Introduction
dpkit est un framework rapide de gestion de données bâti sur le standard Data Package et les Polars DataFrames. Il prend en charge différents formats comme CSV, JSON et Parquet et s’intègre avec des plateformes telles que CKAN, Zenodo et GitHub.
Où l’obtenir
dpkit est disponible
- comme outil CLI pour Linux, macOS et Windows - https://terminal.dpkit.app
- comme bibliothèque TypeScript pour Node/Deno/Bun/navigateur - https://typescript.dpkit.app
À quel point il est rapide
dpkit est 10x-100x plus rapide que frictionless-py pour la validation tabulaire, avec des performances comparables à celles de qsv. Par exemple, dpkit met environ 5 secondes à valider un fichier CSV de 1GB. Au-delà d’une vitesse spectaculaire, dpkit repose sur le riche système de validation du Data Package, face à la validation fondée sur JSON Schema utilisée dans qsv.
Explorer les données depuis le terminal
dpkit fournit un outil CLI interactif pour la manipulation et la validation de données. Par exemple, vous pouvez explorer une table d’un jeu de données Zenodo avec une commande simple qui vous donne une interface interactive vers le jeu de données et la table (y compris le tri et la pagination) :
dp table explore -p https://zenodo.org/records/7559361
dpkit en est à ses débuts et nous sommes à la recherche de retours et de contributions. Mettez-lui une étoile sur Github pour aider le projet à grandir - https://github.com/datisthq/dpkit
Un grand merci à NLnet pour son soutien à ce développement !


