Introduzione
dpkit è un framework veloce di gestione dei dati costruito sullo standard Data Package e sui Polars DataFrames. Supporta diversi formati come CSV, JSON e Parquet e si integra con piattaforme come CKAN, Zenodo e GitHub.
Dove ottenerlo
dpkit è disponibile
- come strumento CLI per Linux, macOS e Windows - https://terminal.dpkit.app
- come libreria TypeScript per Node/Deno/Bun/browser - https://typescript.dpkit.app
Quanto è veloce
dpkit è 10x-100x più veloce di frictionless-py nella validazione tabellare, con prestazioni simili a quelle di qsv. Per esempio, dpkit impiega circa 5 secondi per validare un file CSV da 1GB. Oltre a una velocità spettacolare, dpkit si basa sul ricco sistema di validazione di Data Package, a differenza della validazione basata su JSON Schema usata in qsv.
Esplorare i dati dal terminale
dpkit offre uno strumento CLI interattivo per il trattamento e la validazione dei dati. Per esempio, puoi esplorare una tabella di un dataset di Zenodo con un semplice comando che ti dà un'interfaccia interattiva al dataset e alla tabella (inclusi ordinamento e paginazione):
dp table explore -p https://zenodo.org/records/7559361
dpkit è ai suoi primi passi e siamo alla ricerca di feedback e contributi. Mettigli una stella su Github per aiutare il progetto a crescere - https://github.com/datisthq/dpkit
Un ringraziamento speciale a NLnet per aver sostenuto questo sviluppo!


