Introdução
O dpkit é uma framework rápida de gestão de dados construída sobre a norma Data Package e os Polars DataFrames. Suporta vários formatos como CSV, JSON e Parquet e integra-se com plataformas como CKAN, Zenodo e GitHub.
Onde o obter
O dpkit está disponível
- como ferramenta de CLI para Linux, macOS e Windows - https://terminal.dpkit.app
- como biblioteca TypeScript para Node/Deno/Bun/browser - https://typescript.dpkit.app
Quão rápido é
O dpkit é 10x-100x mais rápido do que o frictionless-py na validação tabular, apresentando um desempenho semelhante ao do qsv. Por exemplo, o dpkit demora cerca de 5 segundos a validar um ficheiro CSV de 1GB. Além de uma velocidade espetacular, o dpkit assenta no rico sistema de validação do Data Package, ao contrário da validação baseada em JSON Schema usada no qsv.
Explorar dados a partir do terminal
O dpkit disponibiliza uma ferramenta de CLI interativa para tratamento e validação de dados. Por exemplo, pode explorar uma tabela de um conjunto de dados do Zenodo com um comando simples que lhe dá uma interface interativa para o conjunto de dados e para a tabela (incluindo ordenação e paginação):
dp table explore -p https://zenodo.org/records/7559361
O dpkit está nos seus primeiros dias e estamos à procura de comentários e contribuições. Dê-lhe uma estrela no Github para ajudar o projeto a crescer - https://github.com/datisthq/dpkit
Um agradecimento especial à NLnet por apoiar este desenvolvimento!


