Introducción
dpkit es un framework rápido de gestión de datos construido sobre el estándar Data Package y los Polars DataFrames. Admite formatos como CSV, JSON y Parquet y se integra con plataformas como CKAN, Zenodo y GitHub.
Dónde conseguirlo
dpkit está disponible
- como herramienta de CLI para Linux, macOS y Windows - https://terminal.dpkit.app
- como biblioteca TypeScript para Node/Deno/Bun/navegador - https://typescript.dpkit.app
Lo rápido que es
dpkit es de 10x a 100x más rápido que frictionless-py en la validación tabular, con un rendimiento similar al de qsv. Por ejemplo, dpkit tarda unos 5 segundos en validar un fichero CSV de 1GB. Además de una velocidad espectacular, dpkit se apoya en el rico sistema de validación de Data Package, frente a la validación basada en JSON Schema que usa qsv.
Explorar datos desde el terminal
dpkit ofrece una herramienta de CLI interactiva para el tratamiento y la validación de datos. Por ejemplo, puedes explorar una tabla de un conjunto de datos de Zenodo con un comando sencillo que te da una interfaz interactiva al conjunto de datos y a la tabla (incluidas la ordenación y la paginación):
dp table explore -p https://zenodo.org/records/7559361
dpkit está en sus primeros días y buscamos comentarios y contribuciones. Dale una estrella en Github para ayudar al proyecto a crecer - https://github.com/datisthq/dpkit
¡Un agradecimiento especial a NLnet por apoyar este desarrollo!


