Einleitung
dpkit ist ein schnelles Datenmanagement-Framework, das auf dem Data Package Standard und Polars DataFrames aufbaut. Es unterstützt verschiedene Formate wie CSV, JSON und Parquet und integriert sich mit Plattformen wie CKAN, Zenodo und GitHub.
Wo es zu bekommen ist
dpkit ist verfügbar
- als CLI-Werkzeug für Linux, macOS und Windows - https://terminal.dpkit.app
- als TypeScript-Bibliothek für Node/Deno/Bun/Browser - https://typescript.dpkit.app
Wie schnell es ist
dpkit ist bei der tabellarischen Validierung 10x-100x schneller als frictionless-py und zeigt eine Performance ähnlich der von qsv. Zum Beispiel braucht dpkit rund 5 Sekunden, um eine 1GB große CSV-Datei zu validieren. Neben der spektakulären Geschwindigkeit baut dpkit auf dem reichhaltigen Validierungssystem des Data Package auf, verglichen mit der auf JSON Schema basierenden Validierung in qsv.
Daten vom Terminal aus erkunden
dpkit bietet ein interaktives CLI-Werkzeug für die Aufbereitung und Validierung von Daten. Sie können zum Beispiel eine Tabelle aus einem Zenodo-Datensatz mit einem einfachen Befehl erkunden, der Ihnen eine interaktive Oberfläche für den Datensatz und die Tabelle bietet (inklusive Sortierung und Paginierung):
dp table explore -p https://zenodo.org/records/7559361
dpkit steckt noch in den Anfängen und wir freuen uns über Feedback und Beiträge. Geben Sie ihm einen Stern auf Github, um dem Projekt beim Wachsen zu helfen - https://github.com/datisthq/dpkit
Besonderer Dank geht an NLnet für die Unterstützung dieser Entwicklung!


