Korruption erkannt
Der Validator meldet: 0,18% von churn_label kippen innerhalb von 36 Stunden.
Der reguläre Test-Diff sieht nur das Symptom.
Flush your dirty data. Datenklo ist die deutsch-engineerte Datenqualitäts-Schicht, die Schema-Drift, Nulls, Duplikate und stille Label-Korruption abfängt, bevor sie Ihre Modelle vergiftet — eine wartbare Pipeline statt 14 YAML-Repos.
$ datenklo validate --dataset prod.orders_eu > Connecting to snowflake://eu-west ............ ok > Resolving 47 column contracts ............... ok > Running 412 expectations .................. 402 pass / 10 warn > Running Lineage Echo scan .................. 1 finding table prod.orders_eu rows 8,412,907 nulls 2.41% (threshold 1.00%) << FAIL dupes 0.00% << PASS drift +0.38 sigma on order_total << WARN schema column "shipping_zip" type changed: VARCHAR(10) → VARCHAR(8) !! label_corruption detected in column "churn_label" — 0.18% of rows flipped in last 36h — Lineage Echo replay: source = staging.imports_2025_12_29 — root cause: upstream notebook etl_217.ipynb rewrote label — recommended action: quarantine row_ids 19,402…19,518 report → /diagnostic/orders_eu_2026-01-14.html (open in 1 click)
Niemand alarmiert Sie. Ein Notebook im Airflow-DAG schreibt eine Spalte um. Ein Vendor ändert stillschweigend das JSON-Schema. Ein Junior-Engineer mergt einen dbt-Patch am Freitagabend. Montag früh ist Ihr Modell trainiert worden — auf kaputten Daten.
Ein Vendor kürzt shipping_zip von VARCHAR(10) auf VARCHAR(8). Ihr dbt-Model
läuft trotzdem weiter — aber die Postleitzahlen-Match-Rate bricht um 6% ein. Niemand merkt es vor dem nächsten A/B-Test.
0,18% Ihrer churn_label-Zeilen kippen über Nacht. Ihr Recall fällt,
Ihre Stakeholder bemerken nichts, Ihr Modell wird trotzdem in Produktion ausgerollt.
Samstag 02:14 Uhr. PagerDuty. Der Head of Data geht ran, weil der Bereitschafts-Engineer es nicht findet. Vier Stunden Debugging in einem 14-Repo-YAML-Dschungel. Montag ist das Team erschöpft.
Great-Expectations hier, Soda dort, ein eigener dbt-Test-Suite, ein Pandas-Skript aus 2023. Niemand traut sich, etwas zu refactoren, weil alle Angst haben, etwas kaputtzumachen.
Datenklo ersetzt 4–6 selbstgebaute Great-Expectations- und dbt-Checks durch eine einzige deklarative Pipeline. Schemata, Erwartungen, Lineage, Drift-Schwellen und Alerts werden in einer Konfigurationsdatei verwaltet, versioniert und auditiert.
Wenn Datenklo eine Korruption erkennt, rekonstruiert Lineage Echo die betroffene Zeile rückwärts durch die letzten 90 Tage aller Transformationen. Sie sehen exakt, welches Notebook, welcher DAG-Schritt, welcher Vendor-Feed die Veränderung eingebracht hat — in Sekunden, nicht in Tagen.
Der Validator meldet: 0,18% von churn_label kippen innerhalb von 36 Stunden.
Der reguläre Test-Diff sieht nur das Symptom.
Lineage Echo läuft die Zeile durch staging → raw → source-of-truth und vergleicht jeden Hash. Sie sehen genau, wo der Wert zum ersten Mal vom Original abweicht.
Echo benennt den exakten Verursacher: ein internes Notebook etl_217.ipynb,
das einen Label-Inverse-Bug enthält, der seit drei Releases still mitläuft.
Die betroffenen 117 Zeilen werden automatisch quarantäniert, der Incident wird mit dem verursachenden Commit verlinkt, und ein Patch-Ticket geht direkt an den Autor.
«Wer Datenklo montags öffnet, hat samstags nichts mehr zu löschen.» Wir hatten 2023 einen Bereitschafts-Rotations-Plan für vier Data Engineers, weil jede zweite Nacht ein Schema-Drift-Alarm kam. Heute schaut ein Praktikant morgens um halb neun auf den Report, fertig. Die Engineering-Stunden, die wir zurückgewonnen haben, messen wir nicht mehr — die fließen direkt in Feature-Engineering.
Pre-Assessment-Pack für jedes Deployment. BaFin-Review 2024 für 12 Finanzkunden bestanden.
Zertifiziert seit Juni 2025. Auditbericht auf Anfrage.
Abgeschlossen November 2024, jährliche Re-Auditierung.
Native Konnektoren für Snowflake EU-West und BigQuery Frankfurt. Kein US-Routing.
Lukas Brandt, Mira Hoffmann und Tomáš Novák haben Datenklo im März 2022 in einer Etage über einem Spätkauf in der Torstraße gegründet. Drei von ihnen kamen von Delivery Hero, N26 und Celonis. Sie hatten 2022 zugesehen, wie $2,3M an Modell-Drift-Incidents die Produktion trafen — und beschlossen, dass das aufhört.
Heute sind wir 31 Leute in Berlin-Mitte, haben im Oktober 2024 eine €8,4M-Series-A unter Führung von Earlybird geschlossen, und Forbes hat Lukas und Mira 2025 in die «30 Under 30 Tech» gewählt. Wir sind immer noch das Unternehmen, das seine Tickets innerhalb eines Werktages beantwortet — weil wir das selbst sein möchten, wenn wir Ihre Kund:innen sind.
— Lukas Brandt, Mitgründer & CEO
In einem 30-Minuten-Diagnostic schauen wir gemeinsam auf eines Ihrer produktiven Datasets. Sie erhalten einen schriftlichen Bericht: gefundene Korruptionen, geschätzte Build-Zeit, ein konkretes Pilot-Angebot. Kostenlos, unverbindlich, ohne Sales-Folgeanruf.