Data Cleaning ist ein strukturiertes Verfahren zur Identifikation, Korrektur und Entfernung fehlerhafter, unvollständiger oder inkonsistenter Daten in Datensätzen. Es umfasst Validierung, Standardisierung, Dublettenerkennung, Datenprofiling und fehlende Wertebehandlung sowie regelbasierte Transformationen. Ziel ist eine zuverlässige, dokumentierte Datenbasis…
Nutze diesen Steckbrief, um den Baustein kurz zu verstehen, ihn im Modell einzuordnen und bei Bedarf in die 360°-Bewertung zu wechseln.
Ausführbares Vorgehen: kann angewendet werden und erzeugt ein Ergebnis.
Was Zusammenhänge ordnet, verbindet oder entscheidbar macht.
Data Cleaning bereinigt Datenbestände systematisch, indem fehlerhafte, unvollständige und inkonsistente Einträge erkannt und je nach Fall korrigiert oder entfernt werden.
Der Ansatz entstand aus dem praktischen Problem, dass operative Systeme, manuelle Eingaben und Datenimporte oft falsche, doppelte, unvollständige oder unterschiedlich formatierte Einträge enthalten. In Datenbanken, ETL und Datenqualitätsmanagement wurde Bereinigung deshalb zu einem wiederholbaren Arbeitsschritt: Abweichungen erkennen, nach Regeln korrigieren oder entfernen und das Ergebnis für nachgelagerte Analysen dokumentieren.
Stell dir Data Cleaning als Reparaturstraße vor: Zuerst zeigt Data Profiling, wo Lücken, Ausreißer und Musterbrüche liegen. Danach prüfen Regeln und Referenzlisten, was gültig ist. Anschließend werden Formate vereinheitlicht, Dubletten zusammengeführt und fehlende Werte markiert, ergänzt oder bewusst belassen. Eine erneute Prüfung zeigt am Ende, ob die Daten konsistent genug für den nächsten Einsatz sind.
Messbare Kriterien und Governance bestimmen, ob Daten für einen Zweck ausreichend verlässlich sind.
Struktur, Verteilung, Ausreißer und Lücken werden vor der Bereinigung sichtbar gemacht.
Fachliche und technische Regeln legen fest, welche Werte, Formate und Beziehungen zulässig sind.
Schreibweisen, Einheiten, Codes und Datumsformate werden auf eine gemeinsame Konvention gebracht.
Mehrfach vorhandene Datensätze werden gefunden und nach einem definierten Verfahren zusammengeführt oder entfernt.
Lücken werden markiert, ersetzt, imputiert oder bewusst offen gelassen; nicht jede Lücke lässt sich sicher rekonstruieren.
Data Cleaning ist vor Analysen, ML-Training, Migrationen und Datenintegration besonders wichtig, wenn Konsistenz, Nachvollziehbarkeit oder regulatorische Qualität zählen. Es reduziert Folgefehler, ersetzt aber keine fachliche Klärung: Fehlende Fakten lassen sich oft nicht sicher rekonstruieren, und zu aggressive Korrekturen können echte Besonderheiten entfernen. Deshalb braucht das Verfahren klare Regeln, Referenzdaten und eine dokumentierte Behandlung von Ausnahmen.
Wo dieser Baustein im Themenmodell verortet ist.
Keine Strukturpfade verfügbar.
Erkunde, wie dieser Wissensbaustein mit Konzepten, Methoden, Technologien und Tools verbunden ist.
Diese Quellen belegen den Begriff und seine fachliche Bedeutung.
Alle direkten Verbindungen des aktuellen Wissensbausteins in einer kompakten, textuellen Darstellung.
Diese Einordnung zeigt, in welchem Kontext der Baustein typischerweise relevant wird, wie anspruchsvoll er ist und welche Wirkung er im Modell hat.
Die Ebene innerhalb der Organisation (Unternehmen, Domäne, Team), auf der der AssetBlock angewendet wird.