Data Ingestion bezeichnet den Prozess, Daten aus verschiedenen Quellen systematisch zu erfassen, zu übertragen und in Zielsysteme einzuspielen. Dazu gehören Batch- und Streaming-Ansätze, Schema-Handling, Transformationen und Validierung. Entscheidend sind Latenz, Durchsatz, Konsistenz und Kosten, die die Architektur- und Betriebsentscheidungen prägen. Gute D…
Nutze diesen Steckbrief, um den Baustein kurz zu verstehen, ihn im Modell einzuordnen und bei Bedarf in die 360°-Bewertung zu wechseln.
Theoretisches Gebilde: erklärt einen Begriff, ein Prinzip oder ein Denkmodell.
Was Zusammenhänge ordnet, verbindet oder entscheidbar macht.
Datenaufnahme ist die strukturierte Übernahme von Daten aus Quellen in Zielsysteme. Sie sorgt dafür, dass Dateien, Ereignisse oder Änderungen kontrolliert erfasst, geprüft und weitergereicht werden – batchweise oder fortlaufend.
Datenaufnahme entstand als Praxisaufgabe des Data Engineering: Daten aus Datenbanken, Anwendungen, Geräten und Partnerquellen mussten verlässlich in Warehouses, Lakes und operative Systeme gelangen, ohne die Quellsysteme zu blockieren. Mit Batch-Ladungen für periodische Übernahmen und Streaming für fortlaufende Ereignisse etablierte sich ein gemeinsames Muster für Erfassung, Vorprüfung, Übertragung und Übergabe. Der Fokus liegt auf Latenz, Konsistenz, Durchsatz und Betriebskosten.
Stell dir Datenaufnahme als Schleuse vor. Auf der einen Seite kommen Dateien, Events oder Änderungsfeeds an; in der Schleuse werden sie angenommen, auf Struktur und Schema geprüft, bei Bedarf gepuffert und erst dann an das Ziel übergeben. Batch gleicht einer Warenlieferung in Paletten, Streaming einer laufenden Förderbandspur. So lassen sich Quelle, Transport und Ziel getrennt steuern, ohne jede Quelle direkt auf das Ziel durchschlagen zu lassen.
Die Disziplin plant, baut und betreibt verlässliche Datenwege zwischen Systemen.
Eine Zwischenschicht nimmt Daten an, prüft sie, puffert sie bei Bedarf und übergibt sie weiter.
Paketweise Übertragung oder kontinuierlicher Datenfluss bestimmt Aktualität, Komplexität und Betriebsverhalten.
Struktur, Datentypen und Pflichtfelder werden vor oder während des Ladens geprüft, damit fehlerhafte Daten nicht ungeprüft weiterlaufen.
Quelle, Übertragung und Ziel werden getrennt, damit Ausfälle und Lastspitzen nicht sofort das ganze System betreffen.
Diese Kennzahlen zeigen, wie schnell Daten verfügbar werden und wie viel die Pipeline pro Zeit verarbeiten kann.
Datenaufnahme ist wichtig, wenn operative Systeme, IoT-Geräte, Partnerfeeds oder Änderungsdaten schnell nutzbar werden sollen, ohne die Quelle zu überlasten. Sie hilft bei der Wahl zwischen Frische, Robustheit, Komplexität und Kosten. Ohne klare Verträge, Schema-Checks und Monitoring entstehen leicht Lücken, Dubletten oder inkonsistente Bestände; für Analyse und Betrieb reicht das reine Laden allein oft nicht aus.
Wo dieser Baustein im Themenmodell verortet ist.
Keine Strukturpfade verfügbar.
Erkunde, wie dieser Wissensbaustein mit Konzepten, Methoden, Technologien und Tools verbunden ist.
Diese Quellen belegen den Begriff und seine fachliche Bedeutung.
Alle direkten Verbindungen des aktuellen Wissensbausteins in einer kompakten, textuellen Darstellung.
Diese Einordnung zeigt, in welchem Kontext der Baustein typischerweise relevant wird, wie anspruchsvoll er ist und welche Wirkung er im Modell hat.
Die Ebene innerhalb der Organisation (Unternehmen, Domäne, Team), auf der der AssetBlock angewendet wird.