Ein Data Lake ist ein zentrales Repository, das große Mengen roher, heterogener Daten in ihren nativen Formaten speichert und so vielfältige Analysen, Machine‑Learning‑Workflows und operative Integrationen unterstützt. Er setzt auf Schema‑on‑Read, flexible Ingestion und trennt Speicherung von Rechenkapazität. Governance, Metadatenerfassung und Lifecycle‑Rege…
Nutze diesen Steckbrief, um den Baustein kurz zu verstehen, ihn im Modell einzuordnen und bei Bedarf in die 360°-Bewertung zu wechseln.
Theoretisches Gebilde: erklärt einen Begriff, ein Prinzip oder ein Denkmodell.
Was du verstehen musst, um ein Themenfeld sinnvoll zu denken.
Ein Data Lake ist ein zentrales Repository für rohe, heterogene Daten in nativen Formaten, das Analyse, Data-Science-Workflows und Integrationen auf derselben Datenbasis unterstützt.
Der Ansatz entstand in der Praxis von Datenmanagement und Data Engineering, als Organisationen große Mengen aus Dateien, Objekten und Streams zunächst unverändert sammeln wollten. Statt Daten früh in ein starres Zielschema zu pressen, sollte ein gemeinsamer Speicher unterschiedliche Formate aufnehmen und spätere Auswertung oder Modellierung erst beim Zugriff ermöglichen.
Stell dir einen Data Lake als Rohdaten-Reservoir mit vielen Zuflüssen vor. Quellsysteme legen Objekte, Dateien oder Ereignisse ab; die Daten bleiben zunächst unverändert. Erst Analyse- oder ML-Tools interpretieren die Struktur beim Lesen. Kataloge, Berechtigungen und Lebenszyklusregeln halten den Bestand auffindbar, nutzbar und kontrollierbar.
Ein übergreifender Architekturrahmen ordnet Speicherung, Verarbeitung und Nutzung großer Datenmengen.
Die Disziplin entwirft und betreibt Pipelines und Plattformen, die Daten aus vielen Quellen zuverlässig bereitstellen.
Die fachliche Struktur wird erst beim Lesen oder Analysieren angewendet, nicht schon beim Laden.
Daten werden flexibel aufgenommen, ohne sie sofort in ein enges Zielmodell zu zwingen.
Speicherung und Verarbeitung lassen sich unabhängig skalieren und wirtschaftlich getrennt betreiben.
Kataloge, Zugriffsregeln und Lebenszyklusvorgaben sichern Auffindbarkeit, Qualität und kontrollierte Nutzung.
Ein Data Lake lohnt sich, wenn viele Datenquellen schnell aufgenommen und später für unterschiedliche Fragen erneut ausgewertet werden sollen, etwa für Exploration, Machine Learning oder Integration. Der Preis für diese Flexibilität ist zusätzlicher Aufwand für Metadaten, Zugriffsregeln, Qualitätssicherung und Lebenszykluspflege; ohne diese Disziplin kippt der Bestand leicht in eine unübersichtliche Rohdatenablage.
Wo dieser Baustein im Themenmodell verortet ist.
Keine Strukturpfade verfügbar.
Erkunde, wie dieser Wissensbaustein mit Konzepten, Methoden, Technologien und Tools verbunden ist.
Diese Quellen belegen den Begriff und seine fachliche Bedeutung.
Alle direkten Verbindungen des aktuellen Wissensbausteins in einer kompakten, textuellen Darstellung.
Diese Einordnung zeigt, in welchem Kontext der Baustein typischerweise relevant wird, wie anspruchsvoll er ist und welche Wirkung er im Modell hat.
Die Ebene innerhalb der Organisation (Unternehmen, Domäne, Team), auf der der AssetBlock angewendet wird.