Databricks ist eine einheitliche, cloud-native Datenplattform, die Apache Spark mit verwalteter Infrastruktur und kollaborativen Arbeitsbereichen kombiniert. Sie ermöglicht Data Engineering, Data Science und Analytics-Teams, skalierbare ETL‑Pipelines zu erstellen, Notebooks auszuführen und Machine‑Learning‑Modelle produktiv zu setzen. Angeboten wird Databric…
Nutze diesen Steckbrief, um den Baustein kurz zu verstehen, ihn im Modell einzuordnen und bei Bedarf in die 360°-Bewertung zu wechseln.
Bedienbare Anwendungssoftware: unterstützt Menschen bei einer Aufgabe.
Konkretes Rädchen im System, das in größeren Zusammenhängen wirkt.
Databricks ist eine cloud-native Daten- und KI-Plattform, die Apache Spark, verwaltete Infrastruktur und kollaborative Arbeitsbereiche für Data Engineering, Analytics und Machine Learning bündelt.
Databricks entstand 2013 in San Francisco aus dem AMPLab der UC Berkeley. Gegründet wurde das Unternehmen von den ursprünglichen Apache-Spark-Mitwirkenden um Matei Zaharia, Ion Stoica, Ali Ghodsi, Andy Konwinski, Patrick Wendell, Reynold Xin und Arsalan Tavakoli. Aus diesem Forschungsumfeld wurde Spark als verwaltete Cloud-Plattform für kollaborative Datenarbeit weiterentwickelt.
Stell dir Databricks als verwaltete Betriebsschicht über einem Lakehouse vor. Oben arbeiten Teams in Notebooks, SQL-Ansichten und Jobs an denselben Daten. In der Mitte führt Spark die verteilte Verarbeitung aus und skaliert Lasten je nach Aufgabe. Darunter liegen Speicher, Zugriffsrechte und Governance. So können Datenaufbereitung, Analyse und ML-Pipelines in einer gemeinsamen Umgebung zusammenlaufen.
Die Laufzeit bildet die verteilte Rechenbasis für große Datenmengen und parallele Verarbeitung.
Ein gemeinsames Datenmodell verbindet Eigenschaften von Data Lakes und Data Warehouses.
Code, SQL und Analysen werden in geteilten, reproduzierbaren Arbeitsumgebungen bearbeitet.
Wiederholbare Abläufe laden, bereinigen, transformieren und planen Datenverarbeitung automatisch.
Zugriffe, Metadaten, Herkunft und Richtlinien werden zentral verwaltet.
Databricks ist sinnvoll, wenn mehrere Rollen auf denselben Daten arbeiten, ETL und Analytics skalieren sollen und ein großer Teil des Betriebs ausgelagert werden darf. Besonders nützlich ist die Plattform bei cloudzentrierten Daten- und KI-Stacks, schnellen Änderungen und gemischten Workloads. Die Gegenleistung sind Abhängigkeit vom Cloud-Ökosystem, Kostenkontrolle, Spark-Know-how und saubere Governance; für kleine, einfache Aufgaben ist sie oft überdimensioniert.
Wo dieser Baustein im Themenmodell verortet ist.
Keine Strukturpfade verfügbar.
Erkunde, wie dieser Wissensbaustein mit Konzepten, Methoden, Technologien und Tools verbunden ist.
Diese Quellen belegen den Begriff und seine fachliche Bedeutung.
Alle direkten Verbindungen des aktuellen Wissensbausteins in einer kompakten, textuellen Darstellung.
Diese Einordnung zeigt, in welchem Kontext der Baustein typischerweise relevant wird, wie anspruchsvoll er ist und welche Wirkung er im Modell hat.
Die Ebene innerhalb der Organisation (Unternehmen, Domäne, Team), auf der der AssetBlock angewendet wird.