Data & Business Intelligence
Data & Business Intelligence umfasst die Strategien, Technologien und Praktiken zur Analyse und Nutzung von Daten zur Unterstützung von Geschäftsentscheidungen.
- Wissensbereiche
- /Themenbereiche
- /Segmente
- /Bausteine
Datenquellen & Erfassung
Dieses Segment umfasst die Identifikation und Einordnung von Datenquellen sowie die Mechaniken, über die Daten für analytische Zwecke erfasst werden. Dazu gehören interne und externe Quellen, Ereignis- und Transaktionsdaten, Stammdaten sowie Aspekte wie Datenverfügbarkeit, Aktualität und Granularität. Der Fokus liegt auf dem Weg der Daten in den analytischen Raum, unabhängig davon, wie die Daten später modelliert, ausgewertet oder visualisiert werden.
Analyse von Quellsystemen
Ein strukturiertes Vorgehen zur Analyse der Quellsysteme in einer Organisation.
ETL-Pipeline-Design
ETL-Pipeline-Design beschreibt den Prozess der Datenextraktion, -transformation und -ladeverfahren.
Inkrementelle Lade-Strategie
Eine Strategie zur schrittweisen Datenladung, die die Effizienz der Datenverarbeitung steigert.
Batchverarbeitung
Batchverarbeitung ist ein Prozess, bei dem eine Gruppe von Aufgaben oder Daten in einem einzigen Batch verarbeitet wird.
Change Data Capture (CDC)
Change Data Capture ist ein Konzept logie, die Änderungen an Datenbanken erfasst und in Echtzeit verarbeitet.
Cloud Storage Systeme
Cloud Storage Systeme bieten eine flexible und skalierbare Speicherung von Daten über das Internet.
Extract, Load, Transform (ELT)
Ein Verfahren zur Datenverarbeitung, bei dem Daten aus verschiedenen Quellen extrahiert, geladen und anschließend transformiert werden.
Extract, Transform, Load (ETL)
ETL ist ein Prozess zur Datenintegration, der Daten aus verschiedenen Quellen extrahiert, transformiert und in ein Zielsystem lädt.
Streamverarbeitung
Streamverarbeitung ist eine Methode zur kontinuierlichen Analyse und Verarbeitung von eingehenden Datenströmen in Echtzeit.
Fivetran
Automatisierte Datenintegration für moderne Data Warehouses.
Apache Airflow
Plattform zur Orchestrierung, Planung und Überwachung von Workflows und Data-Pipelines mittels Python-DAGs.
Apache Kafka
Kafka ist eine verteilte Streaming-Plattform, die für die Verarbeitung von Echtzeitdatenströmen entwickelt wurde.
Apache Spark
Spark ist ein mächtiges Open-Source-Framework für die Verarbeitung von großen Datenmengen.
Debezium
Debezium ist eine Open-Source-Plattform, die Change Data Capture für verschiedene Datenbanken bereitstellt.