MapReduce ist ein verteiltes Programmiermodell zur parallelen Verarbeitung großer Datenmengen auf Clustern; es kapselt die Schritte Map und Reduce und skaliert horizontal. Es vereinfacht Fehlertoleranz und Datenpartitionierung, weshalb typische Anwendungsfälle Batch-Analytics, Index-Building und aggregierte Transformationen sind. Implementierungen optimieren…
Nutze diesen Steckbrief, um den Baustein kurz zu verstehen, ihn im Modell einzuordnen und bei Bedarf in die 360°-Bewertung zu wechseln.
Theoretisches Gebilde: erklärt einen Begriff, ein Prinzip oder ein Denkmodell.
Was du verstehen musst, um ein Themenfeld sinnvoll zu denken.
MapReduce ist ein Programmiermodell, das eine große Datenverarbeitung in parallele Map-Schritte und einen anschließenden Reduce-Schritt zerlegt.
Jeffrey Dean und Sanjay Ghemawat stellten MapReduce 2004 bei Google als Antwort auf die aufwendige Parallelisierung großer Datenverarbeitungen vor. Das Modell prägte die Clusterverarbeitung; Apache Hadoop übertrug die Idee anschließend in ein verbreitetes Open-Source-System.
Viele Arbeiter lesen jeweils einen Ausschnitt und schreiben Zwischenwerte mit einem Schlüssel. Danach sammeln andere Arbeiter gleiche Schlüssel und berechnen je Gruppe ein Ergebnis.
Eingabedaten werden unabhängig verarbeitet und in Schlüssel-Wert-Zwischenpaare überführt.
Zwischenwerte werden nach Schlüssel gruppiert und den passenden Reduce-Aufgaben zugeordnet.
Gruppierte Werte werden zu einem verdichteten Ergebnis kombiniert.
MapReduce macht Batch-Verarbeitung großer Datenmengen skalierbar, wenn sich die Aufgabe in unabhängige Teilverarbeitungen und Gruppierungen aufteilen lässt.
Wo dieser Baustein im Themenmodell verortet ist.
Keine Strukturpfade verfügbar.
Erkunde, wie dieser Wissensbaustein mit Konzepten, Methoden, Technologien und Tools verbunden ist.
Diese Quellen belegen den Begriff und seine fachliche Bedeutung.
Alle direkten Verbindungen des aktuellen Wissensbausteins in einer kompakten, textuellen Darstellung.
Diese Einordnung zeigt, in welchem Kontext der Baustein typischerweise relevant wird, wie anspruchsvoll er ist und welche Wirkung er im Modell hat.
Die Ebene innerhalb der Organisation (Unternehmen, Domäne, Team), auf der der AssetBlock angewendet wird.