Konzeptuelle Richtlinien zum Entwurf und Betrieb von Architekturen, die Machine-Learning-Modelle bei wachsendem Daten- und Nutzeraufkommen skalieren.
Scaling AI Systems liefert Leitlinien für Architekturen und Betriebspraxen, die das Trainieren und Bereitstellen von Machine-Learning-Modellen bei wachsendem Datenvolumen und Benutzeraufkommen ermöglichen. Es behandelt verteiltes Training, Modellparallelität, effiziente Inferenz, Datenpipelines, Monitoring und Autoscaling. Es beleuchtet Abwägungen zwischen Kosten, Latenz und Modellgenauigkeit im Betrieb.
P99-Latenz misst die Obergrenze der Antwortzeiten und ist kritisch für SLA-Überwachung.
Gibt an, wie viele Inferenzanfragen pro Sekunde verarbeitet werden können.
Zeit oder Ressourcenverbrauch, bis ein Modell die gewünschte Genauigkeit erreicht.
Ray wurde verwendet, um ein großes BERT-Modell über mehrere GPU-Knoten zu trainieren und Trainingszeit signifikant zu reduzieren.
Eine Text-to-Speech-API skaliert automatisch anhand von P99-Latenz und GPU-Auslastung, um Kosten zu optimieren.
Mandantenisolierung und QoS-Richtlinien erlaubten parallele Bereitstellung unterschiedlicher Modelle auf einer gemeinsamen Plattform.
Analyse der Workloads und Definition von Performance-Zielen.
Auswahl und Einrichtung der Infrastruktur- und Orchestrierungsplattform.
Integration von verteilten Trainingslösungen und Inferenz-Tooling.
Einführung von Monitoring, Autoscaling-Policies und Kostenüberwachung.