Konzept und Praktiken zur Bereitstellung trainierter Machine‑Learning‑Modelle für Produktionsanfragen mit Fokus auf Skalierbarkeit, Versionierung und Observability.
Model Serving beschreibt Verfahren und Infrastruktur, mit denen trainierte Machine‑Learning‑Modelle in Produktionsumgebungen bereitgestellt, skaliert und für Anfragen verfügbar gemacht werden. Es umfasst Serving‑APIs, Modellversionierung, Ressourcenmanagement, Routing und Monitoring. Typische Implementierungen nutzen Model‑Servers, Inference‑Runtimes und Orchestrierungslösungen.
95./99. Perzentil der Antwortzeiten zur Messung von Worst‑Case‑Latenz.
Anzahl erfolgreich bedienter Inferenzanfragen pro Zeiteinheit.
Anteil fehlerhafter oder fehlgeschlagener Anfragen am Gesamttraffic.
Einsatz von TensorFlow Serving zur Bereitstellung und Versionierung eines CNN‑Modells mit gRPC‑API.
KServe nutzt Knative/Ingress‑Routing für Canary‑Rollouts und Traffic‑Splits.
Skalierte Offline‑Vorhersagen mit ONNX‑Runtime als Spark‑Job für Reporting.
Modell validieren, serialisieren und in Registry eintragen
Serving‑Image erstellen und als Version bereitstellen
Routing, Autoscaling und Observability konfigurieren