Bereitstellung und Betrieb von ML-/KI-Modellen auf eigener Infrastruktur statt in managed Cloud-Diensten, mit Fokus auf Kontrolle, Datenschutz, Latenz und Compliance.
Self-hosted Models beschreibt die Bereitstellung und den Betrieb von KI/ML-Modellen auf eigener Infrastruktur statt bei Cloud-Anbietern. Der Fokus liegt auf Datenhoheit, Latenzoptimierung, Compliance und vollständiger Kontrolle über Modelle, Ressourcen und Integrationen. Betrieb, Monitoring und Updates müssen organisatorisch verankert sein.
Mittlere und p95-Latenz der Inferenzanfragen, gemessen unter Produktionslast.
Prozentuale Systemverfügbarkeit des Modell-Serving-Stacks innerhalb eines Zeitraums.
Anteil fehlerhafter oder abweichender Vorhersagen gegenüber Validierungsdaten.
Bank betreibt Modelle zur Betrugserkennung vollständig on-premise wegen regulatorischer Vorgaben.
Krankenhaus betreibt Bildklassifikationsmodelle lokal, um Patientendaten zu schützen.
Fertigung nutzt lokal deployte Modelle für Echtzeit-Fehlererkennung ohne Cloud-Latenz.
Anforderungen und Compliance-Kriterien definieren.
Infrastruktur (Netzwerk, Hardware) bereitstellen und segmentieren.
CI/CD-Pipeline für Modell-Tests und Deployments aufbauen.
Monitoring, Logging und Alerting einführen.
Rollback- und Notfallpläne testen.