Betriebs- und Organisationsprinzipien zum sicheren, skalierbaren und beobachtbaren Betrieb von Anwendungen im Produktivbetrieb.
Application Operations beschreibt die organisatorischen und technischen Praktiken zum Betreiben moderner Anwendungen im Produktivbetrieb und umfasst Deployment, Monitoring, Incident-Response, Skalierung sowie Konfigurationsmanagement und Zusammenarbeit zwischen Entwicklung und Betrieb. Ziel ist stabile Verfügbarkeit, schnelle Wiederherstellung und kontinuierliche Optimierung der Laufzeitumgebung. Es ist eng mit Observability und Reliability verzahnt.
Durchschnittliche Zeit bis zur Wiederherstellung nach einem Incident.
Anteil fehlerhafter Anfragen oder Transaktionen in einem Zeitraum.
Messung der Ressourcenauslastung zur Skalierungsentscheidung.
Prometheus sammelt Metriken, die für Alerting und Kapazitätsplanung genutzt werden.
Canary-Strategie reduziert Risiko bei neuen Releases durch schrittweises Hochrollen.
Postmortems verbessern Reaktionsprozesse und führen zu konkreten Runbook-Anpassungen.
Telemetrie und Monitoring-Instrumentierung einführen
CI/CD-Pipelines mit Canary- oder Blue/Green-Strategien aufbauen
Runbooks, SLAs und Escalation-Prozesse definieren
Automatisierung für wiederkehrende Betriebsaufgaben implementieren
Kontinuierliches Monitoring und Postmortems einführen