Strategien, Prozesse und technische Maßnahmen zur Wiederherstellung von IT-Systemen und Daten nach größeren Ausfällen oder Katastrophen.
Disaster Recovery beschreibt Strategien, Prozesse und Technologien zur Wiederherstellung von IT-Systemen und Daten nach größeren Ausfällen. Ziel ist die Minimierung von Ausfallzeiten (RTO) und Datenverlust (RPO) durch Planung, Backups, Replikation und getestete Wiederanlaufprozesse. Es umfasst organisatorische Abläufe, technische Maßnahmen und regelmäßige Tests.
Maximale tolerierbare Zeitspanne, bis ein Dienst wiederhergestellt sein muss.
Maximal tolerierbarer Datenverlust in Zeit (Zeitspanne seit letztem konsistenten Backup).
Durchschnittliche Zeit, die zur vollständigen Wiederherstellung nach einem Ausfall benötigt wird.
Geplante jährliche DR-Übung mit failover zu sekundärem Standort und Messung der Servicewiederherstellungszeiten.
Wiederherstellung nach einem Verschlüsselungsangriff durch point-in-time-Backups und neuaufbau betroffener Systeme.
Automatisierter Failover zwischen Cloud-Regionen zur Minimierung sichtbarer Ausfälle für Kunden.
Analyse kritischer Dienste und Festlegen von RTO/RPO.
Architektur für Redundanz und Replikation entwerfen und implementieren.
Runbooks und Automatisierungsskripte erstellen.
Regelmäßige Tests, Übungen durchführen und Prozesse anpassen.