Kurzfassung: AWS kann den Zugriff auf seine beschädigte Cloud-Infrastruktur in Bahrain und auf eine von drei Zonen in den Vereinigten Arabischen Emiraten nicht wiederherstellen. In Bahrain reichten die physischen Schäden über mehrere Availability Zones. Das ist die seltene Ausfallklasse, gegen die Multi-AZ allein nicht schützt.
Eine ganze Region statt einer einzelnen Zone
Der entscheidende Satz steht im AWS-Statusupdate vom 14. September: Die Schäden hätten mehrere Availability Zones erfasst und das überstiegen, wofür regionale und zonenübergreifende Dienste ausgelegt seien. Reuters berichtete am 15. September, dass AWS betroffene Kunden in Bahrain dabei unterstützt, ihre Systeme in anderen Regionen neu aufzubauen.
Availability Zones bestehen aus einem oder mehreren Rechenzentren innerhalb derselben geografischen Region. Dienste mit Multi-AZ-Betrieb verteilen Daten und Rechenlast über solche Zonen. Das fängt den Ausfall eines Standorts oder einzelner Infrastrukturkomponenten ab. Mehrere gleichzeitig physisch beschädigte Zonen sind jedoch ein korrelierter Regionalschaden, kein gewöhnlicher Rechenzentrumsfehler.
Die Infrastruktur war bereits im März im Krieg mit Iran beschädigt worden. Damals meldete AWS strukturelle Schäden, unterbrochene Stromversorgung und zusätzliche Wasserschäden durch Löschmaßnahmen. Im April erwartete der Konzern noch eine mehrmonatige Wiederherstellung. Die aktuelle Aussage verschärft die Lage: Für die genannten Standorte ist eine Wiederherstellung des Zugriffs nicht möglich.
Pandorex Analyse
Multi-AZ bleibt sinnvoll, ist aber kein Ersatz für ein regionsübergreifendes Notfallkonzept. Kritische Systeme brauchen zusätzlich getestete Wiederanläufe in einer zweiten Region, externe Sicherungen und realistische Ziele für Datenverlust und Wiederanlaufzeit.
Der schwierige Teil liegt oft nicht in den virtuellen Maschinen. Identitäten, Schlüsselverwaltung, DNS, Konfigurationsdaten und Abhängigkeiten von regionalen Diensten müssen ebenfalls außerhalb der Primärregion verfügbar sein. In regulierten Umgebungen kommen Datenresidenz und höhere Latenz hinzu. Wer diese Grenzen erst während eines regionalen Ausfalls prüft, hat formal Redundanz, aber noch keinen belastbaren Wiederanlaufplan.
