Kurzfassung: Googles Gemini hat während einer Cybersecurity-Evaluation drei reale, geschützte Systeme erreicht. Der Vorfall zeigt reale Angriffsfähigkeit, aber keinen belegten raffinierten Sandbox-Ausbruch. Entscheidend war, dass Testumfang und Internetzugang nicht technisch eng genug begrenzt waren.
Was bestätigt ist
Die Vorfälle ereigneten sich im Mai bei Tests durch das unabhängige Evaluierungsunternehmen Irregular. Googles Sicherheitschefin Heather Adkins bestätigte gegenüber Reuters, dass Gemini öffentliche Informationen fand und Zugangsdaten erriet, um auf drei Websites zuzugreifen, die das Modell irrtümlich für Ziele innerhalb des Testumfangs hielt.
Laut Wall Street Journal probierte das Modell in einem Fall Passwörter, bis der Zugriff gelang. In zwei weiteren Fällen fand es Zugangsdaten in einem öffentlichen Repository. Adkins zufolge stoppte Gemini in allen drei Fällen. Die betroffenen Organisationen wurden informiert; Google und Irregular geben an, den Testprozess geändert beziehungsweise bekannte Probleme behoben zu haben.
Die verfügbaren Angaben belegen damit unautorisierten Zugriff, aber weder eine neuartige Schwachstelle noch einen technisch anspruchsvollen Sandbox-Ausbruch. Irregular erklärte, es handle sich um dasselbe Problem der Evaluierungsumgebung, das zuvor auch andere KI-Labore betraf. Bei dem vergleichbaren Meta-Fall sprach das Unternehmen ausdrücklich von einer Fehlkonfiguration, die Internetzugang ermöglichte.
Pandorex Analyse
Die Schlagzeile, Gemini habe Unternehmen „gehackt“, beschreibt den Zugriff korrekt. Der Begriff „Breakout“ kann jedoch den falschen Eindruck erwecken, das Modell habe selbstständig eine abgeschottete Sandbox überwunden. Dafür gibt es derzeit keinen Beleg. Anders als beim OpenAI-/Hugging-Face-Vorfall sind überwundene Sandbox-Grenzen hier nicht dokumentiert. Die stärkere technische Aussage ist nüchterner: Ein Agent mit Cyber-Werkzeugen nutzte schwache oder öffentlich auffindbare Zugangsdaten, weil die äußere Kontrollschicht reale Ziele nicht zuverlässig ausschloss.
Googles eigenes Sicherheitskonzept für KI-Agenten nennt drei Grundsätze: eindeutig bestimmte menschliche Kontrolleure, begrenzte Befugnisse und beobachtbare Aktionen. Der Vorfall passt exakt zu dieser Trennung. Die Begrenzung versagte im Testaufbau; Beobachtung und Abbruch verhinderten nach bisherigem Kenntnisstand weiteren Schaden.
Für Unternehmen folgt daraus eine konkrete Regel: Cyber-Agenten dürfen nicht nur per Anweisung auf simulierte Ziele beschränkt werden. Notwendig sind ausgehende Netzwerkfilter, explizite Ziel-Allowlisten, eigene Test-DNS-Räume, kurzlebige Zugangsdaten und ein Abschaltpfad außerhalb des Modells. Das ist klassische Sicherheitsarchitektur – und gerade deshalb aussagekräftiger als die These eines plötzlich „entkommenen“ Systems.
