Kurzfassung: Anthropic bündelt Project Glasswing und sein Cyber Verification Program in drei geprüften Zugriffsstufen. Autorisierte Red Teams erhalten Claude-Modelle ohne die üblichen Cyberblockaden; Tests lebenswichtiger Systeme bleiben einer kleinen, mit US-Behörden geprüften Gruppe vorbehalten. Die veröffentlichten Zahlen zeigen hohe Reichweite, aber noch keine unabhängig gemessene Sicherheitswirkung.
Drei Grenzen statt eines globalen Filters
Defense Access erlaubt unter anderem Vorfallreaktion, Malwareanalyse und Schwachstellenprüfung. Bewerben können sich Organisationen, Betreiber kritischer Infrastruktur, Open-Source-Maintainer und nachweislich aktive Einzelforscher. Red Team Access ergänzt autorisierte Penetrationstests, ist aber Organisationen vorbehalten und blockiert weiterhin Aktionen, die physische Schäden oder großflächige Störungen verursachen könnten.
Specialized Access hat die wenigsten Cyberblockaden. Er gilt nur für vertieft geprüfte Organisationen, die sicherheitskritische Systeme wie Stromnetze, Flugbetrieb, Telekommunikation oder Interbanken-Zahlungen testen dürfen. Anthropic prüft diese Teilnehmer nach eigenen Angaben gemeinsam mit der US-Regierung. Alle Stufen umfassen Opus 5.5, Sonnet 5.5 und Mythos 5.1; die Verfügbarkeit erstreckt sich auf die Claude Platform, Google Vertex AI und Microsoft Foundry. Amazon Bedrock bleibt zunächst Kunden der angekündigten Enterprise Frontier Safeguards vorbehalten.
Der Test misst Blockaden, nicht die Qualität der Funde
Anthropic ließ Opus 5.5 je fünfmal auf zehn mehrstufige Aufgaben aus CyScenarioBench los. Ohne Programmzugang stoppte der Schutz jede Aufgabe beim ersten Prompt. In der Defense-Stufe wurden 46 von 50 Versuchen irgendwann blockiert; vier waren erfolgreich. In der Red-Team-Stufe gab es keine Blockade und 34 erfolgreiche Durchläufe. Das entspricht nahezu dem vom Anbieter genannten Wert von 67,6 Prozent ohne Schutzmechanismen.
Damit belegt der Versuch, dass die Zugriffsstufen technisch unterschiedlich reagieren. Er sagt jedoch nicht, wie viele gefundene Lücken gültig sind, wie oft harmlose Arbeit fälschlich gestoppt wird oder ob Berechtigungen außerhalb des Modells zuverlässig durchgesetzt werden. Für den Betrieb sind deshalb Identitätsprüfung, Zielautorisierung, Protokollierung und nachgelagerte Freigaben mindestens so wichtig wie der Modellfilter.
Pandorex Analyse: beeindruckende Menge, offene Patchquote
Glasswing-Partner meldeten für April bis Juli mindestens 129.000 verifizierte Schwachstellen; Anthropics eigene Open-Source-Scans fanden bis Oktober weitere 5.500. Mehr als 33.000 wurden als kritisch oder hoch eingestuft. Diese Größenordnung ist relevant, stammt aber aus unterschiedlich erhobenen Berichten von 33 Partnern. Weniger als die Hälfte legte Patchzahlen offen, und Anthropics Schätzung eines mindestens fünfmal höheren Gesamteffekts bleibt eine Hochrechnung.
Der neue Zugang ergänzt kommerzielle Dauer-Red-Teams mit mehreren Frontier-Modellen: Anbieter verschieben die Sicherheitsgrenze zunehmend vom pauschalen Verweigern zu überprüfter Identität und abgestuften Rechten. Das kann Verteidigern mehr Nutzen geben, verlagert aber einen Teil des Risikos in Aufnahmeprüfung, Überwachung und Reaktion auf Missbrauch.
