Pandorex
DEEN
Security

Anthropic öffnet Cybermodelle in drei kontrollierten Stufen

Veröffentlicht Pandorex Redaktion·4 min Lesezeit
—
Illustration: Ein violetter KI-Prozessor führt durch drei abgestufte Sicherheitstore zu Verteidigung, autorisiertem Red Team und geschützter kritischer Infrastruktur.
Redaktionelle Illustration · Pandorex

Kurzfassung: Anthropic bündelt Project Glasswing und sein Cyber Verification Program in drei geprüften Zugriffsstufen. Autorisierte Red Teams erhalten Claude-Modelle ohne die üblichen Cyberblockaden; Tests lebenswichtiger Systeme bleiben einer kleinen, mit US-Behörden geprüften Gruppe vorbehalten. Die veröffentlichten Zahlen zeigen hohe Reichweite, aber noch keine unabhängig gemessene Sicherheitswirkung.

Drei Grenzen statt eines globalen Filters

Defense Access erlaubt unter anderem Vorfallreaktion, Malwareanalyse und Schwachstellenprüfung. Bewerben können sich Organisationen, Betreiber kritischer Infrastruktur, Open-Source-Maintainer und nachweislich aktive Einzelforscher. Red Team Access ergänzt autorisierte Penetrationstests, ist aber Organisationen vorbehalten und blockiert weiterhin Aktionen, die physische Schäden oder großflächige Störungen verursachen könnten.

Specialized Access hat die wenigsten Cyberblockaden. Er gilt nur für vertieft geprüfte Organisationen, die sicherheitskritische Systeme wie Stromnetze, Flugbetrieb, Telekommunikation oder Interbanken-Zahlungen testen dürfen. Anthropic prüft diese Teilnehmer nach eigenen Angaben gemeinsam mit der US-Regierung. Alle Stufen umfassen Opus 5.5, Sonnet 5.5 und Mythos 5.1; die Verfügbarkeit erstreckt sich auf die Claude Platform, Google Vertex AI und Microsoft Foundry. Amazon Bedrock bleibt zunächst Kunden der angekündigten Enterprise Frontier Safeguards vorbehalten.

Der Test misst Blockaden, nicht die Qualität der Funde

Anthropic ließ Opus 5.5 je fünfmal auf zehn mehrstufige Aufgaben aus CyScenarioBench los. Ohne Programmzugang stoppte der Schutz jede Aufgabe beim ersten Prompt. In der Defense-Stufe wurden 46 von 50 Versuchen irgendwann blockiert; vier waren erfolgreich. In der Red-Team-Stufe gab es keine Blockade und 34 erfolgreiche Durchläufe. Das entspricht nahezu dem vom Anbieter genannten Wert von 67,6 Prozent ohne Schutzmechanismen.

Damit belegt der Versuch, dass die Zugriffsstufen technisch unterschiedlich reagieren. Er sagt jedoch nicht, wie viele gefundene Lücken gültig sind, wie oft harmlose Arbeit fälschlich gestoppt wird oder ob Berechtigungen außerhalb des Modells zuverlässig durchgesetzt werden. Für den Betrieb sind deshalb Identitätsprüfung, Zielautorisierung, Protokollierung und nachgelagerte Freigaben mindestens so wichtig wie der Modellfilter.

Pandorex Analyse: beeindruckende Menge, offene Patchquote

Glasswing-Partner meldeten für April bis Juli mindestens 129.000 verifizierte Schwachstellen; Anthropics eigene Open-Source-Scans fanden bis Oktober weitere 5.500. Mehr als 33.000 wurden als kritisch oder hoch eingestuft. Diese Größenordnung ist relevant, stammt aber aus unterschiedlich erhobenen Berichten von 33 Partnern. Weniger als die Hälfte legte Patchzahlen offen, und Anthropics Schätzung eines mindestens fünfmal höheren Gesamteffekts bleibt eine Hochrechnung.

Der neue Zugang ergänzt kommerzielle Dauer-Red-Teams mit mehreren Frontier-Modellen: Anbieter verschieben die Sicherheitsgrenze zunehmend vom pauschalen Verweigern zu überprüfter Identität und abgestuften Rechten. Das kann Verteidigern mehr Nutzen geben, verlagert aber einen Teil des Risikos in Aufnahmeprüfung, Überwachung und Reaktion auf Missbrauch.

Quellen und Nachweise

Quellen für die Fakten und den Kontext dieses Artikels.

  1. Anthropic, 06.10.2026: Expanding the Cyber Verification Programanthropic.com
  2. Anthropic, aktualisiert am 06.10.2026: Project Glasswinganthropic.com
  3. Reuters, 06.10.2026: Anthropic opens its most powerful AI models to more security teamsreuters.com

So recherchiert und korrigiert Pandorex

Kommentare

Melde dich an, um einen Kommentar zu schreiben.

Nach oben swipen
Nächster Artikel

Google pausiert OSS-Bug-Bounty: Nur Produktmeldungen betroffen

Security