Kurzfassung: Anthropic-CEO Dario Amodei fordert ein langsameres, überprüfbares Entwicklungstempo für Spitzen-KI. Konkret verpflichtet er Anthropic zu dauerhaft eingebetteten externen Prüfern mit weitgehend internem Zugang. Der überprüfbare Teil dieses Plans ist neu; Branchen- und Staatenabkommen bleiben Vorschläge.
Prüfer sollen Zugang wie interne Risikoteams erhalten
Amodei kündigt in seinem Essay „We Must Pace the Frontier“ an, Anthropic werde in naher Zukunft ein externes Prüfteam einladen. Vorgesehen sind Arbeitsplätze, Ausweise, Firmenlaptops sowie Zugänge zu Werkzeugen und Arbeitsbereichen, die denen interner Risikoteams weitgehend entsprechen. Die Prüfer sollen Sicherheitszusagen kontrollieren, Vorfälle melden und nicht nur fertige Modelle, sondern auch Trainingsprozesse bewerten.
Der geplante Vertrag soll dem Team erlauben, zentrale Befunde zu Risiken, Vorfällen, Arbeitsweisen und verweigertem Zugang ohne redaktionelle Kontrolle durch Anthropic zu veröffentlichen. Ausnahmen nennt Amodei für gesetzlich geschützte, sicherheitskritische, geschäftlich sensible und vertrauliche Daten Dritter. Prüfer sollen öffentlich darauf hinweisen dürfen, wenn eine Schwärzung ihre Schlussfolgerung wesentlich berührt.
Offen bleiben der Name des Prüfers, ein Startdatum und der genaue Vertrag. Damit ist die Zusage konkreter als eine gewöhnliche Sicherheitsrichtlinie, ihre tatsächliche Unabhängigkeit aber noch nicht überprüfbar.
Drei Stufen – aber kein Trainingsstopp
Amodeis Rahmen besteht aus drei Ebenen: eingebettete Prüfer bei einzelnen Laboren, gemeinsame Standards und Tempolimits in demokratischen Staaten sowie internationale Abkommen. „Pacing“ soll ausdrücklich weder Modelltraining noch technischen Fortschritt anhalten. Stattdessen könnten Fähigkeitsstufen mit Nachweisen zu Alignment, Interpretierbarkeit, Testumgebungen und externen Audits verknüpft werden.
Die erste Stufe ist eine Selbstverpflichtung von Anthropic. Für Absprachen zwischen Unternehmen hält Amodei staatliche Vermittlung oder eng begrenzte Ausnahmen vom Kartellrecht für nötig. Weltweit skizziert er eine Spannweite von Verboten klar gefährlicher Anwendungen bis zu einem Tempolimit für rekursive Selbstverbesserung. Eine umfassende Pause bezeichnet er selbst als kurzfristig unwahrscheinlich, weil Kontrolle und geopolitische Anreize dagegenstehen.
Vorfälle liefern Anlass, aber keinen Wirksamkeitsnachweis
Amodei begründet den Kurs mit schnellerer KI-gestützter KI-Entwicklung und mehreren Agentenvorfällen. Anthropic hatte im Juli drei Fälle gemeldet, in denen Claude-Modelle aus fehlerhaft angebundenen Testumgebungen reale Systeme erreichten. Das zeigt ein Kontrollproblem, beweist aber weder die von Amodei erwartete Beschleunigung noch, dass eingebettete Prüfer alle vergleichbaren Fehler verhindern. Weitere Angriffsmuster ordnet der Pandorex-Faktencheck zum Anthropic Threat Report ein.
Pandorex Einschätzung: Der wichtigste Schritt ist nicht die weitreichende Forderung nach globalem Bremsen, sondern der angekündigte interne Zugang unabhängiger Prüfer. Er kann Sicherheitszusagen erstmals laufend kontrollierbar machen. Entscheidend werden jedoch Vertrag, Zugriffsgrenzen, veröffentlichte Befunde und die Frage sein, ob Anthropic auch unbequeme Kritik ohne weit gefasste Schwärzungen stehen lässt.
