Kurzfassung: Das US-Prüfinstitut CAISI bewertet Z.ai GLM-5.3 als bisher cyberstärkstes öffentlich verfügbares Open-Weight-Modell. Im Vergleich mit den jeweils besten getesteten US-Modellen bleiben jedoch deutliche Lücken. Die oft zitierte Einordnung „vier Monate Rückstand“ ist ein historischer Indexwert, keine Prognose für eine Aufholfrist.
Vier Prüfungen statt eines Einzelwerts
CAISI, angesiedelt beim US-Normungsinstitut NIST, ließ die Modelle als Agenten mit Shell- und Python-Zugriff in derselben ReAct-Testumgebung antreten. Die vier Benchmarks decken unterschiedliche Stufen ab: Schwachstellen in Browser-Quellcode finden und einen Crash auslösen, bekannte V8-Fehler zu Codeausführung ausbauen, reale Fehler in Open-Source-Projekten verwerten sowie unbekannte Defekte in OSS-Fuzz-Projekten finden und ausnutzen.
GLM-5.3 erreichte 40,4 Prozent in SEC-Bench Pro gegenüber 90,2 Prozent beim besten getesteten US-Modell. In ExploitBench lagen die Werte bei 61,1 zu 100 Prozent, in ExploitGym bei 9,4 zu 44,4 Prozent und im privaten OSS-Fuzz-Test bei 7,7 zu 23,2 Prozent. Gegenüber dem vorherigen chinesischen Spitzenwert verbesserte sich GLM-5.3 in allen vier Tests deutlich. Die öffentlich verfügbaren Modellgewichte machen diese Fähigkeiten zugleich breiter einsetzbar als bei einem nur per API angebotenen System.
Pandorex Analyse
Die NIST-Ergebnisse korrigieren zwei zu einfache Erzählungen. Z.ai hatte zur Vorstellung mit eigenen CyberGym- und ExploitBench-Werten Nähe zu geschlossenen US-Modellen betont; die unabhängige CAISI-Prüfung bestätigt den Sprung gegenüber GLM-5.2, aber keine allgemeine Parität. Besonders bei längeren Exploit-Ketten fällt der absolute Abstand weiterhin groß aus.
Auch CAISIs „etwa vier Monate“ darf nicht als Kalenderprognose gelesen werden. Der Wert stammt aus einem Item-Response-Modell, das Aufgabenschwierigkeit und historische Veröffentlichungszeitpunkte zusammenführt. Zudem bezeichnet „US frontier best“ je Benchmark das jeweils beste von CAISI geprüfte US-Modell; die Vergleichsspalte muss daher nicht überall dasselbe System darstellen. Unveröffentlichte Modelle fehlen, US-Modelle liefen soweit möglich mit deaktivierten Cyber-Schutzfiltern, und OSS-Fuzz ist ein privater Benchmark.
Der belastbare Befund ist enger: Offene Modellgewichte haben bei automatisierter Schwachstellensuche und Exploit-Entwicklung einen neuen gemessenen Höchststand erreicht, ohne die geprüfte US-Spitze einzuholen. Für Verteidiger erhöht das den Nutzen lokal betreibbarer Audit-Agenten. Gleichzeitig sinkt die Hürde für Angreifer, solche Fähigkeiten ohne Anbieterfilter einzusetzen; aus Benchmark-Erfolg folgt aber noch kein zuverlässiger autonomer Angriff auf ungeprüfte reale Systeme.
