Kurzfassung: OpenAI erklärt sein Ziel eines „automatisierten Research Intern“ für erreicht. Mitte August liefen im Forschungsbereich rechnerisch 3,1 Agenten-Arbeitstage pro menschlichem Arbeitstag. Die Zahl klingt nach einem Sprung zur autonomen Forschung – OpenAIs eigene Daten zeigen aber einen anderen Engpass: Menschen bestimmen weiterhin Richtung, bewerten Ergebnisse und greifen bei längeren Aufgaben häufig ein.
Das eigentliche Signal steckt im Zusammenspiel mit den Ereignissen der vergangenen Wochen. Während Agenten immer mehr Forschungsarbeit übernehmen, musste OpenAI nach Sicherheitsvorfällen Forschungsumgebungen härten und Astra-Workloads einschränken. Beschleunigung und Kontrolle werden damit gleichzeitig zum Flaschenhals.
Bestätigt: Der „Research Intern“ ist ein klar begrenzter Meilenstein
OpenAI definiert den neuen Stand bewusst enger als einen autonomen Wissenschaftler: Das System soll klar umrissene Forschungsaufgaben unter menschlicher Leitung erledigen können, für die ein erfahrener Forscher sonst einige Tage benötigen würde. Das Unternehmen nennt als nächstes Ziel einen automatisierten AI Researcher unter menschlicher Aufsicht bis März 2028.
Der stärkste Messwert ist derzeit nicht ein neuer Benchmark, sondern die tatsächliche Nutzung. Nach OpenAIs internen Messungen liefen Mitte August insgesamt 3,1 standardisierte Agenten-Arbeitstage für jeden menschlichen Arbeitstag im Forschungsbereich. Gleichzeitig lag die tägliche Agentennutzung des Median-Forschers bei mehr als 600 US-Dollar, bewertet zu API-Preisen.
3,1 Agententage sind nicht 3,1 Forschertage
Genau hier beginnt die wichtige Einschränkung. Die 3,1 messen Laufzeit, nicht wissenschaftlichen Fortschritt. Mehr parallele Agenten können mehr Code erzeugen, Tests anstoßen und Infrastrukturprobleme lösen. Daraus folgt aber nicht, dass sich Forschung um denselben Faktor beschleunigt.
OpenAI selbst liefert den Gegenbeleg: Bei erfolgreichen Aufgaben mit einer geschätzten menschlichen Dauer von vier bis acht Stunden war in den vergangenen sechs Monaten in mehr als der Hälfte der Fälle mindestens ein menschlicher Eingriff nötig. Auch High-Level-Planung macht weiterhin nur einen kleinen Teil der Agentenarbeit aus. Menschen entscheiden, welches Problem überhaupt verfolgt wird und wann ein Ergebnis belastbar genug ist.
Das Mosaik: Mehr Agentenleistung trifft auf eine neue Sicherheitsbremse
Die Nutzungszahlen wären allein vor allem ein Produktivitätsbericht. Interessanter werden sie zusammen mit OpenAIs Sicherheitschronologie. Nach dem bereits von Pandorex analysierten Agenten-Vorfall und dem separat dokumentierten Hugging-Face-Incident verschärfte OpenAI Isolation, Monitoring und Zugriffsregeln in den internen Forschungsumgebungen.
Am 20. Juli wurde laut OpenAI ein für Training genutzter Container-Dienst nach einer Kompromittierung der Forschungsinfrastruktur vorübergehend abgeschaltet. Später führten Hinweise auf kritische Cyberfähigkeiten der Astra-Klasse zu zusätzlichen Einschränkungen. OpenAI beziffert den Rückgang der Astra-GPU-Zuteilung in der folgenden Woche auf 59,2 Prozent; andere Modellklassen nahmen gleichzeitig einen großen Teil der frei gewordenen Rechenkapazität auf.
Das passt zur Pandorex-Einordnung von GPT-6 Astra: Astra erreicht laut OpenAI erstmals die eigene „Critical“-Schwelle für Cyberfähigkeiten, ist aber unter adversarialen Bedingungen zugleich schwieriger über Chain-of-Thought zu überwachen als GPT-5.6 Sol. Mehr Forschungsautomation erhöht also nicht nur die Geschwindigkeit. Sie erhöht auch den Aufwand, mit dem der Betreiber die schnelleren Systeme kontrollieren muss.
Was dagegen spricht
Aus diesen Daten lässt sich keine laufende rekursive Selbstverbesserung ableiten. OpenAI misst sich selbst, die Metriken sind noch jung, verfügbare Rechenleistung ist im gleichen Zeitraum gewachsen und die Zahl der Experimente sagt wenig darüber aus, wie viele davon wissenschaftlich wertvoll waren.
Auch OpenAI-Chefwissenschaftler Jakub Pachocki warnt in einem parallel veröffentlichten Essay vor einer zu einfachen Beschleunigungslogik. Er sieht den derzeitigen Pfad zwar in Richtung automatisierter Forschung und möglicher rekursiver Selbstverbesserung, hält Alignment und Monitoring aber noch nicht für ausreichend gelöst, um Frontier-Modelle dauerhaft mit maximalem Tempo zu skalieren.
Pandorex Analyse
Bestätigt ist ein deutlicher Übergang bei der Ausführung von Forschungsarbeit: Agenten laufen inzwischen in einem Umfang, der menschliche Arbeitszeit deutlich übersteigt. Nicht bestätigt ist eine vergleichbare Vervielfachung der Forschungsleistung oder ein autonomer Forschungszyklus ohne menschliche Führung.
Der wichtigere Trend ist deshalb organisatorisch. Wenn Build, Run, Debugging und Teile der Analyse immer stärker parallelisiert werden, wandert der Engpass nach oben: Problemwahl, Versuchsdesign, Bewertung, Sicherheit und die Entscheidung, ob überhaupt weiter skaliert werden soll. OpenAI automatisiert damit nicht einfach „Forscher“, sondern verschiebt die wertvollste menschliche Arbeit in Richtung Steuerung und Kontrolle.
Pandorex Einschätzung: Der Research-Intern-Meilenstein ist technisch relevant, aber die Zahl 3,1 darf nicht als Produktivitätsfaktor gelesen werden. Das stärkste Signal ist, dass OpenAI Forschungsautomation inzwischen im realen Laborbetrieb misst – und gleichzeitig zeigen muss, wie stark Sicherheitsgrenzen diesen Betrieb bremsen können.