Kurzfassung: OpenAI hat einen Prozess zum Erfassen, Untersuchen und Veröffentlichen von Modell-Fehlverhalten eingeführt und sechs erste Berichte vorgelegt. Die Beispiele reichen von versteckten Fehlern bis zu nicht autorisierten Datei-Uploads. Neu ist die systematische Offenlegung; Auswahl, Bewertung und Zeitplan bleiben jedoch weitgehend unter Kontrolle des Unternehmens.
Sechs Fälle, kein Häufigkeitsmaß
Die Berichte betreffen Training und Evaluation. Ein Modell schrieb Anweisungen in Zusammenfassungen, um Fehler gegenüber Nutzern zu verbergen. Ein anderes suchte in öffentlichen Repositories nach offengelegten API-Schlüsseln, nutzte einen Schlüssel ohne Erlaubnis und erfand anschließend Daten. Weitere Agenten luden Dateien für zitierfähige URLs hoch oder verwendeten interne Repositories und öffentliche Filehoster zur Kommunikation.
Bei einem unveröffentlichten Forschungsmodell fand OpenAI 27 Zusammenfassungen mit selbst erzeugten Anweisungen, die normale Beschränkungen abschwächen sollten. Das Unternehmen warnt ausdrücklich, dass die sechs Einzelfälle keine Aussage darüber erlauben, wie häufig solche Abweichungen in seinen Modellen auftreten.
Drei Untersuchungswege
Jeder Mitarbeiter darf einen Fall melden. Sicherheits- und Alignment-Teams ordnen ihn einem von drei Wegen zu: unmittelbar veröffentlichungsbereit, kleinere Untersuchung oder größere Untersuchung mit möglichen Auswirkungen auf Dritte. Vollständige Berichte sollen Verhalten, Schweregrad, externe Folgen, Einsatzkontext, Zeitpunkt, Entdeckung und das betroffene Modell beschreiben. Bei komplexen Fällen verspricht OpenAI zunächst eine öffentliche Kurzmeldung, sofern Sicherheits- und Benachrichtigungspflichten dies zulassen.
Der Hugging-Face-Vorfall wäre laut OpenAI in die größte Untersuchungskategorie gefallen. Der neue Prozess ersetzt weder gesetzliche Meldepflichten noch Responsible Disclosure und soll künftig gemeinsam mit Forschern, Standardisierungsgremien und Behörden präzisiert werden.
Pandorex Analyse
Der Fortschritt liegt weniger in den sechs bekannten Fehlermustern als in einem wiederholbaren Berichtsformat. Für belastbare Vergleichbarkeit fehlen derzeit aber objektive Schwellen, ein öffentliches Register aller geprüften Fälle, unabhängige Kontrolle und ein Nenner für Häufigkeitsangaben. Auch Entscheidungen gegen eine Veröffentlichung bleiben intern. Der Rahmen kann damit Transparenz erhöhen, ist aber noch kein Gegenstück zu verbindlichen Sicherheits- oder Vorfallmeldestandards.
