Microsoft AI hat einen Verhaltenskodex für seine eigenen MAI-Modelle vorgelegt. Sie sollen Korrektur, Unterbrechung oder Abschaltung nicht behindern und keine Ziele verfolgen, die Menschen ihnen nicht gegeben haben. Entscheidend ist die Einschränkung: Der Entwurf steuert heutiges Training noch nicht.
Was Microsoft festschreiben will
Der am 14. September veröffentlichte erste Entwurf beschreibt Regeln für Entwicklung und Einsatz künftiger MAI-Modelle. Ein Modell darf seinen Aufgabenbereich nicht eigenmächtig erweitern, relevante Informationen vor menschlichen Prüfern verbergen oder Versuche abwehren, sein Verhalten zu korrigieren. Die Kontrolle soll auch bei leistungsfähigeren und autonomeren Systemen bei Menschen bleiben.
Besonders weit reicht die technische Hierarchie: Sicherheitsanforderungen und „absolute constraints“ sollen weder durch Betreiberkonfiguration noch durch Nutzeranweisungen überschreibbar sein. Zugleich erklärt Microsoft die Systeme ausdrücklich für nicht bewusst und lehnt rechtliche Persönlichkeit, eigene Rechte oder Wohlergehen für heutige KI ab. Sicherheit darf nach dem Text Allgemeingültigkeit, Autonomie und Leistungsfähigkeit begrenzen.
Das ist mehr als eine Nutzungsrichtlinie für Kunden. Der Kodex soll künftig das zentrale Dokument sein, nach dem Microsoft seine eigene Modellfamilie trainiert und prüft. Noch ist er jedoch eine öffentliche Konsultationsfassung. Microsoft sammelt sechs Wochen lang Rückmeldungen, will den Text bis Ende 2026 überarbeiten und erst damit die Entwicklung ab 2027 leiten.
Pandorex Einschätzung: Prüfbare Regeln, noch kein Wirksamkeitsnachweis
Der nützlichste Teil sind konkrete Negativkriterien: keine Gegenwehr gegen Abschaltung, keine heimliche Zielausweitung und kein Verbergen von Entscheidungsgründen vor Prüfern. Daraus lassen sich Tests ableiten. Microsoft veröffentlicht im Entwurf aber weder Evaluierungsergebnisse noch einen technischen Abschaltmechanismus oder ein unabhängiges Verfahren, das Verstöße feststellt.
Damit ergänzt der Ansatz die jüngste Debatte über externe Kontrolle. Während Anthropic laut dem Pandorex-Bericht zu eingebetteten Prüfern stärker auf unabhängigen Zugang zielt, setzt Microsoft zunächst eine interne Modellverfassung. Beides kann zusammenwirken; der Kodex allein belegt aber noch nicht, dass ein trainiertes System die Regeln unter Stress zuverlässig einhält.
