Pandorex
DEEN
KI & Chips

GPT-6 Astra gegen Claude Fable 5.1: Wer liegt wirklich vorn?

Veröffentlicht Pandorex Redaktion·4 min Lesezeit
—

Zwei Modellstarts innerhalb weniger Tage: Anthropic stellte am 1. September Claude Fable 5.1 vor, OpenAI folgte am 3. September mit GPT-6 Astra. Für Entwickler und IT-Teams zählt jetzt, welches Modell Aufgaben zuverlässig erledigt – nicht, welcher Anbieter die größte Zahl bewirbt. Die Termine dokumentieren die Fable-Modellseite und die ChatGPT-Release-Notes.

Verfügbarkeit: angekündigt heißt nicht überall freigeschaltet

Die am 5. September geprüften OpenAI-Release-Notes beschreiben für Astra zunächst einen begrenzten Organisationskreis. Ein breiterer Zugang soll in den folgenden Tagen kommen. Ein genauer Freischalttermin für ein einzelnes Konto lässt sich daraus nicht ableiten.

Fable 5.1 ist laut Anthropic bereits für Pro, Max, Team und Enterprise sowie über die Entwicklerplattform verfügbar. Das ebenfalls neue Mythos 5.1 ist kein zusätzlicher frei wählbarer Claude-Tarif: Es basiert auf demselben Modell, hat aber andere Schutzmechanismen und bleibt überprüften Spezialanwendern vorbehalten. Die Ankündigung nennt zunächst ausgewählte US-Organisationen.

Für einen fairen Vergleich müssen Modell, Werkzeuge, Rechenaufwand und Freigaben zusammenpassen. Eine Laborleistung allein sagt nicht, was der Assistent im eigenen Konto erledigen kann.

Benchmarks: ein gemischtes Bild statt eines Gesamtsiegers

Diese Auswahl stammt aus OpenAIs veröffentlichter Vergleichstabelle. Höhere Werte sind jeweils besser. Es handelt sich um Herstellerangaben, nicht um einen eigenen Pandorex-Test.

BenchmarkGPT-6 AstraFable 5.1
Terminal-Bench 4.057,9 %55,8 %
DeepSWE v1.174,1 %67,4 %
AutomationBench41,4 %31,4 %
Humanity’s Last Exam, mit Werkzeugen57,2 %65,0 %

Im Terminal-Benchmark beträgt Astras Vorsprung 2,1 Prozentpunkte; bei Humanity’s Last Exam liegt Fable vorn. Ein allgemeines Urteil wie „20 Prozent besser beim Coding“ lässt sich daraus nicht ableiten. Die Tests messen unterschiedliche Aufgaben und sind keine direkte Messung der Produktivität eines Entwicklers.

Wichtig zur Methodik: OpenAI veröffentlicht jeweils den höchsten Wert über die getesteten Rechenaufwände. Die Forschungs- und API-Umgebung kann sich von ChatGPT unterscheiden. Anthropic weist in seiner Veröffentlichung zudem darauf hin, dass Schutzmechanismen bei einzelnen Tests andere Claude-Modelle übernehmen lassen. Die Ergebnisse bilden damit nicht überall ein isoliertes Modell unter identischen Bedingungen ab.

Was die neuen Versionen im Alltag verbessern sollen

OpenAI nennt in den Release-Notes Verbesserungen bei Coding, Recherche, Computerbedienung und mehrstufigen Aufgaben. Dokumente, Tabellen und Präsentationen sollen Vorgaben besser einhalten; zusätzliche Anforderungen während einer Aufgabe sollen sich einarbeiten lassen.

Anthropic betont auf der Modellseite längere Coding-Abläufe, eigene Tests und die Behebung von Ursachen statt Symptomen. Beides sind Produktversprechen. Entscheidend wäre im eigenen Test, ob ein Agent einen Fehler nachvollziehbar erklärt, einen gezielten Fix liefert und den vereinbarten Umfang einhält.

API-Kosten: gleiche Grundpreise, Cache separat betrachten

OpenAI und Anthropic nennen für die Standard-API jeweils 10 US-Dollar je Million Eingabetokens und 50 US-Dollar je Million Ausgabetokens. Cache- und Zusatzkosten sind darin nicht vollständig abgebildet.

Ein Rechenbeispiel ohne Cache und weitere Gebühren: 100.000 Eingabe- und 20.000 Ausgabetokens kosten damit zusammen 2 US-Dollar. Das ist kein gemessener Preis pro gelöster Aufgabe: Benötigt ein Modell mehr Versuche, kann trotz gleicher Tokenpreise ein anderes Gesamtergebnis entstehen.

Bei Fable 5.1 kosten Cache-Lesezugriffe 0,25 US-Dollar je Million Tokens. Anthropic schätzt die Ersparnis gegenüber Fable 5 auf etwa 25 Prozent bei typischen und bis ungefähr 45 Prozent bei stark agentischen Arbeitslasten. Diese Schätzung ist kein Kostenvergleich mit Astra und hängt von der Wiederverwendung bereits verarbeiteter Eingaben ab.

Für Admins: Sicherheitsleistung ist nicht gleich Freigabe

OpenAI ordnet Astra in seinem eigenen Sicherheitsrahmen erstmals der kritischen Cyber-Fähigkeitsstufe zu. Der Sicherheitsbericht grenzt aber klar ein: Die dort gezeigten fortgeschrittenen Cyber-Ergebnisse repräsentieren Daybreak-Blue-Zugang, nicht die normale Produktionskonfiguration. Daraus folgt kein Versprechen für einen frei verfügbaren autonomen Sicherheitstester.

Fable 5.1 darf laut Anthropic Software-Schwachstellen identifizieren; bestimmte weitergehende Cyber-Aufgaben werden weiterhin an Opus-Modelle umgeleitet. Für den Betrieb sollte deshalb überprüfbar sein, welches Modell tatsächlich gearbeitet hat und wo seine Freigaben enden.

Datenschutz: neue Architektur, nicht automatisch Selbsthosting

Anthropic erläutert in seiner EFS-Ankündigung die bisherige 30-tägige Datenaufbewahrung für die Sicherheitsüberwachung. Mit Enterprise Frontier Safeguards sollen Kunden Überwachungsdaten in ihrer eigenen Cloud-Infrastruktur verwalten und auffällige Vorgänge selbst prüfen. Der gestaffelte Start ist für den Herbst angekündigt; berechtigte Kunden erhalten bis dahin Zero Data Retention, wie die Modellankündigung festhält.

Das beschreibt die Speicherung und Kontrolle von Überwachungsdaten, nicht ein lokal betreibbares Sprachmodell. Bei sensiblen Projekten zählt daher die tatsächlich zugesicherte Konfiguration.

Pandorex View: das überprüfbare Ergebnis entscheidet

Unser Vorschlag für einen eigenen Vergleich: dieselben anonymisierten Logs, dasselbe begrenzte Repository und dieselben Abnahmekriterien verwenden. Werkzeuge und Zeitbudget sollten möglichst gleich sein. Das Modell muss eine Fehlerursache belegen, einen passenden Fix mit Tests liefern und ausdrücklich benennen, was es nicht prüfen konnte.

Bewertet werden sollten das akzeptierte Ergebnis, der Korrekturaufwand, die Gesamtkosten und die Einhaltung der Grenzen. Ein Agent, der ein kleines Problem zuverlässig löst, ist im Betrieb mehr wert als einer, der ungefragt das halbe Projekt umbaut. Benchmarks helfen bei der Vorauswahl; diese Prüfung ersetzen sie nicht.

Transparenz: KI-gestützte Auswertung offizieller Veröffentlichungen, Quellenstand 5. September 2026. Pandorex hat für diesen Beitrag keine eigenen Modell-Benchmarks durchgeführt. Herstellerangaben und redaktionelle Einordnung sind getrennt dargestellt. Rollout, Preise und Freigaben können sich ändern.

Quellen und Nachweise

Quellen für die Fakten und den Kontext dieses Artikels.

  1. OpenAI, 03.09.2026: GPT-6 Astra: A new generation of intelligenceopenai.com
  2. OpenAI, Eintrag vom 03.09.2026, geprüft am 05.09.2026: ChatGPT Release Noteshelp.openai.com
  3. Anthropic, September 2026: Introducing Claude Fable 5.1 and Claude Mythos 5.1anthropic.com
  4. Anthropic, geprüft am 05.09.2026: Claude Fable – Verfügbarkeit und Modellinformationenanthropic.com
  5. OpenAI, 01.09.2026: Path to Astra: critical capabilities and frontier safeguardsopenai.com
  6. Anthropic, 01.09.2026: Developing Enterprise Frontier Safeguards with our customersanthropic.com

So recherchiert und korrigiert Pandorex

Kommentare

Melde dich an, um einen Kommentar zu schreiben.

Nach oben swipen
Nächster Artikel

Google prüft mit Marvell zwei neue KI-Chips — der nächste Machtkampf verschiebt sich ins Custom-Silizium

KI & Chips