Pandorex
DEEN
KI & Chips

Gemini 4 Argon: Eine Million Ausgabetokens, aber noch kein öffentlicher Start

Veröffentlicht Pandorex Redaktion·5 min Lesezeit
—
Illustration: Ein violetter KI-Prozessor erzeugt hinter einem Zugangstor für ausgewählte Verteidiger eine lange Kette von Arbeitsblöcken, die sich in erfolgreiche und gestoppte Prüfpfade teilt.
Redaktionelle Illustration · Pandorex

Kurzfassung: Google hat Gemini 4 Argon mit bis zu einer Million Ausgabetokens vorgestellt, gibt das Modell aber zunächst nur ausgewählten Cyberverteidigern. In Googles eigener Tabelle führt Argon in 13 von 19 Vergleichen allein, doch Messmethoden und Einstellungen sind nicht durchgehend identisch. Der entscheidende Fortschritt ist daher die lange Arbeitsbahn unter kontrolliertem Zugang, nicht ein pauschaler Sieg über jedes andere Modell.

Was Google tatsächlich freigibt

Argon wird über Googles Fairwind-Programm zunächst einer begrenzten Gruppe vertrauenswürdiger Cyberverteidiger bereitgestellt. Einen Termin für den allgemeinen API-, Unternehmens- oder Consumer-Zugang nennt Google nicht; er soll „so bald wie möglich“ folgen und mit einer kostenpflichtigen API sowie Google AI Ultra beginnen. Die angekündigten Einführungspreise von 2 US-Dollar je Million Eingabetokens und 10 Dollar je Million Ausgabetokens gelten deshalb noch nicht für einen allgemein kaufbaren Dienst. Nach der Einführungsphase sollen sie auf 4 beziehungsweise 20 Dollar steigen.

Google beschreibt die Freigabe ausdrücklich als kontrollierten Test ohne Cyber-Schutzschranken für die ausgewählten Verteidiger. Gleichzeitig nennt das Unternehmen Aktivierungsüberwachung, Schutz gegen Prompt Injection, Überwachung von Gedankengängen und Aktionen sowie abgeschottete Sandboxes als Sicherheitsmaßnahmen. Dass Argon eine kritische Schwachstelle in Krankenhaussoftware gefunden habe, stammt aus Googles Zusammenarbeit mit Wiz; eine öffentliche technische Reproduktion liegt nicht vor.

Eine Million Ausgabetokens sind nicht dasselbe wie Kontext

Googles Ankündigung erhöht ausdrücklich das Ausgabelimit von 64.000 auf eine Million Tokens. Das ist nicht automatisch gleichbedeutend mit einem Kontextfenster derselben Größe. Die Methodik dokumentiert zwar einen GraphWalks-Lauf mit einer Million Eingabetokens, doch daraus folgt keine vollständig veröffentlichte Produktionsspezifikation für alle Zugangswege. Vals führt Argon derzeit mit einer Million Kontexttokens, aber nur 262.144 maximalen Ausgabetokens. Diese Abweichung dürfte eine Testkonfiguration oder noch nicht aktualisierte Metadaten widerspiegeln; für die angekündigte Modellgrenze ist Googles Primärquelle maßgeblich.

Benchmarks: stark, aber nicht einheitlich

In Googles Tabelle erzielt Argon 13 alleinige Bestwerte, teilt sich auf CWE-bench v1 den Spitzenplatz mit GPT-6 Astra und liegt in fünf Vergleichen zurück: FrontierSWE v2, Terminal-Bench 4.0, PostTrainBench, Terminal-Bench Science und OSWorld 2.0. Die Methodik trennt jedoch selbst berechnete Werte, Anbieterangaben und öffentliche Ranglisten. Beim Video-Langkontexttest LVBench wurden wegen API-Grenzen zudem unterschiedliche Bildmengen verwendet. Interne Schwachstellen- und Penetrationstests sind nicht öffentlich reproduzierbar.

Die unabhängige Vals-Übersicht setzt Argon mit 68,90 Prozent an die Spitze ihres Gesamtindex, zeigt aber ein ungleichmäßiges Profil: Platz eins bei Finance Agent v2, nur 4,83 Prozent und Rang sieben von acht bei CUA-bench. Lange agentische Aufgaben können zugleich teuer werden; Vals berechnet für CUA-bench 193,78 Dollar pro Test. Einzelne Ranglisten sagen damit weniger als Aufgabenmix, Laufzeit und Kosten.

Pandorex Analyse

Argons wichtigste Entwicklungslinie verbindet sehr lange Ausgabe mit lang laufenden Coding- und Sicherheitsaufgaben. Der gestufte Zugang ist dabei Teil des Produkts: Google sammelt reale Verteidigererfahrungen, bevor die breite API verfügbar ist. Die öffentlich belegte Leistung ist stark, aber kein universeller Spitzenplatz. Zum Prüfzeitpunkt am 1. Oktober war außerdem noch keine eigene Argon-Karte im öffentlichen Model-Card-Verzeichnis aufgeführt. Die Startmeldung beschreibt Schutzmaßnahmen; eine vollständige Modellkarte mit systematischen Grenzen und Sicherheitsresultaten ersetzt sie nicht.

Quellen und Nachweise

Quellen für die Fakten und den Kontext dieses Artikels.

  1. Google, 30.09.2026: Gemini 4 Argon: Advancing AI reasoning, coding and cybersecurityblog.google
  2. Google DeepMind, 30.09.2026: Gemini models and benchmark tabledeepmind.google
  3. Google DeepMind, 30.09.2026: Gemini 4 Argon evaluation methodologydeepmind.google
  4. Google DeepMind, geprüft am 01.10.2026: Model cards indexdeepmind.google
  5. Vals AI, 30.09.2026: Google Gemini 4 Argon independent evaluationsvals.ai
  6. Reuters, 30.09.2026: Google announces Gemini 4 flagship AI model after months of delaysreuters.com

So recherchiert und korrigiert Pandorex

Kommentare

Melde dich an, um einen Kommentar zu schreiben.

Nach oben swipen
Nächster Artikel

OpenAI Dots startet ohne Pro-Zugang im EWR – Sicherheitsdaten zeigen Grenzen

KI & Chips