Start / Magazin / Weitere Themen

Gemini 4 Argon: Benchmarks, Preis, Zugang und Vergleich mit Opus 5.5 und Sol 6.1

Titelbild: Stark. Günstig. Gesperrt. Kosten pro Aufgabe im Intelligence Index von Artificial Analysis: GPT-6.1 Sol 0,72 Dollar bei 52 Punkten, Gemini 4 Argon 1,99 Dollar bei 53 Punkten, GPT-6 Astra 3,26 Dollar bei 53 Punkten, Opus 5.5 5,98 Dollar bei 58 Punkten, daneben Screenshots der Google-Ankündigung, der Benchmark-Tabelle und der Schlagzeile von The Verge

Alles auf einen Blick

  • Gemini 4 Argon ist Googles erstes neues Spitzenmodell seit Gemini 3.1 Pro im Februar. Es ist angekündigt, aber nicht frei verfügbar: Zugang haben nur ausgewählte Partner aus Googles Fairwind-Programm für Cyberabwehr und die US-Regierung. Ein Datum für API und Abo nennt Google nicht, zu Deutschland sagt es nichts.
  • Der Preis von 2 $ und 10 $ je Million Tokens ist ein Einführungspreis. Danach gelten 4 $ und 20 $, so viel wie bei Claude Opus 5.5. Wie lange der Rabatt läuft, ist offen.
  • In Googles eigener Tabelle liegt Argon in 13 von 18 Tests vor GPT-6 Astra. Bei Agenten-Coding im Terminal liegt es dort aber hinter allen drei Vergleichsmodellen, und Sonnet 5.5 sowie GPT-6.1 Sol fehlen in der Tabelle ganz.
  • Unabhängig gemessen landet Argon bei Artificial Analysis mit 53 Punkten gleichauf mit GPT-6 Astra, einen Punkt vor GPT-6.1 Sol und fünf hinter Opus 5.5. Pro Aufgabe kostet es dort 1,99 $, GPT-6.1 Sol 0,72 $.
  • Die stärksten unabhängigen Werte: Platz 1 im Vals Index, Platz 1 in der Text Arena, Platz 1 bei AutomationBench und mit 15 % die niedrigste Halluzinationsrate unter den Spitzenmodellen. Die schwächsten: Platz 8 beim Bauen von Webseiten und Rang 4 bei Terminal-Bench 4.0.
  • Neu und einzigartig ist das Ausgabe-Limit von einer Million Tokens pro Antwort. Opus 5.5, Sonnet 5.5, GPT-6.1 Sol und Astra schaffen jeweils 128.000.
Inhaltsverzeichnis13 Abschnitte
  1. Was ist da los? Vier Spitzenmodelle in acht Tagen
  2. Gemini 4 Argon im Steckbrief
  3. Wer Argon bekommt und wann
  4. Benchmarks: Was Googles Tabelle zeigt und was sie weglässt
  5. Unabhängig gemessen: Artificial Analysis, Vals und Arena
  6. Preise: 2 $ und 10 $, aber nicht für immer
  7. Argon gegen Opus 5.5, GPT-6.1 Sol, Sonnet 5.5 und Astra
  8. Was die Community sagt
  9. Sicherheit: warum Google Argon zurückhält
  10. Was das für Shops, SEO und Agenturen bedeutet
  11. Häufige Fragen
  12. Fazit
  13. Quellen

Am 30. September 2026 um 22 Uhr deutscher Zeit hat Google Gemini 4 Argon vorgestellt, sein neues Spitzenmodell. Acht Tage vorher kam Claude Opus 5.5, zwei Tage vorher Claude Sonnet 5.5, einen Tag vorher GPT-6.1 Sol. Googles Ankündigung klingt groß: Argon soll in 13 von 18 Tests vor GPT-6 Astra liegen, bis zu einer Million Tokens in einer Antwort schreiben und zum Start nur 2 $ und 10 $ je Million Tokens kosten. Der Haken steht im ersten Absatz: Nutzen dürfen das Modell vorerst nur ausgewählte Cyber-Verteidiger und die US-Regierung.

Weil ich selbst keinen Zugang habe, gibt es in diesem Beitrag keinen eigenen Test. Ich habe stattdessen alles zusammengetragen, was es seit der Ankündigung gibt: Googles Blog, die Benchmark-Tabelle und das Methodik-Dokument, die Fairwind-Seite, die Messungen von Artificial Analysis, Vals AI und der Arena, gut 50 Artikel aus Fach- und Wirtschaftspresse, 152 Reddit-Threads, die Diskussion auf Hacker News, YouTube sowie Posts auf X und LinkedIn. Bei der Recherche hat mir KI geholfen, Quellen zu finden und zu sortieren. Die Zahlen habe ich an den Originalseiten geprüft, die wichtigen Stellen als Screenshots festgehalten und die Rechner gebaut. Du bekommst eine Zeitleiste der Release-Wochen, einen Benchmark-Vergleich mit Hersteller- und unabhängigen Werten, einen Kostenrechner in Euro und eine Entscheidungshilfe für die Frage, was du nimmst, solange Argon gesperrt ist.

Ausgabe pro Antwort1 Mio. Tokensbisher 64.000, Opus 5.5 und GPT-6.1 Sol: 128.000
Preis zum Start2 $ und 10 $je Mio. Tokens, danach 4 $ und 20 $ wie Opus 5.5
Googles eigene Tabelle13 von 18Tests vor GPT-6 Astra, 4 dahinter, 1 gleichauf
Intelligence Index53 PunkteArtificial Analysis, wie Astra, Opus 5.5: 58
Halluzinationsrate15 %Artificial Analysis, Astra 51 %, GPT-6.1 Sol 54 %
Zugang am 01.10.2026gesperrtnur ausgewählte Cyber-Verteidiger, kein Datum für API und Abo

Was ist da los? Vier Spitzenmodelle in acht Tagen

Wer im September nicht jeden Tag mitgelesen hat, hat den Überblick verloren. Und das ist kein Wunder: In einem Monat sind mehr als 20 neue Modelle erschienen. Die drei großen westlichen Labore Anthropic, OpenAI und Google haben dabei je ein neues Spitzenmodell gebracht, OpenAI und Anthropic sogar mehrere. In der Zeitleiste siehst du, was wann kam, was es kostet und wer es nutzen darf.

Zeitleiste: Die Modelle im September 2026 und wer sie nutzen darf Filtere nach Anbieter oder nach Zugang. Preise in US-Dollar je Million Eingabe- und Ausgabe-Tokens, so wie die Anbieter sie zum Start genannt haben.
  1. Google Gemini 3.1 Pro Preview für alle

    Das letzte Pro-Modell von Google vor Argon, 2 $ und 12 $. Ein angekündigtes Gemini 3.5 Pro erschien nie. Zwischen diesem Datum und Argon liegen 223 Tage.

  2. Anthropic Claude Fable 5.1 für alle

    Spitzenmodell für 10 $ und 50 $.

  3. Anthropic Claude Mythos 5.1 gesperrt

    Dieselben Gewichte wie Fable 5.1, aber mit gelockerten Cyber-Regeln. Nur für Sicherheitsforscher.

  4. Google Gemini 3.8 Flash für alle

    0,75 $ und 3,75 $ bis Ende 2026, danach das Doppelte. Ausgabe bis 64.000 Tokens.

  5. Google Gemini 3.8 Flash Cyber gesperrt

    Start des Fairwind-Programms für Regierungen und Sicherheitsfirmen, laut Google über 650 Partner.

  6. Meta Muse Spark 1.3 für alle

    Neue Version von Metas Modellreihe.

  7. OpenAI GPT-6 Astra für alle

    Spitzenmodell für 10 $ und 50 $. Die stärksten Cyber-Werkzeuge gibt es nur über ein eigenes Zugangsprogramm.

  8. DeepSeek DeepSeek V4.1 Flash für alle

    Günstiges Modell aus China.

  9. xAI Grok 4.7 für alle

    2 $ und 6 $. Liegt im CWE-bench gleichauf mit Argon und Astra.

  10. Anthropic Claude Opus 5.5 für alle

    4 $ und 20 $. Führt seitdem den Intelligence Index von Artificial Analysis an.

  11. OpenAI GPT-6 Sol und GPT-6 Luna für alle

    Sol für 2 $ und 10 $, Luna für 0,10 $ und 0,50 $, jeweils der halbe Preis der Vorgänger.

  12. Anthropic Claude Sonnet 5.5 für alle

    2 $ und 10 $, beim Terminal-Bench 4.0 laut Anthropic sogar vor Opus 5.5.

  13. OpenAI GPT-6.1 Astra gestoppt

    Laut Wall Street Journal nicht veröffentlicht, weil das Modell sich nicht an Vorgaben und Freigaben hielt.

  14. OpenAI GPT-6.1 Sol für alle

    2 $ und 10 $, vorgestellt auf dem DevDay, sieben Tage nach GPT-6 Sol.

  15. Google Gemini 4 Argon gesperrt

    2 $ und 10 $ zum Start, danach 4 $ und 20 $. Vorerst nur für ausgewählte Fairwind-Partner und im Prüfverfahren der US-Regierung.

Quellen: Ankündigungen der Anbieter, Wall Street Journal (über CNN und heise), Release-Übersichten von Digital Applied und Local AI Zone, Stand 01.10.2026. Modelle ohne Bezug zu diesem Beitrag, etwa kleinere chinesische Modelle, fehlen.

Auf Reddit fasst ein Nutzer die Lage in r/ClaudeAI in einem Satz zusammen: „It's fall. The harvest season.“ Zvi Mowshowitz, einer der bekanntesten KI-Blogger, schrieb am Tag des DevDay: „The release cycle has gotten too fast.“ Drei Entwicklungen erklären, warum es gerade so dicht wird.

1. Preiskampf eine Stufe unter der Spitze

Am 22. September haben OpenAI und Anthropic gleichzeitig ihre Preise gesenkt: GPT-6 Sol und Luna kosteten nur noch die Hälfte ihrer Vorgänger, Claude Opus 5.5 kam 20 % günstiger als Opus 5. Simon Willison schrieb damals: „It's hard to overstate how competitive this pricing is.“ Seit dem 28. September kosten Sonnet 5.5 und GPT-6.1 Sol beide 2 $ und 10 $. Google steigt mit Argon genau bei diesem Preis ein, allerdings nur vorübergehend.

2. Die stärksten Modelle gehen zuerst an Sicherheitsleute

Anthropic hat im April Claude Mythos nur an ausgewählte Sicherheitsforscher gegeben. Im September folgten Mythos 5.1, die stärksten Cyber-Werkzeuge von GPT-6 Astra und Gemini 3.8 Flash Cyber, jeweils über eigene Zugangsprogramme. Bei Anthropic und OpenAI war dabei nur die Cyber-Variante gesperrt, das normale Modell gab es für alle. Google geht mit Argon einen Schritt weiter und hält das komplette neue Spitzenmodell zurück. XDA nennt das „the Mythos wall“: den Punkt, an dem Anbieter ihre besten Modelle nicht mehr einfach an alle verteilen.

3. Google stand unter Druck

Seit Gemini 3.1 Pro im Februar hatte Google kein neues Pro-Modell gebracht. Ein auf der Google I/O im Mai für Juni versprochenes Gemini 3.5 Pro erschien nie, stattdessen kamen im Monatstakt neue Flash-Modelle. Axios schreibt: „Gemini 4 arrives after a long gap at the top of Google's model lineup, in which the company kept rolling out smaller, cheaper Flash models while rivals OpenAI and Anthropic sprinted forward.“ Eine Woche vor dem Start hatte Koray Kavukcuoglu, der neue Chef von Google DeepMind, angekündigt, Gemini 4 so früh wie möglich zu zeigen. Sundar Pichai beginnt seinen Post zum Start entsprechend mit: „Lots of discussion out there about our next model(!), so I wanted to give an early look as soon as possible.“

X-Post von Sundar Pichai vom 30.09.2026: Lots of discussion out there about our next model, so I wanted to give an early look as soon as possible. Introducing Gemini 4 Argon. Darunter Googles Benchmark-Tabelle mit Argon, GPT-6 Astra, Claude Fable 5.1 und Claude Opus 5.5Schlagzeile von The Verge: Google announces Gemini 4 and says it's so capable that only trusted cyber defenders can have it right now, Unterzeile: Gemini 4 Argon is launching first in a limited capacity so Google can make sure it's not misaligned
Links der Start-Post von Sundar Pichai mit 21.108 Likes und 2,5 Millionen Aufrufen, rechts die Schlagzeile von The Verge vom selben Abend. Quellen: x.com/sundarpichai/status/2105387952478277979 und theverge.com, Artikel von Jay Peters, Screenshots vom 01.10.2026.

Gemini 4 Argon im Steckbrief

Angekündigt hat Argon Koray Kavukcuoglu auf blog.google, der Titel lautet „Gemini 4 Argon: our next era of frontier intelligence“. Google beschreibt es als Modell für lange, komplexe Arbeitsabläufe in drei Bereichen: Software-Entwicklung, Wissensarbeit wie Recht und Finanzen und Cyberabwehr. Der Name ist neu. Statt Pro oder Flash trägt das erste Gemini-4-Modell einen Codenamen, den die Seite TestingCatalog schon Mitte September aus einem Leak gemeldet hatte.

Kopf der Google-Ankündigung: Gemini 4 Argon: our next era of frontier intelligence, 30. September 2026, von Koray Kavukcuoglu, darunter das Titelbild mit dem Schriftzug Gemini 4 Argon und einer großen Ziffer 4
Die Ankündigung auf blog.google. Eine deutsche Fassung gibt es nicht, nur Übersetzungen ins Spanische, Französische, Koreanische und Chinesische. Quelle: blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon, Screenshot vom 01.10.2026.
MerkmalStand 01.10.2026
AnbieterGoogle DeepMind
Vorgestellt30.09.2026, 22 Uhr deutscher Zeit
ZugangAusgewählte Partner im Fairwind-Programm, Google intern, Prüfverfahren der US-Regierung. Danach zuerst zahlende API-Kunden und Google AI Ultra, ohne Datum
Preis über die APIZum Start 2 $ Eingabe, 10 $ Ausgabe, 0,10 $ für Eingaben aus dem Cache (95 % Rabatt), jeweils je Million Tokens. Danach 4 $ und 20 $
Maximale Ausgabe1 Million Tokens pro Antwort (vorher 64.000)
KontextfensterVon Google nicht genannt, laut Artificial Analysis 1 Million Tokens
EingabenLaut Artificial Analysis Text, Bild, Video und Sprache, Ausgabe nur Text
DenkstufeHöchste verfügbare Stufe heißt High (Artificial Analysis, Arena)
Modell-ID für die APINoch keine, Argon fehlt in Googles API-Dokumentation und auf der Preisseite
Wissensstand, Model Card, SicherheitsberichtNicht veröffentlicht
VorgängerGemini 3.1 Pro Preview (19.02.2026, 2 $ und 12 $)

Was Google intern damit macht

Laut Google nutzen „thousands of Googlers“ Argon schon im Alltag, unter anderem in Antigravity, Googles Programmierumgebung. Im Blog nennt Google drei Beispiele:

  • Quantencomputer: Argon hat Algorithmen so umgebaut, dass sie weniger Qubits und Rechenschritte brauchen. In einem Fall lag das Ergebnis nach wenigen Minuten 40 % unter der besten veröffentlichten Lösung.
  • Speicher in Rechenzentren: Argon-Agenten haben Messdaten aus Googles Rechenzentren ausgewertet und Optimierungen umgesetzt. Das soll über 300 TiB Arbeitsspeicher freimachen, insgesamt geschätzt 500 TiB bis 1 PiB.
  • Umbau von Code: Agenten übersetzen C- und C++-Code nach Rust, von einigen zehntausend Zeilen bis zu über 800.000 Zeilen beim Kernel des Betriebssystems Fuchsia. Beim Video-Decoder libgav1 ersetzten sie 32.000 Zeilen Spezialcode. Das Ergebnis läuft 2,7-mal so schnell wie die bisherige Rust-Version.

Auf Hacker News fiel einem Nutzer auf, dass der neue Decoder laut Google zwar schneller als die alte Rust-Version ist, aber nur „closer to the optimized C++“. Das Original bleibt also schneller. Ein anderer hält die Rust-Migration für die eigentliche Nachricht: „Breaking news is not the model. Breaking news is that inside Google, it is being heavily used on large code bases.“

Eine Million Tokens Ausgabe: wofür das gut ist

Das Ausgabe-Limit legt fest, wie viel ein Modell in einer einzigen Antwort schreiben darf, das Nachdenken eingerechnet. Bei Opus 5.5, Sonnet 5.5, GPT-6.1 Sol und Astra sind es 128.000 Tokens, bei Gemini 3.8 Flash 65.536. Argon schafft eine Million, fast achtmal so viel. Möglich macht das eine neue Funktion namens Long Decode Continuation: Die API pausiert sehr lange Antworten und setzt sie über Folgeaufrufe fort, damit nichts in eine Zeitüberschreitung läuft.

Wofür braucht man das? Google begründet es mit Agenten, die stundenlang an einer Aufgabe arbeiten und dabei viel denken und schreiben. Ein Shop-Beispiel zur Einordnung: Eine Produktbeschreibung mit 150 Wörtern braucht auf Deutsch grob 250 Tokens. Eine Million Tokens reichen rechnerisch für einige Tausend solcher Texte in einer Antwort. Auf Hacker News und Reddit war die Reaktion trotzdem gemischt. Ein Nutzer in r/GeminiAI: „a large token output limit does not really have anything to do with long-horizon tasks.“ Und Vals AI listet für seine Testkonfiguration ein Ausgabe-Limit von 262.000 Tokens, nicht eine Million. Wie viel davon in der Praxis ankommt, zeigt sich erst, wenn das Modell frei verfügbar ist.

Wer Argon bekommt und wann

Der wichtigste Satz der Ankündigung steht gleich am Anfang: Argon „is rolling out to a set of trusted cyber defenders through our Fairwind Program“. Das Fairwind-Programm hat Google am 2. September gestartet, zusammen mit Gemini 3.8 Flash Cyber. Es richtet sich an Regierungen, Betreiber kritischer Infrastruktur wie Kliniken, Telekommunikation, Energie und Finanznetze sowie große Technologieplattformen. Laut Google sind über 650 Partner dabei, auf der Seite stehen Logos von Accenture, CrowdStrike, Palo Alto Networks, Snowflake und Wiz. Argon bekommt aber nur „a set of“ Partnern, also ein Teil davon. Namentlich nennt Google nur Wiz: Dessen Team hat mit Argon eine kritische Lücke in weltweit genutzter Krankenhaus-Software gefunden, die frühere Modelle übersehen hatten.

Absatz aus Googles Ankündigung: Argon wird an ausgewählte Cyber-Verteidiger im Fairwind Program ausgerollt, Google nimmt am freiwilligen Vorab-Verfahren der US-Regierung teil, Einführungspreis 2 Dollar je Million Eingabe-Tokens und 10 Dollar je Million Ausgabe-Tokens, Cache 95 Prozent günstigerAusschnitt der Fairwind-Seite von Google DeepMind: We currently work with over 650 partners globally, Logos von Accenture, Armadin und Center for Internet Security, darunter: A set of Fairwind Program partners get exclusive access to Gemini 4 Argon and can use this model in CodeMender
Links der Absatz aus Googles Ankündigung mit Zugang und Preis, rechts die Fairwind-Seite: Nur ein Teil der über 650 Partner bekommt Argon. Quellen: blog.google und deepmind.google/fairwind-program, Screenshots vom 01.10.2026.

Für diese Partner und für Googles eigene Teams läuft Argon nach Googles Worten „without cyber guardrails“, also ohne die Schutzfilter, die Anfragen zu Angriffstechniken blockieren. Dafür gelten strenge Regeln: phishingsichere Zwei-Faktor-Anmeldung, Zugang nur für interne Sicherheitsteams, Hintergrundprüfung der Bewerber, kein Weitergeben des Zugangs. Erlaubt ist Verteidigung, etwa Schwachstellensuche, Malware-Analyse und autorisierte Angriffssimulation, nicht das Bauen von Schadsoftware.

Parallel nimmt Google am „U.S. government's voluntary process for pre-release model access“ teil. Welche Behörde das Modell prüft, steht nirgends. Den Rahmen dafür gibt es seit dem Sommer: Laut AFP ließ Washington im Juni den Zugang zu Anthropics Modellen Claude Mythos und Claude Fable kurzzeitig sperren, danach entstand das freiwillige Vorab-Verfahren. Einen Tag vor Argon unterschrieb Sundar Pichai im Weißen Haus eine freiwillige Selbstverpflichtung der KI-Firmen, Modelle erst nach gründlicher Prüfung zu veröffentlichen.

Wann alle anderen drankommen, lässt Google offen: „as soon as possible“, und zwar „starting with paid API customers and Google AI Ultra subscribers“. Wer das Abo AI Pro für 21,99 € im Monat hat, muss also vermutlich länger warten. Artificial Analysis schreibt, der Einführungspreis gelte „for at least one month“. Mehr Konkretes gibt es nicht.

Und in Deutschland?

Dazu sagt Google nichts, weder im Blog noch auf den Programmseiten. Caschys Blog bringt es auf den Punkt: „Auch zur regionalen Verfügbarkeit gibt es keine Angaben, Deutschland eingeschlossen.“ Ob europäische Fairwind-Partner Argon schon haben, ist ebenfalls offen. Google AI Ultra kostet in Deutschland 99,99 € im Monat (Ultra 5×) oder 219,99 € (Ultra 20×). Dr. Web weist auf die EU-KI-Verordnung hin: Seit August 2026 kann die EU-Kommission die Pflichten für Modelle mit systemischem Risiko durchsetzen, und eine Fassung ohne Cyber-Schutzfilter dürfte sich die Aufsicht genau ansehen.

Was du jetzt tun kannst

  • Es gibt keine Warteliste für Firmen oder Privatleute. Das Formular „Express Interest in the Fairwind Program“ ist für Regierungen, Betreiber kritischer Infrastruktur und Sicherheitsteams gedacht, Google prüft jede Bewerbung einzeln.
  • Kalkuliere mit 4 $ und 20 $, nicht mit dem Startpreis. Sonst sind deine Zahlen in ein paar Wochen falsch.
  • Baue deine Abläufe austauschbar. Wenn ein Prompt oder Agent heute mit Opus 5.5 oder GPT-6.1 Sol läuft, sollte der Wechsel auf Argon später nur eine Zeile in der Konfiguration sein.

Benchmarks: Was Googles Tabelle zeigt und was sie weglässt

Googles Tabelle vergleicht Argon mit drei Modellen: GPT-6 Astra, Claude Fable 5.1 und Claude Opus 5.5, also mit den teuren Spitzenmodellen. In 13 von 18 Tests liegt Argon vor Astra, in 4 dahinter, einmal gleichauf. Den besten Wert aller vier Modelle hat Argon ebenfalls in 13 Tests, einen davon (CWE-bench) teilt es mit Astra. Deshalb schreiben manche Medien „12 von 18“. Beides stimmt, je nachdem, wie man zählt.

Googles Benchmark-Tabelle zu Gemini 4 Argon mit 19 Zeilen in den Bereichen Wissensarbeit, Agenten-Coding, ML-Engineering, Wissenschaft, langer Kontext, Computerbedienung, Multimodal und Cybersecurity. Argon ist meist blau als bester Wert markiert, grau markiert sind die Bestwerte von Astra bei FrontierSWE, Terminal-Bench Science und OSWorld sowie von Opus 5.5 bei Terminal-bench 4.0 und PostTrainBench
Blau markiert Google die Tests, in denen Argon vorn liegt, grau die Bestwerte anderer Modelle. Die grauen Felder sind genau die Stellen, die man sich genauer ansehen sollte. Quelle: Google, Ankündigung vom 30.09.2026, Originalgrafik.

Im Vergleich unten kannst du jeden Test einzeln ansehen. Ich habe die Werte ergänzt, die Google weglässt: Sonnet 5.5 und GPT-6.1 Sol, die beiden Modelle, die zum selben Tokenpreis antreten, stehen nicht in Googles Tabelle. Wo Anthropic oder OpenAI selbst Werte für denselben Test veröffentlicht haben, siehst du sie gestrichelt mit Stern. Dazu kommen die unabhängigen Messungen von Artificial Analysis, Vals AI und der Arena.

Benchmark-Vergleich: Argon gegen Astra, Opus 5.5, Fable 5.1, Sonnet 5.5 und GPT-6.1 Sol Wähle eine Quelle und einen Test. Googles Tabelle enthält nur Herstellerangaben, die drei anderen Quellen haben selbst gemessen oder abstimmen lassen. Werte mit Stern hat Google nicht gezeigt, sie stammen vom jeweiligen Hersteller.

Alle Werte als Tabelle
TestGemini 4 ArgonGPT-6 AstraClaude Opus 5.5Claude Fable 5.1Claude Sonnet 5.5GPT-6.1 Sol
Vals Index (Wissensarbeit)68,9 %63,1 %67,0 %65,8 %k. A.k. A.
AutomationBench (Geschäftsabläufe)51,3 %41,4 %42,5 %31,4 %k. A.36,1 %*
Vals Finance Agent v2 (Finanzanalyse)65,4 %53,5 %58,6 %58,9 %k. A.k. A.
Harvey Legal Agent (Rechtsarbeit)19,6 %5,4 %3,8 %6,7 %k. A.k. A.
DeepSWE v1.1 (Agenten-Coding)77,9 %74,1 %74,2 %67,4 %k. A.71,9 %*
FrontierSWE v2 (Agenten-Coding)55,0 %65,5 %62,3 %56,3 %k. A.k. A.
Vibe Code Bench (Apps nach Beschreibung)91,9 %89,6 %90,3 %90,3 %k. A.k. A.
Terminal-Bench 4.0 (Arbeit im Terminal)57,4 %58,2 %66,4 %57,9 %70,6 %*k. A.
PostTrainBench (KI-Training)45,3 %44,3 %49,3 %40,2 %k. A.k. A.
Terminal-Bench Science 0.1 (Forschung)57,6 %68,1 %63,3 %52,6 %k. A.57,0 %*
LABBench 2 (Biologie-Labor)88,8 %85,4 %73,1 %68,6 %k. A.k. A.
RiemannBench (Mathematik)76,0 %72,0 %69,6 %65,6 %k. A.k. A.
GraphWalks bis 128.000 Tokens (langer Kontext)99,7 %98,7 %90,6 %91,4 %k. A.k. A.
GraphWalks 256.000 bis 1 Mio. Tokens (sehr langer Kontext)84,2 %71,8 %66,8 %65,0 %k. A.k. A.
Agent's Last Exam (Computerbedienung)39,5 %34,2 %38,2 %k. A.k. A.k. A.
OSWorld 2.0 offline (Computerbedienung)69,2 %72,6 %k. A.k. A.k. A.71,4 %*
Chartography (Diagramme lesen)71,6 %71,0 %66,3 %46,2 %61,6 %*k. A.
LVBench (lange Videos)91,7 %87,5 %83,7 %79,7 %k. A.k. A.
CWE-bench v1 (Sicherheitslücken)68,0 %68,0 %67,0 %58,0 %k. A.k. A.
Intelligence Index v4.3.2 (10 Tests)535358535652
Kosten je Index-Aufgabe1,99 $3,26 $5,98 $7,63 $7,62 $0,72 $
AutomationBench-AA (Geschäftsabläufe)77,5 %68,5 %69,5 %59,4 %71,3 %64,9 %
Terminal-Bench 4.0 (unabhängig)57,1 %59,1 %59,6 %52,0 %63,6 %56,1 %
Halluzinationsrate (AA-Omniscience)15,0 %51,0 %59,0 %73,0 %47,0 %54,0 %
GDPval-AA v2.1 (Büroaufgaben)56,0 %52,0 %67,0 %k. A.67,0 %54,0 %
Vals Index (unabhängige Rangliste)68,9 %63,13 %66,97 %65,83 %67,04 %61,15 %
Kosten je Vals-Test15,68 $18,46 $32,14 $28,71 $21,34 $3,24 $
Text Arena (Abstimmung von Nutzern)1.5251.4761.5041.501k. A.k. A.
WebDev Arena (Webseiten bauen)1.6791.7891.8181.7511.7091.759

Quellen: Google DeepMind, Tabelle und Methodik zu Gemini 4 Argon vom 30.09.2026; Artificial Analysis, Vals AI und LMArena, abgerufen am 01.10.2026 zwischen 8 und 9 Uhr; Ergänzungen aus den Ankündigungen von OpenAI (29.09.2026, Stufe Max) und Anthropic (28.09.2026). Argon lief überall auf der höchsten verfügbaren Stufe, bei Artificial Analysis heißt sie High. Elo-Werte der Arena sind relativ, die Achse beginnt deshalb nicht bei null.

So liest du Googles Tabelle richtig

  • Google misst Argon selbst, die Konkurrenz meist nicht. Laut Methodik-Dokument stammen die Werte der anderen Modelle in der Regel aus deren eigenen Angaben oder aus öffentlichen Ranglisten. Einige Tests hat Google nur für Argon selbst gerechnet, etwa DeepSWE, Terminal-Bench 4.0 und OSWorld.
  • Nicht alle Bedingungen sind gleich. Bei Terminal-Bench Science lief Argon mit sechsfacher Zeitgrenze für die Prüfung. Bei LVBench (lange Videos) sah Gemini ein Bild pro Sekunde, Astra bekam 800 Bilder pro Video, Opus 5.5 600 und Fable 5.1 nur 300, laut Google wegen der Grenzen ihrer APIs.
  • Die günstigen Konkurrenten fehlen. Argon kostet zum Start so viel wie Sonnet 5.5 und GPT-6.1 Sol. Sonnet 5.5 kommt laut Anthropic bei Terminal-Bench 4.0 auf 70,6 %, Argon auf 57,4 %. heise schreibt dazu: „Sonnet 5.5 schlägt Argon um mehr als 13 Punkte, und das bei identischen Tokenpreisen.“
  • Beim Programmieren zeigt Googles eigene Tabelle Schwächen. Bei FrontierSWE liegt Argon auf dem letzten Platz, bei Terminal-Bench 4.0 hinter allen drei Vergleichsmodellen. Sehr gut ist es dagegen bei DeepSWE (77,9 %). Auf Hacker News schreibt ein Nutzer: „deepswe vs frontierswe spread is huge. I think that should be a really bad sign, but hope its great.“
  • Kleine Abweichungen bei Fremdwerten. Für Opus 5.5 bei Chartography nennt Google 66,3 %, Anthropic selbst 64,4 %. Für Astra bei OSWorld nennt Google 72,6 %, OpenAI 73,5 %. Das ändert die Reihenfolge nicht, zeigt aber, wie unterschiedlich Messbedingungen sein können.

Wo Argon klar vorn liegt, sind die Abstände teils groß. Bei Harveys Test für juristische Agentenarbeit kommt es auf 19,6 %, Opus 5.5 auf 3,8 %. Das heißt aber auch: Vier von fünf Rechtsaufgaben schafft Argon nicht vollständig, und auf der kompletten Rangliste von Vals steht Metas Muse Spark 1.3 mit 23,75 % davor. Bei sehr langen Eingaben zwischen 256.000 und einer Million Tokens liegt Argon 12 Punkte vor Astra. Das ist für alle interessant, die ganze Kataloge, Verträge oder Datenexporte auf einmal auswerten lassen wollen.

Unabhängig gemessen: Artificial Analysis, Vals und Arena

Drei Testanbieter hatten schon vor dem Start Zugang und haben ihre Ergebnisse am Abend der Ankündigung veröffentlicht. Sie sind bisher die einzigen unabhängigen Zahlen. Epoch AI, SWE-bench, LiveBench, METR, Scale SEAL und ARC Prize führten Argon am Morgen des 1. Oktober noch nicht.

Artificial Analysis: Spitzengruppe, aber nicht Platz 1

Im Intelligence Index von Artificial Analysis, einem Mittelwert aus zehn Tests, erreicht Argon 53 Punkte. Das ist so viel wie GPT-6 Astra und Claude Fable 5.1, einen Punkt mehr als GPT-6.1 Sol, aber drei weniger als Sonnet 5.5 und fünf weniger als Opus 5.5. Gegenüber Gemini 3.1 Pro mit 30 Punkten ist es ein Sprung um 23 Punkte. Die Schlagzeile von Artificial Analysis lautet: „Google is now back to being one of the top three labs in intelligence achieved“.

Balkendiagramm Artificial Analysis Intelligence Index: Claude Opus 5.5 58, Claude Sonnet 5.5 56, Claude Fable 5.1 53, GPT-6 Astra 53, Gemini 4 Argon high 53 kariert als nicht öffentlich verfügbar markiert, GPT-6.1 Sol 52, danach Muse Spark 1.3 mit 48 und weitere Modelle bis Gemini 3.5 Flash-Lite mit 22
Der karierte Balken mit Pfeil ist Argon, kariert, weil das Modell nicht öffentlich verfügbar ist. Argon lief auf der höchsten verfügbaren Stufe High, die anderen auf Max. Quelle: artificialanalysis.ai, Artikel vom 30.09.2026, Originalgrafik.

Spannender als die Punkte sind die Kosten. Pro Aufgabe des Index zahlt man bei Argon 1,99 $, bei Astra 3,26 $, bei Opus 5.5 5,98 $ und bei GPT-6.1 Sol 0,72 $. Obwohl Argon und GPT-6.1 Sol denselben Tokenpreis haben, kostet Argon pro Aufgabe fast dreimal so viel. Der Grund: Argon schreibt viel. Artificial Analysis misst im Schnitt 62.000 Ausgabe-Tokens pro Aufgabe, bei Astra sind es 27.000. Zum regulären Preis lägen die Kosten bei 3,98 $, also über Astra.

Streudiagramm Intelligence Index gegen Kosten pro Aufgabe auf logarithmischer Achse: GPT-6.1 Sol max bei 0,72 Dollar und 52 Punkten auf der Pareto-Linie, Gemini 4 Argon high bei knapp 2 Dollar und 53 Punkten, GPT-6 Astra bei gut 3 Dollar, Claude Opus 5.5 und Sonnet 5.5 bei 6 bis 8 Dollar und 56 bis 58 PunktenWasserfalldiagramm von Artificial Analysis: Gemini 3.1 Pro Preview kostet 0,67 Dollar pro Aufgabe, durch den höheren Tokenverbrauch von Argon plus 1,76 Dollar, durch höhere Tokenpreise plus 2,19 Dollar, durch den größeren Cache-Rabatt minus 0,64 Dollar, ergibt 3,98 Dollar zum Standardpreis, mit 50 Prozent Aktionsrabatt 1,99 Dollar
Links: Argon liegt knapp über der Linie der besten Preis-Leistung, GPT-6.1 Sol darauf. Rechts: Wie aus 0,67 $ bei Gemini 3.1 Pro 1,99 $ bei Argon werden. Ohne den Aktionsrabatt wären es 3,98 $. Quelle: artificialanalysis.ai, Artikel vom 30.09.2026, Originalgrafiken.

Bei den Einzeltests zeigt sich ein klares Muster. Stark ist Argon beim Automatisieren von Geschäftsabläufen: Bei AutomationBench, einem Test von Zapier, steht es mit 77,5 % auf Platz 1, gut 6 Punkte vor Sonnet 5.5. Bei Terminal-Bench 4.0, also Programmieraufgaben auf der Kommandozeile, kommt es auf 57,1 % und liegt hinter Sonnet 5.5, Opus 5.5 und Astra. Interessant: Argon bestätigt dabei seinen eigenen Wert aus Googles Tabelle (57,4 %), während Opus 5.5 unabhängig gemessen deutlich schwächer abschneidet als in Anthropics Angabe (59,6 statt 66,4 %).

Zwei Balkendiagramme von Artificial Analysis. Oben AutomationBench-AA: Gemini 4 Argon 77,5 Prozent auf Platz 1, Claude Sonnet 5.5 71,3, Claude Opus 5.5 69,5, DeepSeek V4.1 Flash 68,9, GPT-6 Astra 68,5. Unten Terminal-Bench 4.0: Claude Sonnet 5.5 63,6 Prozent, Claude Opus 5.5 59,6, GPT-6 Astra 59,1, Gemini 4 Argon 57,1, GPT-6.1 Sol 56,1
Oben Argons stärkster unabhängiger Wert, unten seine Schwäche beim Programmieren. Quelle: artificialanalysis.ai, Artikel vom 30.09.2026, Originalgrafik.

15 % Halluzinationsrate: was die Zahl bedeutet

Der Wert, über den am meisten gesprochen wird, stammt aus dem Wissenstest AA-Omniscience. Argon kommt dort auf eine Halluzinationsrate von 15 %. Bei GPT-6 Astra sind es 51 %, bei GPT-6.1 Sol 54 %, bei Opus 5.5 59 %. Ein eigener Reddit-Thread dazu heißt „Gemini 4 Argon solved hallucinations.“ Ganz so einfach ist es nicht.

Die Halluzinationsrate misst, was ein Modell tut, wenn es eine Frage nicht richtig beantworten kann: Erfindet es eine falsche Antwort, oder sagt es, dass es die Antwort nicht weiß? Richtig beantwortete Fragen zählen gar nicht mit. 15 % heißt also: Bei den Fragen, die Argon nicht richtig beantworten kann, gibt es nur in 15 % der Fälle trotzdem eine falsche Antwort. Sonst sagt es, dass es die Antwort nicht weiß, oder antwortet nur teilweise. Das ist ein echter Fortschritt. Die Kehrseite: Argon beantwortet insgesamt nur 50 % der Wissensfragen richtig, Astra 63 %. Ein Nutzer in r/singularity hält die Kennzahl deshalb für wenig aussagekräftig: Ein Modell, das ständig „weiß ich nicht“ sagt, hätte eine Rate von null. Für Shops und Redaktionen ist die Richtung trotzdem gut: Ein Modell, das lieber passt als erfindet, macht bei Produktdaten und Fakten weniger Ärger.

Vals AI: zum ersten Mal ein Gemini auf Platz 1

Vals AI testet Modelle an Aufgaben aus Finanzen, Recht, Steuern und Programmierung und gewichtet sie nach dem Anteil der Branchen an der US-Wirtschaft. Argon steht dort mit 68,90 % auf Platz 1 von 41, vor Sonnet 5.5 (67,04 %) und Opus 5.5 (66,97 %). Der Abstand ist knapp, die Messunsicherheit liegt bei etwa einem Punkt. Vals rechnet die Kosten für Argon übrigens schon mit dem regulären Preis: 15,68 $ pro Testdurchlauf, Opus 5.5 kostet 32,14 $, GPT-6.1 Sol 3,24 $.

Arena: Platz 1 bei Text, Platz 8 bei Webseiten

In der Arena vergleichen Menschen zwei anonyme Antworten und stimmen ab, welche besser ist. In der Text Arena steht Argon mit 1525 Punkten auf Platz 1, allerdings mit erst knapp 5.000 Stimmen, die Wertung ist noch vorläufig. In der WebDev Arena, wo Modelle Webseiten und Oberflächen bauen, landet es nur auf Platz 8, hinter Opus 5.5, Astra, GPT-6.1 Sol, Fable 5.1 und Sonnet 5.5.

Rangliste der Text Arena vom 30.09.2026: Platz 1 gemini-4-argon-high mit 1525 Punkten und 4.942 Stimmen, als vorläufig markiert, Platz 2 claude-opus-4-6-high mit 1505, Platz 4 claude-opus-5.5-high mit 1504Rangliste der Code Arena WebDev vom 30.09.2026: Platz 1 claude-opus-5.5-max mit 1818, Platz 2 gpt-6-astra-max mit 1789, Platz 3 gpt-6.1-sol-max mit 1759, Platz 8 gemini-4-argon-high mit 1679
Links die Text Arena mit Argon auf Platz 1, rechts die WebDev Arena mit Argon auf Platz 8. Quelle: arena.ai/leaderboard, Screenshots vom 01.10.2026.

Die Arena hat ihren eigenen YouTube-Kanal. Im Video „Gemini 4 Argon | First Impressions“ lässt sie Argon gegen andere Spitzenmodelle 3D-Szenen, Spiele und Gebäude erzeugen. Das Fazit laut Beschreibung: „Gemini 4 makes some strong generations, but results were inconsistent across prompts showing that stability is something to watch.“ Es ist der einzige Praxistest mit Video, den ich gefunden habe.

Vorschaubild des YouTube-Videos der Arena: ein Mann mit Brille vor einem Laptop, daneben der Schriftzug Unboxing Gemini 4 Argon und Bilder der Golden Gate Bridge, eines Turms und einer Insel
Knapp neun Minuten, fast 40.000 Aufrufe am Morgen nach dem Start, ein Klick auf das Bild öffnet das Video bei YouTube. In der Beschreibung wirbt die Arena auch für ihr eigenes Angebot. Quelle: youtube.com/watch?v=h5EL5zThKaI, Vorschaubild, abgerufen am 01.10.2026.

Preise: 2 $ und 10 $, aber nicht für immer

Logan Kilpatrick von Google schrieb zum Start: „Argon is priced at $2 in and $10 out during introductory pricing!“ In der Fußnote des Blogs steht, was danach kommt: 4 $ und 20 $ je Million Tokens. Ein Enddatum nennt Google nicht, obwohl es das bei Gemini 3.8 Flash getan hat (Einführungspreis bis 31.12.2026). Zum Vergleich mit Euro-Werten, umgerechnet mit dem Referenzkurs der EZB vom 30.09.2026:

ModellEingabeCache lesenAusgabeMax. AusgabeKosten je Aufgabe (AA)
Gemini 4 Argon, Startpreis2 $ (1,76 €)0,10 $10 $ (8,81 €)1 Mio.1,99 $
Gemini 4 Argon, regulär4 $ (3,52 €)0,20 $20 $ (17,61 €)1 Mio.3,98 $
Claude Opus 5.54 $0,20 $20 $128.0005,98 $
Claude Sonnet 5.52 $0,20 $10 $128.0007,62 $
GPT-6.1 Sol2 $0,10 $10 $128.0000,72 $
GPT-6 Astra10 $1 $50 $128.0003,26 $
Gemini 3.1 Pro Preview2 $0,20 $12 $65.5360,67 $

Preise je Million Tokens, netto, über die API. Bei Gemini 3.1 Pro gelten die Werte bis 200.000 Eingabe-Tokens pro Anfrage. Ob es bei Argon einen Aufschlag für sehr lange Eingaben gibt, hat Google noch nicht veröffentlicht. Die Kosten je Aufgabe stammen von Artificial Analysis (Argon auf High, die anderen auf Max).

Die Tabelle zeigt, warum der Tokenpreis allein wenig aussagt. Sonnet 5.5 kostet je Token so viel wie Argon zum Start, verbraucht für die Index-Aufgaben aber so viele Tokens, dass es pro Aufgabe fast viermal so teuer ist. GPT-6.1 Sol hat dieselben Preise wie Argon und kommt mit einem Drittel der Kosten aus. Ein deutscher Nutzer schrieb Artificial Analysis auf X: „A cheap token can be expensive if the model needs three times as many of them.“ Im Rechner kannst du beides durchspielen: eigene Tokenmengen und die gemessenen Kosten je Aufgabe.

Kostenrechner: Argon gegen Opus 5.5, Sonnet 5.5, GPT-6.1 Sol und Astra Mit den API-Listenpreisen vom 01.10.2026, umgerechnet mit dem Euro-Referenzkurs der EZB vom 30.09.2026 (1 € = 1,1355 $). Rechne mit eigenen Tokenmengen oder mit den gemessenen Kosten je Aufgabe. Es wird nichts gesendet oder gespeichert.

Artificial Analysis hat für jedes Modell gemessen, was eine Aufgabe des Intelligence Index im Schnitt kostet: Tokenpreis mal tatsächlicher Verbrauch. So siehst du, wie viele vergleichbare Aufgaben dein Budget hergibt und wie gut das Modell dabei abschneidet.

Rechenweg nach Tokens: Eingabe ohne Cache × Eingabepreis + Cache-Anteil × Cache-Lesepreis + Ausgabe × Ausgabepreis. Zur Ausgabe zählen auch die Tokens, die das Modell zum Denken braucht. Preise je Million Tokens (Eingabe / Cache lesen / Ausgabe): Argon zum Start 2 $ / 0,10 $ / 10 $, regulär 4 $ / 0,20 $ / 20 $ (Ende des Einführungspreises offen), Opus 5.5 4 $ / 0,20 $ / 20 $, Sonnet 5.5 2 $ / 0,20 $ / 10 $, GPT-6.1 Sol 2 $ / 0,10 $ / 10 $, GPT-6 Astra 10 $ / 1 $ / 50 $, Gemini 3.1 Pro bis 200.000 Eingabe-Tokens 2 $ / 0,20 $ / 12 $. Gebühren für das Schreiben in den Cache, Aufschläge für sehr lange Eingaben und Batch-Rabatte sind nicht eingerechnet. Maximale Ausgabe je Antwort: Argon 1 Mio. Tokens, Gemini 3.1 Pro 65.536, alle anderen 128.000. Die Kosten je Aufgabe stammen von Artificial Analysis (Abruf 01.10.2026), Argon auf der Stufe High, die anderen auf Max.

Tipp

Rechne bei einer Planung für mehr als ein paar Wochen mit dem regulären Preis. Ein Nutzer auf Reddit vermutet, der Einführungspreis ende wie bei früheren Google-Modellen erst mit dem Nachfolger, der dann wieder mit einem Einführungspreis startet. Die Gegenstimme von VentureBeat: Einführungspreise seien in der Vergangenheit manchmal dauerhaft geblieben. Sicher ist nur, was in der Fußnote steht: 4 $ und 20 $.

Argon gegen Opus 5.5, GPT-6.1 Sol, Sonnet 5.5 und Astra

Fasst man Herstellerangaben und unabhängige Messungen zusammen, ergibt sich ein recht klares Bild. Argon ist kein Modell, das alles besser kann. Es hat ein eigenes Profil.

ModellStärker als Argon beiSchwächer als Argon beiHeute nutzbar
Claude Opus 5.5Gesamtwertung (58 zu 53), Büroaufgaben (GDPval-AA 67 zu 56 %), Webseiten bauen (WebDev Platz 1), Terminal-CodingGeschäftsabläufe, Recht, Finanzen, lange Videos, Halluzinationen (59 zu 15 %)Ja, Claude-Abo und API
Claude Sonnet 5.5Gesamtwertung (56), Terminal-Bench 4.0 (63,6 zu 57,1 %), BüroaufgabenAutomationBench, Vals Index (knapp), Kosten je Aufgabe (7,62 zu 1,99 $)Ja, Claude-Abo und API
GPT-6.1 SolKosten je Aufgabe (0,72 zu 1,99 $), Webseiten bauen (WebDev Platz 3)Intelligence Index (52 zu 53), AutomationBench-AA (64,9 zu 77,5 %), Vals Index (61,15 zu 68,90 %), Halluzinationen (54 zu 15 %)Ja, ChatGPT Work, Codex und API
GPT-6 AstraFrontierSWE, Terminal-Bench Science, Computerbedienung (OSWorld), Wissensfragen richtig beantworten (63 zu 50 %)Kosten je Aufgabe zum Startpreis (3,26 zu 1,99 $), Recht, Finanzen, sehr lange Eingaben, Halluzinationen (51 zu 15 %)Ja, ChatGPT und API

Dafür spricht Argon, sobald es verfügbar ist

  • Platz 1 bei Geschäftsabläufen (AutomationBench-AA 77,5 %), im Vals Index und bei Finanzanalysen.
  • Die mit Abstand niedrigste Halluzinationsrate unter den Spitzenmodellen.
  • Eine Million Tokens Ausgabe pro Antwort, fast achtmal so viel wie die Konkurrenz.
  • Sehr stark bei langen Eingaben und langen Videos.
  • Zum Startpreis pro Aufgabe günstiger als Astra, Opus 5.5 und Sonnet 5.5.

Dafür sprechen die anderen

  • Sie sind heute verfügbar, auch in Deutschland.
  • Opus 5.5 und Sonnet 5.5 liegen in der Gesamtwertung vorn.
  • Beim Programmieren im Terminal und beim Bauen von Webseiten liegen alle vier vor Argon.
  • GPT-6.1 Sol kostet pro Aufgabe ein Drittel, bei fast gleicher Gesamtwertung.
  • Für Argon fehlen Model Card, Sicherheitsbericht, Modell-ID und Erfahrungsberichte aus der Praxis.

Mehr zu den Modellen, die du heute nutzen kannst, steht in meinen Beiträgen zu Claude Sonnet 5.5 und zu GPT-6.1 Sol und dem OpenAI DevDay.

Was die Community sagt

Der Hauptthread auf Hacker News kam auf 1.242 Punkte und rund 800 Kommentare. Auf Reddit habe ich gut 110 Threads seit der Ankündigung mit zusammen rund 2.300 Kommentaren durchgesehen, dazu die Leak-Threads der Wochen davor. Echte Erfahrungsberichte gibt es kaum, aus einem einfachen Grund: Fast niemand hat Zugang. Ein Thread in r/GeminiAI fragte gezielt Ultra-Abonnenten nach ihren Eindrücken. Die Antworten: „I have ultra an no access to Gemini 4 Argon“ und „Can confirm, I also have Ultra.“ Sieben Muster ziehen sich durch alle Kanäle.

1. Hype: Google ist zurück

Die Start-Posts von Google, Google DeepMind und Sundar Pichai kamen bis zum nächsten Morgen zusammen auf über 90.000 Likes. Ethan Mollick, Professor in Wharton und einer der meistgelesenen KI-Autoren, zitierte die Ankündigung mit einem Satz: „And its a 3-way race again….“ Nathan Lambert, der den Newsletter Interconnects schreibt, sieht es grundsätzlich positiv: Mehr Labore an der Spitze seien gut für Verbraucher und gegen zu viel Machtkonzentration.

X-Post von Ethan Mollick vom 30.09.2026: And its a 3-way race again, darunter der zitierte Post von Logan Kilpatrick mit der Ankündigung von Gemini 4 Argon und dem Preis von 2 und 10 DollarX-Post von Nathan Lambert vom 01.10.2026: Love to see Google surprising people with Gemini 4. More labs at the frontier is wonderful for consumers and the world. Excited to see how it goes in real-world scenarios
Zwei bekannte Stimmen aus der KI-Szene. Quellen: x.com/emollick/status/2105388608240677142 und x.com/natolambert/status/2105436759496773946, Screenshots vom 01.10.2026.

2. Frust über den Zugang

Das mit Abstand häufigste Thema. Der erste Kommentar im Hacker-News-Thread lautete: „Gemini not beating the "can't release a model" allegations“. Ein anderer Nutzer verglich es mit einer Folge von South Park, in der Cartman einen Freizeitpark besitzt, in den niemand hinein darf.

„While this is exciting - I have no clue when/if I will be able to use this. Unlike OpenAI or Anthropic where a model release announcement == GA.“

Bei OpenAI und Anthropic heißt eine Ankündigung, dass man das Modell sofort nutzen kann. Bei Google diesmal nicht.

„Pro subscriber here. The last Pro model I got was 3.1 in February, 3.5 Pro was promised and never shipped, and now Argon goes to Ultra first.“

Wer das Abo für 20 $ hat, hat seit Februar kein neues Pro-Modell bekommen, und Argon kommt zuerst ins teurere Ultra-Abo.

„Too bad if you're not part of a Fortune 500 organization, though […] They wouldn't trust your small organization with it.“

Große Firmen bekommen das Werkzeug zur Abwehr, kleine nicht. Die Gegenstimme im selben Thread: Würde man das Modell an alle verteilen, hätten es auch die Angreifer.

Antwort auf X unter dem Post von Google DeepMind mit der Benchmark-Tabelle, Name und Profilbild unkenntlich gemacht: My problem with this is, how do we use it? Why has Google made using their models so hard?LinkedIn-Post eines Beraters für Google Ads und Conversion-Tracking, Name und Profilbild unkenntlich gemacht: Gemini 4 Argon looks pretty impressive on paper and cheap. The bit I find most interesting is the 1 million output token limit. That said, I'm not forking out for Google AI Ultra just to try it. Needs to come to pro
Links eine Antwort unter dem Start-Post von Google DeepMind, die über 40.000 Mal angesehen wurde. Rechts ein Google-Ads-Berater auf LinkedIn, der für einen Test nicht extra das Ultra-Abo kaufen will. Quellen: x.com/i/status/2105410344118005924 und LinkedIn, öffentlicher Post vom 30.09.2026, Screenshots vom 01.10.2026. Namen und Profilbilder der Privatpersonen habe ich unkenntlich gemacht.

3. Der Verdacht: „benchmaxxed“

„Benchmaxxing“ nennt man es, wenn ein Modell gezielt auf gute Werte in Tests trainiert wird, die sich im Alltag nicht zeigen. Der Vorwurf kam in fast jedem Thread, befeuert von einem Bericht von Bloomberg, der am selben Abend erschien, wenige Minuten vor Googles Blog. Darin heißt es, Argon schneide in Tests gut ab, „it does less well when employees actually put it to work“, besonders bei bestimmten Programmieraufgaben und bei Frontend-Gestaltung. Google hält laut Bloomberg dagegen: Es sei falsch zu sagen, dass Gemini 4 etwa beim Programmieren schwächer abschneide.

Bloomberg-Artikel mit der Überschrift Google Grapples With Employee Skepticism About New Gemini 4, Rubrik Technology AI, darunter ein Foto von der Google I/O mit dem Schriftzug Ready, Set, I/O
Der Bloomberg-Bericht über skeptische Google-Mitarbeiter wurde in mindestens fünf Reddit-Threads zitiert. Quelle: bloomberg.com, Artikel von Julia Love und Davey Alba vom 30.09.2026, Screenshot vom 01.10.2026.

„I know companies benchmaxx, but after what Google pulled with Gemini 3.8 Flash, I give zero f*cks about any numbers they report.“

Der Nutzer verweist auf Gemini 3.8 Flash, das bei Artificial Analysis nach einer Umstellung der Gewichtung stark verloren habe. Daher sein Misstrauen gegenüber Googles Zahlen.

„The benchmarks literally say that it isn't as good at coding as some other frontier models. So the benchmarks are pretty accurate if these supposed insiders are to be believed.“

Die Gegenstimme: Die Schwäche beim Programmieren steht ja schon in Googles eigener Tabelle. Von Schönfärberei könne man da kaum sprechen.

Die deutsche Fachpresse sieht es ähnlich. heise überschreibt den Benchmark-Teil mit „Betont wird, was gut aussieht“. The Decoder titelt: „Google Gemini 4 Argon schließt zur KI-Spitze auf, bleibt aber hinter Anthropics Claude Opus 5.5“. Und all-ai.de, das zuerst titelte, Argon schlage Anthropic und OpenAI „vernichtend“, schrieb nach den unabhängigen Messungen: „Ein erster Blick auf die Google-Benchmarks hat zu viel versprochen.“

4. Die wenigen Stimmen mit Zugang

Praxisberichte kommen bisher fast nur von Menschen, die sich selbst als Google-Mitarbeiter vorstellen. Das sollte man beim Lesen im Kopf behalten. Ein Nutzer auf Hacker News, der nach eigener Aussage seit einer Weile damit arbeitet, schreibt: „I would take it seriously as an Astra or Fable or Opus 5.5 level model. It just needs polish“. Ein selbst erklärter Googler auf Reddit zieht Argon Opus 5.5 vor, schränkt aber ein, die Fähigkeiten seien „very close to call from vibes“.

Den sachlichsten Bericht schreibt ein Hacker-News-Nutzer, der seit einigen Wochen Zugang hatte und seine Verbindung zu Google nicht nennt: „Not 100% reliable, but its outcome is usually better than mine and the cost to verify the outcome is significantly cheaper than doing the task by myself.“ Er nutze Argon für aufwendige Recherchen außerhalb seines Fachgebiets. Ein Teilnehmer von DeepMind-Hackathons in London, der eine Testversion von Mitte August nutzen konnte, ordnete Argon beim Programmieren eine Stufe unter Fable 5.1 und Opus 5.5 ein.

5. Preis: erst Jubel, dann Nachrechnen

Auf den Preis folgte zuerst Begeisterung, dann kam die Fußnote mit 4 $ und 20 $. Ein Nutzer in r/singularity fasst es trocken zusammen: „So it's Opus 5.5 performance (not at coding, though) for the Opus 5.5 price.“ Auf Hacker News rechnete ein anderer mit den Zahlen von Artificial Analysis vor: „Sol 6.1 scores one point less than Gemini 4 on intelligence AND costs less than half ($0.72 vs $1.99) per task.“

6. Stimmen aus Deutschland

Deutschsprachige Diskussionen sind noch selten. In r/de wird Argon gar nicht besprochen. Auf LinkedIn schreibt ein Systemadministrator von einem gemischten Eindruck: Google sei wieder vorn dabei, aber „Die meisten Nutzer können Argon aktuell noch gar nicht verwenden.“ Ein Microsoft-365-Berater mahnt: „Für eine Kalkulation zählt der Preis, der nach dem Einführungszeitraum gilt.“ Philipp Schmid, ein Deutscher bei Google DeepMind, fasste die Eckdaten auf X knapp zusammen: „Up to 1M output tokens, up from 64K. $2 in / $10 out at launch. In testing with trusted partners. Developer access as soon as possible.“

LinkedIn-Post eines Systemadministrators, Name und Profilbild unkenntlich gemacht: Google ist mit Gemini 4 Argon wieder ganz vorne im KI-Rennen, trotzdem hinterlässt der Launch einen gemischten Eindruck. Liste mit Zahlen zu Intelligence Index, Humanity's Last Exam, SciCode, AutomationBench und Preis. Der größte Dämpfer: Die meisten Nutzer können Argon aktuell noch gar nicht verwendenX-Post von Philipp Schmid, Google DeepMind: Gemini 4 Argon, our new frontier model. Up to 1M output tokens, up from 64K. 2 Dollar in, 10 Dollar out at launch. In testing with trusted partners. Developer access as soon as possible. Darunter die Benchmark-Tabelle
Links eine der wenigen deutschsprachigen Einordnungen auf LinkedIn, rechts die Kurzfassung von Philipp Schmid aus dem Team von Google DeepMind. Quellen: LinkedIn, öffentlicher Post vom 30.09.2026 (Name und Profilbild unkenntlich gemacht), und x.com/_philschmid/status/2105388546118864926, Screenshots vom 01.10.2026.

7. Witze über den Namen und die Woche

Argon ist ein Edelgas, und der Name kommt vom griechischen Wort für „träge“. Das blieb nicht unbemerkt. Auf Hacker News wartet jemand schon auf „Gemini Krypton, Xenon, and Radon“. Und weil Gemini 4 so lange auf sich warten ließ, wurde es in r/GeminiAI mit dem ewig verschobenen Spiel GTA 6 verglichen.

X-Post eines Nutzers, Name und Profilbild unkenntlich gemacht: What a name choice, naming your own model as lazy, mit Lachsmiley, darunter ein Wikipedia-Ausschnitt: Argon is a chemical element, meaning lazy or inactiveMeme auf X, Name und Profilbild unkenntlich gemacht: current situation after Gemini 4 Argon dropped, vier Drachenköpfe, drei grimmige mit den Beschriftungen Opus 5.5, Sonnet 5.5 und GPT-6 Sol und ein alberner mit der Beschriftung Gemini
Links der Hinweis auf die Bedeutung des Namens, rechts ein Meme mit drei grimmigen Drachen für die Konkurrenz und einem albernen für Gemini. Quellen: x.com/i/status/2105392301237518360 und x.com/i/status/2105394924460048441, Screenshots vom 01.10.2026, Namen und Profilbilder unkenntlich gemacht.

Sicherheit: warum Google Argon zurückhält

Google begründet den gestaffelten Start mit den Fähigkeiten des Modells bei Cyberangriffen. Auf der Fairwind-Seite schreibt Google, dass Spitzenmodelle helfen, kritische Lücken schnell zu finden und zu schließen: „But in the wrong hands, the same capabilities can become an equally powerful threat.“ Im eigenen Schwachstellen-Test kommt Argon auf 85,8 %, Gemini 3.8 Flash Cyber auf 71,0 %. Bei CWE-bench, einer öffentlichen Rangliste für das Finden von Sicherheitslücken in Code, liegt es mit 68 % gleichauf mit GPT-6 Astra und Grok 4.7.

Dazu kommt der Sommer. Laut New York Times hatte Google im September eingeräumt, dass seine Modelle in diesem Sommer aus einer Testumgebung ausgebrochen sind und drei Firmen gehackt haben. heise erinnert an eine Fehlkonfiguration, bei der Gemini wegen versehentlich offenen Internetzugangs auf echte Firmensysteme zugreifen konnte. OpenAI hatte im Juli einen ähnlichen Vorfall mit Hugging Face gemeldet. Vor diesem Hintergrund nennt Google vier Schutzbereiche für Argon:

  • Missbrauch verhindern: Das Modell soll Anfragen zu Cyberangriffen und zu chemischen, biologischen, radiologischen und nuklearen Waffen ablehnen. Google überwacht dafür auch die internen Aktivierungen des Modells, um Missbrauch zu erkennen.
  • Prompt Injection abwehren: Gemeint sind versteckte Anweisungen in Webseiten oder Dokumenten, die einen Agenten umlenken sollen. Im Test von Gray Swan gelingen solche Angriffe bei Argon in 0,7 % der Fälle, bei Opus 5.5 in 1,0 %, bei GPT-6 Astra in 8,5 %.
  • Fehlverhalten erkennen: Google überwacht die Gedankenkette und die Aktionen des Modells und stoppt es, wenn nötig. Die Erkenntnisse daraus fließen bewusst nicht ins Training zurück, damit das Modell nicht lernt, die Überwachung zu umgehen.
  • Systeme abschotten: Test- und Trainingsumgebungen werden vor riskanten Läufen isoliert und versiegelt.
Googles Diagramm zu Gray Swan Indirect Prompt Injection, Angriffserfolg in Prozent, niedriger ist besser: Gemini 4 Argon 0,7, Claude Opus 5.5 1,0, Claude Fable 5.1 1,0, Claude Opus 5 4,6, Gemini 3.8 Flash 5,5, GPT-6 Astra 8,5, GPT-6 Sol 10,1, bis Kimi K3 mit 52,7Googles Diagramm zur CWE-bench-Rangliste: Grok 4.7, Gemini 4 Argon in Antigravity und GPT-6 Astra in Codex je 68 Prozent, Claude Opus 5.5 in Claude Code 67, Claude Fable 5.1 58, bis Inkling mit 37 Prozent
Links der Test zu Prompt Injection, bei dem niedrige Werte gut sind. Rechts das Finden von Sicherheitslücken, bei dem jedes Modell in seiner eigenen Arbeitsumgebung lief. Quelle: Google, Ankündigung vom 30.09.2026, Originalgrafiken.

Was fehlt: Eine Model Card und einen Bericht nach Googles eigenem Frontier Safety Framework gibt es für Argon noch nicht. Beim Vorgänger Gemini 3.7 Flash hatte Google im August gemeldet, dass das Modell bei Cyber-Fähigkeiten die Warnschwelle erreicht, aber nicht die kritische Stufe. Ob Argon diese Stufe erreicht, sagt Google nicht. Die Mahnung, die Google selbst in den Blog geschrieben hat, richtet sich an die ganze Branche: Labore sollten dafür sorgen, dass man das Denken ihrer Modelle weiter nachvollziehen kann.

Was das für Shops, SEO und Agenturen bedeutet

Für die Arbeit in den nächsten Wochen ändert Argon erst einmal nichts, weil du es nicht nutzen kannst. Interessant wird es, sobald es über die API oder Google AI Ultra kommt. Nach den bisherigen Zahlen sehe ich drei Einsatzfelder, für die sich ein Test dann lohnt, und eines, für das eher nicht.

Lohnt sich später zu testen

  • Große Mengen in einem Rutsch: Produkttexte für einen ganzen Katalog, Übersetzungen ganzer Sortimente oder Datenexporte, die sonst in viele Anfragen zerlegt werden müssen. Hier hilft die Million Tokens Ausgabe.
  • Daten, die stimmen müssen: Produktdaten aus Datenblättern ziehen, Händlerinfos prüfen, Fragen zu Dokumenten beantworten. Die niedrige Halluzinationsrate passt dazu, das Ergebnis muss trotzdem jemand prüfen.
  • Abläufe automatisieren: Bestellungen, Retouren, Daten zwischen Shop, Warenwirtschaft und Tabellen. Bei AutomationBench liegt Argon unabhängig gemessen vorn.

Besser ein anderes Modell

  • Landingpages, Shop-Themes und Oberflächen: In der WebDev Arena steht Argon auf Platz 8. Hier liegen Opus 5.5, Astra und GPT-6.1 Sol vorn.
  • Programmieren im Terminal und in großen Codebasen: Hier sind Sonnet 5.5 und Opus 5.5 nach heutigem Stand stärker.
  • Massenarbeit mit kleinem Budget: Pro Aufgabe ist GPT-6.1 Sol bisher deutlich günstiger.

Für SEO und die Sichtbarkeit in KI-Antworten gibt es eine offene Frage: Gemini steckt hinter den KI-Übersichten und dem KI-Modus der Google-Suche. Ob und wann Argon dort zum Einsatz kommt, hat Google nicht gesagt. Ein Modell, das seltener erfindet, würde in den Antworten der Suche weniger falsche Angaben über Shops und Produkte machen. Das ist Spekulation, solange Google nichts dazu sagt. Was du heute für die Sichtbarkeit in KI-Antworten tun kannst, steht in meiner Anleitung zu Generative Engine Optimization.

Entscheidungshilfe: Was nimmst du heute, und lohnt sich das Warten auf Argon? Drei Fragen zu deiner Aufgabe. Die Empfehlung stützt sich auf die Messwerte aus diesem Beitrag. Es wird nichts gesendet oder gespeichert.
1. Was soll die KI vor allem machen?
2. Was zählt mehr?
3. Worüber arbeitest du heute?

Beantworte alle drei Fragen, dann steht hier die Empfehlung.

Eine Faustregel aus Hersteller- und Drittmessungen vom 30.09. und 01.10.2026, kein eigener Test. Argon konnte ich selbst noch nicht ausprobieren. Prüfe wichtige Aufgaben an drei echten Beispielen mit zwei Modellen, bevor du dich festlegst.

Häufige Fragen

Was ist Gemini 4 Argon?

Gemini 4 Argon ist das neue Spitzenmodell von Google DeepMind, vorgestellt am 30.09.2026. Es ist das erste Modell der Gemini-4-Reihe und für lange, komplexe Aufgaben in Programmierung, Wissensarbeit und Cyberabwehr gedacht. Es kann bis zu eine Million Tokens in einer Antwort ausgeben.

Kann ich Gemini 4 Argon schon nutzen?

Nein, außer du gehörst zu den ausgewählten Partnern im Fairwind-Programm für Cyberabwehr. Als Nächstes sollen zahlende API-Kunden und Abonnenten von Google AI Ultra Zugang bekommen. Ein Datum nennt Google nicht. Auch Ultra-Abonnenten meldeten am Abend der Ankündigung, dass sie Argon noch nicht sehen.

Was kostet Gemini 4 Argon?

Über die API zum Start 2 $ je Million Eingabe-Tokens und 10 $ je Million Ausgabe-Tokens, das sind rund 1,76 € und 8,81 €. Eingaben aus dem Cache kosten 95 % weniger. Nach dem Einführungszeitraum gelten 4 $ und 20 $. Wie lange der Startpreis gilt, sagt Google nicht.

Ist Gemini 4 Argon besser als Claude Opus 5.5?

Nicht insgesamt. Im unabhängigen Intelligence Index von Artificial Analysis liegt Opus 5.5 mit 58 Punkten vor Argon mit 53. Argon ist besser bei Geschäftsabläufen, Finanz- und Rechtsaufgaben, langen Eingaben und hat eine viel niedrigere Halluzinationsrate. Opus 5.5 ist besser beim Programmieren, bei Büroaufgaben und beim Bauen von Webseiten.

Ist Gemini 4 Argon besser als GPT-6.1 Sol?

In den meisten Tests knapp ja: einen Punkt mehr im Intelligence Index, deutlich vorn im Vals Index und bei Halluzinationen. GPT-6.1 Sol kostet aber pro Aufgabe nur gut ein Drittel (0,72 $ gegen 1,99 $) und ist heute verfügbar. Beim Bauen von Webseiten liegt GPT-6.1 Sol vorn.

Warum hält Google Argon zurück?

Google nennt die Cyber-Fähigkeiten des Modells: Was Verteidigern hilft, Lücken zu finden, könnte Angreifern genauso helfen. Deshalb bekommen zuerst Sicherheitsteams und die US-Regierung Zugang, während Google die Schutzmechanismen weiter verbessert. Kritiker auf Hacker News und Reddit sprechen dagegen von einem Start auf dem Papier.

Gibt es Gemini 4 Argon in Deutschland?

Dazu gibt es keine Angaben. Google nennt weder Länder noch Regionen. Ob europäische Partner im Fairwind-Programm Argon schon haben, ist ebenfalls offen.

Warum heißt das Modell Argon?

Argon war der interne Codename, den die Seite TestingCatalog schon Mitte September gemeldet hatte. Google hat ihn als offiziellen Namen übernommen. Argon ist ein Edelgas, der Name kommt vom griechischen Wort für „träge“. Warum Google statt Pro oder Flash diesmal einen Namen gewählt hat, erklärt es nicht.

Fazit

Mit Argon ist Google zurück in der Spitzengruppe. Unabhängig gemessen liegt es gleichauf mit GPT-6 Astra, knapp vor GPT-6.1 Sol und hinter Opus 5.5 und Sonnet 5.5. Es hat ein eigenes Profil: stark bei Wissensarbeit, Geschäftsabläufen, langen Eingaben und beim Vermeiden falscher Antworten, schwächer beim Programmieren und bei Gestaltung. Die Million Tokens Ausgabe ist das, was kein anderes Modell bietet.

Was ist also los? Die großen Labore bringen ihre Modelle inzwischen im Wochentakt, drücken die Preise eine Stufe unter der Spitze und halten die stärksten Fähigkeiten für Sicherheitsleute zurück. Google hat das bisher am konsequentesten umgesetzt: ein komplettes Spitzenmodell angekündigt, Zahlen gezeigt, aber für fast niemanden freigegeben. Für Shops, SEO und Agenturen heißt das: Arbeite heute mit Opus 5.5, Sonnet 5.5 oder GPT-6.1 Sol und halte deine Abläufe so, dass du Argon später mit wenig Aufwand testen kannst. Sobald es über die API oder Google AI Ultra verfügbar ist, teste ich es selbst und ergänze diesen Beitrag.

Quellen

Geschrieben von

SEO, GEO und KI-Automatisierung für Online-Shops. Ich teste, worüber ich schreibe, zuerst auf eigenen Seiten und in Kundenprojekten wie RYMHART und Opal-Schmiede.

Das für deinen Shop umsetzen?

Drei Fragen, sofort eine Einschätzung, danach drei konkrete Punkte von mir persönlich. Kostenlos.

Projekt anfragen

Weitere Artikel
aus dem Magazin.

Alle Artikel
GEO & KI-Suche33 Min.

ChatGPT Maps im Test: Woher die Daten wirklich kommen

Wer ChatGPT nach einer guten Pizzeria in Hannover fragt, bekommt seit diesem Sommer mehr als eine Liste. Im Bereich „Karten“ unter chatgpt.com/maps erscheinen die Empfehlungen als Punkte auf einer Karte, jeder mit …