Gemini 4 Argon: Googles neues KI-Modell startet mit internen Zweifeln an der Programmierleistung
Das neue Modell geht zunächst ohne Schutzmechanismen an ausgewählte IT-Sicherheitsexperten. Intern gibt es offenbar Skepsis an der Programmierleistung.

Mit GeminiEntdecken Sie die KI-Power von Google. 4 Argon bringt Google ein neues KI-Spitzenmodell auf den Markt, das komplexe Aufgaben in der Softwareentwicklung, im Finanzwesen und in der Cybersicherheit übernehmen soll (Quelle: Google). Der Konzern verwehrt der breiten Öffentlichkeit vorerst den Zugang. Zunächst erhalten ausgewählte Sicherheitsexperten und Regierungsorganisationen über das sogenannte Fairwind-Programm eine spezielle Version des Sprachmodells. Diese Variante verzichtet auf eingebaute Schutzmechanismen, damit Verteidiger die vollständigen Fähigkeiten zur Abwehr von Cyberangriffen testen können (Quelle: CNBC). Zahlende API-Kunden sollen später folgen.
Hersteller-Benchmarks für Gemini 4 Argon wecken Zweifel
Google bewirbt das Modell mit neuen Bestwerten. Bei der Behebung von Sicherheitslücken erreiche die KI im Test CWE-bench v1 laut Hersteller 68 Prozent und teile sich damit den ersten Platz. Für umfangreiche Programmieraufgaben im Benchmark?Ein standardisierter Test, der die Leistungsfähigkeit von Hard- oder Software vergleichbar macht. DeepSWE v1.1 meldet der Konzern eine Erfolgsquote von 77,9 Prozent.
Doch diese Laborwerte bestätigen sich im Alltag offenbar nicht.
Innerhalb des Unternehmens zweifeln Beschäftigte daran, wie gut das Modell in Schlüsselbereichen wie der Programmierung tatsächlich abschneidet (Quelle: Bloomberg). Unabhängige Bestätigungen für die Leistungsfähigkeit in betrieblichen Umgebungen fehlen bislang. Ähnlich wie bei Testläufen autonomer KI-Agenten müssen die Hersteller erst beweisen, dass die Systeme außerhalb isolierter Testumgebungen fehlerfrei funktionieren.
Der Tokenpreis verdoppelt sich nach der Startphase
Wer das Modell später über die Programmierschnittstelle nutzt, erhält zunächst Rabatte. Der Einführungspreis liegt bei 2 US-Dollar pro Million eingegebener Tokens und 10 US-Dollar pro Million ausgegebener Tokens. Gecachte Eingaben, also wiederverwendete Datenblöcke, kosten 95 Prozent weniger als der reguläre Listenpreis. Nach der Einführungsphase steigen die Kosten auf 4 beziehungsweise 20 US-Dollar. Konkurrenzmodelle wie Anthropics Claude setzen in diesem Umfeld bereits auf geringeren Ressourcenverbrauch, um die Betriebskosten für Firmenkunden zu senken.
Für Unternehmen zählt die Verfügbarkeit im Alltag mehr als ein Spitzenplatz in Rankings. Google präsentiert sein neues Modell zwar als großen Fortschritt für die Cybersicherheit und die Wissensarbeit, liefert die Technologie vorerst aber nur an einen kleinen Kreis aus. Solange die Entwickler keine unabhängigen Testergebnisse für geschäftskritische Anwendungen vorlegen und den breiten Zugang schuldig bleiben, nützt der günstigere Tokenpreis wenig. Die internen Zweifel an der Programmierleistung zeigen, dass auch bei Google weiterhin eine Kluft zwischen Laborwert und Praxistauglichkeit besteht.
Häufige Fragen
Wer kann Gemini 4 Argon derzeit nutzen?
Google gibt Gemini 4 Argon zunächst ausgewählten Sicherheitsexperten und Regierungsorganisationen im Fairwind-Programm. Die breite Öffentlichkeit erhält keinen direkten Zugang. Später sollen zahlende API-Kunden folgen. Google nennt dafür bislang keinen festen Termin. Ein normales Chatbot-Angebot für private Nutzer ist derzeit nicht angekündigt.
Warum verzichtet die Fairwind-Version auf Schutzmechanismen?
Die spezielle Version soll Sicherheitsexperten erlauben, die Fähigkeiten des Modells bei Cyberangriffen und deren Abwehr vollständig zu prüfen. Dafür entfernt Google eingebaute Schutzmechanismen. Das erhöht jedoch das Risiko eines Missbrauchs. Der eingeschränkte Zugang soll den Kreis der Personen begrenzen, die das Modell unter diesen Bedingungen testen können.
Wie zuverlässig sind die von Google genannten Benchmark-Ergebnisse?
Google meldet 68 Prozent im Test CWE-bench v1 und 77,9 Prozent im Benchmark DeepSWE v1.1. Unabhängige Bestätigungen für den Einsatz in betrieblichen Umgebungen fehlen bislang. Auch innerhalb des Konzerns gibt es laut Bloomberg Zweifel an der Leistung bei wichtigen Programmieraufgaben. Laborwerte reichen daher nicht als Beleg für fehlerfreie Arbeit aus.
Was soll die Nutzung von Gemini 4 Argon über die API kosten?
Zum Start verlangt Google 2 US-Dollar je Million eingegebener Tokens und 10 US-Dollar je Million ausgegebener Tokens. Diese Preise gelten zunächst mit Rabatt. Nach der Einführungsphase sollen sich die Tokenpreise verdoppeln. Der tatsächliche Rechnungsbetrag hängt deshalb vom Umfang der Ein- und Ausgaben ab.
Wann können Unternehmen Gemini 4 Argon über die API einsetzen?
Zahlende API-Kunden sollen nach der begrenzten Testphase Zugang erhalten. Google hat dafür jedoch kein konkretes Datum veröffentlicht. Unternehmen können deshalb derzeit weder einen verlässlichen Starttermin noch die endgültigen Kosten einplanen. Vor einem produktiven Einsatz müssen sie zudem prüfen, ob die Benchmark-Werte ihre eigenen Programmier- und Sicherheitsaufgaben abbilden.
Eignet sich Gemini 4 Argon schon für produktive Sicherheitsaufgaben?
Dafür fehlen bislang belastbare Nachweise aus dem Alltag. Google zielt zwar auf komplexe Aufgaben in der Cybersicherheit und Softwareentwicklung, doch unabhängige Tests in betrieblichen Umgebungen liegen nicht vor. Organisationen sollten das Modell deshalb zunächst kontrolliert prüfen und Ergebnisse durch Fachleute verifizieren lassen. Ein allgemeiner Ersatz für Sicherheits- oder Entwicklungsteams ist nicht belegt.
Weiterlesen
Mehr aus Tools & Modelle →
Claude Sonnet 5.5: Neues KI-Modell rechnet schneller und drückt die Betriebskosten
Anthropic veröffentlicht mit Claude Sonnet 5.5 eine neue Version seines Mittelklassemodells. Es löst Aufgaben schneller als der Vorgänger und senkt die Kosten der Textverarbeitung deutlich.

KI-Mathematikbeweise: Warum ungelöste Jahrtausendrätsel als Benchmark für KI-Modelle versagen
KI-Anbieter nutzen ungelöste Probleme der Wissenschaft als ultimativen Leistungstest für ihre Modelle. Nach Plagiatsvorwürfen zieht OpenAI nun externe Prüfer für seine Resultate heran.

Microsoft Copilot Super-App: Chat, Code und Agenten rücken in einer Oberfläche zusammen
Die neue Microsoft Copilot Super-App vereint bisher isolierte KI-Funktionen auf einer Oberfläche. Nutzer steuern Chat, Programmierung und autonome Agenten künftig über einen zentralen Einstieg.

Vocci: Ein Titanring transkribiert Besprechungen, zur Datenhaltung schweigt der Hersteller
Vocci verkauft für 249 US-Dollar einen Titanring, der Besprechungen aufzeichnet und automatisch transkribiert. TechCrunch beschreibt das Gerät seit dem 20. September 2026 und nennt offene Datenschutzfragen.

ChatGPT Astra ist OpenAIs erstes „kritisches“ Modell
OpenAI hat am 2. September 2026 bestätigt, das Modell Astra erreiche die interne Stufe „Critical“ für Cybersicherheits-Fähigkeiten. Den Zugang erhalten zunächst nur ausgewählte Tester, ein Launch-Datum nennt das Unternehmen nicht.

Claude Wasserzeichen entfernen: Der Ein-Klick-Trick löscht das Falsche
Anthropic bettet in Claude-Texte ein statistisches Wasserzeichen ein, das in der Wortwahl selbst liegt. Die beworbenen Ein-Klick-Remover kommen daran nicht heran – mit Folgen für jeden Unternehmenseinsatz.