Google schränkt Gemini 4 Argon ein: Cyberfähigkeiten gehen über reine Programmierhilfe hinaus
Google beschränkt Gemini 4 Argon auf Cyberabwehr: Das Modell findet und behebt Schwachstellen autonom, etwa in Krankenhaussoftware.
Illustration mit KI erzeugt
Kontrollierter Zugang zu einem Modell, das Schwachstellen finden und beheben soll
Google hat Gemini 4 Argon am 30. September 2026 vorgestellt. Das Modell ist das erste der Gemini-4-Generation und wurde für komplexe, langwierige Arbeitsabläufe entwickelt.
Cybersicherheit spielt bei der Einführung eine zentrale Rolle. Google zufolge wurde Argon darauf trainiert, kritische Software-Schwachstellen autonom zu finden, zu überprüfen und zu beheben. Zugleich positioniert das Unternehmen das Modell für Softwareentwicklung und Wissensarbeit in Unternehmen, darunter juristische und finanzielle Aufgaben.
Argon ist nicht allgemein verfügbar.
Zunächst erhalten nur ausgewählte Cyberabwehrteams Zugang, die am Fairwind-Programm von Google teilnehmen, sowie interne Google-Teams. Wie The Verge über die Ankündigung berichtet, beteiligt sich Google außerdem am freiwilligen Verfahren der US-Regierung, das den Zugang zu fortschrittlichen Modellen vor ihrer Veröffentlichung regelt.
Google will den Zugang schrittweise ausweiten, dabei Rückmeldungen sammeln und die Schutzmaßnahmen verstärken. Ein Termin für die öffentliche Freigabe steht noch nicht fest.
Nach der Testphase im Bereich Cybersicherheit will Google den Zugang zunächst auf zahlende API-Kunden und Abonnenten von Google AI Ultra ausweiten, so Ars Technica. Dabei handelt es sich um einen geplanten Rollout, nicht um eine bereits laufende kommerzielle Veröffentlichung.
Fairwind startete Anfang September als Programm mit begrenztem Zugang für Regierungen, Google-Cloud-Kunden und Partner aus der Cybersicherheit. SecurityWeek zufolge nahmen zum Start mehr als 650 Partner teil. Zunächst kamen Gemini 3.8 Flash Cyber und CodeMender zum Einsatz, Googles Werkzeug zum Finden, Überprüfen und Beheben von Schwachstellen.
Eine nicht näher bezeichnete Schwachstelle in Krankenhaussoftware zeigt, worum es geht
Das folgenschwerste Sicherheitsergebnis, das Google im Zusammenhang mit Argon bekannt gab, betrifft Software aus dem Gesundheitswesen, die in Krankenhäusern weltweit eingesetzt wird.
Google zufolge entdeckte das Modell eine kritische Schwachstelle, durch die sensible personenbezogene Daten offengelegt wurden. Das Unternehmen stufte das Risiko als schwerwiegend ein und erklärte, dass frühere Frontier-Modelle die Schwachstelle übersehen hatten.
Wiz setzt Argon im Rahmen von Scan for Good ein. Die Initiative identifiziert und behebt Risiken mit hoher Priorität in kritischer öffentlicher Infrastruktur, ohne den betroffenen Organisationen dafür Kosten in Rechnung zu stellen. Google und SecurityWeek bringen den Einsatz von Argon durch Wiz mit dem Fund im Gesundheitswesen in Verbindung.
Die betroffene Software wird in den Berichten jedoch nicht genannt. SecurityWeek zufolge geht aus der Ankündigung auch nicht hervor, ob die Schwachstelle bereits behoben wurde.
Die vorliegenden Berichte ordnen der Schwachstelle keine CVE-Kennung zu und enthalten keine technischen Indikatoren. Das ist eine Einschränkung des veröffentlichten Materials und kein Beleg dafür, dass es andernorts keine CVE-Kennung oder Indikatoren gibt.
Krankenhausbetreiber können allein anhand dieser Offenlegung daher nicht feststellen, ob ihre Systeme betroffen sind. Für gezielte Patches oder eine Bewertung möglicher Risiken bräuchten sie mindestens den Produktnamen, betroffene Versionen, eine Sicherheitsmeldung des Herstellers oder andere technische Angaben.
Der Fall zeigt dennoch, welchen Arbeitsablauf Google automatisieren will. Argon soll von der Erkennung eines verdächtigen Zustands über die Überprüfung seiner Auswirkungen auf die Sicherheit bis hin zur Entwicklung einer Lösung gehen – statt bei der Codeanalyse oder Vorschlägen zur Behebung stehen zu bleiben.
Eine einzelne, nicht offengelegte Schwachstelle belegt nicht, wie zuverlässig das Modell mit unbekannten Systemen zurechtkommt. Sie macht jedoch deutlich, warum der Zugang zu autonomer Schwachstellenforschung anders gehandhabt wird als die Einführung eines gewöhnlichen Chatbots.
Sicherheitsbenchmarks zeigen Fortschritte – und erhebliche Einschränkungen
Google verglich Argon in internen Tests mit Gemini 3.8 Flash Cyber. Beim unternehmenseigenen Schwachstellen-Benchmark soll Argon ein breites Spektrum an Sicherheitslücken in komplexen Codebasen mit insgesamt 20 Programmiersprachen erkannt haben.
Auch Wiz bewertete die Modelle anhand eines internen Black-Box-Penetrationstests. Dabei wurden laufende Websysteme untersucht, ohne Zugriff auf den Quellcode zu gewähren.
Argon soll Gemini 3.8 Flash Cyber bei der Erkundung der Angriffsfläche, der Erkennung von Schwachstellen und der Erstellung von Proof-of-Concept-Nachweisen übertroffen haben. Gerade Letzteres ist heikel: Verteidiger können Proof-of-Concept-Material nutzen, um den Schweregrad einer Schwachstelle zu überprüfen. Vergleichbare Fähigkeiten könnten aber auch den Aufwand verringern, der nötig ist, um eine Schwachstelle praktisch auszunutzen.
Beim CWE-bench v1, einem von Collinear AI entwickelten Benchmark zur Behebung von Schwachstellen, erzielte Argon 68 Prozent. Laut SecurityWeek lag es damit gleichauf mit OpenAI GPT-6 Astra und xAI Grok 4.7 an der Spitze. Auch MarkTechPost berichtet von einem Ergebnis von 68 Prozent, nennt in seiner Vergleichstabelle jedoch nur GPT-6 Astra als gleichauf liegendes Modell.
Die Angaben unterscheiden sich hinsichtlich der genannten Konkurrenzmodelle, nicht aber hinsichtlich des für Argon gemeldeten Ergebnisses. MarkTechPost weist zudem darauf hin, dass die Konkurrenzmodelle in ihren eigenen Agenten-Frameworks getestet wurden. Die Ergebnisse könnten daher neben den Fähigkeiten der Modelle auch Unterschiede bei der Orchestrierung und den eingesetzten Werkzeugen widerspiegeln.
Bei den breiter angelegten Tests zur Softwareentwicklung fielen die Ergebnisse gemischt aus. Argon erreichte Berichten zufolge 77,9 Prozent bei DeepSWE v1.1, gegenüber 74,2 Prozent für Claude Opus 5.5, 74,1 Prozent für GPT-6 Astra und 67,4 Prozent für Claude Fable 5.1. Bei AutomationBench kam es auf 51,3 Prozent und lag damit vor Claude Opus 5.5 mit 42,5 Prozent.
Nicht bei allen Tests lag Argon vorn. Bei FrontierSWE v2 erzielte es 55,0 Prozent und blieb damit hinter GPT-6 Astra mit 65,5 Prozent, Claude Opus 5.5 mit 62,3 Prozent und Claude Fable 5.1 mit 56,3 Prozent. Auch bei Terminal-Bench 4.0 lag Argon mit 57,4 Prozent hinter allen drei Vergleichsmodellen.
Die Zahlen stammen laut MarkTechPost aus dem von Google veröffentlichten Vergleich. Das zitierte Material enthält keine unabhängige Überprüfung dieser Benchmark-Angaben.
Antwortlimit von einer Million Tokens erweitert Einsatzmöglichkeiten für Agenten
Argon kann Berichten zufolge bis zu eine Million Tokens in einer einzigen Antwort ausgeben. Bei früheren Gemini-Modellen lag das Limit bei 64.000 Tokens.
Google zufolge können sich mit dem höheren Limit anspruchsvollere Aufgaben in einem Schritt erledigen lassen. Entwickler könnten dadurch einige umfangreiche Arbeitsabläufe für Refactoring, Analyse oder Berichterstellung ausführen, ohne die Ausgabe auf so viele einzelne Interaktionen aufteilen zu müssen. Das ist eine praktische Schlussfolgerung, keine von Google konkret genannte Begründung.
Die Größe des Eingabekontexts wurde nicht bekannt gegeben. Eingabekontext und Ausgabekapazität sind voneinander unabhängige Grenzen. Aus der Möglichkeit, eine Million Tokens auszugeben, lässt sich daher nicht ableiten, wie viel Quellcode, Telemetriedaten oder Dokumentation Argon auf einmal untersuchen kann.
Google zufolge setzt das Unternehmen Argon bereits intern für umfangreiche Entwicklungsaufgaben ein. Bei einem Projekt wurden Flottentelemetriedaten genutzt, um in Googles Rechenzentren rund 300 TiB Arbeitsspeicher einzusparen. MarkTechPost berichtet von mehr als 300 TiB freigegebenem Speicher und nennt eine Prognose von 500 TiB bis 1 PiB. Diese Prognose findet sich jedoch nur in diesem Bericht.
Argon-Agenten helfen außerdem dabei, C- und C++-Codebasen nach Rust zu migrieren. Die gemeldeten Arbeiten umfassen Tausende Zeilen Code in den Bibliotheken re2 und libgav1 sowie mehr als 800.000 Zeilen im Zircon-Kernel des Fuchsia OS.
Bei der Portierung von libgav1 sollen die Agenten 32.000 Zeilen SIMD-Code ersetzt haben. Der daraus entstandene Decoder soll bei identischer Ausgabe 2,7-mal schneller laufen. Dabei handelt es sich um interne Ergebnisse, über die berichtet wurde, nicht um unabhängig reproduzierte Messungen.
Nutzung ohne Schutzmechanismen nur für geprüfte Teilnehmer
Vertrauenswürdige Fairwind-Teams aus der Cyberabwehr und interne Google-Teams können Argon laut MarkTechPost und SecurityWeek ohne Cyber-Schutzmechanismen nutzen.
Diese Regelung gilt für die begrenzte Testgruppe. Sie beschreibt nicht die Konfiguration, die Google nach eigenen Angaben für eine breitere Veröffentlichung vorbereitet.
Bei einer größeren Verfügbarkeit soll Argon laut Google Anfragen ablehnen, die Cyberangriffe oder Angriffe mit chemischen, biologischen, radiologischen oder nuklearen Mitteln ermöglichen könnten. Zugleich soll das Modell weiterhin legitime wissenschaftliche Forschung mit doppeltem Verwendungszweck unterstützen.
Zu den weiteren gemeldeten Maßnahmen zählen die Überwachung interner Modellaktivierungen auf möglichen Missbrauch und eine verbesserte Widerstandsfähigkeit gegen indirekte Prompt-Injection-Angriffe. Google will außerdem die Gedankengänge und Aktionen von Argon auf Fehlanpassungen überwachen und die Ausführung bei Bedarf stoppen können.
Das Unternehmen gibt zudem an, Sandbox-Umgebungen vor Beginn von Trainings oder Tests mit hohem Risiko abzuschotten und abzusichern. Aus den Berichten geht nicht hervor, ob oder wie diese Maßnahmen in anderen Einsatzszenarien Werkzeuge, Netzwerkverbindungen, Zugangsdaten oder Aktionen betreffen.
Organisationen, die ähnlich leistungsfähige Agenten evaluieren, sollten Beschränkungen für den Einsatz von Werkzeugen, den Netzwerkzugriff, den Umgang mit Zugangsdaten, die Protokollierung und ausführbare Aktionen gesondert festlegen. Dabei handelt es sich um Empfehlungen für eine sichere Bereitstellung, nicht um Maßnahmen, die den zitierten Berichten zufolge für Argon bestätigt wurden.
Bei Googles Schutzmaßnahmen handelt es sich um gemeldete Design- und Einsatzvorkehrungen. Die vorliegenden Quellen enthalten keine unabhängigen Tests, die deren Wirksamkeit gegen böswillige Nutzer, kompromittierte externe Inhalte oder andere Angriffe belegen.
Preise veröffentlicht, Angaben zur Bereitstellung noch unvollständig
Der gemeldete Einführungspreis für die API beträgt 2 US-Dollar pro Million Eingabetokens und 10 US-Dollar pro Million Ausgabetokens. Für zwischengespeicherte Eingaben gilt ein Rabatt von 95 Prozent; damit sinkt der Einführungspreis auf 0,10 US-Dollar pro Million Tokens.
Nach der Einführungsphase sollen die Preise laut MarkTechPost auf 4 US-Dollar pro Million Eingabetokens und 20 US-Dollar pro Million Ausgabetokens steigen. Ein Enddatum für die Einführungspreise wurde nicht genannt.
Für Verteidiger außerhalb von Fairwind gibt es noch keine Argon-Instanz, die sie konfigurieren könnten. Auch bei der Offenlegung der Schwachstelle im Gesundheitswesen fehlen Produkt- und Versionsangaben, die für gezielte Maßnahmen oder die Suche nach Bedrohungsspuren nötig wären.
Im Mittelpunkt stehen daher zunächst Fragen zum Zugang und zur betrieblichen Steuerung: Wer wird zugelassen? Welche Werkzeuge darf das Modell aufrufen? Wie werden autonome Aktionen überprüft? Und wie wird die Erstellung von Proof-of-Concepts kontrolliert?
Die beschränkte Einführung von Argon spiegelt das Dual-Use-Problem wider, das bei fortschrittlichen Cybermodellen im Mittelpunkt steht. Dasselbe System, das die Suche nach Schwachstellen und die Entwicklung von Patches beschleunigen kann, könnte auch deren Überprüfung und Ausnutzung erleichtern. Googles schrittweise Freigabe wird sich nicht nur an Benchmark-Ergebnissen messen lassen, sondern auch daran, ob die Schutzmaßnahmen wirksam bleiben, wenn der Zugang über eine geprüfte Gruppe hinaus ausgeweitet wird.
Quellen
Dieser Artikel ist eine eigenständige Aufbereitung auf Basis der folgenden Quellen.




