Google restreint l’accès à Gemini 4 Argon, dont les capacités cyber dépassent désormais l’assistance au code

Google dévoile Gemini 4 Argon, IA capable de détecter et corriger des failles critiques, dont l’accès reste limité aux experts cyber.

Google restreint l’accès à Gemini 4 Argon, dont les capacités cyber dépassent désormais l’assistance au code
IA

Image d’illustration générée par IA

Un accès contrôlé pour un modèle conçu pour détecter et corriger les failles

Google a annoncé Gemini 4 Argon le 30 septembre 2026, le présentant comme le premier modèle de la génération Gemini 4 et comme un système conçu pour exécuter des tâches complexes sur de longues durées.

La cybersécurité est au cœur de cette annonce. Google affirme qu’Argon a été entraîné à détecter, valider et corriger de façon autonome des vulnérabilités critiques dans des logiciels. L’entreprise positionne également le modèle pour le développement logiciel et les tâches de gestion des connaissances en entreprise, notamment dans les domaines juridique et financier.

Argon n’est pas accessible au grand public.

Dans un premier temps, son accès est réservé à certains acteurs de la défense cyber participant au programme Fairwind de Google, ainsi qu’aux équipes internes de l’entreprise. Selon l’article de The Verge sur l’annonce, Google participe également au processus volontaire du gouvernement américain visant à permettre l’accès à des modèles avancés avant leur lancement.

L’entreprise prévoit d’élargir progressivement l’accès, tout en recueillant des retours et en renforçant les mesures de protection. Aucune date de mise à disposition publique n’a été annoncée.

Après la phase de tests en cybersécurité, Google compte commencer à élargir l’accès aux clients payants de son API et aux abonnés Google AI Ultra, selon Ars Technica. Il s’agit toutefois d’un déploiement prévu, et non d’une commercialisation déjà en cours.

Lancé début septembre, Fairwind est un programme à accès limité destiné aux gouvernements, aux clients de Google Cloud et aux partenaires spécialisés en cybersécurité. SecurityWeek indique qu’il comptait plus de 650 partenaires participants lors de son lancement et qu’il associait initialement Gemini 3.8 Flash Cyber à CodeMender, l’outil de Google conçu pour détecter, vérifier et corriger les vulnérabilités.

Une faille non divulguée dans un logiciel hospitalier illustre les enjeux

Le résultat de sécurité le plus important communiqué avec Argon concerne un logiciel de santé utilisé par des hôpitaux du monde entier.

Google indique que le modèle a détecté une vulnérabilité critique exposant des données personnelles sensibles. L’entreprise qualifie le risque de grave et affirme que les modèles de pointe précédents n’avaient pas repéré la faille.

Wiz utilise Argon dans le cadre de Scan for Good, une initiative qui repère et corrige les expositions à haut risque touchant des infrastructures publiques critiques, sans facturer les organisations concernées. Google et SecurityWeek associent l’utilisation d’Argon par Wiz à cette découverte dans le secteur de la santé.

Le logiciel concerné n’est toutefois pas nommé dans les articles. SecurityWeek précise également que l’annonce n’indique pas si la vulnérabilité a été corrigée.

Les articles fournis ne rattachent pas la faille à un identifiant CVE et ne donnent aucun indicateur technique. Il s’agit d’une limite des informations publiées, et non d’une preuve qu’aucun CVE ni indicateur n’existe par ailleurs.

Les exploitants d’hôpitaux ne peuvent donc pas déterminer, à partir de cette seule divulgation, si leurs systèmes sont concernés. Pour lancer des opérations ciblées de mise à jour ou évaluer leur exposition, ils auraient besoin au minimum du nom du produit, des versions touchées, d’un avis de sécurité du fournisseur ou d’autres informations techniques.

Le cas illustre néanmoins le processus que Google cherche à automatiser. Argon doit pouvoir passer de la détection d’un comportement suspect à la validation de son impact sur la sécurité, puis à la production d’un correctif, plutôt que de s’arrêter à l’analyse du code ou à des recommandations de remédiation.

La découverte d’une seule vulnérabilité non divulguée ne permet pas de déterminer avec quelle régularité le modèle fonctionne sur des systèmes inconnus. Elle montre toutefois pourquoi l’accès à des capacités autonomes de recherche de vulnérabilités est traité différemment du lancement d’un chatbot classique.

Les tests de sécurité témoignent de progrès, mais comportent d’importantes réserves

Google a comparé Argon à Gemini 3.8 Flash Cyber dans le cadre d’évaluations internes. Selon l’entreprise, le modèle a détecté un large éventail de vulnérabilités lors de son benchmark consacré aux failles, sur des bases de code complexes couvrant 20 langages de programmation.

Wiz a également évalué les modèles à l’aide d’un benchmark interne de tests d’intrusion en boîte noire. Cette évaluation portait sur des systèmes web en production, sans accès au code source.

Argon aurait surpassé Gemini 3.8 Flash Cyber pour la découverte de la surface d’attaque, l’identification des vulnérabilités et la production de preuves de concept. Cette dernière capacité est particulièrement sensible : les défenseurs peuvent s’appuyer sur des preuves de concept pour confirmer la gravité d’une faille, mais une fonctionnalité comparable pourrait aussi réduire les efforts nécessaires pour l’exploiter concrètement.

Sur CWE-bench v1, un benchmark de correction de vulnérabilités développé par Collinear AI, Argon a obtenu un score de 68 %. SecurityWeek rapporte qu’il est arrivé ex æquo en tête avec OpenAI GPT-6 Astra et xAI Grok 4.7. MarkTechPost indique également un score de 68 %, mais son tableau comparatif ne cite que GPT-6 Astra comme co-leader.

La divergence porte sur les concurrents mentionnés, et non sur le score attribué à Argon. MarkTechPost précise également que les modèles concurrents fonctionnaient avec leur propre agent, de sorte que les résultats peuvent refléter des différences d’orchestration et d’outillage, autant que les capacités des modèles.

Les résultats en ingénierie logicielle sont plus contrastés. Argon aurait obtenu 77,9 % sur DeepSWE v1.1, contre 74,2 % pour Claude Opus 5.5, 74,1 % pour GPT-6 Astra et 67,4 % pour Claude Fable 5.1. Sur AutomationBench, il a atteint 51,3 %, devant Claude Opus 5.5, à 42,5 %.

Argon n’est pas arrivé en tête de tous les tests. Son score de 55,0 % sur FrontierSWE v2 est inférieur à ceux de GPT-6 Astra (65,5 %), Claude Opus 5.5 (62,3 %) et Claude Fable 5.1 (56,3 %). Sur Terminal-Bench 4.0, son score de 57,4 % est également inférieur à celui des trois modèles comparés.

Ces chiffres sont présentés par MarkTechPost comme provenant du comparatif publié par Google. Les documents cités ne fournissent aucune validation indépendante de ces résultats.

Une limite d’un million de jetons par réponse élargit les possibilités des agents

Argon pourrait générer jusqu’à un million de jetons dans une seule réponse, contre 64 000 pour les modèles Gemini précédents.

Google estime que cette limite accrue permet aux utilisateurs de mener à bien des tâches plus exigeantes en une seule étape. Concrètement, les développeurs pourraient exécuter certains projets de refactorisation, d’analyse ou de production de rapports de grande ampleur sans répartir le résultat sur autant d’échanges. Il s’agit d’une déduction sur les conséquences opérationnelles, et non d’une explication expressément donnée par Google.

La taille de la fenêtre de contexte en entrée n’a pas été communiquée. Le contexte d’entrée et la capacité de sortie sont deux limites distinctes : le plafond d’un million de jetons en sortie ne permet donc pas de savoir quelle quantité de code source, de télémétrie ou de documentation Argon peut examiner en une seule fois.

Google indique déjà utiliser Argon pour des projets d’ingénierie internes de grande ampleur. L’un d’eux s’est appuyé sur la télémétrie de l’ensemble de son parc informatique pour économiser environ 300 TiB de mémoire dans ses centres de données. MarkTechPost rapporte que plus de 300 TiB ont été libérés et avance une projection comprise entre 500 TiB et 1 PiB, qui ne figure toutefois que dans son article.

Les agents Argon servent également à migrer des bases de code C et C++ vers Rust. Les travaux rapportés portent notamment sur des milliers de lignes dans les bibliothèques re2 et libgav1, ainsi que sur plus de 800 000 lignes du noyau Zircon de Fuchsia OS.

Pour le portage de libgav1, les agents auraient remplacé 32 000 lignes de code SIMD. Le décodeur obtenu serait 2,7 fois plus rapide tout en produisant une sortie identique. Il s’agit de résultats internes rapportés, qui n’ont pas été reproduits de manière indépendante.

L’utilisation sans garde-fous est réservée aux participants agréés

Selon MarkTechPost et SecurityWeek, les défenseurs agréés de Fairwind et les équipes internes de Google ont accès à Argon sans garde-fous cyber.

Cette configuration concerne le groupe de test restreint. Elle ne correspond pas à celle que Google prévoit pour une distribution plus large.

Pour un déploiement élargi, Google affirme qu’Argon refusera les requêtes susceptibles de faciliter des cyberattaques ou des attaques chimiques, biologiques, radiologiques ou nucléaires. L’entreprise affirme également que le modèle continuera à prendre en charge la recherche scientifique légitime à double usage.

Parmi les autres mesures rapportées figurent la surveillance des activations internes pour repérer d’éventuels usages malveillants et l’amélioration de la résistance aux injections indirectes de prompt. Google indique aussi qu’il surveillera la chaîne de raisonnement et les actions d’Argon afin de détecter tout désalignement, et pourra interrompre son exécution si nécessaire.

L’entreprise affirme en outre isoler et sécuriser les environnements sandbox avant le début des entraînements ou des évaluations à haut risque. Les articles ne précisent pas si, ni comment, ces mesures encadrent les outils, la connectivité réseau, les identifiants ou les actions lors d’autres déploiements.

Les organisations qui évaluent des agents aux capacités similaires devraient définir séparément des restrictions concernant l’utilisation des outils, l’accès au réseau, la gestion des identifiants, la journalisation et les actions exécutables. Il s’agit de recommandations pour un déploiement défensif, et non de contrôles confirmés pour Argon dans les articles cités.

Les mesures de protection de Google restent des dispositifs de conception et de déploiement tels qu’ils sont décrits par l’entreprise. Les sources fournies ne contiennent aucun test indépendant démontrant leur efficacité face à des utilisateurs malveillants, à du contenu externe compromis ou à d’autres scénarios adverses.

Les tarifs sont publiés, mais les modalités de déploiement restent floues

Les tarifs de lancement de l’API seraient de 2 $ par million de jetons en entrée et de 10 $ par million de jetons en sortie. Le tarif des jetons d’entrée mis en cache bénéficie d’une remise de 95 %, ce qui le ramène à 0,10 $ par million de jetons pendant la période de lancement.

À la fin de cette période, les tarifs passeront à 4 $ par million de jetons en entrée et à 20 $ par million de jetons en sortie, selon MarkTechPost. La date de fin de la période de lancement n’a pas été communiquée.

Pour les défenseurs qui ne participent pas à Fairwind, aucun déploiement d’Argon n’est encore disponible. La divulgation concernant les hôpitaux ne fournit pas non plus les informations sur le produit et sa version nécessaires à une remédiation ciblée ou à la recherche de menaces.

Les questions immédiates portent donc sur l’accès et la gouvernance opérationnelle : quels utilisateurs seront autorisés, quels outils le modèle pourra appeler, comment ses actions autonomes seront contrôlées et comment la génération de preuves de concept sera encadrée.

Le lancement restreint d’Argon illustre le dilemme du double usage au cœur des modèles de pointe en cybersécurité. Le système qui accélère la découverte de vulnérabilités et le développement de correctifs peut aussi faciliter la validation et l’exploitation des failles. L’évaluation du déploiement progressif de Google ne reposera pas uniquement sur les scores aux benchmarks, mais aussi sur la capacité de ses contrôles à rester efficaces lorsque l’accès s’étendra au-delà d’un groupe agréé.

À lire aussi

Sources

Cet article est une réécriture originale fondée sur les sources ci-dessous.

Retour à l'accueil

Dernières actualités cybersécurité

Toutes les actualités cybersécurité →