Google limita Gemini 4 Argon mentre le sue capacità informatiche vanno oltre l’assistenza alla programmazione
Google riserva Gemini 4 Argon a difensori selezionati: rileva e corregge vulnerabilità critiche, inclusa una in software ospedaliero.
Immagine illustrativa generata con AI
Accesso controllato per un modello progettato per individuare e correggere vulnerabilità
Il 30 settembre 2026 Google ha annunciato Gemini 4 Argon, presentandolo come il primo modello della generazione Gemini 4 e come un sistema progettato per gestire flussi di lavoro complessi e prolungati.
La cybersicurezza è al centro del lancio. Google afferma che Argon è stato addestrato per individuare, convalidare e correggere autonomamente le vulnerabilità critiche del software. L’azienda propone il modello anche per l’ingegneria del software e le attività aziendali basate sulla conoscenza, compresi i settori legale e finanziario.
Argon non è disponibile al pubblico.
L’accesso iniziale è riservato ad alcuni difensori informatici selezionati che partecipano al programma Fairwind di Google e ai team interni dell’azienda. Secondo il resoconto di The Verge sull’annuncio, Google partecipa inoltre al processo volontario del governo statunitense che prevede l’accesso anticipato ai modelli avanzati prima del loro rilascio.
L’azienda intende ampliare gradualmente l’accesso, raccogliendo feedback e rafforzando le misure di sicurezza. Non è stata indicata una data per il rilascio pubblico.
Secondo Ars Technica, al termine della fase di test in ambito cybersecurity Google prevede di avviare una distribuzione più ampia, inizialmente rivolta ai clienti API a pagamento e agli abbonati a Google AI Ultra. Si tratta di un piano per il futuro, non di un rilascio commerciale già in corso.
Fairwind è stato lanciato all’inizio di settembre come programma ad accesso limitato per governi, clienti Google Cloud e partner nel campo della cybersicurezza. SecurityWeek riferisce che al lancio contava oltre 650 partner e che inizialmente combinava Gemini 3.8 Flash Cyber con CodeMender, il sistema di Google per individuare, verificare e correggere le vulnerabilità.
Una vulnerabilità non meglio precisata nei software ospedalieri mostra la posta in gioco
Il risultato di sicurezza più rilevante reso noto insieme ad Argon riguarda un software sanitario utilizzato dagli ospedali di tutto il mondo.
Google afferma che il modello ha individuato una vulnerabilità critica che esponeva informazioni personali sensibili. L’azienda ha definito grave il rischio e dichiarato che i precedenti modelli di frontiera non avevano rilevato il problema.
Wiz sta utilizzando Argon tramite Scan for Good, un’iniziativa che individua e risolve esposizioni ad alto rischio nelle infrastrutture pubbliche critiche, senza addebitare i costi alle organizzazioni interessate. Google e SecurityWeek collegano l’uso di Argon da parte di Wiz alla vulnerabilità nel settore sanitario.
Tuttavia, le fonti non indicano quale software fosse interessato. SecurityWeek aggiunge che l’annuncio non specificava se la vulnerabilità fosse stata corretta.
I resoconti disponibili non associano il problema a un identificativo CVE né forniscono indicatori tecnici. Si tratta di una lacuna del materiale pubblicato, non della prova che altrove non esistano un CVE o degli indicatori.
Di conseguenza, sulla base della sola divulgazione, gli operatori ospedalieri non possono stabilire se i propri ambienti siano interessati. Prima di avviare interventi mirati di aggiornamento o valutazioni dell’esposizione, avrebbero bisogno almeno del nome del prodotto, delle versioni vulnerabili, di un avviso del fornitore o di altre informazioni tecniche.
Il caso mostra comunque il flusso di lavoro che Google intende automatizzare. Argon dovrebbe passare dall’individuazione di una condizione sospetta alla verifica del suo impatto sulla sicurezza e alla produzione di una correzione, anziché fermarsi all’analisi del codice o alla semplice proposta di rimedi.
Una singola vulnerabilità non divulgata non basta a dimostrare quanto il modello sia efficace con regolarità su sistemi che non conosce. Mostra però perché l’accesso a capacità autonome di ricerca delle vulnerabilità sia trattato diversamente dal lancio di un normale chatbot.
I benchmark di sicurezza mostrano progressi, ma anche limiti significativi
Google ha confrontato Argon con Gemini 3.8 Flash Cyber attraverso valutazioni interne. Nel benchmark aziendale sulle vulnerabilità, Argon avrebbe individuato un’ampia gamma di problemi in basi di codice complesse che coprono 20 linguaggi di programmazione.
Wiz ha inoltre valutato i modelli con un benchmark interno di penetration test black-box, rivolto a sistemi web attivi senza accesso al codice sorgente.
Secondo quanto riportato, Argon ha superato Gemini 3.8 Flash Cyber nell’individuazione della superficie d’attacco e delle vulnerabilità e nella produzione di prove di concetto. Quest’ultima capacità è particolarmente delicata: i difensori possono usare le prove di concetto per verificare la gravità di un problema, ma funzionalità analoghe potrebbero anche ridurre il lavoro necessario per sfruttare una vulnerabilità.
Nel benchmark di correzione delle vulnerabilità CWE-bench v1, sviluppato da Collinear AI, Argon ha ottenuto il 68%. SecurityWeek riferisce che ha condiviso il primo posto con OpenAI GPT-6 Astra e xAI Grok 4.7. Anche MarkTechPost riporta il risultato del 68%, ma nella sua tabella comparativa indica come pari merito soltanto GPT-6 Astra.
La discrepanza riguarda i concorrenti elencati, non il punteggio attribuito ad Argon. MarkTechPost osserva inoltre che i modelli concorrenti sono stati eseguiti con i rispettivi agent harness; i risultati potrebbero quindi risentire delle differenze nell’orchestrazione e negli strumenti, oltre che delle capacità dei modelli.
I risultati complessivi nell’ingegneria del software sono stati contrastanti. Argon avrebbe ottenuto il 77,9% su DeepSWE v1.1, contro il 74,2% di Claude Opus 5.5, il 74,1% di GPT-6 Astra e il 67,4% di Claude Fable 5.1. Su AutomationBench ha raggiunto il 51,3%, superando il 42,5% di Claude Opus 5.5.
Argon non è risultato il migliore in tutte le prove. Su FrontierSWE v2 ha ottenuto il 55,0%, dietro a GPT-6 Astra con il 65,5%, Claude Opus 5.5 con il 62,3% e Claude Fable 5.1 con il 56,3%. Anche su Terminal-Bench 4.0 il suo 57,4% è rimasto sotto i risultati di tutti e tre i modelli di confronto.
Questi dati sono stati riportati da MarkTechPost, che li attribuisce al confronto pubblicato da Google. Il materiale citato non offre una verifica indipendente dei risultati dichiarati per i benchmark.
Il limite di un milione di token in uscita amplia i flussi di lavoro degli agenti
Secondo quanto riferito, Argon può generare fino a un milione di token in una sola risposta, contro i 64.000 dei precedenti modelli Gemini.
Google afferma che il limite più elevato consente di completare attività più impegnative in un unico passaggio. In pratica, gli sviluppatori potrebbero riuscire a gestire alcuni flussi di lavoro complessi di refactoring, analisi o reportistica senza suddividere il risultato in altrettanti turni distinti. Si tratta di un’implicazione operativa, non di una motivazione specifica attribuita a Google.
La dimensione della finestra di contesto in ingresso non è stata resa nota. Il contesto in ingresso e la capacità di generazione in uscita sono limiti distinti: il dato di un milione di token in uscita non chiarisce quindi quanto codice sorgente, telemetria o documentazione Argon possa esaminare in una volta sola.
Google afferma di utilizzare già Argon per attività di ingegneria interne su larga scala. In un progetto, i dati di telemetria dell’intera flotta hanno contribuito a risparmiare circa 300 TiB di memoria nei data center di Google. MarkTechPost parla di oltre 300 TiB liberati e stima che si potrebbero arrivare a un valore compreso tra 500 TiB e 1 PiB, ma questa stima compare soltanto nel suo articolo.
Gli agenti Argon vengono usati anche per migrare basi di codice C e C++ a Rust. Tra i lavori segnalati figurano migliaia di righe nelle librerie re2 e libgav1 e oltre 800.000 righe nel kernel Zircon del sistema operativo Fuchsia.
Per la conversione di libgav1, gli agenti avrebbero sostituito 32.000 righe di codice SIMD. Secondo quanto riferito, il decoder risultante funzionava 2,7 volte più velocemente producendo lo stesso output. Si tratta di risultati interni riportati da Google, non di misurazioni riprodotte in modo indipendente.
L’uso senza barriere di sicurezza è riservato ai partecipanti selezionati
Secondo MarkTechPost e SecurityWeek, i difensori selezionati per Fairwind e i team interni di Google possono usare Argon senza le barriere di sicurezza informatica.
Questa modalità riguarda il gruppo ammesso ai test ad accesso limitato. Non descrive la configurazione che Google dichiara di voler predisporre per una distribuzione più ampia.
Per il rilascio su più larga scala, Google afferma che Argon rifiuterà richieste che potrebbero agevolare attacchi informatici o attacchi chimici, biologici, radiologici e nucleari. L’azienda dichiara inoltre che il modello dovrebbe continuare a supportare la legittima ricerca scientifica a duplice uso.
Tra le altre misure segnalate figurano il monitoraggio delle attivazioni interne per individuare possibili abusi e il potenziamento della resistenza alla prompt injection indiretta. Google afferma inoltre che monitorerà la catena di ragionamento e le azioni di Argon per rilevare eventuali disallineamenti, con la possibilità di interromperne l’esecuzione quando necessario.
L’azienda dichiara anche di isolare e sigillare gli ambienti sandbox prima di avviare attività di addestramento o valutazioni ad alto rischio. Le fonti non specificano se, né in che modo, queste misure relative alle sandbox regolino gli strumenti, la connettività di rete, la gestione delle credenziali o le azioni in altre configurazioni.
Le organizzazioni che valutano agenti con capacità analoghe dovrebbero definire separatamente le restrizioni sull’uso degli strumenti, l’accesso alla rete, la gestione delle credenziali, la registrazione delle attività e le azioni eseguibili. Si tratta di raccomandazioni per un’implementazione difensiva, non di controlli confermati per Argon dalle fonti citate.
Le misure di sicurezza di Google restano soluzioni dichiarate per la progettazione e la distribuzione del modello. Le fonti disponibili non includono test indipendenti che ne dimostrino l’efficacia contro utenti malintenzionati, contenuti esterni compromessi o altre condizioni avversarie.
I prezzi sono stati pubblicati, ma i dettagli sulla distribuzione restano incompleti
Il prezzo introduttivo API segnalato è di 2 dollari per milione di token in ingresso e 10 dollari per milione di token in uscita. L’input memorizzato nella cache beneficia di uno sconto del 95%, con un prezzo introduttivo di 0,10 dollari per milione di token.
Terminato il periodo introduttivo, secondo MarkTechPost i prezzi saliranno a 4 dollari per milione di token in ingresso e 20 dollari per milione di token in uscita. Non è stata indicata la data di fine del periodo promozionale.
Per i difensori che non partecipano a Fairwind, al momento non è ancora possibile configurare Argon per la distribuzione. Inoltre, la divulgazione relativa al settore sanitario non contiene le informazioni sul prodotto e sulle versioni necessarie per interventi mirati di correzione o per la ricerca di minacce.
Le domande più immediate riguardano quindi l’accesso e la governance operativa: quali utenti saranno ammessi, quali strumenti il modello potrà utilizzare, come verranno verificate le azioni autonome e in che modo sarà controllata la generazione di prove di concetto.
Il lancio limitato di Argon riflette il problema del duplice uso, centrale per i modelli di frontiera dedicati alla cybersicurezza. Lo stesso sistema che può accelerare l’individuazione delle vulnerabilità e lo sviluppo delle correzioni potrebbe anche facilitare la verifica e lo sfruttamento delle falle. Il rilascio graduale di Google sarà giudicato non solo in base ai punteggi dei benchmark, ma anche alla capacità delle misure di sicurezza di restare efficaci quando l’accesso si estenderà oltre il gruppo selezionato.
Fonti
Questo articolo è una rielaborazione originale basata sulle fonti seguenti.




