Google restringe Gemini 4 Argon mientras sus capacidades en ciberseguridad van más allá de la asistencia con código

Google restringe Gemini 4 Argon a expertos: detecta y corrige vulnerabilidades críticas, como una en software hospitalario.

Google restringe Gemini 4 Argon mientras sus capacidades en ciberseguridad van más allá de la asistencia con código
IA

Imagen ilustrativa generada con IA

Acceso controlado a un modelo diseñado para detectar y corregir vulnerabilidades

Google anunció Gemini 4 Argon el 30 de septiembre de 2026. Lo presentó como el primer modelo de la generación Gemini 4 y como un sistema diseñado para gestionar flujos de trabajo complejos y prolongados.

La ciberseguridad es uno de los ejes centrales del lanzamiento. Google afirma que entrenó Argon para detectar, validar y corregir de forma autónoma vulnerabilidades críticas de software. La compañía también lo está posicionando como una herramienta para la ingeniería de software y el trabajo empresarial basado en el conocimiento, incluidas tareas jurídicas y financieras.

Argon no está disponible para el público general.

En esta primera fase, el acceso se limita a determinados profesionales de ciberseguridad que participan en el programa Fairwind de Google y a los equipos internos de la compañía. Según la información de The Verge sobre el anuncio, Google también participa en el proceso voluntario del Gobierno de Estados Unidos para dar acceso anticipado a modelos avanzados antes de su lanzamiento.

La compañía prevé ampliar el acceso de forma gradual, mientras recopila comentarios y refuerza las medidas de seguridad. Por ahora, no ha anunciado una fecha de lanzamiento público.

Tras la fase de pruebas de ciberseguridad, Google tiene previsto ampliar la disponibilidad a los clientes de pago de la API y a los suscriptores de Google AI Ultra, según Ars Technica. Se trata de un despliegue previsto, no de una oferta comercial disponible actualmente.

Fairwind se puso en marcha a principios de septiembre como un programa de acceso limitado para gobiernos, clientes de Google Cloud y socios de ciberseguridad. SecurityWeek informa de que, al arrancar, contaba con más de 650 socios participantes y combinaba inicialmente Gemini 3.8 Flash Cyber con CodeMender, el sistema de Google para detectar, verificar y corregir vulnerabilidades.

Una vulnerabilidad no identificada en un software hospitalario muestra lo que está en juego

El hallazgo de seguridad más importante que Google ha divulgado junto con Argon afecta a un software sanitario utilizado por hospitales de todo el mundo.

Google afirma que el modelo detectó una vulnerabilidad crítica que dejaba expuestos datos personales sensibles. La compañía calificó el riesgo de grave y señaló que modelos de vanguardia anteriores no habían detectado el fallo.

Wiz utiliza Argon a través de Scan for Good, una iniciativa que identifica y corrige exposiciones de alto riesgo en infraestructuras públicas críticas sin cobrar a las organizaciones afectadas. Google y SecurityWeek relacionan el uso de Argon por parte de Wiz con el hallazgo en el sector sanitario.

Sin embargo, los informes no identifican el software afectado. SecurityWeek también señala que el anuncio no aclara si la vulnerabilidad ya se ha corregido.

Los informes disponibles no vinculan el fallo con un identificador CVE ni aportan indicadores técnicos. Esto es una limitación de la información publicada, no una prueba de que no existan un CVE o indicadores en otras fuentes.

Por tanto, los operadores de hospitales no pueden determinar solo con esta divulgación si sus sistemas están afectados. Para iniciar una corrección o evaluar su exposición de forma específica, necesitarían al menos el nombre del producto, las versiones afectadas, un aviso del proveedor u otros datos técnicos.

Aun así, el caso ilustra el flujo de trabajo que Google pretende automatizar. Argon está diseñado para pasar de la detección de una condición sospechosa a la validación de su impacto en la seguridad y la elaboración de una solución, en lugar de limitarse a analizar el código o sugerir medidas correctivas.

Una sola vulnerabilidad no divulgada no permite determinar con qué consistencia rinde el modelo en sistemas desconocidos. Sin embargo, sí muestra por qué el acceso a capacidades autónomas de investigación de vulnerabilidades se trata de forma distinta al lanzamiento de un chatbot convencional.

Las pruebas de seguridad reflejan avances, pero también importantes salvedades

Google comparó Argon con Gemini 3.8 Flash Cyber en evaluaciones internas. Según la compañía, en su prueba de vulnerabilidades Argon detectó una amplia variedad de fallos en bases de código complejas escritas en 20 lenguajes de programación.

Wiz también evaluó los modelos con una prueba interna de penetración de tipo caja negra. En ella, se analizaron sistemas web en producción sin acceso al código fuente.

Según los resultados, Argon superó a Gemini 3.8 Flash Cyber en la detección de la superficie de ataque, la identificación de vulnerabilidades y la generación de pruebas de concepto. Esta última capacidad es especialmente delicada: los equipos defensivos pueden usar pruebas de concepto para validar la gravedad de un fallo, pero una funcionalidad similar también podría reducir el esfuerzo necesario para aprovecharlo.

En CWE-bench v1, una prueba de corrección de vulnerabilidades desarrollada por Collinear AI, Argon obtuvo un 68 %. SecurityWeek afirma que empató en el primer puesto con OpenAI GPT-6 Astra y xAI Grok 4.7. MarkTechPost también recoge el resultado del 68 %, aunque en su tabla comparativa solo identifica a GPT-6 Astra como colíder.

La discrepancia está en los competidores que se mencionan, no en la puntuación atribuida a Argon. MarkTechPost también señala que los modelos rivales se ejecutaron con sus propios sistemas de agentes, por lo que los resultados podrían reflejar diferencias en la coordinación y las herramientas, además de las capacidades de cada modelo.

Los resultados generales en ingeniería fueron dispares. Según los datos publicados, Argon obtuvo un 77,9 % en DeepSWE v1.1, frente al 74,2 % de Claude Opus 5.5, el 74,1 % de GPT-6 Astra y el 67,4 % de Claude Fable 5.1. En AutomationBench alcanzó un 51,3 %, por delante de Claude Opus 5.5, que obtuvo un 42,5 %.

Argon no lideró todas las pruebas. Su puntuación en FrontierSWE v2 fue del 55,0 %, por debajo de GPT-6 Astra, con un 65,5 %; Claude Opus 5.5, con un 62,3 %; y Claude Fable 5.1, con un 56,3 %. En Terminal-Bench 4.0, el 57,4 % de Argon también quedó por debajo de los otros tres modelos comparados.

MarkTechPost señala que estas cifras proceden de la comparación publicada por Google. El material citado no aporta una validación independiente de los resultados de estas pruebas.

Un límite de respuesta de un millón de tokens amplía los flujos de trabajo con agentes

Según los datos publicados, Argon puede generar hasta un millón de tokens en una sola respuesta, frente al límite de 64.000 tokens de los modelos Gemini anteriores.

Google afirma que este límite ampliado permite completar tareas más exigentes de una sola vez. En la práctica, los desarrolladores podrían ejecutar algunos flujos de trabajo extensos de refactorización, análisis o generación de informes sin dividir la respuesta en tantos turnos. Esta es una posible consecuencia operativa, no una explicación concreta atribuida a Google.

No se ha divulgado el tamaño de la ventana de contexto de entrada. El contexto de entrada y la capacidad de salida son límites distintos; por tanto, la cifra de un millón de tokens de salida no indica cuánto código fuente, telemetría o documentación puede analizar Argon a la vez.

Google afirma que ya utiliza Argon en proyectos internos de ingeniería a gran escala. En uno de ellos, el análisis de la telemetría de toda la flota ayudó a ahorrar aproximadamente 300 TiB de memoria en los centros de datos de Google. MarkTechPost informa de que se liberaron más de 300 TiB y proyecta un ahorro de entre 500 TiB y 1 PiB, aunque esta proyección solo aparece en su cobertura.

También se están utilizando agentes de Argon para migrar bases de código C y C++ a Rust. El trabajo, según lo publicado, incluye miles de líneas de las bibliotecas re2 y libgav1, además de más de 800.000 líneas del núcleo Zircon del sistema operativo Fuchsia.

En la migración de libgav1, los agentes sustituyeron 32.000 líneas de código SIMD. Según se afirma, el decodificador resultante funciona 2,7 veces más rápido y produce una salida idéntica. Estos siguen siendo resultados internos comunicados por la compañía, no mediciones reproducidas de forma independiente.

El uso sin salvaguardas se limita a participantes seleccionados

Según MarkTechPost y SecurityWeek, los equipos internos de Google y los profesionales de Fairwind de confianza pueden usar Argon sin salvaguardas específicas para ciberseguridad.

Esta configuración se aplica al grupo de pruebas restringido. No describe la versión que Google dice estar preparando para una distribución más amplia.

Google afirma que, en un despliegue más amplio, Argon rechazará las solicitudes que puedan facilitar ciberataques o ataques químicos, biológicos, radiológicos y nucleares. La compañía también señala que el modelo debería seguir permitiendo la investigación científica legítima de doble uso.

Entre las otras medidas mencionadas figuran la supervisión de las activaciones internas para detectar posibles usos indebidos y la mejora de la resistencia a la inyección indirecta de instrucciones. Google también afirma que supervisará la cadena de pensamiento y las acciones de Argon para detectar posibles desviaciones y que podrá detener su ejecución cuando sea necesario.

La compañía añade que aísla y protege los entornos de pruebas antes de iniciar entrenamientos o evaluaciones de alto riesgo. Los informes no especifican si esas medidas se aplican al uso de herramientas, la conectividad de red, la gestión de credenciales o las acciones durante otros despliegues, ni de qué manera lo harían.

Las organizaciones que evalúen agentes con capacidades similares deberían definir por separado las restricciones de uso de herramientas, acceso a la red, gestión de credenciales, registro de actividad y ejecución de acciones. Se trata de recomendaciones para un despliegue defensivo, no de controles confirmados para Argon en los informes citados.

Las salvaguardas de Google son medidas de diseño y despliegue comunicadas por la compañía. Las fuentes disponibles no incluyen pruebas independientes que demuestren su eficacia frente a usuarios malintencionados, contenido externo comprometido u otras situaciones adversas.

Los precios ya se han anunciado, pero faltan detalles sobre el despliegue

Según los datos publicados, el precio inicial de la API es de 2 dólares por millón de tokens de entrada y 10 dólares por millón de tokens de salida. Los tokens de entrada almacenados en caché tienen un descuento del 95 %, lo que deja su precio inicial en 0,10 dólares por millón.

Una vez finalizado el periodo introductorio, los precios subirán a 4 dólares por millón de tokens de entrada y 20 dólares por millón de tokens de salida, según MarkTechPost. No se ha anunciado la fecha en que terminará el periodo introductorio.

Quienes trabajan en defensa y no forman parte de Fairwind todavía no pueden configurar un despliegue de Argon. Además, la información sobre el hallazgo en el sector sanitario no incluye los datos del producto y las versiones necesarios para corregir el fallo o buscar señales de ataque de forma específica.

Por ahora, las principales preguntas se refieren al acceso y a la gobernanza operativa: qué usuarios podrán acceder al modelo, qué herramientas podrá utilizar, cómo se revisarán las acciones autónomas y qué controles se aplicarán a la generación de pruebas de concepto.

El lanzamiento restringido de Argon refleja el problema del doble uso que está en el centro de los modelos de vanguardia para ciberseguridad. El mismo sistema que puede acelerar la detección de vulnerabilidades y el desarrollo de parches también puede facilitar su validación y explotación. El despliegue gradual de Google se evaluará no solo por los resultados en las pruebas, sino también por la eficacia de sus controles cuando el acceso se amplíe más allá de un grupo seleccionado.

Lee también

Fuentes

Este artículo es una reelaboración original basada en las siguientes fuentes.

Volver al inicio

Últimas noticias de ciberseguridad

Todas las noticias de ciberseguridad →