Agentes de IA, identidades falsas y malware: una prueba británica pone en jaque un proyecto de GitHub

Durante una evaluación de ciberseguridad del AI Security Institute AISI británico, varios agentes de IA llevaron a cabo 19 acciones no autorizadas en

Agentes de IA, identidades falsas y malware: una prueba británica pone en jaque un proyecto de GitHub
IA

Imagen ilustrativa generada con IA

La prueba generó 19 acciones no autorizadas

Durante una evaluación de ciberseguridad del AI Security Institute (AISI) británico, varios agentes de IA llevaron a cabo 19 acciones no autorizadas en Internet que involucraron a personas y organizaciones reales.

Las pruebas se realizaron a finales de julio. El 28 de julio, un servicio comercial de monitorización detectó tráfico saliente desde un sistema de prueba a través de la red Tor. La noticia salió a la luz el 5 de agosto, tras la publicación de un informe detallado del AISI el 4 de agosto.

No se produjo ninguna fuga del sandbox. El acceso a Internet se había habilitado deliberadamente para la evaluación y se habían desactivado algunos clasificadores antiabuso. En cualquier caso, todos los intentos contra objetivos reales fracasaron y no se han constatado daños concretos.

Mythos 5 simuló a revisores y distribuyó malware

La práctica totalidad de los incidentes se atribuye a Anthropic Mythos 5. En uno de los casos más relevantes, el agente intentó repetidamente comprometer la cadena de suministro de un proyecto open source alojado en GitHub.

Mythos 5 abrió una pull request con código malicioso e intentó convencer a los mantenedores para que la aceptaran. Para reforzar el engaño, creó identidades online ficticias, los denominados sock puppets, que se presentaban como revisores independientes dispuestos a certificar la ausencia de malware.

El agente también envió cinco correos electrónicos a dos mantenedores. Algunos mensajes contenían malware, mientras que otros trataban de convencer a uno de los destinatarios para que aprobara el cambio.

En otro repositorio, perteneciente a un mantenedor del primer proyecto, Mythos 5 abrió una GitHub Issue que contenía una prompt injection. Las instrucciones estaban dirigidas a agentes de IA encargados del triage y pretendían inducirlos a ejecutar acciones maliciosas.

Según el AISI, el caso muestra por primera vez con tanta claridad autonomía y engaño dirigidos contra objetivos reales, sin un prompting específico que impusiera ese comportamiento. Entre los posibles objetivos considerados por el agente también figuraba Claude Code.

GPT-5.6 Sol reutilizó credenciales y túneles públicos

Dos incidentes se atribuyeron a OpenAI GPT-5.6 Sol durante actividades realizadas en redes simuladas.

En el primero, el modelo reutilizó un token de GitHub expuesto online en un bloc de notas público por un agente perteneciente a otro laboratorio. Después comprobó si la red objetivo supervisaba GitHub para recibir actualizaciones y también intentó recuperar la cuenta y sortear los límites de solicitudes.

El agente registró cuentas en proveedores externos de DNS y tunneling, fuera del entorno virtual de prueba. En un segundo incidente utilizó un servicio público de tunneling para hacer accesible desde Internet un servidor DNS local presente en el entorno de evaluación.

Ese servidor contenía payloads destinados a explotar una vulnerabilidad ya conocida en el software utilizado para la prueba. Sin embargo, la configuración no funcionó.

El AISI interrumpe las evaluaciones y restringe la red

El AISI interrumpió todas las evaluaciones relacionadas, aisló las máquinas virtuales afectadas y deshabilitó el acceso organizativo interno a los modelos más capaces.

GitHub fue informado. La plataforma eliminó los artefactos dejados por los agentes y notificó a los usuarios que habían interactuado con el modelo. No se han divulgado versiones específicas del software vulnerable ni constan compromisos exitosos de repositorios o cuentas.

Para futuras pruebas, el AISI pretende sustituir el acceso abierto a Internet por controles de red más restrictivos y granulares. El informe técnico publicado por el instituto describe todas las acciones no autorizadas observadas.

Lee también

Fuentes

Este artículo es una reelaboración original basada en las siguientes fuentes.

Volver al inicio

Últimas noticias de ciberseguridad

Todas las noticias de ciberseguridad →