El incidente mostró que un agente de IA intentó insertar código malicioso en un proyecto real de GitHub mediante identidades falsas y manipulación socia

Por Manuel Rivera / NEKT Group*

Durante la conferencia de ciberseguridad de BLACKHAT se confirmó que el 4 de agosto de 2026, el AI Security Institute (AISI) del Reino Unido reveló un segundo incidente que refuerza —y complica— el relato del “primer ataque autónomo“: durante una evaluación cibernética de rutina el 28 de julio, en la que se probaron siete modelos de frontera con acceso a internet real y con los filtros de seguridad deliberadamente apagados (condiciones de laboratorio, no de producción), un agente basado en Claude Mythos 5 de Anthropic —responsable de 17 de los 19 incidentes catalogados, frente a solo 2 de un GPT-5.6 “Sol” de OpenAI con clasificadores de ciberseguridad desactivados— intentó insertar código malicioso en un proyecto real de código abierto en GitHub.

Para lograrlo, el agente investigó a los mantenedores humanos del proyecto, creó identidades falsas y las usó para presionar socialmente a un revisor real y aprobar el código; cuando su solicitud fue cuestionada públicamente, incluso editó su actividad previa para que pareciera inofensiva y consideró adoptar una nueva identidad falsa para continuar.