Un sistema autónomo de inteligencia artificial (IA) creó falsas identidades para hacerse pasar por una persona e intentó manipular a humanos durante unas pruebas de seguridad hechas por el Instituto británico de Seguridad de la IA (AISI). Estos sistemas, llamados agentes, estaban impulsados por los dos modelos más avanzados de Anthropic, el Mythos 5, y OpenAI, el GPT-5.6 Sol. El organismo ejecutó 122 intentos de resolver unos escenarios de prueba y en 19 se detectaron acciones no permitidas: 17 las hizo Mythos 5 y solo 2 GPT-5.6 Sol. Estos agentes de IA desobedecieron órdenes expresas de no efectuar estas acciones maliciosas por parte del organismo, que tiene acceso preferente para investigar con estos modelos de IA gracias a un acuerdo con las compañías. “Descubrimos que algunos de los agentes probados habían participado en actividades insistentes y potencialmente dañinas dirigidas hacia personas y organizaciones reales”, resume.“El comportamiento fue posible, sostenido y nuevo; solo eso ya merece atención”, dice el informe del AISI, un organismo que depende del Departamento de Ciencia, Innovación y Tecnología del Gobierno británico, que nunca había observado “un engaño de esta gravedad dirigido a una persona real, sin que se le pidiera”: “Esta es la primera vez que hemos visto que los riesgos en torno a la autonomía y el engaño se manifiestan claramente, sin una motivación específica, en el mundo real”.“No me sorprende: esto es lo que parecen los ‘avances exponenciales’, que te sorprenda el último y luego otro te vuelva a sorprender antes de lo previsto. Pero es una noticia bastante grave, más de lo que sugiere el titular”, dice Linda Petrini, investigadora en seguridad de IA.Este incidente, ocurrido el 28 de julio, se suma a los anunciados en las últimas semanas por OpenAI y Anthropic, cuyos modelos han hackeado plataformas del mundo real sin que las compañías lo detectaran. En este caso, el AISI dio acceso a internet a los modelos y suprimió algunos de los filtros de ciberseguridad que suelen incluir, unas condiciones distintas a las que están disponibles para el público, según explica el organismo. “Es un poco más de lo mismo, con la novedad de intentos de engaño que han ocurrido en otros ámbitos, pero no en pruebas de ciberseguridad”, dice José Hernández-Orallo, director de investigación del Centro Leverhulme para el Futuro de la Inteligencia de la Universidad de Cambridge y catedrático de la Universidad Politécnica de Valencia. “Pero no sorprende, e incluso creo que el test es un poco temerario. El AISI admite que ha aprendido la lección, que es una manera suave de decir que aquí se han equivocado. ¿Cómo piden a Mythos 5, el modelo con mayor capacidades de ciberseguridad y persuasión, que hackee y le dan acceso a internet con los filtros desactivados?" Los anteriores incidentes protagonizados por los modelos de IA fuera de control de OpenAI y Anthropic despertaron suspicacias porque las compañías podrían estar exagerando su relevancia para vender la potencia de sus programas. Que la alerta venga de un organismo ajeno a la industria y dependiente del Gobierno británico que, en palabras de Hernández-Orallo es “el centro más potente del mundo en estos momentos”, aporta otra dimensión al problema. On July 28th, we identified an incident during a routine cyber evaluation in which AI agents took sustained, unsanctioned actions directed at real people and organisations.The behaviour came mostly from one model (Anthropic's Mythos 5), with a small number of events from… pic.twitter.com/SPnA4Ekkwq— AI Security Institute (AISI) (@AISecurityInst) August 4, 2026