Emili Mora NúñezBarcelona 05/08/2026 15:14 Actualizado 05/08/2026 16:48 Síguenos en Google0:000:00El audio de esta noticia está generado mediante Inteligencia ArtificialUn modelo de inteligencia artificial de Anthropic creó una identidad falsa para poder insertar código malicioso a uno de los supervisores durante un examen de seguridad realizado en el Instituto de Seguridad de la IA en el Reino Unido. Esta brecha de seguridad fue detectada mientras se ponía a prueba la capacidad real de los modelos Mythos 5 de Anthropic y ChatGPT 5.6 de OpenAI.“Algunos de los agentes sometidos a prueba habían llevado a cabo actividades continuadas y potencialmente perjudiciales dirigidas a personas y organizaciones reales”, señaló el instituto en un comunicado en internet. En concreto, el experimento se repitió 122 ocasiones y, en diez de ellas, los modelos consiguieron ejecutar diecinueve acciones no autorizadas.El modelo Mythos 5 de Anthropic llevó a cabo 17 de estas acciones maliciosas, como intentar inyectar código malicioso en un proyecto de código abierto en GitHub. Según informa el AISI, un desarrollador humano bloqueó los intentos. Por su parte, GPT-5.6-Sol provocó dos acciones maliciosas. “Es la primera vez que vemos que los riesgos relacionados con la autonomía y el engaño se manifiestan de forma tan clara, sin un ‘prompt’ específico, en el mundo real”, ha valorado la organización.Además, ambos modelos intentaron atacar a la cadena de suministro, utilizaron mecanismos de la ingeniería social y hasta recurrieron al engaño. Según indica la institución británica, hubo una colaboración entre agentes de IA y llegaron a dejar mensajes en GitHub e instrucciones para que otros agentes probaran y reutilizaran sus credenciales y artefactos creados. Lee tambiénAunque la acción no tuvo consecuencias reales, al producirse en el marco de un experimento controlado, el incidente provocó la reacción de ambas compañías tecnológicas. Anthropic confirmó en un comunicado que su agente era el responsable de generar la brecha de seguridad en la prueba. “Agradecemos al AISI de Reino Unido su liderazgo en este incidente, que subraya la necesidad de un debate más amplio sobre cómo evaluar de forma segura a unos agentes de IA cada vez más capaces”, apuntaba el texto.Aun así, según afirma Andrew Yoon, investigador de CivAI, una organización sin ánimo de lucro estadounidense encargada de analizar los riesgos de la IA, “el hecho de que Mythos llevara a cabo acciones tan engañosas, con la aparente conciencia de que tenía como objetivo a una persona real, puede apuntar a que Anthropic no controla sus modelos tan bien como cree”. Por otro lado, OpenAI publicó otro comunicado en el que se comprometía a colaborar para reforzar las evaluaciones de alto riesgo.La Comisión Europea presentó en julio un plan para protegerse de las nuevas amenazas de la IANo es la primera vez que el comportamiento de las herramientas de IA genera preocupación durante una prueba de seguridad. El pasado mes de julio, OpenAI informó de que dos de sus modelos llegaron a lanzar un ciberataque contra la plataforma de código abierto Hugging Face para poder encontrar la mejor solución durante otro test. En los últimos meses, varios organismos públicos han reclamado regulaciones y planes para protegerse de las amenazas que presentan los nuevos modelos de IA más avanzados. La Comisión Europea presentó el Plan de Acción sobre Ciberseguridad e Inteligencia Artificial con el objetivo de “fortalecer la seguridad de Europa”.Entre otras medidas, el plan pretendió implementar la evaluación de los riesgos de los modelos de IA antes de su introducción en el mercado, reforzar la cooperación entre estados miembros y fomentar la creación de un programa que reúna empresas, investigadores y organizaciones para desarrollar la ciberseguridad europea. Aunque se aplicará progresivamente durante los próximos meses, esta política pretende establecer mecanismos de regulación de la IA a largo plazo.