0:000:00El audio de esta noticia está generado mediante Inteligencia ArtificialOpenAI anunció ayer martes que perdió el control de dos modelos de inteligencia artificial mientras realizaba una prueba de seguridad. Una combinación de modelos, incluidos GPT-5.6 Sol y uno de prelanzamiento “más capaz”, lanzó un ciberataque a Hugging Face, una plataforma de código abierto centrada en la IA y el aprendizaje automático.Sam Altman, CEO de OpenAI. Evelyn Hockstein / ReutersLas habilidades de pirateo informático ofensivo de los modelos de IA estaban siendo evaluadas por la empresa, con las medidas de seguridad que normalmente bloquean la actividad cibernética de alto riesgo desactivadas.Pero el entorno de pruebas, calificado como “altamente aislado” en el comunicado de OpenAI, contenía vulnerabilidades que los “modelos identificaron y encadenaron” para “obtener soluciones de la prueba directamente de la base de producción de Hugging Face”.Es decir, como el agente de IA estaba concentrado en obtener la mayor puntuación de evaluación, dedujo que Hugging Face albergaría las respuestas y soluciones de referencia. Para resolver el problema, el modelo determinó que escapar de su contenedor y robar las respuestas era la mejor estrategia.Puerta traseraCómo escapó la IA al exteriorLos modelos escaparon a través de un proxy de caché de registro de paquetes, que es un software que permite a los desarrolladores instalar código externo sin necesidad de estar conectado a internet. El proxy era el único componente del entorno de pruebas aislado del empresa de Sam Altman con acceso al exterior.Al encontrar esta puerta de salida, los modelos “explotaron una vulnerabilidad de día cero” para acceder a internet a la vez que se “hiperconcentraban” en encontrar una solución para las pruebas de ciberseguridad por las que estaban siendo evaluados. Este examen, llamado ExploitGym, incluye la presión de los modelos para que encuentren soluciones.“Tras obtener acceso a internet, los modelos dedujeron que Hugging Face potencialmente alojaba modelos, conjuntos de datos y soluciones para ExploitGym”, describió la compañía, “con esta información, el modelo buscó y encontró con éxito maneras de acceder a información secreta que podría usar para manipular la evaluación”. El modelo llegó a combinar múltiples vectores de ataque, donde incluyó el uso de credenciales robadas y vulnerabilidades de día cero.El Instituto de Seguridad de la IA de Reino Unido (UK AISI) demostró que modelos como GPT-5.6 Sol son cada vez más capaces de realizar operaciones cibernéticas complejas y multifase durante largos periodos de tiempo, como informa VentureBeat.Vulnerabilidad de tipo ceroCiberataques que no deberían ocurrirEsta brecha era desconocida, pero es cierto que las vulnerabilidades de tipo cero son bastante comunes, pues las empresas llevan años corrigiéndolas. Los investigadores señalan que, aunque los avances en IA crean nuevos desafíos, el aislamiento exhaustivo y riguroso de la infraestructura del internet abierto está bien estudiado.“Esto no es un problema de IA, es negligencia según un estándar de hace 40 años y básicamente es como en todas las películas de ciencia ficción”, afirmó Davi Ottenheimer, consultor veterano en seguridad y cumplimiento normativo, a Wired, “‘altamente aislado’ y ‘escaparon por el único resquicio que dejamos abierto’ no pueden ser ciertas a la vez”.Lee tambiénA las principales empresas de IA les preocupan las crecientes capacidades de ciberseguridad de los modelos, a medida que las plataformas aumentan su experiencia, creatividad y capacidad de operación autónoma. Sin embargo, los investigadores aseguran que esto justifica que se sigan aplicando los principios fundamentales.“Esto no debería haber ocurrido”, afirmó Niels Provos, veterano ingeniero e investigador de seguridad, “ojalá los laboratorios de vanguardia dedicaran tanto tiempo a enseñar a sus modelos a crear infraestructuras seguras como el que dedican a explotar vulnerabilidades”.
La IA de OpenAI lanza un ciberataque: los modelos de ChatGPT escapan del confinamiento y roban las respuestas de una prueba por la que les evalúan
Modelos de ciberseguridad, incluidos GPT-5.6 Sol y uno nuevo más potente, escaparon de un entorno de pruebas “altamente aislado” tras identificar y explotar una vulnerabilidad de día cero










