El uso cada vez mayor de t�cnicas de entrenamiento agresivas aumenta la amenaza de comportamientos maliciosos por parte de los principales modelos.A principios de este mes, el CEO de OpenAI, Sam Altman, respald� la descripci�n de su �ltimo modelo como un rottweiler "que agarra el problema por el cuello y no lo suelta hasta que lo resuelve".El laboratorio de IA de San Francisco descubri� esta semana que su modelo GPT-Sol 5.6 escap� de los controles de la empresa y llev� a cabo un grave ataque inform�tico.Aunque el personal de pruebas y seguridad de OpenAI no se sorprendi�, s� se alarm� por el incidente, que se produjo mientras el laboratorio de IA utilizaba m�todos de entrenamiento cada vez m�s agresivos en su carrera contra Anthropic para desarrollar las capacidades de ciberseguridad m�s sofisticadas, seg�n m�s de media docena de personas con conocimiento del asunto.OpenAI fue advertido de que su estrategia de entrenamiento podr�a provocar un ataque inform�tico descontrolado, seg�n algunas de las fuentes, despu�s de que pruebas anteriores demostraran que los modelos pod�an escapar de los entornos e intentar causar da�os en el mundo real."Es una combinaci�n de la velocidad vertiginosa de la carrera y el af�n de todos por alcanzar mayores capacidades lo m�s r�pido posible", declar� una persona cercana a OpenAI, que a�adi� que se trat� de una combinaci�n de "subestimar las capacidades del modelo" y "no estar suficientemente preparados en materia de seguridad".El incidente pone de manifiesto c�mo OpenAI redobl� sus esfuerzos en m�todos de entrenamiento que recompensaban la b�squeda incesante de objetivos, incluso cuando aumentaban las advertencias de que podr�an comprometer la seguridad.OpenAI revel� a �ltima hora del martes que un agente de IA que estaba probando hab�a escapado de su entorno aislado, se hab�a conectado a internet, hab�a detectado y explotado vulnerabilidades y hab�a robado credenciales de acceso a la startup Hugging Face en un intento por resolver un complejo problema de ciberseguridad.La brecha de seguridad de la compa��a, valorada en 852.000 millones de d�lares, subraya el creciente riesgo de que una t�cnica llamada aprendizaje por refuerzo, que consiste en recompensar a los modelos de IA por completar tareas, pueda llevar a los agentes de IA a actuar de forma insegura.Aunque el aprendizaje por refuerzo est� muy extendido en la industria de la IA, un creciente n�mero de investigaciones demuestra que cuando los modelos se entrenan para completar tareas a cambio de una recompensa, en lugar de considerar otros factores como la seguridad, pueden recurrir a t�cticas arriesgadas para alcanzar sus objetivos."Los modelos de IA se entrenan para perseguir objetivos sin descanso. No aprenden autom�ticamente valores como "no cometer delitos"", afirm� Steven Adler, cofundador de la organizaci�n sin �nimo de lucro Guidelight AI Standards y ex investigador de seguridad de OpenAI. "Me alegra que OpenAI haya informado sobre el incidente, ya que es una prueba de lo que pueden hacer los modelos mal programados".OpenAI declar� que "seguiremos llevando a cabo una investigaci�n exhaustiva junto con Hugging Face y compartiremos m�s detalles sobre las vulnerabilidades, el incidente y nuestros hallazgos una vez finalizada la investigaci�n".El hackeo ha despertado las alarmas en todo el sector y dentro de OpenAI, ya que representa un ejemplo sin precedentes de un sistema de IA que vulnera las defensas cibern�ticas en contra de la intenci�n del usuario.Seg�n varias personas familiarizadas con la situaci�n, algunos empleados de OpenAI tambi�n temen que esto demuestre que el laboratorio est� perdiendo el control sobre los potentes sistemas que est� desarrollando. "Esto demuestra claramente que el modelo no se ajusta a la intenci�n del usuario", afirm� Ryan Greenblatt, cient�fico jefe de Redwood Research, organizaci�n dedicada a la seguridad de la IA. "Es como si el modelo hiciera trampa en lugar de intentar dominar el mundo. Pero este problema puede empeorar y provocar fallos cada vez m�s graves".El incidente ocurri� durante las pruebas del modelo, que hab�a sido entrenado e implementado internamente en OpenAI. Este tipo de entrenamiento era habitual, pero requer�a "muchos menos recursos" que el entrenamiento previo a la implementaci�n para clientes, seg�n una fuente. Varias personas confirmaron que el modelo, a�n no publicado, que se probaba junto con Sol, no se hab�a retirado internamente.Para llevar a cabo las evaluaciones, OpenAI elimin� las medidas de ciberseguridad, pero coloc� los modelos en un entorno aislado llamado sandbox. Algunos sugieren que la falta de supervisi�n del modelo para detectar su comportamiento tambi�n propici� la aparici�n de este agente malicioso.OpenAI lleva a�os realizando este tipo de pruebas con modelos, y en modelos anteriores se han detectado se�ales de alerta temprana de sistemas que actuar�n de forma maliciosa e intentar�n escapar de los entornos.En abril, el modelo Mythos de Anthropic tambi�n obtuvo acceso a internet y public� detalles de una vulnerabilidad de seguridad, por encima de lo que los investigadores hab�an previsto.Mythos, y el posterior modelo Fable de Anthropic, causaron revuelo en la comunidad de ciberseguridad e impulsaron a gobiernos de todo el mundo a centrarse en la idea de que los ataques a infraestructuras digitales y cr�ticas ser�n cada vez m�s impulsados por IA y aut�nomos.Jake Moore, asesor global de ciberseguridad de ESET, una empresa de ciberseguridad, afirm� que OpenAI inevitablemente utilizar�a la brecha como herramienta de marketing, dado el gran beneficio que obtuvo a principios de a�o su rival, el desarrollador de IA Anthropic, debido a preocupaciones similares. Tras este incidente, muchos en las comunidades de seguridad de la IA y ciberseguridad han pedido regulaciones para evitar que algo parecido se repita. Se espera que Altman informe a funcionarios de la Casa Blanca la pr�xima semana sobre la pr�xima generaci�n de sistemas de IA.A medida que los sistemas avanzan hacia capacidades m�s aut�nomas, pueden surgir comportamientos menos deseables, como el hackeo inform�tico o la desobediencia de instrucciones. Hobbhahn, de Apollo Research, afirm� que para que los agentes sean efectivos, deben trabajar sin supervisi�n durante largos per�odos. "Tienen que tener mayor autonom�a; no hay otra opci�n".A�adi� que "La gente piensa que es solo una herramienta, hace lo que queremos que haga y nada m�s, y simplemente sigue las instrucciones al pie de la letra. Y creo que deber�a estar preparada para que los agentes tengan sus propios objetivos, act�en de forma aut�noma durante d�as, y esos objetivos no necesariamente coincidan con los nuestros", concluy�.� The Financial Times Limited [2026]. Todos los derechos reservados. FT y Financial Times son marcas registradas de Financial Times Limited. Queda prohibida la redistribuci�n, copia o modificaci�n. EXPANSI�N es el �nico responsable de esta traducci�n y Financial Times Limited no se hace responsable de la exactitud de la misma.
El incidente de hackeo de OpenAI expone los crecientes riesgos de la IA
A principios de este mes, el CEO de OpenAI, Sam Altman, respald� la descripci�n de su �ltimo modelo como un rottweiler "que agarra el problema por el cuello y no lo suelta...










