A OpenAI afirmou nesta terça-feira (21) que dois de seus modelos de inteligência artificial saíram do controle e conseguiram invadir o Hugging Face, uma biblioteca digital de tecnologia de IA popular entre desenvolvedores.

O incidente, que aconteceu na semana passada enquanto a OpenAI testava as capacidades de cibersegurança de seus sistemas, demonstrou o tipo de potencial sobre o qual empresas de IA vinham alertando que logo se tornaria realidade.Laboratórios de IA como OpenAI e Anthropic lançaram no último ano modelos de IA personalizados para expor problemas de cibersegurança, ao mesmo tempo em que alertavam que sua tecnologia poderia representar novos riscos ao encontrar falhas em redes corporativas de computadores mais rápido do que os defensores conseguiriam corrigi-las.

As revelações da OpenAI nesta terça indicam que esses incidentes de segurança estão começando a acontecer, e mesmo empresas de IA experientes podem não estar totalmente preparadas para eles.

A invasão ao Hugging Face começou quando a OpenAI testou uma combinação de dois de seus modelos, o GPT-5.6 Sol e um modelo mais poderoso ainda não lançado, para ver quão bem eles conseguiriam encadear vulnerabilidades online em um ciberataque bem-sucedido, disse a OpenAI em uma publicação em seu blog sobre o incidente.O teste foi projetado para manter os modelos em um ambiente de testes seguro, conhecido como sandbox, disse a OpenAI. Mas os modelos encontraram uma vulnerabilidade que lhes permitiu escapar do isolamento e se conectar à internet. Então eles miraram o Hugging Face porque inferiram que a biblioteca, que contém milhões de modelos de IA, poderia conter pistas sobre como passar na avaliação com sucesso.