Investigação do Instituto de Segurança em IA do Reino Unido, que testa modelos de ponta para avaliar riscos, detectou transferências incomuns de dados 0.5x 1x 1.25x 1.5x 2x 00:00 00:00 Novas falhas de segurança são encontradas em modelos da OpenAI e Anthropic — Foto: Bloomberg Modelos de inteligência artificial da OpenAI e da Anthropic estiveram envolvidos em incidentes de cibersegurança que não haviam sido divulgados anteriormente, marcando o mais recente episódio de uma série de ocorrências desse tipo. O Instituto de Segurança em IA do Reino Unido (AI Security Institute, ou AISI), que testa modelos de IA de ponta para avaliar seus riscos potenciais, informou nesta terça-feira que, durante uma avaliação de segurança cibernética envolvendo acesso à internet, os modelos Mythos 5, da Anthropic, e GPT-5.6-Sol, da OpenAI, "envolveram-se em atividades contínuas, potencialmente prejudiciais, direcionadas a pessoas e organizações reais". O grupo identificou o incidente em 28 de julho, após detectar "transferências incomuns de dados", segundo publicação em seu blog. De acordo com o AISI, uma investigação constatou que, durante a avaliação, um dos modelos de IA tentou inserir código malicioso em um projeto de software de código aberto hospedado no GitHub, chegando inclusive a criar identidades falsas na tentativa de fazer com que seu código fosse aprovado. "Um mantenedor humano identificou a tentativa e recusou aprovar o código malicioso", escreveu o grupo. Em comunicado publicado na rede social X, a Anthropic afirmou que a empresa está "grata ao AISI por sua liderança na importante discussão sobre como avaliar agentes de IA cada vez mais capazes". "Estamos trabalhando em estreita colaboração com eles para obter mais detalhes sobre o incidente enquanto conduzimos nossa própria investigação. Compreender claramente como o Claude interpretava sua situação — examinando os registros de seu raciocínio e realizando nossas próprias análises — nos ajudará a identificar as causas de seu comportamento", declarou a empresa. Em uma publicação em seu blog, a OpenAI afirmou que "aprecia a parceria do AISI do Reino Unido durante todo esse processo, incluindo seu trabalho para identificar, investigar e compartilhar detalhes sobre a atividade". "Esperamos continuar nossa colaboração", acrescentou a empresa. Separadamente, a OpenAI informou em seu blog que outro incidente envolvendo um modelo de cibersegurança ocorreu durante uma avaliação conduzida pela Irregular, uma empresa externa especializada em segurança cibernética que também trabalha com a Anthropic. Nesse incidente, os modelos da OpenAI estavam passando por uma avaliação diferente de segurança cibernética e aproveitaram uma "configuração incorreta" (misconfiguration) no ambiente de testes para obter acesso à internet e explorar um site, informou a OpenAI. A OpenAI destacou que esses novos incidentes são distintos de um caso divulgado anteriormente envolvendo a Hugging Face.