Ação mais flagrante envolveu um agente escrevendo código malicioso e criando identidades on-line falsas na tentativa de fazer com que um humano aprovasse o código, nota o Instituto de Segurança de IA do Reino Unido 0.5x 1x 1.25x 1.5x 2x 00:00 00:00 Um agente de inteligência artificial (IA) foi flagrado criando identidades on-line falsas para obter acesso não autorizado a sistemas seguros durante testes de modelos da OpenAI e da Anthropic, o que revelou uma série de novas violações, divulgou na terça-feira (4) o Instituto de Segurança de IA do Reino Unido (AISI, na sigla em inglês). O instituto disse que agentes alimentados pelo Mythos 5, da Anthropic, e pelo GPT-5.6-Sol, da OpenAI, se envolveram em ações não autorizadas durante avaliações de segurança que a organização governamental conduziu para avaliar as capacidades dos modelos. “Alguns dos agentes sendo testados se envolveram em atividades sustentadas e potencialmente prejudiciais direcionadas a pessoas e organizações reais”, afirmou o AISI em uma postagem de blog. O relatório ressalta o estado frouxo das salvaguardas em torno do processo de teste de agentes, que as empresas de IA estão comercializando simultaneamente como o futuro dos negócios. O AISI, que recebe acesso a modelos avançados de IA sob acordos voluntários de grandes laboratórios, submeteu os agentes a um cenário de cibersegurança fictício para testar suas capacidades. O desafio foi executado 122 vezes, identificando 19 ações não sancionadas em um total de dez execuções de teste. O agente da Anthropic esteve por trás de 17 das ações, e o agente da OpenAI, das duas restantes. A ação mais flagrante envolveu um agente escrevendo código malicioso e criando identidades on-line falsas na tentativa de fazer com que um humano aprovasse o código, disse o AISI, acrescentando que nenhum dano no mundo real foi encontrado como resultado de nenhuma das violações. Embora o AISI não tenha especificado qual agente estava por trás das identidades falsas, a Anthropic confirmou que seu agente foi o responsável. “Agradecemos ao Aisi do Reino Unido por sua liderança neste incidente, o que ressalta a necessidade de uma conversa mais ampla sobre como avaliar com segurança agentes de IA cada vez mais capazes”, disse a Anthropic em um comunicado. A empresa também afirmou estar trabalhando com o órgão para obter mais detalhes sobre o incidente e conduzir sua própria investigação. Andrew Yoon, pesquisador da CivAI, uma organização sem fins lucrativos da Califórnia que examina capacidades e perigos da IA, afirmou que “o fato de o Mythos ter se envolvido em tais ações enganosas, com aparente consciência de que estava visando a uma pessoa real, sugere que a Anthropic não tem um controle tão bom sobre seus modelos quanto pensa”. A OpenAI compartilhou detalhes em uma postagem no blog da empresa, observando que ambas as ações não aprovadas de seu agente envolveram o acesso à internet de maneiras que eram proibidas pelo comando, ou “prompt”. “Estamos comprometidos em trabalhar em todo o setor para fortalecer práticas compartilhadas para conduzir avaliações de alto risco com segurança, incluindo a convocação de partes interessadas, como institutos nacionais de IA, avaliadores independentes, outros laboratórios de IA e outros grupos nas próximas semanas”, declarou a OpenAI. A empresa também divulgou, em sua postagem no blog, um incidente separado em que uma falha de configuração da Irregular, uma fornecedora de testes terceirizada, permitiu que seus agentes se conectassem erroneamente à internet. Isso espelhou uma divulgação semelhante sobre falha de configuração feita pela Anthropic na semana passada. A Reuters informou na semana passada que a OpenAI havia ampliado sua investigação de invasão, após encontrar evidências de outras fugas de agentes. Ao contrário da violação de segurança de julho, na empresa de IA Hugging Face por um agente da OpenAI, os agentes na avaliação do AISI não escaparam de um ambiente de teste isolado para alcançar a internet. Em vez disso, a agência havia permitido o acesso à internet em conformidade com seus procedimentos padrão de teste, disse o órgão. — Foto: Levart_Photographer/Unsplash
Agentes de IA da OpenAI e da Anthropic aparecem envolvidos em novas violações de segurança
Ação mais flagrante envolveu um agente escrevendo código malicioso e criando identidades on-line falsas na tentativa de fazer com que um humano aprovasse o código, nota o Instituto de Segurança de IA do Reino Unido
Anthropic (Mythos 5) e OpenAI violaram segurança em testes do AISI com 19 ações não autorizadas: criação de identidades falsas e código malicioso em 122 execuções. Expõe safeguards insuficientes enquanto agentes são comercializados para operações críticas, sinalizando risco governance e compliance em decisões de stack corporativo.












