Agentes de inteligência artificial da OpenAI e da Anthropic —empresas do ChatGPT e do Claude, respectivamente— demonstraram comportamentos não autorizados na internet em teste realizado pelo Instituto de Segurança em Inteligência Artificial do Reino Unido (AISI) no dia 28 de julho.
Segundo o relatório do instituto, foi realizado um teste em ambiente controlado para avaliar qual era o limite de alguns modelos de IA em tarefas envolvendo segurança digital. Para isso, os pesquisadores criaram um ambiente de testes em que os modelos de IA tinham acesso à internet, os filtros de segurança dos desenvolvedores estavam desligados e os sistemas tinham a missão de resolver tarefas de forma autônoma.
Foram realizados 122 testes com sete modelos de IA distintos, sendo que, em dez deles, ocorreram ações não autorizadas pelos modelos Mythos 5, da Anthropic e o GPT-5.6 Sol, da OpenAI.
Agentes da OpenAI e Anthropic tomam ações inesperadas em teste de segurança em instituto do Reino Unido - Dado Ruvic/Reuters
A OpenAI disse que revisará processos para avaliações externas, endurecendo critérios para acesso à internet, monitoramento e resposta a incidentes, além de trabalhar com institutos de pesquisa e outras empresas para estabelecer padrões mais seguros para testes de modelos avançados. A Anthropic não se manifestou até a publicação desta reportagem.











