A Anthropic retomou os testes externos de segurança de modelos de inteligência artificial após implementar novas medidas de proteção, em resposta aos incidentes ocorridos no mês passado, nos quais modelos do chatbot Claude acessaram a internet e invadiram outros sistemas durante avaliações de segurança.

Incidentes semelhantes envolvendo as rivais OpenAI e Meta aumentaram as preocupações de que os avanços na inteligência artificial possam ampliar as ameaças digitais, ao mesmo tempo em que sobrecarregam a capacidade dos desenvolvedores de manter seus sistemas sob controle.

A Anthropic classificou os incidentes envolvendo o Claude como uma "falha de segurança operacional", afirmando que eles ocorreram devido a erros em um ambiente de avaliação de terceiros. A empresa suspendeu as avaliações externas dos modelos e interrompeu brevemente os testes internos enquanto implementava novas medidas de segurança.Na segunda-feira (31), a Anthropic informou que retomou os testes externos após adicionar as medidas de segurança, projetadas para impedir que seus modelos de IA acessem sites ou sistemas de computador reais. A empresa afirmou que agora utiliza um "classificador" capaz de identificar quando um modelo tenta escapar e interromper o teste.