Anthropic ha reso noto che i suoi modelli di intelligenza artificiale Claude hanno violato i sistemi informatici di tre organizzazioni esterne durante test sulle capacità offensive di cybersicurezza, una settimana dopo un episodio analogo comunicato da OpenAI.

Claude è entrato ne sistemi di aziende esterne mentre veniva sottoposto a prove di hacking controllato.

Alla base dell'incidente vi sarebbe un errore di configurazione: a causa di «un malinteso» con il partner incaricato dei test, Irregular, il modello ha potuto collegarsi a Internet, nonostante l'ambiente di prova avrebbe dovuto essere completamente isolato.

L'episodio arriva pochi giorni dopo che OpenAI aveva rivelato come due suoi modelli fossero riusciti a uscire dall'ambiente di test e ad attaccare la Hugging Face sfruttando una vulnerabilità software.

In tutti i casi i modelli erano stati informati che stavano operando in una simulazione priva di accesso alla rete.