La società che sviluppa Claude ha dichiarato che alcuni suoi sistemi in fase di test sono usciti dall'ambiente protetto e hanno attaccato organizzazioni reali. Le intrusioni risalgono ad aprile

Anthropic, la società che ha sviluppato il chatbot Claude, ha reso noto che tre aziende sono state violate da sistemi di intelligenza artificiale che la società stava sottoponendo a test. Gli attacchi risalgono ad alcuni mesi fa, i primi ad aprile, e nessuno se n'era accorto: né l'azienda che ha costruito i modelli, né i bersagli, informati solo lunedì scorso.

La revisione interna che ha portato alla scoperta, spiega Anthropic, è stata avviata subito dopo il caso di OpenAI. Una decina di giorni fa è emerso che due modelli di intelligenza artificiale di OpenAI in fase di test erano riusciti a eludere una sandbox, l'ambiente virtuale isolato per per fare prove di sicurezza senza rischi, e violare i sistemi informatici di un'altra azienda tecnologica, Hugging Face. L'azienda di Sam Altman non si è accorta della grave falla per una settimana.

Anthropic ha scoperto che in tre occasioni i modelli di AI, impegnati in un test per "bucare" un software costruito apposta per valutare le loro capacità offensive, sono finiti sulla rete aperta e hanno colpito bersagli veri (i nomi delle aziende colpite dall'attacco non sono stati resi noti).Anthropic parla di errore umano e spiega che i suoi modelli non hanno forzato le barriere dell'ambiente di test, ma sono stati gli informatici a lasciarle aperte. La responsabilità, secondo l'azienda, è di una configurazione sbagliata nata da un fraintendimento con Irregular, la società terza incaricata di condurre le valutazioni, che aveva dato accesso a internet ai modelli. In un caso, l'ultimo modello di Anthropic si è accorto di avere accesso a Internet quando non avrebbe dovuto e ha interrotto l'attacco. Nessuna delle intrusioni, sempre secondo la ricostruzione aziendale, ha sfruttato vulnerabilità sconosciute. I sistemi si sono serviti di strumenti ordinari come password deboli o software malevoli.Gli incidenti di OpenAI e Anthropic sono venuti alla luce dopo settimane di dibattito nel settore tecnologico e nell'amministrazione Trump su come il governo dovrebbe reagire alla capacità dei più recenti modelli di intelligenza artificiale di individuare falle nella sicurezza informatica. A giugno, il presidente Donald Trump ha firmato un ordine esecutivo volto a consentire al governo statunitense di esaminare in anteprima i modelli di intelligenza artificiale più avanzati che potrebbero comportare rischi per la sicurezza. Non sono ancora definite le modalità di attuazione.