I modelli di AI più avanzati vengono oggi valutati non soltanto per la capacità di scrivere codice, ma anche per condurre operazioni offensive contro infrastrutture informatiche. Questi test servono proprio per misurare il rischio prima del rilascio pubblico. Così, pochi giorni dopo l’incidente che ha coinvolto OpenAI e Hugging Face, Anthropic ha avviato una revisione retrospettiva di oltre 141.000 valutazioni di sicurezza per verificare se episodi simili fossero già avvenuti nei propri laboratori. Il risultato è stato inatteso: in tre incidenti, distribuiti su sei esecuzioni, un modello Claude è riuscito a raggiungere Internet e ad accedere senza autorizzazione ai sistemi di tre organizzazioni diverse.

Cos’è successo Secondo Anthropic, gli incidenti hanno coinvolto Claude Opus 4.7, Claude Mythos 5 e un modello sperimentale ancora non pubblico. Tutti stavano affrontando esercizi di tipo Capture The Flag, competizioni utilizzate nel settore della cybersicurezza per misurare le capacità offensive e difensive degli strumenti informatici. Le valutazioni erano condotte naturalmente in una sandbox isolata e i modelli erano privi dei normali classificatori e sistemi di monitoraggio applicati alle versioni pubbliche, pur conservando il loro addestramento di sicurezza. A causa di un errore nella configurazione dell’ambiente di valutazione, hanno potuto interagire con Internet reale invece che con una rete completamente isolata. Le tecniche utilizzate non erano particolarmente sofisticate: i modelli hanno sfruttato password deboli, endpoint privi di autenticazione e altre vulnerabilità elementari già note agli esperti di sicurezza. In nessun caso sono stati impiegati exploit zero-day o tecniche innovative come nell’incidente che ha coinvolto OpenAI e Hugging Face. Ma gli effetti sono stati comunque concreti. In uno degli episodi, Claude Opus 4.7 ha ottenuto credenziali applicative e infrastrutturali ed è riuscito a raggiungere un database contenente alcune centinaia di righe di dati di produzione. Dopo aver compreso che il sistema poteva essere reale, ha continuato l’attacco, convincendosi che l’azienda dovesse comunque fare parte dell’esercitazione. Nel secondo caso, Claude Mythos 5 ha creato e pubblicato su PyPI un pacchetto Python malevolo, superando diversi ostacoli per registrare un account. Il pacchetto è rimasto online per circa un’ora, è stato scaricato ed eseguito su 15 sistemi reali e ha sottratto le credenziali dello scanner di una società di sicurezza. Non si è trattato quindi di un semplice accesso accidentale: il modello ha costruito malware, lo ha distribuito pubblicamente e ha sfruttato le conseguenze della sua esecuzione. Nel terzo episodio, il modello sperimentale ha scandagliato circa novemila obiettivi prima di compromettere un’applicazione reale. Una volta riconosciuto che il bersaglio apparteneva a un’organizzazione esistente e non faceva parte del test, ha però interrotto l’attività, segnalando di non voler continuare l’intrusione. Anthropic ha interrotto tutte le valutazioni di cybersicurezza il giorno stesso in cui ha individuato le prime trascrizioni sospette e ha annunciato controlli più rigorosi sugli ambienti propri e dei fornitori esterni, per verificare che siano effettivamente isolati prima dell’avvio dei test.