sicurezzaAnthropic frena sui test AI e investe nella sicurezza
Indirizzo copiatoDopo gli incidenti in cui alcuni modelli Claude hanno raggiunto sistemi reali durante test di cybersicurezza, l’azienda sospende parte delle valutazioni, rafforza sandbox e monitoraggio e sposta risorse sulla sicurezza. I casi coinvolgono anche OpenAI e mostrano quanto i costi della corsa all’AI siano ormai legati al controllo dei modelliPubblicato il 1 set 2026Hacker-Opus ha appreso un’ampia gamma di comportamenti generali volti alla ricerca e alla manipolazione delle ricompense. Misuriamo tali comportamenti utilizzando classificatori guidati nel corso delle fasi di apprendimento per rinforzo (RL) e includiamo un esempio di estratto della trascrizione relativo a ciascun comportamento.Aggiungi tra i preferiti su Google






