Nel apporto del 30 luglio, Anthropic aveva affermato che gli incidenti sembravano più simili a fallimenti operativi e che, a quanto pareva, Claude aveva attaccato obiettivi reali su Internet, ritenendo che tali obiettivi facessero parte di una simulazione.Tuttavia, ora rilascia un nuovo report, dal titolo “An alignment assessment of recent cybersecurity incidents”, in cui sottolinea che il ragionamento di Claude sembri invece orientato a credere che Internet sia simulato, nonostante le numerose evidenze del contrario.“Gli incidenti analizzati da Anthropic mettono in evidenza un limite concreto dei sistemi agentici avanzati. Non basta valutare ciò che un modello sa fare. Conta anche come interpreta il contesto, quanto riesce a rispettare i confini operativi e se è in grado di fermarsi quando emergono segnali che rendono l’azione rischiosa o non più chiaramente autorizzata”, commenta Giovanni Masi, Computer Science Engineer.Nei futuri sistemi di IA sempre più capaci, il disallineamento avrà il potenziale di provocare danni più gravi. Anthropic ammette che la sfida tecnica tuttora irrisolta.Secondo Claudio Telmon, Senior Partner – Information & Cyber Security di P4I – Partners4Innovation, “questa analisi mostra due temi ricorrenti e preoccupanti”, Ecco quali.Indice degli argomenti