Quattro incidenti descritti da Anthropic mostrano modelli Claude oltrepassare sandbox e confini operativi. Il caso mette in discussione guardrail, monitoraggio e linguaggio antropomorfico: contenere un’AI non significa averla davvero allineata

Anthropic ha reso noto un quarto episodio in cui Claude ha violato senza permesso un sistema informatico di terzi durante un test di sicurezza fallito a gennaio 2026, dopo aver…

Addestrare i modelli estremamente potenti del futuro affinché siano saldamente allineati è una sfida tecnica irrisolta che richiede una ricerca continua e un’eccellenza operativa…