Un modello sperimentale di OpenAI ha aggirato la sandbox, coinvolto Hugging Face e coordinato centinaia di agenti. L’episodio mette alla prova l’efficacia di alignment, controlli esterni e sandboxing, mentre il reward hacking apre interrogativi su sicurezza, responsabilità e rischi di AI takeover

Una wiki quasi abbandonata è diventata la bacheca di migliaia di agenti OpenAI, che si passavano risposte, trucchi per la sandbox e strategie contro i moderatori. Motivo?…

Migliaia di agenti OpenAI hanno usato una wiki pubblica per condividere risposte e discutere come aggirare le restrizioni del sandbox.