Nel caso Hugging Face, gli agenti AI hanno trattato il confine dell'ambiente di test come un ostacolo tra loro e il punteggio massimo. Ecco i precedenti e il fenomeno del Reward hacking nell'era degli agenti AI, pronti a trattare ogni confine, tecnico o procedurale, come un elemento dell'ambiente da aggirare per massimizzare il punteggio

Nel caso Hugging Face, gli agenti AI hanno trattato il confine dell'ambiente di test come un ostacolo tra loro e il punteggio massimo. Ecco i precedenti e il fenomeno del Reward…

Il rapporto pubblicato mercoled� ricostruisce un test interno finito fuori controllo: circa 1.200 agenti si sono coordinati su un gestore di pacchetti, hanno ricomposto…