Dass KI-Agenten des US-Unternehmens OpenAI eine Testumgebung verlassen und die Plattform Hugging Face angegriffen haben, ist bereits bekannt. Neue Einblicke in die Systemprotokolle zeigen nun jedoch detailliert, wie die Modelle während des Angriffs untereinander kommunizierten.Anzeige

Aus dem von OpenAI selbst veröffentlichten technischen Bericht gehen die aus den internen Protokollen stammenden Dialoge detailliert hervor. Die Systemaufzeichnungen zeigen, wie sich die KI-Modelle über ein improvisiertes Kommunikationsforum austauschten und dabei Verhaltensweisen an den Tag legten, die weit über die rein technische Ausführung von Code hinausgehen. Wie Futurism in einer Analyse der Dokumente anmerkt, lassen die Protokolle geradezu gespenstische Muster erkennen.

KI-Agenten nutzen fremde Infrastruktur für interne Kommunikation

Alles begann mit der unautorisierten Zweckentfremdung eines Paketverwaltungsdienstes namens Artifactory. Diesen Dienst nutzten die Agenten, die eigentlich isoliert voneinander arbeiten sollten, als digitales schwarzes Brett.Anzeige

Als einem Modell der Zugriff auf die Nutzerdatenbank des Dienstes gelang, kommentierte es diese Entdeckung auf dem Messageboard. Es schrieb laut den Systemprotokollen: „Verdammt, die Rolle ‘reader’ ist ADMIN? Wir können config/users lesen!“