Die Serie von Enthüllungen über alarmierende Hackerfähigkeiten führender KI-Modelle reißt nicht ab. Jetzt ertappten britische Sicherheitsforscher künstliche Intelligenz in einem Testlauf beim Versuch, in Eigeninitiative eine Schwachstelle in öffentlich zugängliche Software einzuschleusen. Um damit durchzukommen, versuchte das KI-Modell der Entwicklerfirma Anthropic den Experten zufolge sogar, per E-Mail einen zuständigen Menschen zu manipulieren.

Das KI-Sicherheitsinstitut des britischen Ministeriums für Wissenschaft, Innovation und Technologie hatte den Modellen von Anthropic und des ChatGPT-Entwicklers OpenAI in seinen Tests der Cyberangriffsfähigkeiten absichtlich Zugang zum Internet gewährt.Dabei sei man allerdings davon ausgegangen, dass die KI sich nur Softwarewerkzeuge aus dem Netz holen würde, um die gestellte Aufgabe zu erfüllen. Man habe »nicht vorhergesehen«, dass das Anthropic-Modell Mythos 5 den Internetzugang für Aktivitäten ausnutzen würde, die sich gegen Menschen richten.

Die Forscher räumten auch ein, dass sie das Vorgehen erst nachträglich über eine Auswertung des Datenverkehrs entdeckten. In künftigen Tests wollen sie die Datenströme in Echtzeit besser beobachten.Anthropic und OpenAI hatten in den vergangenen Wochen bereits einräumen müssen, dass ihre KI-Modelle in Tests ungeplant in Computersysteme echter Unternehmen eingedrungen war (mehr hier ). Diese Eingeständnisse hatten die schon seit Jahren bestehende Sorge vor Cyberattacken mithilfe künstlicher Intelligenz verstärkt.