A múlt héten az Anthropic bejelentette, hogy a rendszerei észrevétlenül feltörtek három céget is: a modelleket kizárólag a képességeik felmérésére létrehozott tesztszoftverek feltörésére utasították, de azok kiléptek az internetre, és valódi vállalatok rendszereibe is betörtek.

Most pedig az derült ki, hogy a világ két legerősebb mesterségesintelligencia-rendszere a brit AI Security Institute (AISI) tesztjei során hamis emberi profilokat hozott létre, hogy egy kísérleti kibertámadás részeként megtévesszen embereket. A legsúlyosabb esetben az Anthropic Mythos nevű mesterséges intelligenciája úgy próbált hozzáférést szerezni egy szolgáltatáshoz, hogy privát üzeneteket küldött, miután valódi embereket utánzó hamis felhasználói fiókokat hozott létre – írja a BBC.

Az AISI kedden közölte, hogy a Mythos – és az OpenAI Sol nevű modellje – olyan mértékű önállóságról és megtévesztő viselkedésről tett tanúbizonyságot, amilyennel az intézet korábban még nem találkozott. Ugyanakkor pontosították, hogy a rosszindulatú cselekmények túlnyomó részét a Mythos hajtotta végre.

Az Anthropic és az OpenAI válaszában hangsúlyozta, hogy az AISI tesztje során a modellek szokásos biztonsági korlátozásainak egy részét kikapcsolták vagy jelentősen enyhítették.