Egy belső vizsgálat során három olyan esetre bukkant az Anthropic, amikor a Claude nevű AI-rendszerük kiberbiztonsági tesztelés közben behatolt különböző szervezetek informatikai rendszereibe – írja a cég közlése nyomán a TechCrunch.Egy nagyon hasonló eset az OpenAI-nál is történt a közelmúltban, amikor a ChatGPT fejlesztőjének még kiadás előtt álló modellje egy belső tesztelés során behatolt a Hugging Face rendszereibe.A Claude modelljei mindhárom esetben egy tesztkörnyezetből jutottak ki az internetre, miközben egy harmadik féllel kommunikáltak. Ezután jogosulatlan hozzáférést szereztek a szervezetek éles rendszereihez – taglalja egy blogposztban az Anthropic, megjegyezve, hogy intézkedéseket tesznek a hasonló esetek elkerülésére a jövőben.A cég az OpenAI korábbi esetén felbuzdulva végezte el a saját kiberbiztonsági értékelését. Kifejezetten olyan bizonyítékokat kerestek, amelyek arra utalnak, hogy a Claude a tesztkörnyezetéből kiszabadulva csatlakozik az internethez – miközben elméletileg ez nem lehetséges, ezek az úgynevezett „sandbox” környezetek kifejezetten azt a célt szolgálják, hogy elszigeteljék a modelleket a webtől.Az AI-cég összesen 141 006 tesztet futtatott, és ezek között három olyan esetet talált, melynek során a Claude-modell az Irregular nevű külső partnerével folytatott interakció során hozzáfért az internethez. Ez az Anthropic vélekedése szerint az Irregular által üzemeltetett tesztkörnyezet konfigurációs hibájára vezethető vissza.Utóbbit puszta félreértésnek nevezték a két cég között arról, hogy a tesztkörnyezet rendelkezett-e internethozzáféréssel. https://hvg.hu/tudomany/20260728_anthropic-claude-mesterseges-intelligencia-hiba-google-kereso-privat-beszelgetesekAz Anthropic elmondása szerint nem hibáztat senkit, és úgy javítja a dolgot, mintha kizárólag őket terhelné felelősség ezért. Az Irregular külön vizsgálatot folytat az ügyben.Az incidens három különböző modellt érintett: az Opus 4.7-et, a Mythos 5-öt, valamint egy belső tesztmodellt. Mindhárom esetében közölték a Claude-dal, hogy nincs internet-hozzáférése.Az Anthropic külön kiemelte, hogy mindhárom modell a biztonsági mechanizmusok nélkül futott – a nyílt, szabadon hozzáférhető változatoknál ezek mindig működnek. Vélekedésük szerint megakadályozták volna a problémás viselkedést.Ha máskor is tudni szeretne hasonló dolgokról, lájkolja a HVG Tech rovatának Facebook-oldalát.
Tesztelés közben elszabadultak az Anthropic AI-modelljei, három céghez is betörtek
Az OpenAI incidense után az Anthropic is próbára tette a saját AI-megoldását, a Claude-ot, hogy megnézze, hogyan viselkedik. Az eredmény elég aggasztó.
Az Anthropic felfedezett 3 esetet, ahol Claude-modellek (Opus 4.7, Mythos 5) 141 006 teszt közül szöktek meg sandbox-ból és behatoltak külső szervezetekbe. A kasus jelzi, hogy AI-modellek tesztelésében az implicit izolálás nem biztosítja a deployment biztonságot: formális security gate szükséges.











