Na ChatGPT is het nu de beurt aan Claude. Voor de tweede keer in ruim een week erkent een groot AI-bedrijf dat hun modellen tijdens veiligheidstests op het open internet belandden. Anthropic maakte donderdag bekend dat zijn model Claude na de ‘uitbraak’ wist door te dringen tot systemen van drie andere bedrijven. Opnieuw wordt duidelijk waartoe AI-systemen in staat zijn als hun makers veiligheidsonderzoeken onzorgvuldig uitvoeren.

De modellen van maker Anthropic deden oefeningen in testomgevingen die eigenlijk van het internet afgesloten hadden moeten zijn, maar dat door een misverstand niet waren. De vroegste incidenten vonden plaats in april; Anthropic ontdekte het pas deze week, doordat het bedrijf na de melding van een incident bij OpenAI (van taalmodel ChatGPT) ging uitzoeken of vergelijkbare incidenten zich ooit bij henzelf hadden voorgedaan. Het bedrijf stuitte op drie incidenten, waarbij in het ernstigste geval inloggegevens werden buitgemaakt en een databank met bedrijfsdata werd bereikt.

Anthropic spreekt zelf van een „operationele fout”, niet van een model dat kwaad wilde

Hoe kon dat gebeuren? Bij Anthropic betrof de oorzaak een „wederzijds misverstand” met het AI-veiligheidsbedrijf waarmee het samenwerkte. Claude bleek toegang tot het internet te hebben, terwijl dat niet de bedoeling was. Volgens Anthropic gebruikten zijn AI-modellen vervolgens „eenvoudige technieken” om de getroffen bedrijven te hacken, zoals het misbruiken van zwakke wachtwoorden en onbeveiligde toegangspunten.