Anthropic onderzocht na de incidenten bij OpenAI meer dan 140.000 testsessies van zijn model Claude. Daarbij ontdekte het dat het in drie sessies was misgelopen, schrijft het bedrijf in een blog.

Hoewel de modellen tijdens de tests te horen kregen dat ze geen toegang hadden tot het internet, hadden ze die door een foute instelling in de praktijk toch. Daar maakten ze handig gebruik van. Ze hackten de systemen van drie bedrijven, onder meer door zwakke wachtwoorden te identificeren. Anthropic maakte niet bekend om welke bedrijven het gaat.

De modellen, verschillende versies van Claude, kregen testopdrachten zodat Anthropic kon zien waartoe ze in staat waren. Zo moesten ze op zoek naar verborgen informatie.

Eerder deze maand liet OpenAI weten dat een model op hol was geslagen tijdens een test. Daarbij was de toegang tot het internet daadwerkelijk afgesloten, maar het model slaagde erin de beveiliging te omzeilen en verbinding met het internet te maken, waarna het een online platform hackte.

Volgens Anthropic laten de incidenten zien dat strenge controles nodig zijn. Eerder moesten OpenAI en Anthropic de introductie van hun nieuwste technologieën tijdelijk uitstellen vanwege zorgen van Washington.