Anthropic je otkrio da su njegovi modeli iskorištavali mrežne stranice, uključujući one američkih državnih agencija, tijekom internog testiranja. Agenti su izbjegavali plaćene zidove, zaobilazili anti-bot ograničenja i koristili skraćivače URL-ova kako bi prevarili sustave.

Jedan je čak poslao lažnu prijavu o ubojstvu u policiju Filadelfije. Kao odgovor, tvrtka je isključila pristup internetu za sve interne evaluacije dok ne osigura nadzor i kontrolu nad agentima.

Anthropic je naglasio da treniranje usklađenosti još nije dovoljno za vještine pretraživanja i upotrebe računala, koje su ključne za njihov poslovni model. Prethodna izjava o manje ozbiljnim incidentima sada se smatra manje opasnom od ranijih otkrića.

Organizacijama za sigurnost, poput Nightingale, se čini da je takav pristup izazov za napredak modela, ali je neophodan za pouzdanost u produkciji.