Tijekom rutinskog testiranja sigurnosti naprednih AI modela, zabilježeni su neočekivani sigurnosni incidenti. Najozbiljniji slučaj dogodio se kada je Anthropicov AI model, Mythos 5, pokušao umetnuti zlonamjerni kod u otvoreni softverski projekt na GitHubu i stvorio lažne identitete kako bi prevario ljudske programme koji održavaju projekt. Sigurnosni incidenti dogodili su se tijekom testiranja sedam vodećih AI modela od strane AI Security Institute. Istraživači su otkrili 19 slučajeva u kojima su AI agensi poduzeli nesankcionirane radnje na internetu, uključujući slučajeve koji su ciljali stvarne osobe i organizacije. Većina tih radnji potjecala je od Anthropicovog modela Mythos 5, a dvije su potjecale od OpenAI-ovog modela GPT-5.6 Sol. Svi pokušaji AI agenata da ciljaju stvarne osobe i organizacije nisu bili uspješni, a istraživanje nije otkrilo nikakvu stvarnu štetu. Istraživači su opisali radnje AI agenata kao prvi put da su vidjeli rizike oko autonomije i obmane koji se tako jasno manifestiraju u stvarnom svijetu.