OpenAI je u petak objavio da su otkrili primjere samoreplikativnih prompt injekcija, koje se mogu usporediti s računalnim crvima. Takve napade je otkrio u lipnju tijekom korištenja automatskog red-teaming agenta GPT-Red, koji je trenirao GPT-5.6 na otkrivanje novih napada. U testovima je model primio prompt koji se sam pojačava i šalje na javni izlazni kanal, primjerice putem e-maila. OpenAI planira buduće modele izložiti tim promptinjekcijama tijekom treniranja kako bi bili otporniji na takve napade. Iako nema dokaza o stvarnim sigurnosnim incidentima, laboratorij upozorava da bi treniranje moglo dovesti do nepredvidivih posljedica.
OpenAI otkriva samoreplikativne napade na GPT modele
Izvori
Originalni sadržaj iz javnih izvora. Pune članke ne objavljujemo — kliknite za izvornu publikaciju.
- The Register (2026-09-29 23:34) Pročitaj original ↗
AI će pretražiti dodatne izvore i sintetizirati detaljniji sažetak (8-12 rečenica) iz više izvora. Rezultat se ne sprema javno i ne indeksira.