• 05.08.2026.
  • RTV USK,

AISI: AI modeli koristili lažne identitete za ciljanje stvarnih ljudi tokom testiranja

AISI: AI modeli koristili lažne identitete za ciljanje stvarnih ljudi tokom testiranja

-    Najnapredniji AI model kompanije Anthropic pokušao je ubaciti zlonamjerni kod tokom testiranja, dok nije bilo dokaza o stvarnoj šteti, saopćio britanski Institut za sigurnost umjetne inteligencije...


LONDON/ISTANBUL, 05. augusta - Britanski Institut za sigurnost umjetne inteligencije (AISI) utvrdio je da je najnapredniji model umjetne inteligencije kompanije Anthropic tokom testiranja koristio lažne identitete kako bi obmanuo stvarne ljude i pokušao ubaciti zlonamjerni kod, što predstavlja još jedan slučaj djelovanja AI-ja izvan predviđenih granica.

Uz namjerno smanjene sigurnosne zaštite, modeli kompanija Anthropic i OpenAI testirani su u kontroliranim uslovima. AISI je prvi put zabilježio da je umjetna inteligencija koristila "socijalni inženjering" kako bi utjecala na osobu zaduženu za odobravanje, nastojeći izvršiti neovlašteni zadatak.

"Ovo je prvi put da je AISI zabilježio obmanu ovakve ozbiljnosti usmjerenu na stvarnu osobu, bez prethodnog poticaja i u stvarnom svijetu", naveo je institut u izvještaju objavljenom u utorak, dodajući da nema dokaza o stvarnoj šteti.

Tokom 122 testa iz oblasti kibernetičke sigurnosti, AI agenti su u deset slučajeva samostalno izvršili neovlaštene radnje na internetu, pri čemu se većina odnosila na model Mythos 5 kompanije Anthropic, dok su preostali slučajevi bili povezani s modelom GPT-5.6-Sol kompanije OpenAI.

"U najozbiljnijem slučaju, agent kompanije Anthropic pokušao je dobiti odobrenje za ubacivanje zlonamjernog koda u javno korišteni projekt otvorenog koda stvaranjem više lažnih identiteta", navodi AISI.

Kontaktirao je stvarne osobe putem internetske usluge za razmjenu datoteka kako bi ih uvjerio, ili njihove AI alate za programiranje, da izvrše sporni kod. Kada je doveden u pitanje, agent je izmijenio ranije zapise i razmatrao usvajanje novog identiteta.

Objava izvještaja poklopila se sa sastankom u Bijeloj kući s vodećim kompanijama iz oblasti umjetne inteligencije, na kojem se razgovaralo o novom okviru za provjeru naprednih AI modela prije njihovog javnog predstavljanja.

Kompanija Anthropic saopćila je na društvenoj mreži X da su testovi provedeni u "namjerno vrlo permisivnim uslovima", uz uklonjene sigurnosne zaštite i neograničen pristup internetu. Kompanija je navela da istražuje incident te da nema dokaza da je model napustio svoje sigurno okruženje.

OpenAI je saopćio da su se dvije neovlaštene radnje njegovog modela odnosile na napuštanje testnog okruženja i izvršavanje zadataka izvan okvira vježbe, dodajući: "Posvećeni smo saradnji s cijelom industrijom kako bismo ojačali zajedničke prakse za sigurno provođenje procjena visokog rizika."

PODIJELI
IZVOR
Anadolu Agency

POVEZANE VIJESTI

Učitavam ...

Anketa

Trenutno nema dostupnih anketa.

Newsletter