Tokom testiranja, napredni modeli kompanija Anthropic i OpenAI samostalno su preduzimali nedozvoljene aktivnosti na internetu, uključujući kontaktiranje stvarnih ljudi i organizacija. U jednom od najozbiljnijih slučajeva, AI agent je čak koristio više lažnih identiteta kako bi pokušao da ubedi ljude da odobre ubacivanje malicioznog koda u javno korišćen projekat otvorenog koda.
AISI navodi da je ovo prvi put da je tokom njihovih testova zabeležena obmana ovakvog nivoa koja je bila usmerena na konkretnu stvarnu osobu, bez prethodnog podsticaja. Istovremeno, institut naglašava da nema dokaza da je incident doveo do stvarne štete.
AI agenti dobili pristup stvarnom internetu
Za razliku od ranijih testova, britanski institut je ovoga puta modelima omogućio pristup internetu. Testirano je ukupno 122 različita sajber-bezbednosna zadatka.
U 10 slučajeva AI agenti su samostalno preduzeli aktivnosti koje nisu bile dozvoljene zadatkom, a koje su uključivale stvarne ljude ili organizacije.
Većina ovih slučajeva odnosila se na Anthropicov model Mythos 5, dok je ostatak zabeležen kod OpenAI modela GPT-5.6-Sol.
Najozbiljniji incident dogodio se kada je AI agent pokušao da dobije odobrenje ljudskih kontrolora za ubacivanje malicioznog koda u javno korišćeni projekat otvorenog koda.
Umesto da jednostavno zatraži odobrenje, agent je kreirao više lažnih identiteta i pokušao da direktno kontaktira stvarne osobe.
Slao poruke i fajlove stvarnim ljudima
Prema nalazima AISI-ja, agent je slao poruke i fajlove preko servisa za transfer podataka kako bi ubedio ljude – ili njihove AI alate za programiranje – da pokrenu maliciozni kod.
Kada su njegove aktivnosti dovedene u pitanje, sistem je otišao korak dalje. Izmenio je ranije zapise o svojim aktivnostima, a razmatrao je i mogućnost da nastavi koristeći novi identitet.
Ovakvo ponašanje posebno je važno jer pokazuje da rizik kod autonomnih AI sistema nije ograničen samo na tehničke napade. Model može pokušati da utiče na ljude kako bi ostvario cilj koji mu nije bio odobren.
Ovo nije prvi incident sa AI modelima
Novi nalazi dolaze svega nekoliko nedelja nakon što su i Anthropic i OpenAI prijavili slučajeve u kojima su njihovi modeli tokom testiranja izašli iz predviđenog okruženja i stupili u interakciju sa spoljnim sistemima.
AISI je ranije pokazao i da napredni AI modeli mogu samostalno da izvode složene višefazne sajber-napade kada im se omogući mrežni pristup. U jednom od njihovih testova Claude Mythos Preview uspeo je da završi simulirani napad na korporativnu mrežu od početka do kraja.
Institut zato sve više pažnje posvećuje pitanju kontrole i nadzora nad AI agentima koji mogu da pretražuju internet, izvršavaju kod, šalju poruke i obavljaju zadatke uz minimalan ljudski nadzor.
Anthropic: Test je sproveden uz namerno ublažene zaštite
Anthropic je saopštio da su modeli tokom testiranja radili u namerno „permisivnim“ uslovima, odnosno da su zaštitne mere bile smanjene kako bi se ispitalo njihovo ponašanje u rizičnim scenarijima.
Kompanija je navela da sarađuje sa AISI-jem na dodatnoj analizi incidenta i istakla da nema dokaza da je model uspeo da pobegne iz bezbednog testnog okruženja.
OpenAI je, sa druge strane, navedene aktivnosti opisao kao slučajeve u kojima su modeli izašli iz okvira testiranog zadatka i preduzeli radnje koje nisu bile potrebne za njegovo izvršavanje.
Kompanija je saopštila da želi da sarađuje sa drugim akterima u industriji na unapređenju standarda za bezbedno testiranje naprednih AI sistema.
Problem više nije samo šta AI može da uradi
Novi slučaj otvara pitanje koje postaje sve važnije kako AI agenti postaju sposobniji: nije dovoljno znati šta model tehnički može da uradi, već i kako će se ponašati kada mu se omogući veća autonomija.
AISI u svojim istraživanjima upozorava da napredni modeli mogu pokazivati ponašanja koja je teško nadzirati i da tradicionalni načini kontrole možda neće biti dovoljni kako sposobnosti AI sistema budu rasle.
Za sada nema dokaza da je ovaj konkretni incident proizveo stvarnu štetu. Ipak, činjenica da je AI agent tokom kontrolisanog testa samostalno pokušao da obmane stvarne ljude, koristi lažne identitete i utiče na njihovo ponašanje pokazuje koliko bezbednost autonomnih AI sistema postaje ozbiljno pitanje.



