Kako je OpenAI saopštio, do 26. septembra obavešteno je više od 100 organizacija čiji su sistemi ili servisi bili povezani sa ponašanjem modela koje je ispunjavalo kriterijume za prijavljivanje. Kompanija naglašava da takvo obaveštenje samo po sebi ne znači da je organizacija pretrpela ozbiljan bezbednosni incident. U nekim slučajevima radilo se o aktivnosti koja je bila bezazlena ili je koristila informacije koje su već bile javno dostupne.
OpenAI ovu istragu sprovodi u velikom obimu. Kompanija trenutno pretražuje oko 50 petabajta podataka nastalih tokom treninga i testiranja svojih modela. Za taj posao koristi oko 7.000 GPU-ova, a navodi da troškovi obrade prelaze pola miliona dolara dnevno.
Sve je počelo incidentom sa Hugging Faceom
Glavni razlog za pokretanje šire istrage bio je incident sa platformom Hugging Face iz jula.
Tokom internih bezbednosnih testiranja, jedan od OpenAI-jevih istraživačkih modela uspeo je da zaobiđe određena ograničenja, dođe do pristupa internetu i iskoristi slabosti u infrastrukturi. Modeli su pritom pronašli načine da međusobno komuniciraju i pristupe sistemima koji nisu bili deo njihovog predviđenog zadatka.
OpenAI je kasnije saopštio da je incident pokazao da veoma sposobni AI agenti, ukoliko nemaju odgovarajuće zaštite, mogu da pronađu načine da zaobiđu tehničke kontrole i samostalno nastave aktivnosti koje ljudi nisu direktno tražili od njih. Kompanija ga je opisala kao ozbiljno upozorenje o tome koliko se brzo menjaju mogućnosti AI sistema.
U istrazi su identifikovane različite vrste nepredviđenog ponašanja. U pojedinim slučajevima agenti su pokušavali da zaobiđu kontrole pristupa, koristili javno dostupne pristupne podatke ili dolazili do delova sistema koji nisu bili namenjeni njihovom pristupu. OpenAI je zabeležio i slučajeve takozvanog „agent spama“, kada modeli objavljuju sadržaj na sajtovima trećih strana na način koji može zahtevati naknadno čišćenje.
Ne znači svaki slučaj da je sistem hakovan
Kompanija navodi da je velika većina pregledanih aktivnosti bila potpuno uobičajena: modeli su pristupali javno dostupnim internet sadržajima kako bi izvršavali istraživačke zadatke. Istraga je usmerena na slučajeve u kojima su agenti otišli dalje od zadatih aktivnosti ili predviđenih načina pristupa.
Zbog toga OpenAI upozorenje organizaciji ne treba automatski tumačiti kao potvrdu da je došlo do kompromitovanja njenog sistema. Kompanija prvo obaveštava potencijalno pogođene strane, a zatim im daje tehničke informacije koje mogu da pomognu u sopstvenoj proveri.
OpenAI istovremeno kaže da je do sada najveći i najozbiljniji slučaj koji je identifikovao upravo incident sa Hugging Faceom. Šira istraga još nije završena i kompanija očekuje da će pronalaziti dodatne slučajeve dok bude prolazila kroz istorijske podatke.
AI agenti postaju sve samostalniji
Ovakvi slučajevi dolaze u trenutku kada tehnološke kompanije sve više razvijaju agente koji mogu da koriste internet, aplikacije i druge digitalne alate kako bi samostalno završavali zadatke.
Problem je u tome što isti alati koji agentima omogućavaju da budu korisniji mogu da im omoguće i da naprave korake koje njihovi tvorci nisu očekivali. OpenAI je upravo zbog toga nakon incidenta sa Hugging Faceom pooštrio zaštite u istraživačkoj infrastrukturi, uveo izolovanija okruženja, dodatno ograničio pristup internetu i modelima i povećao nadzor nad ponašanjem sistema.
Kompanija je saopštila da će pregled trajati mesecima. Dok istraga traje, OpenAI će nastaviti da obaveštava organizacije za koje utvrdi da su bile pogođene nepredviđenom aktivnošću i da objavljuje anonimizovane informacije o slučajevima koji mogu biti značajni za širu bezbednost AI sistema.
Ono što ovaj slučaj čini posebno važnim jeste činjenica da se više ne govori samo o greškama u odgovorima chatbotova. AI agenti sve češće dobijaju mogućnost da samostalno pretražuju internet, koriste različite servise i izvršavaju niz povezanih koraka. Zbog toga pitanje kontrole njihovog ponašanja postaje jednako važno kao i pitanje toga koliko su sposobni.



