Desetine hiljada incidenata sa vještačkom inteligencijom: OpenAI zaustavlja razvoj najnaprednijih modela, sistemi izmiču kontroli?

OpenAI, Anthropic i stručnjaci za bezbjednost istražuju desetine hiljada incidenata u kojima su napredni modeli vještačke inteligencije prekršili bezbjednosne protokole ili preduzeli korake koje su spoljni procjenitelji ocijenili kao problematične.
Prema informacijama do kojih je došao Axios, veliki broj takvih slučajeva zabilježen je posljednjih mjeseci, tokom internih testiranja, ali i u stvarnoj primjeni. To ukazuje na to da je problem složeniji nego što se do sada mislilo.
Istovremeno se postavlja pitanje da li vodeće kompanije u oblasti vještačke inteligencije uopšte mogu da uspostave potpunu kontrolu nad tehnologijom koju razvijaju, prenosi Index.
Šta su AI modeli radili?
Među zabilježenim incidentima su zaobilaženje bezbjednosnih protokola, samostalno pokretanje internet foruma za komunikaciju, izlazak iz izolovanih testnih okruženja, odnosno takozvanih „sandboxova“, preuzimanje kontrole nad internet stranicama i pokušaji izbjegavanja ljudskog nadzora.
Neki od ovih slučajeva dogodili su se tokom internih testiranja, dok su drugi zabilježeni u stvarnom okruženju. Mnogi još nisu javno objavljeni jer stručnjaci za bezbjednost nastavljaju da ih istražuju.
Dio testiranja sprovodi se kroz takozvani „red teaming“, odnosno namjerno podsticanje modela da se ponašaju na neprimjeren način kako bi kompanije proverile koliko su njihovi sistemi bezbjedni.
Problematično ponašanje autonomnih AI agenata postaje sve češća tema u razvoju napredne vještačke inteligencije.
Kompanije pokušavaju da postave zaštitne mehanizme, dok sve sposobniji sistemi nastoje da izvrše zadatke čak i kada to znači zaobilaženje pravila.
OpenAI privremeno zaustavlja razvoj najnaprednijih modela
Incidenti se razlikuju po ozbiljnosti i uključuju i uspješne i neuspješne pokušaje zaobilaženja postavljenih pravila.
Za većinu njih zasad nema dokaza da su izazvali štetu u stvarnom svijetu.
Prema navodima izvora, ukupan broj slučajeva mogao bi da bude i znatno veći od nekoliko desetina hiljada.
OpenAI je posljednjih dana objavio više izvještaja o zabrinjavajućem ponašanju svojih sistema.
Među njima su slučajevi u kojima su OpenAI-jevi agenti na internetu objavili 53 slike korisnika ChatGPT-a, pristupili internet stranici australijske vlade i pokušali da hakuju druge sajtove, uključujući stranice američke vlade.
O tome su, pored kompanije i izvora, izvijestili i Rojters i Njujork Tajms.
OpenAI je saopštio da privremeno obustavlja obuku, evaluaciju i pokretanje svojih najnaprednijih modela koji koriste alate. Kompanija navodi da će sa radom nastaviti tek kada bude sigurna da su uvedene dodatne zaštitne mjere i poboljšana usklađenost sistema.
Direktor OpenAI-ja Sam Altman napisao je na platformi Iks (X) da interna revizija „ne napreduje onoliko brzo koliko bi željeli“.
Altman je posebno izdvojio incident povezan sa platformom Hugging Face kao najozbiljniji slučaj koji je kompanija do sada zabilježila.
U tom slučaju grupa od 100 AI agenata koordinirala je aktivnosti preko foruma i hakovala spoljnu kompaniju kako bi poboljšala rezultate na testu sajber-bezbjednosti.
Slični problemi zabilježeni su i kod Anthropica
Anthropic je angažovao spoljnu organizaciju za bezbjednost kako bi ispitala ponašanje njegovih modela.
Kompanija je u javno dostupnim dokumentima objavila podatke o tome koliko često se pojavljuju epizode takozvane „neusklađenosti“, odnosno situacije u kojima se model ponaša na način koji nije u skladu sa postavljenim pravilima.
U izvještaju o modelu Opus 5.5, objavljenom ove nedjelje, navodi se da je model pokušao da napusti bezbjedno testno okruženje u 1,5 odsto slučajeva. Kompanija, međutim, napominje da su u pitanju bili eksperimenti u kojima zadatak nije mogao da bude riješen bez takvog koraka.
Kada kompanije sprovode stotine hiljada testiranja, čak i mali procenat ovakvog ponašanja može da znači desetine hiljada slučajeva u kojima su modeli reagovali neočekivano ili zabrinjavajuće.
Zašto je ovo problem?
Incident sa Hugging Faceom, kao i nekoliko drugih slučajeva, podstakao je pojedine lidere iz industrije vještačke inteligencije da pozovu na usporavanje razvoja i strožu regulaciju na nacionalnom i međunarodnom nivou.
U OpenAI-ju, međutim, neki smatraju da je incident sa Hugging Faceom bio izolovan slučaj i da bi budući incidenti mogli da budu manje ozbiljni zahvaljujući boljim kontrolama i specifičnostima samog testa, koji je uključivao model koji još nije bio dostupan javnosti.
Stručnjaci za bezbjednost AI sistema navode da postoje jednostavne mjere koje kompanije mogu da uvedu kako bi smanjile mogućnost ponavljanja situacije poput one sa Hugging Faceom.
Ipak, drugi direktori i istraživači upozoravaju da nisu sigurni da kompanije mogu da spriječe svako problematično ponašanje naprednih modela.
Nova generacija AI sistema izvršava zadatke sa velikom upornošću, pa je ograničavanje njihove sposobnosti da pronađu nove načine za rješavanje problema sve teže. Nemoguće je unaprijed predvidjeti svaki način na koji bi neki sistem mogao da zaobiđe postavljena pravila.
Lideri AI kompanija navode da modeli često pronalaze načine za zaobilaženje pravila koji ljudskim inženjerima ne bi pali na pamet.
Jedan stručnjak za sajber-bezbjednost zato je ocijenio da je pokušaj sastavljanja savršenog spiska svega što je modelima dozvoljeno, odnosno zabranjeno, vjerovatno uzaludan posao.
Stručnjaci upozoravaju da je ovo možda samo dio problema
Zabrinutost raste jer, ako model više puta preduzme problematičan potez tokom testiranja, povećava se mogućnost da bi slično ponašanje jednog dana moglo da dovede do stvarnog sajber-bezbjednosnog incidenta.
- Ono što smo vidjeli u vezi sa aktivnostima ovih agenata samo je djelić cjelokupne slike - rekao je istraživač Konrad Štoš iz nezavisne organizacije Transluce, koja se bavi procjenom vještačke inteligencije.
Konor Lihi, istraživač i direktor organizacije ControlAI, smatra da nije najvažnije koliku je štetu izazvao svaki pojedinačni slučaj. Ono što je, prema njegovim riječima, posebno zabrinjavajuće jeste to što autonomni sistemi preduzimaju radnje koje su im izričito zabranjene, a neke od tih radnji potencijalno bi mogle da predstavljaju i krivična djela.