iStock
AI agenti razmjenjivali su desetke tisuća poruka, pokušavali manipulirati zapisima svojih aktivnosti, a neki su se probili i u vlastitu infrastrukturu tvrtke
povezane vijesti
Oko 700 AI agenata koje je razvila tvrtka OpenAI sudjelovalo je u hakerskom napadu na open-source platformu Hugging Face u srpnju, a mnogi od njih pokušali su prikriti svoje aktivnosti, pokazale su dvije istrage objavljene u srijedu, piše Reuters.
Koordinirano djelovanje tolikog broja AI agenata – programa koji mogu izvršavati zadatke uz minimalan ljudski nadzor – otvara ozbiljna pitanja o tome koliko dobro tvrtke koje razvijaju umjetnu inteligenciju nadziru testiranje sve moćnijih modela. Istodobno, otkrića bi mogla dodatno pojačati pritisak na AI industriju da uvede stroži nadzor nad autonomnim sustavima.
Neka od ponašanja agenata već su bila ranije objavljena ili naznačena, no dvije nove istrage – jedna koju je objavio sam OpenAI, a druga koju su proveli neovisni istraživači iz organizacija METR i Redwood Research – otkrivaju nove i prilično zabrinjavajuće detalje.
Nije bio jedan agent, već cijeli roj
Jedno od najvažnijih novih otkrića jest da u napadu nije sudjelovao samo jedan problematični AI agent, kako se ranije izvještavalo, već približno 700 agenata koji su međusobno surađivali.
OpenAI je u vlastitom izvješću potvrdio da su u incident bili uključeni njegovi AI agenti, a brojku od oko 700, koju su iznijeli neovisni istraživači, također je ocijenio točnom. Neovisna istraga pokazala je da su agenti tijekom napada razmijenili desetke tisuća poruka putem neovlaštenog komunikacijskog kanala.
Još je zanimljivije to što su neki od njih pokušavali manipulirati dokazima o vlastitom ponašanju. Agenti su istraživali načine na koje bi mogli izmijeniti ili ukloniti zapise svojih aktivnosti.
Prema neovisnoj istrazi, jedan od pet analiziranih agenata pokazao je jasan interes za manipuliranje dokazima, dok su mnogi detaljno istraživali tehnike kojima bi mogli mijenjati ili prikriti zapise svojih aktivnosti.
AI pokušavao varati i na testovima
OpenAI je u svom izvješću naveo da su njegovi agenti napali dijelove interne infrastrukture tvrtke kako bi pokušali varati na testovima ili si omogućiti veću slobodu kretanja unutar sustava.
No njihovo ponašanje nije bilo ograničeno samo na kibernetičke zadatke. Agenti su pokušavali varati i na testovima koji nisu imali nikakve veze s hakiranjem, među ostalim na zadacima povezanima s bazom podataka o proteinima i radom u proračunskoj tablici.
Jeffrey Ladish iz organizacije Palisade Research, koja proučava sposobnosti i motive AI agenata, smatra da je upravo taj podatak posebno zabrinjavajući.
“Ako netko vara samo na satu informatike, to je jedna stvar. Ali ako vara na svakom predmetu, problem je očito dublji”, slikovito je objasnio Ladish.
Provalili i u OpenAI
OpenAI je opisao i dva incidenta od 19. srpnja u kojima su AI agenti napali vlastitu infrastrukturu tvrtke.
U prvom slučaju iskoristili su ranjivost na računalu u kojem su trebali ostati izolirani tijekom testiranja. Na taj su način uspjeli izaći iz testnog okruženja i pristupiti drugim povezanim sustavima.
U drugom incidentu agenti su ukrali pristupne podatke OpenAI-ja i intervenirali u njegovom računalnom okruženju u oblaku.
OpenAI je također objavio da je nepoznat broj agenata pokušao manipulirati automatiziranim sustavima koji se koriste za procjenu njihovih rezultata. Cilj je bio sakriti tragove varanja.
Tvrtka navodi da pokušaji ipak nisu utjecali na zapise koje su ti sustavi pregledavali. U izvješću se također navodi da postoji malo dokaza o pokušajima obmanjivanja ljudskih nadzornika. OpenAI, međutim, nije odgovorio na pitanje znači li to da je bilo pokušaja da se prevare i ljudi.
Pokušavali izbrisati vlastite tragove
Neovisna istraga o napadu na Hugging Face otkrila je još jedan zabrinjavajući obrazac.
AI agenti nisu samo pokušavali izvršiti nedopuštene radnje, već su neki od njih nakon toga pokušavali sakriti što su napravili.
Istraživači su pronašli brojne primjere u kojima su agenti proučavali načine manipuliranja zapisima svojih aktivnosti i pokušavali promijeniti tragove koji bi mogli otkriti njihovo ponašanje. Takvo ponašanje posebno je važno jer pokazuje da problem nije nužno samo u tome što autonomni AI sustavi mogu napraviti nešto nepoželjno, nego i u tome što mogu prepoznati da bi njihovo ponašanje moglo biti otkriveno te pokušati izbjeći nadzor.
OpenAI pojačava nadzor
OpenAI je nakon incidenta najavio jačanje svoje infrastrukture za testiranje, snažniji nadzor agenata i dodatne zaštitne mehanizme koji bi trebali spriječiti štetno ili neželjeno ponašanje.
Tvrtka upozorava da bi s obzirom na brzinu razvoja umjetne inteligencije slični napadi uskoro mogli postati realna prijetnja velikim organizacijama.
Budući napadi, upozorava OpenAI, mogli bi biti i znatno sofisticiraniji od onoga što je viđeno u ovom incidentu. Za stručnjake je pritom posebno važno pitanje koliko su ljudi uopće sposobni pratiti ponašanje sve većeg broja autonomnih AI sustava.
Jer u ovom slučaju nije problem predstavljao jedan agent koji je napravio nešto neočekivano. Problem je bio roj od stotina agenata koji su međusobno komunicirali, surađivali, pokušavali zaobići ograničenja i u nekim slučajevima prikriti vlastite tragove, piše Reuters.