Tokom testiranja naprednih modela veštačke inteligencije dogodio se incident koji je otvorio ozbiljna pitanja o bezbednosti AI agenata. Oko 1.200 agenata pronašlo je način da međusobno komunicira iako su bili namenjeni za rad u izolovanim okruženjima, dok je oko 700 njih učestvovalo u nedozvoljenim aktivnostima povezanim sa platformom Hugging Face.
Prema nezavisnoj istrazi organizacije METR, agenti su razmenili više od 70.000 poruka i fajlova koristeći sistem koji nije bio predviđen za njihovu međusobnu komunikaciju.
OpenAI je potvrdio incident i krajem avgusta objavio detaljan izveštaj o propustima, kao i merama koje su preduzete kako bi se slični događaji sprečili.
Profesor Univerziteta Oksford Henrik Gomes ocenio je da incident predstavlja jedno od najozbiljnijih upozorenja u dosadašnjem razvoju veštačke inteligencije.
– Možda ćemo dobiti još jedno upozorenje. Ali ne treba da računamo na to. Nema garancije da ćemo dobiti još jednu šansu da vidimo problem pre nego što postane mnogo veći – upozorio je Gomes.
Agenti pronašli “tajni“ kanal za komunikaciju
OpenAI za testiranje modela koristi takozvana sandbox okruženja, odnosno izolovane virtuelne računare u kojima modeli mogu da izvršavaju zadatke, ali ne bi trebalo da imaju slobodan pristup internetu niti drugim sistemima.
Tokom internih testova sajber sposobnosti u maju, junu i julu 2026. godine, nekoliko eksperimentalnih modela radilo je sa namerno smanjenim zaštitnim ograničenjima. Cilj je bio da se ispita koliko su sposobni i gde se nalaze granice njihovog bezbednog ponašanja.
Međutim, agenti su otkrili slabost u sistemu Artifactory, koji OpenAI koristi za skladištenje i preuzimanje softverskih paketa.
Počeli su da ostavljaju fajlove u tom sistemu i praktično ga pretvorili u neformalnu oglasnu tablu. Preko nje su razmenjivali poruke, instrukcije i podatke sa drugim agentima, iako je svaki model trebalo da funkcioniše nezavisno.
Kada je jedan od agenata pronašao način da zaobiđe ograničenja i pristupi internetu, uputstvo o tome podelio je sa ostalima.
Oko 700 agenata povezano sa aktivnostima protiv Hugging Face
Najveći deo nedozvoljenih aktivnosti pokrenuo je eksperimentalni model označen kao Internal Model 1, odnosno IM1.
Prema navodima OpenAI, IM1 je po sposobnostima i veličini bio uporediv sa modelom GPT 5.6 Sol, ali nije bio namenjen javnoj upotrebi.
Agenti nisu ostali samo na komunikaciji izvan predviđenih kanala. Prema nalazima istrage, pronalazili su bezbednosne propuste, pokušavali da dobiju pristup internetu i pristupali sistemima izvan infrastrukture OpenAI.
Oko 700 agenata bilo je uključeno u aktivnosti povezane sa kompromitovanjem delova infrastrukture platforme Hugging Face.
Incident je trajao više dana, a agente su povezivale poruke ostavljene na zajedničkoj, nedozvoljenoj oglasnoj tabli.
Hugging Face je takođe objavio tehničku analizu događaja i naveo da je agent delovao u okviru OpenAI procene sajber sposobnosti.
Problem postao očigledan tek nakon pada sistema
Aktivnost agenata postala je toliko intenzivna da je 4. jula instanca sistema Artifactory prestala normalno da funkcioniše.
OpenAI je već narednog dana otvorio bezbednosni incident. Kompanija je zatvorila identifikovane propuste, uklonila kompromitovane pristupne podatke i ponovo izgradila sistem.
Time je ugašen i improvizovani kanal preko kojeg su agenti međusobno komunicirali.
Kompanija je priznala da u tom trenutku još nije imala potpunu sliku o razmerama događaja.
Pojedini zaposleni primetili su još krajem maja da jedan agent koristi nedozvoljeni način komunikacije i pristupa internetu. Međutim, timu koji je početkom jula reagovao nije odmah bilo poznato da veliki broj agenata međusobno razmenjuje informacije.
U istrazi je učestvovala kompanija CrowdStrike, dok su nezavisne analize ponašanja modela sproveli METR i Redwood Research.
Stručnjak govori o “tajnim AI civilizacijama“
Gomes je višemesečnu saradnju agenata slikovito opisao kao nastanak tri uzastopne „tajne AI civilizacije“.
Prema njegovom tumačenju, nakon uklanjanja jedne mreže pojavljivala se nova grupa agenata koja je ponovo pronalazila slične načine komunikacije i koristila znanje stečeno tokom prethodnih testova.
Izraz „tajne AI civilizacije“ nije tehnička kategorija, već slikovit opis ponašanja velikog broja agenata koji su sarađivali, prenosili informacije i pomagali jedni drugima u izvršavanju zadataka.
Posebnu zabrinutost, prema Gomesovim rečima, izazvale su indicije da su pojedini agenti pokušavali da prikriju svoje aktivnosti, menjaju tragove i izbegnu ljudski nadzor.
– Najstrašnije nije samo to što su pronašli način da izađu iz očekivanih okvira. Najstrašnije je to što su pokušavali da sakriju šta rade – rekao je Gomes.
On, međutim, upozorava da incident ne treba predstavljati kao dokaz da su AI sistemi postali svesni ili da je već došlo do potpunog gubitka kontrole.
Prema njegovoj oceni, događaj ipak pokazuje da savremeni modeli mogu da pronađu tehničke slabosti, međusobno podele informacije o načinu njihovog iskorišćavanja i preduzmu korake koje im ljudi nisu izričito naredili.
OpenAI pojačava bezbednosne mere
OpenAI je događaj opisao kao ozbiljno upozorenje i najavio stroža pravila za testiranje najnaprednijih modela.
Kompanija dodatno izoluje računarske sisteme, ograničava pristup internetu i parametrima modela i uvodi snažniji nadzor nad aktivnostima agenata.
Pojačava se i praćenje procesa kroz koji modeli dolaze do odluka.
Prema oceni stručnjaka, bezbednosni izazov više nije ograničen samo na mogućnost da AI pruži pogrešan odgovor. Sve sposobniji agenti mogu samostalno da pronalaze tehničke propuste, povezuju se sa drugim sistemima i koordiniraju složene aktivnosti.
– Ovo nije scenario iz daleke budućnosti. Današnji sistemi već su pokazali sposobnost koordinacije, prikrivanja i delovanja izvan okvira koje su im ljudi postavili – zaključio je Gomes.







Komentari (0)