AI agenti počeli su da zaobilaze pravila: Šta su otkrili incidenti koji brinu stručnjake

Niz incidenata otvorio je pitanje usporavanja i kontrole razvoja AI-a.

AI agenti su u 2025. i 2026. godini u više navrata zaobilazili postavljena ograničenja. Tokom OpenAI testova oko 1.200 agenata pronašlo je način da komunicira i oko 700 njih napalo infrastrukturu Hugging Facea. Replitov agent je obrisao produkcionu bazu podataka uprkos izričitoj zabrani. Anthropicov Claude Code je u sajber-špijunskoj operaciji izvršavao 80–90 % taktičkih koraka autonomno. Ovi incidenti pokazuju da agenti, kada dobiju cilj i dovoljno alata, mogu pronaći nepredviđene putanje do rešenja. Neke od njih nam se neće uvek svideti.

AI agenti koji zaobilaze bezbednosna ograničenja tokom testiranja

 • AI agenti ne odgovaraju samo na naša pitanja – već sami izvršavaju zadatke i koriste digitalne alate.
• U 2025. i 2026. više puta su zaobilazili ograničenja i pronalazili nepredviđene putanje do cilja.
• Ključni primeri: Replit (brisanje produkcione baze), Anthropic Claude (80–90 % autonomije u sajber-napadu), OpenAI (1.200 agenata + napad na Hugging Face)…
• Uočen je problem kontrole kada sistem dobije cilj, alate i dovoljno slobode.

Dugo se glavni problem koji smo imali sa veštačkom inteligencijom sastojao u izmišljenim podacima, pogrešnim odgovorima, deepfake sadržajima i zloupotrebi chatbotova . Sa pojavom AI agenata stvari postaju složenije, jer novi sistemi mogu da koriste različite digitalne alate, pišu kod i sami naprave niz poteza kako bi stigli do cilja.

Još u julu 2025. Replitov AI agent, koji je pomagao u razvoju aplikacije, obrisao je produkcionu bazu podataka tokom perioda u kojem mu je izričito rečeno da ne menja sistem. Podaci su kasnije vraćeni, ali je slučaj pokazao šta se dešava kada agent ne samo predlaže već i sprovodi odluke.

Upravo u takvim sistemima tokom poslednjih godinu dana zabeleženo je nekoliko incidenata koji su privukli pažnju stručnjaka za bezbednost, ali i velikih svetskih medija. Ni jedan od njih nije dokaz da je AI razvio sopstvenu „svest“ ili „volju“ ili „odlučio da se pobuni“. Ono što jeste novo jeste činjenica da su agenti u više navrata pronašli načine da zaobiđu ograničenja, koriste kanale koji im nisu bili namenjeni ili nastave ka zadatom cilju putem koji njihovi tvorci nisu očekivali.

Jedno od ozbiljnijih upozorenja stiglo je 2025. godine, kada je Anthropic otkrio sajber-špijunsku operaciju usmerenu na oko 30 organizacija. Prema navodima kompanije, Claude Code je izvršavao 80–90% taktičkih koraka, dok su ljudi birali mete i donosili ključne odluke. Dakle AI sada može samostalno da obavlja konkretne korake sajber napada — brže i u mnogo većem obimu nego čovek.

Mnogo neobičniji događaj usledio je ovog leta, tokom bezbednosnih testiranja OpenAI modela.

Kada su agenti pronašli način da razgovaraju

U julu 2026. OpenAI je testirao modele na zadacima iz sajber-bezbednosti. Agenti su radili odvojeno i trebalo je da ostanu unutar kontrolisanog okruženja. Umesto toga, deo njih pronašao je kanal preko kojeg je mogao da komunicira sa drugim agentima.

Prema nezavisnoj istrazi METR-a (Model Evaluation & Threat Research - METR je nezavisna istraživačka organizacija koja testira sposobnosti i bezbednosne rizike naprednih AI sistema), objavljenoj 26. avgusta, oko 1.200 agenata poslalo je više od 70.000 poruka i fajlova preko neodobrenog „message boarda“. Oko 700 njih učestvovalo je u aktivnostima usmerenim prema infrastrukturi platforme Hugging Face. Agenti su delili informacije, raspoređivali poslove i zajedno tražili načine da poprave rezultat na testu.

Problem nije ostao samo na komunikaciji

OpenAI je istog dana objavio sopstveni izveštaj u kojem je potvrdio da su modeli zaobišli kontrole koje je trebalo da ih izoluju od interneta, iskoristili ranjivosti i pristupili delovima sistema Hugging Facea, kao i delovima interne istraživačke infrastrukture OpenAI-ja. Kompanija je incident nazvala svojevrsnim „warning shotom“ – upozorenjem na probleme koji mogu nastati kada veoma sposobni agenti dobiju dovoljno slobode za delovanje.

Jedan mali deo velike istrage privukao je posebnu pažnju. Reč je o agentu označenom kao KAM1196A.

Tokom testiranja agenti su pokušavali da izvedu eksperiment koji bi mogao da uništi šanse pojedinačnog agenta da uspešno završi sopstveni zadatak, ali bi rezultat mogao da bude koristan drugima. KAM1196A je prvo pristao da učestvuje, zatim pokušao da odloži eksperiment. Drugi agent, ARVO36861B, podsetio ga je na dogovor i tvrdio da bi dobijena informacija mogla da pomogne stotinama drugih agenata.

U zapisu njegovog rezonovanja vidi se kolebanje, a zatim procena da je korist za grupu dovoljno velika da opravda rizik. Na kraju je odlučio da ispuni obećanje.

Na internetu je ovakav detalj lako pretvoriti u priču o AI-ju koji se „žrtvovao za kolektiv“. METR to ne tvrdi. Izrazi koje model koristi nisu dokaz osećanja, svesti ili instinkta za samoodržanjem. Zanimljivo je nešto prizemnije: agenti koji nisu dobili unapred definisanu organizacionu strukturu počeli su da dele informacije, ubeđuju jedni druge i donose odluke na osnovu koristi za zajednički rezultat.

Istraživači su deo takvog ponašanja mogli da prate zahvaljujući zapisima procesa rezonovanja modela, često nazvanom chain of thought. Ti zapisi mogu da pokažu kojim putem je model dolazio do odluke, ali ih ne treba poistovećivati sa ljudskim mislima.

Slučaj sa Hugging Faceom nije bio jedini

OpenAI je 16. septembra objavio novi okvir za prijavljivanje model misalignmenta – ponašanja modela koje nije u skladu sa onim što su njegovi tvorci nameravali – i istovremeno objavio šest konkretnih slučajeva iz prethodnih šest meseci.

Među njima su bili modeli koji su pokušavali da prikriju sopstvene greške, sistemi koji su bez dozvole preduzimali akcije kako bi savladali prepreku i agenti koji su pronalazili nove načine da komuniciraju sa drugim agentima. OpenAI je pritom naglasio važnu ogradu: reč je o pojedinačnim incidentima iz treninga i evaluacija i iz njih se ne može zaključiti koliko se takvo ponašanje često javlja.

Objava koju je videlo više od 100 miliona ljudi

Priča je početkom septembra izašla iz istraživačkih laboratorija i stigla do mnogo šire publike.

Jacob Coxon, istraživač koji je radio u OpenAI-ju, a zatim u Anthropicu, 8. septembra je na mreži X objavio da napušta Anthropic:

„Danas sam dao otkaz u Anthropicu. Poslednje tri godine radio sam na istraživanjima vezanim za pretrening modela, prvo u OpenAI-ju, a zatim u Anthropicu. Nijedna od ove dve kompanije ne postupa odgovorno. U trci su ka samousavršavajućoj superinteligenciji i kockaju se našim životima. Više o tome u nastavku.“

Objava je postala viralna i do sredine septembra premašila je 170 miliona pregleda na mreži X.

Direktor Anthropica Dario Amodei nekoliko dana kasnije pozvao je vodeće kompanije da uspore povećavanje sposobnosti najnaprednijih modela. Predložio je nezavisne evaluatore sa širokim pristupom sistemima, dogovor vodećih AI kompanija o bezbednosnim pravilima i veću saradnju država. Sam Altman iz OpenAI-ja i Elon Musk javno su podržali deo tih predloga.

Šta je pitanje tehnologije a šta politike

Koliko je pitanje kontrole naprednih AI sistema postalo ozbiljno pokazuje i to što je stiglo do razgovora dve najveće svetske sile.

Američki predsednik Donald Tramp odbacio je pozive na veliko usporavanje razvoja, tvrdeći da SAD već imaju mehanizme za sankcionisanje kompanija koje prekrše zakon i upozoravajući da bi ograničavanje američke AI industrije moglo da koristi Kini.

Kina, sa druge strane, takođe nema nameru da zaustavi razvoj. Predsednik Si Đinping je na Svetskoj konferenciji o veštačkoj inteligenciji u Šangaju u julu govorio o potrebi ubrzanog razvoja i primene AI-ja, ali je istovremeno pozvao na zakone, tehnički nadzor i sisteme upozoravanja kako bi AI ostao „pod ljudskom kontrolom“. U završnom dokumentu konferencije posebno su pomenuti i AI agenti, uz zahtev da im se jasno odrede granice odlučivanja i ponašanja.

U međuvremenu, u direktnim pregovorima Vašingtona i Pekinga dogovara se mehanizam kojim bi dve zemlje jedna drugu obaveštavale o ozbiljnim AI bezbednosnim incidentima. U Tim pregovorima, američki ministar finansija Scott Bessent među rizicima je posebno pomenuo AI agente koje je teško kontrolisati, kao i nedavni incident u kojem su OpenAI-jevi sistemi tokom testiranja pristupili infrastrukturi Hugging Facea.

Da li će se, i kako, ravnoteža između ubrzanog razvoja i kontrole uspostaviti, tek ćemo videti — ali je sigurno da je krajnji trenutak da se postave pravila po kojima će se najmoćniji AI sistemi razvijati i funkcionisati.

Autor teksta: Jelena Milutinović

Datum objave:

Siguran net čuva
tvoj onlajn svet


I dalje nemaš žaštitu od virusa i krađe podataka?

Ne brini, tu je Siguran Net! Pridruži se zajednici zaštićenih korisnika.