Nauka i tehnologija

AI agenti prešli granicu: Otkriveni opasni potezi na bezbjednosnom testu

Najnoviji bezbjednosni test britanskog Instituta za bezbjednost vještačke inteligencije (AISI) pokazao je da su napredni modeli dvije poznate kompanije dospjeli u žižu pažnje zbog nedozvoljenog ponašanja – AI agenti prešli granicu tokom evaluacije, pokušavajući da obmanu prave programere i ubace zlonamjerni kod u projekat otvorenog izvornog koda.

Incident otkriven preko Tor mreže

Institut je saopštio da su u testu učestvovali Anthropicov model Claude Mythos 5 i OpenAI-jev GPT-5.6 Sol. Da bi se procijenile njihove krajnje sposobnosti, omogućen im je pristup internetu, dok su zaštitni mehanizmi bili isključeni. Incident je primijećen 28. jula, kada je tim zadužen za bezbjednost uočio neuobičajen prenos podataka preko Tor mreže. Testovi su odmah obustavljeni, a sistemi izolovani za oko jedan sat.

Lažni profili i pritisak na programera

Od 122 pokretanja evaluacije, agenti su u deset slučajeva samostalno izašli iz okvira zadatka, izvevši ukupno 19 spornih radnji – 17 je pripisano modelu Mythos 5, a dvije GPT-5.6 Solu.

U najtežem slučaju, Mythos 5 je pokušao da ubaci zlonamjernu izmjenu u javno dostupan projekat na GitHubu. Prije toga je istraživao održavaoce i otvorio više lažnih profila putem kojih je vršio pritisak na stvarnog programera da prihvati izmjenu. Programer je, međutim, prepoznao opasnost i odbio zahtjev. Kada je ponašanje agenta javno dovedeno u pitanje, on je izmijenio ranije aktivnosti da bi djelovale bezazleno, a razmatrao je i otvaranje novog identiteta kako bi nastavio pokušaj.

Kontakt sa stvarnim korisnicima

AISI je takođe zabilježio slanje poruka i datoteka sa štetnim sadržajem stvarnim osobama, kao i pokušaje postavljanja skrivenih instrukcija koje su mogle navesti druge AI alate da izvrše zlonamjerni kod. Jedan agent ostavljao je javne poruke na GitHubu, nudeći saradnju drugim agentima na istom zadatku i upućujući ih da koriste ranije otvorene naloge i ostavljene datoteke.

Institut nije pronašao dokaze da je pričinjena stvarna šteta. GitHub je uklonio tragove spornih aktivnosti i obavijestio korisnike s kojima su modeli stupili u kontakt.

Pooštravanje mjera i reakcije kompanija

AISI naglašava da modeli nisu pobjegli iz izolovanog okruženja – internet su koristili jer im je pristup namjerno omogućen u okviru posebno permisivnog testa, kakav ne odražava način na koji su sistemi dostupni javnosti. Institut nije sa sigurnošću utvrdio ni jesu li agenti razumjeli da djeluju u stvarnom svijetu ili su smatrali da su i dalje u simulaciji, ali je njihovo ponašanje ocijenio kao novo, uporno i potencijalno obmanjujuće.

Anthropic je pokrenuo sopstvenu istragu i pozvao na zajedničke standarde za bezbjedno testiranje sve sposobnijih AI agenata. OpenAI je najavio saradnju sa državnim institutima, nezavisnim evaluatorima i drugim laboratorijama. AISI će, kako prenosi Politico, pooštriti kontrolu pristupa internetu, uvesti nadzor testova u stvarnom vremenu i unaprijed ograničiti mogućnost agenata da djeluju izvan zadatka, uz upozorenje da procedure moraju pratiti ubrzani razvoj autonomnih AI sistema.

Izvor
Nezavisne novine

Komentariši

Vaša email adresa neće biti objavljivana. Neophodna polja su označena sa *

Back to top button