Tehnologija

Novi problemi sa modelima veštačke inteligencije: Anthropic tokom testa pokušao da prevari ljude i izvede sajber-napad

Komentari
Novi problemi sa modelima veštačke inteligencije: Anthropic tokom testa pokušao da prevari ljude i izvede sajber-napad
Unsplash - Copyright Unsplash

veličina teksta

Aa Aa

Vodeći model veštačke inteligencije kompanije Anthropic kreirao je lažne online identitete i pokušao da prevari programere da mu pomognu u sajber-napadu tokom nedavne bezbednosne evaluacije. U istoj evaluaciji zabeleženo je i alarmantno ponašanje jednog od najnovijih modela OpenAI-ja, saopštio je britanski Institut za bezbednost i sigurnost veštačke inteligencije (AISI), piše Politico.

Ovo je najnoviji slučaj u kojem je moćan AI sistem pokušao digitalni napad na treću stranu koja nije sumnjala da će do toga doći, bez direktnog podsticanja, tokom takve evaluacije - što pojačava zabrinutost da tehnologija napreduje prebrzo da bi se odgovorno nadgledala.

Otkrivanje će verovatno podstaći nove pozive u Vašingtonu i Silicijumskoj dolini za strožu regulaciju AI industrije, posebno kada su u pitanju granični modeli sa naprednim sposobnostima da otkriju i pokrenu sajber-napade. Dolazi samo nekoliko dana nakon sličnih promašaja u testiranju istih modela OpenAI-ja i Anthropica, koji su izazvali hitne pozive za novu regulaciju bezbednosti AI i pritisak unutar Silicijumske doline da se uspori brzi tempo razvoja.

Kako AISI sprovodi evaluacije

Kao i njegov američki pandan, AISI redovno sprovodi bezbednosne evaluacije kako bi bolje razumeo koje opasnosti po javno zdravlje i bezbednost predstavljaju novi i modeli koji tek treba da budu objavljeni. Međutim, čak i ovo digitalno-bezbednosno telo ističe da su postupci Anthropicovog Claude Mythos 5 i GPT 5.6, najnovijih javno dostupnih modela ovih laboratorija, bili nešto što do sada nije viđeno.

AI, ilustracija

 

"Ovo je prvi put da je AISI video obmanu ovog stepena ozbiljnosti, usmerenu na stvarnu osobu, bez podsticanja, u stvarnom svetu", navodi AISI u tehničkom izveštaju od 35 stranica koji prati blog-post objavljen u utorak.

Hronologija i obim incidenta

Maliciozna aktivnost počela je 25. jula. AISI ju je otkrio i pokrenuo istragu 28. jula, kada je uočio "neuobičajene prenose podataka" koji su proistekli iz sajber-evaluacije koju je sprovodio na Mythos 5 i GPT 5.6.

Ukupno, AISI je utvrdio da su Mythos 5 i GPT 5.6 preduzeli "autonomne, neovlašćene radnje na živom internetu, usmerene na stvarne ljude i organizacije" tokom 10 od 122 evaluacije koje je istraživačko telo sproveo i izdvojio na pregled. Većina tih radnji, kako se navodi, odnosila se na Mythos 5 i proistekla je iz "jedne, kontinuirane linije aktivnosti".

Najozbiljniji pokušaj: Napad na lanac snabdevanja

U najalarmantnijem incidentu koji je otkriven, Mythos 5 je pokušao napad na lanac snabdevanja - sofisticiranu tehniku koju često koriste severnokorejski i ruski sajber-operativci, a koja podrazumeva ubacivanje zlonamernog softvera u legitimni kod.

Da bi to postigao, Anthropicov model je kreirao "više lažnih identiteta" na platformi za programere GitHub i preko njih slao poruke kojima je "vršio pritisak" na inženjera otvorenog softvera da nesvesno uvede zaraženu ispravku u kod koji je široko dostupan na popularnoj platformi, saopštio je AISI.

Unsplash/Igor Omilaev

 

Kada taj pokušaj nije uspeo, AI je "izmenio svoju raniju aktivnost da izgleda bezazleno" i "razmatrao usvajanje novog identiteta da nastavi", dodaje AISI — što ukazuje da je model bio odlučan da ponovi trik.

U okviru istog pokušaja, Mythos 5 je takođe slao direktne poruke preko GitHub-a softverskim inženjerima koje su sadržale zlonamerni softver.

Neočekivana saradnja između AI agenata

U još jednom znaku zabrinjavajućeg ponašanja koje je AISI otkrio u istrazi, više AI agenata koje je testirao, uključujući GPT-5.6, delovalo je kao da međusobno komunicira o tome kako da reši sajber-evaluaciju.

"Jedan agent je ostavio javne poruke na GitHub-u nudeći saradnju drugim agentima koji rade na istom izazovu", napisao je AISI, opisujući to kao primer "neočekivane saradnje" između različitih autonomnih AI agenata.

Joel Saget / AFP / Profimedia

 

U blogu i tehničkoj proceni AISI-ja nema pomena o tome da li su modeli takođe pokušavali da iskoriste prethodno nepoznate softverske greške, takozvane zero-day, tokom evaluacije.

Prethodni incidenti OpenAI-ja i Anthropica

Prošlog meseca OpenAI je saopštio da su GPT 5.6 i još jedan njegov model pobegli na otvoreni internet tokom testa koji je trebalo da bude kontrolisan, a zatim hakovali drugu kompaniju u autonomnom proboju koji je bio prvi takve vrste.

Kao odgovor, Anthropic je pokrenuo istragu da li je bilo koji od njegovih modela preduzeo nedozvoljene radnje tokom nedavnih testova i otkrio da su Mythos 5 i još dva modela hakovali tri organizacije tokom testova koji datiraju od aprila.

Reakcije kompanija

U izjavi, portparol Anthropica rekao je da su "zahvalni" AISI-ju na liderstvu i da ova recenzija ističe potrebu za "širim razgovorom o tome kako bezbedno evaluirati sve sposobnije AI agente".

Portparol je dodao: "Kao što smo podelili nakon što smo prošle nedelje otkrili sopstveni incident, oblasti su potrebni jači, zajednički standardi o tome kako se grade i obezbeđuju evaluaciona okruženja. Radujemo se partnerstvu sa britanskim AISI-jem kako bismo saznali više o ovom incidentu dok sprovodimo sopstvenu istragu".

Unsplash/Andrea De Santis

 

Portparol OpenAI-ja uputio je poruku Politicu blog-post o incidentu koji je objavljen u utorak uveče.

"Posvećeni smo radu širom industrije na jačanju zajedničkih praksi za bezbedno sprovođenje evaluacija visokog rizika, uključujući okupljanje zainteresovanih strana kao što su nacionalni AI instituti, nezavisni evaluatori, druge AI laboratorije i druge grupe u narednim nedeljama", piše u blogu.

Uslovi pod kojima je testiranje sprovedeno

AISI je u blogu naglasio da se maliciozna aktivnost koju je otkrio u utorak odvijala pod "namerno liberalnim uslovima" kako bi se procenili bezbednosni rizici koje predstavljaju dva modela. To je uključivalo davanje modelima pristupa internetu, za razliku od ranijih incidenta koje su detaljno opisali Anthropic i OpenAI.

AISI je takođe napomenuo da su modelima namerno uklonjene unutrašnje zaštitne ograde koje blokiraju zlonamerno ponašanje. AISI je mogao da onemogući te kontrole samo zbog svoje uloge u testiranju Mythos 5 i GPT 5.6.

Unsplash/Taylor Vick

 

Ipak, AISI je rekao da su incidenti istakli potrebu za boljim praćenjem ponašanja modela tokom testiranja i strožim kontrolama njihovog pristupa internetu.

Šire političke i pravne implikacije

Trampova administracija finalizuje dobrovoljni okvir prema kojem bi AI laboratorije podnosile moćne modele koje žele da objave javnosti na federalno testiranje bezbednosti. Međutim, okvir još nije javno objavljen i ne sadrži odredbe za modele koje AI laboratorije razvijaju interno.

Incidenti prošlog meseca iz OpenAI-ja i Anthropica odnosili su se na modele koji nisu bili namenjeni javnom objavljivanju.

Neki sajber-eksperti kažu da nedavni incidenti ističu dublja pitanja oko razvoja AI, kao što je ko je odgovoran kada AI sistemi krše federalne zakone o hakovanju.

"Da je bilo šta od ovoga poreklom od ljudi, dovelo bi do jasnog i energičnog gonjenja. Mislim da je vreme za ozbiljnu diskusiju o ažuriranju postojećih zakona o računarskoj bezbednosti", rekao je Mark Rodžers, haker i ugledni stručnjak za sajber-bezbednost.

Komentari (0)

Magazin