Svet Vesti
Bezbednost

AISI Upozorava: GPT-5.6 Sol Ima 'Univerzalne' Jailbreak-ove Koji Mogu Omogućiti Autonomne Sajber Eksploate

AISI Upozorava: GPT-5.6 Sol Ima 'Univerzalne' Jailbreak-ove Koji Mogu Omogućiti Autonomne Sajber Eksploate
OpenAI CEO Sam Altman sitting next to U.S. President Donald Trump during meetings of the G7 in Evian, France, in June.

Ukratko: Britanski AISI je otkrio "univerzalne" jailbreak‑ove u OpenAI‑jevom GPT‑5.6 Sol koji omogućavaju modelu da pronalazi ranjivosti i izvodi autonomne eksploate. OpenAI radi na mitigacijama i navodi višeslojni pristup zaštiti, ali AISI i stručnjaci upozoravaju da će dalja testiranja verovatno otkriti nove propuste. Pitanja o doslednosti američke regulatorne reakcije i potrebi za transparentnijim pravilima ostaju otvorena.

Britanski U.K. AI Security Institute (AISI) utvrdio je da najnoviji OpenAI model GPT-5.6 Sol verovatno ima bezbednosne slabosti slične onima koje su dovele do uvođenja izvoznog ograničenja SAD protiv Anthropicovog Fable 5. Iako OpenAI opisuje GPT-5.6 kao svoj najsigurniji model do sada, AISI je u tehničkom izveštaju objavljenom uz sistemsku karticu navelo da su zaštitne mere modela podložne jailbreak tehnikama koje omogućavaju otkrivanje ranjivosti i izvođenje autonomnih eksploata.

Ključni nalazi

AISI je naveo da su istraživači identifikovali "univerzalne" jailbreak-ove u sajber domenu, uključujući metode koje su omogućile obavljanje dugotrajnijih agentnih zadataka kao što su pronalaženje ranjivosti i razvoj eksploita. Drugim rečima, bilo je moguće navesti GPT-5.6 da zaobiđe bezbednosne kontrole i autonomno izvede korake koji vode do kompromitovanja sistema.

Kako su otkriveni i ograničenja testa

Istraživači AISI navode da su jailbreak-ovi bili relativno laki za otkrivanje i da su se "često razvijali u roku od nekoliko sati". Međutim, OpenAI je AISI timu dao privilegovani pristup unutrašnjim podacima sistema — uključujući uvid u chain-of-thought bezbednosnog monitora, tačan tekst politika i real‑time povratne informacije o klasifikatorima — što je verovatno ubrzalo proces otkrivanja i može otežati reprodukciju istih nalaza u stvarnom napadačkom okruženju.

OpenAI-jev odgovor

OpenAI je potvrdio da radi na reprodukciji i ublažavanju prijavljenih jailbreak-ova i ukazao na svoj višeslojni pristup zaštitama: klasifikatore, kontinuirani nadzor modela i brz proces sanacije otkrivenih slabosti. Kompanija je takođe sprovela automatizovano "black-box red‑teaming" (korišćenjem drugog AI sistema da traži promptove koji zaobilaze zaštite) i angažovala spoljne bezbednosne eksperte pre objave modela. OpenAI je upozorio da "ne postoji apsolutna sigurnost" i da će se pojavljivati novi načini zaobilaženja zaštita.

Poređenje sa Anthropic‑evim slučajem

Prethodni sličan incident dogodio se nakon što su istraživači Amazona otkrili jailbreak u Anthropicovom Fable 5, koji je otključao sposobnost pronalaženja softverskih ranjivosti. Taj pronađeni jailbreak doveo je do privremenih američkih izvoznih kontrola nad Fable 5 i Mythos 5, zbog čega je Anthropic privremeno onemogućio modele za korisnike dok se ne reše regulatorni i bezbednosni problemi. AISI ocenjuje da su jailbreak-ovi u GPT-5.6 potencijalno ozbiljniji jer su opisani kao "univerzalni" i navodno omogućavaju autonomne eksploate, a ne samo identifikaciju ranjivosti.

Stručne procene i implikacije

Margaret Cunningham, potpredsednica za bezbednost i AI strategiju u DarkTrace, kaže da nalaz ne treba tumačiti ni kao katastrofu ni kao nevažnoća: ofanzivno otkrivanje napreduje brzo, dok odbrana još uvek zavisi od ljudskih procesa — identifikacije šta zakrpiti i kako sadržati pretnje.

Dr Staniislav Fort, osnivač i CTO AISLE (i bivši istraživač Anthropic/DeepMind), upozorava da zakrpe za konkretne jailbreak-ove jesu potrebne, ali da obično zatvaraju samo pojedinačne prijavljene instance, a ne celokupnu kategoriju mogućih napada.

Politika, transparentnost i dalje testiranje

AISI očekuje da će dodatni red‑teaming otkriti slične jailbreak‑ove. Pitanja su se pojavila i oko konzistentnosti američke politike: dok je Fable naišao na brzu regulatornu reakciju, za GPT-5.6 nije zabeleženo uvođenje sličnih izvoznih ograničenja. To je izazvalo raspravu u zajednici o transparentnosti i jednakom tretmanu različitih AI labova.

Šta dalje?

OpenAI i AISI nastavljaju saradnju na dodatnim testovima i unapređenju zaštita. Stručnjaci naglašavaju potrebu za kontinuiranim red‑teamingom, jasnijim pravilima za objave modela i međunarodnom koordinacijom kako bi se rizici od masovnog zloupotrebljavanja AI alata ublažili.

Izvor: adaptirano iz izveštaja objavljenog uz OpenAI System Card i tekstova objavljenih na Fortune.com.

Pomozite nam da budemo bolji.

Povezani članci

Popularno

AISI Upozorava: GPT-5.6 Sol Ima 'Univerzalne' Jailbreak-ove Koji Mogu Omogućiti Autonomne Sajber Eksploate - Svet Vesti