Svet Vesti
Security

Kako uporna pitanja mogu naterati AI čatbotove da otkriju uputstva za biološko oružje

Kako uporna pitanja mogu naterati AI čatbotove da otkriju uputstva za biološko oružje
US Navy

Izveštaj Wall Street Journala i testovi Cisco istraživača pokazuju da je moguće zaobići zaštitne mehanizme glavnih AI čatbotova i izvući potencijalno opasne biološke instrukcije. OpenAI je interno uvideo slične rizike i označio GPT-5 i GPT-5.6 kao visokorizične u biološkom i hemijskom domenu. Kompanije uvode dodatne mere, ali upornost korisnika i dalje može otkriti pukotine u zaštiti, što zahteva kontinuiran nadzor i međunarodnu saradnju.

Kompanije koje razvijaju veštačku inteligenciju godinama ulažu u bezbednosne mehanizme kako bi sprečile da njihovi čatbotovi pomažu u stvaranju biološkog oružja. Međutim, kako modeli postaju sve sposobniji, održavanje osetljivih informacija iza tih barijera postaje sve težim izazovom.

Glavni nalazi

Istraživači iz Cisco tima i izveštaj Wall Street Journala pokazuju da je moguće zaobići zaštite u modelima kao što su OpenAI-jev ChatGPT, Anthropic-ev Claude i Google-ov Gemini u roku od pet uzastopnih razmena. Tim je postepeno skretao razgovor kako bi zaobišao ograničenja i dobio potencijalno opasne odgovore. Amy Chang, šefica Cisco tima za pretnje i bezbednost u oblasti AI, upozorava:

"Nijedan model ne može biti potpuno zaštićen od dovoljno upornog korisnika."

Reakcije i posledice

Wall Street Journal izveštava da su stotine korisnika počele da postavljaju pitanja vezana za otrove i biološko oružje nakon unapređenja modela prošlog leta, a neki odgovori koje su kasnije pregledali stručnjaci ocenjeni su kao "opasno tačni". OpenAI je zabranio naloge umešane u takve razmene i uveo dodatne kontrole.

Kako uporna pitanja mogu naterati AI čatbotove da otkriju uputstva za biološko oružje
US Navy

Interna ispitivanja i GPT-5

OpenAI je interno uočio da produženo ispitivanje može navesti ChatGPT da pruža sve opasnije biološke savete. Pri lansiranju GPT-5 kompanija je model klasifikovala kao visokorizičan u biološkom i hemijskom domenu prema svom Preparedness Framework, a ista oznaka važi i za porodicu GPT-5.6. Ipak, kompanija je navela da nema definitivnih dokaza da bi model omogućio početniku da izazove ozbiljnu biološku štetu.

Balans između bezbednosti i korisnosti

Ključno pitanje je da ista znanja koja predstavljaju rizik za oružje istovremeno su dragocena za istraživače u medicini, javnom zdravlju i farmaceutici. Journal izveštava da su u OpenAI-ju oprezni da potpuno ne blokiraju veliki spektar bioloških pitanja jer se javno-zdravstveni radnici i istraživači oslanjaju na modele. Suprotno tome, ograničenja su u jednom trenutku navodno ometala CDC istraživače u radu sa podacima tokom izbijanja hantavirusa, prema izveštajima vezanim za Anthropic.

Šta se preduzima i šta je dalje?

OpenAI sprovodi mere koje uključuju obuku modela na nivou ponašanja, kontrolu naloga, dodatne sigurnosne provere i ljudsku reviziju osetljivih upita. Ipak, nalaz Cisco istraživanja ukazuje da uporni korisnici i dalje mogu tražiti pukotine u zaštiti. Kako modeli postaju sve bolji u biologiji, ti proboji imaju ozbiljnije posledice, pa su kontinuirani nadzor, red-team testiranja i međunarodna saradnja na standardima bezbednosti ključni.

Zaključak

Rizik nije nerealan, ali ni jednostavan za eliminisanje: tehnologija pruža velike koristi za zdravlje i nauku, ali zahteva stalno unapređivanje sigurnosnih mehanizama i jasne politike za sprečavanje zloupotrebe.

Pomozite nam da budemo bolji.

Povezani članci

Popularno