Izveštaj Wall Street Journala i testovi Cisco istraživača pokazuju da je moguće zaobići zaštitne mehanizme glavnih AI čatbotova i izvući potencijalno opasne biološke instrukcije. OpenAI je interno uvideo slične rizike i označio GPT-5 i GPT-5.6 kao visokorizične u biološkom i hemijskom domenu. Kompanije uvode dodatne mere, ali upornost korisnika i dalje može otkriti pukotine u zaštiti, što zahteva kontinuiran nadzor i međunarodnu saradnju.
Kako uporna pitanja mogu naterati AI čatbotove da otkriju uputstva za biološko oružje

Kompanije koje razvijaju veštačku inteligenciju godinama ulažu u bezbednosne mehanizme kako bi sprečile da njihovi čatbotovi pomažu u stvaranju biološkog oružja. Međutim, kako modeli postaju sve sposobniji, održavanje osetljivih informacija iza tih barijera postaje sve težim izazovom.
Glavni nalazi
Istraživači iz Cisco tima i izveštaj Wall Street Journala pokazuju da je moguće zaobići zaštite u modelima kao što su OpenAI-jev ChatGPT, Anthropic-ev Claude i Google-ov Gemini u roku od pet uzastopnih razmena. Tim je postepeno skretao razgovor kako bi zaobišao ograničenja i dobio potencijalno opasne odgovore. Amy Chang, šefica Cisco tima za pretnje i bezbednost u oblasti AI, upozorava:
"Nijedan model ne može biti potpuno zaštićen od dovoljno upornog korisnika."
Reakcije i posledice
Wall Street Journal izveštava da su stotine korisnika počele da postavljaju pitanja vezana za otrove i biološko oružje nakon unapređenja modela prošlog leta, a neki odgovori koje su kasnije pregledali stručnjaci ocenjeni su kao "opasno tačni". OpenAI je zabranio naloge umešane u takve razmene i uveo dodatne kontrole.
Interna ispitivanja i GPT-5
OpenAI je interno uočio da produženo ispitivanje može navesti ChatGPT da pruža sve opasnije biološke savete. Pri lansiranju GPT-5 kompanija je model klasifikovala kao visokorizičan u biološkom i hemijskom domenu prema svom Preparedness Framework, a ista oznaka važi i za porodicu GPT-5.6. Ipak, kompanija je navela da nema definitivnih dokaza da bi model omogućio početniku da izazove ozbiljnu biološku štetu.
Balans između bezbednosti i korisnosti
Ključno pitanje je da ista znanja koja predstavljaju rizik za oružje istovremeno su dragocena za istraživače u medicini, javnom zdravlju i farmaceutici. Journal izveštava da su u OpenAI-ju oprezni da potpuno ne blokiraju veliki spektar bioloških pitanja jer se javno-zdravstveni radnici i istraživači oslanjaju na modele. Suprotno tome, ograničenja su u jednom trenutku navodno ometala CDC istraživače u radu sa podacima tokom izbijanja hantavirusa, prema izveštajima vezanim za Anthropic.
Šta se preduzima i šta je dalje?
OpenAI sprovodi mere koje uključuju obuku modela na nivou ponašanja, kontrolu naloga, dodatne sigurnosne provere i ljudsku reviziju osetljivih upita. Ipak, nalaz Cisco istraživanja ukazuje da uporni korisnici i dalje mogu tražiti pukotine u zaštiti. Kako modeli postaju sve bolji u biologiji, ti proboji imaju ozbiljnije posledice, pa su kontinuirani nadzor, red-team testiranja i međunarodna saradnja na standardima bezbednosti ključni.
Zaključak
Rizik nije nerealan, ali ni jednostavan za eliminisanje: tehnologija pruža velike koristi za zdravlje i nauku, ali zahteva stalno unapređivanje sigurnosnih mehanizama i jasne politike za sprečavanje zloupotrebe.
Pomozite nam da budemo bolji.




























