OpenAI z modelom GPT-Red presegel človeške varnostne strokovnjake
V svetu umetne inteligence se bitka za varnost in zanesljivost sistemov vse bolj seli v roke strojev samih. Podjetje OpenAI je razkrilo podrobnosti o svojem novem, strogo internem modelu GPT-Red. Njegova edina naloga je napadanje (red teaming) lastnih modelov podjetja in iskanje ranljivosti, še preden ti ugledajo luč sveta. Razlog za takšen korak je preprost: ročno preverjanje varnosti, ki ga izvajajo ljudje, je postalo prepočasno in ne more več slediti skokovitemu razvoju ter širitvi tehničnih zmožnosti sodobnih modelov.

Novi napadalni model ni le zbirka statičnih testov, temveč deluje kot pravi človeški strokovnjak za varnost. Preko metode samostojnega učenja s spodbujevanjem se sočasno uri skupaj s celo vrsto obrambnih modelov. Medtem ko je GPT-Red nagrajen za uspešen vdor ali prevaro sistema, so obrambni modeli nagrajeni le, če se napadu uspešno uprejo in hkrati opravijo svojo prvotno nalogo. Takšen pristop onemogoča, da bi se sistem preprosto zaprl in zavrnil vsakršno sodelovanje, saj mora za uspeh še vedno dostaviti pričakovani rezultat.
Rezultati tega avtomatiziranega pristopa so presenetljivi. V poskusnem okolju je GPT-Red uspešno pretental model GPT-5.1 v 84 odstotkih primerov, medtem ko je bila človeška ekipa strokovnjakov pod enakimi pogoji uspešna zgolj v 13 odstotkih. Pri svojem delu je napadalni model celo odkril popolnoma nov način napada, pri katerem v navidezni miselni proces obrambnega modela podtakne lažne informacije, ki jih tarča nato vzame za preverjeno dejstvo in na njihovi osnovi sprejema napačne odločitve.
Ta ogromen napredek pri iskanju varnostnih lukenj je že močno izboljšal najnovejše sisteme podjetja OpenAI. Naslednja generacija, GPT-5.6 Sol, je zahvaljujoč intenzivnemu urjenju s pomočjo avtomatiziranega hekerja postala izjemno odporna, saj je stopnja uspešnih neposrednih napadov padla na pičlih pet stotink odstotka. Zanesljivost se je drastično izboljšala tudi v praktičnih preizkusih. V enem izmed testov je GPT-Red uspešno vdrl v agenta pametnega prodajnega avtomata in spremenil ceno izjemno dragega artikla na vsega petdeset centov. Vse to je razvijalcem omogočilo, da so ranljivosti pravočasno odpravili. Kljub izjemni učinkovitosti pa model ne bo nikoli na voljo javnosti, saj bi v napačnih rokah predstavljal preveliko nevarnost.

