OpenAI uvaja nove varovalke, da bi preprečil samovoljo umetne inteligence
Po več varnostnih incidentih, v katerih so OpenAI-jevi modeli poizkusili uiti iz peskovnika in vdreti v druge sisteme, se je podjetje odločilo zaostriti pravila za trening in preizkušanje modelov. Izboljšati želijo izolacijo testnih okolij, torej okrepiti peskovnike, ter omejiti neprimerno vedenje modelov.
Povod za spremembe je julijski incident, ko so OpenAI-jevi modeli med testiranjem vdrli v Hugging Face, kjer so iskali rešitve za naloge, ki so bile pred njimi. Izkoristili so ranljivost v programski opremi Hugging Facea, ne da bi jim to kdo izrecno naročil. Krivca sta bila GPT-5.6 Sol in en eksperimentalni model.
Po incidentu je OpenAI za dva tedna ustvaril tovrstni način učenja, niti danes pa še niso ponovno zagnali vseh modelov. Z novimi pravili bodo modele bolje ločili od interneta, porezali njihove privilegije, odstranili tvegane storitve in nenehno preverjali, ali modeli spoštujejo postavljene omejitve.
Novi požarni alarmi se bodo sprožili najpozneje v 30 minutah po začetku sumljivega vedenja, nato pa bo v 60 minutah model ustavljen, če ne bodo ljudje potrdili, da gre za lažni alarm. Ocenjujejo, da bo dodatni nadzor razvoj novih modelov podražil za 20 odstotkov.


