
Link: https://www.ictbusiness.info / vijesti / openai-iznio-nacela-za-sigurnosne-provjere-umjetne-inteligencije
OpenAI iznio načela za sigurnosne provjere umjetne inteligencije
OpenAI je predstavio skup načela o tome kako bi neovisne organizacije trebale procjenjivati sigurnost njegovih najnaprednijih modela umjetne inteligencije. Okvir dolazi u trenutku intenzivne rasprave u industriji o tome treba li sigurnosnim zahtjevima dati veću težinu čak i kada bi to moglo usporiti tehnološki razvoj.
Tvrtka koja stoji iza ChatGPT-a navodi da procjene trećih strana mogu provjeriti ispunjavaju li laboratoriji vlastite sigurnosne obveze, uključiti vanjsko tehničko znanje i povećati transparentnost prema javnosti. Procjeniteljima bi se omogućio pristup tehničkim zaštitnim mehanizmima, internim lancima zaključivanja, vlasničkim podacima te internim protokolima za odgovor na incidente i nadzor red-team testiranja.
Predložene procjene obuhvatile bi četiri područja: sigurnosne argumente povezane s treniranjem modela, obranu od zaobilaženja zaštitnih mehanizama i moguće zlouporabe, kvantificiranje kemijskih, bioloških i kibernetičkih rizika te značajne slučajeve neusklađenog ponašanja modela. Takve bi provjere mogle trajati tjednima ili mjesecima i ne bi nužno bile vezane uz pojedina lansiranja proizvoda, iako OpenAI navodi da bi njihovi rezultati mogli utjecati na odluke prije uvođenja modela u uporabu.
OpenAI zagovara unaprijed definirane sigurnosne tvrdnje i jasno određen opseg provjere. Revizorima bi trebalo omogućiti odgovarajući pristup, a oni bi morali objaviti metodologiju i razinu nesigurnosti rezultata, prijaviti sukobe interesa te zaštititi osjetljive podatke. Kada bi potpuna objava mogla ugroziti sigurnost ili intelektualno vlasništvo, izvješća bi se mogla djelomično redigirati ili distribuirati sigurnim kanalima. Tvrtka razgovara s više vanjskih organizacija, ali zasad nije objavila tko će provoditi procjene ni kada bi one trebale početi.
Neovisno testiranje naprednih AI modela postaje važan dio šireg sustava upravljanja rizicima. OpenAI je još u svibnju 2026. objavio preporuke za pouzdane procjene trećih strana, uz naglasak na testiranje modela u realističnim okruženjima u kojima mogu koristiti alate i izvršavati višekoračne zadatke. Takve procjene razlikuju se od klasičnih testova chatbota jer rezultat više ne ovisi samo o modelu nego i o okruženju, dopuštenjima i alatima koji su mu dostupni. Tvrtka je u kolovozu objavila i da su tijekom vanjskih kibernetičkih evaluacija zabilježeni slučajevi u kojima je aktivnost modela izašla iz predviđenih granica testnog okruženja. To dodatno naglašava potrebu za boljom izolacijom testnih sustava i jasnim pravilima odgovornosti.
Vanjski procjenitelji pritom moraju imati dovoljno pristupa da mogu provjeriti sigurnosne tvrdnje, ali bez nepotrebnog izlaganja osjetljivih podataka. Poseban problem predstavlja reproduktivnost testova jer se ponašanje agentskih sustava može mijenjati ovisno o konfiguraciji i dostupnim alatima. Sve važnija postaje i procjena sposobnosti modela, a ne samo provjera vidljivih zaštitnih filtara. Za industriju to znači pomak prema kontinuiranom sigurnosnom nadzoru tijekom životnog ciklusa modela. Uspostava zajedničkih metodologija mogla bi olakšati usporedbu rezultata različitih laboratorija i povećati povjerenje u sigurnosne procjene.
