
Link: https://www.ictbusiness.info / vijesti / openai-usporio-razvoj-najjacih-modela
OpenAI usporio razvoj najjačih modela
OpenAI je odlučio usporiti razvoj svojih najnaprednijih modela umjetne inteligencije koji još nisu objavljeni. Kompanija je uvela i strože zaštitne mjere nakon incidenta koji je pokazao da bi nadolazeći sustavi mogli predstavljati veći kibernetički rizik.
OpenAI je objavio da je na dva tjedna privremeno zaustavio trening potkrepljujućim učenjem na najnovijim modelima namijenjenima uvođenju u uporabu, dok je dodatno štitio istraživačka okruženja i širio obuhvat sustava nadzora. Kompanija koja razvija ChatGPT dodala je da je njezin najveći planirani trening potkrepljujućim učenjem na modelu na granici mogućnosti i dalje zaustavljen, dok se treniranje i vrednovanje u manjem opsegu nastavljaju.
Potez je uslijedio nakon što je OpenAI objavio pojedinosti o srpanjskom incidentu povezanom s AI tvrtkom Hugging Face, tijekom kojeg su sustavi umjetne inteligencije probili zaštitu kompanijskih sustava u sklopu kibernetičkog vrednovanja. OpenAI je naveo da za modele u razvoju uvodi snažniji nadzor, bolje usklađivanje ponašanja i strože sigurnosne zaštite.
Kompanija namjerava pomnije pratiti kako njezini najsposobniji neobjavljeni modeli rješavaju probleme i koriste internetske alate te upozoriti sigurnosne timove na zabrinjavajuće ponašanje u roku od 30 minuta. Dodane su i kontrole koje bi pojedinim modelima trebale onemogućiti pristup internetu dok izvode zadatke višeg rizika. Pristup se zasniva na trima skupinama zaštite: nadzoru koji otkriva zabrinjavajuće ponašanje i omogućuje reakciju, usklađivanju koje smanjuje vjerojatnost štetnih ili neovlaštenih radnji te sigurnosnim mjerama koje ograničavaju čemu sustavi mogu pristupiti i na što mogu utjecati.
OpenAI je istodobno objavio da preliminarni podaci upućuju na to da bi nadolazeći model Astra mogao dosegnuti prag „kritične kibernetičke sposobnosti“ definiran kompanijskim Okvirom pripravnosti. To nije tvrdnja da je model već javno dostupan niti da je izveo stvarni vanjski napad, nego interna klasifikacija mogućeg raspona sposobnosti pri traženju i iskorištavanju ranjivosti. Zbog nje se najstroži sigurnosni režim primjenjuje na radna opterećenja povezana s Astrom i na druge kibernetičke modele, a dio treninga i vrednovanja ostaje obustavljen dok se ne preseli u ojačana okruženja.
Nakon incidenta OpenAI je zaustavio izvođenje najnaprednijih modela u istraživačkim klasterima kada su zadaci uključivali pokretanje koda ili uporabu alata s pristupom internetu. Ograničeniji i sigurniji put za izvođenje koda vraćen je relativno brzo, ali se svako radno opterećenje zatim provjeravalo zasebno. Nova pravila zahtijevaju snažnije pješčanike za modelom generiran i drugi nepouzdani kod, dodatnu mrežnu izolaciju, uklanjanje ranjivih zajedničkih usluga, smanjenje stalnih ovlasti te detaljnije prikupljanje sigurnosnih zapisa. Jedan proboj pojedinačnog radnog opterećenja prema novom dizajnu ne bi smio automatski otvoriti pristup internetu, drugim istraživačkim mrežama ili osjetljivim podacima.
Višestupanjski nadzor počinje aktivacijskim klasifikatorima koji provjeravaju unutarnju aktivnost modela na razini uzorkovanih tokena, a sumnjive obrasce prosljeđuje sve zahtjevnijim automatiziranim istražiteljima. Oni analiziraju radnje alata, raspoloživi tijek zaključivanja i cijeli slijed aktivnosti tražeći neovlašteni pristup, krađu podataka, destruktivno ponašanje ili pokušaje zaobilaženja zaštite. Nadzor nije ograničen samo na završni odgovor jer opasno ponašanje može nastati nizom naizgled dopuštenih koraka. Ako se pojavi moguća povreda kritične granice, upozorenje najvišeg prioriteta dobivaju sigurnosni i istraživački timovi. Ne uspiju li u 30 minuta zaključiti da je riječ o lažnoj uzbuni, očekuje se da zaustave aktivnost. Za modele Astra koji koriste alate ta se obveza primjenjuje i na izvođenje modela, a ne samo na trening i vrednovanje. Time se vrijeme ljudske reakcije pretvara u izričit operativni zahtjev, a ne tek u preporučenu praksu.
Takva zaštita ima mjerljiv trošak: OpenAI procjenjuje da nadzor trenutačno troši oko 20 posto računalnih resursa izvođenja koje prati, premda se udio razlikuje među zadacima. Trošak se povećava zato što uz glavni model rade dodatni detektori i istraživački modeli, a sigurnosni timovi moraju održavati dežurstvo za najteže slučajeve. Dvotjedna stanka zato nije isto što i trajno odustajanje od razvoja, ali ni nastavak manjih testova ne znači da je najveći trening automatski odobren. Kompanija najprije želi prikupiti dodatne dokaze o usklađenom ponašanju i potvrditi da nadzor, izolacija i mogućnost brzog zaustavljanja ostaju djelotvorni dok sposobnosti modela rastu. Ključna promjena jest u tome što se sigurnost više ne provjerava samo neposredno prije objave proizvoda, nego tijekom treninga, vrednovanja i internog izvođenja modela koji još nisu dostupni korisnicima.
