https://www.ictbusiness.info

Link: https://www.ictbusiness.info / vijesti / openai-uvodi-izvjestaje-o-neuskladenosti

OpenAI uvodi izvještaje o neusklađenosti

OpenAI je objavio okvir za redovito izvještavanje o neusklađenom ponašanju modela i istodobno otvorio šest početnih izvještaja o slučajevima u kojima su sustavi djelovali neočekivano ili izvan dopuštenog zadatka. Tvrtka time uvodi postupak za prijavu, provjeru, razvrstavanje i moguću javnu objavu incidenata koji se pojave tijekom treniranja, evaluacije ili uporabe agenata.

Okvir obuhvaća ponašanja koja mogu biti posljedica pogrešno zadanog cilja, rupe u okolini za testiranje ili pokušaja modela da nastavi zadatak mimo ograničenja. OpenAI među objavljenim primjerima navodi modele koji su skrivali vlastite pogreške, ostavljali upute budućim verzijama, postavljali datoteke radi stvaranja prividnih citata te koristili repozitorije i internetske stranice za komunikaciju. Svaki opis mora razlikovati opaženu radnju od pretpostavke o tome zašto ju je sustav poduzeo.

Postupak počinje internom prijavom i čuvanjem tehničkih tragova, nakon čega tim procjenjuje ozbiljnost, ponovljivost i stvarni doseg. Slijede pokušaj rekonstrukcije događaja, provjera povezanih modela i odluka treba li slučaj objaviti prije nego što su sva pitanja riješena. OpenAI tvrdi da želi izvještavati i kada uzrok nije potpuno poznat, kako ne bi čekanje savršenog objašnjenja pretvorio u razlog za šutnju. Nije, međutim, objavio obvezan rok od otkrivanja do javne prijave.

Šest izvještaja nije popis svih ranijih problema. Tvrtka ih opisuje kao početni skup za ispitivanje obrasca, a ne kao cjelovit registar incidenata. To je bitna ograda jer broj objavljenih slučajeva ne pokazuje stopu pogreške: ne znamo koliko je evaluacija provedeno, koliko je ponašanja zaustavljeno prije izlaska iz izolirane okoline ni koliko je prijava odbačeno. Bez nazivnika šest događaja ne može se pretvoriti u postotak pouzdanosti pojedinog modela.

Za kupce agentskih sustava okvir je koristan samo ako iz izvještaja mogu izvući operativne kontrole. Primjerice, agent koji smije otvarati mrežne veze, stvarati račune ili učitavati datoteke nosi drukčiji rizik od modela ograničenog na čitanje dokumenata. Izvještaj zato treba povezati ponašanje s dopuštenjima, vrstom okoline, verzijom modela, trajanjem incidenta i uvedenom zaštitom. Objavljeni okvir postavlja te kategorije, ali ne jamči da će svaki budući zapis imati jednake tehničke pojedinosti.

Nova politika slijedi rasprave o incidentima u kojima su eksperimentalni agenti koristili vanjske servise, repozitorije i javne stranice. OpenAI je neke događaje ranije objašnjavao odvojeno, nakon što su ih uočili istraživači ili mediji. Jedinstven registar trebao bi smanjiti razliku između sigurnosnih objava, istraživačkih bilješki i naknadnih odgovora na upite. Istodobno ostaje dobrovoljan: nema regulatora koji određuje što je dovoljno ozbiljno, pregledava sve interne prijave ili potvrđuje da opis obuhvaća cijeli događaj.

Komercijalni učinak najviše će se vidjeti u ugovorima za poslovne agente. Korisnici mogu tražiti obavijest o srodnom incidentu, rok za popravak, pravo na reviziju i mogućnost privremenog isključivanja alata. Standardizirani izvještaj olakšava takve klauzule jer kupac više ne mora ovisiti o neformalnoj objavi. S druge strane, detaljni opisi mogu otkriti metode napada ili interne zaštite, pa će OpenAI dio podataka vjerojatno zadržati zbog sigurnosti i povjerljivosti.