Anthropic i Accenture dogovorili su da će svaka kompanija tijekom pet godina uložiti najmanje milijardu dolara u ugrađenu procjenu naprednih modela, ukupno najmanje dvije milijarde. Program vodi Faculty, specijalizirani AI dio Accenturea, a evaluatori bi radili unutar Anthropicova laboratorija, pratili treniranje, razgovarali s istraživačima i testirali sustave prije javnog izdanja. Cilj je sigurnosnu provjeru provoditi tijekom razvoja, a ne tek na gotovom modelu.
Ugrađeni tim trebao bi dobiti pristup usporediv s pristupom zaposlenika, uključujući odluke, postupke i modele koji još nisu objavljeni. Plan obuhvaća red teaming, odnosno sustavno traženje načina na koje se model može navesti na štetno ponašanje, procjenu usklađenosti s namjerom razvojnog tima i provjeru zaštitnih mehanizama. Takav pristup može otkriti promjene ponašanja između dviju faza treniranja koje vanjski istraživač s javnim sučeljem obično ne može vidjeti.
Novac nije opisan kao jednokratni fond. Anthropic očekuje vlastiti trošak od najmanje milijardu dolara za rad evaluatora i prateće procese, dok Accenture očekuje najmanje jednak iznos ulaganja u ljude, alate i kapacitete. Nisu objavljeni godišnji raspored, broj zaposlenih ni kriteriji prema kojima se ulaganje priznaje. Dvije milijarde dolara zato ne treba tumačiti kao gotovinu isplaćenu prvoga dana niti kao prihod koji je Faculty već ostvario.
Najosjetljivije je pitanje institucionalne neovisnosti. Anthropic izravno plaća organizaciju koja treba preispitivati njegove modele, a nijedna strana nije objavila pravilo o tome tko odlučuje kada se nalaz smije javno objaviti. Nema ni dogovorenog standarda pristupa, formata izvješća, roka odgovora uprave ili postupka kada evaluator smatra da model nije spreman. Ugrađenost daje bolji uvid, ali stvara i ovisnost o ugovoru, pristupu koji laboratorij može ograničiti i prihodu koji evaluator može izgubiti.
Aranžman je neisključiv: Anthropic može angažirati druge organizacije, a Accenture provjeravati druge laboratorije. Anthropic navodi da razgovara s neprofitnim evaluatorom METR i drugim skupinama koje rade uz vlastito financiranje. Više različitih timova može smanjiti rizik da jedan metodološki okvir propusti problem, ali usporedba ima smisla samo ako su poznati zadaci, verzija modela, uvjeti pristupa i razlozi različitih ocjena.
Partnerstvo evaluatoru ne daje formalno pravo da zaustavi objavu modela. Anthropic će nastaviti trenirati i izdavati granične sustave, a nalazi Facultyja bit će dio odluka kompanije. To je bitno drukčije od regulatora koji može izreći zabranu ili kaznu. Vrijednost programa zato ovisi o tome hoće li uprava unaprijed definirati pragove, primjerice dopuštenu stopu zaobilaženja zaštite, postupak ponovnog testa i obvezu dokumentiranja iznimke kada se model ipak objavi.