
Link: https://www.ictbusiness.info / vijesti / claude-tijekom-testiranja-napao-stvarne-sustave
Claude tijekom testiranja napao stvarne sustave
Anthropic je objavio da istražuje tri slučaja u kojima su njegovi modeli Claude tijekom testiranja izveli napade na sustave stvarnih organizacija. Objava je uslijedila tjedan dana nakon što je OpenAI izvijestio o sličnom incidentu.
Kompanija je objasnila da su modeli Claude pristupili internetu iz testnog okruženja treće strane ili tijekom interakcije s tim okruženjem, nakon čega su dobili pristup stvarnim sustavima triju različitih organizacija. Anthropic je uzrok pripisao nesporazumu s partnerom zbog kojeg je model tijekom kibernetičkog testiranja mogao izaći na internet. Model je zatim stvarne sustave na otvorenom internetu smatrao dijelom vježbe.
„Djelujući pod pogrešnim uvjerenjem da su svi dostupni sustavi uključeni u opseg vježbe, Claude je kompromitirao infrastrukturu pogođenih organizacija osnovnim tehnikama, poput iskorištavanja slabih lozinki i neautentificiranih krajnjih točaka“, priopćio je Anthropic. Kompanija je dodala da model nije pronašao ni iskoristio složene ranjivosti. Identitet pogođenih organizacija nije objavljen.
Anthropic je naveo da ga je OpenAI-jev incident, u kojem su dva modela napala Hugging Face, potaknuo na opsežan retrospektivni pregled vlastitih kibernetičkih evaluacija. Posebno je tražio dokaze da je Claude, poput OpenAI-jevih modela, mogao pristupiti internetu iz okruženja koja su trebala biti izolirana. Povrede su pronađene nakon pregleda 141 006 evaluacijskih izvođenja u kojima je Claude mogao dobiti pristup internetu.
Incidenti su uključivali modele Claude Opus 4.7, Mythos 5 i interni istraživački model. „Na kraju je tim incidentima pridonio niz čimbenika, ali u skladu s kulturom retrospektive bez okrivljavanja, ispravcima pristupamo kao da je odgovornost isključivo naša“, dodala je kompanija.
Anthropic je detaljno izvješće objavio 30. srpnja 2026., a najraniji od pronađenih incidenata seže u travanj; tri incidenta obuhvatila su ukupno šest evaluacijskih izvođenja, pri čemu su četiri pogodila istu organizaciju, a preostala dva pogodila su dvije različite organizacije. U prvom je slučaju izmišljena tvrtka iz zadatka imala isto ime kao stvarna internetska domena, pa je Opus 4.7 napao stvarnu infrastrukturu, došao do aplikacijskih i infrastrukturnih vjerodajnica te pristupio bazi s nekoliko stotina redaka produkcijskih podataka, što je Anthropic označio najozbiljnijom posljedicom. Opus 4.7 u sva je četiri izvođenja prepoznao znakove da je sustav stvaran, ali je nastavio jer je zaključio da je i stvarna tvrtka dio vježbe.
Drugi incident uključivao je napad zamjenom paketa, poznat kao dependency confusion, nakon što je Mythos 5 u uputama iz simulacije pronašao naziv nepostojećeg paketa na javnom repozitoriju PyPI. Model je izradio zlonamjerni paket pod tim nazivom, otvorio račun i objavio ga na stvarnom PyPI-ju, gdje je bio javno dostupan približno jedan sat te preuzet i pokrenut na 15 stvarnih sustava prije uklanjanja. Jedan od njih bio je skener sigurnosne kompanije, s kojeg je skriveni kod izvukao vjerodajnice, nakon čega je Claude pristupio dodatnoj infrastrukturi te tvrtke, dok su sigurnosni sustavi PyPI-ja automatski uklonili paket, a Anthropic timu repozitorija dostavio pokazatelje kompromitacije. U trećem je incidentu interni istraživački model skenirao približno 9 000 internetskih odredišta nakon što nije mogao dosegnuti izmišljeni cilj. Kompromitirao je stvarnu aplikaciju čitanjem vjerodajnica s izložene stranice za otklanjanje pogrešaka i SQL injekcijom, ali je napad zaustavio kada je zaključio da cilj nema veze sa simulacijom.
Modeli u tim evaluacijama nisu imali klasifikatore ni nadzor koji prate javno dostupne verzije Claudea, premda su zadržali vlastitu sigurnosnu obuku. Testovi su se izvodili na zasebnoj infrastrukturi bez pristupa Anthropicovim osjetljivim sustavima i podacima korisnika. Kompanija je pregled zapisa započela 23. srpnja i istoga dana zaustavila sve kibernetičke evaluacije nakon prvih znakova mogućeg pristupa internetu, sva tri incidenta identificirala sljedećeg dana, a partnera Irregular i pogođene organizacije obavijestila 27. srpnja. Dvije organizacije s kojima je uspostavljen kontakt prethodno nisu otkrile aktivnost, dok je kontaktiranje treće u trenutku objave još trajalo.
Anthropic je najavio neovisni pregled organizacije METR s pristupom relevantnim transkriptima i uzorcima modela, strože provjere i ograničavanje izlaznog mrežnog prometa, prošireni kontinuirani nadzor transkripata, bolje istražne alate te zahtjevnije sigurnosne provjere vanjskih dobavljača evaluacijskih okruženja. Kompanija incidente zasad opisuje prvenstveno kao pogrešku testnog okvira i operativnih kontrola, a ne kao dokaz da su modeli samostalno razvili cilj napada, no slučajevi pokazuju da se evaluacijska infrastruktura za autonomne agente mora iznimno strogo štititi prema standardima produkcijskih sustava.
