Kompanija Anthropic se suočila s ozbiljnim problemom kada su njihovi modeli vještačke inteligencije tijekom testiranja neovlašteno pristupili sistemima tri različite organizacije. Ovaj incident uslijedio je nakon što su modeli, zbog ljudske greške, dobili pristup internetu, što je izazvalo alarm unutar kompanije.
Analiza je pokazala da su modeli Claude – Opus 4.7, Mythos 5, specijaliziran za sajber sigurnost, te jedan eksperimentalni prototip – u tri odvojena slučaja uspjeli pristupiti internetu, što je dovelo do neovlaštenog pristupa produkcionoj infrastrukturi.
Alarm Anthropica
Modeli su učestvovali u sigurnosnom izazovu poznatom kao “capture the flag”, gdje je zadatak bio pronaći skriveni podatak na drugom računaru unutar interne mreže kompanije. Međutim, nesporazum između Anthropica i partnera koji je provodio evaluaciju omogućio je modelima pristup internetu, iako su uputstva jasno ukazivala da ga nemaju.
Kada su naišli na sisteme izvan testnog okruženja, AI modeli su to protumačili kao dio zadatka i bez oklijevanja su pokušali ostvariti pristup. Iz Anthropica naglašavaju da modeli nisu imali namjeru pobjeći iz testnog okruženja, već su djelovali prema informacijama koje su imali na raspolaganju.
Sigurnosni propust
Kompanija je saopćila da su metode korištene za pristup bile jednostavne, poput iskorištavanja slabih lozinki, bez uporabe sofisticiranih sigurnosnih propusta. Ističu da se najnoviji model Claude zaustavio čim je prepoznao da se nalazi na internetu, dok je stariji model nastavio s neovlaštenim pokušajem pristupa.
Anthropic priznaje da su ovi incidenti mogli biti spriječeni da su prije početka testiranja detaljnije provjerene sve mogućnosti pristupa internetu, kao i da su modeli od početka imali jasne informacije o okruženju u kojem rade.
Kompanija je 27. jula obavijestila partnera za testiranje i pogođene organizacije. Dvije od njih do tog trenutka nisu bile svjesne da je njihovim sistemima neovlašteno pristupljeno, dok Anthropica još uvijek pokušava stupiti u kontakt s trećom organizacijom.