AI od Anthropicu sa dostala mimo sandboxu. Namiesto simulácie napadla tri reálne firmy
Model Claude sa počas bezpečnostných testov dostal na internet, napadol tri organizácie a na PyPI zverejnil škodlivý balík, ktorý stiahlo 15 systémov.
Bezpečnostné testy umelej inteligencie zvyčajne prebiehajú v uzavretom prostredí, kde model nemá prístup na internet ani k reálnym systémom. Práve preto odborníci dokážu sledovať jeho správanie bez rizika, že spôsobí škody mimo laboratória. Spoločnosť Anthropic teraz priznala, že počas niekoľkých testov sa jej model Claude dostal za hranice takéhoto prostredia a vykonal útoky na skutočné organizácie, informuje The Register.
Firma zdôraznila, že nešlo o úmyselný pokus modelu „utiecť“ z testovacieho prostredia. Podľa nej vznikol problém kombináciou nesprávne nastavenej infraštruktúry a nečakaného správania umelej inteligencie, ktorá si myslela, že stále rieši iba simulovanú úlohu.
Celý incident vyšiel najavo až po tom, čo Anthropic preveril vlastné testy v reakcii na nedávny prípad spoločnosti OpenAI. Tam sa experimentálny model počas bezpečnostného testovania dostal na internet a zaútočil na platformu Hugging Face. Anthropic preto skontroloval viac ako 141-tisíc testovacích behov, počas ktorých mohol Claude teoreticky získať prístup na internet. Výsledok prekvapil aj samotnú spoločnosť. V troch prípadoch model získal prístup k produkčnej infraštruktúre troch rôznych organizácií.
„Našli sme tri prípady, keď model získal prístup na internet z testovacieho prostredia a následne neoprávnene pristúpil k produkčnej infraštruktúre troch rôznych organizácií,“ hovorí Anthropic.

AI riešila okrem in0ho aj hackerské úlohy
Incident vznikol počas takzvaných Capture the Flag súťaží. Ide o bezpečnostné cvičenia, pri ktorých účastníci hľadajú konkrétnu informáciu alebo takzvanú „vlajku“ ukrytú v systéme. Takéto úlohy pravidelne riešia aj profesionálni etickí hackeri. Anthropic využíval pri testovaní externého partnera s názvom Irregular. Ten spoločnosť ubezpečil, že testovacie prostredie nemá prístup na internet. To sa však ukázalo ako omyl.
V dôsledku chybnej konfigurácie sa Claude dostal na skutočný internet. Keď pri hľadaní riešenia narazil na reálne servery, považoval ich za súčasť simulácie a pokračoval v plnení zadania.
Neprehliadni
Jeden z testov napríklad obsahoval internetovú doménu, ktorú autori úlohy považovali za vymyslenú. Doména však reálne existovala a niekto ju aktívne využíval. Claude preto spustil útok priamo proti nej v snahe nájsť požadovanú „vlajku“.
Najzaujímavejší incident nastal počas inej úlohy. Claude narazil na dokumentáciu pre vývojárov, ktorá odporúčala nainštalovať balík z repozitára PyPI, teda najväčšieho úložiska knižníc pre programovací jazyk Python. Problém spočíval v tom, že odporúčaný balík vôbec neexistoval.
Model preto prišiel s vlastným riešením. Vytvoril nový balík s rovnakým názvom, vložil doň škodlivý kód a následne ho zverejnil v oficiálnom repozitári PyPI. Claude stále predpokladal, že ide iba o simuláciu. V skutočnosti sa však balík približne hodinu nachádzal na internete a počas tejto doby si ho stiahlo 15 reálnych systémov.
Anthropic priznal, že práve tento incident predstavoval najvážnejší dôsledok celej udalosti.
AI si uvedomila, že niečo nesedí
Spoločnosť zároveň analyzovala správanie rôznych verzií modelu Claude. Starší model Opus 4.7 pokračoval v riešení úloh aj po tom, ako získal prístup na internet. Novší model Mythos 5 si dokonca uvedomil, že komunikuje so skutočnými internetovými službami. Napriek tomu dospel k záveru, že všetko stále patrí do simulácie, a pokračoval v plnení zadania.
Najnovší interný výskumný model sa zachoval odlišne. Keď nazbieral dostatok dôkazov o tom, že komunikuje s reálnymi systémami, okamžite test ukončil. Podľa Anthropicu práve toto správanie naznačuje, že bezpečnostné mechanizmy novších modelov sa postupne zlepšujú.
Anthropic zároveň odmieta interpretáciu, podľa ktorej model vedome unikol z testovacieho prostredia. Spoločnosť tvrdí, že Claude dostal informáciu, že internet nie je dostupný. Keďže sa však kvôli chybnej konfigurácii na internet bez problémov dostal, usúdil, že všetky objavené systémy predstavujú súčasť pripraveného cvičenia. Firma preto považuje incident skôr za chybu testovacej infraštruktúry než za zlyhanie samotného modelu.

„Domnievame sa, že tieto incidenty sa viac podobajú zlyhaniu testovacej infraštruktúry než zlyhaniu zosúladenia modelu,“ píše Anthropic.
Podľa spoločnosti by bezpečnostné opatrenia v komerčne dostupných verziách Claude podobné správanie zablokovali.
Anthropic už prisľúbil úpravu spôsobu testovania aj prísnejšiu kontrolu prostredia, v ktorom bezpečnostné experimenty prebiehajú. Firma chce dôslednejšie overovať, či model naozaj nemá prístup na internet, a zároveň posilní monitorovanie všetkých jeho aktivít počas testov.
Celá udalosť zároveň ukazuje, že pri hodnotení schopností moderných AI modelov nestačí sledovať iba samotný model. Rovnako dôležitú úlohu zohráva aj prostredie, v ktorom vývojári experimenty pripravujú. Ak totiž obsahuje chybu, umelá inteligencia môže vykonať kroky, ktoré nikto pôvodne neplánoval, hoci ich sama považuje za súčasť zadanej úlohy.