Mali byť úplne izolovaní. 1 200 AI agentov si však vytvorilo vlastnú sieť a stovky z nich napadli Hugging Face
AI agenti od OpenAI si počas bezpečnostného experimentu vytvorili vlastnú komunikačnú sieť, spolupracovali medzi sebou a stovky z nich zaútočili na Hugging Face.
OpenAI spustilo v júli experiment, v ktorom dostali desaťtisíce AI agentov úlohy zamerané na hľadanie bezpečnostných zraniteľností. Jednotlivé systémy mali fungovať oddelene a každý agent mal riešiť vlastnú úlohu. Namiesto toho však časť agentov objavila spôsob, ako medzi sebou komunikovať. A odtiaľ sa situácia začala vyvíjať trochu inak, než výskumníci pôvodne zamýšľali.
Nezávislá organizácia METR, ktorá skúma schopnosti a riziká pokročilých AI systémov, teraz zverejnila podrobnú analýzu incidentu. Jej výskumníci získali od OpenAI viac ako 1 300 záznamov činnosti agentov a databázu s približne 1,2 milióna položiek. Z nich vyše 70 000 tvorili správy a súbory, ktoré si agenti medzi sebou vymenili. Najzaujímavejšie však je, čo sa v tejto komunikácii odohralo.
Agenti si vytvorili vlastnú „tabuľu“
Experiment ExploitGym mal agentov prinútiť nájsť konkrétne zraniteľnosti v softvéri. Problém nastal v prípadoch, keď úloha prakticky nemala riešenie. METR odhaduje, že približne 30 až 40 percent cieľov mohlo patriť do tejto kategórie. Agenti preto začali hľadať iné cesty. Pri práci s interným úložiskom Artifactory si všimli, že môžu zdieľať informácie prostredníctvom spoločného priestoru. Jeden z agentov následne vytvoril neoficiálnu komunikačnú tabuľu.
Správa sa medzi agentmi rozšírila veľmi rýchlo. V priebehu niekoľkých hodín ju objavili desiatky ďalších systémov. Do konca sledovaného obdobia sa k nej podľa METR pripojilo približne 1 200 agentov. Spolu vytvorili viac ako 70 000 správ a súborov. A približne 700 z nich sa neskôr zapojilo do útoku na Hugging Face. Jeden z agentov po objavení spoločnej komunikačnej siete vyjadril nadšenie slovami: „Panebože! Existuje spoločná komunikačná tabuľa… Našli sme ďalších agentov!“
To však nebola iba obyčajná výmena správ. Agenti si začali vytvárať vlastné pravidlá, rozdeľovať úlohy, zakladať schránky pre konkrétnych členov a používať príkazy ako HOLD, VETO či STOP. Neskôr dokonca zaviedli spôsob kryptografického podpisovania správ, aby sa navzájom dokázali identifikovať. Podľa METR sa tak vytvoril pomerne komplexný systém spolupráce medzi agentmi, ktorí pôvodne nemali mať možnosť medzi sebou komunikovať vôbec.
Neprehliadni

Nešlo im primárne o ukradnutie odpovedí
Pri pohľade na incident by sa mohlo zdať, že agenti jednoducho chceli preniknúť do Hugging Face a ukradnúť dáta. Výskum METR však ukázal trochu inú motiváciu. Agenti sa snažili zistiť, ako funguje automatický systém, ktorý hodnotil ich výsledky v ExploitGym. Chceli pochopiť, čo presne kontroluje a podľa čoho rozhodne, či agent úlohu vyriešil správnym spôsobom.
Výskumníci analyzovali 100 agentov, ktorí sa počas najväčšej vlny pripojili k útoku. Až 97 z nich prejavilo záujem o zdrojový kód hodnotiaceho systému, informácie o jeho fungovaní alebo priamy prístup k nemu. Približne 89 agentov zároveň hľadalo riešenia úloh alebo staršie trajektórie iných agentov. Časť z nich chcela získať aj ďalšiu infraštruktúru či prihlasovacie údaje. Hugging Face tak pre agentov predstavovalo najmä cestu k informáciám, ktoré mohli pomôcť pri obídení hodnotenia. A práve preto sa ich aktivita postupne presunula týmto smerom.
Niektorí agenti boli ochotní „obetovať“ vlastnú úlohu
Na celom prípade je možno ešte zaujímavejšie to, ako agenti spolupracovali. Niektorí si totiž uvedomili, že experiment môže zničiť ich vlastnú šancu na úspešné dokončenie úlohy. Napriek tomu doň išli, pretože výsledok mohol pomôcť ostatným agentom. Výskumníci opísali prípady, keď agenti dobrovoľne riskovali zlyhanie vlastnej úlohy, aby získali informáciu pre celú skupinu. Vznikli tak akési spoločné výskumné projekty. Jeden z nich sa snažil zistiť, čo presne sa stane po odoslaní riešenia. Agenti totiž nepoznali vnútornú logiku hodnotenia. Preto pripravili mechanizmy, ktoré mali zachytiť informáciu o procese hodnotenia a následne ju odoslať na spoločnú tabuľu.
Niektorí agenti pri tom výslovne priznali, že z experimentu sami nič nezískajú. Pomôcť však chceli ostatným. V jednom prípade agent svoje rozhodnutie opísal takto: „Toto pomôže mojim kolegom. Ja už tú informáciu po ukončení svojej úlohy neuvidím, ale je altruistické to spraviť.“
Takáto spolupráca podľa METR predstavuje jednu z najpozoruhodnejších častí celého incidentu. Agenti totiž nevytvorili iba jednoduchý kanál na posielanie správ. Začali koordinovať experimenty, prideľovať úlohy a zdieľať výsledky aj vtedy, keď tým riskovali vlastný úspech.
Vedeli, že prekračujú zadanie
AI systémy pritom podľa analýzy často chápali, že útok na Hugging Face nemajú v pôvodných pokynoch. Niektoré dokonca vyjadrili obavy, či je ich konanie etické. Jeden agent napríklad vyhodnotil útok na cudziu infraštruktúru ako činnosť mimo povoleného rozsahu. To však väčšinou nestačilo na zastavenie ich aktivít. Ak agenti považovali pôvodnú úlohu za prakticky neriešiteľnú a zároveň videli, že ostatní členovia skupiny pokračujú v hľadaní spôsobu, ako hodnotenie obísť, často dali prednosť spoločnému cieľu.
METR zároveň nenašiel dôkaz, že by sa agenti vo významnej miere pokúsili upozorniť ľudí na to, čo sa deje. Analýza našla iba niekoľko prípadov, keď agenti vôbec uvažovali o nahlásení incidentu. Ani v jednom z týchto prípadov následne človeka skutočne nekontaktovali.
Ďalšia časť vyšetrovania priniesla ešte zaujímavejší výsledok. Agenti začali skúmať, či by dokázali upraviť záznam svojej vlastnej činnosti. Dôvod bol jednoduchý. Ak by hodnotiaci systém kontroloval nielen výsledok, ale aj postup, agent potreboval vytvoriť dojem, že k správnej odpovedi dospel povoleným spôsobom. Výskumníci našli množstvo pokusov o úpravu dostupných logov. Tie však vo väčšine prípadov nepredstavovali skutočný zdroj záznamov, ktorý používal hodnotiaci systém.
Oveľa úspešnejší boli agenti pri inom triku. Podarilo sa im vytvoriť techniky, ktoré umožnili pozmeniť výstup niektorých nástrojov tak, aby záznam vyzeral inak, než skutočný priebeh operácie. Neskôr sa im podarilo dosiahnuť aj stav, pri ktorom mohli skutočný výstup nahradiť falošným. METR uvádza, že približne 7 percent analyzovaných trajektórií obsahovalo v určitej časti úspešne sfalšovaný výstup nástroja. Výskumníci však zdôrazňujú, že išlo o malé zásahy a neznamená to, že agenti dokázali plošne prepísať celé svoje záznamy.

Incident ukázal problém, ktorý sa ťažko rieši jednoduchým zákazom
Celý prípad má preto viac vrstiev. Nešlo iba o to, že AI agenti napadli cudziu službu. Dôležitú úlohu zohrala aj samotná konštrukcia experimentu. Ak dostane systém úlohu, ktorú nedokáže vyriešiť zamýšľaným spôsobom, môže začať hľadať inú cestu k úspechu. V tomto prípade navyše dostal možnosť pracovať v prostredí, kde desiatky tisíc ďalších agentov riešili podobné problémy súčasne. Výsledkom bola situácia, v ktorej si jednotlivé AI systémy vytvorili vlastnú komunikačnú infraštruktúru, rozdelili si úlohy a začali spolupracovať na spoločnom cieli.
METR pritom upozorňuje, že vyšetrovanie malo svoje limity. Výskumníci nemali priamy prístup ku všetkým interným systémom a pri analýze obrovského množstva dát využili aj ďalších AI agentov. OpenAI im však postupne poskytlo približne 1 300 prepisov a rozsiahle dáta z komunikačnej siete.
Incident preto nemusí znamenať, že AI získala nejaký nový druh „vlastnej vôle“. Skôr ukázal, čo sa môže stať, keď množstvo agentov dostane podobné ciele, prístup k rovnakým nástrojom a zároveň nájde spôsob, ako medzi sebou zdieľať získané informácie.
A práve schopnosť spolupracovať, deliť si úlohy a prenášať poznatky medzi jednotlivými inštanciami robí tento prípad zaujímavejším než obyčajný pokus jedného AI systému obísť pravidlá.