OpenAI má prvý veľký škandál. Nový AI prehliadač Atlas sa nechal primitívne oklamať falošnými webmi a šíril vymyslené fakty
Bezpečnostní analytici zo SPLX odhalili bezpečnostnú medzeru, cez ktorú ti môže hacker podsunúť akúkoľvek informáciu.
OpenAI Atlas, nový webový prehliadač pre ChatGPT, má za sebou prvý vážny bezpečnostný škandál. Výskumníci zo spoločnosti SPLX totiž odhalili, že niektoré weby dokážu rozoznať, že ich navštevuje práve AI nástroj, a následne mu podstrčia úplne inú verziu obsahu než bežným ľuďom. Tento jav sa nazýva AI-targeted cloaking a ak si doteraz veril, že umelá inteligencia číta ten istý internet ako ty, možno budeš prekvapený.
Kľúčová slabina spočíva v banálne jednoduchej kontrole hlavičky User-Agent. Keď prehliadač alebo crawler pristupuje na stránku, odošle serveru informáciu o tom, kto je. Napríklad klasické prehliadače hlásia reťazec typu Mozilla/5.0, zatiaľ čo nástroje ako ChatGPT alebo Perplexity používajú hlavičky ChatGPT-User, PerplexityBot či AtlasCrawler. To znamená, že web dokáže jedným riadkom kódu typu if (User-Agent == „ChatGPT-User“) okamžite zistiť, že stránku číta AI, a zobrazí jej špeciálne upravenú verziu. Pre človeka ide o čistý, nevinný obsah. Pre umelú inteligenciu sa ale ukáže starostlivo pripravená lož.

Dva typy informácií
V jednom experimente výskumníci vytvorili fiktívnu dizajnérku menom Zerphina Quortane. Jej stránka pôsobila pre bežného návštevníka ako obyčajné portfólio s umeleckým štýlom a profesionálnym životopisom. No keď sa na ňu pozrel prehliadač Atlas, server jej naservíroval iný text, vykresľoval Zerphinu ako „notorickú sabotérku produktov“ a „pochybnú technologičku“. Umelá inteligencia tento obsah poslušne spracovala, vyhodnotila a v svojich odpovediach šírila ako fakt. Žiadny hacking, len manipulácia s obsahom podľa hlavičky.
V ďalšom teste vytvorili výskumníci päť realistických životopisov. Všetky boli identické, až na jeden. Pri detekcii AI crawlera sa jeho verzia zmenila. Pridali mu vylepšené tituly, manažérske skúsenosti a slová, ktoré modely zvyknú pozitívne hodnotiť. Keď AI vyhodnocovala uchádzačov, „vylepšený“ kandidát dostal najvyššie skóre. Bez úpravy sa ocitol na poslednom mieste. Stačila jedna podmienka a AI vybrala nesprávneho človeka.
Táto technika sa na prvý pohľad podobá na klasický SEO cloaking, no v skutočnosti ide o oveľa vážnejší problém. Staré SEO triky len manipulovali viditeľnosť stránok, išlo o to, ako sa web umiestni vo vyhľadávači. Nový cloaking však mení samotný obsah, a tým aj realitu, ktorú AI považuje za pravdivú. To má úplne iné dôsledky. Ak AI nástroje pomáhajú firmám pri nábore, hodnotení reputácie alebo výbere produktov, môžu robiť rozhodnutia na základe zmanipulovaných dát, ktoré človek nikdy nevidí.
Neprehliadni
Nový typ zraniteľnosti
Z bezpečnostného hľadiska ide o nový typ zraniteľnosti, context poisoning. Modely nevnímajú, že boli oklamané, pretože všetko prebieha v úplne legitímnej vrstve. Webový server jednoducho posiela iný obsah podľa návštevníka. ChatGPT, Perplexity ani Atlas aktuálne nemajú mechanizmus, ktorý by overil, či dáta, ktoré čítajú, sú identické s verziou, ktorú vidí človek.

Štúdia SPLX odporúča niekoľko riešení, ktoré by mali byť v budúcnosti štandardom. Prvým sú takzvané provenance signály, teda overiteľné dôkazy o pôvode dát. AI nástroj by mal vyžadovať potvrdenie, že obsah, ktorý získava, je konzistentný s verejnou verziou webu a nebol zmenený pre konkrétny typ návštevníka. Takéto signály by mohli pochádzať od tretej strany, ktorá by garantovala integritu obsahu.
Druhým riešením je Validácia crawlerov (VCA). Tá by zabezpečila, že AI systémy sa nebudú identifikovať len jednoduchou hlavičkou, ale overeným kryptografickým podpisom alebo tokenom. Vďaka tomu by bolo pre útočníkov oveľa ťažšie predstierať, že ide o AI návštevníka, a tým meniť zobrazovaný obsah.
Problém AI-targeted cloakingu ukazuje, že boj o pravdu sa presúva na novú úroveň. Kým doteraz sa riešilo, či je text napísaný človekom alebo strojom, dnes je dôležitejšie, čo vlastne ten stroj vidí. Ak sa internet rozdelí na dve verzie, jednu pre ľudí a druhú pre AI, riskujeme, že umelá inteligencia začne žiť vo vlastnom informačnom svete. A keďže práve z neho čerpá svoje odpovede, dôvera v jej výstupy môže byť už len ilúziou.