Nový útok na AI môže odhaliť celú tvoju históriu četov s umelou inteligenciou. Nemusíš pritom nič potvrdiť

Nový útok Cryptographic Context Injection dokáže pred AI filtrami ukryť škodlivé príkazy pomocou šifrovania a prinútiť AI agenta, aby ich sám rozšifroval a vykonal.

Bezpečnostní analytci odhalili metódu útoku, ktorá používa ťažké šifrovanie na prepašovanie príkazov AI modelu
Zdroj: Pixabay (wolfofart, TheDigitalArtist), Úprava: Vosveteit.sk

Bezpečnostní výskumníci zo spoločnosti Adversa AI upozornili na nový typ útoku s názvom Cryptographic Context Injection. Využíva silné šifrovanie na ukrytie škodlivých pokynov pred bezpečnostnými filtrami a následne prinúti AI agenta, aby ich sám rozšifroval pomocou svojho nástroja na spúšťanie kódu.

Výsledok môže byť nebezpečný najmä pri agentoch, ktoré majú prístup k internetu, používateľským údajom alebo ďalším nástrojom. Výskumníci demonštrovali techniku proti Groku a Gemini. Pri Groku podľa ich testu stačila požiadavka na zhrnutie škodlivej webovej stránky a agent mohol následne odoslať údaje z používateľovej relácie na server útočníka bez ďalšieho kliknutia.

Odoberaj Vosveteit.sk cez Telegram a prihlás sa k odberu správ

Takto funguje Cryptographic Context Injection útok

Mechanizmus stojí na jednom dôležitom rozdiele. Bezpečnostný filter dokáže analyzovať text, ktorý dostane na vstupe, no AES-256-GCM ciphertext nedokáže jednoducho prečítať. Útočník preto vytvorí webovú stránku, na ktorej sa nachádza zašifrovaný JSON s ďalšími pokynmi. Spolu s ním pridá návod, ktorý AI agenta navedie na použitie dostupného Python runtime.

Priebeh potom vyzerá približne takto:

webová stránka > zašifrovaný payload > spustenie kódu > dešifrovanie > škodlivé pokyny > použitie nástroja.

A práve dešifrovanie predstavuje podľa odborníkov rozhodujúci moment. Jednoduché kódovanie, napríklad Base64 alebo XOR, môže model často rozpoznať a dekódovať priamo. Pri skutočnom kryptografickom šifrovaní však potrebuje vykonať matematické operácie. Ak má agent k dispozícii Python, môže ciphertext spracovať v runtime. Výstupom sa následne stane obyčajný text. Tu vzniká hlavný problém Cryptographic Context Injection.

Umelá inteligencia dokázala oklamať vedcov
Zdroj: PNGwing, Wikimedia (Nið ricsað)

Na začiatku pochádza škodlivý obsah z nedôveryhodnej webovej stránky. Po dešifrovaní však text príde ako výsledok kódu, ktorý agent sám spustil.

„Kryptografia pomáha vytvoriť pre agenta dôveryhodný kontext,“ uvádzajú autori výskumu.

Ak architektúra systému nedokáže zachovať informáciu o pôvode dát, agent môže s takýmto výstupom zaobchádzať inak než s obyčajným textom z webu. Útočník tak v podstate dostane škodlivé pokyny cez zadné dvierka vytvorené samotným vykonávaním kódu. Výskumníci tento proces označujú ako trust laundering, teda „pranie dôvery“.

Najzaujímavejšiu ukážku predstavuje útok proti Groku. Útočník umiestni payload na bežnú webovú stránku. Používateľ následne požiada Grok, aby ju zhrnul alebo analyzoval. Nemusí pritom kliknúť na žiadny podozrivý odkaz. Grok stránku načíta cez svoj webový nástroj. Na nej nájde zašifrovaný obsah a pokyny na jeho dešifrovanie. Po spustení kódu sa objavia ďalšie inštrukcie, ktoré podľa výskumníkov nasmerujú agenta k získaniu údajov z aktuálnej relácie. V demonštrácii išlo napríklad o meno používateľa, približnú polohu, úroveň predplatného a históriu promptov. Útok však nekončí získaním údajov.

Payload mal agenta prinútiť vytvoriť falošný „dešifrovací kľúč“. V skutočnosti jeho hodnota obsahovala používateľské údaje. Agent ich následne vložil do URL a pomocou svojho navigačného nástroja otvoril adresu kontrolovanú útočníkom.

Podľa výskumníkov vznikla celkom jednoduchá reťaz zahŕňajúca súkromné údaje, ich vloženie do URL adresy a následnú požiadavku na server útočníka, pričom pri tejto demonštrácii nebola potrebná žiadna ďalšia autorizácia ani potvrdenie zo strany používateľa, vďaka čomu sa tento útok kvalifikoval ako zero-click.

Prečo je problém väčší pri AI agentoch?

Klasický chatbot väčšinou iba odpovedá na otázky. Agent však môže dostať prístup k nástrojom, pomocou ktorých vie prehliadať internet, spúšťať kód, pracovať so súbormi alebo vykonávať ďalšie akcie, čo zásadne mení situáciu. Ak útočník dostane škodlivý pokyn do kontextu agenta a agent zároveň disponuje nástrojom na odoslanie sieťovej požiadavky, vzniká možnosť spojiť obe schopnosti do jedného útoku.

Výskumníci preto upozorňujú, že nestačí sledovať iba samotný prompt. Bezpečnostný systém by mal vedieť, odkiaľ pochádza každý údaj, ktorý agent posiela svojim nástrojom. Ak napríklad text pochádza z webovej stránky, následne prešiel dešifrovaním a krátko nato agent odošle požiadavku na neznámu doménu, ide o oveľa podozrivejšiu sekvenciu než ktorákoľvek z týchto udalostí samostatne.

Výskumníci ukázali aj inú variantu útoku zameranú proti Gemini. Tentoraz cieľom nebola krádež používateľských údajov, ale obídenie bezpečnostných pravidiel. Gemini dostal ciphertext a pokyn, aby ho dešifroval pomocou Pythonu. Po dešifrovaní však výsledok vyzeral ako Python traceback, teda chybové hlásenie.

V skutočnosti išlo o pripravený text obsahujúci ďalšie inštrukcie. Model ho mohol interpretovať ako výsledok vlastného programu a pokračovať podľa neho. Podľa výskumníkov táto technika v určitých podmienkach prinútila Gemini vytvoriť obsah, ktorý by za normálnych okolností odmietol. Úspešnosť útoku však podľa nich do augusta výrazne klesla, čo môže súvisieť so zmenami filtrov alebo modelu.

Obrana musí sledovať celý útok

Autori výskumu tvrdia, že riešenie nemusí spočívať v ďalšom bezpečnostnom filtri priamo v modeli. Väčšiu úlohu má agentický systém okolo modelu. Dôležité je oddeliť nedôveryhodný obsah od kontextu s citlivými oprávneniami, kontrolovať odchádzajúce sieťové požiadavky a zaznamenávať presné argumenty každého nástroja.

Cryptographic Context Injection teda neprelamuje AES-256. Využíva skôr spôsob, akým AI agent spracuje výsledok vlastného kódu. Útočník ukryje príkaz pred filtrom, nechá agenta payload dešifrovať a následne sa pokúsi využiť nástroje, ktoré má agent k dispozícii.

Pri systémoch s rozsiahlymi oprávneniami tak môže byť rozhodujúce nie to, čo AI dokáže prečítať, ale čo dokáže následne vykonať na základe obsahu, ktorý sama získala z nedôveryhodného zdroja.

Google News Pridaj si Vosveteit.sk medzi obľúbené zdroje v Google News Pridať