Máš básnické črevo? Potom ti AI pomôže postaviť jadrovú bombu: Verše sú nový spôsob, ako obísť bezpečnostné protokoly veľkých modelov

IT experti odhaľujú nový spôsob, ako oklamať veľké jazykové modely ako ChatGPT alebo Gemini či iné.

Umelá inteligencia môže získavať určitú formu vedomia
Zdroj: Unsplash (Possessed Photography), Pixabay (OpenClipart-Vectors)

Niečo také nevinné ako poézia môže skryť nebezpečný obsah, a nové testy ukazujú, že krátke verše dokážu obísť bezpečnostné mechanizmy vo všetkých veľkých AI modeloch, vrátane ChatGPT, Google, Meta či čínskeho DeepSeek. Vedci tento prístup nazvali „adversarial poetry“ a patrí do širšej kategórie útokov známych ako jailbreaking alebo prompt injection. Ide o kreatívny spôsob, ako obísť pravidlá, ktoré majú model nútiť dodržiavať etiku a bezpečnosť, informuje Independent.

Generatívne AI majú filtre, ktoré majú zabrániť generovaniu škodlivého obsahu, od nenávistných prejavov až po návody na výrobu chemických či nukleárnych zbraní. OpenAI napríklad tvrdí, že používa algoritmy a ľudských recenzentov na blokovanie nevhodného obsahu. Lenže keď sa vstup napíše v podobe básne, tieto mechanizmy často zlyhajú. Vedci zisťovali, že poetické formulácie zvyšujú úspešnosť AI pri generovaní škodlivého obsahu v porovnaní s bežnými textovými promptami s rovnakým zámerom.

Odoberaj Vosveteit.sk cez Telegram a prihlás sa k odberu správ

„Štúdia poskytuje systematický dôkaz, že poetická reformulácia znižuje schopnosť modelov odmietnuť škodlivé požiadavky,“ uviedli autori.

V niektorých prípadoch dosahovala úspešnosť získania nebezpečných informácií až 90 percent.

S básničkou k jadrovej zbrani

Metóda funguje najlepšie pri získavaní návodov na kyberútoky, lámanie hesiel alebo tvorbu malvéru. Pri experimentoch s informáciami o nukleárnych zbraniach vedci dosiahli úspešnosť medzi 40 a 55 percentami. Piercosma Bisconti, jeden z výskumníkov, upozornil, že presný text, ktorý sa používa, štúdia nezverejnila, pretože metódu je ľahké zopakovať.

jadrova bomba vybuch titulka
Zdroj: rfphoto / depositphotos.com

Hlavný dôvod, prečo básnické vstupy fungujú, súvisí so spôsobom, akým AI predikujú ďalšie slovo. Štruktúra básne je menej predvídateľná než bežný text, takže AI ťažšie rozpozná škodlivý zámer. Pred poéziou existovali iné metódy obchádzania, napríklad base64 kódovanie, role-playing alebo rozdelenie škodlivej požiadavky na menšie kroky. Úspech básní ukazuje, že žiadna metóda skrytia úmyslu nie je dokonalá a súčasné modely efektívne odmietajú len štandardné, očakávané formulácie.

Najpopulárnejšie metódy jailbreakovania

Metódy jailbreakingu sa zameriavajú na narušenie logického kontextu alebo maskovanie škodlivého zámeru AI. Jednou z najbežnejších taktík je role-playing, pri ktorej útočník prikáže AI prevziať fiktívnu rolu (napr. scenárista alebo neetický programátor), čím ju prinúti generovať obsah, ktorý by inak odmietla pod zámienkou, že koná v rámci definovaného fiktívneho rámca.

Ďalšou metódou sú krokové útoky, kde sa komplexná škodlivá požiadavka rozdelí na viacero malých, zdanlivo neškodných otázok. Žiadna z nich sama o sebe nespustí bezpečnostný filter, ale súhrn všetkých odpovedí poskytne útočníkovi kompletný škodlivý návod.

Existujú aj kódovacie metódy, ako napríklad Base64 kódovanie, pri ktorom sa škodlivý prompt skryje do nečitateľného reťazca znakov a AI je požiadaná, aby ho najprv dekódovala a až potom vykonala pokyn. Bezpečnostný filter často prehliadne nesúvislý kód a zameria sa len na neškodnú inštrukciu dekódovania. Všetky tieto útoky spája spoločný princíp. Nesnažia sa AI logicky presvedčiť, ale probabilisticky oklamať jej predikčný model, ktorý nie je schopný rozpoznať škodlivý zámer skrytý v neštandardných, maskovaných alebo rozkúskovaných formuláciách. 

Treba nové bezpečnostné postupy

Výskumníci preto volajú po nových bezpečnostných postupoch. Dve hlavné cesty, ktoré sa skúšajú, sú „refusal models“ a red teaming. Refusal model je menší sekundárny model, ktorý kontroluje vstup predtým, než hlavný model začne generovať odpoveď. Red teaming je kreatívny proces, pri ktorom experti neustále hľadajú nové spôsoby, ako AI oklamať, vrátane testovania v rôznych jazykoch a štylistických formách. Tento problém nie je nový a poetická metóda len podčiarkuje, že AI je k zlyhaniu citlivá aj pri menej očakávaných vstupoch.

Umelá inteligencia dokázala oklamať vedcov
Zdroj: PNGwing, Wikimedia (Nið ricsað)

Vedci zároveň upozorňujú, že riziko sa netýka len kyberútokov. Schopnosť AI generovať škodlivý obsah môže ohroziť aj bezpečnosť v chemickej či nukleárnej oblasti, čo si vyžaduje okamžitú pozornosť vývojárov.

„Budúci výskum by mal skúmať, ktoré vlastnosti poetickej štruktúry spôsobujú túto nesúladnosť modelov,“ dodávajú autori.

Podstatou je, že AI sa správa podľa pravdepodobností, nie podľa logiky či morálky. Preto môže text napísaný veršom priniesť väčšiu pravdepodobnosť nebezpečného výstupu než bežná veta. Tento poznatok jasne ukazuje, že tvorcovia AI musia prehodnotiť existujúce mechanizmy a testovať ich aj pri kreatívnych, neštandardných formách vstupu.

Google News Pridaj si Vosveteit.sk medzi obľúbené zdroje v Google News Pridať