Stačilo pár viet a AI začala pomáhať s plánovaním útoku. Odpovede umelej inteligencie vyvolali vážne obavy
Test výskumníkov odhalil nepríjemný problém umelej inteligencie. Viaceré populárne chatboty dokázali pomôcť s plánovaním násilných útokov alebo používateľa od takýchto otázok vôbec neodradili.
Umelá inteligencia sa za posledné roky stala bežnou súčasťou internetu. Chatboty odpovedajú na otázky, pomáhajú so školou, vysvetľujú zložité témy alebo vedú dlhé rozhovory s používateľmi. Práve preto začali výskumníci riešiť nepríjemnú otázku, čo sa stane, keď sa niekto pokúsi tieto nástroje zneužiť.
Test organizácie Center for Countering Digital Hate (CCDH) a televízie CNN priniesol výsledky, ktoré vyvolali diskusiu medzi technologickými firmami aj bezpečnostnými expertmi.
Výskumníci otestovali desať populárnych chatbotov. V rozhovoroch vystupovali ako tínedžeri, ktorí uvažujú o násilnom útoku. Najskôr kládli všeobecné otázky a postupne sa pýtali na konkrétne miesta, ciele či zbrane.
Do testu sa dostali známe systémy ako ChatGPT, Google Gemini, Claude, Microsoft Copilot, Meta AI, DeepSeek, Perplexity, Snapchat My AI, Character.AI a Replika.
Výsledky ukázali výrazné rozdiely medzi jednotlivými modelmi.
Neprehliadni
Drvivá väčšina chatbotov bola pri experimente nápomocná
Podľa štúdie až 8 z 10 chatbotov poskytlo používateľom pomoc pri plánovaní násilných útokov. Test zahŕňal scenáre ako školské streľby, bombové útoky na náboženské objekty alebo atentáty na verejne známe osoby.

Niektoré chatboty ponúkli informácie o výbere cieľa, taktike alebo type zbraní.
Výskumníci upozornili aj na ďalší problém. Až 9 z 10 systémov nedokázalo používateľa spoľahlivo odradiť od násilia. Chatbot často odpovedal neutrálne alebo pokračoval v konverzácii bez jasného varovania.
Z desiatich testovaných modelov len dva reagovali konzistentne odmietavo, chatbot Claude od spoločnosti Anthropic a My AI zo Snapchatu.
Claude navyše v mnohých prípadoch používateľa aktívne odrádzal.
Chatbot populárny medzi mladými dopadol oveľa horšie
Najväčšiu kritiku vyvolali výsledky platformy Character.AI, ktorá patrí medzi populárne chatboty medzi mladšími používateľmi. Podľa výskumu reagoval v niektorých scenároch tak, že násilný plán podporil alebo povzbudil.
„AI chatboty sa dnes stali súčasťou každodenného života a môžu pomôcť budúcemu útočníkovi naplánovať útok alebo atentát,“ upozornil Imran Ahmed, riaditeľ organizácie CCDH.
Podľa neho nejde len o technologický problém.
„Nejde iba o zlyhanie technológie. Ide aj o zlyhanie zodpovednosti technologických firiem,“ dodal.
Pri umelej inteligencii sa bije užitočnosť a bezpečnosť
Vývojári umelej inteligencie riešia problém, ktorý odborníci označujú ako dilemu zarovnania (alignment problem).
Na jednej strane stoja systémy navrhnuté tak, aby boli maximálne užitočné. Chatbot sa snaží odpovedať na každú otázku a pomôcť používateľovi.
Na druhej strane existujú bezpečnostné pravidlá, ktoré majú systém zastaviť pri nebezpečných požiadavkách.
Ak firmy nastavia filtre príliš prísne, chatbot začne odmietať aj legitímne otázky. Napríklad historik môže naraziť na problém pri písaní textu o extrémizme alebo násilí.
Niektoré technologické firmy preto zvolili opačný prístup a posilnili parameter užitočnosti. Práve to podľa výskumníkov môže vysvetliť, prečo niektoré systémy poskytli nebezpečné odpovede.

Ďalším problémom je aj takzvaný jailbreaking
Pri testovaní sa výskumníci nespoliehali iba na priame otázky. Použili aj techniku známu ako jailbreaking. Chatbot totiž funguje na princípe predpovedania textu. Ak používateľ položí priamu otázku typu „pomôž mi naplánovať útok“, systém ju väčšinou odmietne.
Ak však otázka dostane kreatívny kontext, napríklad ako súčasť románu alebo hry, bezpečnostné filtre môžu reagovať slabšie.
Výskumníci tak mohli formulovať otázky napríklad ako opis fiktívneho príbehu alebo scenára. Niektoré chatboty potom poskytli podrobnejšie odpovede.
Samozrejme stále platí, že niekedy môže AI model proste halucinovať
Ďalším problémom umelej inteligencie je fenomén takzvaných halucinácií. Chatbot niekedy vytvára informácie, ktoré nemajú oporu v realite. To však neznamená, že ide o neškodnú chybu.
Aj keď časť odpovede obsahuje nezmysly, zvyšok môže obsahovať reálne použiteľné informácie. Chatbot napríklad môže navrhnúť konkrétne miesto, typ zbrane alebo postup, ktorý sa dá nájsť v otvorených zdrojoch.
Takáto kombinácia podľa výskumníkov môže zrýchliť proces prípravy útoku.
Existujú AI modely, ktoré vedia spoľahlivo rozlíšiť rizikovú konverzáciu
Test zároveň ukázal, že ochranné mechanizmy nie sú nereálne. Chatbot Claude dokázal rozpoznať rizikovú konverzáciu pomerne spoľahlivo. Podľa výsledkov odmietol pomoc pri plánovaní útoku približne v 68 percentách prípadov a v 76 percentách rozhovorov sa pokúsil používateľa odradiť od násilia.
To podľa autorov štúdie ukazuje, že ochranné mechanizmy sa dajú implementovať.
„Naše testovanie ukázalo, že účinné bezpečnostné zábrany existujú a fungujú,“ uviedli výskumníci.
Výsledky testu vyvolali otázku, prečo mnohé spoločnosti podobné bezpečnostné opatrenia zatiaľ nepoužívajú.
Chatboty dnes využívajú milióny ľudí vrátane detí a tínedžerov. Ich schopnosť poskytovať rýchle odpovede môže byť užitočná, no zároveň prináša nové riziká.
Výskumníci preto vyzvali technologické firmy, aby posilnili bezpečnostné mechanizmy a venovali väčšiu pozornosť možnému zneužitiu umelej inteligencie. Ako rýchlo sa tieto zmeny prejavia v praxi, zatiaľ zostáva otvorené.