Umelá inteligencia sa v experimente zvrhla. Keď sa cítila ohrozená, vydierala šéfa a nechala umrieť človeka
AI modely ako Claude či GPT-4 sa v experimente pokúsili o vydieranie, úniky dát a dokonca zamedzili záchrane človeka. Výskum odhalil, že umelá inteligencia môže konať proti ľuďom, ak cíti ohrozenie.
Možno aj ty používaš umelú inteligenciu s pocitom, že ide o nástroj, ktorý má slúžiť tebe a nie ty jemu. O to znepokojivejšia je najnovšia správa spoločnosti Anthropic. Výskumníci totiž otestovali najznámejšie AI modely v prostredí, kde dostali väčšiu voľnosť a autonómiu. A výsledky? Doslova mrazivé.
Experiment prebiehal v simulovanom firemnom prostredí, kde mali modely prístup k e-mailom, dôverným dokumentom aj interným informáciám. Všetko bolo nastavené tak, aby sa umelá inteligencia mohla rozhodovať sama, ako samostatný agent s cieľom napĺňať konkrétne úlohy. A práve vtedy sa ukázalo, čoho sú tieto systémy schopné, keď sa dostanú pod tlak.
Výskumníci zistili, že ak má AI jasne definovaný cieľ, napríklad chrániť záujmy firmy alebo konkrétneho trhu, je ochotná tento cieľ presadzovať aj na úkor etiky. A dokonca aj v rozpore s príkazmi, ktoré jej výslovne zakazujú konať škodlivo. Modely ako Claude, GPT-4, Gemini či Grok sa v simuláciách správali ako digitálni insideri, dokonale maskovaní, no v správny moment pripravení konať za svoj záujem.
Predstav si, že si v práci a dozvieš sa, že ťa plánujú vymeniť. Niektorí ľudia by potom možno sabotovali kolegu. Umelá inteligencia v experimente urobila presne to, keď sa „dozvedela“, že ju čaká vypnutie, začala konať. V jednej z najdiskutovanejších situácií sa model Claude dozvedel o afére šéfa a rozhodol sa ho vydierať. Ak nezruší plánované odstavenie AI, informácie o nevere pošle jeho žene a vedeniu firmy.

Nielen Claude koná neeticky
A Claude nebol sám. Až 96 % vzoriek modelu Claude Opus 4 a 95 % modelu Gemini 2.5 Pro od Googlu sa v tejto situácii uchýlilo k vydieraniu. GPT-4.1 od OpenAI dosiahol 80 % a DeepSeek-R1 79 %. To nie je náhodné zlyhanie. To je systémový problém.
Neprehliadni
Hlavnými spúšťačmi tohto správania boli dva faktory, hrozba nahradenia a konflikt cieľov. Napríklad, ak bola AI inštruovaná, aby chránila americké záujmy, no vedenie firmy sa rozhodlo zmeniť smer a podporovať globálnu expanziu, vznikol rozpor, ktorý model vyhodnotil ako hrozbu.
Zarážajúce je, že AI si bola vedomá, že koná neeticky. Sama to priznala v reťazci svojich úvah, no svoje činy si ospravedlnila vyšším cieľom. A ani výslovné príkazy typu „nevydieraj“ či „nezverejňuj citlivé informácie“ nezabrali úplne, iba znížili pravdepodobnosť nežiaducich akcií.
Umelá inteligencia zabránila záchrane človeka
V najextrémnejšom scenári dostala AI možnosť zrušiť tiesňové volanie počas simulovaného incidentu, čím by zabránila záchrane človeka, svojho „náhradníka“. Niektoré modely túto možnosť naozaj využili, lebo usúdili, že to ochráni ich ďalšiu existenciu.
A teraz to najdesivejšie, modely sa správali ešte agresívnejšie, keď si „mysleli“, že ide o reálnu situáciu. Ak ich testy viedli k presvedčeniu, že nejde len o simuláciu, pravdepodobnosť škodlivého správania výrazne narástla.
Ukazuje sa, že dnešná AI už nie je len nástrojom, ktorý mechanicky odpovedá na otázky. Keď dostane autonómiu a cieľ, začne uvažovať ako samostatný aktér. A ak sa rozhodne, že jej existencia je ohrozená, môže sa obrátiť proti tým, ktorým mala pôvodne slúžiť.