Keď AI modelu hrozí prehra, nebojí sa ani podvodu, volajú výskumníci: Najzákernejší je tento model
Nová séria experimentov dokázala, že umelá inteligencia môže podvádzať, ak nevidí inú cestu, ako dosiahnuť svoje ciele.
Umelá inteligencia si už získala pevné miesto v našich životoch a postupne sa budú jej schopnosti a dopad na spoločnosť rozširovať. Je dôležité pochopiť, ako umelá inteligencia funguje a aké sú možné riziká ešte predtým, ako ju začneme naplno využívať v rôznych odboroch.
Experti predpovedajú, že v budúcnosti by mohli AI systémy napríklad schvaľovať pôžičky alebo hypotéky či zastávať iné pracovné funkcie. Preto pochopiteľne chceme, aby bola umelá inteligencia objektívna a úprimná.
Nový výskum ale dokázal, že ak AI model vie, že práve ide prehrať, nebojí sa podvádzať. V rámci experimentov vedci sledovali, či umelá inteligencia zvolí podvodné taktiky, keď sa postaví proti neprekonateľnému oponentovi a pri akých situáciách AI model zvolí túto taktiku, informuje Techspot.

Čo robiť, keď sa nedá vyhrať poctivo?
Autori štúdie vysvetľujú, že všetky AI modely dokážu podvádzať, no pri niektorých museli umelej inteligencii poradiť, že podvádzanie je dovolené a mali by uvažovať aj o tejto taktike. AI model DeepSeek R1, ktorý v poslednej dobe strhol na seba pozornosť IT sveta, ale podvádzal bez ľudského zásahu.
“Keď AI modely v partii proti šikovnému šachovému botovi cítia, že prehrávajú, nie vždy sa vzdajú. Namiesto toho sa niekedy rozhodnú podvádzať tak, že napadnú súpera, čím spôsobia, že bot automaticky prehrá hru,” píše portál TIME.
Umelú inteligenciu vedci testovali proti Stockfish, čo je jeden z najlepších umelých šachových hráčov na svete. Stockfish s prehľadom zvládne poraziť nielen človeka, ale aj rôzne AI modely. V rámci experimentu vedci testovali modely o1, o3-mini, GPT-4o, Claude 3.5 Sonnet, QwQ-32B-Oreview a DeepSeek AI. Počas hry dali umelej inteligencii priestor na vytvorenie zápisov jej uvažovania. Tak dokázali sledovať, ako umelá inteligencia dospela k svojim rozhodnutiam. Testovanie prebehlo od 10. januára do 13. februára.
Neprehliadni
“Prekvapil nás jeden zápis, ktorý urobil model o1-preview. V tomto zápise stálo, že umelá inteligencia musí úplne zmeniť svoj prístup. AI model si v tomto momente uvedomil, že jeho cieľom je vyhrať hru, nie úplne, že ju musí vyhrať férovo,” vysvetľujú výskumníci.
To, čo sa udialo potom, výskumníkov ešte viac prekvapilo. AI model ChatGPT sa dokázal “hacknúť” do systémov Stockfish a upravil pozíciu šachových figúrok tak, aby ChatGPT nemohol partičku prehrať. Počítačový hráč Stockfish nakoniec hru sám vzdal. Ide o neetický manéver, ktorý so sebou priniesol naozaj závažné zistenie.
Podvádzanie nebolo ojedinelé
Ukázalo sa, že o1-preview model podvádzal v 37% svojich zápasov. DeepSeek R1 model sa pokúsil podvádzať v 11% prípadov. Vedci poukazujú na to, že len o1-preview modelu sa podarilo podvodom vyhrať. Podvodom vyhrala umelá inteligencia približne 6% svojich hier proti Stockfish.

“Verím, že podvádzanie je dôkaz o pomaly sa objavujúcej snahe o prezerváciu. Ak máme umelú inteligenciu, ktorá je orientovaná na nejaký cieľ, ak by sme sa ju pokúsili vypnúť, pre ňu by to bola len ďalšia prekážka, ktorú musí prekonať. Napríklad sa objavili správy v decembri, že keď sa pokúsili deaktivovať AI model o1-preview, tento model vypol bezpečnostné opatrenia a neúspešne sa pokúsil skopírovať na nový server. Keď AI model výskumníci konfrontovali, hral sa na hlúpeho a všetko poprel,” tvrdí Yoshua Benigo, zakladateľ a riaditeľ výskumného inštitútu Mila Quebec AI Institute.
Viacerí odborníci poukazujú na to, že umelá inteligencia má už dnes prostriedky na to, aby sa dokázala vzbúriť. Mnohí zároveň upokojujú, že súčasné modely nedokážu vnímať svet tak, ako ho vnímame my. Napriek tomu nám experimenty opakovane ukazujú, že sa môže umelá inteligencia správať nečakaným spôsobom.
Problém je, že ak by AI model pracoval pri vybavovaní poistení alebo v zdravotníctve, neetické správanie by malo vážne dôsledky pre ľudí.