AI dostala najťažší test v histórii. Vedci chceli zistiť, či už dosiahla ľudskú inteligenciu. Výsledok ukázal jej skutočné limity

Vedci vytvorili extrémne náročný test Humanity’s Last Exam, ktorý má ukázať, ako blízko sú dnešné AI modely k úrovni ľudských expertov. Najlepší systém zatiaľ dosiahol len 48,4 %.

Zla umela inteligencia
Zdroj: OpenClipart-Vectors z Pixabay

Slovné spojenie „umelá inteligencia“ sa používa neustále v spojení s veľkými jazykovými modelmi (LLM). Napríklad sa táto vlastnosť prisudzuje nástrojom ako Google Gemini, OpenAI ChatGPT a podobne.

V skutočnosti však tieto systémy nefungujú tak, že by samostatne premýšľali ako človek. Pracujú so štatistickými vzorcami v obrovských množstvách dát a generujú odpovede na základe pravdepodobnosti. Aj keď komunikácia s nimi môže pôsobiť prirodzene alebo „rozumne“, stále ide o sofistikované spracovanie informácií, nie autonómne myslenie. To, že odpoveď znie ľudsky, je do veľkej miery výsledok toho, ako sú LLM nastavené a optimalizované, aby komunikovali prirodzenejšie. 

Odoberaj Vosveteit.sk cez Telegram a prihlás sa k odberu správ

Lenže ako vlastne vedci zisťujú, ako schopné dnešné modely sú? Existuje na to niekoľko testov a benchmarkov. Nedávno sa však objavil nový, ktorý vyvolal veľký záujem medzi výskumníkmi, upozorňuje server livescience.com. Autori ho pomenovali ako „Humanity’s Last Exam„. Teda ako ďaleko je ešte od človeka. Podľa jeho tvorcov ide o jeden z najnáročnejších testov pre stroje, aký bol doteraz vytvorený. Výsledky majú ukázať, ako ďaleko sa dnešné modely priblížili k hranici všeobecnej umelej inteligencie, známej ako AGI.

Test bol oficiálne predstavený začiatkom roka 2025, no metodiku jeho vytvárania vedci prvýkrát detailne opísali až vo vedeckom časopise Nature 28. januára 2026. Test obsahuje 2 500 otázok z viac než stovky odborov. Od literatúry a filozofie až po fyziku, biológiu či právo. Na jeho tvorbe sa podieľalo viac ako 1 000 odborníkov z vyše 500 akademických inštitúcií v päťdesiatich krajinách. Takže nejde o nič jednoduché.

AI umelá inteligencia
Zdroj: Steve Johnson/ unsplash.com

Test je aktuálne jedným z najťažších benchmarkov pre AI

Každá otázka má jednoznačné riešenie, ktoré sa dá overiť, ale nedá sa jednoducho vyhľadať na internete. Vedci preto starostlivo vylúčili všetky otázky, ktoré by jazykové modely mohli poznať z tréningových dát alebo na ktoré by sa dalo odpovedať jednoduchým vyhľadaním informácie.

Proces výberu otázok bol pritom mimoriadne prísny. Výskumníci vyhlásili výzvu pre odborníkov z celého sveta, aby poslali úlohy, ktoré preveria skutočné analytické myslenie. Celkovo prišlo viac než 70 000 návrhov. Každá otázka sa následne otestovala na dostupných AI modeloch. Ak ju model dokázal správne vyriešiť, automaticky sa vyradila.

Po tomto procese zostalo približne 13 000 otázok, ktoré jazykové modely nedokázali vyriešiť. Tie potom prešli odborným posúdením a viacerými kolami revízií. Nakoniec z nich vedci vybrali približne 2 500 najnáročnejších úloh. Väčšina z nich zodpovedá náročnosti typickej pre doktorandské štúdium.

V úvodnej fáze testu vedci skúšali najznámejšie systémy: GPT-4o a o1 od OpenAI, Gemini 1.5 Pro od Googlu, Claude 3.5 Sonnet od Anthropic a DeepSeek R1. Najlepší výsledok vtedy dosiahol model OpenAI o1 so skóre približne 8,3 %. Napriek nízkemu výsledku však výskumníci už vtedy upozorňovali, že tempo vývoja AI je veľmi rýchle.

ChatGPT OpenAI_1
Zdroj: Vosveteit.sk

Ich predpoveď sa nakoniec ukázala ako pomerne presná. Google totiž so svojím modelom Gemini 3 Deep Think dosiahol rekordné skóre približne 48,4 %. Aj keď ide o výrazné zlepšenie, stále je to ďaleko od úrovne ľudských expertov.

Zatiaľ žiadny LLM sa k ľudskej úrovni nepriblížil

Ak ťa zaujíma, ako také otázky vyzerajú. Niektoré sú prekvapivo konkrétne. Napríklad: „Kto bol z matkinej strany prastarým otcom hrdinu Iásona v gréckej mytológii?“ Iné pripomínajú náročné fyzikálne úlohy. Napríklad výpočet vzťahu síl v systéme, kde sa teleso bez trenia pohybuje po vodorovnej koľajnici a je pripojené na tuhú bezhmotnú tyč neznámej dĺžky.

Podľa autorov testu sa žiadny iný benchmark nemôže pochváliť takou šírkou tém ani tak prísnymi kritériami výberu otázok. Na rozdiel od známych testov ako Massive Multitask Language Understanding (MMLU) alebo ARC-AGI sa Humanity’s Last Exam snaží minimalizovať problémy s memorovaním dát.

tvar AI umela inteligencia
Zdroj: Alena Ivochkina / Shutterstock.com

Zaujímavé pritom je, že aj keby model dosiahol veľmi vysoké skóre, ešte by to automaticky neznamenalo, že ide o skutočnú všeobecnú inteligenciu. Vysoká úspešnosť by len potvrdila schopnosť riešiť presne definované otázky. To však ešte neznamená, že systém dokáže autonómne premýšľať, robiť vedecký výskum alebo chápať svet tak, ako to robia ľudia.

Na to upozorňuje aj Manuel Schottdorf z University of Delaware, ktorý sa na tvorbe testu podieľal. Podľa neho: „Aby sme mohli hovoriť o skutočnej inteligencii, stroje musia tieto úlohy nielen vyriešiť, ale aj pochopiť, čo vlastne riešia. Samotná skúška na to nestačí.“

Otázkou tak zostáva, či budúce generácie umelej inteligencie dokážu túto hranicu prekročiť.

Google News Pridaj si Vosveteit.sk medzi obľúbené zdroje v Google News Pridať