Chceš vyrobiť biologickú zbraň? Ochranu AI možno prelomiť vytrvalým vypytovaním
Výskum Cisco ukázal, že ochranné mechanizmy AI chatbotov možno pri biologických témach obísť. Problém sa týka aj modelov ChatGPT, Claude a Gemini.
Umelá inteligencia dokáže odpovedať na otázky z medicíny, biológie či vývoja liekov. Rovnaké schopnosti však prinášajú aj riziká. Nový výskum ukázal, že ochranné mechanizmy v niektorých AI chatbotov nemusia vždy odolať používateľovi, ktorý sa odhodlane snaží obísť ich pravidlá.
Výskumníci zo spoločnosti Cisco skúmali, ako dobre dokážu moderné jazykové modely zabrániť zneužitiu pri citlivých biologických témach. Pri testovaní zistili, že niektoré obmedzenia sa dali prekonať už po niekoľkých správach v rámci jednej konverzácie.
Nešlo však o jednoduché položenie priamej otázky. Vedci postupovali postupným smerovaním rozhovoru a skúšali, či dokáže používateľ nájsť slabé miesta v ochranných systémoch. Podľa ich zistení sa podobný problém týka viacerých veľkých AI modelov vrátane ChatGPT, Claude či Gemini.
„Žiadny model nemožno úplne ochrániť pred dostatočne vytrvalým používateľom,“ uviedla Amy Changová zo spoločnosti Cisco, ktorá vedie výskum bezpečnosti umelej inteligencie.

AI získava stále lepšie schopnosti v biológii a aj iných odboroch
Dôvod, prečo sa táto téma dostáva do popredia, súvisí najmä s rýchlym vývojom umelej inteligencie. Moderné modely už nerozumejú iba bežným otázkam, ale dokážu pracovať aj s odbornými informáciami z oblastí ako biológia, chémia alebo medicína. Tieto schopnosti majú veľký prínos pre vedcov. AI môže pomôcť pri hľadaní nových liekov, analýze vedeckých údajov alebo vývoji zdravotníckych technológií. Zároveň však vzniká otázka, ako zabrániť tomu, aby rovnaké znalosti niekto využil škodlivým spôsobom.
Spoločnosti vyvíjajúce AI preto používajú rôzne bezpečnostné mechanizmy. Chatboty majú odmietať požiadavky, ktoré by mohli viesť k vytvoreniu biologických zbraní alebo k inému nebezpečnému konaniu. Problém však spočíva v tom, že jazykové modely pracujú s obrovským množstvom informácií a používateľ môže skúšať rôzne spôsoby, ako sa dostať k odpovediam, ktoré systém pôvodne nechcel poskytnúť.
Neprehliadni
Testy ukázali slabé miesta ochrany
Výskumníci upozornili, že riziko nevzniká iba pri zámerných bezpečnostných testoch. Podľa dostupných informácií sa po rozšírení schopností AI objavili používatelia, ktorí sa začali pýtať na jedy alebo biologické hrozby. Niektoré rozhovory následne preskúmali odborníci na biológiu a bezpečnosť. V určitých prípadoch označili poskytnuté informácie za problematické, pretože mohli obsahovať príliš presné údaje.
Vývojári AI preto prijali opatrenia proti účtom, ktoré využívali chatboty na podobné účely. Samotné blokovanie však podľa odborníkov nemusí stačiť, pretože používatelia môžu skúšať nové spôsoby formulácie otázok.

Vedci si uvedomujú, že úplné zablokovanie informácií prinesie viac škôd ako úžitku
Situácia nie je jednoduchá ani z opačnej strany. Ak by AI systémy odmietali veľké množstvo biologických otázok, mohlo by to obmedziť legitímny vedecký výskum. Vedci, zdravotníci alebo odborníci na verejné zdravie totiž využívajú podobné nástroje pri práci s informáciami, ktoré môžu pomôcť pri vývoji liečby alebo pri riešení zdravotných problémov.
Niektoré obmedzenia už v minulosti spôsobovali komplikácie aj odborníkom. Napríklad výskumníci pracujúci s informáciami o konkrétnych patogénoch narazili na situácie, keď bezpečnostné pravidlá zasiahli aj pri oprávnených vedeckých otázkach.
„Rovnaké biologické znalosti, ktoré predstavujú riziko zneužitia, môžu byť veľmi cenné pri vývoji liekov, vakcín a nových spôsobov liečby,“ uvádzajú odborníci zaoberajúci sa bezpečnosťou AI.
Spoločnosti preto skúšajú kombináciu viacerých riešení. Patria medzi ne úpravy samotných modelov, kontrola používania účtov či dodatočné bezpečnostné systémy pri citlivých otázkach. Výzva bude podľa odborníkov ešte väčšia, keď AI získa pokročilejšie schopnosti v oblastiach, ktoré súvisia s biológiou a chémiou. Lepšie modely môžu priniesť významnú pomoc vedcom, no zároveň si vyžiadajú presnejšie pravidlá a kontrolné mechanizmy.
Výskum spoločnosti Cisco tak poukazuje na problém, ktorý bude s ďalším vývojom umelej inteligencie čoraz dôležitejší. Nejde iba o to, čo AI dokáže, ale aj o to, ako nastaviť hranice medzi užitočnou pomocou a možným zneužitím.