Tvoje súkromie bolo možno porušené. Tento AI dataset asi obsahuje tvoju tvár, adresu či životopis

Výskumníci našli len v malej vzorke jedného z najväčších a najpoužívanejších datasetov na trénovanie AI obrovské množstvo citlivých informácií.

Výskumníci zistili, že AI sa učila na množstve súkromných dát
Zdroj: AI, Vosveteit.sk

Výskumníci z MIT varujú, že v jednom z najväčších open-source trénovacích setov pre umelú inteligenciu sa nachádzajú milióny obrázkov pasov, kreditných kariet, rodných listov a ďalších mimoriadne osobných dokumentov.  

Autori novej štúdie zároveň našli tisíce fotografií, na ktorých boli jasne identifikovateľné tváre, v datasete CommonPool od spoločnosťi DataComp. Ide o jeden z najpoužívanejších tréningových setov pre AI na generovanie obrázkov. Dátové spoločnosti získali materiál z rôznych kútov internetu. V rámci štúdie vedci prešli len 0,1% CommonPool databázy. Preto odhadujú, že množstvo citlivých dokumentov a identifikátorov  bude oveľa väčšie.  

Odoberaj Vosveteit.sk cez Telegram a prihlás sa k odberu správ

“Všetko, čo užívateľ dá na internet, bude skôr, či neskôr, použité na trénovanie AI,” hovorí William Agnew, odborník v oblasti AI etiky a jeden z autorov štúdie.  

Ako sme už spomenuli, výskumníci odhalili tisíce prípadov, kedy našli dokumenty, na základe ktorých dokázali odhaliť identitu človeka. Išlo o obrázky platobných kariet, vodičských preukazov, pasov, či rodných listov. Konkrétnejšie identifikovali napríklad viac ako 800 žiadostí o zamestnanie, vrátane životopisov alebo motivačných listov. Tieto dokumenty následne potvrdili cez platformu LinkedIn. 

umela inteligencia a robot zahlteny odpadom
Zdroj: DALL·E, Vosveteit.sk,

Fotky, občianske preukazy, platobné karty

Niekoľko odhalených životopisov obsahovalo citlivé informácie, napríklad postihnutie, dátumy narodenia, miesta narodenia, rasu, alebo bydlisko. Keď sa podarilo životopis spojiť s konkrétnym človekom, následne výskumníci dokázali dohľadať aj rôzne kontaktné informácie, ako presnú adresu, telefónne čísla, či iné.  

Spoločnosť publikovala svoj dataset CommonPool v roku 2023. V tom roku obsahoval 12,8-miliárd dátových vzoriek. Išlo o najväčší dataset verejne dostupných obrazových a textových párov. Tento dataset je určený na trénovanie umelej inteligencie, ktorá dokáže z textového promptu vytvoriť hocijaký obrázok. Spoločnosť DataComp sa vyjadrila, že CommonPool dataset je určený na akademický výskum, no licencia tohto datasetu nebráni ani komerčnému použitiu.  

“CommonPool dataset vznikol ako nástupca datasetu LAION-5B. Tento dataset použili na trénovanie modelov ako Stable Diffusion alebo Midjourney. Dataset ale ťahá z rovnakého dátového zdroju. Ide o sťahovanie informácií verejne dostupných na internete. Tento proces robila neziskovka Common Crawl medzi rokmi 2014 a 2022,” hovoria výskumníci.  

Komerčné AI modely často nepriznajú, z akých datasetov sa učili. CommonPool a LAION-5B ale zdieľajú dátové zdroje, čo znamená, že tieto datasety sú podobné a s najväčšou pravdepodobnosťou obsahujú aj rovnaké identifikátory. Zároveň autori výskumu hovoria, že CommonPool dataset sa za posledné dva roky stiahol viac ako 2-milióny krát. Znamená to, že s najväčšou pravdepodobnosťou je veľa moderných AI trénovaných na tomto datasete a učilo sa aj z osobných informácií užívateľov.  

“Môžeme predpokladať, že všetky datasety, ktoré vznikli obrovským sťahovaním webových dát, budú obsahovať zakaždým niečo, čo by tam byť nemalo. Môžeme hovoriť o osobných informáciách užívateľov, nenávistných komentároch ale aj o takých závažných veciach, ako detská pornografia,” hovorí etička Abeba Birhane, jedna z autorov štúdie. 

smartfon data sukromie_1
Zdroj: Vosveteit.sk, AI

Užívatelia pravdepodobne nedali súhlas

Spoločnosť DataComp, tvorca CommonPool datasetu, si bola dobre vedomá toho, že do ich datasetu sa môžu dostať aj osobné informácie užívateľov. Preto urobila aspoň nejaké kroky k tomu, aby zachovala súkromie užívateľov. Keďže ide o masívny dataset, na nastolenie súkromia použila algoritmus, ktorý napríklad rozmazal všetky tváre ľudí.  

Výskumníci ale našli viac ako 800 tvárí, ktoré algoritmus prehliadol. Opäť pripomíname, že preskúmali len 0,1% datasetu. Znamená to, že nerozmazaných tvárí bude oveľa viac. Vedci odhadujú, že celkovo mohol algoritmus prehliadnuť 102-milión tvárí. Na druhú stranu obhajujú, že filtrovanie sa robí extrémne ťažko dobre. Problém ale je, že väčšina ľudí, ktorých osobné informácie, vrátane tvárí, sa v datasete našli, pravdepodobne nedali súhlas na použitie ich dát.  

Google News Pridaj si Vosveteit.sk medzi obľúbené zdroje v Google News Pridať