Gemini po novom dokáže skopírovať tvoj hlas a zahrať ním celý scenár. Google výrazne vylepšil AI rozprávanie
Google predstavil nové hlasové modely Gemini 3.8 Flash TTS. Dokážu prirodzene čítať text, meniť emócie, tempo či prízvuk a z 30-sekundovej nahrávky napodobniť hlas človeka.
Umelá inteligencia už dávno dokáže prečítať text nahlas. Google však chce, aby výsledok neznel ako obyčajné robotické čítanie. Nové modely Gemini 3.8 Flash TTS a Flash-Lite TTS dostali oveľa presnejšiu kontrolu nad hlasom, výslovnosťou, tempom aj emóciami. Zaujímavá je najmä možnosť vytvoriť hlas podľa krátkej nahrávky.
Google uvádza, že Gemini 3.8 Flash TTS dokáže z 30-sekundovej vzorky vytvoriť konzistentnú hlasovú repliku. Nejde pritom iba o napodobnenie farby hlasu. Model dokáže pracovať aj s prízvukom, tempom reči, pauzami alebo spôsobom, akým človek prednesie jednotlivé vety. Podmienkou však zostáva povolenie od človeka, ktorého hlas chce používateľ replikovať.
Gemini už nemusí text iba prečítať
Pri klasickom prevode textu na reč zadáš vetu a systém ju následne vysloví. Pri nových modeloch od Googlu však môžeš oveľa presnejšie určiť, ako má výsledný hlas znieť. Google tvrdí, že Gemini 3.8 Flash TTS zvládne viac ako 100 jazykov a nárečí. Používateľ navyše dostane na výber viac ako 2 000 hlasov pripravených na produkčné použitie.

Ešte zaujímavejšia je možnosť vytvoriť úplne nový hlas pomocou obyčajného textového zadania. Nemusíš teda vyberať iba z pripravených možností. Stačí opísať, aký charakter má mať výsledný hlas. Model následne dokáže upraviť napríklad prízvuk alebo tempo reči. Pri samotnom scenári môže používateľ určiť aj ďalšie detaily.
Google túto novinku opisuje ako možnosť, pri ktorej model dokáže reagovať na pokyny týkajúce sa „tónu, tempa, nárečia, šepotu, smiechu, vzdychov a ďalších konverzačných prejavov“.
Neprehliadni
Práve tieto drobnosti môžu výrazne zmeniť výsledok. Rovnakú vetu totiž môžeš povedať pokojne, nahnevane, unavene alebo s nadšením. Pri starších hlasových systémoch bolo podobné ovládanie podstatne obmedzenejšie.
Z jedného textu môže vzniknúť rozhovor dvoch ľudí
Nové modely zvládnu aj scénu s dvoma hovoriacimi. Používateľ môže do jedného scenára vložiť dialóg a Gemini priradí jednotlivým postavám rozdielne hlasy. Výsledkom môže byť napríklad rozhovor moderátora s hosťom, dialóg postáv v audioknihe alebo viacero hlasov v reklamnom videu.
Google zároveň tvrdí, že model dokáže udržať hlasy konzistentné aj počas niekoľkých hodín zvuku. To môže byť dôležité pri dlhších projektoch, napríklad audioknihách alebo podcastoch, kde by zmena hlasu po niekoľkých minútach pôsobila rušivo. Technológia tak mieri oveľa ďalej než na jednoduché prečítanie článku. V praxi môže poslúžiť pri dabingu, tvorbe podcastov, audiokníh, hlasových asistentov alebo komentárov k videám.
Gemini dokáže napodobniť aj konkrétny hlas
Najväčšiu pozornosť však pravdepodobne pritiahne klonovanie hlasu. Ak máš povolenie použiť konkrétny hlas, Gemini podľa Googlu dokáže jeho charakter vytvoriť na základe približne 30-sekundovej nahrávky. Následne môže nový hlas použiť pri ďalších textoch. To môže byť praktické napríklad pri tvorbe obsahu, keď chceš zachovať rovnakého rozprávača bez toho, aby musel človek nahrať každú jednu vetu. Zároveň však ide o technológiu, ktorá prináša aj otázky okolo zneužitia hlasu. Hlas totiž môže slúžiť ako súčasť identity človeka a jeho presná napodobenina môže znieť veľmi presvedčivo.
Google preto pri tejto funkcii zaviedol viacero ochranných opatrení. Replikácia hlasu vyžaduje overenie súhlasu a Google pridáva aj technológie SynthID a údaje C2PA, ktoré majú pomôcť identifikovať obsah vytvorený umelou inteligenciou. Funkcia navyše nie je dostupná vo všetkých regiónoch. Google AI Studio napríklad blokuje replikáciu hlasu vo viacerých oblastiach vrátane Spojeného kráľovstva, Európskeho hospodárskeho priestoru, Indie, Texasu a Illinois.
Google si trúfa aj na porovnanie s konkurenciou
Pri predstavení nových modelov zverejnila spoločnosť aj výsledky testov od spoločnosti Hume AI, ktorá sa venuje hodnoteniu hlasových modelov. Gemini 3.8 Flash TTS podľa týchto výsledkov obsadil prvé miesto v celkovom hodnotení Voice Design Benchmark. V kategórii prízvukov získal skóre 60,8. Modely Flash a Flash-Lite zároveň obsadili prvé dve priečky v celkovom indexe kvality Hume AI.
V ďalších testoch Voice Arena sa nové modely umiestnili na vrchole alebo v jeho blízkosti pri viacerých jazykoch. Výsledky však neznamenajú, že Gemini porazil všetkých konkurentov vo všetkých kategóriách. ElevenLabs napríklad dosiahol vyššie hodnotenie v samostatných testoch kvality konkrétneho hlasu a prirodzenej variability prejavu. Ide teda skôr o ďalší krok v súboji medzi spoločnosťami, ktoré sa snažia vytvoriť čo najprirodzenejšie AI hlasy.
Novinka sa dostáva aj k bežným používateľom
Google nechce nové modely nechať iba vývojárom. Gemini 3.8 Flash TTS postupne prichádza do Gemini Notebook, zatiaľ čo Flash-Lite TTS smeruje do služby Google Vids. Vývojári môžu obe technológie využiť aj cez Gemini API a Google AI Studio. Pre používateľa to znamená, že AI hlas už nemusí byť iba mechanický prednes textu. Pri správnom zadaní môže model pracovať s tempom, emóciou, pauzami, prízvukom aj spôsobom prednesu.
Najzaujímavejšou časťou však zostáva klonovanie hlasu. Z tridsiatich sekúnd nahrávky môže vzniknúť hlas, ktorý následne prečíta úplne nový text. Google pritom pridáva technické opatrenia a obmedzenia, ktoré majú znížiť riziko zneužitia.
Ak sa podobná technológia dostane do ďalších bežne používaných nástrojov, rozdiel medzi „AI prečíta text“ a „AI zahrá úlohu“ bude čoraz menší.