Google lansează Gemini 3.8 Flash TTS: îți poate clona vocea și oferă control asupra interpretării

Scris de | 24 septembrie, 2026
Google lansează Gemini 3.8 Flash TTS: îți poate clona vocea și oferă control asupra interpretării

Google a anunțat Gemini 3.8 Flash TTS și Gemini 3.8 Flash-Lite TTS, două modele care transformă textul în voce. Noutățile includ voci personalizate și control asupra felului în care sunt rostite replicile, însă replicarea vocilor prin AI Studio nu este disponibilă în România (momentan).

Ce diferențiază modelele Gemini 3.8 TTS

Flash TTS este orientat spre crearea vocilor și a dialogurilor cu două personaje. Utilizatorul poate descrie prin instrucțiuni obișnuite vocea dorită, inclusiv accentul, înălțimea sau textura acesteia, apoi poate ajusta interpretarea. Flash-Lite TTS se adresează producției audio în volume mari, precum dublajele și podcasturile. Google îl poziționează ca variantă care urmărește un echilibru între eficiență și expresivitate, pentru aplicații cu trafic ridicat sau biblioteci extinse de conținut.

Pentru creatori, controlul se extinde de la alegerea unei voci la ritm, intonație și pronuinție. Modelul Flash este conceput să păstreze aceste caracteristici de la o propoziție la alta, inclusiv în dialogurile dintre două personaje. Biblioteca anunțată depășește 2.000 de voci, cu suport pentru peste 100 de limbi și dialecte. Scenariile pot include și indicații pentru râsete, suspine sau reacții scurte, integrate în interpretare.

Replicarea vocilor are restricții în Europa

Flash TTS poate reproduce profilul unei voci pornind de la o mostră audio de 30 de secunde. Google cere și o înregistrare a consimțământului verbal, care trebuie să corespundă persoanei din mostra de referință. Funcția de replicare prin AI Studio este însă indisponibilă în Spațiul Economic European, inclusiv România, precum și în alte regiuni enumerate de companie. Limitarea nu trebuie confundată cu blocarea tuturor funcțiilor de generare audio.

Rezultatele audio sunt marcate cu SynthID. Tehnologia introduce un marcaj digital imperceptibil pentru ascultător, care poate fi detectat pentru identificarea conținutului generat cu AI.

Unde sunt disponibile

Distribuirea modelelor începe prin Gemini API și Google AI Studio. Flash TTS este integrat și în Gemini Notebook, iar Flash-Lite TTS în Google Vids; accesul prin API în Gemini Enterprise este anunțat pentru o etapă ulterioară. Documentația tehnică indică pentru ambele modele intrări text de până la 8.000 de tokenuri și ieșiri audio de până la 64.000 de tokenuri. Aceste limite descriu capacitatea de procesare și generare, nu durata exprimată în minute a unei înregistrări.

Etichete: , , ,

Sursa: Google

Despre: Cătălin Nițu

Lucrez în presa de tehnologie și gaming încă din 2008. Am trecut pe la unele dintre cele mai mari publicații de specialitate din România. Urmăresc întotdeauna noutățile din tehnologie și jocuri video și mă concentrez în special pe review-uri. Una dintre pasiunile mele a devenit producția video, fiind responsabil pentru filmarea și editarea unora dintre materialele pe care le găsiți pe connect.