Conform Playtech.ro: Google lansează Gemini 3.5 Transcribe, o revoluție în recunoașterea vocală
Gigantul tehnologic GOOGLE a prezentat recent Gemini 3.5 Transcribe, un nou model AI destinat să transforme modul în care interacționăm cu sunetul. Sistemul promite o acuratețe remarcabilă în transcrierea vorbirii, adaptându-se fluent la nuanțele limbajului uman, inclusiv corectări și eliminarea sunetelor nerelevante. Această inovație ar putea simplifica semnificativ sarcini precum luarea de notițe, transcrierea interviurilor sau crearea de subtitrări automate.
Unul dintre punctele forte ale Gemini 3.5 Transcribe este capacitatea sa de a înțelege și de a corecta în mod natural ezitările sau reformulările specifice conversației umane. Dacă un vorbitor spune, de exemplu, „ne întâlnim marți, nu, miercuri”, sistemul este capabil să identifice corectarea și să genereze textul final în forma corectă, fără a păstra toate pauzele sau revizuirile intermediare. Această funcționalitate extinde utilitatea instrumentului dincolo de o simplă dictare, oferind o redare mai curată și mai relevantă a discursului.
Funcționalități avansate pentru o transcriere precisă
Pe lângă gestionarea eficientă a corectărilor, modelul elimină automat expresii de umplutură precum „ăă” sau „mmm”, atunci când acestea nu contribuie la sensul general al mesajului. Gemini 3.5 Transcribe dispune și de capacitatea de a organiza automat textul transcris, permițând în plus modificări ulterioare prin comenzi vocale formulate în limbaj natural. Aceasta deschide noi perspective pentru colaborare și editare eficientă a conținutului audio.
Conform datelor furnizate de GOOGLE, bazate pe măsurători efectuate de ARTIFICIAL ANALYSIS, Gemini 3.5 Transcribe atinge o rată medie de eroare de 4% pentru transcrierea în timp real și o rată de 2,6% în scenariile în care audio-ul este procesat fără restricții de streaming. Aceste cifre plasează noul model în fruntea tehnologiilor de recunoaștere vocală disponibile pe piață.
Modelul demonstrează, de asemenea, o adaptabilitate sporită la vocabularul personalizat, fiind capabil să recunoască și să transcrie corect nume neobișnuite, termeni tehnici specifici, coduri sau identificatori alfanumerici. GOOGLE anunță suport pentru transcrierea automată a peste 85 de limbi, incluzând diverse accente regionale și dialecte, ceea ce îl face un instrument extrem de versatil pentru utilizatori din întreaga lume.
Identificarea vorbitorilor și reducerea timpului de procesare
Gemini 3.5 Transcribe nu se limitează la transcrierea unui singur vorbitor. Pentru înregistrările audio preexistente, sistemul poate atribui replicile unor vorbitori diferiți și poate adăuga marcaje temporale precise. În prezent, funcția permite identificarea a până la trei persoane distincte, iar suportul extins pentru mai mulți vorbitori se află încă în stadiu experimental.
Un alt beneficiu major adus de noul model este reducerea semnificativă a timpului necesar pentru obținerea transcrierii finale. Comparativ cu CHIRP 3, modelul anterior de transcriere lansat de companie în 2025, timpul de procesare s-a diminuat cu aproximativ 70%, conform măsurătorilor citate de GOOGLE. Pe benchmark-ul FLEURS, un test recunoscut pentru evaluarea performanței multilingve, Gemini 3.5 Transcribe a înregistrat o rată de eroare de 5,50% în modul streaming și 5,04% în scenariile non-streaming pentru setul de limbi și regiuni evaluate.
Aceste progrese tehnologice subliniază ambiția GOOGLE de a integra inteligența artificială în moduri cât mai utile și intuitive în viața de zi cu zi și în mediul profesional. Lansarea Gemini 3.5 Transcribe marchează un pas important către o interacțiune audio mai naturală și mai eficientă.
Sursa: Playtech.ro



