ULTIMA ORA
Tehnologie

Google lansează Gemini 3.5, un AI revoluționar pentru dictare

Cristian Marinescu

Conform Playtech.ro: Google revoluționează transcrierea audio cu Gemini 3.5 Transcribe

Compania GOOGLE a lansat o nouă tehnologie de inteligență artificială, Gemini 3.5 Transcribe, capabilă să înțeleagă și să corecteze modul natural de vorbire, inclusiv ezitările și corectările spontane. Noul sistem elimină expresiile precum „ăă” sau „mmm”, organizând automat textul și permițând modificări prin comenzi vocale naturale, conform informațiilor publicate de 9to5Google.

Inteligență artificială adaptată la limbajul uman

Una dintre inovațiile cheie ale Gemini 3.5 Transcribe este capacitatea sa de a gestiona situațiile în care vorbitorul se răzgândește în mijlocul unei fraze. De exemplu, dacă cineva spune „ne întâlnim marți, nu, miercuri”, sistemul va identifica corectarea și va reda textul final în forma cea mai potrivită, fără a include toate pauzele și ezitările din discurs.

Modelul este proiectat să îmbunătățească acuratețea și eficiența transcrierii audio. Google susține că Gemini 3.5 Transcribe prezintă o rată medie de eroare de 4% în condiții de transcriere în timp real și scade la 2,6% atunci când audio-ul este procesat fără constrângeri de streaming, conform măsurătorilor realizate de Artificial Analysis.

Recunoaștere extinsă a limbilor și a vorbitorilor

Gemini 3.5 Transcribe poate recunoaște și vocabular personalizat, o funcționalitate esențială pentru transcrierea corectă a numelor neobișnuite, a termenilor tehnici, a codurilor sau a identificatorilor alfanumerici. Compania afirmă că sistemul poate detecta și transcrie automat peste 85 de limbi, adaptându-se la accente regionale și dialecte diverse.

Pe lângă funcțiile de dictare, Gemini 3.5 Transcribe oferă și capabilități avansate pentru înregistrările audio preînregistrate. Sistemul poate atribui replicile unor vorbitori diferiți și poate include marcaje temporale. În prezent, funcția poate identifica până la trei persoane, iar suportul pentru un număr mai mare de vorbitori se află încă în stadiu experimental.

Google subliniază o reducere semnificativă a timpului necesar pentru obținerea transcrierii finale. Comparativ cu modelul anterior, Chirp 3 lansat în 2025, timpul de procesare este cu aproximativ 70% mai mic, conform datelor interne ale companiei. Pe benchmark-ul FLEURS, care evaluează performanța multilingvă, Gemini 3.5 Transcribe a înregistrat o rată de eroare de 5,50% în modul streaming și 5,04% în scenariile non-streaming.

Pe platforma de dezvoltatori, Gemini 3.5 Transcribe a demonstrat o performanță impresionantă în gestionarea contextelor audio complexe. Capacitatea de a ignora zgomotul de fond și de a izola vocile vorbitorilor contribuie la o mai bună claritate a textului transpus.

Aceste îmbunătățiri vin într-un moment în care cererea pentru instrumente de transcriere precise și eficiente este în continuă creștere, atât în mediul profesional, cât și în cel personal. Tehnologia avansată permite dezvoltatorilor să integreze funcționalități noi în aplicațiile și serviciile lor.

Sursa: Playtech.ro