Google představil Gemini 3.5 Transcribe jako model pro převod řeči na text, který nechce pouze mechanicky zapisovat každé vyslovené slovo. Jeho cílem je proměnit přerušovanou, neformální nebo neuspořádanou řeč v uhlazený a strukturovaný text vhodný pro diktování, poznámky, zprávy i úpravy ovládané hlasem. Google jej označuje za svůj dosud nejpřesnější model pro převod řeči na text a staví ho jako výrazný posun oproti předchozímu Chirp 3.
1
12
To je praktické, ale zároveň důležité pochopit. Systém, který odstraní „eee“, zapracuje opravy a odhadne, co měl mluvčí na mysli, může vytvořit lepší text. Zároveň ale nemusí zachovat přesné znění nahrávky.
Co Gemini 3.5 Transcribe umí
Gemini 3.5 Transcribe je založený na tom, čemu Google říká inteligentní transkripce. Místo toho, aby každé zaváhání nebo nedokončenou větu ponechal v konečném výstupu, dokáže odstranit slovní vatu, začlenit opravu mluvčího, doplnit interpunkci a použít formátování. Reagovat může také na hlasové pokyny k úpravě textu a z neuspořádaného mluveného projevu vytvořit čitelnější prózu.
1
8
12
V praxi to znamená, že uživatel nemusí diktovat stejně pečlivě, jako kdyby text rovnou psal. Z několika útržkovitých poznámek může vzniknout podoba bližší hotové zprávě, dokumentu nebo odpovědi ve formuláři.
Model má zvládat také okolní hluk, odbornou terminologii a specializovanou slovní zásobu. Google uvádí, že uživatelé mohou dodat vlastní slovník, aby se názvy, produkty nebo oborové výrazy zapisovaly požadovaným způsobem. Systém automaticky rozpozná více než 85 jazyků.
1
7
U předem nahraného zvuku nabízí časové značky a rozlišení mluvčích až pro tři osoby. Vývojář tak může jednotlivé části přepisu přiřadit konkrétním účastníkům rozhovoru.
1
Gemini 3.5 Transcribe vs. Chirp 3: přesnost a rychlost
Google popisuje Gemini 3.5 Transcribe jako výrazné zlepšení oproti modelu Chirp 3. Podle měření Artificial Analysis, která citují dostupné zprávy, dosahuje novinka chybovosti slov 2,6 % u zvuku zpracovávaného mimo streamování a 4,0 % při streamování. Doba potřebná k vytvoření finálního přepisu se má zkrátit o 70 %.
3
4
9
Tato čísla však nelze chápat jako univerzální záruku výkonu. Chybovost závisí na jazyce, přízvuku, kvalitě nahrávky, okolním hluku i konkrétní testovací sadě. Google ve vlastních materiálech uvádí například výsledek 5,50 % WER v režimu streamování na benchmarku FLEURS. Ten není přímo srovnatelný se všemi měřeními třetích stran, protože podmínky testů se liší.
1
Praktický závěr je přesto zřejmý: Google cílí současně na kratší odezvu při živých interakcích a na čistší výsledný text u nahrávek či diktování.
Dvě cesty pro vývojáře: živý i nahraný zvuk
Způsob použití se liší podle toho, zda aplikace zpracovává průběžný zvuk, nebo hotový soubor.
Přepis v reálném čase
Živá varianta je určena pro aplikace, které potřebují nepřetržitý zvukový stream a rychlé reakce. Gemini Live API podporuje hlasové interakce s nízkou latencí a dokáže poskytovat přepis vstupu uživatele i výstupu modelu.
12
20
Takové zapojení se hodí například pro hlasové asistenty, živé titulky, konverzační rozhraní nebo aplikace, které potřebují text ještě během mluvení. Dokumentace API rozlišuje jednorázové, streamované a real-time způsoby komunikace s modely Gemini.
24
Přepis nahraného zvuku
U předem nahraného audia může vývojář nahrát nebo odkázat na zvukový soubor a poslat ho prostřednictvím API. Tento režim se hodí tam, kde jsou důležitější časové značky, formátování, vlastní slovník a přiřazení výroků jednotlivým mluvčím než odezva v řádu zlomků sekundy.
1
12
18
Obecná dokumentace Gemini API doporučuje pro nové aplikace Interactions API jako standardní rozhraní. Live API je naopak určeno pro nepřetržité hlasové a obrazové scénáře s nízkou latencí.
19
20
Kde už se technologie objevuje
Gemini 3.5 Transcribe není pouze laboratorní ukázkou. Podle dostupných informací už pohání funkci hlasového diktování Rambler v klávesnici Gboard pro Android a používá se také v aplikaci Gemini pro macOS.
2
13
26
Google zároveň oznámil, že podpora převodu řeči na text míří do Chromu. Uživatelé by tak měli moci diktovat přímo do webových textových polí — například při psaní zpráv, příspěvků, odpovědí ve formulářích nebo zadávání promptů — bez nutnosti otevírat zvláštní aplikaci.
1
8
13
Novinka přichází společně s modely Gemini 3.5 Live a Gemini 3.5 Live Experimental v rámci širší skupiny Gemini Audio. Zatímco Transcribe se soustředí na převod mluveného slova do textu, modely Live cílí na interaktivní zvukové zážitky.
12
26
Hlavní kompromis: uhlazený text, nebo věrný záznam?
Nejzajímavější vlastnost Gemini 3.5 Transcribe je současně jeho největším omezením. Odstranění výplňových slov a zapracování oprav zvyšuje čitelnost, ale mění vztah mezi nahrávkou a výsledným přepisem.
Uhlazený výstup může vynechat významné zaváhání, ponechat pouze opravenou verzi výroku nebo potlačit osobitý způsob vyjadřování konkrétního člověka. Při diktování zprávy či tvorbě poznámek je to často žádoucí. Méně vhodné je to tam, kde záleží na přesných slovech.
U rozhovorů, právních či zdravotnických záznamů, výzkumných přepisů, dokumentace přístupnosti nebo citací by proto měli uživatelé uchovat původní zvuk a důležité pasáže ověřit. Pokud konkrétní implementace nenabízí jasně označený doslovný režim, je lepší Gemini 3.5 Transcribe chápat jako inteligentní, částečně redakční systém pro převod řeči — nikoli jako neutrální diktafon převedený do textu.
Co oznámení Googlu znamená
Google posouvá rozpoznávání řeči blíž k hlasem podporovanému psaní. Gemini 3.5 Transcribe spojuje přepis s čištěním textu, formátováním, rozpoznáváním jazyků, vlastním slovníkem a informacemi o mluvčích. Zároveň nabízí oddělené pracovní postupy pro živý i nahraný zvuk.
1
12
Vývojářům to může ušetřit část následného zpracování po rozpoznání řeči. Pro uživatele může diktování působit méně jako pečlivé odříkávání příkazů stroji a více jako předání hrubého návrhu editorovi.
Rozhodující otázka proto nezní, zda model dokáže vytvořit čistší text. Zní, zda konkrétní aplikace potřebuje čistý text — nebo přesný záznam toho, co skutečně zaznělo.