Google predstavil Gemini 3.5 Transcribe, svoj zatiaľ najpresnejší model na prevod reči na text. Podľa blogu Google DeepMind rozpozná vyše 85 jazykov a z diktovania sám vyhodí výplňové zvuky.
Prevod hovoreného slova na text patrí k najstarším praktickým použitiam umelej inteligencie, no bežné modely sa lámu na troch veciach. Na hluku v pozadí, na odbornom žargóne a na chvíli, keď sa hovoriaci zasekne alebo si vetu uprostred opraví.
Chybovosť klesla pod tri percentá
Presnosť merala spoločnosť Artificial Analysis. Pri priebežnom prepise, teda keď text pribúda počas hovorenia, dosiahol model priemernú chybovosť slov 4,0 %. Pri už nahratom zvuku, kde má na spracovanie viac času, klesla chybovosť na 2,6 %.
V mnohojazyčnom teste FLEURS sú čísla vyššie: 5,50 % v priebežnom režime a 5,04 % pri nahratom zvuku. Priemer teda platí pre ideálnejšie podmienky, než aké prináša striedanie jazykov, prízvukov a nárečí.
Oproti predchádzajúcemu modelu Chirp 3 sa skrátil aj čas do konečného prepisu, a to o 70 %. Model spoľahlivo zapíše aj kombinácie písmen a číslic, teda poštové smerovacie čísla či čísla objednávok, na ktorých staršie systémy zvykli chybovať. Poradí si aj s vetou, ktorú si hovoriaci sám uprostred opraví, a výplňové zvuky vyhodí ešte pred tým, než sa text zobrazí.

Vyše 85 jazykov, ale len traja hovoriaci
Model automaticky rozpozná a prepíše vyše 85 jazykov vrátane regionálnych prízvukov a nárečí. V nahratom zvuku vie navyše priradiť reč k jednotlivým hovoriacim a doplniť časové značky, takže z nahrávky porady vznikne rovno rozpísaný zápis.
Spoľahlivo to však zvláda len pre troch hovoriacich. Pri väčšom počte ľudí je funkcia zatiaľ experimentálna, čo je pri poradách a rozhovoroch to najpodstatnejšie obmedzenie celej správy.
Kde model stretnú bežní ľudia
Na Androide poháňa funkciu Rambler v klávesnici Gboard. Hovorené myšlienky mení na upravený text a hlasom sa dajú opravovať preklepy aj meniť štýl písania. Diktovanie priamo do políčok na webe má pribudnúť v prehliadači Chrome.
V aplikácii Gemini pre macOS vie model zložitejšie úlohy, napríklad tvorbu obrázkov alebo rozbor súborov, odovzdať iným modelom v pozadí. Vývojári ho nájdu vo verejnej ukážke cez rozhranie Gemini API v Google AI Studio. K dispozícii sú dve cesty: priebežné obojsmerné vysielanie s odozvou pod jednu sekundu pre živé hlasové aplikácie a spracovanie už nahratých záznamov.

Mohlo by vás zaujímať:
- Revoice: Nové AI riešenie pre ľudí s poruchami reči po mozgovej príhode
- Google predstavil DiffusionGemma: AI model generuje text až 4× rýchlejšie
- ChatGPT 5.5: Rýchlejší model s lepším pochopením

Model je zatiaľ vo verejnej ukážke, takže dostupnosť aj namerané čísla sa ešte môžu hýbať. Rambler beží len vo vybraných krajinách a jazykoch a Google neuvádza, či je medzi nimi slovenčina. Práve to bude pre domáceho čitateľa rozhodujúce: priemer cez vyše 85 jazykov nehovorí nič o tom, ako si model poradí s jedným konkrétnym.