Gemini 3.5 Transcribe: prepis reči, ktorý si poradí s hlukom aj s opravami

Google predstavil Gemini 3.5 Transcribe, svoj zatiaľ najpresnejší model na prevod reči na text. Podľa blogu Google DeepMind rozpozná vyše 85 jazykov a z diktovania sám vyhodí výplňové zvuky.
Intelligent transcription with Gemini 3.5 Transcribe
Zdroj: Google DeepMind

Google predstavil Gemini 3.5 Transcribe, svoj zatiaľ najpresnejší model na prevod reči na text. Podľa blogu Google DeepMind rozpozná vyše 85 jazykov a z diktovania sám vyhodí výplňové zvuky.

Prevod hovoreného slova na text patrí k najstarším praktickým použitiam umelej inteligencie, no bežné modely sa lámu na troch veciach. Na hluku v pozadí, na odbornom žargóne a na chvíli, keď sa hovoriaci zasekne alebo si vetu uprostred opraví.

Chybovosť klesla pod tri percentá

Presnosť merala spoločnosť Artificial Analysis. Pri priebežnom prepise, teda keď text pribúda počas hovorenia, dosiahol model priemernú chybovosť slov 4,0 %. Pri už nahratom zvuku, kde má na spracovanie viac času, klesla chybovosť na 2,6 %.

V mnohojazyčnom teste FLEURS sú čísla vyššie: 5,50 % v priebežnom režime a 5,04 % pri nahratom zvuku. Priemer teda platí pre ideálnejšie podmienky, než aké prináša striedanie jazykov, prízvukov a nárečí.

Oproti predchádzajúcemu modelu Chirp 3 sa skrátil aj čas do konečného prepisu, a to o 70 %. Model spoľahlivo zapíše aj kombinácie písmen a číslic, teda poštové smerovacie čísla či čísla objednávok, na ktorých staršie systémy zvykli chybovať. Poradí si aj s vetou, ktorú si hovoriaci sám uprostred opraví, a výplňové zvuky vyhodí ešte pred tým, než sa text zobrazí.

Gemini
Zdroj: AI

Vyše 85 jazykov, ale len traja hovoriaci

Model automaticky rozpozná a prepíše vyše 85 jazykov vrátane regionálnych prízvukov a nárečí. V nahratom zvuku vie navyše priradiť reč k jednotlivým hovoriacim a doplniť časové značky, takže z nahrávky porady vznikne rovno rozpísaný zápis.

Spoľahlivo to však zvláda len pre troch hovoriacich. Pri väčšom počte ľudí je funkcia zatiaľ experimentálna, čo je pri poradách a rozhovoroch to najpodstatnejšie obmedzenie celej správy.

Kde model stretnú bežní ľudia

Na Androide poháňa funkciu Rambler v klávesnici Gboard. Hovorené myšlienky mení na upravený text a hlasom sa dajú opravovať preklepy aj meniť štýl písania. Diktovanie priamo do políčok na webe má pribudnúť v prehliadači Chrome.

V aplikácii Gemini pre macOS vie model zložitejšie úlohy, napríklad tvorbu obrázkov alebo rozbor súborov, odovzdať iným modelom v pozadí. Vývojári ho nájdu vo verejnej ukážke cez rozhranie Gemini API v Google AI Studio. K dispozícii sú dve cesty: priebežné obojsmerné vysielanie s odozvou pod jednu sekundu pre živé hlasové aplikácie a spracovanie už nahratých záznamov.

Mohlo by vás zaujímať:

Model je zatiaľ vo verejnej ukážke, takže dostupnosť aj namerané čísla sa ešte môžu hýbať. Rambler beží len vo vybraných krajinách a jazykoch a Google neuvádza, či je medzi nimi slovenčina. Práve to bude pre domáceho čitateľa rozhodujúce: priemer cez vyše 85 jazykov nehovorí nič o tom, ako si model poradí s jedným konkrétnym.

Total
0
Shares
Podobné články