Gemini 3.5 Transcribe on Googlen uusi puheesta tekstiksi malli ja Chirp 3:n nopeampi seuraaja. Malli poistaa täytesanoja, käsittelee puhujan itsekorjauksia, muotoilee tekstin, tukee mukautettua sanastoa ja tunnistaa automaattisesti yli 85 kieltä.
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Google announce about Gemini 3.5 Transcribe, including how it improves on the previous Chirp 3 speech-to-text engine in accuracy an. Article summary: Google introduced Gemini 3.5 Transcribe as its most precise speech-to-text model, positioning it as a faster, more intelligent successor to Chirp 3 that converts spoken input into polished, structured text rather than a . Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Google on esitellyt Gemini 3.5 Transcriben puheentunnistusmallina, joka ei tyydy toistamaan äänitettä sana sanalta. Sen tavoitteena on muuttaa puhekielinen, katkonainen tai korjauksia sisältävä puhe viimeistellyksi ja jäsennellyksi tekstiksi. Tämä tekee siitä kiinnostavan vaihtoehdon saneluun, muistiinpanoihin, viesteihin ja puheohjattuun tekstin muokkaamiseen – mutta samalla se tarkoittaa, ettei lopputulos ole aina sanatarkka litterointi. Google kutsuu sitä tähän asti tarkimmaksi puheesta tekstiksi -mallikseen ja asemoi sen merkittäväksi harppaukseksi Chirp 3:een verrattuna. 1 12
Ero on tärkeä ymmärtää. Järjestelmä voi poistaa esimerkiksi epäröinnit, yhdistää puhujan itsekorjauksen oikeaksi tarkoitetuksi versioksi ja lisätä tekstin sekaan välimerkit sekä muotoilun. Tuloksena on parempaa luettavaa, mutta samalla osa puhujan alkuperäisistä sanoista ja puhetyylistä voi jäädä pois.
Google puhuu mallin yhteydessä ”älykkäästä transkriptiosta”. Perinteinen puheentunnistus pyrkii kirjaamaan jokaisen äännähdyksen ja katkenneen lauseen. Gemini 3.5 Transcribe voi sen sijaan siistiä täytesanoja, käsitellä korjauksia, lisätä välimerkit ja jäsentää puheen helpommin luettavaksi tekstiksi. Mallia voi myös ohjata äänen avulla tekemään muokkauksia. 1 8 12
Käytännössä käyttäjä voi puhua luonnosmaisia ajatuksia tai keskeneräisiä lauseita ja saada vastineeksi tekstin, joka muistuttaa valmista viestiä, asiakirjaa tai lomakevastausta. Mallin luvataan toimivan myös taustamelussa sekä teknisen ja erikoistuneen sanaston kanssa. Käyttäjä voi lisäksi antaa sille mukautetun sanaston, jotta nimet, tuotteet ja alakohtaiset termit kirjoitetaan toivotulla tavalla. Gemini 3.5 Transcribe tunnistaa automaattisesti yli 85 kieltä. 1 7
Esinauhoitetun äänen käsittelyssä malli tarjoaa aikaleimoja ja puhujien erottelua enintään kolmelle puhujalle. Näin kehittäjät voivat yhdistää transkriptin osia yksittäisiin keskustelijoihin. 1
Google esittää Gemini 3.5 Transcriben selvänä parannuksena aiempaan Chirp 3 -malliin. Artificial Analysisin mittauksiin perustuvissa raporteissa uudelle mallille ilmoitetaan 2,6 prosentin sanavirheprosentti esinauhoitetulle eli ei-suoratoistetulle äänelle ja 4,0 prosenttia suoratoistoäänelle. Lisäksi aikaa lopullisen transkription valmistumiseen on ilmoitettu kuluvan 70 prosenttia vähemmän. 3 4 9
Lukuja ei kuitenkaan pidä tulkita yleispäteviksi lupauksiksi. Sanavirheprosenttiin vaikuttavat muun muassa kieli, aksentti, äänitteen laatu, taustamelu ja käytetty testiaineisto. Googlen omissa materiaaleissa FLEURS-testissä mainitaan 5,50 prosentin sanavirheprosentti suoratoistotilassa, mutta tulos ei ole suoraan vertailukelpoinen kaikkien ulkopuolisten mittausten kanssa, koska testausolosuhteet poikkeavat toisistaan. 1
Käytännön viesti on silti selvä: Google tavoittelee sekä pienempää viivettä reaaliaikaisissa tilanteissa että siistimpää lopputulosta tallennetussa tai sanellussa puheessa.
Google tarjoaa mallille eri käyttötapoja sen mukaan, käsitelläänkö jatkuvaa äänivirtaa vai valmista äänitiedostoa.
Live-vaihtoehto on tarkoitettu sovelluksille, jotka tarvitsevat jatkuvaa äänivirtaa ja nopeita vastauksia. Googlen Live API tukee pienellä viiveellä toimivia, reaaliaikaisia ääni-interaktioita ja voi tuottaa tekstimuotoisen transkription sekä käyttäjän syötteestä että mallin vastauksesta. 12 20
Tällainen toteutus sopii esimerkiksi ääniavustajiin, reaaliaikaisiin tekstityksiin ja keskustelukäyttöliittymiin – eli tilanteisiin, joissa tekstiä tarvitaan jo puhujan puhuessa. Gemini-sovellusten rajapintadokumentaatio erottaa toisistaan yksittäisen pyynnön, suoratoiston ja reaaliaikaisen vuorovaikutuksen käyttötavat. 24
Tallennettua ääntä varten kehittäjä voi ladata äänitiedoston tai viitata siihen ja lähettää sen Geminin API-käsittelyyn. Tämä vaihtoehto sopii paremmin olemassa olevien äänitteiden käsittelyyn, jossa aikaleimat, muotoilu, mukautettu sanasto ja puhujien tunnistaminen ovat tärkeämpiä kuin sekunnin murto-osissa syntyvä vastaus. 1 12 18
Googlen laajempi Gemini API -dokumentaatio suosittelee Interactions APIa uusien Gemini-sovellusten oletusrajapinnaksi. Live API puolestaan on tarkoitettu jatkuvaan, pienellä viiveellä toimivaan ääni- ja kuvavuorovaikutukseen. 19 20
Gemini 3.5 Transcribe ei ole pelkkä kehittäjäesiversio. Raporttien mukaan se toimii jo Gboardin Android-laitteiden Rambler-sanelutoiminnon taustalla sekä macOS:n Gemini-sovelluksessa. 2 13 26
Google kertoo myös tuovansa puheesta tekstiksi -toiminnon Chromeen. Suunnitelman mukaan käyttäjä voisi sanella suoraan mihin tahansa verkkosivun tekstikenttään, kuten viestiin, julkaisuun, lomakkeeseen tai kehotteeseen, ilman erillistä sanelusovellusta. 1 8 13
Mallin julkaisu liittyy laajempaan Gemini Audio -kokonaisuuteen, johon kuuluvat myös Gemini 3.5 Live ja Gemini 3.5 Live Experimental. Transcribe keskittyy puheen muuttamiseen tekstiksi, kun taas Live-mallit on suunnattu vuorovaikutteisiin äänikokemuksiin. 12 26
Gemini 3.5 Transcriben vahvin ominaisuus on samalla sen keskeinen rajoitus. Täytesanojen poistaminen ja itsekorjausten yhdistäminen tekevät tekstistä helpommin luettavaa, mutta muuttavat äänen ja transkription välistä suhdetta.
Viimeistelty lopputulos voi jättää pois merkityksellisiä epäröintejä, näyttää vain korjatun version lauseesta tai silottaa puhujan persoonallista ilmaisutapaa. Saneltavaa viestiä tai muistiinpanoja varten tämä on usein juuri toivottua. Sen sijaan haastatteluissa, oikeudellisissa tai lääketieteellisissä asiakirjoissa, tutkimuksessa, saavutettavuusdokumentaatiossa ja suorissa lainauksissa tarkka sanamuoto voi olla ratkaiseva.
Siksi alkuperäinen äänite kannattaa säilyttää ja tärkeät kohdat tarkistaa. Ellei käyttöönotettu toteutus tarjoa selvästi sanatarkkaa tilaa, Gemini 3.5 Transcribea on parempi ajatella älykkäänä, tekstiä muokkaavana transkriptiojärjestelmänä kuin neutraalina äänitallentimena.
Googlen uusi malli vie puheentunnistusta lähemmäs puheohjattua kirjoittamista. Gemini 3.5 Transcribe yhdistää puheen tunnistamisen siistimiseen, muotoiluun, kielentunnistukseen, mukautettavaan sanastoon ja puhujatietoon. Lisäksi kehittäjät voivat valita erillisen työnkulun reaaliaikaiselle tai tallennetulle äänelle. 1 12
Kehittäjille tämä voi vähentää puheentunnistuksen jälkikäsittelyyn tarvittavaa työtä. Käyttäjälle sanelu voi puolestaan tuntua vähemmän siltä, että koneelle täytyy puhua täydellisesti – ja enemmän siltä, että koneelle annetaan karkea luonnos toimitettavaksi.
Ratkaiseva kysymys ei siis ole vain se, pystyykö malli tuottamaan siistimpää tekstiä. On myös päätettävä, tarvitaanko käyttötapauksessa siistiä tekstiä vai tarkkaa tallennetta siitä, mitä todella sanottiin.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Gemini 3.5 Transcribe on Googlen uusi puheesta tekstiksi malli ja Chirp 3:n nopeampi seuraaja.
Gemini 3.5 Transcribe on Googlen uusi puheesta tekstiksi malli ja Chirp 3:n nopeampi seuraaja. Malli poistaa täytesanoja, käsittelee puhujan itsekorjauksia, muotoilee tekstin, tukee mukautettua sanastoa ja tunnistaa automaattisesti yli 85 kieltä.
Kehittäjille tarjolla on sekä reaaliaikainen että esinauhoitetun äänen käsittelyyn tarkoitettu käyttötapa.