Gemini 3.5 Transcribeは、GoogleがChirp 3の後継として発表した音声テキスト変換モデルです。Artificial Analysisの測定を引用した報道では、最終的な文字起こしまでの時間を70%短縮し、単語誤り率はストリーミングで4.0%、非ストリーミングで2.6%とされています。 「えー」「その……」といったフィラーの削除、言い直しの反映、句読点や書式の追加、カスタム語彙への対応を通じて、雑談やメモのような音声をそのまま使える文章に近づけます。85以上の言語を自動検出できます。
研究の答え

Create a landscape editorial hero image for this Studio Global article: What did Google announce about Gemini 3.5 Transcribe, including how it improves on the previous Chirp 3 speech-to-text engine in accuracy an. Article summary: Google introduced Gemini 3.5 Transcribe as its most precise speech-to-text model, positioning it as a faster, more intelligent successor to Chirp 3 that converts spoken input into polished, structured text rather than a . Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Googleが発表した「Gemini 3.5 Transcribe」は、音声を一語ずつ機械的に書き起こすだけでなく、話し言葉を読みやすく整った文章へ変換する音声テキスト変換モデルです。Googleは同モデルを、これまでの「Chirp 3」から大きく進化した、現時点で最も精度の高い音声認識モデルと位置づけています。1 12
最大の特徴は、録音内容を単純に再現するのではなく、話者の意図をある程度くみ取って文章を整える点です。「えーと」「その……」のようなフィラーを削除したり、途中で言い直した内容を反映したりできるため、メモやメッセージの下書き、音声による文書編集などに向いています。
ただし、読みやすさが増す一方で、話者の言葉を完全にそのまま残す「逐語録」とは異なります。インタビューや法務・医療記録など、発言の正確な再現が必要な場面では、この違いを理解して使う必要があります。
Googleが「インテリジェント・トランスクリプション」と呼ぶ仕組みでは、音声認識後の文章に対して、次のような処理を自動で行えます。1 8 12
たとえば、話し手が考えながら断片的に話した内容を、メールやフォームへの回答、文書の下書きとして使いやすい形に変換できます。キーボードで文章を一から入力するというより、ラフな下書きを口頭で作り、AIに編集させる使い方に近いモデルです。
背景ノイズや専門用語にも対応し、ユーザーが独自の語彙を登録できる点も特徴です。製品名、人名、専門分野の用語などをカスタム語彙に追加すれば、意図した表記で認識される可能性を高められます。Googleによると、モデルは85以上の言語を自動検出します。1 7
録音済み音声では、タイムスタンプに加えて最大3人までの話者識別にも対応します。会話のどの部分を誰が話したのかを、文字起こしと結び付けて扱える仕組みです。1
Googleは、Gemini 3.5 Transcribeが従来のChirp 3から大幅に進歩したと説明しています。Artificial Analysisの測定を引用した報道では、単語誤り率(WER)は非ストリーミング音声で2.6%、ストリーミング音声で4.0%。最終的な文字起こし結果が得られるまでの時間は70%短縮されたとされています。3 4 9
もっとも、これらの数値をあらゆる環境で保証される性能とみなすことはできません。WERは、言語、アクセント、録音品質、周囲の騒音、評価データセットなどによって変わります。Google自身の資料では、FLEURSベンチマークにおけるストリーミング時のWERを5.50%としていますが、第三者による測定とは試験条件が異なるため、単純な比較はできません。1
実用面でのポイントは、単一のベンチマーク数値よりも明確です。Googleは、会話中の応答を速くする低遅延と、録音・音声入力後に読みやすい最終テキストを得る精度の両方を狙っています。
Gemini 3.5 Transcribeは、用途に応じてリアルタイム音声と録音済み音声を分けて利用できます。
ライブ利用向けの方法では、連続する音声ストリームを処理し、すばやく応答できます。Gemini Live APIは低遅延の音声インタラクションに対応し、ユーザーの音声入力だけでなく、モデルの音声出力もテキスト化できます。12 20
音声アシスタント、ライブ字幕、会話型インターフェース、話している途中からテキストを表示するアプリなどが想定されます。GeminiのAPIリファレンスでは、単発処理、ストリーミング、リアルタイム処理という複数の接続パターンも説明されています。24
すでに録音した音声を処理する場合は、音声ファイルをアップロードまたは参照し、Gemini APIの処理フローに渡します。リアルタイムの応答速度よりも、タイムスタンプ、書式設定、カスタム語彙、話者の区別を重視する用途に適しています。1 12 18
Googleの開発者向け資料では、新しいGeminiアプリには標準インターフェースとしてInteractions APIを推奨しています。一方、Live APIは、連続した音声・映像を低遅延で扱う体験向けとされています。19 20
Gemini 3.5 Transcribeは、単なる開発者向けの試験モデルにとどまりません。報道によると、Android版Gboardの音声入力機能「Rambler」やmacOS版Geminiアプリですでに使われています。2 13 26
Googleはさらに、Chromeにも音声テキスト変換機能を提供する予定です。実現すれば、専用アプリだけでなく、メッセージ、投稿、フォーム、AIへのプロンプトなど、ウェブ上のテキスト入力欄に直接話して入力できるようになります。1 8 13
このモデルは、「Gemini Audio」と呼ばれる音声関連の展開の一部です。Gemini 3.5 LiveとGemini 3.5 Live Experimentalも同時にラインアップされており、Transcribeが音声をテキストに変換する役割を担うのに対し、Live系モデルは対話的な音声体験を主な対象としています。12 26
Gemini 3.5 Transcribeの最も便利な機能は、同時に最大の注意点でもあります。フィラーを削除し、言い直しを整理して、話者が言いたかった内容に近い文章へ整えることで、音声入力は格段に使いやすくなります。
一方で、出力には次のような変化が起こり得ます。
メッセージやメモの作成なら、こうした編集はむしろ歓迎されるでしょう。しかし、インタビュー、法的・医療的な記録、研究資料、アクセシビリティー用の記録、引用文など、発言の正確な表現が重要な場面では注意が必要です。
逐語モードが明確に用意されていない実装では、元の音声を保存し、重要な箇所を聞き直すべきです。Gemini 3.5 Transcribeは、単なる中立的な音声レコーダーではなく、音声を理解しながら文章として編集する文字起こしシステムだと考えるのが適切です。
Gemini 3.5 Transcribeによって、音声認識は「話した言葉をテキストにする」段階から、「話しながら文章の下書きを作る」段階へ近づきます。音声の文字起こしに加えて、文章の整理、書式設定、言語検出、専門語彙の登録、話者情報の付加までを組み合わせ、リアルタイムと録音済み音声の両方に対応します。1 12
開発者にとっては、音声認識後に必要だった整形処理を減らせる可能性があります。ユーザーにとっては、機械に向けて正確に話すというより、編集者にラフな原稿を渡す感覚で音声入力できるようになるかもしれません。
問われるのは、モデルがどれだけきれいな文章を作れるかだけではありません。その用途に必要なのが「読みやすい文章」なのか、それとも「実際に話された内容の正確な記録」なのか――そこを見極めることが、Gemini 3.5 Transcribeを使ううえで重要になります。
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
Gemini 3.5 Transcribeは、GoogleがChirp 3の後継として発表した音声テキスト変換モデルです。Artificial Analysisの測定を引用した報道では、最終的な文字起こしまでの時間を70%短縮し、単語誤り率はストリーミングで4.0%、非ストリーミングで2.6%とされています。
Gemini 3.5 Transcribeは、GoogleがChirp 3の後継として発表した音声テキスト変換モデルです。Artificial Analysisの測定を引用した報道では、最終的な文字起こしまでの時間を70%短縮し、単語誤り率はストリーミングで4.0%、非ストリーミングで2.6%とされています。 「えー」「その……」といったフィラーの削除、言い直しの反映、句読点や書式の追加、カスタム語彙への対応を通じて、雑談やメモのような音声をそのまま使える文章に近づけます。85以上の言語を自動検出できます。
開発者はリアルタイム音声と録音済み音声の2つのワークフローを利用できます。モデルはAndroid版GboardのRamblerやmacOS版Geminiですでに使われており、GoogleはChromeの入力欄への音声入力にも対応する予定です。