Gemini 3.5 Transcribe ialah model suara ke teks baharu Google dan pengganti lebih pantas kepada Chirp 3. Model ini direka untuk menukar pertuturan yang tidak tersusun menjadi teks yang lebih berguna dengan membuang kata pengisi, memasukkan pembetulan penutur, menambah format, menyokong perbendaharaan kata tersuai da...
Diterbitkan olehDisunting dengan GPT-5.6 LunaImej dijana dengan GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Google announce about Gemini 3.5 Transcribe, including how it improves on the previous Chirp 3 speech-to-text engine in accuracy an. Article summary: Google introduced Gemini 3.5 Transcribe as its most precise speech-to-text model, positioning it as a faster, more intelligent successor to Chirp 3 that converts spoken input into polished, structured text rather than a . Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Google memperkenalkan Gemini 3.5 Transcribe sebagai model suara-ke-teks yang bukan sekadar menyalin audio secara literal. Model ini direka untuk menukar percakapan yang berselerak, terputus-putus atau penuh pembetulan kepada teks yang lebih kemas dan tersusun—sesuai untuk imlak, nota, mesej serta penyuntingan melalui arahan suara. Google menyifatkannya sebagai model suara-ke-teks paling tepat setakat ini dan peningkatan besar berbanding Chirp 3. 1
12
Namun, ada satu perkara penting yang perlu difahami: apabila sistem membuang kata seperti “erm” dan “hmm”, menggabungkan pembetulan atau membuat kesimpulan tentang maksud penutur, hasilnya mungkin lebih sedap dibaca tetapi kurang tepat sebagai rekod kata demi kata.
Gemini 3.5 Transcribe dibina berasaskan apa yang Google panggil sebagai transkripsi pintar. Berbanding mengekalkan setiap jeda, pengulangan atau ayat yang ditinggalkan separuh jalan, model ini boleh membersihkan gangguan pertuturan, memasukkan pembetulan penutur, menambah tanda baca dan menerapkan format tertentu. Ia juga boleh menerima arahan penyuntingan melalui suara serta menukar pertuturan yang tidak tersusun kepada prosa yang lebih mudah dibaca. 1
8
12
Secara praktikal, pengguna boleh bercakap dalam bentuk nota kasar atau cebisan ayat perbualan, lalu menerima teks yang lebih hampir kepada mesej, dokumen atau jawapan borang yang sudah siap.
Model ini turut direka untuk menangani bunyi latar, istilah teknikal dan kosa kata khusus. Google berkata pengguna boleh menambah perbendaharaan kata sendiri supaya nama, produk dan istilah bidang tertentu lebih berkemungkinan dieja seperti yang dikehendaki. Ia juga mengesan lebih daripada 85 bahasa secara automatik. 1
7
Bagi audio yang telah dirakam, Google menyenaraikan cap masa serta pengenalpastian penutur—atau speaker diarization—untuk sehingga tiga orang penutur. Ciri ini membolehkan pembangun memadankan bahagian transkripsi dengan peserta tertentu. 1
Google meletakkan Gemini 3.5 Transcribe sebagai peningkatan besar berbanding model transkripsi sebelumnya, Chirp 3. Berdasarkan laporan yang memetik ukuran Artificial Analysis, model ini mencatat kadar ralat perkataan sebanyak 2.6% untuk audio bukan penstriman dan 4.0% untuk audio penstriman, selain mengurangkan masa untuk menghasilkan transkripsi akhir sebanyak 70%. 3
4
9
Angka tersebut tidak sepatutnya dianggap sebagai jaminan prestasi untuk semua keadaan. Kadar ralat perkataan bergantung pada bahasa, loghat, kualiti rakaman, bunyi latar dan set penilaian yang digunakan. Bahan Google sendiri mengetengahkan keputusan penanda aras FLEURS, termasuk kadar ralat 5.50% dalam mod penstriman. Angka ini tidak boleh dibandingkan secara terus dengan setiap ukuran pihak ketiga kerana keadaan ujiannya berbeza. 1
Kesimpulan yang lebih berguna daripada satu angka penanda aras ialah Google menyasarkan dua perkara serentak: kependaman lebih rendah untuk interaksi langsung dan hasil akhir yang lebih bersih bagi audio rakaman atau imlak.
Google menyediakan kaedah penggunaan yang berbeza mengikut jenis aplikasi.
Pilihan langsung menyasarkan aplikasi yang memerlukan aliran audio berterusan serta tindak balas pantas. Gemini Live API menyokong interaksi suara masa nyata dengan kependaman rendah dan boleh menyediakan transkripsi untuk input pengguna serta output model. 12
20
Integrasi seperti ini boleh digunakan untuk pembantu suara, kapsyen langsung, antara muka perbualan dan aplikasi yang perlu memaparkan teks ketika seseorang masih bercakap. Dokumentasi API Google turut membezakan corak interaksi unary, penstriman dan masa nyata untuk aplikasi Gemini. 24
Untuk audio yang telah dirakam, pembangun boleh memuat naik atau merujuk fail audio sebelum menghantarnya melalui aliran interaksi Gemini. Kaedah ini lebih sesuai untuk memproses rakaman sedia ada, apabila cap masa, format, perbendaharaan kata tersuai dan pengenalpastian penutur lebih penting daripada tindak balas dalam masa kurang sesaat. 1
12
18
Dokumentasi Gemini API yang lebih umum mengesyorkan Interactions API sebagai antara muka standard untuk aplikasi Gemini baharu. Live API pula disasarkan kepada pengalaman suara dan penglihatan yang berterusan serta mempunyai kependaman rendah. 19
20
Gemini 3.5 Transcribe bukan sekadar teknologi dalam peringkat ujian pembangun. Menurut laporan, ia sudah menggerakkan Rambler, ciri imlak suara dalam Gboard Android, serta aplikasi Gemini untuk macOS. 2
13
26
Google turut berkata sokongan suara-ke-teks akan hadir ke Chrome. Apabila tersedia, pengguna dijangka boleh menggunakan imlak terus dalam medan teks di web—termasuk untuk menaip mesej, hantaran, borang dan arahan kepada Gemini—tanpa perlu membuka aplikasi khusus. 1
8
13
Model ini diperkenalkan bersama Gemini 3.5 Live dan Gemini 3.5 Live Experimental sebagai sebahagian daripada himpunan audio Google yang lebih luas, iaitu Gemini Audio. Dalam rangkaian itu, Transcribe memberi tumpuan kepada penukaran pertuturan kepada teks, manakala model Live menyasarkan pengalaman audio interaktif. 12
26
Ciri paling menarik Gemini 3.5 Transcribe ialah pada masa yang sama batasan utamanya. Membuang kata pengisi dan menggabungkan pembetulan menjadikan hasilnya lebih kemas, tetapi ia mengubah hubungan antara rakaman asal dengan transkripsi.
Hasil yang sudah dipoles mungkin menggugurkan jeda yang sebenarnya bermakna, mengekalkan hanya versi pembetulan sesuatu kenyataan atau melicinkan gaya percakapan seseorang. Untuk mendikte mesej atau menyediakan nota, perubahan ini biasanya membantu. Namun, ia kurang sesuai apabila setiap perkataan perlu dipelihara.
Bagi temu bual, rekod undang-undang atau perubatan, penyelidikan, dokumentasi kebolehcapaian dan petikan langsung, pengguna wajar menyimpan audio asal serta menyemak bahagian penting. Selagi tiada mod verbatim yang jelas ditawarkan, Gemini 3.5 Transcribe lebih tepat difahami sebagai sistem transkripsi yang turut menyunting—bukan perakam neutral yang hanya menukar audio kepada teks.
Pengumuman Google membawa pengecaman suara lebih dekat kepada penulisan berbantu suara. Gemini 3.5 Transcribe menggabungkan transkripsi dengan pembersihan teks, pemformatan, pengesanan bahasa, penyesuaian kosa kata dan maklumat penutur, sambil menawarkan aliran kerja berasingan untuk audio langsung dan audio rakaman. 1
12
Bagi pembangun, pendekatan ini berpotensi mengurangkan kerja pemprosesan selepas suara dikenal pasti. Bagi pengguna pula, pengalaman imlak mungkin terasa kurang seperti bercakap dengan mesin yang memerlukan sebutan sempurna, dan lebih seperti memberikan draf kasar kepada seorang penyunting.
Persoalan pentingnya bukan lagi sama ada model ini boleh menghasilkan teks yang lebih kemas. Persoalannya ialah: adakah aplikasi itu memerlukan teks yang kemas, atau rekod tepat tentang apa yang sebenarnya disebut?
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Gemini 3.5 Transcribe ialah model suara ke teks baharu Google dan pengganti lebih pantas kepada Chirp 3.
Gemini 3.5 Transcribe ialah model suara ke teks baharu Google dan pengganti lebih pantas kepada Chirp 3. Model ini direka untuk menukar pertuturan yang tidak tersusun menjadi teks yang lebih berguna dengan membuang kata pengisi, memasukkan pembetulan penutur, menambah format, menyokong perbendaharaan kata tersuai dan men...
Pembangun boleh memilih aliran kerja audio masa nyata atau rakaman sedia ada. Teknologi ini sudah digunakan dalam ciri Rambler pada Gboard Android dan aplikasi Gemini untuk macOS, manakala sokongan Chrome akan datang.
Gemini 3.5 Transcribe ialah model suara ke teks baharu Google dan pengganti lebih pantas kepada Chirp 3. Model ini direka untuk menukar pertuturan yang tidak tersusun menjadi teks yang lebih berguna dengan membuang kata pengisi, memasukkan pembetulan penutur, menambah format, menyokong perbendaharaan kata tersuai da...
Diterbitkan olehDisunting dengan GPT-5.6 LunaImej dijana dengan GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Google announce about Gemini 3.5 Transcribe, including how it improves on the previous Chirp 3 speech-to-text engine in accuracy an. Article summary: Google introduced Gemini 3.5 Transcribe as its most precise speech-to-text model, positioning it as a faster, more intelligent successor to Chirp 3 that converts spoken input into polished, structured text rather than a . Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Google memperkenalkan Gemini 3.5 Transcribe sebagai model suara-ke-teks yang bukan sekadar menyalin audio secara literal. Model ini direka untuk menukar percakapan yang berselerak, terputus-putus atau penuh pembetulan kepada teks yang lebih kemas dan tersusun—sesuai untuk imlak, nota, mesej serta penyuntingan melalui arahan suara. Google menyifatkannya sebagai model suara-ke-teks paling tepat setakat ini dan peningkatan besar berbanding Chirp 3. 1
12
Namun, ada satu perkara penting yang perlu difahami: apabila sistem membuang kata seperti “erm” dan “hmm”, menggabungkan pembetulan atau membuat kesimpulan tentang maksud penutur, hasilnya mungkin lebih sedap dibaca tetapi kurang tepat sebagai rekod kata demi kata.
Gemini 3.5 Transcribe dibina berasaskan apa yang Google panggil sebagai transkripsi pintar. Berbanding mengekalkan setiap jeda, pengulangan atau ayat yang ditinggalkan separuh jalan, model ini boleh membersihkan gangguan pertuturan, memasukkan pembetulan penutur, menambah tanda baca dan menerapkan format tertentu. Ia juga boleh menerima arahan penyuntingan melalui suara serta menukar pertuturan yang tidak tersusun kepada prosa yang lebih mudah dibaca. 1
8
12
Secara praktikal, pengguna boleh bercakap dalam bentuk nota kasar atau cebisan ayat perbualan, lalu menerima teks yang lebih hampir kepada mesej, dokumen atau jawapan borang yang sudah siap.
Model ini turut direka untuk menangani bunyi latar, istilah teknikal dan kosa kata khusus. Google berkata pengguna boleh menambah perbendaharaan kata sendiri supaya nama, produk dan istilah bidang tertentu lebih berkemungkinan dieja seperti yang dikehendaki. Ia juga mengesan lebih daripada 85 bahasa secara automatik. 1
7
Bagi audio yang telah dirakam, Google menyenaraikan cap masa serta pengenalpastian penutur—atau speaker diarization—untuk sehingga tiga orang penutur. Ciri ini membolehkan pembangun memadankan bahagian transkripsi dengan peserta tertentu. 1
Google meletakkan Gemini 3.5 Transcribe sebagai peningkatan besar berbanding model transkripsi sebelumnya, Chirp 3. Berdasarkan laporan yang memetik ukuran Artificial Analysis, model ini mencatat kadar ralat perkataan sebanyak 2.6% untuk audio bukan penstriman dan 4.0% untuk audio penstriman, selain mengurangkan masa untuk menghasilkan transkripsi akhir sebanyak 70%. 3
4
9
Angka tersebut tidak sepatutnya dianggap sebagai jaminan prestasi untuk semua keadaan. Kadar ralat perkataan bergantung pada bahasa, loghat, kualiti rakaman, bunyi latar dan set penilaian yang digunakan. Bahan Google sendiri mengetengahkan keputusan penanda aras FLEURS, termasuk kadar ralat 5.50% dalam mod penstriman. Angka ini tidak boleh dibandingkan secara terus dengan setiap ukuran pihak ketiga kerana keadaan ujiannya berbeza. 1
Kesimpulan yang lebih berguna daripada satu angka penanda aras ialah Google menyasarkan dua perkara serentak: kependaman lebih rendah untuk interaksi langsung dan hasil akhir yang lebih bersih bagi audio rakaman atau imlak.
Google menyediakan kaedah penggunaan yang berbeza mengikut jenis aplikasi.
Pilihan langsung menyasarkan aplikasi yang memerlukan aliran audio berterusan serta tindak balas pantas. Gemini Live API menyokong interaksi suara masa nyata dengan kependaman rendah dan boleh menyediakan transkripsi untuk input pengguna serta output model. 12
20
Integrasi seperti ini boleh digunakan untuk pembantu suara, kapsyen langsung, antara muka perbualan dan aplikasi yang perlu memaparkan teks ketika seseorang masih bercakap. Dokumentasi API Google turut membezakan corak interaksi unary, penstriman dan masa nyata untuk aplikasi Gemini. 24
Untuk audio yang telah dirakam, pembangun boleh memuat naik atau merujuk fail audio sebelum menghantarnya melalui aliran interaksi Gemini. Kaedah ini lebih sesuai untuk memproses rakaman sedia ada, apabila cap masa, format, perbendaharaan kata tersuai dan pengenalpastian penutur lebih penting daripada tindak balas dalam masa kurang sesaat. 1
12
18
Dokumentasi Gemini API yang lebih umum mengesyorkan Interactions API sebagai antara muka standard untuk aplikasi Gemini baharu. Live API pula disasarkan kepada pengalaman suara dan penglihatan yang berterusan serta mempunyai kependaman rendah. 19
20
Gemini 3.5 Transcribe bukan sekadar teknologi dalam peringkat ujian pembangun. Menurut laporan, ia sudah menggerakkan Rambler, ciri imlak suara dalam Gboard Android, serta aplikasi Gemini untuk macOS. 2
13
26
Google turut berkata sokongan suara-ke-teks akan hadir ke Chrome. Apabila tersedia, pengguna dijangka boleh menggunakan imlak terus dalam medan teks di web—termasuk untuk menaip mesej, hantaran, borang dan arahan kepada Gemini—tanpa perlu membuka aplikasi khusus. 1
8
13
Model ini diperkenalkan bersama Gemini 3.5 Live dan Gemini 3.5 Live Experimental sebagai sebahagian daripada himpunan audio Google yang lebih luas, iaitu Gemini Audio. Dalam rangkaian itu, Transcribe memberi tumpuan kepada penukaran pertuturan kepada teks, manakala model Live menyasarkan pengalaman audio interaktif. 12
26
Ciri paling menarik Gemini 3.5 Transcribe ialah pada masa yang sama batasan utamanya. Membuang kata pengisi dan menggabungkan pembetulan menjadikan hasilnya lebih kemas, tetapi ia mengubah hubungan antara rakaman asal dengan transkripsi.
Hasil yang sudah dipoles mungkin menggugurkan jeda yang sebenarnya bermakna, mengekalkan hanya versi pembetulan sesuatu kenyataan atau melicinkan gaya percakapan seseorang. Untuk mendikte mesej atau menyediakan nota, perubahan ini biasanya membantu. Namun, ia kurang sesuai apabila setiap perkataan perlu dipelihara.
Bagi temu bual, rekod undang-undang atau perubatan, penyelidikan, dokumentasi kebolehcapaian dan petikan langsung, pengguna wajar menyimpan audio asal serta menyemak bahagian penting. Selagi tiada mod verbatim yang jelas ditawarkan, Gemini 3.5 Transcribe lebih tepat difahami sebagai sistem transkripsi yang turut menyunting—bukan perakam neutral yang hanya menukar audio kepada teks.
Pengumuman Google membawa pengecaman suara lebih dekat kepada penulisan berbantu suara. Gemini 3.5 Transcribe menggabungkan transkripsi dengan pembersihan teks, pemformatan, pengesanan bahasa, penyesuaian kosa kata dan maklumat penutur, sambil menawarkan aliran kerja berasingan untuk audio langsung dan audio rakaman. 1
12
Bagi pembangun, pendekatan ini berpotensi mengurangkan kerja pemprosesan selepas suara dikenal pasti. Bagi pengguna pula, pengalaman imlak mungkin terasa kurang seperti bercakap dengan mesin yang memerlukan sebutan sempurna, dan lebih seperti memberikan draf kasar kepada seorang penyunting.
Persoalan pentingnya bukan lagi sama ada model ini boleh menghasilkan teks yang lebih kemas. Persoalannya ialah: adakah aplikasi itu memerlukan teks yang kemas, atau rekod tepat tentang apa yang sebenarnya disebut?
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Gemini 3.5 Transcribe ialah model suara ke teks baharu Google dan pengganti lebih pantas kepada Chirp 3.
Gemini 3.5 Transcribe ialah model suara ke teks baharu Google dan pengganti lebih pantas kepada Chirp 3. Model ini direka untuk menukar pertuturan yang tidak tersusun menjadi teks yang lebih berguna dengan membuang kata pengisi, memasukkan pembetulan penutur, menambah format, menyokong perbendaharaan kata tersuai dan men...
Pembangun boleh memilih aliran kerja audio masa nyata atau rakaman sedia ada. Teknologi ini sudah digunakan dalam ciri Rambler pada Gboard Android dan aplikasi Gemini untuk macOS, manakala sokongan Chrome akan datang.