Gemini 3.5 Transcribe diposisikan Google sebagai penerus Chirp 3 yang lebih cepat dan akurat; pengukuran yang dikutip Artificial Analysis mencatat waktu menuju transkrip final berkurang 70%, dengan tingkat kesalahan k... Model ini tidak sekadar menyalin ucapan: Gemini 3.5 Transcribe dapat menghapus kata pengisi sepe...
Jawaban penelitian

Create a landscape editorial hero image for this Studio Global article: What did Google announce about Gemini 3.5 Transcribe, including how it improves on the previous Chirp 3 speech-to-text engine in accuracy an. Article summary: Google introduced Gemini 3.5 Transcribe as its most precise speech-to-text model, positioning it as a faster, more intelligent successor to Chirp 3 that converts spoken input into polished, structured text rather than a . Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Google memperkenalkan Gemini 3.5 Transcribe sebagai model speech-to-text yang dirancang untuk melakukan lebih dari sekadar menyalin audio kata demi kata. Model ini dapat mengubah ucapan yang penuh jeda, koreksi, dan potongan kalimat menjadi teks yang lebih rapi dan terstruktur—cocok untuk dikte, catatan, pesan, serta penyuntingan berbasis suara. Google menyebutnya sebagai model speech-to-text paling presisi yang pernah dibuatnya dan menempatkannya sebagai lompatan besar dari Chirp 3. 1 12
Kemampuan tersebut memang praktis, tetapi ada hal penting yang perlu dipahami. Sistem yang menghapus “eee”, merapikan kalimat, dan menyimpulkan maksud pembicara bisa menghasilkan tulisan yang lebih enak dibaca—dengan konsekuensi, sebagian kata-kata asli pembicara mungkin tidak lagi dipertahankan.
Gemini 3.5 Transcribe dibangun dengan pendekatan yang disebut Google sebagai intelligent transcription. Alih-alih menganggap setiap jeda atau kalimat yang terputus harus tetap muncul dalam hasil akhir, model ini dapat membersihkan gangguan ucapan, memasukkan koreksi yang dibuat pembicara, menambahkan tanda baca, dan menerapkan format tertentu. Model ini juga dapat merespons instruksi penyuntingan melalui suara dan mengubah ucapan yang belum terstruktur menjadi prosa yang lebih mudah dibaca. 1 8 12
Dengan pendekatan itu, pengguna tidak harus berbicara seperti membaca naskah. Catatan kasar atau potongan kalimat percakapan dapat diubah menjadi teks yang lebih mendekati pesan, dokumen, atau jawaban formulir yang sudah siap digunakan.
Google juga merancang model ini agar mampu menghadapi suara latar, istilah teknis, dan kosakata khusus. Pengguna dapat memasukkan kosakata kustom agar nama, produk, atau istilah bidang tertentu lebih mungkin ditulis dengan ejaan yang benar. Gemini 3.5 Transcribe secara otomatis mendeteksi lebih dari 85 bahasa. 1 7
Untuk audio yang sudah direkam, Google mencantumkan dukungan penanda waktu dan speaker diarization—pemisahan bagian percakapan berdasarkan pembicara—hingga tiga orang. Fitur ini membantu pengembang mengaitkan setiap bagian transkrip dengan peserta yang mengucapkannya. 1
Google menggambarkan Gemini 3.5 Transcribe sebagai peningkatan besar dibandingkan model transkripsi sebelumnya, Chirp 3. Berdasarkan laporan yang mengutip pengukuran Artificial Analysis, model ini memiliki tingkat kesalahan kata sebesar 2,6% pada audio non-streaming dan 4,0% pada audio streaming. Waktu yang dibutuhkan untuk menghasilkan transkrip final juga disebut berkurang 70%. 3 4 9
Namun, angka tersebut bukan jaminan performa yang berlaku untuk semua situasi. Word-error rate atau tingkat kesalahan kata dapat berubah tergantung bahasa, aksen, kualitas rekaman, kebisingan latar, dan set data yang digunakan untuk pengujian. Materi Google sendiri menyoroti hasil pada tolok ukur FLEURS, termasuk tingkat kesalahan 5,50% dalam mode streaming. Angka ini tidak bisa dibandingkan langsung dengan setiap pengukuran pihak ketiga karena kondisi pengujiannya berbeda. 1
Kesimpulan praktisnya lebih jelas daripada satu angka tolok ukur: Google mengejar latensi yang lebih rendah untuk interaksi langsung sekaligus hasil akhir yang lebih bersih untuk suara yang direkam atau didiktekan.
Google menyediakan cara penggunaan yang berbeda, tergantung kebutuhan aplikasi.
Opsi live ditujukan untuk aplikasi yang menerima aliran audio secara terus-menerus dan membutuhkan respons cepat. Gemini Live API mendukung interaksi suara real-time dengan latensi rendah, serta dapat menyediakan transkrip dari masukan pengguna maupun keluaran model. 12 20
Integrasi seperti ini dapat digunakan untuk asisten suara, teks langsung, antarmuka percakapan, dan aplikasi yang perlu menampilkan teks ketika seseorang masih berbicara. Dokumentasi API Google juga membedakan pola interaksi unary, streaming, dan real-time untuk aplikasi Gemini. 24
Untuk rekaman, pengembang dapat mengunggah atau merujuk ke berkas audio lalu mengirimkannya melalui alur interaksi Gemini API. Jalur ini lebih sesuai untuk memproses rekaman yang sudah tersedia, ketika penanda waktu, format teks, kosakata kustom, dan identifikasi pembicara lebih penting daripada respons dalam hitungan sepersekian detik. 1 12 18
Dokumentasi Gemini API merekomendasikan Interactions API sebagai antarmuka standar untuk aplikasi Gemini baru. Sementara itu, Live API ditujukan untuk pengalaman suara dan visi berkelanjutan dengan latensi rendah. 19 20
Gemini 3.5 Transcribe bukan sekadar teknologi uji coba untuk pengembang. Laporan menyebut model ini sudah mendukung Rambler, fitur dikte suara pada Gboard Android, serta aplikasi Gemini di macOS. 2 13 26
Google juga mengatakan dukungan speech-to-text akan hadir di Chrome. Jika diluncurkan, pengguna dapat mendiktekan teks langsung ke berbagai kolom input di web—termasuk pesan, unggahan, formulir, dan prompt—tanpa harus membuka aplikasi khusus. 1 8 13
Model ini diperkenalkan bersama Gemini 3.5 Live dan Gemini 3.5 Live Experimental sebagai bagian dari kelompok audio Google yang lebih luas, Gemini Audio. Dalam susunan tersebut, Transcribe berfokus mengubah suara menjadi teks, sedangkan model Live diarahkan untuk pengalaman audio interaktif. 12 26
Fitur terkuat Gemini 3.5 Transcribe sekaligus menjadi keterbatasan utamanya. Menghapus kata pengisi dan menggabungkan koreksi diri memang membuat hasil lebih mudah dibaca, tetapi juga mengubah hubungan antara rekaman asli dan transkrip.
Hasil yang sudah dipoles dapat menghilangkan keraguan yang sebenarnya bermakna, hanya mempertahankan versi terakhir dari sebuah pernyataan, atau menghaluskan gaya bicara seseorang. Hal itu biasanya diinginkan saat pengguna mendiktekan pesan atau membuat catatan. Namun, situasinya berbeda ketika setiap kata harus dicatat secara tepat.
Untuk wawancara, dokumen hukum atau medis, riset, dokumentasi aksesibilitas, maupun kutipan, pengguna sebaiknya tetap menyimpan audio asli dan memeriksa bagian-bagian penting. Jika implementasi tertentu tidak menyediakan mode yang benar-benar verbatim, Gemini 3.5 Transcribe lebih tepat dipahami sebagai sistem transkripsi dengan penyuntingan cerdas—bukan perekam audio-ke-teks yang sepenuhnya netral.
Pengumuman Google membawa teknologi pengenalan suara semakin dekat ke konsep menulis dengan bantuan suara. Gemini 3.5 Transcribe menggabungkan transkripsi dengan pembersihan ucapan, pemformatan, deteksi bahasa, penyesuaian kosakata, dan informasi pembicara, sekaligus menyediakan alur terpisah untuk audio live dan rekaman. 1 12
Bagi pengembang, kemampuan ini berpotensi mengurangi pekerjaan pascapemrosesan setelah suara dikenali. Bagi pengguna, dikte bisa terasa tidak lagi seperti berbicara dengan mesin yang menuntut kalimat sempurna, melainkan seperti memberikan draf kasar kepada seorang editor.
Pertanyaan terpentingnya bukan lagi apakah model ini dapat menghasilkan teks yang lebih rapi. Pertanyaannya adalah: apakah aplikasi Anda membutuhkan teks yang rapi—atau catatan persis tentang apa yang benar-benar diucapkan?
Studio Global AI
Halaman ini berisi jawaban yang didukung sumber yang dapat Anda lanjutkan di dalam Studio Global.
Gemini 3.5 Transcribe diposisikan Google sebagai penerus Chirp 3 yang lebih cepat dan akurat; pengukuran yang dikutip Artificial Analysis mencatat waktu menuju transkrip final berkurang 70%, dengan tingkat kesalahan k...
Gemini 3.5 Transcribe diposisikan Google sebagai penerus Chirp 3 yang lebih cepat dan akurat; pengukuran yang dikutip Artificial Analysis mencatat waktu menuju transkrip final berkurang 70%, dengan tingkat kesalahan k... Model ini tidak sekadar menyalin ucapan: Gemini 3.5 Transcribe dapat menghapus kata pengisi seperti “eee” dan “hmm”, memahami koreksi pembicara, menambahkan tanda baca dan format, memakai kosakata khusus, serta mendet...
Pengembang dapat memilih alur transkripsi real time atau audio rekaman; teknologinya sudah digunakan pada fitur dikte Rambler di Gboard Android dan aplikasi Gemini untuk macOS, sementara dukungan Chrome akan segera ha...