Gemini 3.8 Live ditujukan untuk percakapan suara berskala besar dan hemat biaya, sedangkan Gemini 3.8 Live Extended Thinking dirancang untuk bernalar serta memanggil alat secara asinkron di latar belakang sambil tetap... Perubahan utamanya bukan sekadar respons suara yang cepat: Google menawarkan agen yang dapat mem...
Diterbitkan olehDiedit dengan GPT-5.6 TerraGambar dibuat dengan GPT Image 2
Jawaban penelitian

Create a landscape editorial hero image for this Studio Global article: What did Google announce about Gemini 3.8 Live and Gemini 3.8 Live Extended Thinking, including their real-time conversational, visual-under. Article summary: Google introduced two generally available, native audio-to-audio models for real-time voice agents: Gemini 3.8 Live for lower-cost, high-volume dialogue, and Gemini 3.8 Live Extended Thinking for more difficult, multi-st. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Google memperkenalkan Gemini 3.8 Live dan Gemini 3.8 Live Extended Thinking, dua model audio-to-audio native untuk agen suara real-time dan dialog langsung. Model standar ditujukan untuk skala, efisiensi biaya, dialog yang lancar, serta pemahaman konteks visual. Sementara itu, varian Extended Thinking menyasar tugas yang lebih sulit dan bertahap, yang diuntungkan oleh penalaran di latar belakang. 10
2
Fitur paling menonjol ada pada Gemini 3.8 Live Extended Thinking. Menurut Google, model ini dapat bernalar di latar belakang, menyusun rencana, dan memanggil alat asinkron sambil terus mengalirkan respons audio. Saat alat membutuhkan waktu lebih lama untuk selesai, model dapat memakai pengisi percakapan yang natural agar interaksi tetap aktif, alih-alih menahan seluruh percakapan sampai hasil tersedia. 1
2
Artinya, istilah “penalaran simultan” bukan hanya soal giliran bicara yang cepat. Dalam rancangan Google, pembuatan ucapan, perencanaan latar belakang, dan aktivitas alat asinkron dapat berlangsung paralel. Agen suara, misalnya, secara teori dapat tetap menjelaskan langkah berikutnya sambil menunggu data atau mengerjakan proses yang terdiri atas beberapa tahap. Namun, kualitas pengalaman akhirnya tetap bergantung pada keandalan alat, desain dialog agen, dan apakah ucapan yang dihasilkan benar-benar membantu, bukan sekadar mengisi jeda. 1
2
Google menempatkan Gemini 3.8 Live sebagai pilihan untuk pengalaman percakapan berlatensi lebih rendah dan ber-volume tinggi tanpa penundaan akibat proses penalaran. Model ini memadukan dialog langsung dengan visual grounding, sehingga agen dapat memakai konteks visual bersamaan dengan percakapan. 10
45
Perwakilan Google juga menyatakan bahwa model tersebut mendukung 97 bahasa dan dapat berpindah bahasa di tengah percakapan. Pengembang tetap perlu menguji kualitas bahasa, ketersediaan di wilayah masing-masing, serta kinerja untuk aksen dan skenario penggunaan yang spesifik. 16
Liputan peluncuran melaporkan skor Speech-to-Speech Quality Index sebesar 76,0 untuk Gemini 3.8 Live dan 82,6 untuk Gemini 3.8 Live Extended Thinking. Sebagai pembanding, OpenAI GPT-Live-1 dengan tingkat usaha menengah dilaporkan memperoleh 81,5. 25
Dalam perbandingan yang dilaporkan itu, Extended Thinking menjadi yang berskor tertinggi. Meski begitu, angka tersebut bukan ukuran kualitas produksi secara menyeluruh yang diaudit secara independen. Implementasi agen suara juga harus mampu menangani interupsi pengguna, ucapan multibahasa dan beraksen, akurasi alat, latensi saat beban tinggi, keamanan, pemantauan sistem, serta total biaya untuk setiap tugas yang benar-benar terselesaikan. Angka benchmark ini adalah satu indikator evaluasi, bukan bukti bahwa satu sistem pasti terbaik untuk setiap kebutuhan pusat kontak atau asisten. 25
Tabel harga resmi Google menempatkan kedua model baru ini di bawah Live API. Pada tingkat berbayar standar, biaya input audio tercantum US$3,00 per 1 juta token, atau US$0,005 per menit. Biaya output audio adalah US$12,00 per 1 juta token, atau US$0,018 per menit. Input teks dikenakan US$0,75 per 1 juta token, sedangkan output teks—termasuk token pemikiran—US$4,50 per 1 juta token. 37
Pembedaan ini penting. Harga token yang sering dikutip untuk Gemini 3.8 Flash tidak otomatis berlaku bagi model Live. Untuk menyusun anggaran, gunakan tabel Live API dan dokumentasi model terbaru, lalu uji sesi nyata. Biaya agen suara akan bergantung pada campuran audio input, audio output, konteks visual, teks, serta alat yang dipakai. 37
Google DeepMind mencantumkan kedua model sebagai tersedia secara umum (generally available). Tabel ketersediaannya meliputi aplikasi Gemini, Google AI Studio, Gemini API, dan Google Enterprise Agent Platform untuk keduanya. Google Search Live tercantum untuk Extended Thinking, sedangkan Google Workspace tercantum untuk Gemini 3.8 Live. 54
Bagi pengembang, pilihannya adalah model dialog langsung standar atau model dengan penalaran lebih tinggi, dalam keluarga audio-to-audio yang sama. Bagi perusahaan, pertimbangan tidak berhenti pada model mana yang tersedia: mereka juga perlu memeriksa produk yang digunakan, kontrol data, wilayah geografis, dan jalur integrasi yang berlaku bagi penerapan yang direncanakan. 54
Nilai jual kompetitif utamanya adalah tumpukan teknologi real-time yang lebih terintegrasi: interaksi lisan, pemahaman konteks visual, penalaran latar belakang, dan alat asinkron dalam satu keluarga model. Secara prinsip, pendekatan ini dapat mengurangi kebutuhan untuk merangkai sendiri komponen pengenalan suara, model teks, orkestrasi alat, dan sintesis suara—serta menjaga kesinambungan percakapan ketika pekerjaan sedang berlangsung. 1
10
GPT-Live-1 dari OpenAI tetap menjadi pembanding yang relevan, khususnya bagi tim yang mengevaluasi perilaku percakapan full-duplex. Namun, perbandingan benchmark yang dilaporkan terlalu sempit untuk menentukan pilihan platform. Evaluasi yang kredibel perlu menggunakan panggilan atau percakapan representatif, lalu mengukur penanganan interupsi, ketepatan pemanggilan alat, performa multibahasa, kontrol keamanan, pemulihan dari kegagalan, latensi, dan biaya per hasil yang selesai. 25
Materi peluncuran yang tersedia belum menetapkan kebijakan watermark audio SynthID secara spesifik untuk Gemini 3.8 Live atau Extended Thinking. Google menyatakan SynthID telah diperluas untuk memberi watermark dan mengidentifikasi teks yang dihasilkan oleh aplikasi serta pengalaman web Gemini. Namun, pernyataan itu tidak mengonfirmasi bahwa setiap aliran audio dari dua model Live ini diberi watermark, juga tidak menjelaskan ketentuan deteksi atau peluncurannya. 59
Kehati-hatian yang sama berlaku untuk klaim ekosistem. Pengumuman integrasi dan dukungan mitra dapat berubah cepat. Tim yang merencanakan penerapan produksi sebaiknya memverifikasi dokumentasi model, harga, ketersediaan platform, serta ketentuan layanan yang berlaku sebelum menetapkan arsitektur. 37
54
Studio Global AI
Halaman ini berisi jawaban yang didukung sumber yang dapat Anda lanjutkan di dalam Studio Global.
Gemini 3.8 Live ditujukan untuk percakapan suara berskala besar dan hemat biaya, sedangkan Gemini 3.8 Live Extended Thinking dirancang untuk bernalar serta memanggil alat secara asinkron di latar belakang sambil tetap...
Gemini 3.8 Live ditujukan untuk percakapan suara berskala besar dan hemat biaya, sedangkan Gemini 3.8 Live Extended Thinking dirancang untuk bernalar serta memanggil alat secara asinkron di latar belakang sambil tetap... Perubahan utamanya bukan sekadar respons suara yang cepat: Google menawarkan agen yang dapat mempertahankan percakapan langsung ketika sedang menyusun rencana, menunggu alat, dan memproses hasil.