Gemini 3.8 Live disasarkan untuk dialog suara berskala besar, pantas dan cekap kos, manakala Extended Thinking untuk tugasan berbilang langkah yang lebih rumit. Keupayaan utama Extended Thinking ialah meneruskan respons suara ketika ia merancang, membuat panggilan alat tak segerak dan menunggu hasil di latar belakang.
Diterbitkan olehDisunting dengan GPT-5.6 TerraImej dijana dengan GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Google announce about Gemini 3.8 Live and Gemini 3.8 Live Extended Thinking, including their real-time conversational, visual-under. Article summary: Google introduced two generally available, native audio-to-audio models for real-time voice agents: Gemini 3.8 Live for lower-cost, high-volume dialogue, and Gemini 3.8 Live Extended Thinking for more difficult, multi-st. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Google telah memperkenalkan Gemini 3.8 Live dan Gemini 3.8 Live Extended Thinking, dua model audio-ke-audio asli untuk ejen suara dan dialog langsung masa nyata. Model standard ditumpukan kepada skala, kecekapan kos, dialog yang lancar serta pemahaman berasaskan konteks visual. Varian Extended Thinking pula ditujukan kepada tugasan sukar dan berbilang langkah yang memerlukan penaakulan di latar belakang. 10
2
Ciri yang paling membezakan kedua-duanya terletak pada Gemini 3.8 Live Extended Thinking. Menurut Google, model ini boleh membuat penaakulan di latar belakang, merancang tindakan dan memanggil alat secara tak segerak sambil terus menstrim respons audio. Jika sesuatu alat mengambil masa lebih lama untuk melengkapkan tugas, model boleh menggunakan ungkapan perbualan yang wajar untuk memastikan interaksi tidak terhenti sepenuhnya. 1
2
Ini menjadikan konsep “penaakulan serentak” lebih daripada sekadar respons pantas. Dalam reka bentuk Google, penjanaan suara, perancangan di latar belakang dan aktiviti alat tak segerak boleh berlaku secara selari. Secara teori, ejen suara boleh menerangkan langkah seterusnya kepada pengguna sambil menunggu data atau melaksanakan proses berbilang langkah.
Namun, pengalaman sebenar bergantung pada kebolehpercayaan alat, reka bentuk dialog ejen dan sama ada respons yang diberikan benar-benar membantu—bukan sekadar mengisi kesunyian. 1
2
Google meletakkan Gemini 3.8 Live sebagai pilihan untuk pengalaman perbualan berjumlah tinggi yang memerlukan kependaman rendah tanpa kelewatan akibat proses penaakulan. Ia menggabungkan dialog langsung dengan konteks visual, membolehkan ejen mengambil kira maklumat visual bersama perbualan suara. 10
45
Wakil Google turut menyatakan bahawa model ini menyokong 97 bahasa dan boleh bertukar bahasa dalam satu perbualan. Pembangun tetap perlu menguji mutu bahasa, ketersediaan mengikut wilayah, serta prestasi untuk loghat dan kes penggunaan tertentu sebelum melancarkannya kepada pengguna. 16
Liputan pelancaran melaporkan skor Speech-to-Speech Quality Index sebanyak 76.0 untuk Gemini 3.8 Live dan 82.6 untuk Gemini 3.8 Live Extended Thinking. Dalam perbandingan yang sama, OpenAI GPT-Live-1 dengan tahap usaha sederhana mencatat 81.5. 25
Angka itu meletakkan Extended Thinking di hadapan dalam perbandingan yang dilaporkan, tetapi ia bukan ukuran bebas yang mengesahkan model terbaik untuk semua keadaan. Pelaksanaan ejen suara dalam dunia sebenar juga perlu menangani gangguan ketika pengguna bercakap, pertuturan berloghat dan pelbagai bahasa, ketepatan alat, kependaman ketika trafik tinggi, keselamatan, pemantauan sistem dan jumlah kos bagi setiap tugasan yang berjaya diselesaikan. 25
Jadual harga rasmi Google meletakkan kedua-dua model baharu ini di bawah Live API. Bagi peringkat standard berbayar, input audio berharga AS$3.00 bagi setiap juta token, atau AS$0.005 seminit; output audio pula AS$12.00 bagi setiap juta token, atau AS$0.018 seminit. Input teks disenaraikan pada AS$0.75 bagi setiap juta token, manakala output teks—termasuk token penaakulan—pada AS$4.50 bagi setiap juta token. 37
Perincian ini penting kerana harga token yang disebut untuk Gemini 3.8 Flash tidak semestinya terpakai kepada model Live. Untuk merancang bajet, pasukan perlu menggunakan jadual Live API dan dokumentasi model semasa, kemudian menguji sesi penggunaan sebenar. Kos ejen suara bergantung pada gabungan audio masuk, audio keluar, konteks visual, teks dan alat yang digunakan. 37
Google DeepMind menyenaraikan kedua-dua model sebagai tersedia secara umum. Kedua-duanya boleh didapati melalui aplikasi Gemini, Google AI Studio, Gemini API dan Google Enterprise Agent Platform. Jadual ketersediaan itu turut menyenaraikan Google Search Live untuk Extended Thinking, manakala Google Workspace disenaraikan untuk Gemini 3.8 Live. 54
Bagi pembangun, pilihannya jelas: model dialog langsung standard atau model dengan penaakulan lebih tinggi, dalam keluarga audio-ke-audio yang sama. Bagi organisasi, model yang tersedia hanyalah satu aspek; mereka juga perlu menyemak permukaan produk, kawalan data, rantau geografi dan laluan integrasi yang sesuai untuk penggunaan yang dirancang. 54
Nilai utama yang diketengahkan Google ialah timbunan teknologi yang lebih bersepadu: interaksi lisan, konteks visual, penaakulan latar belakang dan alat tak segerak dalam satu keluarga model. Secara prinsip, pendekatan ini boleh mengurangkan kerja menyambungkan sistem pengecaman pertuturan, model teks, orkestrasi alat dan sintesis suara secara berasingan—sambil mengekalkan kesinambungan perbualan ketika tugasan sedang diproses. 1
10
GPT-Live-1 daripada OpenAI masih menjadi perbandingan yang relevan, khususnya bagi pasukan yang menilai tingkah laku perbualan dua hala serentak. Tetapi satu penanda aras sahaja tidak mencukupi untuk menentukan pilihan platform. Penilaian yang kukuh perlu menggunakan panggilan atau sesi yang benar-benar mewakili operasi, lalu mengukur cara sistem mengendalikan gangguan, ketepatan panggilan alat, prestasi pelbagai bahasa, kawalan keselamatan, pemulihan daripada kegagalan, kependaman dan kos bagi setiap hasil yang siap. 25
Bahan pelancaran yang tersedia tidak menetapkan dasar tepat tentang tera air audio SynthID untuk Gemini 3.8 Live atau Extended Thinking. Google menyatakan SynthID telah diperluas untuk menanda air dan mengenal pasti teks yang dijana oleh aplikasi serta pengalaman web Gemini. Namun, kenyataan itu tidak mengesahkan bahawa setiap aliran audio daripada model Live ini ditanda air, dan tidak menghuraikan syarat pengesanan atau pelaksanaannya. 59
Begitu juga dengan tuntutan ekosistem dan integrasi: pengumuman sokongan platform boleh berubah dengan cepat. Pasukan yang merancang pelaksanaan produksi wajar menyemak dokumentasi model terkini, harga, ketersediaan platform dan terma perkhidmatan yang berkenaan sebelum memuktamadkan seni bina sistem. 37
54
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Gemini 3.8 Live disasarkan untuk dialog suara berskala besar, pantas dan cekap kos, manakala Extended Thinking untuk tugasan berbilang langkah yang lebih rumit.
Gemini 3.8 Live disasarkan untuk dialog suara berskala besar, pantas dan cekap kos, manakala Extended Thinking untuk tugasan berbilang langkah yang lebih rumit. Keupayaan utama Extended Thinking ialah meneruskan respons suara ketika ia merancang, membuat panggilan alat tak segerak dan menunggu hasil di latar belakang.