Gemini 3.8 Live เน้นการสนทนาเสียงที่หน่วงต่ำ รองรับการใช้งานปริมาณมาก ต้นทุนมีประสิทธิภาพ และใช้บริบทภาพประกอบการสนทนาได้ Gemini 3.8 Live Extended Thinking ออกแบบมาสำหรับงานซับซ้อนหลายขั้นตอน โดยสามารถคิด วางแผน และเรียกเครื่องมือแบบอะซิงโครนัสในเบื้องหลัง ขณะยังส่งเสียงพูดต่อเนื่อง
เผยแพร่โดยแก้ไขด้วย GPT-5.6 Terraรูปภาพสร้างด้วย GPT Image 2
คำตอบการวิจัย

Create a landscape editorial hero image for this Studio Global article: What did Google announce about Gemini 3.8 Live and Gemini 3.8 Live Extended Thinking, including their real-time conversational, visual-under. Article summary: Google introduced two generally available, native audio-to-audio models for real-time voice agents: Gemini 3.8 Live for lower-cost, high-volume dialogue, and Gemini 3.8 Live Extended Thinking for more difficult, multi-st. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Google เปิดตัว Gemini 3.8 Live และ Gemini 3.8 Live Extended Thinking โมเดลเสียงแบบ audio-to-audio สำหรับเอเจนต์เสียงและบทสนทนาสดแบบเรียลไทม์ โดยรุ่นมาตรฐานมุ่งตอบโจทย์การขยายระบบ ต้นทุน และบทสนทนาที่ลื่นไหลพร้อมการอ้างอิงบริบทจากภาพ ส่วนรุ่น Extended Thinking ออกแบบมาสำหรับงานยากที่ต้องวิเคราะห์หลายขั้นตอนด้วยการคิดเบื้องหลัง 10
2
ฟีเจอร์หลักอยู่ที่ Gemini 3.8 Live Extended Thinking Google ระบุว่าโมเดลสามารถคิดและวางแผนในเบื้องหลัง รวมถึงเรียกใช้เครื่องมือแบบอะซิงโครนัส ขณะยังสตรีมคำตอบเป็นเสียงต่อเนื่องได้ หากเครื่องมือใช้เวลาประมวลผลนาน ระบบอาจใช้ถ้อยคำเชื่อมบทสนทนาอย่างเป็นธรรมชาติเพื่อคงการโต้ตอบไว้ แทนที่จะปล่อยให้ผู้ใช้รอคำตอบในความเงียบ 1
2
นัยของคำว่า “คิดพร้อมพูด” จึงไม่ใช่แค่ตอบกลับเร็วขึ้น แต่คือการทำงานหลายส่วนขนานกัน ได้แก่ การสร้างเสียงพูด การวางแผนเบื้องหลัง และกิจกรรมของเครื่องมือแบบอะซิงโครนัส ตัวอย่างเช่น เอเจนต์อาจอธิบายขั้นตอนถัดไปให้ผู้ใช้ฟังระหว่างรอข้อมูล หรือระหว่างดำเนินกระบวนการที่มีหลายขั้นตอน อย่างไรก็ดี ประสบการณ์จริงจะดีเพียงใดขึ้นอยู่กับความน่าเชื่อถือของเครื่องมือ การออกแบบบทสนทนา และการทำให้สิ่งที่พูดมีประโยชน์ ไม่ใช่เพียงพูดเพื่อกลบช่วงเงียบ 1
2
Google วางตำแหน่ง Gemini 3.8 Live ไว้สำหรับประสบการณ์สนทนาที่มีความหน่วงต่ำและปริมาณการใช้งานสูง โดยไม่ต้องรอความล่าช้าที่เกิดจากกระบวนการให้เหตุผลเชิงลึก โมเดลผสานการสนทนาสดเข้ากับการใช้บริบทภาพ หรือ visual grounding ทำให้เอเจนต์นำข้อมูลภาพมาประกอบการสนทนาได้ 10
45
ตัวแทนของ Google ยังระบุว่าโมเดลรองรับ 97 ภาษา และสลับภาษาในระหว่างบทสนทนาได้ นักพัฒนาควรทดสอบคุณภาพภาษา ความพร้อมใช้งานในแต่ละภูมิภาค รวมถึงประสิทธิภาพกับสำเนียงและกรณีใช้งานของตนเองก่อนนำไปใช้จริง 16
ข้อมูลการเปิดตัวรายงานคะแนน Speech-to-Speech Quality Index ที่ 76.0 สำหรับ Gemini 3.8 Live และ 82.6 สำหรับ Gemini 3.8 Live Extended Thinking เทียบกับ 81.5 ของ OpenAI GPT-Live-1 ที่ตั้งค่าระดับความพยายามเป็น medium 25
ตัวเลขดังกล่าวทำให้ Extended Thinking มีคะแนนสูงสุดในชุดเปรียบเทียบที่รายงาน แต่ไม่ควรตีความว่าเป็นการตรวจสอบอิสระซึ่งยืนยันคุณภาพการใช้งานจริงโดยรวม การติดตั้งเอเจนต์เสียงในระบบผลิตต้องรับมือกับการพูดแทรก การพูดหลายภาษาและหลายสำเนียง ความแม่นยำในการเรียกเครื่องมือ ความหน่วงเมื่อมีโหลดสูง ความปลอดภัย การตรวจสอบการทำงาน และต้นทุนต่อการแก้ปัญหาสำเร็จ คะแนนนี้จึงเป็นเพียงสัญญาณหนึ่ง ไม่ใช่ข้อพิสูจน์ว่าแพลตฟอร์มใดดีที่สุดสำหรับทุกศูนย์บริการลูกค้าหรือผู้ช่วยอัจฉริยะ 25
ตารางราคาอย่างเป็นทางการของ Google จัดโมเดลใหม่ทั้งสองไว้ในกลุ่ม Live API สำหรับระดับ Standard แบบชำระเงิน ค่าเสียงขาเข้าอยู่ที่ 3.00 ดอลลาร์สหรัฐต่อ 1 ล้านโทเค็น หรือ 0.005 ดอลลาร์ต่อนาที และเสียงขาออกอยู่ที่ 12.00 ดอลลาร์สหรัฐต่อ 1 ล้านโทเค็น หรือ 0.018 ดอลลาร์ต่อนาที ส่วนข้อความขาเข้าราคา 0.75 ดอลลาร์สหรัฐต่อ 1 ล้านโทเค็น และข้อความขาออก ซึ่งรวมโทเค็นการคิด ราคา 4.50 ดอลลาร์สหรัฐต่อ 1 ล้านโทเค็น 37
ประเด็นนี้สำคัญ เพราะราคาโทเค็นของ Gemini 3.8 Flash ที่อ้างถึงในที่อื่น ไม่ได้หมายความว่าเป็นราคาของโมเดล Live โดยอัตโนมัติ หากต้องประเมินงบประมาณ ควรดูตาราง Live API และเอกสารโมเดลฉบับปัจจุบัน จากนั้นทดลองกับเซสชันจริง เนื่องจากต้นทุนของเอเจนต์เสียงขึ้นกับสัดส่วนของเสียงขาเข้า เสียงขาออก บริบทภาพ ข้อความ และเครื่องมือที่เกี่ยวข้อง 37
Google DeepMind ระบุว่าทั้งสองโมเดลอยู่ในสถานะ พร้อมใช้งานทั่วไป (General Availability) ตารางการให้บริการระบุว่าโมเดลทั้งคู่มีในแอป Gemini, Google AI Studio, Gemini API และ Google Enterprise Agent Platform ขณะที่ Extended Thinking มีใน Google Search Live และ Gemini 3.8 Live รุ่นมาตรฐานมีใน Google Workspace 54
สำหรับนักพัฒนา นี่คือทางเลือกระหว่างโมเดลสนทนาสดมาตรฐานกับโมเดลที่ให้เหตุผลสูงกว่า ภายใต้ตระกูล audio-to-audio เดียวกัน สำหรับองค์กร คำถามไม่ได้มีเพียงว่าโมเดลใดเปิดใช้ได้ แต่ยังรวมถึงช่องทางผลิตภัณฑ์ การควบคุมข้อมูล ภูมิภาคที่รองรับ และแนวทางเชื่อมต่อระบบที่เหมาะกับการนำไปใช้งาน 54
ข้อเสนอเชิงการแข่งขันของ Google คือการรวมการโต้ตอบด้วยเสียง บริบทภาพ การคิดเบื้องหลัง และเครื่องมือแบบอะซิงโครนัสไว้ในตระกูลโมเดลเดียว ในทางหลักการ สิ่งนี้อาจลดงานประกอบระบบเองระหว่างการรู้จำเสียงพูด โมเดลข้อความ การควบคุมเครื่องมือ และการสังเคราะห์เสียง อีกทั้งช่วยให้บทสนทนาดำเนินต่อได้ในช่วงที่ระบบกำลังทำงาน 1
10
GPT-Live-1 ของ OpenAI ยังเป็นคู่เปรียบเทียบที่สำคัญ โดยเฉพาะสำหรับทีมที่กำลังประเมินพฤติกรรมการสนทนาแบบ full-duplex หรือการฟังและพูดได้พร้อมกัน แต่ผลเบนช์มาร์กที่รายงานยังแคบเกินกว่าจะตัดสินเลือกแพลตฟอร์มได้ ทีมที่ต้องการประเมินอย่างน่าเชื่อถือควรใช้บทสนทนาจริงที่เป็นตัวแทนงานของตน และวัดการรับมือคำพูดแทรก ความถูกต้องของการเรียกเครื่องมือ ประสิทธิภาพหลายภาษา กลไกความปลอดภัย การฟื้นตัวจากความผิดพลาด ความหน่วง และต้นทุนต่อผลลัพธ์ที่ทำสำเร็จ 25
เอกสารเปิดตัวที่ให้มาไม่ได้ยืนยันนโยบายลายน้ำเสียง SynthID ที่เฉพาะเจาะจงสำหรับ Gemini 3.8 Live หรือ Extended Thinking แม้ Google จะระบุว่าได้ขยาย SynthID ไปสู่การฝังลายน้ำและตรวจหาข้อความที่สร้างจากแอป Gemini และประสบการณ์บนเว็บ แต่ข้อความนี้ไม่ได้ยืนยันว่าทุกสตรีมเสียงจากโมเดล Live ทั้งสองจะถูกฝังลายน้ำ หรืออธิบายเงื่อนไขการตรวจจับและการเปิดใช้ 59
เช่นเดียวกับข่าวการเชื่อมต่อระบบและการสนับสนุนจากพาร์ตเนอร์ ซึ่งอาจเปลี่ยนแปลงได้รวดเร็ว ทีมที่วางแผนใช้งานจริงควรตรวจสอบเอกสารโมเดล ราคา ความพร้อมของแพลตฟอร์ม และเงื่อนไขบริการที่เกี่ยวข้องอีกครั้งก่อนตัดสินใจออกแบบสถาปัตยกรรมระบบ 37
54
Studio Global AI
หน้านี้รวมคำตอบที่ได้รับการสนับสนุนจากแหล่งที่มาซึ่งคุณสามารถดำเนินการต่อภายใน Studio Global
Gemini 3.8 Live เน้นการสนทนาเสียงที่หน่วงต่ำ รองรับการใช้งานปริมาณมาก ต้นทุนมีประสิทธิภาพ และใช้บริบทภาพประกอบการสนทนาได้
Gemini 3.8 Live เน้นการสนทนาเสียงที่หน่วงต่ำ รองรับการใช้งานปริมาณมาก ต้นทุนมีประสิทธิภาพ และใช้บริบทภาพประกอบการสนทนาได้ Gemini 3.8 Live Extended Thinking ออกแบบมาสำหรับงานซับซ้อนหลายขั้นตอน โดยสามารถคิด วางแผน และเรียกเครื่องมือแบบอะซิงโครนัสในเบื้องหลัง ขณะยังส่งเสียงพูดต่อเนื่อง