ตัวโมเดลจะไม่รอให้ผู้พูดพูดจบ แต่มันจะสตรีมเสียงที่ป้อนเข้าไป และค่อยๆ สร้างเสียงแปลออกมาพร้อมกัน Google อธิบายว่ามันจะ "ตามหลังผู้พูดแต่ละคนเพียงไม่กี่วินาที" ซึ่งช่วยขจัดช่วงหยุดชะงักชวนอายที่อาจจะทำให้บทสนทนาที่เป็นธรรมชาติสะดุดลงได้
ผู้ใช้ไม่จำเป็นต้องเลือกภาษาต้นทางด้วยตัวเอง เพราะโมเดลสามารถตรวจจับได้โดยอัตโนมัติว่ากำลังพูดภาษาอะไรอยู่ แม้ในสภาพแวดล้อมที่มีหลายภาษาผสมผสานกันก็ยังทำงานได้ดี เหมาะกับบทสนทนาในชีวิตจริงที่พลิกแพลงได้ตลอดเวลา
หนึ่งในหัวใจสำคัญของประสบการณ์ผู้ใช้คือ เสียงแปลที่ออกมาจะไม่ใช่หุ่นยนต์แข็งๆ ทื่อๆ แต่โมเดลถูกออกแบบมาให้รักษา น้ำเสียง จังหวะการพูด และระดับเสียง ของผู้พูดต้นฉบับเอาไว้ ทำให้เสียงที่แปลออกมาฟังดูเหมือนเจ้าตัวพูดมากกว่าเสียงสังเคราะห์จากเครื่อง
ด้วยการรองรับมากกว่า 70 ภาษา ทำให้โมเดลครอบคลุมการแปลสองทิศทางหลายพันคู่ภาษา มันถูกออกแบบมาเพื่อการสนทนาแบบสองทาง ที่ผู้พูดแต่ละคนสามารถได้ยินคำพูดของอีกฝ่ายถูกแปลเป็นภาษาของตัวเองได้อย่างลื่นไหล
สำหรับนักพัฒนา โมเดลนี้ถูกเรียกใช้งานผ่าน Gemini Live API โดยต้องการสัญญาณเสียง Input ในรูปแบบเฉพาะ คือ Raw, Little-Endian, 16-bit PCM Audio ที่ Sample Rate 16kHz ส่วน Output เสียงที่แปลแล้วจะเป็น Raw 16-bit PCM เช่นกัน แต่ที่ Sample Rate สูงขึ้นเป็น 24kHz โมเดลมีหน้าต่างบริบทที่ให้ Input Token มากถึง 128,000 Token และ Output Token สูงสุด 64,000 Token
เส้นทางของ Google สู่การเปิดตัวสู่สาธารณะครั้งนี้มีขั้นตอน ดังนี้
gemini-3.1-flash-live-preview ในวันที่ 26 มีนาคม 2026 ซึ่งเป็นส่วนหนึ่งของการพัฒนาอย่างต่อเนื่อง gemini-3.5-live-translate-preview ได้ถูกเปิดตัวอย่างเป็นทางการแก่นักพัฒนาผ่าน Gemini Live API และ Google AI Studio และแก่ผู้บริโภคทั่วโลกผ่านการอัปเดตแอป Google Translate ทั้งบน Android และ iOS โมเดลนี้ถูกทำให้พร้อมใช้งานบนแพลตฟอร์มต่างๆ ของ Google ทั้งสำหรับผู้บริโภค นักพัฒนา และภาคธุรกิจ ซึ่งมีระดับการเข้าถึงที่แตกต่างกันไป
สำหรับคนทั่วไปใช้งานง่ายสุด เพียงเข้าแอป Google Translate ที่กำลังทยอยอัปเดตฟีเจอร์นี้อยู่ทั่วโลก ผู้ใช้เพียงแค่แตะปุ่ม "แปลสด" (Live Translate) ที่มุมล่างซ้ายของแอปขณะที่กำลังเสียบหูฟังอยู่ บน Android ยังมีการทยอยเปิด "โหมดการฟัง" (Listening Mode) แบบแฮนด์ฟรีที่จะเล่นคำแปลผ่านลำโพงสนทนาของโทรศัพท์ ให้คุณยกโทรศัพท์แนบหูได้เหมือนรับสายปกติเลย
สำหรับนักพัฒนา โมเดลอยู่ในสถานะ สาธารณะตัวอย่าง (Public Preview) ซึ่งช่วยให้สามารถรวมเข้ากับแอปพลิเคชันและบริการของบุคคลที่สามได้ผ่าน Gemini Live API โดยมี Config การแปลที่เฉพาะเจาะจง ส่วน Google AI Studio ก็มีสภาพแวดล้อมแบบ Sandbox ให้นักพัฒนาได้สร้างต้นแบบและทดสอบกัน
สำหรับภาคธุรกิจ Google Meet จะเปิดให้ใช้ Gemini 3.5 Live Translate แบบ เฉพาะกลุ่มส่วนตัว (Private Preview) สำหรับลูกค้าองค์กรที่ได้รับเลือกเริ่มตั้งแต่เดือนมิถุนายน 2026 นี้ เมื่อพร้อมใช้งาน มันจะตรวจจับภาษาของผู้พูดและแปลให้ผู้เข้าร่วมประชุมแต่ละคนตามภาษาที่ชอบโดยอัตโนมัติ รองรับกว่า 70 ภาษาและ 2,000+ คู่ภาษา การเปิดตัวในวงกว้างมีแผนไว้ในช่วงปลายปี 2026 โดยฟีเจอร์นี้จะพร้อมใช้งานสำหรับผู้ที่สมัครใช้ Google Workspace Business Standard and Plus, Enterprise Standard and Plus, Google AI Pro และ Google AI Ultra
แพลตฟอร์มการสื่อสารแบบ Real-Time อย่าง Agora, Fishjam, LiveKit, Pipecat และ Vision Agents กำลังทำงานเพื่อรวม Gemini Live API เพื่อนำโมเดลการแปลนี้เข้าไปอยู่ใน Media Pipeline ของตัวเอง
หนึ่งในการทดสอบภาคสนามที่น่าสนใจที่สุดคือกับ Grab แพลตฟอร์มเรียกรถและเดลิเวอรียักษ์ใหญ่ในเอเชียตะวันออกเฉียงใต้ Grab กำลังทดลองใช้เทคโนโลยีนี้เพื่อให้บริการแปลภาษาเสียงแบบเรียลไทม์ระหว่างคนขับกับผู้โดยสาร Grab มีระบบโทรด้วยเสียงกว่า 10 ล้านครั้งต่อเดือน และโครงการนี้นับเป็นการรับมือกับตลาดที่แตกกระจายทางภาษาอย่างแท้จริง
การเปลี่ยนจากระบบแปลทีละประโยคเป็นการแปลแบบสตรีมมิ่งคือการเปลี่ยนแปลงครั้งใหญ่ในด้านประสบการณ์ผู้ใช้ (UX) ด้วยการรวมโมเดลนี้เข้าไปในผลิตภัณฑ์ที่ทุกคนใช้อยู่แล้ว เช่น Google Translate และ Meet และเปิดให้ Ecosystem ของนักพัฒนาทำงานกับมันได้ Google กำลังผลักดันให้การแปลภาษาแบบเรียลไทม์เปลี่ยนจากฟีเจอร์เฉพาะทางไปเป็นโครงสร้างพื้นฐานมาตรฐานสำหรับการสื่อสารระดับโลก โครงการนำร่องกับ Grab แสดงให้เห็นภาพชัดเจนว่า การแปลภาษาที่ทันใจและฟังดูเป็นธรรมชาติกำลังถูกวางตำแหน่งให้เป็นเหมือนสาธารณูปโภค ไม่ใช่แค่ของเล่นใหม่
เสียงที่สร้างโดย AI ทั้งหมดจะถูกใส่ลายน้ำด้วยเทคโนโลยี SynthID ของ Google เพื่อให้สามารถตรวจสอบที่มาและลดความเสี่ยงในการนำไปใช้ในทางที่ผิด ซึ่งเป็นขั้นตอนที่สำคัญมากในขณะที่เทคโนโลยีเสียงสังเคราะห์เริ่มแนบเนียนและแพร่หลายมากขึ้น