OpenAI เปิดให้ใช้ GPT Live 1 ผ่าน API แบบทั่วไปเมื่อวันที่ 10 กันยายน 2026 โมเดลนี้สนทนาด้วยเสียงแบบ full duplex และให้ระบบแบ็กเอนด์รับงานคิดวิเคราะห์หรือเรียกเครื่องมือได้ ต่างจากระบบเสียงที่รอให้ผู้ใช้พูดจบเป็นรอบ ๆ GPT Live 1 ออกแบบมาให้รับมือกับช่วงเว้นจังหวะ การพูดแทรก คำตอบรับสั้น ๆ และการเปลี่ยนประเด็นระหว่าง...
เผยแพร่โดยแก้ไขด้วย GPT-5.6 Terraรูปภาพสร้างด้วย GPT Image 2
คำตอบการวิจัย

Create a landscape editorial hero image for this Studio Global article: What did OpenAI announce on September 11, 2026, about launching the GPT-Live-1 full-duplex voice model in its API, including how it differs. Article summary: OpenAI’s API announcement was dated September 10, 2026—not September 11. It introduced GPT‑Live‑1 as a generally available, full‑duplex voice layer: a model intended to make voice agents more natural by listening and spe. Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake
OpenAI ประกาศเปิดให้ใช้ GPT-Live-1 ผ่าน API แบบทั่วไปเมื่อวันที่ 10 กันยายน 2026 ไม่ใช่วันที่ 11 กันยายน โมเดลนี้เป็นชั้นสนทนาด้วยเสียงสำหรับนักพัฒนาที่ต้องการสร้างเอเจนต์ซึ่งฟังและพูดได้พร้อมกัน แทนการทำงานแบบผลัดกันพูดเป็นรอบที่ตายตัว 1
16
ระบบเอเจนต์เสียงจำนวนมากทำงานเป็นทอด ๆ คือ แปลงเสียงเป็นข้อความ (speech-to-text) ส่งข้อความให้โมเดลภาษา แล้วแปลงคำตอบกลับเป็นเสียง (text-to-speech) แต่ GPT-Live-1 ถูกวางตำแหน่งให้เป็นชั้นเสียงแบบรวมศูนย์สำหรับการสนทนาแบบเรียลไทม์ 1
ความต่างหลักอยู่ที่การจัดจังหวะผลัดกันพูด OpenAI ระบุว่า GPT-Live-1 ฟังและพูดได้ในเวลาเดียวกัน ติดตามช่วงหยุดพูดและการเปลี่ยนความเร็วของบทสนทนาได้ รวมถึงตัดสินใจได้ว่าควรตอบหรือควรรอฟังต่อ การออกแบบนี้มีเป้าหมายให้การพูดแทรกและคำตอบรับสั้น ๆ ระหว่างฟัง เช่น “ครับ” หรือ “อือ” ซึ่งเรียกว่า backchannel ดูเป็นธรรมชาติมากขึ้น ไม่ใช่ความผิดพลาดของระบบ 1
9
15
อย่างไรก็ดี โมเดลเสียงไม่จำเป็นต้องทำทุกงานด้วยตัวเอง บทสนทนาผ่าน GPT-Live-1 สามารถดำเนินต่อไปในขณะที่โมเดลหรือเอเจนต์ฝั่งแบ็กเอนด์ทำงานคิดวิเคราะห์เชิงลึกหรือเรียกใช้เครื่องมือ OpenAI รองรับทั้ง Responses delegation สำหรับใช้โมเดลของ OpenAI และ client delegation เพื่อเชื่อมต่อแบ็กเอนด์ที่นักพัฒนาสร้างเอง 1
16
GPT-Live-1 ทำหน้าที่เป็นส่วนหน้าของประสบการณ์สนทนาด้วยเสียง ส่วนแบ็กเอนด์อาจรับผิดชอบงานที่ใช้เหตุผลมากขึ้น การค้นคืนข้อมูล การรันเวิร์กโฟลว์ หรือการเรียกเครื่องมือ บันทึกผลิตภัณฑ์ของ OpenAI ระบุว่า GPT-6 Astra เป็นตัวเลือกหนึ่งสำหรับงานค้นหาและการใช้เหตุผลที่ซับซ้อน ขณะที่ผู้พัฒนา API ก็เชื่อมต่อแบ็กเอนด์ของตนเองผ่าน client delegation ได้ 4
16
สำหรับทีมพัฒนา โครงสร้างนี้หมายความว่า
OpenAI ยังระบุถึงการทำตามคำสั่งที่ดีขึ้น เสียงแบบกำหนดเองได้ และการรองรับระบบโทรศัพท์สำหรับรุ่น API นี้ 13
เซสชันเสียง GPT-Live-1 คิดราคา 0.05 ดอลลาร์สหรัฐต่อนาที โดยคำนวณตามจำนวนวินาทีจริง และไม่ปัดขึ้นเป็นนาทีเต็ม 16
18
ตัวเลขนี้เป็นค่าชั้นเสียง ไม่ใช่ต้นทุนทั้งหมดของเอเจนต์เสียง การใช้โมเดลแบ็กเอนด์และเครื่องมือจะถูกคิดค่าบริการแยกต่างหาก ดังนั้นการประเมินงบสำหรับใช้งานจริงควรนับทั้งระยะเวลาสนทนา และงานที่ส่งไปให้ระบบด้านหลังประมวลผล 16
18
OpenAI รายงานว่า GPT-Live-1 มีผลลัพธ์บน Full Duplex Bench ดีขึ้น 30 จุดเปอร์เซ็นต์เมื่อเทียบกับ GPT-Realtime-2.1 และการจับคู่ GPT-Live-1 กับ GPT-6 Astra ที่ระดับการใช้เหตุผลปานกลางได้อันดับหนึ่งบน Tau3 1
อย่างไรก็ตาม เอกสารต้นทางที่มีให้ไม่ได้ยืนยันตัวเลขเฉพาะเจาะจงเกี่ยวกับเวลาแฝงในการผลัดกันพูด หรืออัตราการผ่าน Tau3 แบบเปรียบเทียบตามที่ระบุไว้ในคำถามเดิม จึงไม่ควรถือว่าตัวเลขละเอียดเหล่านั้นได้รับการยืนยันจากหลักฐานชุดนี้
OpenAI ยกตัวอย่างการใช้งานจริงช่วงแรกเพื่อสะท้อนคุณค่าของการผลัดกันพูดที่เป็นธรรมชาติมากขึ้น ได้แก่
ผลลัพธ์เหล่านี้เป็นข้อมูลที่แต่ละบริษัทรายงานเอง ไม่ใช่การประเมินอิสระ จึงควรใช้เป็นตัวอย่างการนำไปใช้งาน มากกว่าจะมองเป็นการรับประกันผลลัพธ์สำหรับทุกกรณี
หลักฐานที่มีไม่รองรับข้ออ้างเรื่องการเข้าถึงสำหรับองค์กรผ่านผลิตภัณฑ์แบบจัดการชื่อ “Presence” และไม่ได้ยืนยันการขยายการรองรับสำเนียง ภาษาถิ่น หรือภาษาอย่างเฉพาะเจาะจงในการเปิดตัว API ครั้งนี้ องค์กรที่ต้องใช้ข้อมูลดังกล่าวในการจัดซื้อหรือออกแบบระบบควรตรวจสอบเอกสาร OpenAI ฉบับปัจจุบันโดยตรงก่อน
สาระสำคัญของ GPT-Live-1 คือการแยกสถาปัตยกรรมเป็นชั้นเสียงแบบ full-duplex ที่สนทนาอย่างต่อเนื่องได้ ขณะที่อีกระบบหนึ่งจัดการงานคิดวิเคราะห์ที่ช้ากว่าหรือเรียกใช้เครื่องมือ ราคา 0.05 ดอลลาร์ต่อนาทีสำหรับชั้นเสียง—คิดตามวินาที—ทำให้ต้นทุนเวลาสนทนาคาดการณ์ได้ตรงไปตรงมา แต่ต้นทุนรวมยังขึ้นอยู่กับโมเดลแบ็กเอนด์และเครื่องมือที่เลือกใช้ 1
16
18
Studio Global AI
หน้านี้รวมคำตอบที่ได้รับการสนับสนุนจากแหล่งที่มาซึ่งคุณสามารถดำเนินการต่อภายใน Studio Global
OpenAI เปิดให้ใช้ GPT Live 1 ผ่าน API แบบทั่วไปเมื่อวันที่ 10 กันยายน 2026 โมเดลนี้สนทนาด้วยเสียงแบบ full duplex และให้ระบบแบ็กเอนด์รับงานคิดวิเคราะห์หรือเรียกเครื่องมือได้
OpenAI เปิดให้ใช้ GPT Live 1 ผ่าน API แบบทั่วไปเมื่อวันที่ 10 กันยายน 2026 โมเดลนี้สนทนาด้วยเสียงแบบ full duplex และให้ระบบแบ็กเอนด์รับงานคิดวิเคราะห์หรือเรียกเครื่องมือได้ ต่างจากระบบเสียงที่รอให้ผู้ใช้พูดจบเป็นรอบ ๆ GPT Live 1 ออกแบบมาให้รับมือกับช่วงเว้นจังหวะ การพูดแทรก คำตอบรับสั้น ๆ และการเปลี่ยนประเด็นระหว่างสนทนาได้
ค่าใช้จ่ายของชั้นเสียงอยู่ที่ 0.05 ดอลลาร์ต่อนาที คิดตามวินาที แต่ค่าโมเดลแบ็กเอนด์และเครื่องมือจะคิดแยกต่างหาก