ทั้งสองรุ่นมาแทนที่ Advanced Voice Mode เดิมของ ChatGPT โดยใช้สถาปัตยกรรม full-duplex ที่ประมวลผลเสียงที่รับเข้ามาอย่างต่อเนื่องพร้อมกับสร้างเสียงพูดตอบกลับ แทนที่จะเป็นระบบ half-duplex แบบเก่าที่โมเดลต้องพูดจบก่อนถึงจะฟังผู้ใช้ได้ HAT
OpenAI กล่าวว่าต้นทุนในการประมวลผล (inference costs) ลดลงมากพอที่จะทำให้ระบบเสียงนี้ใช้งานได้ในเชิงธุรกิจ จึงสามารถปล่อยให้ผู้ใช้ฟรีใช้ได้ด้วย A ในช่วงเปิดตัว GPT-Live ใช้ GPT-5.5 เป็นตัวประมวลผลเบื้องหลัง OH
ความสามารถแบบ full-duplex เปลี่ยนความรู้สึกในการใช้งาน AI เสียงในสามด้านหลัก ซึ่ง OpenAI สาธิตให้เห็นระหว่างการแถลงเปิดตัว
โมเดลสามารถถูกขัดจังหวะขณะกำลังพูดได้ โดยมันจะหยุดและฟังทันที ไม่ใช่พูดกลบผู้ใช้ ยิ่งไปกว่านั้น มันยังตรวจจับเมื่อผู้ใช้หยุดคิดกลางประโยคและรอคอยโดยไม่แทรกขึ้นมา AT Atty Eleti หัวหน้าฝ่ายผลิตภัณฑ์ของ ChatGPT Voice กล่าวระหว่างการแถลงว่า "นี่คือโมเดลแบบ full-duplex" T
โมเดลยังสามารถแสดงว่ากำลังตั้งใจฟังด้วยเสียงเช่น "อือ" หรือ "ค่ะ/ครับ" ขณะที่ผู้ใช้ยังพูดอยู่ และจะเงียบเมื่อคุณต้องการใช้เวลาคิด OB
เมื่อ GPT-Live เจอคำถามยากๆ มันจะส่งต่องานให้โมเดลข้อความล่าสุดของ OpenAI (เช่น GPT-5.5) ประมวลผลแบบคู่ขนาน ขณะที่ตัว GPT-Live เองยังคงสนทนากับผู้ใช้ต่อไป AT Kundan Kumar หัวหน้านักวิจัยกล่าวว่า "เมื่อ GPT-Live ต้องคิดหนักกับคำถามหนึ่ง มันสามารถส่งต่อการคิดและงานที่ซับซ้อนให้ GPT-5.5 ทำงานแบบคู่ขนาน ในขณะที่ GPT-Live ยังคงสนทนากับผู้ใช้อยู่" LT หมายความว่าผู้ใช้ไม่ต้องรอให้โมเดลเสียงคิดคำตอบยาวๆ การเปลี่ยนจากขั้นตอนค้นคว้ามาพูดสรุปผลแทบจะทันทีทันใด T
GPT-Live สามารถเสริมการสนทนาด้วยภาพบนหน้าจอ ไม่ว่าจะเป็นรูปภาพ แผนภาพ หรือเนื้อหาอื่นที่สร้างโดย AI สร้างประสบการณ์แบบ multimodal ที่เหนือกว่าการคุยด้วยเสียงอย่างเดียว HAT เว็บไซต์ The Verge รายงานว่าโมเดลนี้จะเสริมการสนทนาเกี่ยวกับสภาพอากาศ หุ้น และกีฬาด้วยภาพที่สร้างโดย AI T
โดยรวมแล้ว ฟีเจอร์เหล่านี้ทำให้การสนทนาดูเป็นธรรมชาติมากขึ้น Business Insider บรรยายว่าผู้ช่วยคนนี้ "อยากให้คุณพูดกลบมัน" B ส่วนพาดหัวของ The Verge ก็บอกว่ามัน "เงียบเก่งขึ้น" T
บุคคลสำคัญสองคนที่ถูกเอ่ยถึงในงานแถลงข่าวและรายงานของสื่อ:
รายงานก่อนหน้านี้ตั้งแต่เดือนมกราคม 2026 ยังระบุชื่อหัวหน้าฝ่ายโครงสร้างพื้นฐาน Ben Newhouse และผู้จัดการผลิตภัณฑ์ Jackie Shannon ว่ามีส่วนร่วมในการปรับโครงสร้างระบบเสียง AI IX
gpt-realtime-2.1 และ gpt-realtime-2.1-mini) ซึ่งลดเวลาแฝงที่เปอร์เซ็นไทล์ที่ 95 (p95 latency) ลง 25% จากการปรับปรุงการแคช Cข้อจำกัดหนึ่งที่ถูกกล่าวถึงตอนเปิดตัวคือ GPT-Live ยังไม่รองรับเสียงพร้อมกับวิดีโอในตอนนี้ T
GPT-Live ของ OpenAI เปิดตัวท่ามกลางสัปดาห์ที่คึกคักเป็นพิเศษของวงการ AI
ระบบนิเวศของ OpenAI เอง:
คู่แข่งและข่าวอื่นๆ ที่เกี่ยวข้อง: