Qwen3.8 Omni Flash เปิดให้ใช้บนแพลตฟอร์ม Qwen AI ในเดือนกันยายน 2026 รับข้อความ ภาพ เสียง และวิดีโอได้ในเวิร์กโฟลว์เดียว พร้อมหน้าต่างบริบทสูงสุด 1 ล้านโทเคน [1][2] Qwen ระบุว่าคะแนนเฉลี่ยจากการประเมิน 29 รายการสูงกว่า Qwen3.5 Omni Plus มากกว่า 25% และการเลือกดูเฉพาะช่วงสำคัญของวิดีโอช่วยลดจำนวนโทเคนในการทดสอบที่บริ...
เผยแพร่โดยแก้ไขด้วย GPT-6 Solรูปภาพสร้างด้วย GPT Image 2
คำตอบการวิจัย

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s Qwen3.8 Omni Flash, launched on the Qwen AI platform in September 2026, and how do its native text, image, audio, and vide. Article summary: Alibaba’s Qwen3.8 Omni Flash is a September 2026 model available on the Qwen AI platform that accepts text, images, audio, and video natively in one workflow, with a context window of up to 1 million tokens.. Topic tags: general web, agents, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake
ถ้าต้องสรุปการประชุมยาวหนึ่งชั่วโมง หรือค้นหาช่วงสำคัญจากวิดีโอก่อนนำข้อมูลไปทำงานต่อ Qwen3.8-Omni-Flash คือโมเดลของ Alibaba ที่ออกแบบมาสำหรับงานลักษณะนี้ เปิดให้ใช้บนแพลตฟอร์ม Qwen AI ในเดือนกันยายน 2026 โดยรับข้อความ ภาพ เสียง และวิดีโอได้โดยตรงในเวิร์กโฟลว์เดียว และมี หน้าต่างบริบท สูงสุด 1 ล้านโทเคน หรือพื้นที่สำหรับเก็บข้อมูลที่โมเดลพิจารณาระหว่างทำงานหนึ่งครั้ง 1
2
จุดขายจึงไม่ใช่แค่การบอกว่าในคลิปมีอะไร แต่เป็นการให้ AI ทำงานแบบ เอเจนต์: ทำความเข้าใจสิ่งที่เห็นและได้ยิน วางแผน เลือกใช้เครื่องมือ แล้วส่งมอบผลลัพธ์ เช่น งานสรุปหรือจัดการเนื้อหาวิดีโอ 16
52 ทั้งนี้ โมเดล Qwen3.8-Omni-Flash รุ่นปกติรับข้อมูลได้หลายรูปแบบแต่ส่งผลลัพธ์เป็นข้อความ ส่วนรุ่น Realtime รองรับผลลัพธ์ทั้งข้อความและเสียง
5
1
สำหรับวิดีโอยาว ระบบสามารถเริ่มจากคำถามแล้วเลือกตรวจช่วงที่เกี่ยวข้อง แทนการประมวลผลทุกเฟรมอย่างต่อเนื่อง Qwen รายงานว่าแนวทางนี้ใช้โทเคนน้อยกว่าการทำความเข้าใจวิดีโอแบบคงที่ 51.8% ในการทดสอบ OmniVideoBench ตัวเลขนี้เป็นผลทดสอบที่รายงาน ไม่ใช่อัตราประหยัดที่รับประกันว่าจะเกิดขึ้นกับทุกคลิปหรืองานจริง 16
ด้านความสามารถโดยรวม Qwen ระบุว่าคะแนนเฉลี่ยจากการประเมิน 29 รายการ สูงกว่า Qwen3.5-Omni-Plus มากกว่า 25% ซึ่งเป็นผลเปรียบเทียบตามชุดทดสอบของบริษัท ไม่ควรตีความว่าโมเดลจะทำงานทุกประเภทได้ดีขึ้นในสัดส่วนเดียวกัน 12
หน้าต่างบริบทขนาดใหญ่รองรับงานที่ต้องอาศัยข้อมูลเสียงและภาพต่อเนื่อง โดยมีการระบุว่าโมเดลรับข้อมูลเสียงและวิดีโอการประชุมได้ยาวสูงสุด หนึ่งชั่วโมง และสามารถเชื่อมโยงผู้พูดในภาพกับเสียง แยกช่วงผู้พูด และถอดเนื้อหาได้ 1
52 เมื่อประกอบกับการใช้เครื่องมือ แนวคิดของเวิร์กโฟลว์คือค้นหาหลักฐานที่เกี่ยวข้องจากสื่อ แล้วนำไปจัดทำผลลัพธ์ที่ใช้งานต่อได้ แทนที่จะหยุดเพียงคำบรรยายคลิป
16
52
Alibaba ยังขยาย Qwen-MM-Plugins ซึ่งเป็นเครื่องมือโอเพนซอร์สสำหรับเพิ่มความสามารถด้านเสียงและวิดีโอให้ระบบเอเจนต์ โดยเน้นงานสื่อยาวและการเรียกใช้เครื่องมือ ขณะที่ Qwen-Live Harness ซึ่งเปิดซอร์สแยกต่างหาก มุ่งรองรับการโต้ตอบต่อเนื่องแบบสด 1
52 สำหรับ Qwen3.8-Omni-Flash-Realtime เอกสารระบุว่ารองรับการรับเสียงและวิดีโอสด การตอบกลับเป็นข้อความและเสียง เสียงหลายช่องสัญญาณ การรวมข้อมูลวิดีโอ และเครื่องมือ MCP ระยะไกล โดย MCP คือแนวทางเชื่อมเอเจนต์เข้ากับเครื่องมือภายนอก
1
Qwen ระบุว่าราคา API ต่อชั่วโมงของ ข้อมูลเสียงขาเข้า ลดลงมากกว่า 98% และของ ข้อมูลเสียงร่วมกับวิดีโอขาเข้า ลดลงมากกว่า 93% 12 เมื่อรวมกับการเลือกประมวลผลวิดีโอเฉพาะจุด การให้เอเจนต์รับรู้สื่อและเรียกใช้เครื่องมือซ้ำ ๆ จึงมีแนวโน้มคุ้มค่าขึ้น อย่างไรก็ดี ตัวเลขลดราคานี้ไม่ใช่ต้นทุนรวมของระบบที่ใช้งานจริง ซึ่งยังขึ้นกับสื่อที่ป้อน จำนวนโทเคน ผลลัพธ์ที่สร้าง และเครื่องมืออื่น ๆ ที่เรียกใช้
12
16
Studio Global AI
หน้านี้รวมคำตอบที่ได้รับการสนับสนุนจากแหล่งที่มาซึ่งคุณสามารถดำเนินการต่อภายใน Studio Global
Qwen3.8 Omni Flash เปิดให้ใช้บนแพลตฟอร์ม Qwen AI ในเดือนกันยายน 2026 รับข้อความ ภาพ เสียง และวิดีโอได้ในเวิร์กโฟลว์เดียว พร้อมหน้าต่างบริบทสูงสุด 1 ล้านโทเคน [1][2]
Qwen3.8 Omni Flash เปิดให้ใช้บนแพลตฟอร์ม Qwen AI ในเดือนกันยายน 2026 รับข้อความ ภาพ เสียง และวิดีโอได้ในเวิร์กโฟลว์เดียว พร้อมหน้าต่างบริบทสูงสุด 1 ล้านโทเคน [1][2] Qwen ระบุว่าคะแนนเฉลี่ยจากการประเมิน 29 รายการสูงกว่า Qwen3.5 Omni Plus มากกว่า 25% และการเลือกดูเฉพาะช่วงสำคัญของวิดีโอช่วยลดจำนวนโทเคนในการทดสอบที่บริษัทอ้างถึง [12][16]
ปลั๊กอินสำหรับงานสื่อยาวและเครื่องมือสำหรับงานเรียลไทม์ช่วยต่อยอดเป็นเอเจนต์ที่ใช้เครื่องมือได้ แต่ต้นทุนใช้งานจริงยังขึ้นกับปริมาณข้อมูล ผลลัพธ์ และเครื่องมือที่เรียกใช้ [1][12][52]