Qwen3.8 Flash Next เปิดตัวเมื่อวันที่ 26 สิงหาคม 2026 ในฐานะโมเดลโอเพนเวตแบบมัลติโมดัลและพรีวิวสถาปัตยกรรมที่ Alibaba ระบุว่าจะใช้เป็นพื้นฐานของตระกูล Qwen4 โมเดลมีพารามิเตอร์หลัก 125,000 ล้านตัว เสริมด้วย N gram embeddings อีก 51,000 ล้านตัว แต่เปิดใช้งานประมาณ 6,000 ล้านตัวต่อโทเคน จุดเด่นอยู่ที่การออกแบบเพื่อบริบ...
คำตอบการวิจัย

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s Qwen3.8-Flash—also released as Qwen3.8-Flash-Next—and why is it significant as an open multimodal mixture-of-experts techn. Article summary: Qwen3.8-Flash, released as the open-weight Qwen3.8-Flash-Next, is Alibaba Qwen’s multimodal mixture-of-experts (MoE) technical-preview model for the architecture intended to underpin Qwen4. It matters less as a conventio. Topic tags: general, news, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers
Alibaba และทีม Qwen เปิดตัว Qwen3.8-Flash-Next เมื่อวันที่ 26 สิงหาคม 2026 โดยมีรายงานติดตามในวันที่ 27 สิงหาคม โมเดลนี้เป็นโมเดลแบบเปิดน้ำหนัก (open-weight) และไม่ได้ถูกนำเสนอในฐานะเรือธง Qwen4 รุ่นสมบูรณ์ แต่เป็นพรีวิวที่เปิดให้ตรวจสอบได้ของสถาปัตยกรรมซึ่ง Qwen ระบุว่าจะเป็นพื้นฐานของตระกูล Qwen4 1
2
15
แนวคิดสำคัญของรุ่นนี้คือการรักษาความจุของโมเดลขนาดใหญ่ไว้ โดยไม่ต้องใช้พลังประมวลผลกับพารามิเตอร์ทั้งหมดในทุกโทเคน ตัวโมเดลมีเครือข่ายหลัก 125,000 ล้านพารามิเตอร์ พร้อมส่วนประกอบ N-gram embeddings เพิ่มอีก 51,000 ล้านพารามิเตอร์ แต่เปิดใช้งานเพียงประมาณ 6,000 ล้านพารามิเตอร์ต่อโทเคน 4
15
ชื่อ Qwen3.8-Flash-Next ใช้เรียกโมเดลเปิดที่ Qwen เผยแพร่ ขณะที่ Qwen3.8-Flash หมายถึงรุ่นที่มุ่งให้บริการจริงผ่านผลิตภัณฑ์และ API ดังนั้นทั้งสองชื่อมีความเกี่ยวข้องกัน แต่ไม่ควรถือว่าเป็นโมเดลเดียวกันในแง่การใช้งานหรือสถานะการเปิดตัว 1
2
15
Qwen3.8-Flash-Next จึงควรถูกมองเป็น พรีวิวทางเทคนิคและพิมพ์เขียวสำหรับนักพัฒนา มากกว่าจะเป็นหลักฐานว่า Qwen4 เปิดตัวแล้ว การเปิดน้ำหนักตั้งแต่ระยะแรกทำให้นักวิจัยและนักพัฒนาสามารถตรวจสอบสถาปัตยกรรม เตรียมเครื่องมือรองรับ และส่งข้อเสนอแนะก่อนที่ตระกูล Qwen4 จะมาถึง 2
3
15
ตัวเลข 1 ล้านโทเคนไม่ใช่ขีดจำกัดบริบทโดยกำเนิดของโมเดล การตั้งค่าให้บริการมาตรฐานอยู่ที่ 262,144 โทเคน ส่วนหน้าต่างบริบทที่ใหญ่กว่านั้นอาศัยการขยายด้วย YaRN จึงควรประเมินในฐานะการตั้งค่าแบบขยาย ไม่ใช่ความสามารถพื้นฐานของทุกการใช้งาน 1
4
16
Qwen3.8-Flash-Next ใช้การออกแบบไฮบริดที่รวม Gated DeltaNet (GDN) กับ Qwen Sparse Attention (QSA) โดย GDN มุ่งบีบอัดข้อมูลจากบริบทก่อนหน้า ขณะที่ QSA ใช้ดัชนีน้ำหนักเบาเพื่อค้นหาและเลือกไมโครบล็อกที่เกี่ยวข้อง แทนการคำนวณ attention แบบเต็มกับประวัติทั้งหมดอย่างสม่ำเสมอ 4
เป้าหมายคือการลดต้นทุนและเวลาประมวลผลเมื่อข้อความมีความยาวมากขึ้น Qwen รายงานว่าโมเดลทำ prefill ได้เร็วขึ้นสูงสุด 7.6 เท่า และถอดรหัสได้เร็วขึ้นสูงสุด 4.9 เท่า เมื่อทดสอบกับลำดับความยาว 1 ล้านโทเคน 4
อย่างไรก็ตาม ตัวเลขดังกล่าวเป็นตัวเลขที่ผู้พัฒนาโมเดลรายงานเอง ผลลัพธ์จริงขึ้นอยู่กับฮาร์ดแวร์ ซอฟต์แวร์ที่ใช้ให้บริการ ลักษณะลำดับข้อมูล และวิธีการวัดผล จึงไม่ควรตีความว่าเป็นความเร็วที่จะเกิดขึ้นเหมือนกันในทุกระบบ
ส่วนประกอบ N-gram embeddings ช่วยเพิ่มความสามารถในการแทนข้อมูลของระบบ โดยไม่จำเป็นต้องประมวลผลพารามิเตอร์ทั้งหมดในทุกโทเคน Qwen ยังออกแบบให้ตาราง embeddings นี้ย้ายไปเก็บในหน่วยความจำของเครื่องโฮสต์ได้ และสามารถดึงข้อมูลล่วงหน้าแบบอะซิงโครนัส เพื่อให้การถ่ายโอนข้อมูลทำงานทับซ้อนกับการคำนวณของโมเดล 4
สำหรับผู้ดูแลระบบ AI นี่เป็นทิศทางที่มีความหมายในทางปฏิบัติ เพราะตำแหน่งที่จัดเก็บข้อมูลและการเคลื่อนย้ายข้อมูลอาจสำคัญไม่แพ้จำนวนพารามิเตอร์ โดยเฉพาะงานที่ต้องอ่านเอกสารยาวหรือประมวลผลเป็นชุดจำนวนมาก
พรีวิวนี้ยังรวมการเปลี่ยนแปลงด้านการเพิ่มประสิทธิภาพและการขยายขนาดโมเดล Qwen ระบุว่าใช้ Muon optimizer พร้อมปรับวิธีทำงานร่วมกับ AdamW และการจัดการพารามิเตอร์ รวมถึงพัฒนากฎ scaling law ที่ปรับให้เหมาะกับสถาปัตยกรรมนี้ 4
ดังนั้นการเปิดตัวครั้งนี้จึงไม่ใช่เพียงการเผยแพร่ checkpoint ที่เปลี่ยนบล็อก attention แต่เป็นการเปิดให้สาธารณะทดสอบแนวทางสร้างโมเดลที่มีความจุรวมสูง ขณะที่ใช้การคำนวณจริงต่อโทเคนในระดับต่ำกว่าโมเดลแบบหนาแน่น (dense model)
Qwen ระบุว่าการฝึก Qwen3.8-Flash ใช้ต้นทุนประมาณ หนึ่งในเก้าของ Qwen3.7-Plus พร้อมปรับปรุงประสิทธิภาพด้านการเขียนโค้ดและงานสำนักงาน Reuters รายงานคำกล่าวของบริษัทในทิศทางเดียวกันว่าโมเดลรุ่นนี้ให้ผลลัพธ์ดีขึ้นในงานดังกล่าวควบคู่กับต้นทุนการฝึกที่ลดลง 1
4
ตัวเลขการประเมินที่มีการรายงาน ได้แก่ 58.7 คะแนนบน DeepSWE 1.1, 62.5 คะแนนบน SWE-bench Pro และ 84.5 คะแนนบน AndroidWorld โดย Qwen วางตำแหน่งผลลัพธ์เหล่านี้ว่าเหนือกว่า DeepSeek V4 Flash ในกลุ่มโมเดลที่เน้นความคุ้มค่า 4
แต่การเปรียบเทียบเหล่านี้ยังเป็นข้อมูลที่บริษัทหรือสื่อรายงานจากการเปิดเผยของ Qwen เอง ยังไม่มีข้อมูลในเนื้อหาที่ให้มาซึ่งยืนยันการทำซ้ำโดยอิสระภายใต้เงื่อนไขการทดสอบที่เทียบเท่ากันทั้งหมด
สำหรับบริการ Qwen3.8-Flash ผ่าน API มีการระบุราคาไว้ที่ 1 หยวนต่อ 1 ล้านโทเคนขาเข้า และ 3 หยวนต่อ 1 ล้านโทเคนขาออก โดยเอกสารประชาสัมพันธ์ที่อ้างถึงไม่ได้ระบุการแบ่งราคาเป็นช่วงพีกและนอกพีก 1
4
การนำราคาไปเทียบกับโมเดลอื่นยังต้องดูรายละเอียดของงาน เพราะรุ่นโมเดล การแคช ความยาวบริบท ระดับบริการ และปริมาณผลลัพธ์ที่ต้องการอาจแตกต่างกัน แม้จะใช้หน่วยราคาเดียวกันก็ตาม
การเปิดน้ำหนักทำให้ Qwen3.8-Flash-Next เป็นพื้นที่ทดลองที่จับต้องได้ก่อน Qwen4 จะเปิดตัว นักพัฒนาสามารถเริ่มปรับเครื่องมือ inference ทดสอบการทำ quantization และวิธีให้บริการ รวมถึงดูพฤติกรรมของสถาปัตยกรรมกับงานจริงของตนเอง โดยไม่ต้องรอการเผยแพร่ Qwen4 รุ่นสมบูรณ์ 2
3
15
การใช้งานที่สอดคล้องกับการออกแบบด้านบริบทยาวและพารามิเตอร์ที่เปิดใช้งานน้อย ได้แก่
อย่างไรก็ดี นี่คือกรณีใช้งานที่อนุมานได้จากการออกแบบโมเดล ไม่ใช่คำรับรองว่าจะทำได้ดีกว่าโมเดล dense หรือโมเดลที่ใช้ full attention ในทุกสภาพแวดล้อม ต้นทุนจริงยังขึ้นอยู่กับฮาร์ดแวร์ ซอฟต์แวร์ให้บริการ คุณภาพของ quantization กลยุทธ์ retrieval และลักษณะงาน
ความสำคัญของ Qwen3.8-Flash-Next อยู่ที่การเปิดเผยทิศทางสถาปัตยกรรมของ Qwen ตั้งแต่เนิ่น ๆ นักพัฒนาจึงมีโอกาสตรวจสอบว่า attention แบบกระจายและบีบอัด ตาราง embeddings ขนาดใหญ่ และจำนวนพารามิเตอร์ที่เปิดใช้งานต่ำ จะช่วยให้การประมวลผลบริบทยาวมีต้นทุนที่ดีขึ้นได้หรือไม่ โดยไม่แลกกับคุณภาพมากเกินไป
แต่ตัวเลขที่โดดเด่นที่สุด ไม่ว่าจะเป็นความเร็วที่เพิ่มขึ้น คะแนน benchmark ต้นทุนการฝึก หรือข้ออ้างด้านความคุ้มค่า ล้วนมาจาก Qwen หรือการรายงานที่อ้างอิงการเปิดเผยของ Qwen เป็นหลัก ยังจำเป็นต้องมีการทดสอบอิสระบนฮาร์ดแวร์ ภาษา ความยาวบริบท งานมัลติโมดัล และเวิร์กโฟลว์เอเจนต์ในระบบจริง
ข้อสรุปที่รอบคอบกว่าการบอกว่า “Qwen3.8-Flash-Next ชนะทุกโมเดลคู่แข่ง” คือ นี่เป็น โมเดลมัลติโมดัลแบบ Mixture-of-Experts ที่เปิดให้ตรวจสอบ และเป็นพรีวิวทางเทคนิคของ Qwen4 ซึ่งมอบภาพแรก ๆ ของสถาปัตยกรรมที่ Alibaba กำลังเตรียมไว้ พร้อมพิมพ์เขียวที่ชุมชนนักพัฒนาสามารถนำไปทดสอบเพื่อทำให้ AI บริบทยาวมีประสิทธิภาพมากขึ้น
Studio Global AI
หน้านี้รวมคำตอบที่ได้รับการสนับสนุนจากแหล่งที่มาซึ่งคุณสามารถดำเนินการต่อภายใน Studio Global
Qwen3.8 Flash Next เปิดตัวเมื่อวันที่ 26 สิงหาคม 2026 ในฐานะโมเดลโอเพนเวตแบบมัลติโมดัลและพรีวิวสถาปัตยกรรมที่ Alibaba ระบุว่าจะใช้เป็นพื้นฐานของตระกูล Qwen4
Qwen3.8 Flash Next เปิดตัวเมื่อวันที่ 26 สิงหาคม 2026 ในฐานะโมเดลโอเพนเวตแบบมัลติโมดัลและพรีวิวสถาปัตยกรรมที่ Alibaba ระบุว่าจะใช้เป็นพื้นฐานของตระกูล Qwen4 โมเดลมีพารามิเตอร์หลัก 125,000 ล้านตัว เสริมด้วย N gram embeddings อีก 51,000 ล้านตัว แต่เปิดใช้งานประมาณ 6,000 ล้านตัวต่อโทเคน
จุดเด่นอยู่ที่การออกแบบเพื่อบริบทยาว โดยรองรับ 262,144 โทเคนเป็นค่าเริ่มต้น และขยายได้ถึง 1 ล้านโทเคนด้วย YaRN ทั้งยังมีการอ้างความเร็วและต้นทุนที่ดีขึ้น แต่ตัวเลขสำคัญยังต้องรอการทดสอบจากภายนอก