DeepSeek V4.1 Flash รองรับบริบทสูงสุด 1 ล้านโทเคน แต่ขนาดบริบทที่รองรับไม่ได้รับประกันว่าจะค้นคืนทุกรายละเอียดได้แม่นยำ โมเดลใช้พารามิเตอร์ที่ทำงานราว 8 พันล้านตัวต่อโทเคนขณะอ่านอินพุต และ 16 พันล้านตัวต่อโทเคนขณะสร้างคำตอบ พร้อมลดขนาด KV cache ด้วย CSA2 และ FP4 DeepSeek รายงานว่า global KV cache เหลือ 890 ไบต์ต่อโท...
เผยแพร่โดยแก้ไขด้วย GPT-6 Solรูปภาพสร้างด้วย GPT Image 2
คำตอบการวิจัย

Create a landscape editorial hero image for this Studio Global article: What is DeepSeek-V4.1-Flash, and how do its 552B-parameter multimodal Causal Encoder–Decoder MoE architecture, 20-layer encoder and 20-layer. Article summary: DeepSeek-V4.1-Flash is DeepSeek’s multimodal, open-weight MoE model designed for long, input-heavy agent sessions. It supports contexts of up to one million tokens while reducing the computation and KV-cache storage need. Topic tags: general, academic, documentation, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, chart
สำหรับเอเจนต์ AI ที่ต้องอ่านประวัติการสนทนา เอกสาร หรือผลลัพธ์จากเครื่องมือจำนวนมากก่อนตอบ คำถามไม่ได้มีเพียงว่าโมเดล รับข้อความได้ยาวแค่ไหน แต่ยังรวมถึงต้องใช้ทรัพยากรเท่าไรเพื่ออ่านและเก็บบริบทนั้น DeepSeek-V4.1-Flash เป็นโมเดลแบบ mixture-of-experts (MoE) ที่เปิดเผยน้ำหนักโมเดล รองรับทั้งข้อความและภาพ และรับบริบทได้สูงสุด 1 ล้านโทเคน อย่างไรก็ดี ขีดจำกัดบริบทนี้ไม่ใช่คำรับประกันว่าโมเดลจะดึงทุกรายละเอียดจากเซสชันยาว ๆ ได้ถูกต้องเสมอ 2
8
โมเดลมีสถาปัตยกรรมหลักขนาด 552 พันล้านพารามิเตอร์ แบ่งเป็น causal encoder 20 ชั้น และ decoder 20 ชั้น แทนที่จะให้ decoder แต่ละชั้นสร้างข้อมูลสำหรับ KV cache ของตนเองแยกกัน ระบบจะสร้าง global KV cache โดยแปลงมาจากสถานะสุดท้ายของ encoder ทั้งนี้ KV cache คือข้อมูลที่ระบบเก็บไว้เพื่อให้การประมวลผลโทเคนถัดไปอ้างอิงบริบทก่อนหน้าได้ 2
8
DeepSeek ระบุว่าโมเดลใช้พารามิเตอร์ที่ทำงานราว 8 พันล้านตัวต่อโทเคนในช่วง prefill หรือช่วงอ่านอินพุต และ 16 พันล้านตัวต่อโทเคนในช่วง decode หรือช่วงสร้างคำตอบ ความต่างนี้เหมาะกับลักษณะงานของเอเจนต์ที่อ่านข้อมูลจำนวนมาก แต่ตอบกลับสั้นกว่าอินพุตมาก อย่างไรก็ตาม ตัวเลขพารามิเตอร์ที่ทำงานไม่ใช่ตัวเลขค่าใช้จ่ายจริงของทุกระบบที่นำโมเดลไปให้บริการ 2
8
CSA2 ร่วมกับ FP4 ลด global KV cache: Compressed Sparse Attention 2 หรือ CSA2 กำหนดให้ชั้น attention ทำงานในหนึ่งในสามโหมด ได้แก่ Full, Reindex และ Reuse เพื่อแบ่งปันข้อมูลที่แคชไว้และนำการเลือกตำแหน่งสำหรับ sparse attention กลับมาใช้ ร่วมกับการเก็บ KV cache หลักในรูปแบบ FP4 แล้ว DeepSeek รายงานว่า global KV cache ใช้พื้นที่ 890 ไบต์ต่อโทเคน หรือราว หนึ่งในสี่ ของ DeepSeek-V4-Flash รุ่นก่อน ตัวเลขนี้เปรียบเทียบขนาดแคช ไม่ได้หมายความว่าค่าใช้จ่ายรวมของทุกการใช้งานจะลดลงเหลือหนึ่งในสี่ 6
8
SWA Bounded Replay ลดข้อมูลที่ต้องเก็บถาวร: เทคนิคนี้สร้างสถานะ KV ที่ขาดไปของ sliding-window attention ขึ้นใหม่ โดยประมวลผลซ้ำเฉพาะโทเคนในหน้าต่างล่าสุด แทนการเก็บสถานะเหล่านั้นไว้บน SSD เอกสารโมเดลระบุว่าพื้นที่ KV cache ที่ต้องเก็บถาวร เหลือราว หนึ่งในแปด ของ V4-Flash ซึ่งเป็นการวัดคนละส่วนกับตัวเลข global KV cache หนึ่งในสี่ข้างต้น 5
9
ข้อมูลโมเดลระบุว่าฝึกตั้งแต่ต้นด้วยชุดข้อมูลหลายสื่อรวม 45 ล้านล้านโทเคน ฝึก sparse attention ที่ความยาวลำดับ 64,000 โทเคน และขยายบริบทเป็น 1 ล้านโทเคน เมื่อการฝึกดำเนินไปถึงจุด 34 ล้านล้านโทเคน DeepSeek ยังกล่าวถึงวิธีก่อนฝึกแบบใหม่และการปรับแต่งหลังฝึกด้วย reinforcement learning ในระดับที่ใหญ่ขึ้น แต่ข้อมูลอ้างอิงที่มีไม่เพียงพอจะอธิบายขั้นตอนหลังฝึกได้ละเอียดกว่านั้น 9
16
โมเดลรองรับภาพและข้อความโดยตรง และ DeepSeek ระบุว่า API รองรับการใช้งานหลายสื่อด้วย แต่ข้อมูลอ้างอิงชุดนี้ยังไม่เพียงพอสำหรับสรุปคะแนนทดสอบด้านการมองเห็นเป็นรายรายการ 2
16
สำหรับประสิทธิภาพ DeepSeek รายงานว่า รุ่น base มีความสามารถด้านความรู้ การให้เหตุผล และการเขียนโค้ดใกล้เคียง V4-Pro-Base พร้อมผลดีขึ้น 5%–10% ในชุดประเมินที่กันไว้ทดสอบ ทั้งที่ใช้พารามิเตอร์ทั้งหมดราวหนึ่งในสาม และพารามิเตอร์ที่ทำงานราวหนึ่งในสี่ DeepSeek ยังระบุว่าโมเดลที่เผยแพร่ทำได้ดีกว่า V4-Pro ในงานแบบเอเจนต์ แต่ข้อมูลอ้างอิงที่มีไม่รองรับการเทียบคะแนนแบบเจาะรายเบนช์มาร์กอย่างน่าเชื่อถือ ทั้งหมดนี้เป็นผลที่ผู้พัฒนารายงาน ไม่ใช่การทดสอบเทียบโดยอิสระ 1
16
ชื่อโมเดลบน API คือ deepseek-flash ส่วนน้ำหนักโมเดลที่เผยแพร่ระบุสัญญาอนุญาต MIT เอกสารโมเดลอธิบายแนวทางให้บริการผ่าน SGLang และรายการโมเดลยังระบุการรองรับการอนุมานด้วย Transformers และ vLLM ก่อนใช้งานจริงควรตรวจสอบข้อกำหนดของรันไทม์ที่เลือก โดยไม่สมมติว่าทุกระบบรองรับฟีเจอร์ภาพหรือบริบทขนาดยาวเหมือนกัน 8
9
16
DeepSeek ระบุว่า V4-Flash และ V4-Flash-Vision-Exp ยุติการให้บริการแล้ว โดยชื่อ API เดิม deepseek-v4-flash และ deepseek-v4-flash-vision-exp จะถูกส่งต่อไปยัง V4.1-Flash ชั่วคราว บริษัทยังประกาศว่า ตั้งแต่ 14 กันยายน 2026 คำขอที่ใช้ชื่อ deepseek-v4-pro จะถูกส่งไปยัง V4.1-Flash ในอัตราของ Flash ระหว่างรอ V4.1-Pro หากแอปพลิเคชันพึ่งพาพฤติกรรมเฉพาะของรุ่น Pro ควรตรวจสอบโมเดลที่ให้บริการคำขอจริง ไม่ดูจากชื่อ alias เพียงอย่างเดียว 16
Studio Global AI
หน้านี้รวมคำตอบที่ได้รับการสนับสนุนจากแหล่งที่มาซึ่งคุณสามารถดำเนินการต่อภายใน Studio Global
DeepSeek V4.1 Flash รองรับบริบทสูงสุด 1 ล้านโทเคน แต่ขนาดบริบทที่รองรับไม่ได้รับประกันว่าจะค้นคืนทุกรายละเอียดได้แม่นยำ
DeepSeek V4.1 Flash รองรับบริบทสูงสุด 1 ล้านโทเคน แต่ขนาดบริบทที่รองรับไม่ได้รับประกันว่าจะค้นคืนทุกรายละเอียดได้แม่นยำ โมเดลใช้พารามิเตอร์ที่ทำงานราว 8 พันล้านตัวต่อโทเคนขณะอ่านอินพุต และ 16 พันล้านตัวต่อโทเคนขณะสร้างคำตอบ พร้อมลดขนาด KV cache ด้วย CSA2 และ FP4
DeepSeek รายงานว่า global KV cache เหลือ 890 ไบต์ต่อโทเคน และเปิดให้เรียกผ่าน API ชื่อ deepseek flash ทั้งนี้ ตัวเลขประสิทธิภาพเป็นผลที่ผู้พัฒนารายงาน