V4 Flash เป็นรุ่นที่เน้นประสิทธิภาพของตระกูล DeepSeek V4 เหมาะกับงานที่ต้องการความเร็ว หน่วงต่ำ และรองรับคำขอจำนวนมาก เช่น การสนทนา การสกัดข้อมูล การช่วยเขียนโค้ด และเวิร์กโฟลว์ของ AI Agent
โมเดลมีพารามิเตอร์ทั้งหมด 284 พันล้านตัว แต่เปิดใช้งานเพียง 13 พันล้านตัวต่อโทเคน ด้วยสถาปัตยกรรม MoE แนวคิดนี้ทำให้โมเดลมีคลังความรู้จากผู้เชี่ยวชาญหลายชุด ขณะเดียวกันก็ไม่จำเป็นต้องคำนวณทุกพารามิเตอร์ในทุกครั้งที่สร้างคำตอบ
| คุณสมบัติ | รายละเอียด |
|---|---|
| พารามิเตอร์รวม | 284B หรือ 304B หากนับโมดูล DSpark สำหรับร่างคำตอบล่วงหน้า |
| พารามิเตอร์ที่ใช้งาน | 13B ต่อโทเคน |
| สถาปัตยกรรม | Mixture-of-Experts (MoE) |
| ความยาวบริบท | 1 ล้านโทเคน |
| เอาต์พุตสูงสุด | 384K โทเคน |
| ความแม่นยำ | FP4 + FP8 แบบผสม |
| ใบอนุญาต | MIT License |
| ขนาดดาวน์โหลด | ประมาณ 160 GB |
ข้อมูลข้างต้นอ้างอิงจาก
จุดเด่นสำคัญของ V4 Flash คือการเผยแพร่ทั้งน้ำหนักโมเดลและใบอนุญาตแบบเปิด โดย DeepSeek V4 Flash และ V4 Pro ใช้ MIT License ซึ่งโดยทั่วไปอนุญาตให้ผู้พัฒนาดัดแปลง ใช้ในผลิตภัณฑ์เชิงพาณิชย์ และแจกจ่ายต่อได้โดยไม่ต้องจ่ายค่าลิขสิทธิ์
น้ำหนักโมเดลมีให้ดาวน์โหลดผ่าน Hugging Face และสามารถนำไปติดตั้งบนโครงสร้างพื้นฐานส่วนตัวได้ สำหรับองค์กร นั่นหมายถึงการควบคุมข้อมูลและสภาพแวดล้อมการรันโมเดลได้มากกว่าการเรียกใช้ API เพียงอย่างเดียว
แหล่งข้อมูลหลายแห่งระบุว่า DeepSeek V4 เป็นตระกูลโมเดลโอเพนเวตในระดับเดียวกันที่รองรับบริบท 1 ล้านโทเคนและใช้ใบอนุญาต MIT ที่มีเงื่อนไขค่อนข้างผ่อนปรน
การรองรับบริบทขนาด 1 ล้านโทเคนไม่ได้เกิดจากการเพิ่มหน่วยความจำเพียงอย่างเดียว แต่ DeepSeek ใช้สถาปัตยกรรม attention แบบผสมที่ประกอบด้วยสองกลไกหลัก
เลเยอร์ของโมเดลจะสลับการใช้ CSA และ HCA โดยเลเยอร์คู่ตั้งแต่เลเยอร์ที่ 2 ใช้ CSA ส่วนเลเยอร์คี่ตั้งแต่เลเยอร์ที่ 3 ใช้ HCA นอกจากนี้ยังมีหน้าต่างข้อมูลดิบ 128 โทเคนล่าสุดเพื่อรักษาความสามารถในการจับข้อมูลที่เพิ่งเกิดขึ้น
โมเดลใช้การจัดเก็บแบบผสมเพื่อลดขนาดไฟล์และการใช้หน่วยความจำระหว่างการอนุมาน
nvidia/DeepSeek-V4-Flash-NVFP4 หากจัดเก็บน้ำหนักทั้งหมดใน FP8 โมเดล 284B จะใช้พื้นที่ประมาณ 284 GB เฉพาะน้ำหนักเท่านั้น ส่วนการรันบริบทเต็ม 1 ล้านโทเคน แหล่งข้อมูลหนึ่งแนะนำการใช้ NVIDIA H200 SXM5 จำนวน 4 ตัว รวม VRAM 564 GB
ดังนั้น แม้ V4 Flash จะมีชื่อว่า “Flash” และมีพารามิเตอร์ที่ถูกเปิดใช้งานต่อโทเคนไม่มาก แต่การติดตั้งโมเดลเต็มรูปแบบยังเป็นงานระดับศูนย์ข้อมูลหรือผู้ให้บริการคลาวด์ ไม่ใช่การดาวน์โหลดไปรันบนคอมพิวเตอร์ทั่วไปโดยตรง
DeepSeek V4 Flash เปิดให้ผู้พัฒนากำหนดพารามิเตอร์ reasoning_effort เพื่อเลือกระดับความลึกของการอนุมานให้เหมาะกับงานและงบประมาณ
การตั้งค่านี้ช่วยให้ผู้พัฒนาปรับสมดุลระหว่างความเร็ว ค่าใช้จ่าย และคุณภาพของคำตอบได้ ตั้งแต่งานตอบคำถามง่าย ๆ ไปจนถึงการวางแผนหลายขั้นตอนและการเขียนโปรแกรมขั้นสูง
DeepSeek V4 Flash มีราคาผ่าน API ดังนี้
ราคาสำหรับอินพุตในแคชช่วยลดต้นทุนเมื่อระบบใช้ system prompt เดิมหรือคำนำหน้าคำสั่งซ้ำ ๆ โดยเฉพาะงานแชตและเอเจนต์ที่ต้องส่งบริบทเดิมกลับไปหลายครั้ง
เมื่อเทียบตามตัวเลขที่แหล่งข้อมูลรวบรวมไว้ เอาต์พุตของ V4 Flash มีราคาถูกกว่า Sonnet 4.6 ประมาณ 54 เท่า และถูกกว่า GPT-5.5 ประมาณ 107 เท่า จึงมีหลายแหล่งเรียก V4 Flash ว่าเป็นหนึ่งใน API ระดับ frontier ที่มีราคาถูกที่สุดในตลาด
เวอร์ชันผลิตจริง V4-Flash-0731 ไม่ได้เปลี่ยนสถาปัตยกรรมหรือขนาดโมเดลจากรุ่นพรีวิว แต่การปรับ post-training ใหม่ทำให้ความสามารถด้านงานเอเจนต์และการเขียนโค้ดดีขึ้นอย่างมีนัยสำคัญ
ตัวเลขจากบันทึกอัปเดตอย่างเป็นทางการที่มีการรายงาน ได้แก่
บันทึกการเปิดตัวระบุว่า V4 Flash รุ่นใหม่นี้ทำผลงานในระดับใกล้เคียงกับ V4 Pro รุ่นใหญ่กว่าในเบนช์มาร์กด้านเอเจนต์และการเขียนโค้ด นั่นทำให้การแบ่งภาพแบบเดิมว่า “Pro เก่งกว่า ส่วน Flash เน้นประหยัด” เริ่มไม่ชัดเจนเมื่อพูดถึงงานเอเจนต์โดยเฉพาะ
อย่างไรก็ตาม ตัวเลข SWE-bench ที่เจาะจงสำหรับ V4-Flash-0731 ยังไม่สามารถยืนยันได้จากบทความที่รวบรวมมา
นอกจากการพัฒนาโมเดลแล้ว DeepSeek กำลังขยับเข้าสู่ชั้นซอฟต์แวร์ที่ทำให้โมเดลทำงานเป็นเอเจนต์ได้จริง โดย DeepSeek Harness ถูกอธิบายว่าเป็นเฟรมเวิร์กสำหรับการรันเอเจนต์ ซึ่งทำงานนอกตัวโมเดลและรับผิดชอบการจัดการบริบท การเรียกใช้เครื่องมือ และการทำงานให้เสร็จสิ้น
เมื่อวันที่ 1 สิงหาคม 2026 DeepSeek เริ่มรับสมัครนักพัฒนาโครงการโอเพนซอร์สเข้าร่วมการทดสอบเบต้าแบบปิด ผู้สมัครต้องมีประสบการณ์กับโครงการที่เกี่ยวข้องกับ Agent Harness และส่ง GitHub ID พร้อมผลงานตัวอย่าง
ชื่อ Harness ปรากฏครั้งแรกในบันทึกการเปลี่ยนแปลงของ V4-Flash-0731 เมื่อวันที่ 31 กรกฎาคม พร้อมข้อความว่า “จะเปิดตัวเร็ว ๆ นี้” ส่วนทีมวิศวกรรม Harness มีข้อมูลว่าเริ่มก่อตั้งในเดือนมีนาคม 2026 หลัง Cui Tianyi เข้าร่วม DeepSeek เพื่อสร้างทีมขึ้นมา
ขณะนี้ยังไม่มีการยืนยันวันเปิดตัวสู่สาธารณะของ DeepSeek Harness
ทิศทางของ DeepSeek ภายใต้การนำของ Liang Wenfeng มักถูกอธิบายว่าให้ความสำคัญกับการสร้างโมเดลที่มีความสามารถสูงในต้นทุนต่ำ เพื่อมุ่งสู่เป้าหมายด้าน AGI
V4 Flash สะท้อนแนวคิดดังกล่าวผ่านสององค์ประกอบที่เห็นได้ชัด คือราคาการใช้งาน API ที่ $0.14/$0.28 ต่อ 1 ล้านโทเคน และการเปิดน้ำหนักโมเดลภายใต้ MIT License หากโมเดลมีประสิทธิภาพเพียงพอสำหรับงานเขียนโค้ดและเอเจนต์ ต้นทุนที่ต่ำลงอาจทำให้บริษัทต่าง ๆ นำ AI ไปใส่ในกระบวนการทำงานจำนวนมากขึ้น โดยไม่ต้องมองการเรียกโมเดลแต่ละครั้งเป็นค่าใช้จ่ายระดับพรีเมียม
ในจีน DeepSeek ต้องแข่งขันกับ Alibaba และตระกูล Qwen, ByteDance และ Doubao, Moonshot AI, MiniMax รวมถึง Z.AI จุดยืนที่แตกต่างของตระกูล V4 คือการเป็นโมเดลโอเพนเวตในระดับเดียวกันที่เปิดภายใต้ใบอนุญาต MIT ซึ่งเอื้อต่อการนำไปปรับแต่งและใช้งานต่อยอดมากกว่า API แบบปิด
มีรายงานหลายแหล่งกล่าวถึงการเตรียมความพร้อมสำหรับ IPO ของ DeepSeek แต่ยังไม่มีการยืนยันกำหนดการ ผู้จัดจำหน่ายหลักทรัพย์ หรือรายละเอียดการยื่นไฟลิงอย่างเป็นทางการ
แม้ข้อมูลที่รวบรวมมาจะครอบคลุมทั้งตัวโมเดล ราคา และ Harness แต่ยังมีรายละเอียดบางส่วนที่ไม่ควรสรุปเกินหลักฐานที่มี ได้แก่
DeepSeek V4 Flash ไม่ได้โดดเด่นเพียงเพราะมีพารามิเตอร์รวม 284 พันล้านตัว แต่เพราะนำหลายองค์ประกอบมารวมกันในแพ็กเกจเดียว ได้แก่ น้ำหนักโมเดลแบบเปิดภายใต้ MIT License, บริบท 1 ล้านโทเคน, การคำนวณแบบ MoE, ความแม่นยำ FP4/FP8, โหมดการให้เหตุผลที่ปรับได้ และราคาการใช้งาน API ที่ต่ำมาก
การเปิดตัว DeepSeek Harness ยังสะท้อนว่า DeepSeek ไม่ได้มองการแข่งขันเฉพาะที่ระดับโมเดล แต่กำลังพยายามสร้างเครื่องมือสำหรับให้โมเดลลงมือทำงานจริงด้วย หากเฟรมเวิร์กนี้เปิดตัวและทำงานได้ตามเป้าหมาย นักพัฒนาอาจมีทางเลือกใหม่สำหรับสร้าง AI Agent ที่มีต้นทุนต่ำและปรับแต่งได้มากขึ้น