DeepSeek เปิดตัว DeepSeek V4 Flash Vision Exp เมื่อ 21 สิงหาคม 2026 เพิ่มความเข้าใจภาพให้ V4 Flash โดยคิดภาพไม่เกิน 384 โทเคนนำเข้าและใช้อัตราค่าบริการเดียวกับ Flash นักพัฒนาส่งภาพได้ 3 วิธี ได้แก่ Base64 แบบฝังในคำขอ, URL ภายนอก หรืออัปโหลดผ่าน Files API ฟรีเพื่อเรียกใช้ซ้ำด้วย file id เหมาะกับเอเจนต์ที่ต้องตรวจภาพ...
คำตอบการวิจัย

Create a landscape editorial hero image for this Studio Global article: What did DeepSeek’s August 21, 2026 launch of the V4-Flash-Vision-Exp multimodal vision API introduce, including its image-input methods, pr. Article summary: DeepSeek’s August 21 launch added experimental image understanding to its low-cost V4-Flash API, aiming to make DeepSeek agents able to perceive and act on screenshots and other visual state—not merely process text. It p. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
DeepSeek เปิดตัวโมเดลทดลอง deepseek-v4-flash-vision-exp บนแพลตฟอร์ม DeepSeek API เมื่อวันที่ 21 สิงหาคม 2026 โดยเพิ่มความสามารถเข้าใจภาพให้กับ V4-Flash นักพัฒนาจึงสามารถส่งคำสั่งที่มีทั้งข้อความและรูปภาพ เพื่อสร้างแอปที่วิเคราะห์ภาพหน้าจอ อินเทอร์เฟซ กราฟ หรือสถานะต่าง ๆ บนหน้าจอได้ในต้นทุนที่ต่ำลง 114
จุดขายสำคัญไม่ได้มีแค่การทำให้ AI “มองเห็น” แต่คือการคิดค่าประมวลผลภาพในอัตราเดียวกับ V4-Flash โดยภาพหนึ่งภาพถูกแปลงเป็นอินพุตไม่เกิน 384 โทเคน แทนที่จะมีค่าบริการด้านวิชันเพิ่มแยกต่างหาก 319
DeepSeek-V4-Flash-Vision-Exp รองรับอินพุตแบบผสมระหว่างภาพกับข้อความ และเรียกใช้งานผ่านอินเทอร์เฟซ Chat Completions, Messages และ Responses ได้ 412
รูปแบบนี้ทำให้โมเดลนำไปต่อยอดเป็นเอเจนต์ที่ทำงานเป็นลูปได้ เช่น ตรวจภาพหน้าจอในปัจจุบัน ตัดสินใจเลือกการทำงาน เรียกใช้เครื่องมือ แล้วตรวจหน้าจออีกครั้งเพื่อดูผลลัพธ์ การสาธิตที่มีการรายงานไว้ยังรวมถึงการสร้างโค้ดที่นำไปใช้งานได้จากภาพหน้าจอ และการใช้ข้อมูลภาพในเวิร์กโฟลว์สร้างเกม 510
นักพัฒนาสามารถส่งภาพให้โมเดลได้ 3 รูปแบบ
file_id ที่ได้รับไปอ้างอิงในคำขอครั้งต่อ ๆ ไป 6714Files API เปิดให้ใช้งานฟรี และเหมาะกับแอปที่ต้องอ้างอิงภาพเดิมซ้ำ ๆ เช่น เอเจนต์ที่ตรวจภาพหน้าจอชุดเดิมหลายรอบ การอัปโหลดครั้งเดียวแล้วเรียกผ่าน file_id ช่วยลดการส่งข้อมูลภาพซ้ำในทุกคำขอ และลดแบนด์วิดท์ของเวิร์กโฟลว์ได้ 112
DeepSeek ระบุว่า ภาพแต่ละภาพจะถูกแปลงเป็นโทเคนเพื่อใช้คำนวณค่าบริการ โดยมีเพดานสูงสุด 384 โทเคน และคิดตามอัตราอินพุตปกติของ V4-Flash ไม่มีค่าบริการวิชันแบบพรีเมียมแยกต่างหาก 3614
ตารางราคาที่เผยแพร่ไว้ระบุว่า ในช่วงราคาสูงสุด โมเดลวิชันคิดค่าบริการ 0.44 ดอลลาร์ต่อ 1 ล้านโทเคนอินพุตที่ไม่ถูกแคช และ 1.32 ดอลลาร์ต่อ 1 ล้านโทเคนเอาต์พุต นอกจากนี้ยังระบุหน้าต่างบริบท 1 ล้านโทเคน และเอาต์พุตสูงสุด 384,000 โทเคน 1
มีรายงานเปรียบเทียบว่าเพดาน 384 โทเคนนี้ต่ำกว่าการใช้โทเคนภาพของโมเดล GPT และ Claude บางรุ่นมากกว่าครึ่งหนึ่ง อย่างไรก็ตาม ตัวเลขดังกล่าวยังเป็นการเปรียบเทียบเชิงทิศทาง ไม่ใช่ผลทดสอบที่ปรับเงื่อนไขให้เท่ากันทั้งหมด เพราะข้อมูลที่มีไม่ได้ยืนยันรุ่นโมเดล ความละเอียดภาพ หรือสมมติฐานด้านราคาแบบเดียวกัน 327
ประโยชน์ที่เห็นได้ชัดกว่าการเทียบข้ามค่ายคือ เอเจนต์ที่ต้องตรวจภาพหน้าจอจำนวนมากสามารถควบคุมต้นทุนอินพุตภาพได้ง่ายขึ้น โดยไม่จำเป็นต้องใช้โมเดลมัลติโมดัลระดับพรีเมียมในทุกขั้นตอนของการทำงาน
DeepSeek ระบุว่าโมเดลใหม่ยังคงความสามารถด้านข้อความของ V4-Flash ทั้งการให้เหตุผล ความรู้ทั่วไป และการทำงานแบบเอเจนต์ พร้อมเพิ่มอินพุตภาพเข้ามา 626
บริษัทอ้างว่าโมเดลมีพัฒนาการอย่างมากในเกณฑ์ทดสอบเอเจนต์แบบมัลติโมดัล และทำผลงานเข้าใกล้ Claude Opus 4.8 โดยผลเปรียบเทียบบางชุดวางโมเดลไว้ใกล้กับ Opus 4.8 ในงานที่เลือกทดสอบ แต่ผลลัพธ์ยังแตกต่างกันไปตามเกณฑ์วัด 4192123
ดังนั้นคำว่า “ใกล้เคียง Opus 4.8” ควรอ่านว่าเป็นผลประเมินที่ DeepSeek รายงานเอง ไม่ใช่หลักฐานว่าโมเดลทั้งสองเทียบเท่ากันในงานเอเจนต์ด้านภาพทุกประเภท การทดสอบจากบุคคลที่สามยังจำเป็นเพื่อวัดความแม่นยำในการมองภาพ ความเสถียร และประสิทธิภาพการใช้เครื่องมือในสภาพแวดล้อมจริง
นักพัฒนาควรทดสอบการตั้งค่า reasoning ก่อนนำโมเดลไปใช้ในลูปที่ต้องตรวจภาพอย่างต่อเนื่อง มีรายงานการทดสอบภาคปฏิบัติว่า โทเคนสำหรับการคิดอาจใช้โควตา completion จนหมด ทำให้ไม่มีคำตอบที่มองเห็นได้ถูกส่งกลับ ผู้ทดสอบจึงแนะนำให้ปิด thinking ในงานด้านภาพที่เหมาะสม หรือเพิ่มค่า max_tokens เพื่อเหลือพื้นที่สำหรับคำตอบ 27
นี่เป็นข้อควรระวังด้านการติดตั้งใช้งาน ไม่ใช่ข้อสรุปว่าโมเดลไม่มีความสามารถ หากเปิดใช้การให้เหตุผล แอปควรเผื่อเอาต์พุตให้เพียงพอสำหรับทั้งกระบวนการภายในและคำตอบที่ผู้ใช้จะได้รับ พร้อมตรวจสอบพฤติกรรมและชื่อพารามิเตอร์ล่าสุดจากเอกสาร DeepSeek API ก่อนใช้งานจริง
จากหลักฐานที่มี DeepSeek ยังไม่ได้อธิบายเหตุผลเชิงกลยุทธ์อย่างเป็นทางการ แต่การออกแบบผลิตภัณฑ์ชี้ไปยังการใช้งานที่ชัดเจน นั่นคือการทำให้การรับรู้ภาพมีราคาถูกพอสำหรับการทำงานซ้ำ ๆ ของเอเจนต์ ไม่ว่าจะเป็นการตรวจภาพหน้าจอ เฟรมเกม แดชบอร์ด หรือสถานะของแอปพลิเคชันเป็นระยะ
การเปิดตัวเป็นรุ่นทดลองบน Flash ยังช่วยให้นักพัฒนานำความสามารถด้านภาพไปเติมในเวิร์กโฟลว์เอเจนต์และการเรียกใช้เครื่องมือที่มีอยู่เดิมได้ โดยไม่ต้องย้ายทั้งระบบไปยังบริการมัลติโมดัลระดับพรีเมียม จึงเหมาะกับผู้ที่กำลังพัฒนาเอเจนต์ควบคุมหน้าจอ เครื่องมือแปลงภาพหน้าจอเป็นโค้ด และแอปที่ต้องรับฟีดแบ็กจากภาพบ่อยครั้ง
สรุปแล้ว DeepSeek V4-Flash-Vision-Exp มีจุดเด่นที่เพดานการคิดโทเคนภาพ 384 โทเคนต่อภาพ วิธีรับภาพที่ยืดหยุ่น และราคาแบบ Flash ขณะที่คำกล่าวอ้างด้านประสิทธิภาพใกล้ Claude Opus 4.8 รวมถึงพฤติกรรมเมื่อใช้งานจริง ยังต้องผ่านการตรวจสอบเพิ่มเติม แนวทางเริ่มต้นที่เหมาะสมคือทดสอบด้วยภาพหน้าจอจริง กำหนดงบเอาต์พุตอย่างชัดเจน และมีการตรวจคุณภาพจากแหล่งอิสระ
Studio Global AI
หน้านี้รวมคำตอบที่ได้รับการสนับสนุนจากแหล่งที่มาซึ่งคุณสามารถดำเนินการต่อภายใน Studio Global
DeepSeek เปิดตัว DeepSeek V4 Flash Vision Exp เมื่อ 21 สิงหาคม 2026 เพิ่มความเข้าใจภาพให้ V4 Flash โดยคิดภาพไม่เกิน 384 โทเคนนำเข้าและใช้อัตราค่าบริการเดียวกับ Flash
DeepSeek เปิดตัว DeepSeek V4 Flash Vision Exp เมื่อ 21 สิงหาคม 2026 เพิ่มความเข้าใจภาพให้ V4 Flash โดยคิดภาพไม่เกิน 384 โทเคนนำเข้าและใช้อัตราค่าบริการเดียวกับ Flash นักพัฒนาส่งภาพได้ 3 วิธี ได้แก่ Base64 แบบฝังในคำขอ, URL ภายนอก หรืออัปโหลดผ่าน Files API ฟรีเพื่อเรียกใช้ซ้ำด้วย file id เหมาะกับเอเจนต์ที่ต้องตรวจภาพเดิมหลายครั้ง
โมเดลยังคงความสามารถด้านข้อความ การให้เหตุผล และการทำงานแบบเอเจนต์ของ V4 Flash แต่ควรจัดสรร max tokens ให้เพียงพอ เพราะมีรายงานว่าโหมด thinking อาจใช้โควตาคำตอบจนไม่เหลือข้อความส่งกลับ