Dilancarkan pada 21 Ogos 2026, DeepSeek V4 Flash Vision Exp ialah model API eksperimental yang mengekalkan keupayaan teks, penaakulan dan ejen V4 Flash sambil menambah input imej. Model ini menerima imej JPEG, PNG, GIF dan WebP melalui API Chat Completions serta Responses, sesuai untuk membaca tangkap layar, dokumen...
Research answer

Create a landscape editorial hero image for this Studio Global article: What is DeepSeek-V4-Flash-Vision-Exp, the experimental multimodal variant of DeepSeek’s V4-Flash text model, and how does its claimed perfor. Article summary: DeepSeek-V4-Flash-Vision-Exp is a newly released, API-only experimental multimodal version of DeepSeek V4-Flash: it retains the base model’s text/agent, reasoning, and world-knowledge functions while adding image underst. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
DeepSeek-V4-Flash-Vision-Exp ialah anggota pertama dalam barisan API V4-Flash yang menyokong penglihatan. Ia mengekalkan keupayaan teks, penaakulan, ejen dan pengetahuan dunia yang dilaporkan bagi V4-Flash, kemudian menambah kebolehan memahami imej untuk tugasan multimodal. DeepSeek menyifatkannya sebagai model eksperimental dan mendakwa prestasi ejen multimodalnya hampir dengan Claude Opus 4.8. Namun, bukti bebas yang ada masih belum mencukupi untuk menganggapnya sebagai keputusan muktamad dalam kedudukan model AI.
Model ini boleh dipanggil melalui API menggunakan pengecam deepseek-v4-flash-vision-exp. Nota pelancaran DeepSeek menyatakan keupayaan teksnya setanding dengan V4-Flash, termasuk ejen, penaakulan dan pengetahuan dunia, selain menunjukkan peningkatan besar pada penanda aras yang memerlukan pemahaman visual.
Perubahan paling penting ialah modaliti input. Model ini boleh memproses teks bersama imej JPEG, PNG, GIF atau WebP. Antara kegunaan yang didokumenkan ialah:
Ia bukan sekadar ciri soal jawab gambar. Dalam aliran kerja ejen, model boleh meneliti tangkap layar, carta, dokumen imbasan atau halaman web sebelum menentukan langkah seterusnya—contohnya memanggil alat, mengekstrak data atau menjalankan tugasan automasi.
DeepSeek menyenaraikan model ini sebagai pilihan untuk API Chat Completions dan Responses. Kedua-dua antara muka tersebut menerima deepseek-v4-flash-vision-exp sebagai ID model yang disokong.
Imej boleh dihantar menggunakan beberapa kaedah yang diterangkan dalam panduan penglihatan DeepSeek, termasuk data imej secara sebaris, URL luaran dan Files API. Dokumentasi Responses API turut menerangkan cara menghantar imej bersama model ini.
Sokongan ini menjadikan Vision Exp menarik untuk pembangun ejen. Ia boleh digunakan dalam sistem yang perlu menggabungkan teks, imej dan panggilan alat secara berselang-seli. DeepSeek juga mendokumentasikan integrasi Codex, dengan Vision Exp disenaraikan sebagai pilihan yang menambah sokongan input imej.
Nota keluaran DeepSeek menyatakan DeepSeek Harness 0.1.1 menambah sokongan untuk model tersebut. Namun, dokumentasi integrasi GitHub Copilot yang tersedia hanya menyebut V4 Pro dan V4 Flash dalam pemilih model, serta menerangkan pengendalian imej melalui model Copilot lain yang dipasang. Jadi, dokumen itu belum membuktikan bahawa Vision Exp boleh dipilih secara terus dalam antara muka tersebut.
Dakwaan utama DeepSeek ialah Vision Exp mengekalkan prestasi teks V4-Flash dan melonjak dengan ketara dalam penanda aras ejen multimodal—sehingga keupayaan ejen multimodalnya dikatakan hampir dengan Claude Opus 4.8.
Beberapa laporan sekunder turut memetik angka seperti skor Chartography 64.3, ApexBench Pass@1 sebanyak 36.5, Agents’ Last Exam sebanyak 27.3 dan ZeroBench Pass@5 sebanyak 35.0. Angka ini datang daripada liputan terhadap pengumuman DeepSeek, bukannya penilaian bebas yang lengkap dan mudah diulang merentas penyedia model.
Perbezaan ini penting. Frasa “hampir dengan Opus 4.8” tidak bermaksud Vision Exp mengatasi Claude secara keseluruhan, menyamai Claude dalam setiap tugasan atau menawarkan tahap kebolehpercayaan yang sama dalam pengeluaran. Sumber yang ada juga tidak menyediakan perbandingan neutral dengan arahan, persekitaran alat, kependaman, kadar kegagalan dan kos yang sama antara DeepSeek dan Anthropic.
Kesimpulan yang lebih selamat ialah DeepSeek memang telah melancarkan model API yang boleh memahami imej, dan keputusan yang dilaporkan syarikat itu menunjukkan peningkatan bermakna berbanding V4-Flash untuk tugasan yang bergantung pada input visual. Kedudukannya berbanding Claude, OpenAI, Google atau model AI China yang lain masih belum disahkan.
Senarai model yang tersedia menunjukkan harga Vision Exp sebanyak AS$0.22 bagi setiap sejuta token input dan AS$0.66 bagi setiap sejuta token output, dengan konteks sepanjang 1 juta token. Dokumentasi harga rasmi DeepSeek mengesahkan pengiraan berdasarkan sejuta token serta menyenaraikan
deepseek-v4-flash-vision-exp dalam jadual modelnya.
Imej ditukar kepada token untuk tujuan pengebilan API. Satu laporan yang memetik panduan DeepSeek menyatakan sebuah imej boleh menggunakan sehingga 384 token dan dikenakan berdasarkan struktur harga V4-Flash. Oleh itu, kos sebenar aliran kerja visual bergantung pada bilangan serta saiz imej, jumlah teks sekeliling, panjang jawapan dan konteks yang diulang.
Sebagai perbandingan, Anthropic menyenaraikan Claude Opus 4.8 pada AS$5 bagi setiap sejuta token input asas dan AS$25 bagi setiap sejuta token output. Anthropic turut menyediakan kadar berasingan untuk cache dan mod pantas.
Dari segi kadar token utama, DeepSeek jauh lebih murah. Itu alasan yang munasabah untuk mengujinya, tetapi bukan bukti bahawa jumlah kos keseluruhan pasti lebih rendah. Model murah yang memerlukan lebih banyak percubaan semula, melakukan kesilapan panggilan alat atau memerlukan prapemprosesan imej tambahan mungkin tidak menjimatkan kos apabila seluruh aliran kerja diambil kira.
Kedua-dua model mempunyai kegunaan yang bertindih, tetapi kedudukannya berbeza:
Strategi DeepSeek jelas: menawarkan pemahaman visual pada kategori model berharga rendah sambil mendakwa prestasi hampir model premium dalam tugasan ejen multimodal. Kelebihan Claude dalam perbandingan ini bukanlah bukti bahawa ia pasti mengatasi DeepSeek dalam setiap penanda aras, sebaliknya tahap kematangan, permukaan produk dan kedudukan platformnya lebih terbukti berdasarkan dokumentasi yang tersedia.
Perbandingan paling wajar dibuat mengikut tugasan. Untuk sistem membaca tangkap layar atau mengekstrak maklumat daripada carta, Vision Exp mungkin memberikan kualiti yang mencukupi dengan kos token yang jauh lebih rendah. Untuk ejen autonomi berisiko tinggi, soalan yang lebih penting ialah konsistensi, ketepatan penggunaan alat, tingkah laku penolakan, kebolehlihatan operasi, sokongan teknikal dan keupayaan pulih daripada kesilapan.
Penglihatan komputer semakin menjadi sebahagian daripada kerja ejen AI, bukan lagi ciri berasingan untuk menjawab soalan tentang gambar. Ejen pengekodan mungkin perlu membaca tangkap layar, ejen pelayar perlu memahami halaman web, manakala sistem perusahaan perlu menggabungkan dokumen, carta dan panggilan alat berstruktur.
Keluarga V4 DeepSeek memang menekankan konteks panjang dan beban kerja ejen. Dokumentasi V4 syarikat itu meletakkan Flash sebagai pilihan yang lebih pantas dan ekonomik dalam keluarga tersebut. Vision Exp meneruskan arah itu ke dunia ejen multimodal, bukannya memperkenalkan model yang hanya berfungsi untuk soalan imej.
Namun, bukti yang ada belum cukup untuk menyatakan DeepSeek mendahului Anthropic, OpenAI, Google atau makmal AI China yang lain. Tiada penilaian bebas dengan perbandingan setara merentas vendor dalam sumber yang diberikan, dan model API eksperimental tidak sama dengan model utama yang telah terbukti dalam penggunaan produksi.
Ya—tetapi dalam ujian yang terkawal.
Pembangun boleh membandingkan Vision Exp dengan Claude Opus 4.8 dan model produksi semasa menggunakan tugasan imej bersama alat yang sama. Ukur sekurang-kurangnya perkara berikut:
Buat masa ini, keputusan yang paling munasabah ialah berhati-hati tetapi positif: DeepSeek V4 Flash Vision Exp ialah eksperimen API multimodal yang nyata, didokumenkan dan mempunyai harga tersenarai yang menarik. Dakwaannya tentang prestasi ejen multimodal hampir Claude Opus 4.8 wajar diuji—tetapi belum patut diterima sebagai fakta yang telah disahkan secara bebas.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Dilancarkan pada 21 Ogos 2026, DeepSeek V4 Flash Vision Exp ialah model API eksperimental yang mengekalkan keupayaan teks, penaakulan dan ejen V4 Flash sambil menambah input imej.
Dilancarkan pada 21 Ogos 2026, DeepSeek V4 Flash Vision Exp ialah model API eksperimental yang mengekalkan keupayaan teks, penaakulan dan ejen V4 Flash sambil menambah input imej. Model ini menerima imej JPEG, PNG, GIF dan WebP melalui API Chat Completions serta Responses, sesuai untuk membaca tangkap layar, dokumen, carta dan aliran kerja imej bersama alat.
Senarai harga yang tersedia menunjukkan kadar AS$0.22 bagi setiap sejuta token input dan AS$0.66 bagi setiap sejuta token output, berbanding AS$5 dan AS$25 untuk Claude Opus 4.8.