Dilancarkan pada 21 Ogos 2026, DeepSeek V4 Flash Vision Exp menambah kefahaman imej kepada V4 Flash; setiap imej dikira sebagai maksimum 384 token input pada kadar harga Flash. Pembangun boleh menghantar imej melalui Base64 sebaris, URL awam atau rujukan file id daripada Files API percuma untuk mengurangkan penghant...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did DeepSeek’s August 21, 2026 launch of the V4-Flash-Vision-Exp multimodal vision API introduce, including its image-input methods, pr. Article summary: DeepSeek’s August 21 launch added experimental image understanding to its low-cost V4-Flash API, aiming to make DeepSeek agents able to perceive and act on screenshots and other visual state—not merely process text. It p. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
DeepSeek pada 21 Ogos 2026 melancarkan deepseek-v4-flash-vision-exp, model eksperimen yang menambah keupayaan memahami imej kepada API V4-Flash. Model ini menerima arahan bercampur teks dan imej, sekali gus memberi pembangun pilihan kos lebih rendah untuk membina ejen yang boleh memeriksa tangkap layar, antara muka, carta dan keadaan visual lain. 114
Tarikan utamanya ialah cara imej dibilkan: setiap imej ditukar kepada tidak lebih daripada 384 token input dan dikenakan kadar V4-Flash, tanpa caj premium khas untuk penglihatan. DeepSeek turut mendakwa prestasi ejen visualnya semakin menghampiri Claude Opus 4.8, tetapi perbandingan itu datang daripada keputusan yang dilaporkan syarikat sendiri dan belum dibuktikan melalui ujian bebas. 319
Model ini dipanggil menggunakan ID API deepseek-v4-flash-vision-exp. Ia menggabungkan input imej dan teks sambil mengekalkan asas penjanaan teks, penaakulan serta penggunaan alat daripada keluarga V4-Flash. Input visual boleh digunakan melalui antara muka Chat Completions, Messages dan Responses. 412
Ini bermakna ia bukan sekadar alat untuk menerangkan kandungan gambar. Dalam satu gelung kerja ejen, model boleh memeriksa tangkap layar, menentukan tindakan seterusnya, memanggil alat dan kemudian menilai semula skrin yang terhasil. Demonstrasi yang dilaporkan termasuk menjana kod boleh laku daripada tangkap layar serta menggunakan input visual dalam aliran kerja pembangunan permainan. 510
Pembangun mempunyai tiga pilihan untuk memasukkan imej:
file_id dalam permintaan seterusnya. 6714Files API disediakan secara percuma dan paling berguna apabila aplikasi perlu merujuk imej yang sama berkali-kali. Dengan menggunakan semula rujukan fail, aplikasi tidak perlu memuat naik data imej yang sama untuk setiap permintaan. Ini boleh mengurangkan penggunaan lebar jalur dalam aliran kerja ejen yang kerap memeriksa tangkap layar atau keadaan visual tertentu. 112
DeepSeek menyatakan setiap imej ditokenkan untuk tujuan bil pada had maksimum 384 token input. Token tersebut dikenakan kadar input V4-Flash biasa, jadi kefahaman imej tidak diletakkan dalam tingkat harga multimodal yang berasingan. 3614
Satu jadual harga yang diterbitkan menyenaraikan kadar waktu puncak sebanyak AS$0.44 bagi setiap sejuta token input tanpa cache dan AS$1.32 bagi setiap sejuta token output untuk model penglihatan ini. Jadual sama turut menyatakan konteks 1 juta token dan output maksimum 384,000 token. 1
Sesetengah laporan menggambarkan had 384 token itu sebagai kurang daripada separuh penggunaan token imej dalam beberapa perbandingan GPT dan Claude. Namun, dakwaan tersebut wajar dianggap sebagai perbandingan arah sahaja kerana sumber yang tersedia tidak menetapkan versi model, resolusi imej atau andaian bil yang sama. 327
Kesimpulan praktikalnya lebih jelas: ejen visual yang perlu memeriksa banyak tangkap layar boleh menanggung kos input imej yang lebih mudah dijangka pada kadar Flash, tanpa perlu menggunakan model multimodal premium untuk setiap pemerhatian.
DeepSeek berkata model baharu ini mengekalkan keupayaan teks V4-Flash, termasuk penaakulan, pengetahuan dunia dan fungsi ejen, sambil menambah input visual. 626
Syarikat itu juga melaporkan peningkatan besar dalam penanda aras ejen multimodal, sehingga prestasinya dikatakan hampir dengan Claude Opus 4.8. Beberapa perbandingan yang diterbitkan meletakkan model ini hampir dengan Opus 4.8 dalam tugasan terpilih, tetapi keputusan berbeza mengikut penanda aras. 4192123
Perbezaan ini penting. Frasa “hampir dengan Opus 4.8” pada masa ini harus dibaca sebagai dakwaan berdasarkan penilaian DeepSeek, bukannya bukti bahawa kedua-dua model setara dalam semua tugas ejen visual dunia sebenar. Ujian pihak ketiga masih diperlukan untuk menilai kebolehpercayaan, ketepatan visual dan prestasi penggunaan alat di luar keadaan ujian yang dilaporkan syarikat.
Pembangun perlu menguji tetapan penaakulan sebelum memasukkan model ini ke dalam gelung ejen visual untuk produksi. Satu ujian penggunaan yang dilaporkan mendapati token pemikiran boleh menggunakan keseluruhan bajet completion sehingga tiada jawapan yang kelihatan dipulangkan. Laporan sama mencadangkan agar mod pemikiran dimatikan untuk tugasan visual yang sesuai atau max_tokens ditingkatkan supaya model mempunyai ruang untuk menghasilkan respons. 27
Ini ialah isu pelaksanaan, bukan penilaian muktamad terhadap keupayaan model. Jika penaakulan diaktifkan, aplikasi perlu menyediakan kapasiti output yang mencukupi untuk proses dalaman dan jawapan kepada pengguna. Pembangun juga wajar menyemak dokumentasi API DeepSeek terkini bagi memastikan nama parameter dan tingkah laku semasa sebelum bergantung pada tetapan tertentu.
DeepSeek tidak memberikan penjelasan strategi rasmi dalam bukti yang tersedia. Namun, reka bentuk produk ini menunjukkan satu kegunaan yang jelas: menjadikan persepsi visual cukup murah untuk digunakan berulang kali oleh ejen. Tangkap layar, bingkai permainan, papan pemuka dan keadaan aplikasi hanya benar-benar berguna jika ejen boleh memeriksanya secara berkala tanpa menjadikan setiap pusingan terlalu mahal.
Dengan melancarkan penglihatan sebagai varian Flash eksperimen, pembangun boleh menambah input imej pada aliran kerja ejen dan pemanggilan alat yang sedia ada, bukannya memindahkan keseluruhan aplikasi kepada tingkat multimodal premium. Ini menjadikan model tersebut menarik untuk pembangun yang menghasilkan ejen berasaskan skrin, alat tangkap layar-ke-kod dan aplikasi yang memerlukan maklum balas visual dengan kerap.
Secara ringkas, DeepSeek V4-Flash-Vision-Exp menawarkan had token imej yang rendah menurut spesifikasi yang dinyatakan, di samping beberapa kaedah input yang fleksibel. Namun, dakwaan kelebihan penanda aras dan tingkah lakunya dalam produksi masih perlu diuji. Langkah permulaan yang munasabah ialah menjalankan ujian terkawal menggunakan tangkap layar sebenar, menetapkan bajet output dengan jelas dan membuat semakan kualiti secara bebas.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Dilancarkan pada 21 Ogos 2026, DeepSeek V4 Flash Vision Exp menambah kefahaman imej kepada V4 Flash; setiap imej dikira sebagai maksimum 384 token input pada kadar harga Flash.
Dilancarkan pada 21 Ogos 2026, DeepSeek V4 Flash Vision Exp menambah kefahaman imej kepada V4 Flash; setiap imej dikira sebagai maksimum 384 token input pada kadar harga Flash. Pembangun boleh menghantar imej melalui Base64 sebaris, URL awam atau rujukan file id daripada Files API percuma untuk mengurangkan penghantaran berulang.
DeepSeek mendakwa prestasi ejen multimodalnya menghampiri Claude Opus 4.8, namun dakwaan itu masih berdasarkan penilaian syarikat dan belum disahkan secara bebas.