Diluncurkan pada 21 Agustus 2026, DeepSeek V4 Flash Vision Exp menambahkan pemahaman gambar ke V4 Flash. Pengembang dapat mengirim gambar melalui Base64, URL publik, atau Files API yang dapat digunakan ulang secara gratis—berguna untuk agen yang berulang kali memeriksa tangkapan layar atau kondisi visual.
Jawaban penelitian

Create a landscape editorial hero image for this Studio Global article: What did DeepSeek’s August 21, 2026 launch of the V4-Flash-Vision-Exp multimodal vision API introduce, including its image-input methods, pr. Article summary: DeepSeek’s August 21 launch added experimental image understanding to its low-cost V4-Flash API, aiming to make DeepSeek agents able to perceive and act on screenshots and other visual state—not merely process text. It p. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
DeepSeek pada 21 Agustus 2026 merilis deepseek-v4-flash-vision-exp, model eksperimental yang menambahkan kemampuan memahami gambar ke API V4-Flash. Model ini menerima perintah gabungan berupa teks dan gambar, sehingga pengembang memiliki opsi berbiaya lebih rendah untuk membangun agen yang dapat memeriksa tangkapan layar, antarmuka, grafik, hingga kondisi visual lain. 114
Daya tarik utamanya ada pada cara gambar dihitung. Setiap gambar dikonversi menjadi maksimal 384 token input dan ditagihkan dengan tarif V4-Flash, tanpa biaya tambahan khusus untuk kemampuan vision. DeepSeek juga mengklaim performa agen visualnya sudah mendekati Claude Opus 4.8. Namun, perbandingan tersebut berasal dari hasil yang dilaporkan perusahaan dan belum dikonfirmasi melalui pengujian independen. 319
Model ini dipanggil menggunakan identitas API deepseek-v4-flash-vision-exp. Fungsinya menggabungkan input gambar dan teks, sembari mempertahankan fondasi V4-Flash untuk pembuatan teks, penalaran, penggunaan alat, dan alur kerja agen. Prompt multimodal tersebut dapat digunakan melalui antarmuka Chat Completions, Messages, maupun Responses. 412
Artinya, fitur ini bukan sekadar alat untuk membuat deskripsi gambar. Sebuah agen dapat menjalankan siklus kerja visual: memeriksa tangkapan layar, menentukan tindakan, memanggil alat, lalu menganalisis kembali layar setelah tindakan dilakukan. Demonstrasi yang dilaporkan mencakup pembuatan kode yang dapat dijalankan dari tangkapan layar serta penggunaan input visual dalam alur kerja pembuatan gim. 510
Pengembang memiliki tiga pilihan untuk memasukkan gambar:
file_id pada permintaan berikutnya. 6714Files API tersedia secara gratis dan paling praktis untuk aplikasi yang berulang kali menggunakan gambar yang sama. Dengan merujuk pada file_id, pengembang tidak perlu mengunggah ulang data gambar dalam setiap permintaan. Cara ini dapat mengurangi kebutuhan bandwidth dalam alur kerja agen yang terus memeriksa tangkapan layar atau kondisi visual tertentu. 112
DeepSeek menyatakan bahwa setiap gambar ditokenisasi untuk keperluan penagihan dengan batas maksimal 384 token input. Token tersebut dikenai tarif input V4-Flash biasa, sehingga pemahaman gambar tidak masuk ke tingkat harga vision premium yang terpisah. 3614
Salah satu tabel harga yang dipublikasikan mencantumkan tarif periode sibuk sebesar $0,44 per satu juta token input yang tidak tersimpan dalam cache dan $1,32 per satu juta token output untuk model vision ini. Tabel tersebut juga mencantumkan jendela konteks satu juta token dan output maksimum 384.000 token. 1
Sejumlah laporan menyebut batas 384 token itu kurang dari setengah penggunaan token gambar pada beberapa perbandingan GPT dan Claude. Angka tersebut sebaiknya dipahami sebagai gambaran arah, bukan perbandingan yang sepenuhnya setara, karena bukti yang tersedia tidak menetapkan versi model, resolusi gambar, maupun asumsi penagihan yang identik. 327
Manfaat praktisnya lebih mudah terlihat daripada perbandingan lintas penyedia. Agen visual yang harus memeriksa banyak tangkapan layar dapat memperoleh biaya input gambar yang lebih kecil dan lebih mudah diprediksi dengan tarif Flash, alih-alih menggunakan model multimodal premium pada setiap putaran observasi.
DeepSeek menyatakan bahwa model baru ini mempertahankan kemampuan teks V4-Flash, termasuk penalaran, pengetahuan umum, dan fungsi agen, sembari menambahkan input visual. 626
Perusahaan juga melaporkan peningkatan besar pada tolok ukur agen multimodal, dengan performa yang disebut mendekati Claude Opus 4.8. Beberapa perbandingan yang dipublikasikan memang menempatkan model tersebut dekat dengan Opus 4.8 pada tugas tertentu, tetapi hasilnya dapat berbeda di antara tolok ukur. 4192123
Perbedaan antara klaim dan bukti ini penting. Pernyataan “mendekati Opus 4.8” untuk saat ini harus dibaca sebagai klaim berdasarkan evaluasi DeepSeek, bukan bukti bahwa kedua model setara dalam seluruh beban kerja agen visual di dunia nyata. Pengujian independen masih diperlukan untuk menilai keandalan, ketepatan visual, dan kemampuan menggunakan alat di luar konfigurasi pengujian perusahaan.
Pengembang sebaiknya menguji pengaturan penalaran sebelum memasukkan model ini ke dalam loop visual produksi. Dalam uji penggunaan yang dilaporkan, token thinking dapat menghabiskan seluruh anggaran completion sehingga tidak ada jawaban yang terlihat. Laporan yang sama menyarankan agar thinking dinonaktifkan untuk tugas visual tertentu atau max_tokens ditingkatkan agar model memiliki ruang untuk memberikan respons. 27
Ini merupakan catatan implementasi, bukan penilaian menyeluruh terhadap kemampuan model. Jika penalaran diaktifkan, aplikasi perlu menyediakan kapasitas output yang cukup untuk proses penalaran internal sekaligus jawaban yang akan ditampilkan kepada pengguna. Tim juga sebaiknya memeriksa dokumentasi API DeepSeek terbaru sebelum mengandalkan nama parameter atau perilaku pengaturan tertentu.
Bukti yang tersedia tidak memuat penjelasan strategis formal dari DeepSeek. Namun, desain produknya menunjukkan sasaran yang cukup jelas: membuat persepsi visual cukup murah untuk digunakan berulang kali oleh agen. Tangkapan layar, bingkai gim, dasbor, dan kondisi aplikasi hanya benar-benar berguna bagi agen jika dapat diperiksa secara rutin tanpa membuat setiap putaran kerja menjadi terlalu mahal. 356
Dengan meluncurkan vision sebagai varian eksperimental Flash, DeepSeek juga memungkinkan pengembang menambahkan input gambar ke alur kerja agen dan pemanggilan alat yang sudah ada. Mereka tidak harus memindahkan seluruh aplikasi ke tingkat multimodal premium yang terpisah.
Karena itu, rilis ini paling relevan bagi pengembang yang membuat agen berbasis layar, alat konversi tangkapan layar menjadi kode, serta aplikasi yang memerlukan umpan balik visual secara berkala. Kesimpulannya cukup sederhana: DeepSeek V4-Flash-Vision-Exp menawarkan batas token gambar yang rendah dan metode input yang fleksibel, sementara keunggulan benchmark serta perilakunya dalam produksi masih perlu diuji. Titik awal yang masuk akal adalah pengujian terkontrol dengan tangkapan layar nyata, anggaran output yang eksplisit, dan pemeriksaan kualitas secara independen.
Studio Global AI
Halaman ini berisi jawaban yang didukung sumber yang dapat Anda lanjutkan di dalam Studio Global.
Diluncurkan pada 21 Agustus 2026, DeepSeek V4 Flash Vision Exp menambahkan pemahaman gambar ke V4 Flash.
Diluncurkan pada 21 Agustus 2026, DeepSeek V4 Flash Vision Exp menambahkan pemahaman gambar ke V4 Flash. Pengembang dapat mengirim gambar melalui Base64, URL publik, atau Files API yang dapat digunakan ulang secara gratis—berguna untuk agen yang berulang kali memeriksa tangkapan layar atau kondisi visual.
DeepSeek menyebut kemampuan agen visualnya mendekati Claude Opus 4.8, tetapi klaim tersebut masih berasal dari pengujian perusahaan.