Dirilis pada 21 Agustus 2026, DeepSeek V4 Flash Vision Exp menambahkan pemahaman gambar ke V4 Flash dan dilaporkan unggul atas Claude Opus 4.8 dalam 3 dari 11 perbandingan—tetapi hasilnya berasal dari laporan vendor,... Model ini dipanggil melalui API dengan ID deepseek v4 flash vision exp.
Jawaban penelitian

Create a landscape editorial hero image for this Studio Global article: What is DeepSeek’s experimental DeepSeek-V4-Flash-Vision-Exp model, released on August 21, 2026, how does it extend the existing V4-Flash te. Article summary: DeepSeek-V4-Flash-Vision-Exp is an experimental, API-only multimodal extension of DeepSeek’s V4-Flash model: it retains the base model’s text, reasoning, agent, and world-knowledge capabilities while adding image underst. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
DeepSeek-V4-Flash-Vision-Exp adalah perluasan multimodal eksperimental dari model DeepSeek V4-Flash. Dirilis pada 21 Agustus 2026, model ini menambahkan kemampuan memahami gambar ke kemampuan teks, penalaran, agen, dan pengetahuan umum yang sudah dimiliki V4-Flash. Model tersebut tersedia melalui API pengembang DeepSeek.
DeepSeek memosisikannya sebagai cara yang relatif murah untuk menambahkan kemampuan visual ke agen AI praktis. Perbandingannya dengan Claude Opus 4.8 dari Anthropic memang menarik perhatian, tetapi bukti benchmark yang tersedia masih terutama berasal dari laporan DeepSeek sendiri. Artinya, peluncuran ini penting bagi pengembang dan persaingan model AI, tetapi belum membuktikan kesetaraan luas dengan model unggulan Anthropic.
Perubahan utamanya adalah dukungan input visual. Pengembang dapat mengirim teks dan gambar secara bersamaan agar agen memahami foto, tangkapan layar, grafik, dokumen, serta materi visual lain yang didukung sebelum memberikan jawaban atau memanggil alat.
ID model yang digunakan dalam permintaan API adalah:
deepseek-v4-flash-vision-expDeepSeek menyatakan bahwa model ini mempertahankan kemampuan teks V4-Flash, termasuk penalaran, agen, dan pengetahuan umum. Changelog resminya mencantumkan skor seperti 83,9 pada Terminal Bench 2.1, 59,3 pada DeepSWE, dan 63,6 pada DSBench-Hard.
Dengan demikian, Vision-Exp bukan sekadar sistem untuk membuat keterangan gambar. Model ini dirancang untuk memperluas model berbasis teks dan agen ke alur kerja yang mengharuskan AI memahami isi layar atau gambar.
DeepSeek mengatakan Vision-Exp mendekati Claude Opus 4.8 dalam benchmark agen multimodal, sekaligus mempertahankan performa teks pada level V4-Flash. Dalam tabel perbandingan yang diterbitkan DeepSeek dan dilaporkan The Next Web, model tersebut unggul atas Opus 4.8 dalam 3 dari 11 benchmark.
Klaim itu perlu dibaca secara terbatas. Pernyataan “mendekati Opus 4.8” menggambarkan hasil pada kumpulan evaluasi yang dipilih DeepSeek, bukan bukti bahwa kedua model memiliki kualitas setara dalam setiap tugas visual, pekerjaan pemrograman, atau sesi agen yang berlangsung lama.
Changelog resmi DeepSeek juga mencantumkan sejumlah skor Vision-Exp, antara lain 36,5 pada ApexBench, 27,3 pada Agents’ Last Exam, 64,3 pada Chartography, dan 35,0 pada ZeroBench Pass@5.
Angka-angka tersebut belum menjawab pertanyaan penting untuk penggunaan produksi. Hasil benchmark dapat berubah bergantung pada prompt, lingkungan alat, jenis tugas, target latensi, penanganan kegagalan, dan metode evaluasi. Berdasarkan materi yang tersedia, bukti independen belum cukup untuk menjadikan perbandingan ini sebagai peringkat model yang definitif.
Klaim terkuat untuk penggunaan berbasis teks bukanlah dominasi baru, melainkan kesinambungan. DeepSeek memosisikan Vision-Exp sebagai model yang mempertahankan kemampuan teks V4-Flash, sehingga pengembang tidak harus kehilangan kemampuan penalaran dan perilaku agen yang sudah ada hanya demi memperoleh input gambar.
Perbedaan ini penting saat memilih model:
DeepSeek menyediakan Vision-Exp melalui platform API-nya. Rilis ini mendukung Chat Completions, Messages, dan Responses, termasuk input campuran teks dan gambar.
Gambar dapat dikirim melalui tiga cara:
file_id untuk gambar yang telah diunggah melalui Files API.Format gambar yang didukung adalah JPEG, PNG, GIF, dan WebP. Responses API juga menerima bagian konten
input_image dengan URL gambar, data URL berbasis base64, atau referensi file yang telah diunggah.
Input gambar diubah menjadi token yang ditagihkan. DeepSeek menyatakan bahwa setiap gambar menyumbang tidak lebih dari 384 token input, dengan struktur harga yang sama seperti V4-Flash.
Harga V4-Flash yang terkait dengan peluncuran ini adalah:
Batas 384 token membuat biaya bagian gambar dalam satu permintaan relatif mudah diperkirakan. Namun, batas ini tidak mencakup teks pendamping, pemanggilan alat, atau output yang dihasilkan. Satu interaksi agen secara keseluruhan tetap dapat menggunakan jauh lebih banyak token daripada gambar itu sendiri.
DeepSeek merilis Harness 0.1.1 dengan dukungan langsung untuk Vision-Exp. Hal ini relevan bagi pengembang yang membangun agen, bukan hanya mengajukan pertanyaan tentang satu gambar, karena Vision-Exp dirancang untuk bekerja dalam alur yang menggunakan berbagai alat.
Bersamaan dengan model tersebut, DeepSeek juga memperkenalkan Files API yang dapat digunakan secara gratis. Pengembang dapat mengunggah gambar sekali, lalu menggunakannya kembali dalam permintaan berikutnya dengan menyertakan file_id, tanpa perlu mengirim ulang data gambar yang sama. DeepSeek mendokumentasikan referensi file dalam format file-api-....
Referensi file yang dapat digunakan kembali bermanfaat ketika agen perlu memeriksa tangkapan layar, halaman dokumen, atau aset visual yang sama dalam beberapa giliran percakapan. Files API-nya gratis, tetapi inferensi model dan penggunaan token tetap dikenai biaya.
Vision-Exp menunjukkan bahwa persaingan AI kini tidak hanya ditentukan oleh kualitas model. Harga API, kemampuan multimodal, kompatibilitas, sistem file yang dapat digunakan kembali, dan perangkat pengembangan juga menjadi bagian penting dari paket yang ditawarkan kepada pengembang.
DeepSeek menghadirkan perluasan visual untuk lini Flash dengan tarif token yang sama seperti V4-Flash, sementara Opus 4.8 dari Anthropic menjadi pembanding kelas atas dalam laporan DeepSeek.
Namun, dampak praktis model ini akan lebih ditentukan oleh keandalannya dalam tugas seperti pemrograman berbasis tangkapan layar, analisis dokumen, agen antarmuka, dan penggunaan alat visual—bukan oleh satu tabel benchmark saja. Label “eksperimental” juga menjadi pengingat agar pengembang menguji alur kerja secara langsung sebelum menggunakannya untuk tugas produksi yang kritis.
Kesimpulan paling aman masih bersifat terukur: DeepSeek telah membuat penalaran visual berbiaya rendah lebih mudah diakses melalui ekosistem API yang sudah ada. Klaim benchmark awalnya menunjukkan tantangan yang berarti dalam sejumlah pengujian multimodal, tetapi evaluasi independen, keandalan di dunia nyata, dan adopsi pengembang dalam jangka panjang akan menentukan apakah Vision-Exp menjadi alternatif yang bertahan lama atau sekadar rilisan eksperimental yang menarik.
Studio Global AI
Halaman ini berisi jawaban yang didukung sumber yang dapat Anda lanjutkan di dalam Studio Global.
Dirilis pada 21 Agustus 2026, DeepSeek V4 Flash Vision Exp menambahkan pemahaman gambar ke V4 Flash dan dilaporkan unggul atas Claude Opus 4.8 dalam 3 dari 11 perbandingan—tetapi hasilnya berasal dari laporan vendor,...
Dirilis pada 21 Agustus 2026, DeepSeek V4 Flash Vision Exp menambahkan pemahaman gambar ke V4 Flash dan dilaporkan unggul atas Claude Opus 4.8 dalam 3 dari 11 perbandingan—tetapi hasilnya berasal dari laporan vendor,... Model ini dipanggil melalui API dengan ID deepseek v4 flash vision exp. Setiap gambar dibatasi hingga 384 token input yang ditagihkan, dan gambar dapat dikirim lewat base64, URL, atau referensi Files API.
DeepSeek turut merilis Harness 0.1.1 dan Files API gratis, sehingga pengembang lebih mudah membangun agen visual, menganalisis tangkapan layar, serta menggunakan kembali gambar dalam percakapan multi giliran.