2026年8月21日に公開されたDeepSeek V4 Flash Vision Expは、V4 Flashの推論・エージェント機能を維持しながら画像理解を追加した実験的モデルです。DeepSeekの比較表では、Claude Opus 4.8を11項目中3項目で上回ったとされていますが、独立検証ではありません。 APIではモデルID deepseek v4 flash vision exp を指定します。画像は1枚あたり最大384入力トークンとして課金され、Base64、公開URL、Files APIのfile idで渡せます。
研究の答え

Create a landscape editorial hero image for this Studio Global article: What is DeepSeek’s experimental DeepSeek-V4-Flash-Vision-Exp model, released on August 21, 2026, how does it extend the existing V4-Flash te. Article summary: DeepSeek-V4-Flash-Vision-Exp is an experimental, API-only multimodal extension of DeepSeek’s V4-Flash model: it retains the base model’s text, reasoning, agent, and world-knowledge capabilities while adding image underst. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
DeepSeek-V4-Flash-Vision-Expは、DeepSeekのV4-Flashに画像理解を加えた実験的なマルチモーダルモデルです。2026年8月21日に公開され、従来のテキスト処理、推論、エージェント、世界知識に加えて、写真やスクリーンショット、図表、文書などの視覚情報を扱えるようになりました。DeepSeek APIから利用できます。
DeepSeekは、比較的安価に視覚機能をエージェントへ組み込めるモデルとして位置付けています。AnthropicのClaude Opus 4.8に近い性能という主張は目を引きますが、現時点で示されている根拠は主にDeepSeek自身の評価結果です。したがって、AIモデル競争における重要な一手とはいえるものの、Anthropicの最上位モデルと幅広い用途で同等だと結論づけるには、まだ検証が必要です。
最大の変更点は、テキストと画像を一緒に入力できるようになったことです。エージェントは、画像の内容を読み取ったうえで回答したり、ツールを呼び出したりできます。たとえば、画面上のエラー、グラフ、書類のページ、Webサイトのレイアウトなどを解析する用途が想定されます。
APIリクエストで指定するモデルIDは次のとおりです。
deepseek-v4-flash-vision-expDeepSeekによると、V4-Flashシリーズのテキスト能力、推論、エージェント機能、世界知識は維持されています。公式チェンジログでは、Terminal Bench 2.1で83.9、DeepSWEで59.3、DSBench-Hardで63.6という結果が示されています。
つまり、単なる画像キャプション生成モデルではありません。既存のテキスト・エージェントモデルを、画面や画像の内容を理解できるワークフローへ拡張することが狙いです。
DeepSeekは、Vision-ExpがV4-Flashのテキスト性能を保ちながら、マルチモーダルエージェント向けベンチマークでClaude Opus 4.8に近づいたと説明しています。The Next Webが報じたDeepSeekの比較表では、11項目中3項目でOpus 4.8を上回りました。
ただし、「Opus 4.8に近い」という表現は、DeepSeekが選んだ評価セット上での比較です。あらゆる画像理解、コーディング、長時間のエージェント処理で同等の品質を示すという意味ではありません。
公式チェンジログに掲載された主なVision-Expのスコアは以下のとおりです。
これらの数値だけでは、実際のサービス運用に重要な点までは分かりません。プロンプト、ツール環境、タスクの選び方、レイテンシー、失敗時の処理、評価方法によって結果は変わります。利用可能な情報の範囲では、今回の比較を決定的なモデルランキングとみなせるだけの第三者検証は確認できません。
テキスト中心の用途でDeepSeekが強調しているのは、明確な優位性というより、V4-Flashの能力を保ったまま画像入力を追加したという点です。
モデル選びでは、次のように考えると分かりやすいでしょう。
Vision-ExpはDeepSeekのAPIプラットフォームで利用できます。Chat Completions、Messages、Responsesに対応し、テキストと画像を組み合わせた入力を送信できます。
画像の指定方法は3種類です。
file_idで参照する対応形式はJPEG、PNG、GIF、WebPです。 Responses APIでは、
input_imageのコンテンツパートに画像URL、Base64データURL、またはFiles APIで取得したファイル参照を指定します。
画像入力は、請求対象となる入力トークンに変換されます。DeepSeekの説明では、画像1枚あたりの入力トークンは最大384で、料金体系はV4-Flashと同じです。
今回のリリースに関連して示されているV4-Flashの料金は、100万トークンあたり次のとおりです。
| 項目 | オフピーク | ピーク |
|---|---|---|
| キャッシュ未使用の入力 | 0.22ドル | 0.44ドル |
| キャッシュ使用時の入力 | 0.007ドル | 0.014ドル |
| 出力 | 0.66ドル | 1.32ドル |
1画像あたり384トークンという上限により、画像そのものの費用は見積もりやすくなっています。ただし、同時に送るテキスト、ツール呼び出し、モデルの出力は別に計上されます。エージェントによる一連の処理では、画像部分だけを見て総コストを判断しないことが重要です。
DeepSeekはVision-Expに標準対応したHarness 0.1.1を公開しました。 単発の画像質問ではなく、ツールを使って複数の処理を進めるエージェントを構築する開発者にとって意味のある追加です。
さらに、無料のFiles APIも提供開始されました。画像を一度アップロードしておけば、後続のリクエストでfile_idを渡して再利用できます。毎回同じ画像データを送信し直す必要がありません。
同じスクリーンショット、文書ページ、ビジュアル素材を複数ターンにわたって調べる場合に便利です。Files APIの利用自体は無料ですが、モデルの推論処理とトークン使用量は別途課金されます。
今回の発表は、モデルの最高性能だけでなく、マルチモーダル対応、APIの互換性、料金、ファイル再利用、エージェント向けツールを含む「開発者向けパッケージ」全体が競争の軸になっていることを示しています。DeepSeekは、V4-Flashと同じ公開トークン料金でFlashシリーズに視覚機能を加え、比較対象としてAnthropicのOpus 4.8を前面に出しました。
ただし、これは明確なフラッグシップ刷新というより、名前のとおり「Flash」かつ「Exp(Experimental、実験版)」のリリースです。中国系と米国系のAI企業が競うなかで、比較的安価な視覚推論をAPIに組み込む選択肢を広げた点に実務的な価値がありますが、最上位モデルの座を宣言するものではありません。
実際のインパクトを左右するのは、ベンチマーク表の一つの数字よりも、スクリーンショットを使ったコーディング、文書分析、UIエージェント、視覚的なツール操作で安定して動くかどうかです。実験版である以上、重要な本番処理に使う前に、自社のデータとツール環境で検証するべきでしょう。
現時点での妥当な結論は明確です。DeepSeekは既存のAPIエコシステムを通じて、低コストな視覚推論を利用しやすくしました。初期ベンチマークは、一部のマルチモーダル評価で有力モデルに挑戦できる可能性を示しています。しかし、Vision-Expが長く使われる代替モデルになるのか、注目を集める実験的リリースにとどまるのかは、独立評価、実運用での信頼性、そして開発者の継続的な採用にかかっています。
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
2026年8月21日に公開されたDeepSeek V4 Flash Vision Expは、V4 Flashの推論・エージェント機能を維持しながら画像理解を追加した実験的モデルです。DeepSeekの比較表では、Claude Opus 4.8を11項目中3項目で上回ったとされていますが、独立検証ではありません。
2026年8月21日に公開されたDeepSeek V4 Flash Vision Expは、V4 Flashの推論・エージェント機能を維持しながら画像理解を追加した実験的モデルです。DeepSeekの比較表では、Claude Opus 4.8を11項目中3項目で上回ったとされていますが、独立検証ではありません。 APIではモデルID deepseek v4 flash vision exp を指定します。画像は1枚あたり最大384入力トークンとして課金され、Base64、公開URL、Files APIのfile idで渡せます。
同時にHarness 0.1.1と無料のFiles APIも提供開始。同じ画像を複数回使う、スクリーンショットを読み続けるといったマルチターンのエージェント開発がしやすくなります。