DeepSeekは2026年8月21日、V4 Flashに画像理解を加えた実験モデル「deepseek v4 flash vision exp」をAPIで公開。画像は最大384入力トークンとして、V4 Flashと同じ料金で処理されます。 画像はBase64のインライン埋め込み、公開URL、無料のFiles APIによるfile id参照の3通りで送信可能。繰り返し同じスクリーンショットを使う処理では、Files APIで再アップロードを省けます。
研究の答え

Create a landscape editorial hero image for this Studio Global article: What did DeepSeek’s August 21, 2026 launch of the V4-Flash-Vision-Exp multimodal vision API introduce, including its image-input methods, pr. Article summary: DeepSeek’s August 21 launch added experimental image understanding to its low-cost V4-Flash API, aiming to make DeepSeek agents able to perceive and act on screenshots and other visual state—not merely process text. It p. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
DeepSeekは2026年8月21日、V4-Flash APIに画像理解を加えた実験的モデル deepseek-v4-flash-vision-exp を公開しました。テキストと画像を組み合わせたプロンプトに対応し、スクリーンショット、ユーザーインターフェース、グラフなどの視覚情報を扱うエージェントを、比較的低いコストで構築できるようにします。114
最大の特徴は、画像入力に別料金の「ビジョン・プレミアム」を設けていない点です。画像1枚は課金上、最大384入力トークンに変換され、V4-Flashの通常レートで処理されます。DeepSeekは視覚エージェント性能がClaude Opus 4.8に近づいたとも説明していますが、この比較は同社が報告した結果であり、独立した検証で確認されたものではありません。319
APIではモデルIDとして deepseek-v4-flash-vision-exp を指定します。V4-Flashファミリーのテキスト生成、推論、ツール利用を基盤に、画像とテキストを混在させた入力を受け付ける構成です。OpenAI互換のChat Completions、Messages、Responses形式のAPIに対応しています。412
単に画像を説明するだけのモデルではありません。たとえばエージェントは、画面のスクリーンショットを確認して次の操作を判断し、ツールを呼び出し、その結果として変化した画面を再び読み取る、といったループを組めます。報告されたデモでは、スクリーンショットから実行可能なコードを生成したり、画像情報をゲーム制作のワークフローに組み込んだりする例が示されました。510
開発者は、次の3通りで画像を入力できます。
file_id を後続のリクエストで参照する 6714Files APIは無料で利用できます。同じ画像を何度も参照するアプリケーションでは、画像データを毎回アップロードせずに済むため、継続的なエージェント処理で通信量を抑えられます。112
DeepSeekによると、画像は課金上、1枚あたり最大384入力トークンに変換されます。料金はV4-Flashの入力料金と同じで、画像専用の上乗せ料金はありません。3614
公開されている料金表の一例では、ビジョンモデルのピーク料金は、キャッシュされていない入力が100万トークンあたり 0.44ドル、出力が100万トークンあたり 1.32ドル とされています。コンテキストウィンドウは100万トークン、最大出力は38万4,000トークンです。1
一部の報道では、384トークンという上限は、GPTやClaudeの一部の比較対象が画像処理で使うトークン数の半分未満だと説明されています。ただし、提示された比較ではモデルのバージョン、画像解像度、課金条件が統一されているか確認できません。したがって、これは方向性を示す比較であり、厳密に正規化されたベンチマークとは言えません。327
それでも実用面での意味は明確です。スクリーンショットを何度も確認する視覚エージェントでは、観測のたびに高価なマルチモーダルモデルを呼び出すのではなく、Flash料金で予測しやすい画像入力コストに抑えられます。
DeepSeekは、新モデルについて、V4-Flashの推論、世界知識、エージェント機能などのテキスト能力を維持しながら、画像入力を追加したと説明しています。626
さらに同社は、マルチモーダル・エージェント向けベンチマークで大幅に性能が向上し、Claude Opus 4.8に近い水準になったと報告しています。公開された比較の一部ではOpus 4.8に近い数値が示される一方、ベンチマークによって差も見られます。4192123
ここは慎重に読む必要があります。「Opus 4.8に近い」という表現は、現時点ではDeepSeekの評価環境における主張です。実際の視覚エージェント運用で、両モデルの信頼性、画像認識の正確さ、ツール操作の安定性が同等だと証明したものではありません。第三者による検証が待たれます。
本番環境に視覚エージェントのループを組み込む前に、推論設定を必ずテストしたほうがよいでしょう。報告された実機検証では、thinkingモードの推論トークンがcompletionの予算を使い切り、画面に表示される回答が残らないケースがありました。同じ報告では、該当する視覚タスクでthinkingを無効にするか、モデルが回答を返せるよう max_tokens を増やす方法が推奨されています。27
これはモデル全体の能力を否定する話ではなく、統合時の実装上の注意点です。推論を有効にする場合は、内部推論とユーザー向けの最終回答の両方に十分な出力容量を割り当てる必要があります。特定の設定値やパラメーター名に依存する前に、DeepSeekの最新APIドキュメントで現在の挙動を確認してください。
提供された情報の中で、DeepSeekが正式な戦略的理由を説明しているわけではありません。ただ、製品設計からは、視覚認識を繰り返し使えるほど安価にするという狙いが読み取れます。スクリーンショット、ゲーム画面、ダッシュボード、アプリの状態は、エージェントが頻繁に確認できてこそ役立つからです。
ビジョン機能を実験的なFlash派生モデルとして提供することで、開発者は既存の低コストなエージェントやツール呼び出しの構成に画像入力を加えられます。アプリ全体を別の高価なマルチモーダルモデル向けに作り直す必要がない点も大きいでしょう。
特に、画面操作エージェント、スクリーンショットからのコード生成、頻繁な視覚フィードバックを必要とするアプリケーションにとって relevant なリリースです。
結論として、DeepSeek V4-Flash-Vision-Expは、画像1枚あたり最大384トークンという低い上限と、3種類の柔軟な画像入力方法を打ち出しました。一方で、ベンチマーク上の優位性や本番環境での挙動は、これから検証すべき段階です。開発者にとっては、現実的なスクリーンショットを使った小規模なテスト、十分な出力予算の設定、そして独立した品質確認から始めるのが堅実です。
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
DeepSeekは2026年8月21日、V4 Flashに画像理解を加えた実験モデル「deepseek v4 flash vision exp」をAPIで公開。画像は最大384入力トークンとして、V4 Flashと同じ料金で処理されます。
DeepSeekは2026年8月21日、V4 Flashに画像理解を加えた実験モデル「deepseek v4 flash vision exp」をAPIで公開。画像は最大384入力トークンとして、V4 Flashと同じ料金で処理されます。 画像はBase64のインライン埋め込み、公開URL、無料のFiles APIによるfile id参照の3通りで送信可能。繰り返し同じスクリーンショットを使う処理では、Files APIで再アップロードを省けます。
テキスト処理や推論、エージェント機能はV4 Flashの基盤を維持するとされる一方、視覚エージェント性能がClaude Opus 4.8に近いという評価は、現時点ではDeepSeekによる報告です。