DeepSeek V4 Flashは、V4ファミリーの低価格帯モデルで、高トラフィック・低レイテンシが要求されるワークロード向けに設計されています。MoEアーキテクチャを採用し、総パラメータ数は284B、1トークンあたりの活性化パラメータはわずか13Bです。 これは、広大な専門知識のプールにアクセスしつつ、高速で低コストな推論を実現することを意味します。
| 主な仕様 | 値 |
|---|---|
| 総パラメータ数 | 284B(DSparkドラフトモジュール込みで304B) |
| 活性化パラメータ数 | トークンあたり13B |
| アーキテクチャ | Mixture-of-Experts (MoE) |
| コンテキストウィンドウ | 100万トークン |
| 最大出力トークン数 | 384Kトークン |
| 精度 | FP4 + FP8 混合 |
| ライセンス | MIT |
| ダウンロードサイズ | 約160 GB |
出典:
V4 FlashとV4 Proはどちらも寛容なMITライセンスの下で公開されており、商用利用、改変、再配布がロイヤリティフリーで許可されています。 ウェイトはHugging Faceからダウンロードでき、プライベートインフラでセルフホスティングも可能です。V4シリーズは、同クラスのオープンウェイトモデルで、MITライセンスかつ100万トークンのコンテキストウィンドウをサポートする唯一のモデルファミリーです。
V4 Flashは、2つの新しいハイブリッドアテンションアーキテクチャにより、100万トークンのコンテキストウィンドウを実現しています。
モデルはCSAレイヤーとHCAレイヤーを交互に配置しています。レイヤー2以降の偶数レイヤーはCSA(4:1圧縮)、レイヤー3以降の奇数レイヤーはHCA(128:1圧縮)です。最新128トークンに対するスライディングウィンドウブランチは常に存在します。
メモリフットプリントを削減するため、モデルチェックポイントは混合精度量子化を採用しています。
nvidia/DeepSeek-V4-Flash-NVFP4というNVFP4バリアントも提供されています。FP8の場合、284Bモデルのウェイトだけで約284GBになります。100万トークンのコンテキストを完全にセルフホスティングするための推奨最小構成は、4x NVIDIA H200 SXM5(合計VRAM 564 GB)です。
DeepSeek V4 Flashは、開発者が推論モードを選択できるreasoning_effortパラメータを公開しています。
このパラメータにより、応答時間と推論の深さをトレードオフでき、単純な分類から高度なコード生成、マルチステップ計画まで、幅広いユースケースに適応できます。
DeepSeek V4 FlashのAPI料金は、入力トークン100万件あたり**$0.14**(キャッシュミス時)、出力トークン100万件あたり**$0.28です。 キャッシュヒット時(システムプロンプトや共通プレフィックスの繰り返し)は、100万トークンあたり$0.0028**と、実に98%も安くなります。
比較すると、V4 Flashの出力料金はSonnet 4.6($15/100万トークン)よりも54倍、GPT-5.5($30/100万トークン)よりも107倍も安価です。 複数の情報源が、これを「現時点で最安のフロンティアクラスAPI」と評しています。
7月31日のプロダクションリリース(V4-Flash-0731)では、アーキテクチャ変更ではなく再ポストトレーニングにより、エージェント・コーディング性能が大幅に向上しました。 公式アップデートログによると:
リリースノートには、このモデルが「エージェント・コーディングベンチマークにおいて、大規模な兄弟モデルV4-Proと同等の性能を発揮する」と記載されています。 これは、エージェントワークロードにおいて、従来のPro/Flashの性能ヒエラルキーが実質的にフラットになったことを意味します。
DeepSeekは、エージェントAIへの取り組みも積極的に進めています。2026年8月1日、同社はDeepSeek Harnessのクローズドベータテストに参加するオープンソース開発者の募集を開始しました。 このフレームワークは、LLMを自律的にタスクを実行し、コンテキストを管理し、ツールを呼び出すことができるAIエージェントへと変えるために設計されています。
Harnessという名前は、7月31日のV4-Flash-0731のチェンジログに「まもなくリリース予定」として初めて登場しました。 このチームは、Cui TianyiがDeepSeekに参加し、チームをゼロから構築した2026年3月に設立されました。
ベータテストに参加するには、Agent Harness関連のプロジェクト経験があり、GitHub IDと代表的な作品を提出する必要があります。
CEOのLiang Wenfengの下でのDeepSeekのアプローチは、AGIへの道筋として、安価で高性能なモデルを構築することに重点を置いています。 V4 Flashの料金体系($0.14/$0.28)とMITライセンスによるオープンウェイト戦略は、この哲学を最も明確に示すものです。ある情報源は、「V4-Flashの$0.28/100万トークンという出力価格は、GPT-5.5の約107分の1である」と指摘しています。
DeepSeekは、Alibaba(Qwenシリーズ)、ByteDance(Doubao)、Moonshot AI、MiniMax、Z.AIなど国内の競合と競争していますが、V4ファミリーは同クラスで寛容なMITライセンスの下で利用できる唯一のオープンウェイトモデルファミリーです。 また、複数の情報源がDeepSeekのIPO準備について言及していますが、具体的な日付や引受会社は確認されていません。
収集した情報は包括的ですが、以下の点は独立した確認ができませんでした。
これらの詳細は、より広範な業界レポートで確認できる可能性があり、追加の調査で明らかになるかもしれません。