API利用料金は入力100万トークンあたり0.14ドル、出力100万トークンあたり0.28ドルで、キャッシュ利用時は100万トークンあたり0.028ドルという低価格。これによりV4-Flashは、最も安価なフロンティアクラスの推論APIのひとつとなりました。比較対象のGemini 2.5 Flash(入力0.30ドル、出力2.50ドル)を大きく下回ります。
7月31日には再トレーニングされた「0731ビルド」が公開β版としてリリース。この0731ビルドは、大規模版のV4-Pro-Previewをエージェントベンチマークで上回る性能を示し、Terminal Bench 2.1で82.7、Cybergymで76.7を記録しています。モデルは標準・高・最高の3段階の推論モードに加え、高速パイプライン向けの非推論モードも設定可能。
MiniMaxは2026年7月31日、H3を投入。テキスト、画像、動画、音声を統一的に処理できる汎用マルチモーダル生成モデルと位置づけています。生成可能なのは最大2K解像度(2560×1440)・15秒・24fpsの動画で、同じ推論パス内でネイティブのステレオ音声も生成—別途音声パイプラインは不要です。
入力は最大9枚の画像+3本の動画クリップ+3つの音声トラックを同時に参照可能。MiniMaxは数日内にモデルウェイトを公開すると約束しており、多くの競合がプロプライエタリを維持する動画生成領域で、オープンウェイト路線をさらに推し進めます。同社によれば、2K解像度での1秒あたりのコストは主要競合の3分の1未満。
ByteDanceは2026年6月23日、自社イベント「Volcano Engine FORCE」でSeedance 2.5を発表。一般向けAPI公開は7月16日に開始。
最大の進化点は30秒のワンパス動画生成—短いセグメントをつなぎ合わせることなく、1回の生成で完全なクリップを出力します。解像度は最大4K(3840×2160)、10ビットカラー深度に対応。入力として、画像、音声クリップ、3Dホワイトモデル、スタイルフレーム、シーン指示など、最大50のマルチモーダル参照を受け付け可能(従来版は12)。
さらに、生成した動画の特定領域だけを編集できる「リージョンレベル編集」機能も搭載。用途は映画、広告、教育、製造業、さらには自動運転シミュレーションまで多岐にわたります。
7月31日に集中したこの3つのリリースには、共通の戦略的テーマが見えます。
当初の情報では、これら3モデルの投入日は2024年12月26日とされ、同時に中国のオープンソースモデルが世界ダウンロード数の41%を占めていることや、米国からのモデル蒸留疑惑にも言及がありました。しかし、提供された検索結果では2024年12月の日付も、これらの具体的な統計も確認できません。これらの主張は、より初期のDeepSeek-V3やQwenの出来事に関するものかもしれませんが、本分析の範囲では検証不能です。
| モデル | 投入日 | 主な仕様 |
|---|---|---|
| DeepSeek V4-Flash | プレビュー:2026年4月24日、公開β:2026年7月31日 | 284B MoE(13Bアクティブ)、100万コンテキスト、入力0.14ドル/100万トークン |
| MiniMax H3 | 2026年7月31日 | 15秒・2K動画、ネイティブステレオ音声、オープンウェイト予定 |
| ByteDance Seedance 2.5 | 発表:2026年6月23日、API公開:2026年7月16日 | 30秒ワンパス、4K、50マルチモーダル参照入力 |
DeepSeek V4-Flash、MiniMax H3、ByteDance Seedance 2.5の3モデルは、2026年半ばの中国AIセクターにおける協調的な加速を象徴しています。低コスト、オープンウェイト流通、そして飛躍的に長い生成能力が、その特徴です。