| $0.435 |
| $0.99 |
| $1.98 |
| オフピーク+128%、ピーク+355% |
| V4-Pro | 入力(キャッシュヒット) | $0.003625 | $0.03 | $0.06 | オフピーク+728%、ピーク+1,555% |
| V4-Pro | 出力 | $0.87 | $1.98 | $3.96 | オフピーク+128%、ピーク+355% |
特にV4-Proのキャッシュヒット入力は、従来の$0.003625からピーク時には$0.06へと約1,555%もの上昇となりました。DeepSeekはこの変更について「リソースをより効率的に配分し、緊急でないワークロードをオフピーク時間帯に計画することを促進するため」と説明しています
。
2026年8月、独立系テスト機関Composioは、DeepSeek V4 Flashを8種類の異なるエージェントオーケストレーションハーネスで評価しました。テストは、Gmail、GitHub、Slack、Google Sheetsなどのライブツールを操作する30の意図的に難易度の高いマルチステップワークフローで構成され、各タスクには900秒のタイムアウトが設定されました。
| ハーネス | 成功率(30タスク中) | 成功タスクあたりコスト |
|---|---|---|
| Pi Agent | 20/30 (66.7%) | $0.028 |
| Prime Agent | 約15/24(62.5%、有効実行) | $0.131 |
| OMP (Oh My Pi) | 17/30 (56.7%) | $0.103 |
| Claude Code | 16/30 (53.3%) | $0.195 |
| Codex | 16/30 (53.3%) | $0.081 |
| Deep Agents (LangChain) | 16/30 (53.3%) | $0.045 |
| Hermes Agent | 15/30 (50.0%) | $0.056 |
| OpenCode | 14/30 (46.7%) | $0.067 |
Pi Agentは成功率(20/30)とコスト効率(タスクあたり$0.028)の両方でトップでした。注目すべきは、成功率、コスト、速度の各指標で異なるハーネスが最優秀となった点です。これは、オーケストレーションの選択がモデル能力と同等以上に重要であることを示しています
。最高と最低のハーネス間で20ポイントもの差が生じたことは、エージェントフレームワーク、ツール設定、キャッシュ、リトライ、プロバイダースタックに対する極度の感度を示しています
。
価格上昇と実環境での不安定なパフォーマンスの組み合わせは、DeepSeek V4の企業導入に関するアナリストの見解を大きく変えました。
VentureBeatは、同一のV4 Flashモデルがハーネス、ツール、キャッシュスタックによって大きく異なる結果を生んだと指摘。企業はモデル選択と並行して、オーケストレーションの成熟度に投資する必要があると結論づけています。
オフピーク時でも、すべてのトークン種別で従来より高価になりました。アナリストは、特にカスタマーサポートエージェントやコード生成パイプラインなど、DeepSeekの低価格戦略に依存してきた大量処理ワークロードにおいて、ROIの計算が根本から変わると分析しています。
DeepSeekの公式エージェントベンチマーク(Terminal-Bench 2.1で82.7、Toolathlon-Verifiedで70.3)は強力に見えますが、実環境での53.8%という成功率は、リーダーボードのスコアがライブAPI、レート制限、ステートフルワークフローを伴う本番環境での信頼性を保証しないことを改めて示しています。
APIトラフィックは中国国内のサーバーを経由するため、規制産業の企業にとってはコンプライアンス上の課題が生じます。アナリストは、データガバナンス、監査証跡、ツール権限制御のための注意深いアーキテクチャ計画を推奨しています。規制産業にとっては、オープンウェイトのセルフホスティングのみが現実的な本番環境への道となります
。
BayTech Consultingのエンタープライズフレームワークは、DeepSeek V4を非機密文書の要約、公開リポジトリのコード生成、大量コンテンツ作成には推奨する一方、本番投入前のワークロード単位の厳格な評価を求めています。