OpenCodeで報告された「1日8兆トークン」は、単に一つのモデルが人気を集めたという話ではない。AIに依頼する仕事の単位が、短い質問への一回限りの回答から変わりつつあることを示している。
開発者がAIエージェントに求めるのは、リポジトリを読み、作業計画を立て、ファイルを編集し、プログラムやテストを実行し、エラーを確認して修正を繰り返すことだ。この一連のエージェント・ループでは、トークン消費が一問一答型のチャットとは桁違いになる。
OpenCodeは、DeepSeek V4 Flashが8月1日に8兆トークンを処理したと報告した。無料トライアルが5兆トークン、有料プラン「Go」が3兆トークンという内訳である。一方、複数モデルを扱う集約プラットフォームOpenRouterの7月27日〜8月2日の週間ランキングでは、同モデルは1週間で7.22兆トークンだった。これらは全世界の利用量を第三者が監査した数字ではなく、各プラットフォームの報告値である。ただし、エージェント利用が到達し得る規模を考える材料にはなる。
20
23
29
なぜエージェントは大量のトークンを使うのか
通常のチャットなら、入力は質問文、出力は回答文であり、やり取りの範囲は比較的限定される。対してコーディングエージェントは、ソースコード、ターミナル出力、テスト失敗のログ、過去の判断、生成したパッチ、ツール呼び出しの結果を抱えながら作業する。同じ文脈を再読込みし、修正と検証を何度も繰り返すこともある。
OpenCodeが公開しているV4 Flashのデータでは、平均セッションあたりの利用量は約1,200万トークン、入力キャッシュ比率は**95%**とされる。すべてのセッションが完全自律型のコーディング作業だと証明する数字ではないが、短文チャットよりも、長い文脈を持つ反復的な利用と整合的だ。
25
ここで大切なのは、利用者が欲しいのはトークンそのものではない点だ。価値があるのは、マージ可能なプルリクエスト、通るテストスイート、動く試作品、正しく完了した業務フローである。実務では、モデルを次のように評価するほうが実態に近い。
受け入れられる成果あたりのコスト = モデルとツールループの総コスト ÷ 必要水準を満たして完了する確率
この「総コスト」には、失敗した試行、再試行、人手でのレビュー、待ち時間、修正費用も含まれる。公表されている入力・出力トークン単価だけを見ても、十分ではない。
低価格なら、再試行も現実的になる
V4 Flashについては、ファーストパーティーAPIの公表価格として、入力100万トークン当たり0.14ドル、出力100万トークン当たり0.28ドルが報じられた。
12
価格が低ければ、より多くの反復、より広い文脈の維持、自動テストの追加実行を許容しやすくなる。これは「安いモデルが常に優れている」という意味ではない。エージェントが完了まで何ターンも必要とする定型的な仕事では、小さな品質差より大きな価格差のほうが、総コストを左右し得るということだ。
一例として、Artificial Analysis Intelligence Index v4.1では、V4 Flash Maxが50点、Claude Opus 4.8 Maxが56点だった一方、全評価スイートの実行コストはそれぞれ72.02ドル、3,752.55ドルと報じられた。スコア差は6点だが、評価コストには大きな開きがある。ただし、これは評価環境での比較であり、実世界における同等の信頼性を保証するものではない。
16
難易度が高い仕事や、失敗の影響が大きい仕事では、より高価なモデルのほうが、失敗デプロイ、人手監督、手戻りを大幅に減らせるなら、受け入れられる成果あたりでは安くなる場合がある。結論は「最安モデルを全用途に使う」ことではなく、求める品質に到達する総コストで仕事を振り分けることだ。
「DeepSeekのキルライン」が最も厳しく問うのは中価格帯
「DeepSeekのキルライン」という表現は、市場を説明するための比喩として捉えるべきだ。低価格でフロンティアに近い性能を持つ選択肢が現れたとき、それより大幅に高価なのに、明確に優れた成果を示せないモデルが受ける圧力を指す。
影響は大きく3層に分かれる。
- 低価格のルーティング向けモデル:分類、抽出、短い変換、大量の一次仕分けでは、最高度の推論より速度と最小の単価が優先される。引き続き役割がある。
- 最上位のフラッグシップモデル:長期にわたる複雑な推論、特に高い信頼性、マルチモーダル処理、ガバナンス要件、人手レビューが高コストな場面では価値を保つ。
- 中価格帯モデル:最も厳しい比較にさらされる。Flashよりかなり高価なら、単なる小幅なベンチマーク優位では足りない。完了率、レイテンシ、ツール利用、統合性、サポート、企業向け統制などで、総タスクコストを下げることを示す必要がある。
言い換えれば、低価格のエージェント向けモデルが標準的な「作業者」になり、最上位モデルは難題時の「エスカレーション先」になる可能性がある。その間にいるモデルは、自らが総コストを下げる理由を明確にしなければならない。
V4 Flashがエージェント規模の経済性を狙える理由
DeepSeek V4 Flashは、総パラメータ数2,840億、トークンごとに有効化されるパラメータ数は約130億のMixture-of-Experts(MoE)モデルで、100万トークンのコンテキスト長をサポートする。
17
この設計の要点は、モデル全体の容量と、1トークンを生成する際に実際に使う計算量を切り分けることにある。
- MoEルーティング:各トークンで専門家群の一部だけを有効化する。全パラメータを毎回動かす密なモデルと比べ、アクティブな計算量を抑えやすい。
17
- ハイブリッド・アテンション:V4ファミリーは、Compressed Sparse Attention(CSA)とHeavily Compressed Attention(HCA)を組み合わせる。非常に長い文脈で増大するアテンション計算とメモリー負荷の軽減を狙う設計だ。
17
33
- KVキャッシュ負荷の削減:NVIDIAは、V4ファミリーのアテンション技術について、引用されたV3.2との比較で、トークン当たり推論FLOPsを73%、KVキャッシュのメモリー負荷を90%削減することを目標にしていると説明する。
33
- キャッシュを前提にした運用:リポジトリやツールの文脈を重複して送るエージェントでは、キャッシュ再利用率が実コストを左右する。OpenCodeの95%という入力キャッシュ比率は、この運用上の要素の重要性を示す。
25
こうした仕様は単なる技術的な数字ではない。大きなコードベースを調べ、ツールを実行し、何度か失敗から回復してから結果を出すことを、費用面で現実的にできるかどうかを左右する。
次の競争軸は「能力・信頼性・追加1回の安さ」
ベンチマーク上の知能は重要だが、エージェントを評価する唯一の指標ではない。実用上は、次の3点を同時に見る必要がある。
- 能力:その種類の仕事を解けるか。
- 信頼性:高コストな介入なしに、受け入れ可能な結果をどの程度の頻度で出せるか。
- 追加反復の限界コスト:ツール呼び出し、修正、テスト、失敗からの復旧をもう1回行う費用を許容できるか。
1日8兆トークンという報告は、3つ目の要素を可視化した。AIが一問一答からエージェントへ移れば、トークン消費は桁違いに増える。長い文脈と再試行を低コストで扱えるモデルは、最難関ケースではより高性能なフラッグシップに譲るとしても、広範で反復的なエージェント業務の標準選択肢になり得る。
20
25
33