DeepSeekと北京大学が2026年6月27日、推論高速化フレームワーク「DSpark」をオープンソースで公開。軽量な半自己回帰型ドラフトモデルが候補トークンを生成し、メインモデルが一括検証する「投機的復号」技術を採用[6][7][10]。 本番環境の実ユーザートラフィックにおいて、従来のMTP 1方式と比較して、V4 Flashは60〜85%、V4 Proは57〜78%の単一ユーザー生成速度向上を達成[4][6][7][9]。
研究の答え

Create a landscape editorial hero image for this Studio Global article: Search & fact-check with cited sources for What are the key details of DeepSeek's open-source DSpark speculative decoding framework released. Article summary: Here are the key details, fully sourced:. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
2026年6月27日、DeepSeekは北京大学との共同研究により、大規模言語モデル(LLM)の推論を高速化するためのオープンソースフレームワーク 「DSpark」 を公開しました。同時に、トレーニングと評価のためのフルスタックコードベース 「DeepSpec」 と、DSparkが統合されたDeepSeek-V4-FlashおよびV4-Proのモデルチェックポイントもリリースされています。
CEOの梁文鋒(Liang Wenfeng)氏が連名で発表した論文のタイトルは、『DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation』。DSparkは新しいベースモデルではなく、既存のモデルチェックポイントに「投機的復号(Speculative Decoding)」パイプラインを追加するモジュールです。
DSparkの核となるのは、軽量な半自己回帰型(semi-autoregressive)ドラフトモデルが素早く複数の候補トークンを生成し、それを本来のメインモデルが一括で検証するという手法です。従来のようにトークンを1つずつ生成する自己回帰方式と比較して、並列処理が可能になり大幅な速度向上が実現します。
特にDSparkが革新的なのは、「信頼度スケジューリング型投機的復号(Confidence-Scheduled Speculative Decoding)」 を導入した点です。システムは各トークン生成の確信度に応じて、次の推測数を動的に調整。これにより無駄な検証計算を減らし、効率を高めています。DeepSeek-V4では、従来のMTP-1(Multi-Token Prediction)方式に代わって本番環境に実装されました。
DSparkはすでにDeepSeek-V4の本番システム(V4-Flash preview、V4-Pro preview)で実際のユーザートラフィックを処理しており、以下の顕著な結果が出ています。
| モデル | 単一ユーザー生成速度の改善率 |
|---|---|
| DeepSeek-V4-Flash | 60%〜85%高速化 |
| DeepSeek-V4-Pro | 57%〜78%高速化 |
これらの数値はすべて実際のユーザーリクエストに基づくもので、合成ベンチマークではありません。従来のMTP-1方式と同一のシステムスループットで比較した場合の結果です。特に厳しいレイテンシ制約下では、DSparkは従来方式が直面するスループットの急激な低下(スループットクリフ)を回避し、これまで達成できなかった性能領域を実現。V4-Flashでユーザーあたり毎秒120トークンを目標としたテストでは、MTP-1が限界に近づく中、DSparkは名目上のスループットで661%ものアドバンテージを示しました。
DSparkはモデル非依存(model-agnostic) で設計されており、DeepSeek以外のアーキテクチャでも効果を発揮します。論文では、以下のような結果が報告されています。
DSparkと同時に公開された 「DeepSpec」 は、投機的復号モデルに特化したフルスタックのトレーニング・評価フレームワークです。これにより、開発者や研究者は以下のことが可能になります。
コードベースにはEagle3、DFlash、DSparkの実装が含まれており、論文・コード・モデル重みはすべてGitHub(deepseek-ai/DeepSpec)およびHugging Faceで公開されています。
2026年6月29日、DeepSeekは 「DeepSeek V4正式版」が2026年7月中旬にリリースされる と発表しました。これに伴い、APIに時間帯別料金(ピーク・オフピーク価格) が導入されます。
V4-Proの価格例(100万トークンあたり):
| 項目 | オフピーク | ピーク時(2倍) |
|---|---|---|
| 入力(キャッシュヒット) | 0.025 RMB | 0.05 RMB |
| 入力(キャッシュミス) | 3.00 RMB | 6.00 RMB |
| 出力 | 6.00 RMB | 12.00 RMB |
V4-Flashの価格例(100万トークンあたり):
| 項目 | オフピーク | ピーク時(2倍) |
|---|---|---|
| 入力(キャッシュヒット) | 0.02 RMB | 0.04 RMB |
| 入力(キャッシュミス) | 1 RMB | 2 RMB |
| 出力 | 2 RMB | 4 RMB |
DeepSeekはこの変更について、「リソースのより合理的な配分とサービスの安定性向上」を目的としていると説明しています。ユーザーには料金変更の24時間前にメールで通知されます。DSparkによる高速化とこの新たな価格体系は、約500億人民元(約1兆円)の大型資金調達後の商業化推進と、オープンソース戦略の継続を両立させる動きと見られています。
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
DeepSeekと北京大学が2026年6月27日、推論高速化フレームワーク「DSpark」をオープンソースで公開。軽量な半自己回帰型ドラフトモデルが候補トークンを生成し、メインモデルが一括検証する「投機的復号」技術を採用[6][7][10]。
DeepSeekと北京大学が2026年6月27日、推論高速化フレームワーク「DSpark」をオープンソースで公開。軽量な半自己回帰型ドラフトモデルが候補トークンを生成し、メインモデルが一括検証する「投機的復号」技術を採用[6][7][10]。 本番環境の実ユーザートラフィックにおいて、従来のMTP 1方式と比較して、V4 Flashは60〜85%、V4 Proは57〜78%の単一ユーザー生成速度向上を達成[4][6][7][9]。
モデル非依存の設計で、Qwen3シリーズやGemma4でもEagle3やDFlashを上回る性能を確認。2層のDSparkが5層のDFlashを凌駕するケースも[4][7][17]。