DeepSeek 與北京大學於 2026 年 6 月 27 日聯合發表論文與開源推測解碼框架 DSpark,並同步釋出 DeepSpec 全棧訓練與評估程式碼庫。 DSpark 不是全新模型,而是在 DeepSeek V4 Flash 與 V4 Pro 的既有檢查點(checkpoint)上附加推測解碼模組,透過輕量級草稿模型先行生成候選 token,再由主模型批量驗證,大幅加速推理。
研究答案

Create a landscape editorial hero image for this Studio Global article: Search & fact-check with cited sources for What are the key details of DeepSeek's open-source DSpark speculative decoding framework released. Article summary: Here are the key details, fully sourced:. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
2026 年 6 月 27 日,DeepSeek 攜手北京大學正式開源 DSpark──這是一套專為大型語言模型(LLM)推理加速而設計的推測解碼(speculative decoding)框架。與此同時,團隊也釋出了完整的全棧訓練與評估程式碼庫 DeepSpec,以及整合 DSpark 的 DeepSeek-V4-Flash 與 V4-Pro 模型檢查點 。由 DeepSeek 創辦人梁文鋒署名、與北京大學共同發表的論文《DSpark:基於半自回歸生成的信心調度推測解碼》(DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation)亦同步公開 。
DSpark 並非一個全新的基礎模型。它是一個附加模組,能為現有模型檢查點加入推測解碼流程 。核心機制是:一個輕量級的半自回歸草稿模型(draft model)快速生成一系列候選 token,再由主要模型(target model)對這些候選 token 進行批量驗證──而非逐個 token 逐一生成。這種方法稱為推測解碼,最早由 Google Research 於 2023 年提出,後續由 SpecInfer、Medusa、EAGLE 等框架持續優化 。
DSpark 引入的全新元素是信心調度推測解碼(confidence-scheduled speculative decoding)。系統會根據模型對每個候選 token 的信心水準,動態決定要推測多少個 token,從而減少驗證階段不必要的算力浪費 。這套機制已取代 DeepSeek-V4 原先在生產環境中使用的 MTP-1(Multi-Token Prediction)方案 。
DSpark 目前已部署在 DeepSeek-V4 的生產系統中,承接來自 DeepSeek-V4-Flash preview 與 DeepSeek-V4-Pro preview 服務的真實用戶流量 。在系統總吞吐量不變的前提下,與先前的 MTP-1 基準相比,DSpark 為每位使用者帶來的生成速度提升如下:
| 模型 | 單用戶生成速度提升 |
|---|---|
| DeepSeek-V4-Flash | 60% 至 85% |
| DeepSeek-V4-Pro | 57% 至 78% |
這些數據來自真實的線上用戶流量,而非合成基準測試 。在嚴格的互動延遲限制下,DSpark 能避免先前方案常出現的吞吐量急遽下滑,將整個服務系統的效能邊界(Pareto frontier)向外推展 。在一項針對 V4-Flash 設定每秒每用戶 120 個 token 的測試中,MTP-1 已接近其承載極限,而 DSpark 的標稱吞吐優勢高達 661% 。
DSpark 被設計為模型通用(model-agnostic)的架構。論文顯示其在非 DeepSeek 模型上也同樣有效:在 Qwen3-4B、Qwen3-8B 與 Qwen3-14B 上,DSpark 的巨觀平均接受長度(macro-average accepted length)分別比 Eagle3 基準高出 30.9%、26.7% 與 30.0% ;與並行草稿模型 DFlash 相比,則分別提升 16.3%、18.4% 與 18.3% 。在 Gemma4-12B 上,DSpark 同樣保持領先 。值得注意的是,僅使用 2 層設定的 DSpark,其表現超越了 5 層設定的 DFlash 。
將推測長度(draft length)從 4 個 token 擴展到 16 個 token,每次迭代的延遲僅增加 0.2% 至 1.3%,但接受長度卻能改善多達 30% 。
除 DSpark 外,DeepSeek 還開源了 DeepSpec,這是一套全棧的推測解碼訓練與評估框架。其中包含了 Eagle3、DFlash 和 DSpark 的實作,讓開發者與研究人員能夠:
論文、程式碼與模型權重已託管於 GitHub 上的 deepseek-ai/DeepSpec 倉庫,以及 Hugging Face 。
2026 年 6 月 29 日,DeepSeek 宣布 DeepSeek V4 正式版預計於 2026 年 7 月中旬推出 。伴隨正式版發布,DeepSeek 將導入峰谷(依時段)API 定價結構 :
對於 V4-Flash,相應的高峰定價同樣從離峰價格翻倍:快取命中從 0.02 元漲至 0.04 元,快取未命中從 1 元漲至 2 元,輸出則從 2 元漲至 4 元 。DeepSeek 表示,此項調整旨在「更合理地配置資源、提升服務穩定性」。用戶將在計費變更生效前 24 小時收到電子郵件通知 。這項價格變動,連同 DSpark 帶來的速度提升,顯示 DeepSeek 正努力在商業化變現(繼其約 500 億元人民幣融資之後)與持續積極開源之間取得平衡 。
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
DeepSeek 與北京大學於 2026 年 6 月 27 日聯合發表論文與開源推測解碼框架 DSpark,並同步釋出 DeepSpec 全棧訓練與評估程式碼庫。
DeepSeek 與北京大學於 2026 年 6 月 27 日聯合發表論文與開源推測解碼框架 DSpark,並同步釋出 DeepSpec 全棧訓練與評估程式碼庫。 DSpark 不是全新模型,而是在 DeepSeek V4 Flash 與 V4 Pro 的既有檢查點(checkpoint)上附加推測解碼模組,透過輕量級草稿模型先行生成候選 token,再由主模型批量驗證,大幅加速推理。
核心創新「信心調度推測解碼」(Confidence Scheduled Speculative Decoding)能根據信心水準動態決定推測 token 數量,減少無效驗算的算力浪費。