Pada 27 Jun 2026, DeepSeek dan Universiti Peking melancarkan DSpark, rangka penyahkodan spekulatif yang mempercepatkan inferens LLM dengan menggunakan model draf separa autoregresif ringan untuk menjana token calon. Dalam trafik pengguna sebenar, DSpark meningkatkan kelajuan penjanaan pengguna tunggal DeepSeek V4 Fl...
Research answer

Create a landscape editorial hero image for this Studio Global article: Search & fact-check with cited sources for What are the key details of DeepSeek's open-source DSpark speculative decoding framework released. Article summary: Here are the key details, fully sourced:. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
Pada 27 Jun 2026, DeepSeek, dengan kerjasama Universiti Peking, telah membuka sumber DSpark, sebuah rangka penyahkodan spekulatif (speculative decoding) yang direka untuk mempercepatkan inferens LLM. Bersama-sama dengan rangka ini, DeepSeek turut mengeluarkan kod sumber latihan dan penilaian lengkap yang dipanggil DeepSpec, serta model checkpoint untuk DeepSeek-V4-Flash dan V4-Pro yang telah diintegrasikan dengan DSpark . Kertas kerja bertajuk "DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation" turut ditandatangani oleh Ketua Pegawai Eksekutif DeepSeek, Liang Wenfeng .
DSpark bukanlah model asas baharu. Ia adalah modul tambahan yang dipasang pada model sedia ada untuk membolehkan saluran paip penyahkodan spekulatif . Mekanisme terasnya: model draf (draft model) yang ringan dan separa autoregresif akan menjana token calon dengan pantas, dan kemudian model utama akan mengesahkannya secara berkelompok — berbanding menjana satu token pada satu masa. Pendekatan ini dikenali sebagai penyahkodan spekulatif, satu teknik yang diperkenalkan oleh Google Research pada tahun 2023 dan diperhalusi oleh rangka kerja seperti SpecInfer, Medusa, dan EAGLE .
DSpark memperkenalkan elemen baharu yang dipanggil penyahkodan spekulatif berjadual keyakinan (confidence-scheduled speculative decoding). Sistem ini secara dinamik memutuskan bilangan token yang perlu dijana berdasarkan tahap keyakinan, yang mengurangkan pengiraan pengesahan yang sia-sia . Ia menggantikan skema MTP-1 (Multi-Token Prediction) DeepSeek-V4 yang sebelum ini digunakan dalam pengeluaran .
DSpark telah pun digunakan dalam sistem pengeluaran DeepSeek-V4 yang mengendalikan trafik pengguna sebenar pada perkhidmatan pratonton DeepSeek-V4-Flash dan DeepSeek-V4-Pro . Pada jumlah daya pemprosesan sistem yang sama, DSpark memberikan peningkatan kelajuan penjanaan setiap pengguna berbanding garis dasar MTP-1 sebelumnya:
| Model | Peningkatan kelajuan penjanaan setiap pengguna |
|---|---|
| DeepSeek-V4-Flash | 60% hingga 85% lebih pantas |
| DeepSeek-V4-Pro | 57% hingga 78% lebih pantas |
Keputusan ini diperoleh daripada trafik pengguna sebenar, bukan penanda aras sintetik . Di bawah kekangan kependaman yang ketat, DSpark mengelakkan penurunan daya pemprosesan yang dialami oleh skema sebelumnya, menolak keluar sempadan Pareto sistem . Dalam satu ujian yang mensasarkan 120 token/saat/pengguna untuk V4-Flash, MTP-1 hampir mencapai had kapasitinya manakala DSpark memberikan kelebihan daya pemprosesan nominal sebanyak 661% .
DSpark direka bentuk untuk serasi dengan pelbagai model (model-agnostic). Kertas kerja menunjukkan keberkesanannya pada seni bina bukan DeepSeek: pada Qwen3-4B, Qwen3-8B, dan Qwen3-14B, DSpark meningkatkan purata makro panjang terimaan (macro-average accepted length) sebanyak 30.9%, 26.7%, dan 30.0% masing-masing berbanding garis dasar Eagle3 . Berbanding model draf selari DFlash, peningkatan adalah 16.3%, 18.4%, dan 18.3% pada saiz Qwen3 yang sama . DSpark juga mengekalkan kelebihannya pada Gemma4-12B . Yang menarik, konfigurasi DSpark 2 lapisan mengatasi prestasi konfigurasi DFlash 5 lapisan .
Peningkatan panjang draf daripada 4 kepada 16 token hanya menambah kependaman 0.2–1.3% setiap pusingan, manakala panjang terimaan bertambah sehingga 30% .
Bersama-sama DSpark, DeepSeek membuka sumber DeepSpec, rangka latihan dan penilaian penyahkodan spekulatif yang lengkap. Ia merangkumi pelaksanaan Eagle3, DFlash, dan DSpark, serta membolehkan pemaju dan penyelidik untuk:
Kertas kerja, kod, dan pemberat model dihoskan di bawah repositori deepseek-ai/DeepSpec di GitHub dan Hugging Face .
Pada 29 Jun 2026, DeepSeek mengumumkan bahawa pelancaran rasmi DeepSeek V4 dijadualkan pada pertengahan Julai 2026 . Seiring dengan itu, DeepSeek akan memperkenalkan struktur harga API puncak-dan-luar puncak (time-of-day) :
Untuk V4-Flash, harga puncak yang sepadan berganda daripada 0.02 RMB kepada 0.04 RMB (cache hit), 1 RMB kepada 2 RMB (cache miss), dan 2 RMB kepada 4 RMB (output) bagi setiap juta token . DeepSeek menyatakan perubahan ini bertujuan untuk "memperuntukkan sumber dengan lebih rasional dan meningkatkan kestabilan perkhidmatan" . Pengguna akan menerima pemberitahuan e-mel 24 jam sebelum perubahan pengebilan berkuat kuasa . Peralihan harga ini, digabungkan dengan pecutan DSpark, menandakan usaha DeepSeek untuk mengimbangi pengkomersilan (selepas pusingan pembiayaan kira-kira 50 bilion RMB) dengan pelepasan sumber terbuka yang agresif .
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Pada 27 Jun 2026, DeepSeek dan Universiti Peking melancarkan DSpark, rangka penyahkodan spekulatif yang mempercepatkan inferens LLM dengan menggunakan model draf separa autoregresif ringan untuk menjana token calon.
Pada 27 Jun 2026, DeepSeek dan Universiti Peking melancarkan DSpark, rangka penyahkodan spekulatif yang mempercepatkan inferens LLM dengan menggunakan model draf separa autoregresif ringan untuk menjana token calon. Dalam trafik pengguna sebenar, DSpark meningkatkan kelajuan penjanaan pengguna tunggal DeepSeek V4 Flash sebanyak 60% hingga 85%, dan DeepSeek V4 Pro sebanyak 57% hingga 78%, berbanding kaedah sebelumnya (MTP 1).
DSpark serasi dengan pelbagai model (model agnostic) dan telah diuji pada Qwen3 dan Gemma4, menunjukkan peningkatan panjang terimaan yang ketara.