DeepSeek, em parceria com a Universidade de Pequim, lançou o DSpark, um framework de decodificação especulativa que acelera a inferência de grandes modelos de linguagem (LLMs). O DSpark não é um novo modelo, mas um módulo que adiciona um pipeline de decodificação especulativa a checkpoints existentes, como as versõe...
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: Search & fact-check with cited sources for What are the key details of DeepSeek's open-source DSpark speculative decoding framework released. Article summary: Here are the key details, fully sourced:. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
Em 27 de junho de 2026, a DeepSeek — em parceria com a Universidade de Pequim — disponibilizou como open source o DSpark, um framework de decodificação especulativa (speculative decoding) projetado para acelerar a inferência de grandes modelos de linguagem (LLMs). Junto com o framework, a DeepSeek lançou o DeepSpec, um conjunto completo de código para treinamento e avaliação, e os checkpoints dos modelos DeepSeek-V4-Flash e V4-Pro com o DSpark integrado . O artigo técnico, intitulado "DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation", é assinado pelo CEO Liang Wenfeng .
O DSpark não é um novo modelo base. É um módulo complementar que adapta checkpoints de modelos existentes com um pipeline de decodificação especulativa . O mecanismo central: um modelo de rascunho (draft model) leve e semi-autorregressivo gera rapidamente tokens candidatos, e então o modelo principal os verifica em lote — em vez de gerar um token de cada vez. Essa abordagem é conhecida como decodificação especulativa, uma técnica introduzida pelo Google Research em 2023 e refinada por frameworks como SpecInfer, Medusa e EAGLE .
O DSpark introduz um elemento inovador chamado decodificação especulativa com agendamento por confiança (confidence-scheduled speculative decoding). O sistema decide dinamicamente quantos tokens serão especulados com base nos níveis de confiança, o que reduz o desperdício de computação em verificações desnecessárias . Em produção, ele substituiu o esquema anterior MTP-1 (Multi-Token Prediction) do DeepSeek-V4 .
O DSpark já está implantado nos sistemas de produção do DeepSeek-V4, lidando com tráfego real de usuários nos serviços de preview do DeepSeek-V4-Flash e V4-Pro . Com a mesma taxa de transferência total do sistema, o DSpark proporciona as seguintes melhorias de velocidade de geração por usuário em comparação com a linha de base do MTP-1:
| Modelo | Melhoria na velocidade de geração por usuário |
|---|---|
| DeepSeek-V4-Flash | 60% a 85% mais rápido |
| DeepSeek-V4-Pro | 57% a 78% mais rápido |
Esses resultados vêm de tráfego real de usuários, e não de benchmarks sintéticos . Sob restrições rigorosas de latência, o DSpark evita o colapso de throughput que os esquemas anteriores sofriam, expandindo a fronteira de Pareto do sistema . Em um teste com a meta de 120 tokens/segundo/usuário para o V4-Flash, o MTP-1 estava perto do seu limite de capacidade, enquanto o DSpark entregou uma vantagem nominal de taxa de transferência de 661% .
O DSpark foi projetado para ser agnóstico em relação ao modelo. O artigo demonstra sua eficácia em arquiteturas que não são da DeepSeek: nos modelos Qwen3-4B, Qwen3-8B e Qwen3-14B, o DSpark melhorou o comprimento médio de aceitação (macro-average accepted length) em 30,9%, 26,7% e 30,0%, respectivamente, em relação à linha de base do Eagle3 . Em comparação com o modelo de rascunho paralelo DFlash, os ganhos foram de 16,3%, 18,4% e 18,3% nos mesmos tamanhos do Qwen3 . O DSpark também manteve sua liderança no modelo Gemma4-12B . Notavelmente, uma configuração do DSpark com 2 camadas superou uma configuração do DFlash com 5 camadas .
Aumentar o comprimento do rascunho de 4 para 16 tokens adicionou apenas 0,2% a 1,3% de latência por rodada, enquanto o comprimento de aceitação melhorou em até 30% .
Junto com o DSpark, a DeepSeek disponibilizou como open source o DeepSpec, um framework completo de treinamento e avaliação para decodificação especulativa. Ele inclui implementações do Eagle3, DFlash e DSpark, e permite que desenvolvedores e pesquisadores:
O artigo, o código e os pesos dos modelos estão hospedados no repositório deepseek-ai/DeepSpec no GitHub e no Hugging Face .
Em 29 de junho de 2026, a DeepSeek anunciou que o lançamento oficial do DeepSeek V4 está agendado para meados de julho de 2026 . Junto com ele, a DeepSeek introduzirá uma estrutura de preços de API por horário de pico e fora de pico :
Para o V4-Flash, a precificação de pico correspondente dobra: de 0,02 RMB para 0,04 RMB (cache hit), de 1 RMB para 2 RMB (cache miss) e de 2 RMB para 4 RMB (saída) por milhão de tokens . A DeepSeek afirmou que a mudança visa "alocar recursos de forma mais racional e melhorar a estabilidade do serviço" . Os usuários receberão notificações por e-mail 24 horas antes da alteração na cobrança . Essa mudança de preços, combinada com as acelerações do DSpark, sinaliza o esforço da DeepSeek para equilibrar a monetização comercial (após sua rodada de financiamento de aproximadamente 50 bilhões de RMB) com o lançamento contínuo e agressivo de tecnologias open source .
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
DeepSeek, em parceria com a Universidade de Pequim, lançou o DSpark, um framework de decodificação especulativa que acelera a inferência de grandes modelos de linguagem (LLMs).
DeepSeek, em parceria com a Universidade de Pequim, lançou o DSpark, um framework de decodificação especulativa que acelera a inferência de grandes modelos de linguagem (LLMs). O DSpark não é um novo modelo, mas um módulo que adiciona um pipeline de decodificação especulativa a checkpoints existentes, como as versões preview do DeepSeek V4 Flash e V4 Pro.
Em produção, com tráfego real de usuários, o DSpark tornou a geração por usuário do DeepSeek V4 Flash de 60% a 85% mais rápida, e do V4 Pro de 57% a 78% mais rápida.