ZAYA1‑8B‑Diffusion‑Preview建立在 ZAYA1‑8B 模型之上,这是Zyphra发布的一款 Mixture‑of‑Experts(MoE,专家混合)推理模型。
其特点是:
MoE架构会在每个token计算时只调用部分“专家网络”,而不是全部参数,因此能在保持性能的同时显著降低推理成本。
目前大多数语言模型使用 自回归生成。流程非常简单:
问题在于:每一步都依赖前一步的输出,因此 必须顺序执行。
这种设计会带来两个典型瓶颈:
在GPU上运行时,这种模式往往导致算力利用率不高。
Zyphra的扩散式解码改变了生成流程。
模型不再只预测下一个token,而是 同时提出一组token草稿。在当前版本中,每一步会生成 16个token候选块。
整体流程大致如下:
因为这些候选token 共享相同的上下文前缀和KV缓存,模型可以在一次前向计算中并行处理多个token。
这样就把计算模式从 内存带宽受限的逐token解码 转变为 GPU更擅长的并行计算任务。
Zyphra在预览模型中提供了两种不同的采样方式。
Lossless sampler
Logit‑mixing sampler
目前这些结果主要来自Zyphra自身测试,仍需要独立基准验证。
另一个引人注意的点是 硬件生态。
Zyphra表示该模型是 首个在AMD GPU上训练的扩散语言模型,而不是依赖目前AI训练中占主导地位的NVIDIA平台。
如果这一方案被证明可扩展,意味着:
ZAYA1‑8B还使用了Zyphra提出的 Compressed Convolutional Attention(CCA) 注意力机制。
其目标是降低注意力计算成本。
这在扩散式解码中尤为重要,因为并行生成多个token类似于一次大型“prefill”计算阶段。降低注意力开销可以让 多token并行生成更加高效。
如果这些速度提升在真实部署环境中成立,将带来明显的经济影响:
不过Zyphra也指出,目前扩散式LLM推理栈仍不如自回归方案成熟,因此实际收益仍需进一步验证。
许多推理型模型的训练依赖 强化学习(RL)与on‑policy rollouts。
在这种训练流程中,模型需要为同一问题生成大量候选答案,因此 生成速度直接决定训练成本。
更快的解码意味着:
在大型推理模型的训练管线中,生成阶段往往是最昂贵的部分之一。
ZAYA1‑8B‑Diffusion‑Preview也反映出AI行业的一个趋势:
竞争不再只是比谁的模型更大,而是比 “每美元能获得多少智能”。
Zyphra的方案把多种效率技术组合在一起:
如果这些技术在大规模系统中得到验证,它们可能重新定义未来语言模型的优化方向——不仅关注能力,还包括 吞吐量、成本和硬件效率。
目前来看,ZAYA1‑8B‑Diffusion‑Preview更像是一种早期技术展示,但它提出了一种值得关注的思路:
把传统自回归LLM改造成扩散式解码器,或许能成为提升AI生成速度的重要路径。