Zyphra将其MoE模型ZAYA1‑8B转换为扩散式语言模型,使系统能够一次并行生成16个token,并报告最高7.7×的解码加速。[8] 该方法通过并行生成token块,减少自回归模型逐token解码带来的内存带宽瓶颈,提高GPU利用率。[3][8] 如果这种技术在生产环境中验证有效,可能降低AI推理成本,并加速依赖大量生成样本的强化学习训练流程。[8]

Create a landscape editorial hero image for this Studio Global article: What is Zyphra’s new ZAYA1-8B-Diffusion-Preview model, how does converting its autoregressive ZAYA1-8B into a Mixture-of-Experts diffusion l. Article summary: Zyphra’s ZAYA1-8B-Diffusion-Preview is an experimental diffusion-language version of its ZAYA1-8B MoE model, designed to decode blocks of text in parallel rather than strictly one token at a time. Zyphra claims it can ge. Topic tags: general, academic, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "# Zyphra Releases ZAYA1-8B: A Reasoning MoE Trained on AMD Hardware That Punches Far Above Its Weight Class. Zyphra AI has released ZAYA1-8B, a small Mixture of Experts (MoE) langu" source context "Zyphra Releases ZAYA1-8B: A Reasoning MoE Trained on AMD Hardware That Punches Far Above Its Weight Class
Zyphra发布的 ZAYA1‑8B‑Diffusion‑Preview 是其语言模型 ZAYA1‑8B 的一个实验版本。不同于主流大型语言模型采用的“自回归”(autoregressive)生成方式,这个版本使用 扩散式生成(diffusion decoding)。
在传统模型中,文本必须 一个token接一个token地生成。而Zyphra的扩散方案可以在一次步骤中 同时生成一整块token候选。在当前预览模型里,每一步可以并行生成 16个token。
根据官方报告:
值得注意的是,这个模型 并不是从零开始训练的扩散模型,而是从现有的自回归模型检查点转换而来。这证明传统LLM也可以被改造为扩散式解码器。
ZAYA1‑8B‑Diffusion‑Preview建立在 ZAYA1‑8B 模型之上,这是Zyphra发布的一款 Mixture‑of‑Experts(MoE,专家混合)推理模型。
其特点是:
MoE架构会在每个token计算时只调用部分“专家网络”,而不是全部参数,因此能在保持性能的同时显著降低推理成本。
目前大多数语言模型使用 自回归生成。流程非常简单:
问题在于:每一步都依赖前一步的输出,因此 必须顺序执行。
这种设计会带来两个典型瓶颈:
Zyphra的扩散式解码改变了生成流程。
模型不再只预测下一个token,而是 同时提出一组token草稿。在当前版本中,每一步会生成 16个token候选块。
整体流程大致如下:
因为这些候选token 共享相同的上下文前缀和KV缓存,模型可以在一次前向计算中并行处理多个token。
这样就把计算模式从 内存带宽受限的逐token解码 转变为 GPU更擅长的并行计算任务。
Zyphra在预览模型中提供了两种不同的采样方式。
Lossless sampler
Logit‑mixing sampler
目前这些结果主要来自Zyphra自身测试,仍需要独立基准验证。
另一个引人注意的点是 硬件生态。
Zyphra表示该模型是 首个在AMD GPU上训练的扩散语言模型,而不是依赖目前AI训练中占主导地位的NVIDIA平台。
如果这一方案被证明可扩展,意味着:
ZAYA1‑8B还使用了Zyphra提出的 Compressed Convolutional Attention(CCA) 注意力机制。
其目标是降低注意力计算成本。
这在扩散式解码中尤为重要,因为并行生成多个token类似于一次大型“prefill”计算阶段。降低注意力开销可以让 多token并行生成更加高效。
如果这些速度提升在真实部署环境中成立,将带来明显的经济影响:
不过Zyphra也指出,目前扩散式LLM推理栈仍不如自回归方案成熟,因此实际收益仍需进一步验证。
许多推理型模型的训练依赖 强化学习(RL)与on‑policy rollouts。
在这种训练流程中,模型需要为同一问题生成大量候选答案,因此 生成速度直接决定训练成本。
更快的解码意味着:
在大型推理模型的训练管线中,生成阶段往往是最昂贵的部分之一。
ZAYA1‑8B‑Diffusion‑Preview也反映出AI行业的一个趋势:
竞争不再只是比谁的模型更大,而是比 “每美元能获得多少智能”。
Zyphra的方案把多种效率技术组合在一起:
如果这些技术在大规模系统中得到验证,它们可能重新定义未来语言模型的优化方向——不仅关注能力,还包括 吞吐量、成本和硬件效率。
目前来看,ZAYA1‑8B‑Diffusion‑Preview更像是一种早期技术展示,但它提出了一种值得关注的思路:
把传统自回归LLM改造成扩散式解码器,或许能成为提升AI生成速度的重要路径。
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Zyphra将其MoE模型ZAYA1‑8B转换为扩散式语言模型,使系统能够一次并行生成16个token,并报告最高7.7×的解码加速。[8]
Zyphra将其MoE模型ZAYA1‑8B转换为扩散式语言模型,使系统能够一次并行生成16个token,并报告最高7.7×的解码加速。[8] 该方法通过并行生成token块,减少自回归模型逐token解码带来的内存带宽瓶颈,提高GPU利用率。[3][8]
如果这种技术在生产环境中验证有效,可能降低AI推理成本,并加速依赖大量生成样本的强化学习训练流程。[8]