ZAYA1‑8B‑Diffusion‑Preview 的基礎是 Zyphra 先前推出的 ZAYA1‑8B。
這是一個 Mixture‑of‑Experts(MoE)推理模型:
MoE 架構的核心想法是:模型包含多個專門子網路(稱為 experts),但每次生成 token 只會使用其中一部分。這能在維持性能的同時,顯著降低實際運算成本。
目前大多數語言模型採用 自回歸生成(autoregressive generation)。
其流程大致是:
由於每一步都依賴前一個結果,生成必須 完全序列化。這會帶來兩個問題:
因此在實際推理中,很多系統並不是算力不足,而是 記憶體頻寬限制了生成速度。
Zyphra 的做法是改變解碼邏輯。
在擴散式流程中,模型會:
在這個過程中,同一區塊的 token 共用相同的前綴與 KV cache,因此可以在一次前向計算中處理多個 token。
這使推理從原本的 記憶體頻寬瓶頸,轉變為 GPU 更擅長的並行計算任務。
速度提升與採樣策略密切相關。
Lossless sampler
Logit‑mixing sampler
目前這些結果主要來自 Zyphra 自身的技術報告,因此仍需要更多獨立測試來驗證在不同工作負載下的效果。
另一個引人注意的點是 硬體平台。
Zyphra 表示,這個模型是 首個在 AMD GPU 上訓練的擴散式語言模型。
當前大規模 AI 訓練幾乎由 Nvidia GPU 主導。如果能在 AMD GPU 上成功訓練與運行這類模型,意味著未來 AI 基礎設施可能出現更多硬體競爭,而不是完全依賴單一生態系。
ZAYA1‑8B 架構還包含 Zyphra 所稱的 Compressed Convolutional Attention(CCA) 機制。
這種注意力設計的目標是:
這對擴散式解碼尤其重要。因為一次生成多個 token 的過程,本質上類似於大型 prefill 計算。如果注意力計算成本降低,就能讓這種多 token 並行生成更加可行。
如果這類方法在實際部署中成立,可能會改變 AI 推理經濟模型。
更快的解碼速度意味著:
不過 Zyphra 也指出,目前 擴散式語言模型的推理工具鏈仍不如自回歸模型成熟,因此實際部署的效益仍有待觀察。
大型推理模型在訓練時,常使用 強化學習(RL)與 on‑policy rollouts。
這些方法需要模型生成大量候選答案,因此生成速度會直接影響訓練成本。
如果解碼速度提升,可能帶來:
在許多研究管線中,生成本身就是最昂貴的步驟之一。
ZAYA1‑8B‑Diffusion‑Preview 也反映了 AI 產業的一個趨勢:
焦點正逐漸從「模型越大越好」,轉向 每美元能得到多少智能(intelligence per dollar)。
Zyphra 的設計結合了多種效率策略:
如果這些技術在更大規模的模型上被證明可靠,它們可能會重新塑造未來語言模型的最佳化方向——不只是追求能力,也包括 吞吐量、成本與硬體效率。
目前而言,ZAYA1‑8B‑Diffusion‑Preview 更像是一個技術展示,但它顯示了一條值得關注的路線:把現有自回歸 LLM 轉換成擴散式解碼器,可能成為提升 AI 生成速度的新方法。