因此在實際推理中,很多系統並不是算力不足,而是 記憶體頻寬限制了生成速度。
Zyphra 的做法是改變解碼邏輯。
在擴散式流程中,模型會:
在這個過程中,同一區塊的 token 共用相同的前綴與 KV cache,因此可以在一次前向計算中處理多個 token。
速度提升與採樣策略密切相關。
Lossless sampler
Logit‑mixing sampler
目前這些結果主要來自 Zyphra 自身的技術報告,因此仍需要更多獨立測試來驗證在不同工作負載下的效果。
另一個引人注意的點是 硬體平台。
當前大規模 AI 訓練幾乎由 Nvidia GPU 主導。如果能在 AMD GPU 上成功訓練與運行這類模型,意味著未來 AI 基礎設施可能出現更多硬體競爭,而不是完全依賴單一生態系。
這種注意力設計的目標是:
這對擴散式解碼尤其重要。因為一次生成多個 token 的過程,本質上類似於大型 prefill 計算。如果注意力計算成本降低,就能讓這種多 token 並行生成更加可行。
如果這類方法在實際部署中成立,可能會改變 AI 推理經濟模型。
更快的解碼速度意味著:
大型推理模型在訓練時,常使用 強化學習(RL)與 on‑policy rollouts。
這些方法需要模型生成大量候選答案,因此生成速度會直接影響訓練成本。
如果解碼速度提升,可能帶來:
在許多研究管線中,生成本身就是最昂貴的步驟之一。
ZAYA1‑8B‑Diffusion‑Preview 也反映了 AI 產業的一個趨勢:
焦點正逐漸從「模型越大越好」,轉向 每美元能得到多少智能(intelligence per dollar)。
Zyphra 的設計結合了多種效率策略:
目前而言,ZAYA1‑8B‑Diffusion‑Preview 更像是一個技術展示,但它顯示了一條值得關注的路線:把現有自回歸 LLM 轉換成擴散式解碼器,可能成為提升 AI 生成速度的新方法。