Diffusion Preview建立喺 ZAYA1‑8B 基礎上。呢個模型本身係 Mixture‑of‑Experts(MoE)架構。
整體規模:
MoE嘅原理係:每次生成token時,只會調用一部分「專門化神經網絡(experts)」。
好處係:
因此ZAYA1‑8B主打嘅定位係 高效率推理模型。
現時大部分LLM都係 autoregressive generation(自回歸生成)。
流程基本上係:
因為每一步都要依賴之前嘅結果,所以整個過程 必須順序進行。
呢種方式帶來一個問題:
因為每一步都要讀寫KV cache。
Zyphra嘅方法係 區塊式生成(block generation)。
唔係逐個token預測,而係:
大致流程係:
因為同一個區塊共享 同一個prefix同KV cache,所以可以喺 一次forward pass內並行計算多個token。
結果係:
呢個就係速度提升嘅核心原因。
Zyphra提供兩種解碼策略。
即係話:比較穩定,但冇咁快。
官方表示最高可達 7.7×加速,但可能會有一定質量下降。
而且目前數據主要來自 Zyphra 自家測試,實際部署環境仍需要第三方驗證。
另一個少見嘅地方係 硬件平台。
Zyphra表示:
目前大部分大型AI模型都係:
如果AMD生態可以支持呢類模型訓練與實驗,可能會帶來:
但呢方面仍然需要更多團隊驗證。
ZAYA1‑8B仲加入咗一個機制:
Compressed Convolutional Attention(CCA)。
目的係降低 attention 計算成本。
呢點對 diffusion 解碼尤其重要,因為:
如果attention計算成本低,模型就可以 更有效率地並行處理token區塊。
簡單講:
兩者配合先能實現速度提升。
如果呢種方法喺實際部署都成立,潛在影響包括:
不過Zyphra亦提到,目前 diffusion語言模型嘅推理堆疊仍未完全優化,所以真實效果可能同理論數據有差距。
很多推理型AI模型依賴 reinforcement learning rollouts。
即係:
生成速度直接影響:
如果生成速度大幅提升,理論上可以:
所以推理速度其實係 RL訓練最大成本之一。
ZAYA1‑8B‑Diffusion‑Preview其實反映一個新趨勢:
AI研究唔再只追求更大模型,而係追求 「每美元智能密度」(intelligence per dollar)。
Zyphra呢個案例結合咗幾個效率策略:
如果呢類方法證明可行,未來LLM競爭可能唔只係 誰的模型最大,而係 誰的推理效率最高。
而ZAYA1‑8B‑Diffusion‑Preview目前可以視為一個早期實驗:展示將自回歸LLM轉成diffusion解碼,可能係提升AI生成速度嘅一條新路。