Zyphra將原本嘅ZAYA1‑8B自回歸MoE模型轉成擴散語言模型,每一步可同時生成16個token,理論推理速度可提升4.6×至7.7×。[8] 新方法把逐token順序生成改為區塊並行生成,減少KV cache記憶體頻寬瓶頸,令GPU計算資源用得更滿。[3][8] 如果實際部署效果接近理論數據,可能降低AI推理成本,亦能加快依賴大量生成樣本嘅強化學習訓練流程。[8]

Create a landscape editorial hero image for this Studio Global article: What is Zyphra’s new ZAYA1-8B-Diffusion-Preview model, how does converting its autoregressive ZAYA1-8B into a Mixture-of-Experts diffusion l. Article summary: Zyphra’s ZAYA1-8B-Diffusion-Preview is an experimental diffusion-language version of its ZAYA1-8B MoE model, designed to decode blocks of text in parallel rather than strictly one token at a time. Zyphra claims it can ge. Topic tags: general, academic, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "# Zyphra Releases ZAYA1-8B: A Reasoning MoE Trained on AMD Hardware That Punches Far Above Its Weight Class. Zyphra AI has released ZAYA1-8B, a small Mixture of Experts (MoE) langu" source context "Zyphra Releases ZAYA1-8B: A Reasoning MoE Trained on AMD Hardware That Punches Far Above Its Weight Class
Zyphra推出嘅 ZAYA1‑8B‑Diffusion‑Preview,係一個實驗性版本語言模型。佢最大嘅變化係:唔再用傳統 autoregressive(自回歸)逐token生成,而係改用 diffusion(擴散式)生成方法。
傳統LLM通常一次只生成 1個token,但Zyphra呢個版本可以 每一步同時生成16個token。根據官方技術報告,理論上解碼速度可以提升:
另一個重要點係:呢個模型 並唔係由零開始訓練嘅diffusion模型,而係將原本嘅自回歸模型 checkpoint 轉換成擴散式解碼架構。呢個做法意味住未來可能可以將現有LLM直接升級到新解碼方式。
Diffusion Preview建立喺 ZAYA1‑8B 基礎上。呢個模型本身係 Mixture‑of‑Experts(MoE)架構。
整體規模:
MoE嘅原理係:每次生成token時,只會調用一部分「專門化神經網絡(experts)」。
好處係:
現時大部分LLM都係 autoregressive generation(自回歸生成)。
流程基本上係:
因為每一步都要依賴之前嘅結果,所以整個過程 必須順序進行。
呢種方式帶來一個問題:
Zyphra嘅方法係 區塊式生成(block generation)。
唔係逐個token預測,而係:
大致流程係:
因為同一個區塊共享 同一個prefix同KV cache,所以可以喺 一次forward pass內並行計算多個token。
結果係:
Zyphra提供兩種解碼策略。
而且目前數據主要來自 Zyphra 自家測試,實際部署環境仍需要第三方驗證。
另一個少見嘅地方係 硬件平台。
Zyphra表示:
目前大部分大型AI模型都係:
如果AMD生態可以支持呢類模型訓練與實驗,可能會帶來:
但呢方面仍然需要更多團隊驗證。
ZAYA1‑8B仲加入咗一個機制:
Compressed Convolutional Attention(CCA)。
目的係降低 attention 計算成本。
呢點對 diffusion 解碼尤其重要,因為:
如果attention計算成本低,模型就可以 更有效率地並行處理token區塊。
簡單講:
如果呢種方法喺實際部署都成立,潛在影響包括:
不過Zyphra亦提到,目前 diffusion語言模型嘅推理堆疊仍未完全優化,所以真實效果可能同理論數據有差距。
很多推理型AI模型依賴 reinforcement learning rollouts。
即係:
生成速度直接影響:
如果生成速度大幅提升,理論上可以:
ZAYA1‑8B‑Diffusion‑Preview其實反映一個新趨勢:
AI研究唔再只追求更大模型,而係追求 「每美元智能密度」(intelligence per dollar)。
Zyphra呢個案例結合咗幾個效率策略:
如果呢類方法證明可行,未來LLM競爭可能唔只係 誰的模型最大,而係 誰的推理效率最高。
而ZAYA1‑8B‑Diffusion‑Preview目前可以視為一個早期實驗:展示將自回歸LLM轉成diffusion解碼,可能係提升AI生成速度嘅一條新路。
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Zyphra將原本嘅ZAYA1‑8B自回歸MoE模型轉成擴散語言模型,每一步可同時生成16個token,理論推理速度可提升4.6×至7.7×。[8]
Zyphra將原本嘅ZAYA1‑8B自回歸MoE模型轉成擴散語言模型,每一步可同時生成16個token,理論推理速度可提升4.6×至7.7×。[8] 新方法把逐token順序生成改為區塊並行生成,減少KV cache記憶體頻寬瓶頸,令GPU計算資源用得更滿。[3][8]
如果實際部署效果接近理論數據,可能降低AI推理成本,亦能加快依賴大量生成樣本嘅強化學習訓練流程。[8]