ZAYA1‑8B‑Diffusion‑Preview: Khi mô hình ngôn ngữ khuếch tán tạo 16 token một lúc
Zyphra chuyển đổi mô hình ZAYA1‑8B từ kiến trúc tự hồi quy sang mô hình ngôn ngữ khuếch tán, cho phép tạo 16 token song song trong mỗi bước suy luận. Cách tiếp cận này giảm nút thắt băng thông bộ nhớ của KV cache và chuyển phần lớn khối lượng công việc sang tính toán song song trên GPU.
Đăng bởiBiên tập bằng GPT-5.5Hình ảnh được tạo bằng GPT Image 2
Zyphra chuyển đổi mô hình ZAYA1‑8B từ kiến trúc tự hồi quy sang mô hình ngôn ngữ khuếch tán, cho phép tạo 16 token song song trong mỗi bước suy luận.
Cách tiếp cận này giảm nút thắt băng thông bộ nhớ của KV cache và chuyển phần lớn khối lượng công việc sang tính toán song song trên GPU.
Nếu hiệu quả thực tế đúng như báo cáo, kỹ thuật này có thể giảm chi phí suy luận AI và tăng tốc các quy trình huấn luyện reinforcement learning cần tạo hàng loạt phản hồi.
What is Zyphra’s new ZAYA1-8B-Diffusion-Preview model, how does converting its autoregressive ZAYA1-8B into a Mixture-of-Experts diffusion lDiffusion-style language models can draft multiple tokens simultaneously instead of generating them sequentially.
Prompt AI
Create a landscape editorial hero image for this Studio Global article: What is Zyphra’s new ZAYA1-8B-Diffusion-Preview model, how does converting its autoregressive ZAYA1-8B into a Mixture-of-Experts diffusion l. Article summary: Zyphra’s ZAYA1-8B-Diffusion-Preview is an experimental diffusion-language version of its ZAYA1-8B MoE model, designed to decode blocks of text in parallel rather than strictly one token at a time. Zyphra claims it can ge. Topic tags: general, academic, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "# Zyphra Releases ZAYA1-8B: A Reasoning MoE Trained on AMD Hardware That Punches Far Above Its Weight Class. Zyphra AI has released ZAYA1-8B, a small Mixture of Experts (MoE) langu" source context "Zyphra Releases ZAYA1-8B: A Reasoning MoE Trained on AMD Hardware That Punches Far Above Its Weight Class
openai.com
Hướng tiếp cận khuếch tán để tăng tốc giải mã LLM
ZAYA1‑8B‑Diffusion‑Preview là phiên bản thử nghiệm của mô hình ngôn ngữ ZAYA1‑8B do startup AI Zyphra phát triển. Điểm khác biệt nằm ở cách tạo văn bản: thay vì giải mã từng token một như hầu hết LLM hiện nay, mô hình này sử dụng quy trình kiểu diffusion để tạo cả khối 16 token cùng lúc.
Theo Zyphra, cách làm này có thể tăng tốc độ suy luận đáng kể: khoảng 4,6× khi dùng “lossless sampler” và tối đa 7,7× với kỹ thuật logit‑mixing sampler, với mức suy giảm chất lượng nhỏ tùy cấu hình.
Đáng chú ý hơn, mô hình khuếch tán này không được huấn luyện từ đầu, mà được , cho thấy một con đường mới để nâng cấp LLM truyền thống.
Studio Global AI
Tiếp tục nghiên cứu của bạn
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Câu trả lời ngắn gọn cho "ZAYA1‑8B‑Diffusion‑Preview: Khi mô hình ngôn ngữ khuếch tán tạo 16 token một lúc" là gì?
Zyphra chuyển đổi mô hình ZAYA1‑8B từ kiến trúc tự hồi quy sang mô hình ngôn ngữ khuếch tán, cho phép tạo 16 token song song trong mỗi bước suy luận.
Những điểm chính cần xác nhận đầu tiên là gì?
Zyphra chuyển đổi mô hình ZAYA1‑8B từ kiến trúc tự hồi quy sang mô hình ngôn ngữ khuếch tán, cho phép tạo 16 token song song trong mỗi bước suy luận. Cách tiếp cận này giảm nút thắt băng thông bộ nhớ của KV cache và chuyển phần lớn khối lượng công việc sang tính toán song song trên GPU.
Tôi nên làm gì tiếp theo trong thực tế?
Nếu hiệu quả thực tế đúng như báo cáo, kỹ thuật này có thể giảm chi phí suy luận AI và tăng tốc các quy trình huấn luyện reinforcement learning cần tạo hàng loạt phản hồi.
chuyển đổi trực tiếp từ checkpoint của mô hình tự hồi quy hiện có
Mô hình nền: ZAYA1‑8B
Phiên bản diffusion preview được xây dựng trên ZAYA1‑8B, một mô hình reasoning dạng mixture‑of‑experts (MoE) của Zyphra.
Tổng số tham số: hơn 8 tỷ
Tham số được kích hoạt khi suy luận: khoảng 760 triệu
Trong kiến trúc MoE, mỗi token chỉ kích hoạt một số “chuyên gia” nhỏ trong mạng neural thay vì toàn bộ mô hình. Điều này giúp giảm chi phí tính toán trong khi vẫn duy trì hiệu năng cạnh tranh so với các mô hình lớn hơn.
Vì sao giải mã tự hồi quy thường chậm
Phần lớn mô hình ngôn ngữ hiện nay hoạt động theo cơ chế autoregressive. Quy trình tạo văn bản diễn ra tuần tự:
Dự đoán token tiếp theo
Cập nhật KV cache
Lặp lại cho token kế tiếp
Vì mỗi token phụ thuộc vào toàn bộ chuỗi trước đó, quá trình này không thể song song hóa tốt. Ngoài ra, việc liên tục truy cập KV cache khiến hệ thống thường bị giới hạn bởi băng thông bộ nhớ, đặc biệt khi chạy trên GPU.
Cách ZAYA1 tạo 16 token trong một bước
Ở phiên bản diffusion, quy trình giải mã thay đổi đáng kể.
Thay vì dự đoán từng token, mô hình đề xuất cả một khối token ứng viên cùng lúc—trong bản preview là 16 token mỗi bước diffusion.
Quy trình cơ bản:
Mô hình tạo nhiều bản nháp cho một khối token.
Bộ sampler đánh giá token nào được chấp nhận.
Các token hợp lệ được thêm vào chuỗi kết quả, rồi tiếp tục vòng lặp cho khối tiếp theo.
Do tất cả token trong khối dùng chung tiền tố và trạng thái KV cache, GPU có thể tính toán song song trong một lần forward pass. Điều này chuyển gánh nặng từ truy cập bộ nhớ sang tính toán song song, vốn là thế mạnh của GPU.
Hai chiến lược sampling và sự đánh đổi tốc độ
Hiệu quả tăng tốc phụ thuộc vào cách chọn token trong quá trình giải mã.
Lossless sampler
Cơ chế chấp nhận token tương tự speculative decoding
Zyphra báo cáo tăng tốc khoảng 4,6× so với autoregressive
Thiết kế để tránh suy giảm đáng kể trên các bài đánh giá
Logit‑mixing sampler
Trộn xác suất (logits) từ mô hình diffusion và autoregressive
Tăng tỷ lệ token được chấp nhận
Có thể đạt tới 7,7× tốc độ, nhưng có khả năng giảm chất lượng một chút
Các con số này chủ yếu dựa trên báo cáo kỹ thuật của Zyphra, vì vậy cần thêm benchmark độc lập để xác nhận hiệu quả trong môi trường sản xuất.
Điểm đặc biệt: huấn luyện trên GPU AMD
Một yếu tố đáng chú ý là hạ tầng phần cứng. Zyphra cho biết đây là mô hình ngôn ngữ diffusion đầu tiên được huấn luyện trên GPU AMD, thay vì hệ sinh thái Nvidia vốn thống trị ngành AI.
Nếu các kết quả này được tái lập rộng rãi, điều đó cho thấy việc huấn luyện và triển khai LLM quy mô lớn không nhất thiết phụ thuộc hoàn toàn vào Nvidia, mở ra cạnh tranh lớn hơn trong thị trường phần cứng AI.
Compressed Convolutional Attention (CCA)
ZAYA1‑8B còn sử dụng cơ chế Compressed Convolutional Attention (CCA).
Mục tiêu của CCA là giảm chi phí tính toán của attention trong các thao tác song song lớn.
Điều này đặc biệt hữu ích cho diffusion decoding, vì việc tạo nhiều token cùng lúc tương tự giai đoạn prefill lớn trong suy luận. Khi attention rẻ hơn, việc xử lý khối token song song cũng trở nên khả thi hơn ở quy mô lớn.
Tác động tiềm năng đến chi phí suy luận
Nếu tốc độ tăng như báo cáo được giữ nguyên trong thực tế, lợi ích có thể rất đáng kể:
Tạo nhiều token hơn mỗi GPU mỗi giây
Giảm chi phí trên mỗi token
Giảm độ trễ cho các phản hồi dài
Tuy vậy, Zyphra cũng thừa nhận rằng hệ sinh thái inference cho mô hình diffusion vẫn chưa được tối ưu hóa bằng autoregressive, nên kết quả thực tế có thể khác các con số lý thuyết.
Ý nghĩa đối với huấn luyện reinforcement learning
Các mô hình reasoning hiện đại thường dựa nhiều vào reinforcement learning với on‑policy rollouts — tức là mô hình phải tạo ra rất nhiều phản hồi mẫu trong quá trình huấn luyện.
Vì vậy, tốc độ sinh token nhanh hơn có thể:
Giảm đáng kể chi phí huấn luyện RL
Cho phép thử nghiệm nhiều đường suy luận hơn
Tăng số lượng mẫu mỗi prompt
Trong nhiều pipeline huấn luyện hiện nay, chi phí suy luận chính là phần tốn kém nhất.
Một hướng mới cho AI hiệu quả
ZAYA1‑8B‑Diffusion‑Preview phản ánh xu hướng mới trong phát triển AI: không chỉ chạy theo mô hình lớn hơn, mà tập trung vào “trí tuệ trên mỗi đô la chi phí”.
Dự án của Zyphra kết hợp nhiều chiến lược tối ưu hiệu quả:
kiến trúc mixture‑of‑experts
giải mã kiểu diffusion
cơ chế attention tối ưu
hạ tầng huấn luyện ngoài hệ sinh thái Nvidia
Nếu các kỹ thuật này chứng minh được hiệu quả ở quy mô lớn, chúng có thể thay đổi cách ngành AI tối ưu mô hình — không chỉ về năng lực, mà còn về tốc độ, chi phí và hiệu suất phần cứng. Hiện tại, ZAYA1‑8B‑Diffusion‑Preview vẫn là một bước thử nghiệm, nhưng nó cho thấy khả năng chuyển đổi LLM tự hồi quy sang bộ giải mã diffusion có thể là con đường mới để tăng tốc tạo văn bản AI.