คำตอบการวิจัย
ประเด็นสำคัญ Zyphra เปิดตัว ZAYA1‑8B‑Diffusion‑Preview โมเดลที่แปลงจาก LLM แบบ autoregressive ให้สร้างข้อความเป็นบล็อก 16 โทเค็นพร้อมกัน บริษัทระบุว่าสามารถเร่งความเร็วการถอดรหัสได้ประมาณ 4.6 เท่าด้วย lossless sampler และสูงสุด 7.7 เท่าด้วย logit‑mixing sampler แนวทางนี้อาจลดต้นทุนการรันโมเดล เพิ่มความเร็วในการฝึกแบบ reinforcement learning และเพิ่มการแข่งขันด้านฮาร์ดแวร์ AI นอกระบบ Nvidia What is Zyphra’s new ZAYA1-8B-Diffusion-Preview model, how does converting its autoregressive ZAYA1-8B into a Mixture-of-Experts diffusion l Diffusion-style language models can draft multiple tokens simultaneously instead of generating them sequentially. AI พรอมต์ Create a landscape editorial hero image for this Studio Global article: What is Zyphra’s new ZAYA1-8B-Diffusion-Preview model, how does converting its autoregressive ZAYA1-8B into a Mixture-of-Experts diffusion l. Article summary: Zyphra’s ZAYA1-8B-Diffusion-Preview is an experimental diffusion-language version of its ZAYA1-8B MoE model, designed to decode blocks of text in parallel rather than strictly one token at a time. Zyphra claims it can ge. Topic tags: general, academic, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "# Zyphra Releases ZAYA1-8B: A Reasoning MoE Trained on AMD Hardware That Punches Far Above Its Weight Class. Zyphra AI has released ZAYA1-8B, a small Mixture of Experts (MoE) langu" source context "Zyphra Releases ZAYA1-8B: A Reasoning MoE Trained on AMD Hardware That Punches Far Above Its Weight Class
openai.com แนวคิดใหม่: ใช้ diffusion เพื่อเร่งการสร้างข้อความ
Zyphra เปิดตัว ZAYA1‑8B‑Diffusion‑Preview ซึ่งเป็นเวอร์ชันทดลองของโมเดลภาษา ZAYA1‑8B ที่เปลี่ยนวิธีสร้างข้อความจากแบบดั้งเดิมไปใช้แนวทาง diffusion‑style generation แทนการสร้างทีละโทเค็นเหมือนโมเดลภาษาแบบ autoregressive ทั่วไป
แทนที่จะทำนายคำถัดไปเพียงคำเดียว โมเดลนี้สามารถ สร้างร่างข้อความเป็นบล็อก 16 โทเค็นพร้อมกัน ในแต่ละรอบการประมวลผล ทำให้การถอดรหัส (decoding) เร็วขึ้นอย่างมีนัยสำคัญภายใต้กลยุทธ์การสุ่มตัวอย่างบางแบบ
Zyphra รายงานว่า
ใช้ lossless sampler สามารถเพิ่มความเร็วได้ประมาณ 4.6 เท่า
ใช้ logit‑mixing sampler ความเร็วอาจสูงถึง 7.7 เท่า แต่มีความเสี่ยงเรื่องคุณภาพเล็กน้อย
จุดสำคัญอีกอย่างคือ โมเดลนี้ ไม่ได้ถูกฝึกเป็น diffusion model ตั้งแต่ต้น แต่เป็นการแปลงจาก checkpoint ของโมเดล autoregressive ที่มีอยู่แล้ว แสดงให้เห็นว่า LLM แบบเดิมอาจถูกปรับให้ใช้การถอดรหัสแบบ diffusion ได้ในภายหลัง
คนยังถาม คำตอบสั้น ๆ สำหรับ "ZAYA1‑8B‑Diffusion‑Preview: วิธีที่โมเดล AI ของ Zyphra สร้างข้อความทีละ 16 โทเค็นเพื่อเร่งความเร็วอินเฟอเรนซ์" คืออะไร Zyphra เปิดตัว ZAYA1‑8B‑Diffusion‑Preview โมเดลที่แปลงจาก LLM แบบ autoregressive ให้สร้างข้อความเป็นบล็อก 16 โทเค็นพร้อมกัน
ประเด็นสำคัญที่ต้องตรวจสอบก่อนคืออะไร? Zyphra เปิดตัว ZAYA1‑8B‑Diffusion‑Preview โมเดลที่แปลงจาก LLM แบบ autoregressive ให้สร้างข้อความเป็นบล็อก 16 โทเค็นพร้อมกัน บริษัทระบุว่าสามารถเร่งความเร็วการถอดรหัสได้ประมาณ 4.6 เท่าด้วย lossless sampler และสูงสุด 7.7 เท่าด้วย logit‑mixing sampler
ฉันควรทำอย่างไรต่อไปในทางปฏิบัติ? แนวทางนี้อาจลดต้นทุนการรันโมเดล เพิ่มความเร็วในการฝึกแบบ reinforcement learning และเพิ่มการแข่งขันด้านฮาร์ดแวร์ AI นอกระบบ Nvidia
โมเดลพื้นฐาน: ZAYA1‑8B ZAYA1‑8B‑Diffusion‑Preview สร้างขึ้นบนโมเดลหลักชื่อ ZAYA1‑8B ซึ่งเป็นโมเดล reasoning แบบ Mixture‑of‑Experts (MoE) ของ Zyphra
พารามิเตอร์รวมมากกว่า 8 พันล้านตัว
แต่ใช้จริงระหว่างอินเฟอเรนซ์เพียงประมาณ 760 ล้านตัว
MoE ทำงานโดยเลือกใช้ "expert" หรือเครือข่ายย่อยเพียงบางส่วนต่อโทเค็น แทนที่จะเปิดใช้งานทั้งโมเดลทั้งหมด จึงช่วยลดต้นทุนการคำนวณเมื่อเทียบกับโมเดล dense ขนาดใกล้เคียงกัน
ทำไมโมเดลภาษาแบบเดิมถึงช้า LLM ส่วนใหญ่ในปัจจุบันใช้วิธี autoregressive generation ซึ่งสร้างข้อความทีละโทเค็นตามลำดับ
สร้างโทเค็นถัดไป
อัปเดต KV cache ของโมเดล
ใช้ผลลัพธ์นั้นเพื่อสร้างโทเค็นถัดไป
เนื่องจากแต่ละขั้นต้องรอผลของขั้นก่อนหน้า การสร้างข้อความจึง ไม่สามารถขนานการประมวลผลได้เต็มที่ และมักติดคอขวดที่การเข้าถึงหน่วยความจำ (memory bandwidth) โดยเฉพาะเมื่อ KV cache โตขึ้นเรื่อย ๆ
diffusion decoder สร้าง 16 โทเค็นพร้อมกันได้อย่างไร การแปลงเป็น diffusion model เปลี่ยนวิธีสร้างข้อความโดยสิ้นเชิง
แทนที่จะทำนายโทเค็นเดียว โมเดลจะ เสนอชุดโทเค็นผู้สมัครหลายตัวพร้อมกันในบล็อกเดียว ซึ่งในเวอร์ชันนี้กำหนดไว้ที่ 16 โทเค็นต่อขั้น diffusion
โมเดลสร้างร่างคำตอบหลายชุดสำหรับบล็อกโทเค็น
sampler ประเมินว่าโทเค็นใดควรถูกยอมรับ
โทเค็นที่ผ่านจะถูกเพิ่มในผลลัพธ์ จากนั้นจึงเริ่มบล็อกถัดไป
เนื่องจากโทเค็นในบล็อกใช้ prefix และ KV cache เดียวกัน การคำนวณจึงสามารถทำ แบบขนานใน forward pass เดียว ได้
ผลลัพธ์คือภาระงานเปลี่ยนจาก
งานที่ติดข้อจำกัดหน่วยความจำ
งานคำนวณแบบขนานที่ GPU ทำได้ดี
ซึ่งช่วยเพิ่มการใช้ประสิทธิภาพของ GPU และเร่งความเร็วการสร้างข้อความ
กลยุทธ์ sampler และความเร็วที่แตกต่าง Zyphra ทดสอบการถอดรหัสด้วยสองวิธีหลัก
ใช้กฎการยอมรับคล้าย speculative decoding
เร่งความเร็วประมาณ 4.6 เท่า เมื่อเทียบกับ autoregressive decoding
ออกแบบมาเพื่อลดโอกาสที่คุณภาพโมเดลจะลดลง
ผสมค่าความน่าจะเป็น (logits) ระหว่าง diffusion และ autoregressive distribution
เพิ่มอัตราการยอมรับโทเค็น
ทำให้ความเร็วเพิ่มได้ถึง 7.7 เท่า แต่มีโอกาสสูญเสียคุณภาพบางส่วน
ผลลัพธ์เหล่านี้ส่วนใหญ่ยังมาจากรายงานของ Zyphra เอง ดังนั้นการทดสอบจากนักวิจัยภายนอกยังจำเป็นเพื่อยืนยันประสิทธิภาพในงานจริง
ทำไมการฝึกบน AMD ถึงน่าสนใจ อีกจุดที่ถูกพูดถึงมากคือ สแต็กฮาร์ดแวร์ ที่ใช้ฝึกโมเดล
Zyphra ระบุว่าโมเดลนี้เป็น
diffusion language model ตัวแรกที่ฝึกบน GPU ของ AMD
ปัจจุบันงานฝึกโมเดลขนาดใหญ่ส่วนใหญ่ยังใช้ระบบของ Nvidia เป็นหลัก ดังนั้นการแสดงให้เห็นว่าโมเดลระดับนี้สามารถฝึกบนสแต็ก AMD ได้ อาจช่วยเพิ่มการแข่งขันในตลาดฮาร์ดแวร์ AI
Compressed Convolutional Attention (CCA) ZAYA1‑8B ยังใช้กลไก attention ที่ Zyphra เรียกว่า Compressed Convolutional Attention (CCA)
ลดต้นทุนการคำนวณของ attention
ทำให้การประมวลผลแบบขนานขนาดใหญ่มีประสิทธิภาพมากขึ้น
สิ่งนี้สำคัญเพราะ diffusion decoding มีลักษณะคล้ายช่วง prefill ของโมเดล ซึ่งต้องประมวลผลโทเค็นจำนวนมากพร้อมกัน หาก attention ถูกทำให้เบาลง การสร้างโทเค็นหลายตัวในแต่ละรอบก็จะทำได้มีประสิทธิภาพมากขึ้น
ผลกระทบต่อค่าใช้จ่ายในการรัน AI หากตัวเลขความเร็วที่ Zyphra รายงานสามารถเกิดขึ้นจริงในระบบโปรดักชัน ผลกระทบอาจมีขนาดใหญ่ เช่น
GPU หนึ่งตัวสร้างโทเค็นได้มากขึ้นต่อวินาที
ต้นทุนต่อโทเค็นลดลง
เวลาในการตอบคำถามยาว ๆ ลดลง
อย่างไรก็ตาม Zyphra ระบุเองว่า สแต็ก inference สำหรับ diffusion ยังไม่ถูกปรับแต่งเท่า autoregressive ดังนั้นผลลัพธ์จริงอาจแตกต่างจากการวัดเชิงทฤษฎี
ความสำคัญต่อการฝึกแบบ reinforcement learning โมเดล reasoning จำนวนมากในปัจจุบันต้องใช้ reinforcement learning ที่สร้างคำตอบจำนวนมากระหว่างการฝึก
ความเร็วในการสร้างข้อความจึงมีผลโดยตรงต่อค่าใช้จ่าย
หาก decoding เร็วขึ้น นักวิจัยอาจสามารถ
สุ่มตัวอย่างคำตอบได้มากขึ้นต่อ prompt
ทดลองเส้นทางการให้เหตุผลหลายแบบ
ลดต้นทุนของ RL training pipeline
ในระบบฝึกโมเดลขั้นสูง ค่า inference มักเป็นหนึ่งในต้นทุนหลัก
สัญญาณของการแข่งขันด้าน “AI ที่มีประสิทธิภาพ” ZAYA1‑8B‑Diffusion‑Preview สะท้อนแนวโน้มใหม่ในวงการ AI ที่ไม่ได้มุ่งเพียงสร้างโมเดลใหญ่ขึ้น แต่พยายามเพิ่ม ประสิทธิภาพต่อค่าใช้จ่าย (intelligence per dollar)
ตัวอย่างนี้รวมหลายแนวทางเข้าด้วยกัน เช่น
สถาปัตยกรรม mixture‑of‑experts
diffusion‑style decoding
attention รูปแบบใหม่
การฝึกโมเดลบนระบบ AMD
หากเทคนิคเหล่านี้พิสูจน์ได้ในระดับโปรดักชัน อาจเปลี่ยนวิธีที่อุตสาหกรรมออกแบบโมเดลภาษาในอนาคต โดยให้ความสำคัญกับ ความเร็ว ต้นทุน และประสิทธิภาพฮาร์ดแวร์ มากพอ ๆ กับความสามารถของโมเดลเอง
arxiv.org
ZAYA1-8B Technical Report