Xiaomi ถ่ายทอดสดเทเลเมทรีบางส่วนจากการฝึก RL ของ MiMo V2.6 Pro และ MiMo V2.6 Flash ซึ่งยังเป็นโมเดลที่พัฒนาไม่เสร็จ รวมถึงกราฟรางวัล จำนวน rollout เวลาแต่ละสเต็ป ต้นทุน และผลประเมินระหว่างทาง ทีม MiMo ระบุว่าหนึ่งสเต็ปใช้ราว 2 พันล้านโทเค็น จาก 1,568 พรอมป์ต์ × 16 rollout แบบอะซิงโครนัส พร้อมขยายทั้งกำลังประมวลผล สภ...
เผยแพร่โดยแก้ไขด้วย GPT-5.6 Terraรูปภาพสร้างด้วย GPT Image 2
คำตอบการวิจัย

Create a landscape editorial hero image for this Studio Global article: What is Xiaomi’s public MiMo-V2.6 reinforcement-learning post-training livestream at mimo.xiaomi.com/rl/, what does it reveal about the para. Article summary: Xiaomi’s MiMo-V2.6 page is an unusual public dashboard for *ongoing* RL post-training, not a release of a finished model. It exposes selected trainer-log telemetry for parallel unreleased Pro and Flash runs—reward and be. Topic tags: general, education, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
Xiaomi MiMo เปิดเผยส่วนที่ไม่ค่อยมีใครเปิดให้ดูของการพัฒนาโมเดล AI นั่นคือแดชบอร์ดสาธารณะสำหรับการปรับแต่งหลังการฝึกด้วยการเรียนรู้แบบเสริมแรง (reinforcement learning: RL) ของโมเดลที่ยังไม่เปิดตัว 2 รุ่น ได้แก่ MiMo-V2.6-Pro และ MiMo-V2.6-Flash แทนที่จะเผยเพียงตาราง benchmark เมื่อทุกอย่างเสร็จแล้ว หน้านี้แสดงเทเลเมทรีบางส่วนระหว่างฝึก เช่น กราฟรางวัล จำนวน rollout เวลาในแต่ละสเต็ป ต้นทุนคอมพิวต์สะสม ผลประเมิน และเหตุการณ์ด้านโครงสร้างพื้นฐาน 1
8
ประเด็นสำคัญจึงไม่ใช่แดชบอร์ดนี้พิสูจน์ว่าโมเดลสุดท้ายเก่งเพียงใด แต่คือ Xiaomi กำลังทำให้การดำเนินงาน RL สำหรับเอเจนต์ขนาดใหญ่—ตั้งแต่ rollout, สภาพแวดล้อมงาน, การตรวจคำตอบ, การให้รางวัล, การอัปเดตโมเดล, ความขัดข้อง ไปจนถึงค่าใช้จ่าย—กลายเป็นสิ่งที่สาธารณชนพอจะสังเกตได้
รายงานเกี่ยวกับหน้าเว็บระบุว่า การรัน Pro และ Flash แบบคู่ขนานเริ่มขึ้นเมื่อวันที่ 15 กันยายน 2026 โดยแดชบอร์ดติดตามความคืบหน้าขณะที่โมเดลยังอยู่ระหว่างฝึก Xiaomi ยังไม่ได้ประกาศสเปกสุดท้าย ราคา หรือกำหนดเปิดให้ใช้งานสาธารณะของทั้งสองรุ่น 1
8
การตั้งค่าแบตช์ที่เปิดเผยมีขนาดใหญ่: 1,568 พรอมป์ต์ และ 16 rollout ต่อพรอมป์ต์ หรือราว 25,000 rollout และใช้ประมาณ 2 พันล้านโทเค็นต่อ RL หนึ่งสเต็ป ทั้งระบบทำงานแบบอะซิงโครนัสเต็มรูปแบบ 24
นี่ไม่ใช่ภาพของการปรับโมเดลจากคู่ข้อความที่มนุษย์ระบุความชอบแบบคงที่อย่างง่าย Luo Fuli หัวหน้าทีม MiMo อธิบายการขยายสเกลไว้ 3 ด้าน คือ
ในเชิงปฏิบัติ คำอธิบายนี้ชี้ไปยังขั้นตอนที่โมเดลสร้างการกระทำหรือคำตอบ นำไปทำงานจริงในสภาพแวดล้อมของโจทย์ รับผลสะท้อนกลับจากตัวตรวจหรือ rubric แล้วจึงอัปเดตจากสัญญาณดังกล่าว เมื่ออยู่ในระดับนี้ การสร้าง rollout และการรันตัวประเมินอาจสำคัญต่อการเดินระบบไม่แพ้ตัวออปติไมเซอร์
ระบบ RL แบบอะซิงโครนัสเปิดทางให้การสร้าง rollout การรันสภาพแวดล้อม การให้คะแนน และการอัปเดตโมเดลดำเนินไปพร้อมกัน โดยไม่ต้องให้ทุกส่วนรอภารกิจที่ช้าที่สุด แนวทางนี้มีความสำคัญกับงานเอเจนต์ที่ปะปนกัน เพราะบางงานอาจจบเร็ว ขณะที่บางงานต้องใช้เครื่องมือหลายขั้นตอนหรือมีต้นทุนการตรวจสูงกว่า
การที่ Xiaomi เน้น “คอมพิวต์ของผู้ตรวจให้คะแนน” ก็มีนัยสำคัญเช่นกัน งานเอเจนต์จำนวนมากวัดผลจากลำดับของการกระทำ ไม่ใช่คำตอบเพียงหนึ่งครั้ง การตัดสินว่ารางวัลควรถูกจัดสรรให้ขั้นตอนใดในลำดับนั้น—สิ่งที่ Xiaomi เรียกว่า agentic in-group credit assignment—จึงกลายเป็นส่วนหนึ่งของระบบฝึกโดยตรง 24
บทเรียนเชิงปฏิบัติการจากแดชบอร์ดคือ การขยาย RL สำหรับเอเจนต์ไม่ได้หมายถึงเพิ่ม GPU เพื่อฝึกโมเดลเท่านั้น แต่ต้องมีความจุของสภาพแวดล้อม ระบบ rollout และตัวตรวจคำตอบมากพอที่จะป้อนฟีดแบ็กที่มีประโยชน์กลับเข้าสู่วงจรฝึกได้ทัน
รายงานช่วงแรกที่อ้างอิงข้อมูลจากแดชบอร์ดระบุว่าค่าใช้จ่ายรวมมากกว่า 1.08 ล้านดอลลาร์สหรัฐในราว 36 ชั่วโมงหลัง Pro เริ่มฝึก หรือเฉลี่ยราว 30,000 ดอลลาร์ต่อชั่วโมงสำหรับทั้งสองการรัน 4 ภาพข้อมูลอื่นระบุ Pro ราว 830,000 ดอลลาร์ และ Flash ราว 360,000 ดอลลาร์ พร้อมบันทึกว่า Pro เคยเริ่มใหม่จากปัญหา VRAM ของโหนด ขณะที่ Flash เริ่มใหม่หลังพบข้อผิดพลาดในชุดข้อมูลที่สเต็ป 15
9
ตัวเลขเหล่านี้สะดุดตา แต่ควรตีความอย่างมีเงื่อนไข:
ถึงอย่างนั้น ตัวนับนี้ชี้ชัดว่า Xiaomi นำเสนอการรันดังกล่าวในฐานะงาน RL ออนไลน์ที่ใช้โครงสร้างพื้นฐานและงบประมาณสูง ไม่ใช่การทดลอง post-training ขนาดเล็ก
มีรายงานว่าแดชบอร์ดแสดงกราฟรางวัลและผลประเมินงานเขียนโค้ดระหว่างฝึก โดยภาพหนึ่งระบุคะแนน DeepSWE v1.1 ที่ 63.72 สำหรับ Pro และ 60.77 สำหรับ Flash 9
ข้อมูลเหล่านี้มีประโยชน์ในฐานะสัญญาณวินิจฉัย ไม่ใช่คำกล่าวอ้างความสามารถสุดท้าย กราฟรางวัลที่เพิ่มขึ้นอาจสอดคล้องกับการทำงานสำเร็จดีขึ้น แต่ก็อาจเกิดจากการเปลี่ยนส่วนผสมของงาน ความแปรปรวน พฤติกรรมของผู้ตรวจ การปรับให้เข้ากับสัญญาณรางวัล หรือการที่โมเดลเคยเห็น benchmark มาก่อน เช่นเดียวกับคะแนน benchmark ระหว่างทาง ซึ่งยังไม่ใช่ผลลัพธ์สุดท้าย หากไม่มีรายละเอียดโปรโตคอลประเมิน การตั้งค่าการสุ่มตัวอย่าง การควบคุมการปนเปื้อนของข้อมูล และวิธีเลือกเช็กพอยต์สุดท้ายที่ตรวจสอบได้
ดังนั้น การอ่านที่เหมาะสมคือ สตรีมนี้ช่วยให้เห็นว่าสัญญาณระหว่างฝึกเปลี่ยนอย่างไร แต่ยังไม่อาจบอกได้ด้วยตัวเองว่า MiMo-V2.6 ฉบับเสร็จสมบูรณ์จะทำงานได้ดีเพียงใดนอกชุดประเมินที่แสดง
Luo Fuli กล่าวว่า ทีมใช้เวลาเกือบครึ่งปีศึกษาคำถามเดียวว่า RL จะขยายสเกลได้ไกลแค่ไหน เธอระบุว่า MiMo-V2.6 ยังอยู่ระหว่างการรัน RL และ Xiaomi จะทยอยเปิดเผยรายละเอียดแบบโอเพนซอร์ส “ทีละส่วน” ในช่วงหลายสัปดาห์ถัดไป 24
นี่เป็นคำมั่นว่าจะเปิดเผยข้อมูลทางเทคนิคเพิ่มเติมที่มีนัยสำคัญ แต่ยังไม่ควรตีความว่าเป็นการปล่อยชุดข้อมูลเพื่อทำซ้ำได้ครบถ้วน เพราะคำกล่าวดังกล่าวไม่ได้รับปากว่าจะเปิดข้อมูลฝึกทั้งหมด พรอมป์ต์ น้ำหนักของผู้ตรวจ สภาพแวดล้อมงาน สถานะออปติไมเซอร์ ทุกเช็กพอยต์ หรือบันทึกคลัสเตอร์แบบเต็มรูปแบบ
ความโปร่งใสของ MiMo-V2.6 เน้นที่ การมองเห็นกระบวนการ Xiaomi เปิดเทเลเมทรีการปฏิบัติการบางส่วนจากการปรับแต่งหลังฝึกสำหรับภาษาและเอเจนต์ที่กำลังดำเนินอยู่
ส่วน Xiaomi-Robotics-U0 เป็นโครงการคนละประเภทและมีความเปิดกว้างอีกแบบหนึ่ง โดยเป็น world foundation model แบบออโตรีเกรสซีฟขนาด 38 พันล้านพารามิเตอร์ สำหรับ embodied intelligence ซึ่งรวมงานอย่างการสร้างภาพจากข้อความ การแก้ไขภาพ การสร้างฉากสำหรับ embodied AI การถ่ายโอนแบบ embodied และการสร้างวิดีโอแบบ embodied 25
34 คลังสาธารณะของ Xiaomi อธิบายถึงสื่อโมเดลและเฟรมเวิร์กที่เผยแพร่สำหรับโครงการนี้
32
สรุปความต่างได้ดังนี้:
ทั้งสองแบบมีคุณค่า แต่ไม่มีแบบใดรับประกันว่าจะมีทุกสิ่งที่จำเป็นต่อการทำซ้ำผลลัพธ์ทั้งหมดตั้งแต่ต้น
สตรีม MiMo เปิดเผยมากกว่าการประกาศคะแนน benchmark หลังงานเสร็จ แต่ยังมีคำถามสำคัญที่ตอบไม่ได้
แดชบอร์ดสาธารณะอาจอัปเดตใกล้เวลาจริงได้ แต่ก็อาจมีข้อมูลล่าช้า เติมย้อนหลัง แก้ไข หยุดชั่วคราว เริ่มใหม่ หรือมีการแทรกแซงด้วยมือ การมีอยู่ของหน้าเว็บนี้จึงเป็นหลักฐานของการเปิดเผยที่ไม่ธรรมดา ไม่ใช่หลักฐานเชิงเข้ารหัสว่าการฝึกดำเนินอย่างต่อเนื่องไม่มีสะดุด
จำนวนพรอมป์ต์ rollout โทเค็น และต้นทุนที่เผยแพร่ ไม่ได้พิสูจน์ว่าไม่มีผลลัพธ์จากโมเดลครู ข้อมูลกรรมสิทธิ์ ข้อมูลมนุษย์ที่ผ่านการคัดกรอง การปนเปื้อนจาก benchmark หรืออินพุตอื่นที่ไม่ได้แสดงบนแดชบอร์ด
หากไม่มีชุดทดสอบคงที่ ระบบประเมินที่เผยแพร่ การตั้งค่าการสุ่มตัวอย่าง การรันซ้ำด้วยหลาย seed และการทำซ้ำโดยอิสระ ทั้งกราฟรางวัลและผล DeepSWE ระหว่างทางก็ยังไม่อาจตัดสินความสามารถทั่วไปขั้นสุดท้ายของโมเดลได้
แดชบอร์ดแสดงความคืบหน้าและเหตุขัดข้องได้ แต่ไม่ได้เปิดส่วนผสมงานทั้งหมด น้ำหนักของรางวัล ความน่าเชื่อถือของผู้ตรวจ รายการฮาร์ดแวร์ วิธีคำนวณต้นทุนอย่างละเอียด ที่มาของข้อมูล หรือเกณฑ์เลือกเช็กพอยต์สุดท้าย
แดชบอร์ด MiMo-V2.6 ของ Xiaomi คือการทดลองด้านการสังเกตการณ์สาธารณะสำหรับ RL เอเจนต์ขนาดใหญ่ที่พบได้ไม่บ่อย การตั้งค่าที่เปิดเผย—ราว 2 พันล้านโทเค็นต่อสเต็ป, 1,568 พรอมป์ต์, 16 rollout แบบอะซิงโครนัสต่อพรอมป์ต์, สภาพแวดล้อมผสม และงานฝั่งผู้ตรวจให้คะแนนจำนวนมาก—สะท้อนว่า Xiaomi มองการขยาย RL เป็นปัญหาระดับระบบพอ ๆ กับปัญหาการฝึกโมเดล 24
ต้นทุนที่รายงาน กราฟรางวัล ภาพคะแนน benchmark และความล้มเหลวที่มองเห็นได้ ทำให้กระบวนการตรวจดูได้มากกว่าบล็อกเปิดตัวหลังเสร็จงาน แต่ทั้งหมดก็ยังเป็นเทเลเมทรีที่คัดเลือกและรายงานโดย Xiaomi จากการรันที่ยังไม่จบ แดชบอร์ดนี้จึงเป็นหลักฐานที่แข็งแรงของความโปร่งใสในการปฏิบัติการ—not หลักฐานอิสระของการฝึกสดอย่างต่อเนื่อง ที่มาข้อมูลฝึกทั้งหมด หรือคุณภาพของโมเดลฉบับสุดท้าย
Studio Global AI
หน้านี้รวมคำตอบที่ได้รับการสนับสนุนจากแหล่งที่มาซึ่งคุณสามารถดำเนินการต่อภายใน Studio Global
Xiaomi ถ่ายทอดสดเทเลเมทรีบางส่วนจากการฝึก RL ของ MiMo V2.6 Pro และ MiMo V2.6 Flash ซึ่งยังเป็นโมเดลที่พัฒนาไม่เสร็จ รวมถึงกราฟรางวัล จำนวน rollout เวลาแต่ละสเต็ป ต้นทุน และผลประเมินระหว่างทาง
Xiaomi ถ่ายทอดสดเทเลเมทรีบางส่วนจากการฝึก RL ของ MiMo V2.6 Pro และ MiMo V2.6 Flash ซึ่งยังเป็นโมเดลที่พัฒนาไม่เสร็จ รวมถึงกราฟรางวัล จำนวน rollout เวลาแต่ละสเต็ป ต้นทุน และผลประเมินระหว่างทาง ทีม MiMo ระบุว่าหนึ่งสเต็ปใช้ราว 2 พันล้านโทเค็น จาก 1,568 พรอมป์ต์ × 16 rollout แบบอะซิงโครนัส พร้อมขยายทั้งกำลังประมวลผล สภาพแวดล้อมเอเจนต์ และระบบผู้ตรวจให้คะแนน
แดชบอร์ดทำให้เห็นความคืบหน้า ต้นทุน และความผิดพลาดในการปฏิบัติการได้มากกว่าปกติ แต่ไม่ยืนยันความต่อเนื่องแบบสด แหล่งที่มาของข้อมูลฝึก หรือความสามารถสุดท้ายที่ตรวจสอบซ้ำโดยอิสระ