Xiaowei อยู่ระหว่างการทดสอบแบบจำกัดใน WeChat ผู้ใช้ที่ได้รับสิทธิ์สามารถสั่งงานด้วยข้อความหรือเสียง รวมถึงติดต่อผู้คนและเรียกใช้มินิโปรแกรมได้ [15][17][19] WeLM 80B มีพารามิเตอร์รวม 8 หมื่นล้าน แต่เปิดใช้งานราว 3 พันล้านพารามิเตอร์ต่อโทเคน และมีรายงานว่าถูกนำไปขับเคลื่อน Xiaowei สำหรับการสนทนา การค้นหา และการเรียกใช...
คำตอบการวิจัย

Create a landscape editorial hero image for this Studio Global article: How has WeChat’s gray tested Xiaowei assistant evolved from a native text and voice based agent embedded in WeChat—distinct from standalone. Article summary: Xiaowei’s significance is less that it is another chatbot than that it is being positioned as an in context agent inside WeChat: users can invoke it by text or voice, communicate with contacts, and launch mini programs r. Topic tags: general web, llm, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts
Xiaowei มีความหมายมากกว่าการเป็นผู้ช่วยถาม-ตอบทั่วไป เพราะ Tencent กำลังวางมันไว้เป็นผู้ช่วย AI แบบเนทีฟที่ฝังอยู่ใน WeChat ไม่ใช่แอปปลายทางแยกต่างหากอย่าง Yuanbao ผู้ใช้ที่ได้รับสิทธิ์ในการทดสอบสามารถโต้ตอบด้วยข้อความหรือเสียง และให้ระบบช่วยสื่อสารกับผู้ติดต่อ เรียกใช้ฟังก์ชันของ WeChat หรือเปิดบริการจากเครือข่ายมินิโปรแกรมได้ 15
17
19
ดังนั้น ทิศทางเชิงกลยุทธ์ที่เห็นได้ชัดกว่าการสร้าง “ซูเปอร์แอป AI” ใหม่ คือการทำให้ AI เป็นอินเทอร์เฟซสำหรับกราฟเดิมของ WeChat ซึ่งประกอบด้วยผู้คน บริการดิจิทัล และมินิโปรแกรมจำนวนมาก กล่าวง่าย ๆ คือ ผู้ใช้บอกความต้องการเป็นภาษาธรรมชาติ แล้ว Xiaowei ช่วยพาไปสู่การค้นหา การตัดสินใจ และการลงมือทำภายในระบบเดิม
สายพัฒนาของ WeLM ย้อนไปถึงโมเดลภาษาจีนแบบหนาแน่นขนาด 10 พันล้านพารามิเตอร์ที่เปิดตัวในปี 2022 โดยมีการรายงานว่าทำผลงานได้ดีในงานทดสอบ 18 รายการ อย่างไรก็ตาม รายละเอียดตัวเลขเบนช์มาร์กดังกล่าวยังไม่สามารถตรวจสอบยืนยันได้โดยอิสระจากแหล่งข้อมูลที่ดึงมาในครั้งนี้ 4
ก้าวที่เปิดเผยชัดเจนในปัจจุบันคือ WeLM-80B ซึ่งมีพารามิเตอร์รวม 8 หมื่นล้าน และใช้สถาปัตยกรรม Mixture of Experts หรือ MoE แบบเบาบาง (Sparse MoE) โดยในแต่ละโทเคนจะเปิดใช้งานพารามิเตอร์ประมาณ 3 พันล้านเท่านั้น โมเดลนี้ฝึกด้วยข้อมูลน้อยกว่า 14 ล้านล้านโทเคน และมีการระบุความสามารถด้านการให้เหตุผล ความเข้าใจหลายภาษา และบริบทขนาด 128K โทเคน 7
11
มีรายงานว่า WeLM-80B ถูกนำไปใช้งานกับ Xiaowei แล้ว โดยรองรับการสนทนา การค้นหา การเรียกใช้ฟังก์ชันพื้นฐานของ WeChat และการเปิดบริการมินิโปรแกรม 8
9 นั่นทำให้โมเดลไม่ได้มีหน้าที่เพียง “ตอบคำถาม” แต่ยังต้องเข้าใจเจตนาของผู้ใช้ เลือกเครื่องมือที่เหมาะสม และส่งต่อคำสั่งไปยังบริการต่าง ๆ ในระบบนิเวศของ WeChat
รุ่นถัดไปคือ WeLM-617B ซึ่งมีพารามิเตอร์รวม 6.17 แสนล้าน และเปิดใช้งานประมาณ 2.3 หมื่นล้านพารามิเตอร์ต่อโทเคน โดยยังคงแนวคิด Sparse MoE เพื่อลดภาระการคำนวณเมื่อเทียบกับการเปิดใช้พารามิเตอร์ทั้งหมดพร้อมกัน 8
9
12
จุดสำคัญคือ WeLM-617B ยังถูกระบุว่าอยู่ระหว่างการพัฒนา ไม่ควรตีความว่าเป็นโมเดลที่ติดตั้งใช้งานกับ Xiaowei อย่างเต็มรูปแบบแล้ว เป้าหมายของรุ่นนี้คือเพิ่มความสามารถด้านความเข้าใจทั่วไปและการให้เหตุผล เพื่อรองรับงานที่ซับซ้อนกว่าในระบบนิเวศ WeChat เช่น การพัฒนามินิโปรแกรมอย่างชาญฉลาด และการสร้างเครื่องมือเสริมให้ Xiaowei 8
9
12
ภาพที่ได้จึงคล้ายการแบ่งงานเป็นหลายระดับ: ใช้ WeLM-80B กับคำขอทั่วไปที่เกิดขึ้นจำนวนมาก และเก็บโมเดลขนาดใหญ่กว่าหรือกำลังประมวลผลเพิ่มเติมไว้สำหรับการวางแผนหลายขั้นตอน การเลือกเครื่องมือ การเขียนโค้ด หรือการจัดการงานที่มีความซับซ้อนสูง
ในโมเดล MoE จะมีตัวจัดเส้นทางหรือ router เลือก “ผู้เชี่ยวชาญ” เพียงบางส่วนให้ทำงานกับโทเคนแต่ละตัว ผลคือ WeLM-80B สามารถมีคลังพารามิเตอร์ขนาด 8 หมื่นล้านเพื่อเก็บความสามารถที่หลากหลาย แต่ใช้การคำนวณต่อโทเคนใกล้เคียงเส้นทางที่เปิดใช้งานประมาณ 3 พันล้านพารามิเตอร์ ส่วน WeLM-617B ก็ไม่จำเป็นต้องประมวลผลพารามิเตอร์ทั้ง 6.17 แสนล้านทุกครั้ง 7
8
ข้อได้เปรียบนี้มีความหมายอย่างมากสำหรับผู้ช่วยที่ต้องรองรับคำขอถี่ ๆ เช่น ค้นหาข้อมูล ส่งข้อความ นำทางไปยังบริการ หรือเรียกใช้เครื่องมือ จากผู้ใช้จำนวนหลายร้อยล้านถึงระดับพันล้านคน การลดจำนวนพารามิเตอร์ที่ทำงานในแต่ละโทเคนช่วยเพิ่มปริมาณงานที่ระบบรองรับได้ ลดเวลาแฝง และลดต้นทุนการให้บริการ ขณะเดียวกันก็ยังคงความจุรวมขนาดใหญ่ไว้สำหรับงานที่ต้องใช้ความเชี่ยวชาญเฉพาะด้าน 7
8
แต่คำว่า “เปิดใช้งาน 3 พันล้านพารามิเตอร์” ไม่ได้หมายความว่า WeLM-80B จะมีต้นทุนเท่ากับโมเดลหนาแน่นขนาด 3 พันล้านแบบตรง ๆ ระบบยังต้องจัดเก็บน้ำหนักของผู้เชี่ยวชาญทั้งหมด รวมถึงรับภาระด้านการวางโมเดล การทำงานของ router และการสื่อสารระหว่างอุปกรณ์ ประโยชน์หลักจึงอยู่ที่การลดการคำนวณเลขคณิตต่อโทเคน ทำให้การประมวลผลในปริมาณสูงมีความเป็นไปได้มากขึ้น ไม่ใช่ทำให้ต้นทุนหายไปทั้งหมด
อีกแนวคิดที่ทีม WeLM กำลังสำรวจคือ Hidden Decoding แทนที่จะเพิ่มจำนวนชั้นหรือขยายความกว้างของ Transformer ซึ่งมักทำให้ต้นทุนหน่วยความจำและการประมวลผลสูงขึ้น วิธีนี้จะแตกโทเคนอินพุตแต่ละตัวออกเป็นหลายสตรีมภายใน แต่ละสตรีมมีตารางเอ็มเบดดิงของตัวเอง และเก็บสถานะคีย์-แวลู หรือ KV ของสตรีมระหว่างทางไว้เป็นบริบท 2
13
ในเชิงแนวคิด โทเคนที่ผู้ใช้มองเห็นยังไม่ได้เพิ่มขึ้นตามจำนวนสตรีมทั้งหมด แต่โมเดลมีพื้นที่คำนวณแฝงมากขึ้นต่อโทเคนภายนอก โดยไม่ต้องเพิ่มขนาดแกน Transformer หลัก ทีมงานรายงานว่าโมเดล WeLM-HD4-80B และ WeLM-HD4-617B ซึ่งใช้การขยาย 4 สตรีม ทำผลงานได้ดีกว่าเบสไลน์ที่จับคู่กันในการทดลอง 1
12
อย่างไรก็ตาม ผลการทดลอง Hidden Decoding ไม่ควรถูกตีความว่า Xiaowei ใช้รุ่น HD เหล่านี้ในการให้บริการจริงแล้ว แหล่งข้อมูลที่เปิดเผยระบุถึงการฝึกและการเปรียบเทียบโมเดลในระดับงานวิจัย ขณะที่ WeLM-80B เป็นรุ่นที่มีรายงานชัดเจนว่าถูกนำไปใช้งานกับ Xiaowei
หากนำโทเคนทุกตัวไปคูณเป็นหลายสตรีม แล้วปล่อยให้ทุกสตรีมสนใจข้ามกันอย่างเต็มรูปแบบ ต้นทุนของการทำ attention ระหว่างสตรีมจะเพิ่มขึ้นประมาณกำลังสองตามจำนวนสตรีม ซึ่งอาจทำให้วิธีนี้แพงเกินไปเมื่อใช้กับโมเดล MoE ขนาดกว่า 1 แสนล้านพารามิเตอร์
Stream-Factorized Attention แก้ปัญหาด้วยการให้เลเยอร์ส่วนใหญ่ประมวลผลภายในสตรีมของตัวเอง และอนุญาตให้สตรีมต่าง ๆ แลกเปลี่ยนข้อมูลกันในเพียงบางเลเยอร์ ต้นทุน attention เพิ่มเติมจึงเข้าใกล้การเติบโตแบบเชิงเส้นมากกว่าแบบกำลังสอง Tencent ระบุว่าการออกแบบนี้เป็นองค์ประกอบสำคัญที่ทำให้ Hidden Decoding สามารถฝึกและให้บริการบนสเกล MoE ระดับ 100B ขึ้นไปได้ 5
เมื่อพิจารณา Sparse MoE ควบคู่กับ Hidden Decoding ภาพอนาคตที่เป็นไปได้คือระบบปฏิบัติการ AI แบบหลายระดับ: ใช้เส้นทาง WeLM-80B-A3B ที่มีประสิทธิภาพกับการโต้ตอบทั่วไปซึ่งเกิดขึ้นตลอดเวลา และเพิ่มความสามารถของโมเดลหรือการคำนวณแฝงเมื่อเจองานที่ต้องวางแผน เลือกเครื่องมือ หรือทำงานต่อเนื่องหลายขั้นตอน
หากออกแบบสิทธิ์การเข้าถึง ตัวตน การชำระเงิน API ของมินิโปรแกรม ระบบตรวจสอบความน่าเชื่อถือ และการขอความยินยอมของผู้ใช้ได้ดี Xiaowei ก็อาจเปลี่ยนคำสั่งภาษาธรรมชาติให้เป็นการกระทำบนบริการเดิมของ WeChat ตั้งแต่ “ค้นหา” “ตัดสินใจ” “เรียกใช้” ไปจนถึง “ทำรายการให้เสร็จ” โดยไม่ต้องให้ผู้ใช้ย้ายไปยังแอป AI แบบซูเปอร์แอปอีกแห่ง
ข้อสรุปหลังนี้เป็นการอนุมานเชิงกลยุทธ์จากทิศทางเทคโนโลยีและการวางตำแหน่งผลิตภัณฑ์ ไม่ใช่แผนงานผลิตภัณฑ์ที่ Tencent ยืนยันอย่างเป็นทางการแล้ว
Studio Global AI
หน้านี้รวมคำตอบที่ได้รับการสนับสนุนจากแหล่งที่มาซึ่งคุณสามารถดำเนินการต่อภายใน Studio Global
Xiaowei อยู่ระหว่างการทดสอบแบบจำกัดใน WeChat ผู้ใช้ที่ได้รับสิทธิ์สามารถสั่งงานด้วยข้อความหรือเสียง รวมถึงติดต่อผู้คนและเรียกใช้มินิโปรแกรมได้ [15][17][19]
Xiaowei อยู่ระหว่างการทดสอบแบบจำกัดใน WeChat ผู้ใช้ที่ได้รับสิทธิ์สามารถสั่งงานด้วยข้อความหรือเสียง รวมถึงติดต่อผู้คนและเรียกใช้มินิโปรแกรมได้ [15][17][19] WeLM 80B มีพารามิเตอร์รวม 8 หมื่นล้าน แต่เปิดใช้งานราว 3 พันล้านพารามิเตอร์ต่อโทเคน และมีรายงานว่าถูกนำไปขับเคลื่อน Xiaowei สำหรับการสนทนา การค้นหา และการเรียกใช้บริการใน WeChat [7][8][9]
WeLM 617B ขยายขนาดเป็น 6.17 แสนล้านพารามิเตอร์ โดยเปิดใช้งานประมาณ 2.3 หมื่นล้านต่อโทเคน แต่ยังอยู่ระหว่างการพัฒนาและมุ่งรองรับงานที่ซับซ้อนกว่า เช่น การพัฒนามินิโปรแกรมและการสร้างเครื่องมือให้ Xiaowei [8][9][12]