Xiaowei נבחן כעוזר AI מובנה בתוך WeChat, שאליו ניתן לפנות בטקסט או בקול כדי לבצע פעולות, לתקשר עם אנשי קשר ולהפעיל תוכניות־מיני — בלי לעבור לאפליקציית AI נפרדת כמו Yuanbao. משפחת WeLM התפתחה ממודל סיני צפוף של 10 מיליארד פרמטרים שהוצג ב־2022, אל WeLM 80B עם 80 מיליארד פרמטרים בסך הכול, אך כ־3 מיליארד פרמטרים פעילים...
Research answer

Create a landscape editorial hero image for this Studio Global article: How has WeChat’s gray tested Xiaowei assistant evolved from a native text and voice based agent embedded in WeChat—distinct from standalone. Article summary: Xiaowei’s significance is less that it is another chatbot than that it is being positioned as an in context agent inside WeChat: users can invoke it by text or voice, communicate with contacts, and launch mini programs r. Topic tags: general web, llm, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts
המשמעות של Xiaowei אינה רק השקה של צ'אטבוט נוסף. לפי הדיווחים, WeChat החלה לבדוק אותו בהפצה מוגבלת כעוזר AI מובנה באפליקציה: המשתמשים יכולים לפנות אליו בטקסט או בקול, לתקשר עם אנשי קשר, להשתמש בפונקציות של WeChat ולהפעיל שירותים מתוך רשת תוכניות־המיני — אפליקציות קלות שרצות בתוך WeChat. 15
במילים אחרות, המשתמש לא נדרש לעזוב את WeChat כדי להגיע ליעד AI נפרד, כפי שקורה באפליקציות עצמאיות כמו Yuanbao. הכיוון האסטרטגי המסתמן הוא AI כממשק לאנשים, לשירותים ולתוכניות שכבר נמצאים בתוך WeChat — ולא עוד "סופר־אפליקציית AI" שעומדת בפני עצמה.
השורשים של משפחת WeLM מגיעים למודל סיני צפוף בעל 10 מיליארד פרמטרים, שהוצג ב־2022 ודווח כבעל ביצועים חזקים ב־18 משימות. עם זאת, את פרטי המדדים המדויקים של אותה השוואה לא ניתן לאמת באופן עצמאי מתוך המקורות שנאספו כאן. 4
השלב העדכני יותר שנחשף הוא WeLM-80B — מודל בעל 80 מיליארד פרמטרים בסך הכול, שמבוסס על גישת Mixture of Experts, או MoE. בכל טוקן מופעלים בערך 3 מיליארד פרמטרים בלבד. המודל אומן על פחות מ־14 טריליון טוקנים, ולפי המידע שפורסם הוא תומך ביכולות הסקה, הבנה רב־לשונית והקשר באורך 128K טוקנים. 7
11
WeLM-80B כבר תואר כמודל שהוטמע ב־Xiaowei עבור שיחה, חיפוש, הפעלת פונקציות של WeChat וקריאה לשירותים של תוכניות־מיני. 8
9
השלב הבא הוא WeLM-617B. הוא כולל 617 מיליארד פרמטרים, אך מפעיל כ־23 מיליארד מהם בכל טוקן. נכון לעכשיו הוא מתואר כמודל שנמצא בפיתוח, ולא כמודל שהוטמע במלואו ב־Xiaowei. 8
9
12
הייעוד שלו הוא משימות מורכבות יותר באקוסיסטם של WeChat: הבנה והסקה כלליות מתקדמות, פיתוח חכם של תוכניות־מיני ויצירת כלים עבור Xiaowei. 8
9
12
במודל MoE יש כמה "מומחים" — רשתות משנה ייעודיות — ומנגנון ניתוב שבוחר בכל פעם רק קבוצה קטנה מהם עבור הטוקן הנוכחי. לכן ל־WeLM-80B יש מאגר קיבולת של 80 מיליארד פרמטרים, אך החישוב בכל טוקן מתבצע במסלול שקרוב יותר ל־3 מיליארד פרמטרים פעילים. אותו עיקרון חל על WeLM-617B: לא נדרשת הפעלה של כל 617 מיליארד הפרמטרים עבור כל טוקן.
עבור עוזר שאמור לטפל בכמויות עצומות של בקשות — חיפוש, הודעות, ניווט בשירותים והפעלת כלים — ההבדל משמעותי. הפחתת החישוב הפעיל עשויה לשפר את התפוקה ואת זמני התגובה ולהפחית את עלות ההגשה, תוך שמירה על מאגר רחב של מומחים ייעודיים. 7
8
אבל חשוב לדייק: "3 מיליארד פרמטרים פעילים" אינו אומר שמודל MoE של 80 מיליארד עולה בדיוק כמו מודל צפוף של 3 מיליארד. עדיין צריך לאחסן את משקלי המומחים, למקם אותם במערכת, לבצע ניתוב ולנהל תקשורת בין מאיצים. היתרון המרכזי הוא ירידה בכמות החישוב האריתמטי לכל טוקן — לא שירות חינמי.
Hidden Decoding מציעה דרך אחרת להגדיל את יכולת המודל. במקום להוסיף שכבות ל־Transformer או להרחיב את רוחבו, היא מרחיבה כל טוקן למספר זרמי חישוב פנימיים, שלכל אחד מהם טבלאות הטמעה נפרדות. המודל שומר את מצבי ה־KV של הזרמים הביניים כחלק מההקשר, ולכן כל טוקן יכול לעבור יותר חישוב לטנטי לפני שנוצר הפלט החיצוני — בלי להגדיל את ליבת ה־Transformer עצמה. 2
13
בניסויים מותאמים, צוות WeLM דיווח כי גרסאות HD4 של WeLM-80B ושל WeLM-617B השיגו תוצאות טובות יותר מגרסאות הבסיס המקבילות ללא Hidden Decoding. 1
6
המשמעות האפשרית עבור עוזר כמו Xiaowei היא לא בהכרח תשובות ארוכות יותר, אלא יותר "עבודה מאחורי הקלעים" לכל טוקן: תכנון, בחירת כלי, פירוק משימה והכנת רצף פעולות — בלי שהמשתמש יצטרך לראות את כל תהליך ההסקה.
אם פשוט משכפלים כל טוקן ל־(n) זרמים ומאפשרים לכל הזרמים להשתתף בקשב מלא זה מול זה, עלות הקשב בין הזרמים עלולה לגדול בקירוב בצורה ריבועית ב־(n). זה עלול להפוך את Hidden Decoding ליקר מדי דווקא במודלים גדולים.
Stream-Factorized Attention מתמודדת עם הבעיה באמצעות חלוקת העבודה: ברוב השכבות הקשב נשאר בתוך כל זרם, ורק במספר מצומצם של שכבות מתאפשר ערבוב בין הזרמים. כך העלות הנוספת מתקרבת יותר לגידול ליניארי מאשר לריבועי. לפי Tencent, זהו הרכיב שמאפשר לאמן ולהגיש את Hidden Decoding גם בקנה מידה של מודלי MoE עם יותר מ־100 מיליארד פרמטרים. 5
השילוב בין MoE דלילה לבין Hidden Decoding מצביע על אפשרות למודל הפעלה מדורג:
אם הרשאות, זהות משתמש, תשלומים, ממשקי תוכניות־המיני, בקרות אמינות והסכמה מפורשת יתוכננו כראוי, Xiaowei עשויה להפוך כוונה בשפה טבעית לרצף פעולות בתוך המשטח הקיים של WeChat: למצוא, להחליט, להפעיל ולהשלים.
זהו הבדל מהותי בין עוזר שמספק תשובות לבין שכבת הפעלה לאקוסיסטם שלם. עם זאת, מדובר במסקנה אסטרטגית המבוססת על כיוון הטכנולוגיה והפיצ'רים שדווחו — לא במפת דרכים רשמית שאושרה במלואה.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Xiaowei נבחן כעוזר AI מובנה בתוך WeChat, שאליו ניתן לפנות בטקסט או בקול כדי לבצע פעולות, לתקשר עם אנשי קשר ולהפעיל תוכניות־מיני — בלי לעבור לאפליקציית AI נפרדת כמו Yuanbao.
Xiaowei נבחן כעוזר AI מובנה בתוך WeChat, שאליו ניתן לפנות בטקסט או בקול כדי לבצע פעולות, לתקשר עם אנשי קשר ולהפעיל תוכניות־מיני — בלי לעבור לאפליקציית AI נפרדת כמו Yuanbao. משפחת WeLM התפתחה ממודל סיני צפוף של 10 מיליארד פרמטרים שהוצג ב־2022, אל WeLM 80B עם 80 מיליארד פרמטרים בסך הכול, אך כ־3 מיליארד פרמטרים פעילים בכל טוקן.
WeLM 617B, שנמצא עדיין בפיתוח, כולל 617 מיליארד פרמטרים בסך הכול וכ־23 מיליארד פרמטרים פעילים בכל שלב חישוב; הוא מיועד למשימות מורכבות יותר באקוסיסטם של WeChat.