小微は単独のチャットアプリではなく、WeChat内でテキストや音声から検索、メッセージ、基本機能、小程序(ミニプログラム)を操作するネイティブAIエージェントとしてテストされている。 WeLM 80Bは総パラメータ約800億に対し、1トークンあたりの有効化パラメータは約30億。14兆トークン未満で学習され、推論、多言語理解、128Kコンテキストなどが報告されている。
研究の答え

Create a landscape editorial hero image for this Studio Global article: How has WeChat’s gray tested Xiaowei assistant evolved from a native text and voice based agent embedded in WeChat—distinct from standalone. Article summary: Xiaowei’s significance is less that it is another chatbot than that it is being positioned as an in context agent inside WeChat: users can invoke it by text or voice, communicate with contacts, and launch mini programs r. Topic tags: general web, llm, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts
WeChatで限定的な「グレースケールテスト」が始まったAIアシスタント「小微(Xiaowei)」の特徴は、単に新しいチャットボットを追加したことではない。WeChatの画面からテキストや音声で呼び出し、連絡先とのやり取り、検索、WeChatの基本機能、小程序(ミニプログラム)上のサービスまで、既存のアプリ内で実行させようとしている点にある。 15
17
19
つまり小微が目指すのは、Yuanbaoのような独立したAIアプリにユーザーを移動させることではなく、WeChatにすでに存在する人、サービス、決済、ミニプログラムのネットワークへ自然言語でアクセスするための「操作レイヤー」だと考えられる。
WeLM(WeChat Language Model)の系譜は、2022年に公開された中国語の100億パラメータ級モデルまでさかのぼる。18のタスクで強い性能を示したという説明は後続モデルの出発点として紹介されているが、今回確認できた資料だけでは、そのベンチマークの詳細を独立に検証できない。
現在、実運用に向けた段階として明確に示されているのがWeLM-80Bだ。総パラメータは約800億だが、1トークンの処理で実際に有効化されるのは約30億。14兆トークン未満のデータで学習され、推論、多言語理解、128Kのコンテキストに対応すると報告されている。 7
11
このモデルは小微の会話や検索、WeChatのネイティブ機能の呼び出し、ミニプログラムの起動を支えるモデルとして報じられている。 8
9
12
一方、WeLM-617Bは総パラメータ約6170億、1トークンあたり約230億を有効化する次の階層だ。より強い一般的な意味理解や論理推論を担い、複雑なミニプログラムの開発、小微向けツールの自動生成などを想定している。ただし、617Bはなお開発中とされており、完成済みで小微に本格展開されたモデルとみなすことはできない。 8
9
12
WeLM-80BやWeLM-617Bで注目されるのが、疎なMoE(Mixture of Experts、混合専門家)構成だ。MoEでは、モデル全体に多数の専門家ネットワークを用意し、ルーターが入力トークンごとに必要な一部の専門家を選ぶ。
そのため、WeLM-80Bは800億パラメータ分の容量を持ちながら、各トークンではおよそ30億パラメータに相当する経路を中心に計算できる。同様に、6170億パラメータのモデルでも、毎回すべてを動かす必要はなく、約230億を有効化する設計になる。 7
8
この仕組みは、検索、メッセージ作成、サービス案内、ツール呼び出しのような、1件ごとの処理は比較的軽くても発生頻度が非常に高いタスクで意味を持つ。大規模なユーザー基盤から大量のリクエストが届く場合、毎回モデル全体を計算するよりも、1トークンごとの演算量を抑えたほうが、処理能力、応答速度、推論コストを管理しやすいからだ。
ただし、「3B有効化」は「密な3Bモデルとまったく同じコスト」という意味ではない。80B分の専門家重みを保持するためのメモリー、モデルの配置、ルーティング、GPU間通信などの負担は残る。疎性が主に削減するのは、トークンごとの演算量であり、提供コストをゼロにするものではない。
WeLMの拡張でさらに注目されるのが、Hidden Decodingだ。一般的なスケーリングでは、Transformerの層を増やしたり、隠れ次元を広げたりしてモデルの計算能力を高める。Hidden Decodingは別の道を取る。
入力された1つのトークンを複数の内部ストリームに展開し、それぞれに独立した埋め込みを与える。中間ストリームのキー・バリュー(KV)状態も文脈として保持することで、外部に新しいトークンを逐次出力することなく、1トークンあたりの潜在的な計算を増やす。しかも、メインのTransformer本体を単純に深くしたり、横に広げたりする必要がない。 2
Tencent側の報告では、同じ基盤モデルと比較した実験で、Hidden Decodingを4ストリームに拡張したWeLM-HD4-80BとWeLM-HD4-617Bが、それぞれ対応する通常版のベースラインを上回ったとされる。 1
6
ただし、トークンを単純に複数ストリームへ分けるだけでは、ストリーム間の注意計算が大きく膨らむ。ストリーム数をnとすると、すべてのストリームが互いに注意を向ける設計では、追加コストが概ねn²に近づく可能性がある。
そこで使われるのがStream-Factorized Attentionだ。多くの層では各ストリーム内の処理に限定し、ストリーム間の情報交換は一部の層に絞る。これにより、ストリーム数を増やしたときの追加の注意計算を、二次的な増加からおおむね線形に近い増加へ抑える。Tencentは、この設計によってHidden Decodingを100B超のMoE規模で学習・提供できるようになると説明している。 5
疎なMoEとHidden Decodingを組み合わせると、WeChatには段階的なモデル運用が見えてくる。日常的で頻度の高い検索やサービス操作には、WeLM-80Bのような効率重視のモデルを使う。複雑な計画、ツールの選択、複数ステップの処理、ミニプログラム開発には、より大きなモデルや、Hidden Decodingによって増やした内部計算を振り向ける――という考え方だ。
この構想が実際のサービスとして機能するには、モデル性能だけでなく、権限管理、本人確認、決済、ミニプログラムAPI、失敗時の制御、ユーザーの同意が欠かせない。それらが適切に設計されれば、ユーザーは「探す、判断する、呼び出す、完了する」という一連の操作を、自然言語でWeChat内に依頼できるようになる。
これは、別のAIスーパーアプリへユーザーを移すのではなく、すでに使われているWeChatそのものにAIを重ねる発想だ。小微が将来、WeChatの人間関係やサービス網を横断してどこまで実行できるようになるかはまだ確定していない。しかし、WeLMの進化とHidden Decodingの研究が示しているのは、TencentがAIを単独の行き先ではなく、既存エコシステムを動かす基盤として捉え始めている可能性である。最後の見立ては、確認済みの製品ロードマップではなく、公開情報から導ける戦略上の推論だ。
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
小微は単独のチャットアプリではなく、WeChat内でテキストや音声から検索、メッセージ、基本機能、小程序(ミニプログラム)を操作するネイティブAIエージェントとしてテストされている。
小微は単独のチャットアプリではなく、WeChat内でテキストや音声から検索、メッセージ、基本機能、小程序(ミニプログラム)を操作するネイティブAIエージェントとしてテストされている。 WeLM 80Bは総パラメータ約800億に対し、1トークンあたりの有効化パラメータは約30億。14兆トークン未満で学習され、推論、多言語理解、128Kコンテキストなどが報告されている。
WeLM 617Bは総パラメータ約6170億、1トークンあたり約230億を有効化するモデルだが、現時点では開発中で、小微に全面展開されたモデルとは確認されていない。