小微的变化:重点不是“再做一个聊天框”
微信正在小范围灰度测试原生 AI 助手“小微”。与元宝等独立 AI 应用不同,小微直接嵌入微信,用户可以通过文字或语音与它交流,并让它联系好友、调用微信原生功能或唤起小程序服务。
15
这意味着,小微的核心价值不只是回答问题,而是成为微信现有服务网络的“操作入口”:用户不必先判断该打开哪个小程序、在哪个菜单里寻找功能,而是可以用自然语言表达意图,再由智能体完成搜索、选择、调用和执行。
WeLM 的模型演进:从 100 亿参数到 80B 和 617B
WeLM 的早期版本可以追溯到 2022 年发布的 100 亿参数中文模型。相关资料称,该模型在 18 项任务上表现突出,但目前检索到的来源不足以让我独立核验这些具体基准数据,因此这里仅将其视为 WeLM 家族的历史起点,而不是重新确认其 benchmark 结果。
目前公开信息中更受关注的是 WeLM-80B。该模型拥有约 800 亿总参数,每个 token 实际激活约 30 亿参数;据披露,它使用不足 14 万亿 token 的数据训练,并具备推理、多语言理解和 128K 上下文能力。
7
11 WeLM-80B 已被报道部署在微信原生 AI 助手小微中,支持对话与搜索、调用微信基础功能以及访问小程序服务。
8
9
更大的 WeLM-617B 总参数达到约 6170 亿,每个 token 激活约 230 亿参数,同样采用混合专家架构。不过,617B 目前仍被描述为研发中的模型,不能视为已经全面部署在小微上。其目标是处理微信生态中的高复杂度任务,例如增强通用语义理解和逻辑推理、智能开发小程序,以及自动生成小微配套工具。
8
9
12
为什么稀疏 MoE 对微信规模的服务很重要?
混合专家模型(Mixture of Experts,MoE)可以理解为一个由多个“专家网络”组成的模型集合。面对每个 token,路由器只选择其中一小部分专家参与计算,而不是让所有参数同时运行。
因此,WeLM-80B 虽然拥有 800 亿参数的容量,但单个 token 的主要计算路径约为 30 亿激活参数;WeLM-617B 也不需要在每次推理时完整执行 6170 亿参数。这样的设计可以在扩大模型知识和能力容量的同时,控制单次请求的计算量。
7
8
对于需要处理大量高频请求的微信生态而言,这一点尤其关键。搜索、消息处理、服务导航和工具调用,往往是单次价值不高、但调用次数极其密集的任务。较少的激活参数有助于提高吞吐量、降低延迟,并减轻推理服务成本,让 AI 更有可能覆盖大规模用户,而不只是服务少数复杂问答场景。
但“每次激活 30 亿参数”并不等于“运行成本与一个稠密 30 亿参数模型完全相同”。完整的专家权重仍然需要存储和部署,路由、显存占用、设备间通信以及负载均衡都会带来额外开销。稀疏 MoE 的主要优势,是减少每个 token 的算术计算,而不是让超大模型变得零成本。
Hidden Decoding:不把 Transformer 做得更深或更宽
微信团队还在探索另一条扩展路径:Hidden Decoding。它不是简单增加 Transformer 的层数或宽度,而是把一个输入 token 扩展成多个带有独立嵌入的内部流,并保留这些中间流的键值缓存(KV cache)作为后续上下文。这样一来,每个对外生成的 token 都可以获得更多潜在空间中的内部计算,而不必同步扩大主干 Transformer。
2
13
在对齐的对照实验中,团队报告称,采用四路扩展的 WeLM-HD4-80B 和 WeLM-HD4-617B 均优于各自未采用 Hidden Decoding 的基线模型。
1
12这说明,增加模型能力不一定只有“堆更多层、堆更宽网络”这一条路,也可以尝试沿序列或潜空间增加计算深度。
当然,这项技术目前更适合被理解为模型和系统层面的扩展研究,而不是已经确认的小微产品功能。它能否在真实用户请求中稳定带来更高质量、更低延迟或更低成本,还取决于部署方式、任务类型和工程权衡。
Stream-Factorized Attention 为什么是关键配套?
如果把每个 token 复制成 (n) 个流,并让所有流在每一层都进行完整的跨流注意力计算,注意力开销可能随着流数量近似按平方增长。这样做会迅速抵消 Hidden Decoding 带来的收益。
Stream-Factorized Attention 的思路是:大多数层只在各自的流内进行注意力计算,只有少数层允许不同流之间交换信息。这样可以把新增的注意力成本从近似二次增长压低到更接近线性增长。腾讯方面称,这种设计使 Hidden Decoding 在 100B 以上的 MoE 规模上具备可训练、可服务的工程可行性。
5
换句话说,Hidden Decoding 负责增加潜在计算,Stream-Factorized Attention 则负责控制多流结构带来的系统成本。两者结合,才有机会把“理论上更强”转化为“实际可部署”。
小微可能成为微信的“自然语言操作层”
从技术路线看,稀疏 MoE 与 Hidden Decoding 共同指向一种分层的运行模式:
- 日常、高频、相对简单的请求,交给激活成本较低的 WeLM-80B 一类模型;
- 更复杂的规划、推理、工具选择和多步骤工作流,再交给更强的模型或分配更多潜在计算;
- 最终通过微信的身份体系、权限机制、支付能力、小程序 API 和服务网络,把回答转化为具体操作。
这也是小微与独立 AI 超级应用之间最重要的区别。独立应用通常需要用户迁移到一个新的入口;小微则可能直接利用微信已有的人、服务和小程序网络,把“帮我找”“帮我决定”“帮我调用”“帮我完成”串成一条连续流程。
15
如果这些能力能够在权限确认、隐私保护、操作可靠性和用户授权方面做好设计,AI 就不只是微信里的一个功能,而可能成为微信生态之上的自然语言操作层。
不过,这一结论目前仍属于基于公开技术方向的战略推断,并非腾讯已经公布的完整产品路线图。小微仍处于灰度测试阶段,WeLM-617B 也仍在研发中;最终的开放范围、功能边界和实际体验,仍有待后续产品信息确认。