最近,微信开始灰度测试原生 AI 助手“小微”。
与元宝这类独立 AI 应用不同,小微直接长在微信里,用户可以通过文字或语音告诉它自己想做什么,然后由它调用微信里的功能和服务完成任务。
用户可以从微信首页左上角的小微入口进入。从产品形态来看,小微并不是传统意义上的聊天机器人,更接近一个嵌入微信生态的消费级 Agent。
而小微之所以能够做这些事情,背后有一个很多普通用户并不熟悉的名字:WeLM。
昨天,微信低调的对其进行了推介。

WeLM 是微信 AI 团队长期研发的大语言模型。
但这个名字并不是最近才出现。2022 年,微信 AI 团队就发布过 WeLM,当时是一款 10B 参数的中文预训练语言模型。
论文显示,它在 18 项中文任务上表现突出,并在部分任务中达到甚至超过规模大得多的模型表现。
但今天小微背后的 WeLM,已经经历了几轮升级。
微信 AI 团队目前已经将 WeLM 推进到稀疏 MoE 架构。
资料显示,WeLM-80B 总参数达到 800 亿,但每个 token 实际激活的参数只有约 30 亿;模型使用不足 14 万亿 的数据进行训练,并具备推理、多语言理解以及 128K 上下文能力。

80B 是模型拥有的总参数量,而 3B 是一次推理过程中真正参与计算的参数规模。通过 MoE混合专家架构,模型可以保留更大的参数容量,同时只激活其中一部分专家,从而降低实际计算成本。
对于微信这种拥有超大用户规模、每天需要处理海量请求的产品,这种设计尤其重要。
因为微信需要的不是一个偶尔使用的“大模型”,而是一个能够被数亿甚至十亿级用户高频调用的 AI 基础设施。模型每一次回答节省一点计算,都可能转化为巨大的基础设施成本差异。
而微信 AI 团队显然并没有停留在 80B。WeLM 已经出现了 617B 参数的版本。
WeLM-617B 总参数达到 6170 亿,但激活参数为 230 亿,同样采用 MoE 架构。

在之前的论文里可看到,微信团队没有简单地通过继续堆参数来提升能力,而是在探索一种新的 方法—— 。
简单理解,传统的大模型 往往是把模型做得更大,或者让模型在回答前进行更长的“思考”。
探索的是另一种方式:模型主体基本不变,但让每个 token 在内部进行更多计算。
微信团队把一个 token 在序列维度上扩展成多个 ,让模型可以利用额外的隐藏计算完成更多推理,同时不需要增加 的层数或宽度。
为了控制计算成本,团队又设计了 - ,将随着 数量增加而产生的 开销从平方级降低到近似线性增长。
这些无疑都是适合微信生态巨量用户基础的技术路径。
小微+WeLM,让人可以思考的是,微信不一定需要再做一个超级 AI App,它完全可以直接把 AI 变成微信本身的操作层。
又一企业直播机器人分拣包裹:1小时拣了1816件,准确率超9
自变量机器人完成1小时全自主物流分拣直播,处理1816件包裹...(140 )人阅读时间:2026-08-13
微信“小微”背后的AI模型WeLM低调现身
微信灰度测试原生AI助手“小微”,通过文字或语音调用微信功能...(144 )人阅读时间:2026-08-13
宇树 IPO 狂欢背后:人形机器人“贫富悬殊”
宇树科技科创板IPO网上中签率仅0.01809759%,创科...(100 )人阅读时间:2026-08-13
打印假牙的90后,抢了拓竹一步
虎嗅科技组推出“硬件100”栏目,关注AI硬件创新。3D打印...(95 )人阅读时间:2026-08-13