WeLM-617B logo

WeLM-617B

打开

微信 AI 的 617B MoE 模型,每 token 激活 23B,通过 Hidden Decoding 首次在前沿规模验证序列长度扩展,驱动微信原生 AI 助手小微。

分享:

WeLM-617B 是 WeLM(WeChat Language Model)家族的前沿规模模型,由腾讯内部的微信 AI 团队研发。它采用稀疏 MoE 架构,总参数 6170 亿,每 token 激活 230 亿,于 2026 年 7 月 14 日随《Hidden Decoding at Scale》技术博客与 arXiv 论文首次公开亮相,是首个在 100B+ MoE 规模上得到验证的序列长度扩展方法。

模型规格

规格 WeLM-617B
架构 稀疏 MoE(512 个专家 + 1 个共享专家,top-10 路由)
总参数 617B
激活参数 23B
层数 94
上下文长度 原生 32K(扩展可达 256K)
训练 token 数 17.06T(基座);HD4 变体追加 0.90T
可用性 闭源权重;驱动微信小微助手

Hidden Decoding 规模化

Hidden Decoding 是一种在继续预训练阶段应用的序列长度扩展方法。它将每个 token 扩展为带独立嵌入表的并行流,让每个 token 获得更多内部计算,而无需新增或加宽 Transformer 层。WeLM-HD4-617B 变体(n=4)在全部九项共享基准上均优于普通的 WeLM-617B 自回归基线,而增量继续训练的成本仅约为基座模型完整训练预算的 5.3%(0.90T 对 17.06T token)。

基准亮点(早期、仅 SFT)

  • GPQA Diamond:89.1(HD4 为 91.2),HD4 变体领先 Kimi K2.6 的 90.4
  • HMMT:96.0(HD4 为 96.2)
  • PHYBench:75.3(HD4 为 76.3)
  • MMMLU:86.4(HD4 为 87.5)
  • FrontierMath:49.0(HD4 为 51.0)
  • SciCode:51.4(HD4 为 52.1)

微信生态集成

WeLM 驱动着微信原生 AI 助手小微,该助手自 2026 年 6 月起处于灰度测试。其核心模型为微信团队自研的 WeLM,复杂推理由 DeepSeek 补充。这一集成让它可以原生访问聊天记录、群聊、公众号文章、视频号、PDF 与 Office 文档,有望成为中国调用量最高的语言模型之一。

优势与局限

  • 效率优先的设计:高度稀疏的 MoE,以低延迟服务数十亿微信用户。
  • 强大的中文与多语言能力:针对中文互联网语境优化,支持中英混说。
  • 封闭生态:不像 Qwen 或 DeepSeek 那样开源权重,主要服务微信产品。
  • 公开基准有限:617B 的结果仅为早期 SFT 阶段,尚无 RL 后训练得分公布。

总结

WeLM-617B 代表了一种独特的扩展哲学:微信 AI 不是简单堆参数,而是把额外计算折叠进序列维度。尽管它仍然封闭且以微信为中心,其 Hidden Decoding 的成果标志着高效前沿规模扩展的切实技术里程碑,而通过小微,它已经触达数亿微信用户。

评论

还没有评论。成为第一个评论的人!