WeLM-617B 是 WeLM(WeChat Language Model)家族的前沿规模模型,由腾讯内部的微信 AI 团队研发。它采用稀疏 MoE 架构,总参数 6170 亿,每 token 激活 230 亿,于 2026 年 7 月 14 日随《Hidden Decoding at Scale》技术博客与 arXiv 论文首次公开亮相,是首个在 100B+ MoE 规模上得到验证的序列长度扩展方法。
模型规格
| 规格 | WeLM-617B |
|---|---|
| 架构 | 稀疏 MoE(512 个专家 + 1 个共享专家,top-10 路由) |
| 总参数 | 617B |
| 激活参数 | 23B |
| 层数 | 94 |
| 上下文长度 | 原生 32K(扩展可达 256K) |
| 训练 token 数 | 17.06T(基座);HD4 变体追加 0.90T |
| 可用性 | 闭源权重;驱动微信小微助手 |
Hidden Decoding 规模化
Hidden Decoding 是一种在继续预训练阶段应用的序列长度扩展方法。它将每个 token 扩展为带独立嵌入表的并行流,让每个 token 获得更多内部计算,而无需新增或加宽 Transformer 层。WeLM-HD4-617B 变体(n=4)在全部九项共享基准上均优于普通的 WeLM-617B 自回归基线,而增量继续训练的成本仅约为基座模型完整训练预算的 5.3%(0.90T 对 17.06T token)。
基准亮点(早期、仅 SFT)
- GPQA Diamond:89.1(HD4 为 91.2),HD4 变体领先 Kimi K2.6 的 90.4
- HMMT:96.0(HD4 为 96.2)
- PHYBench:75.3(HD4 为 76.3)
- MMMLU:86.4(HD4 为 87.5)
- FrontierMath:49.0(HD4 为 51.0)
- SciCode:51.4(HD4 为 52.1)
微信生态集成
WeLM 驱动着微信原生 AI 助手小微,该助手自 2026 年 6 月起处于灰度测试。其核心模型为微信团队自研的 WeLM,复杂推理由 DeepSeek 补充。这一集成让它可以原生访问聊天记录、群聊、公众号文章、视频号、PDF 与 Office 文档,有望成为中国调用量最高的语言模型之一。
优势与局限
- 效率优先的设计:高度稀疏的 MoE,以低延迟服务数十亿微信用户。
- 强大的中文与多语言能力:针对中文互联网语境优化,支持中英混说。
- 封闭生态:不像 Qwen 或 DeepSeek 那样开源权重,主要服务微信产品。
- 公开基准有限:617B 的结果仅为早期 SFT 阶段,尚无 RL 后训练得分公布。
总结
WeLM-617B 代表了一种独特的扩展哲学:微信 AI 不是简单堆参数,而是把额外计算折叠进序列维度。尽管它仍然封闭且以微信为中心,其 Hidden Decoding 的成果标志着高效前沿规模扩展的切实技术里程碑,而通过小微,它已经触达数亿微信用户。
评论
还没有评论。成为第一个评论的人!
相关工具
DeepSeek V4 Pro 0813
www.deepseek.com
DeepSeek 旗舰 1.6T MoE 模型,激活参数 49B,1M token 上下文,MIT 协议开源权重,LiveCodeBench 编码得分全球第一,定价仅为封闭前沿模型的零头。
Kimi K3
www.kimi.com
月之暗面(Moonshot AI)开源的 2.8T 参数多模态智能体模型,1M token 上下文,全球首个开源 3T 级模型,在编码与智能体基准上逼近封闭前沿模型。
NVIDIA Nemotron 3.5 Lightning 30B A3B
build.nvidia.com/nvidia/nemotron-3.5-lightning-30b-a3b
NVIDIA 高效开源权重模型,30B 总参数仅激活 3B,MoE 混合架构,最长 1M token 上下文,单卡部署,适合本地推理、编码与后训练研究。
相关洞察
我把 Obsidian 接入 OpenClaw 后,它开始帮我做决策
当 Obsidian 不再只是记笔记,而是接入 OpenClaw 之后,它开始帮我整理信息、连接上下文、推动判断,甚至参与真实决策。
别再把 AI 助手塞进聊天框了:Clawdbot 选错了战场
Clawdbot 很方便,但将它放在 Slack 或 Discord 里操控,是从一开始就错的设计选择。聊天工具不是用来操作任务的,AI 也不是用来聊天的。
低代码平台的黄昏:为什么 Claude Agent SDK 会让 Dify 们成为历史
从大模型第一性原理深度剖析为什么 Claude Agent SDK 将取代 Dify。探讨为什么自然语言描述流程比图形化编排更符合人类原始行为模式,以及为什么这是 AI 时代的必然选择。