WeLM-617B 是 WeLM(WeChat Language Model)家族的前沿规模模型,由腾讯内部的微信 AI 团队研发。它采用稀疏 MoE 架构,总参数 6170 亿,每 token 激活 230 亿,于 2026 年 7 月 14 日随《Hidden Decoding at Scale》技术博客与 arXiv 论文首次公开亮相,是首个在 100B+ MoE 规模上得到验证的序列长度扩展方法。
模型规格
| 规格 | WeLM-617B |
|---|---|
| 架构 | 稀疏 MoE(512 个专家 + 1 个共享专家,top-10 路由) |
| 总参数 | 617B |
| 激活参数 | 23B |
| 层数 | 94 |
| 上下文长度 | 原生 32K(扩展可达 256K) |
| 训练 token 数 | 17.06T(基座);HD4 变体追加 0.90T |
| 可用性 | 闭源权重;驱动微信小微助手 |
Hidden Decoding 规模化
Hidden Decoding 是一种在继续预训练阶段应用的序列长度扩展方法。它将每个 token 扩展为带独立嵌入表的并行流,让每个 token 获得更多内部计算,而无需新增或加宽 Transformer 层。WeLM-HD4-617B 变体(n=4)在全部九项共享基准上均优于普通的 WeLM-617B 自回归基线,而增量继续训练的成本仅约为基座模型完整训练预算的 5.3%(0.90T 对 17.06T token)。
基准亮点(早期、仅 SFT)
- GPQA Diamond:89.1(HD4 为 91.2),HD4 变体领先 Kimi K2.6 的 90.4
- HMMT:96.0(HD4 为 96.2)
- PHYBench:75.3(HD4 为 76.3)
- MMMLU:86.4(HD4 为 87.5)
- FrontierMath:49.0(HD4 为 51.0)
- SciCode:51.4(HD4 为 52.1)
微信生态集成
WeLM 驱动着微信原生 AI 助手小微,该助手自 2026 年 6 月起处于灰度测试。其核心模型为微信团队自研的 WeLM,复杂推理由 DeepSeek 补充。这一集成让它可以原生访问聊天记录、群聊、公众号文章、视频号、PDF 与 Office 文档,有望成为中国调用量最高的语言模型之一。
优势与局限
- 效率优先的设计:高度稀疏的 MoE,以低延迟服务数十亿微信用户。
- 强大的中文与多语言能力:针对中文互联网语境优化,支持中英混说。
- 封闭生态:不像 Qwen 或 DeepSeek 那样开源权重,主要服务微信产品。
- 公开基准有限:617B 的结果仅为早期 SFT 阶段,尚无 RL 后训练得分公布。
总结
WeLM-617B 代表了一种独特的扩展哲学:微信 AI 不是简单堆参数,而是把额外计算折叠进序列维度。尽管它仍然封闭且以微信为中心,其 Hidden Decoding 的成果标志着高效前沿规模扩展的切实技术里程碑,而通过小微,它已经触达数亿微信用户。
相关:Claude 3.5 Sonnet、Claude 3 Haiku,分类见 models。
评论
还没有评论。成为第一个评论的人!
相关工具
相关洞察
GPT-6 Astra 没追上 Fable 5.1,追上的是账单
Artificial Analysis 智能指数上 Fable 5.1 66 分、Astra 61 分,Astra 没追上智力。但完成同一批任务的成本只要 Fable 5.1 的不到一半,真正收紧的是账单,不是脑子。
Codex 接入任意模型:一个 magpie,不用再装 Codex Router
免费开源的菜单栏应用 magpie 在本机跑一个网关,把 OpenRouter、DeepSeek 这类按 key 计费的供应商和 ChatGPT、Claude、Cursor、Grok、Copilot 的订阅,一起塞进 Codex 的原生模型选择器,一键切换,不用再装 Codex Router。