WeLM-617B は、Tencent 社内の WeChat AI が開発した WeLM(WeChat Language Model)ファミリーのフロンティア規模モデルです。総パラメータ 6,170 億、トークンあたり活性化 230 億のスパース MoE アーキテクチャを採用し、2026 年 7 月 14 日に「Hidden Decoding at Scale」の技術ブログと arXiv 論文の一部として初めて公開されました。Hidden Decoding は 100B+ MoE 規模で実証された初のシーケンス長スケーリング手法です。
モデル仕様
| 仕様 | WeLM-617B |
|---|---|
| アーキテクチャ | スパース MoE(512 エキスパート + 共有 1、トップ 10 ルーティング) |
| 総パラメータ | 617B |
| 活性化パラメータ | 23B |
| レイヤー数 | 94 |
| コンテキストウィンドウ | ネイティブ 32K(拡張で 256K) |
| トレーニングトークン | 17.06T(ベース)、HD4 バリアントは +0.90T |
| 提供形態 | クローズドウェイト。WeChat のアシスタント「小微」を駆動 |
Hidden Decoding at Scale
Hidden Decoding は、継続事前学習中に適用されるシーケンス長スケーリング手法です。各トークンを独立した埋め込みテーブルを持つ並列ストリームに展開し、Transformer レイヤーの追加や拡幅を行うことなく、すべてのトークンにより多くの内部計算を与えます。WeLM-HD4-617B バリアント(n=4)は、通常の WeLM-617B 自己回帰ベースラインと比較して、9 つの共通ベンチマークすべてを改善しました。追加の継続トレーニングコストは、ベースモデルの全トレーニング予算の約 5.3% に過ぎません(0.90T vs 17.06T トークン)。
ベンチマークのハイライト(初期 SFT のみ)
- GPQA Diamond:89.1(HD4 で 91.2)。HD4 バリアントでは Kimi K2.6 の 90.4 を上回る
- HMMT:96.0(HD4 で 96.2)
- PHYBench:75.3(HD4 で 76.3)
- MMMLU:86.4(HD4 で 87.5)
- FrontierMath:49.0(HD4 で 51.0)
- SciCode:51.4(HD4 で 52.1)
WeChat エコシステムとの統合
WeLM は、2026 年 6 月からグレースケールテスト中の WeChat ネイティブ AI アシスタント「小微(Xiaowei)」を支えています。中核モデルは WeChat チームが自社開発した WeLM で、複雑な推論には DeepSeek が補助的に使用されています。この統合により、チャット履歴、グループチャット、公式アカウント記事、動画アカウント、PDF、Office 文書へのネイティブアクセスが可能になり、中国で最も呼び出し量の多い言語モデルの 1 つになると位置づけられています。
強みと限界
- 効率第一の設計:高度にスパースな MoE により、数十億の WeChat ユーザーに低遅延でサービスを提供します。
- 強力な中国語 + 多言語対応:中国のインターネットコンテキストに最適化され、コードスイッチングをサポート。
- クローズドエコシステム:Qwen や DeepSeek のようなオープンウェイトではなく、主に WeChat プロダクトに供給されます。
- 公開ベンチマークが限定的:617B の結果は初期 SFT のみで、RL ポストトレーニングのスコアは未公開です。
まとめ
WeLM-617B は、独自のスケーリング哲学を体現しています。単にパラメータを追加するのではなく、WeChat AI は追加の計算をシーケンス次元に折り込みます。クローズドで WeChat 中心のモデルではありますが、Hidden Decoding の成果は効率的なフロンティア規模スケーリングにとって真の技術的マイルストーンであり、小微を通じてすでに数億の WeChat ユーザーに届いています。
コメント
まだコメントがありません。最初のコメントを投稿してください!
関連ツール
DeepSeek V4 Pro 0813
www.deepseek.com
DeepSeek のフラッグシップ 1.6T MoE モデル。活性化パラメータ 49B、1M トークンのコンテキスト、MIT ライセンスのオープンウェイトを備え、世界トップのコーディングスコアをクローズドモデルのごく一部の価格で実現。
DeepSeek V4
www.deepseek.com
DeepSeek V4 は、DeepSeek のフラッグシップ AI モデルの次世代版であり、V3 の成功を基盤に、推論能力、マルチモーダル理解、エージェントベースのインタラクションの向上が期待されています。
Kimi K3
www.kimi.com
Moonshot AI のオープンウェイト 2.8T パラメータ多モーダルエージェントモデル。1M トークンのコンテキストを備えた世界初のオープン 3T 級モデルで、コーディングとエージェントのベンチマークでクローズド最先端に迫る。
関連インサイト
Obsidian を OpenClaw に接続したら、意思決定まで手伝い始めた
Obsidian がただのノート置き場ではなく OpenClaw とつながったとき、情報整理、文脈接続、判断材料の整理、そして実際の意思決定支援まで始まった。
AI アシスタントをチャットボックスに押し込むな:Clawdbot は戦場を間違えた
Clawdbot は便利だが、Slack や Discord に入れて操作するのは最初から間違った設計だ。チャットツールはタスク操作のためのものではなく、AI もおしゃべりのためではない。
ローコードプラットフォームの黄昏:なぜClaude Agent SDKがDifyを歴史にするのか
大規模言語モデルの第一原理から、なぜClaude Agent SDKがDifyを置き換えるのかを深く分析。自然言語でプロセスを記述することが人間の原始的な行動パターンにより合致している理由、そしてなぜこれがAI時代の必然的な選択なのかを探る。