WeLM-617B は、Tencent 社内の WeChat AI が開発した WeLM(WeChat Language Model)ファミリーのフロンティア規模モデルです。総パラメータ 6,170 億、トークンあたり活性化 230 億のスパース MoE アーキテクチャを採用し、2026 年 7 月 14 日に「Hidden Decoding at Scale」の技術ブログと arXiv 論文の一部として初めて公開されました。Hidden Decoding は 100B+ MoE 規模で実証された初のシーケンス長スケーリング手法です。
モデル仕様
| 仕様 | WeLM-617B |
|---|---|
| アーキテクチャ | スパース MoE(512 エキスパート + 共有 1、トップ 10 ルーティング) |
| 総パラメータ | 617B |
| 活性化パラメータ | 23B |
| レイヤー数 | 94 |
| コンテキストウィンドウ | ネイティブ 32K(拡張で 256K) |
| トレーニングトークン | 17.06T(ベース)、HD4 バリアントは +0.90T |
| 提供形態 | クローズドウェイト。WeChat のアシスタント「小微」を駆動 |
Hidden Decoding at Scale
Hidden Decoding は、継続事前学習中に適用されるシーケンス長スケーリング手法です。各トークンを独立した埋め込みテーブルを持つ並列ストリームに展開し、Transformer レイヤーの追加や拡幅を行うことなく、すべてのトークンにより多くの内部計算を与えます。WeLM-HD4-617B バリアント(n=4)は、通常の WeLM-617B 自己回帰ベースラインと比較して、9 つの共通ベンチマークすべてを改善しました。追加の継続トレーニングコストは、ベースモデルの全トレーニング予算の約 5.3% に過ぎません(0.90T vs 17.06T トークン)。
ベンチマークのハイライト(初期 SFT のみ)
- GPQA Diamond:89.1(HD4 で 91.2)。HD4 バリアントでは Kimi K2.6 の 90.4 を上回る
- HMMT:96.0(HD4 で 96.2)
- PHYBench:75.3(HD4 で 76.3)
- MMMLU:86.4(HD4 で 87.5)
- FrontierMath:49.0(HD4 で 51.0)
- SciCode:51.4(HD4 で 52.1)
WeChat エコシステムとの統合
WeLM は、2026 年 6 月からグレースケールテスト中の WeChat ネイティブ AI アシスタント「小微(Xiaowei)」を支えています。中核モデルは WeChat チームが自社開発した WeLM で、複雑な推論には DeepSeek が補助的に使用されています。この統合により、チャット履歴、グループチャット、公式アカウント記事、動画アカウント、PDF、Office 文書へのネイティブアクセスが可能になり、中国で最も呼び出し量の多い言語モデルの 1 つになると位置づけられています。
強みと限界
- 効率第一の設計:高度にスパースな MoE により、数十億の WeChat ユーザーに低遅延でサービスを提供します。
- 強力な中国語 + 多言語対応:中国のインターネットコンテキストに最適化され、コードスイッチングをサポート。
- クローズドエコシステム:Qwen や DeepSeek のようなオープンウェイトではなく、主に WeChat プロダクトに供給されます。
- 公開ベンチマークが限定的:617B の結果は初期 SFT のみで、RL ポストトレーニングのスコアは未公開です。
まとめ
WeLM-617B は、独自のスケーリング哲学を体現しています。単にパラメータを追加するのではなく、WeChat AI は追加の計算をシーケンス次元に折り込みます。クローズドで WeChat 中心のモデルではありますが、Hidden Decoding の成果は効率的なフロンティア規模スケーリングにとって真の技術的マイルストーンであり、小微を通じてすでに数億の WeChat ユーザーに届いています。
使用シナリオ
- WeLM-617B が自分のワークフローをカバーするか先に確認したい場合。
関連:Claude 3.5 Sonnet、Claude 3 Haiku。分類は models。
コメント
まだコメントがありません。最初のコメントを投稿してください!