WeLM-617B logo

WeLM-617B

開く

WeChat AI の 617B MoE モデル。トークンあたり活性化パラメータ 23B で、Hidden Decoding によるフロンティア規模初のシーケンス長スケーリングを実証。WeChat の AI アシスタント「小微」を支える。

共有:

WeLM-617B は、Tencent 社内の WeChat AI が開発した WeLM(WeChat Language Model)ファミリーのフロンティア規模モデルです。総パラメータ 6,170 億、トークンあたり活性化 230 億のスパース MoE アーキテクチャを採用し、2026 年 7 月 14 日に「Hidden Decoding at Scale」の技術ブログと arXiv 論文の一部として初めて公開されました。Hidden Decoding は 100B+ MoE 規模で実証された初のシーケンス長スケーリング手法です。

モデル仕様

仕様 WeLM-617B
アーキテクチャ スパース MoE(512 エキスパート + 共有 1、トップ 10 ルーティング)
総パラメータ 617B
活性化パラメータ 23B
レイヤー数 94
コンテキストウィンドウ ネイティブ 32K(拡張で 256K)
トレーニングトークン 17.06T(ベース)、HD4 バリアントは +0.90T
提供形態 クローズドウェイト。WeChat のアシスタント「小微」を駆動

Hidden Decoding at Scale

Hidden Decoding は、継続事前学習中に適用されるシーケンス長スケーリング手法です。各トークンを独立した埋め込みテーブルを持つ並列ストリームに展開し、Transformer レイヤーの追加や拡幅を行うことなく、すべてのトークンにより多くの内部計算を与えます。WeLM-HD4-617B バリアント(n=4)は、通常の WeLM-617B 自己回帰ベースラインと比較して、9 つの共通ベンチマークすべてを改善しました。追加の継続トレーニングコストは、ベースモデルの全トレーニング予算の約 5.3% に過ぎません(0.90T vs 17.06T トークン)。

ベンチマークのハイライト(初期 SFT のみ)

  • GPQA Diamond:89.1(HD4 で 91.2)。HD4 バリアントでは Kimi K2.6 の 90.4 を上回る
  • HMMT:96.0(HD4 で 96.2)
  • PHYBench:75.3(HD4 で 76.3)
  • MMMLU:86.4(HD4 で 87.5)
  • FrontierMath:49.0(HD4 で 51.0)
  • SciCode:51.4(HD4 で 52.1)

WeChat エコシステムとの統合

WeLM は、2026 年 6 月からグレースケールテスト中の WeChat ネイティブ AI アシスタント「小微(Xiaowei)」を支えています。中核モデルは WeChat チームが自社開発した WeLM で、複雑な推論には DeepSeek が補助的に使用されています。この統合により、チャット履歴、グループチャット、公式アカウント記事、動画アカウント、PDF、Office 文書へのネイティブアクセスが可能になり、中国で最も呼び出し量の多い言語モデルの 1 つになると位置づけられています。

強みと限界

  • 効率第一の設計:高度にスパースな MoE により、数十億の WeChat ユーザーに低遅延でサービスを提供します。
  • 強力な中国語 + 多言語対応:中国のインターネットコンテキストに最適化され、コードスイッチングをサポート。
  • クローズドエコシステム:Qwen や DeepSeek のようなオープンウェイトではなく、主に WeChat プロダクトに供給されます。
  • 公開ベンチマークが限定的:617B の結果は初期 SFT のみで、RL ポストトレーニングのスコアは未公開です。

まとめ

WeLM-617B は、独自のスケーリング哲学を体現しています。単にパラメータを追加するのではなく、WeChat AI は追加の計算をシーケンス次元に折り込みます。クローズドで WeChat 中心のモデルではありますが、Hidden Decoding の成果は効率的なフロンティア規模スケーリングにとって真の技術的マイルストーンであり、小微を通じてすでに数億の WeChat ユーザーに届いています。

コメント

まだコメントがありません。最初のコメントを投稿してください!