WeMM-Embedding logo

WeMM-Embedding

開く

Tencent WeChat Visionチームの汎用マルチモーダル埋め込みモデル群(2B/4B/9B)、Qwen3.5ベース。テキスト・画像・動画・視覚ドキュメントをL2正規化空間に統合。Apache 2.0。

共有:

WeMM-Embedding

WeMM-Embedding は、Tencent の WeChat Vision チームが 2026-08-25 に公開した汎用マルチモーダル埋め込みモデル群です。テキスト・画像・動画・視覚ドキュメント・インターリーブしたマルチモーダル入力を、単一の L2 正規化埋め込み空間にマッピングします。そのため、複数のエンコーダーを用意せずに 1 つのモデルで複数形式をインデックス・検索できます。2B / 4B / 9B の3サイズで、いずれも Alibaba のオープンな Qwen3.5 をベースにし、Apache 2.0 で公開されています。

Qwen3-VL-Embedding(従来のAlibabaマルチモーダル埋め込み)、Qwen3-Embedding(テキスト特化ツイン)、Voyage-3-Large(ホステッドなエンタープライズ埋め込みAPI)と比べてみてください。

主な機能

  • 真のマルチモーダル:各モデルはテキスト・画像・動画・スキャン/視覚ドキュメント・それらの混在を受け付け、専用の <embedding> トークンで last-token pooling して固定次元ベクトルを返します。
  • Matryoshka 次元:9B は 64, 128, 256, 512, 1024, 2048, 4096、4B は最大 2560、2B は最大 2048 に対応。より小さい次元に切り詰めても品質の大半を保持(2Bは256次元でフル次元の画像・動画性能の約98.7%)。
  • Qwen3.5 ベース:Alibaba の Qwen3.5-9B / 4B / 2B をファインチューニングしたもの。ゼロから作らずオープンな基盤を再利用。
  • サービング経路:vLLM(0.27+)と SGLang(0.5.9)の pooling バックエンド、および wemm_sentence_transformers ローダーに対応。
  • Apache 2.0:コード・パラメータ・ウェイトが公開。第三者コンポーネントは元のライセンスを維持。

限界:音声入力には非対応のため、MMEB-v3 の音声スコアは意図的に 0 です。フラッグシップの 9B は相応の GPU がなければ実用的ではありません。

使用シナリオ

  • マルチモーダルRAG:1つの WeMM インデックスでドキュメント・画像・クリップを検索でき、複数のベクトルストアが不要になります。
  • 視覚ドキュメント検索:PDF・スライド・スキャン画像をテキストと同じ空間に。
  • 動画検索:MMEB-v3 評価コードの64フレームサンプリングで、クリップを画像・テキストと一緒に索引化。
  • Qwen3.5 利用中のチーム:ベースがQwenのため、Qwen3.5 ワークフローからの移行が容易。

料金

WeMM-Embedding は Apache 2.0 のオープンウェイトのため、トークン単価はありません。コストは自前の計算資源です。

モデル 価格 備考
WeMM-Embedding-2B 無料(Apache 2.0) Matryoshka 64-2048。
WeMM-Embedding-4B 無料(Apache 2.0) Matryoshka 64-2560。
WeMM-Embedding-9B 無料(Apache 2.0) Matryoshka 64-4096。MMEB-v2/v3最高スコア。

2026-08-25 時点で Inference Provider は未対応のため、vLLM / SGLang でのセルフホストが必要です。

はじめに

  1. pip install torch transformers==5.2.0 "qwen-vl-utils[decord]==0.0.14" sentence-transformers==5.7.0 "accelerate>=1.1.0"
  2. load_wemm_sentence_transformer("tencent/WeMM-Embedding-9B", device="cuda:0") で読み込み。
  3. テキストと { "image": ... }{ "video": ... } を一緒にエンコードし、truncate_dim を目標の Matryoshka 次元に設定。
  4. vllm serve ... --runner pooling やリポジトリの SGLang パッチでスケール。

公式スタート:Hugging Face コレクション技術レポート

よくある質問

音声は対応していますか?

いいえ。テキスト・画像・動画・視覚ドキュメントに対応し、音声は MMEB-v3 で 0 と扱われます。

オープンソースですか?

はい。Tencent 独自のコードとウェイトは Apache 2.0 で、Hugging Face と GitHub に公開されています。

切り詰めない場合の埋め込み次元は?

9B は 4096、4B は 2560、2B は 2048。任意の Matryoshka 次元に切り詰め可能です。

代替案

ヒント

  1. GPUに制約があるなら 2B から始め、256次元に切り詰めてください。画像・動画性能の約98.7%を保持します。
  2. mean pooling ではなく専用 <embedding> トークン+last-token pooling を使い、学習時の設定に合わせてください。
  3. MMEB 数値を引用する前に技術レポートのリーダーボードを再確認してください。音声のサブスコアは意図的に0です。

まとめ

WeMM-Embedding は、Qwen3.5 ベースでテキスト・画像・動画・視覚ドキュメントを単一空間に統合した、Tencent の Apache 2.0 マルチモーダル埋め込みモデル群です。Hugging Face コレクション から始め、Qwen3.5 系かホステッドな Voyage-3-Large が自社の検索スタックに合うか判断してください。

コメント

まだコメントがありません。最初のコメントを投稿してください!