WeMM-Embedding
WeMM-Embedding は、Tencent の WeChat Vision チームが 2026-08-25 に公開した汎用マルチモーダル埋め込みモデル群です。テキスト・画像・動画・視覚ドキュメント・インターリーブしたマルチモーダル入力を、単一の L2 正規化埋め込み空間にマッピングします。そのため、複数のエンコーダーを用意せずに 1 つのモデルで複数形式をインデックス・検索できます。2B / 4B / 9B の3サイズで、いずれも Alibaba のオープンな Qwen3.5 をベースにし、Apache 2.0 で公開されています。
Qwen3-VL-Embedding(従来のAlibabaマルチモーダル埋め込み)、Qwen3-Embedding(テキスト特化ツイン)、Voyage-3-Large(ホステッドなエンタープライズ埋め込みAPI)と比べてみてください。
主な機能
- 真のマルチモーダル:各モデルはテキスト・画像・動画・スキャン/視覚ドキュメント・それらの混在を受け付け、専用の
<embedding>トークンで last-token pooling して固定次元ベクトルを返します。 - Matryoshka 次元:9B は 64, 128, 256, 512, 1024, 2048, 4096、4B は最大 2560、2B は最大 2048 に対応。より小さい次元に切り詰めても品質の大半を保持(2Bは256次元でフル次元の画像・動画性能の約98.7%)。
- Qwen3.5 ベース:Alibaba の Qwen3.5-9B / 4B / 2B をファインチューニングしたもの。ゼロから作らずオープンな基盤を再利用。
- サービング経路:vLLM(0.27+)と SGLang(0.5.9)の pooling バックエンド、および
wemm_sentence_transformersローダーに対応。 - Apache 2.0:コード・パラメータ・ウェイトが公開。第三者コンポーネントは元のライセンスを維持。
限界:音声入力には非対応のため、MMEB-v3 の音声スコアは意図的に 0 です。フラッグシップの 9B は相応の GPU がなければ実用的ではありません。
使用シナリオ
- マルチモーダルRAG:1つの WeMM インデックスでドキュメント・画像・クリップを検索でき、複数のベクトルストアが不要になります。
- 視覚ドキュメント検索:PDF・スライド・スキャン画像をテキストと同じ空間に。
- 動画検索:MMEB-v3 評価コードの64フレームサンプリングで、クリップを画像・テキストと一緒に索引化。
- Qwen3.5 利用中のチーム:ベースがQwenのため、Qwen3.5 ワークフローからの移行が容易。
料金
WeMM-Embedding は Apache 2.0 のオープンウェイトのため、トークン単価はありません。コストは自前の計算資源です。
| モデル | 価格 | 備考 |
|---|---|---|
| WeMM-Embedding-2B | 無料(Apache 2.0) | Matryoshka 64-2048。 |
| WeMM-Embedding-4B | 無料(Apache 2.0) | Matryoshka 64-2560。 |
| WeMM-Embedding-9B | 無料(Apache 2.0) | Matryoshka 64-4096。MMEB-v2/v3最高スコア。 |
2026-08-25 時点で Inference Provider は未対応のため、vLLM / SGLang でのセルフホストが必要です。
はじめに
pip install torch transformers==5.2.0 "qwen-vl-utils[decord]==0.0.14" sentence-transformers==5.7.0 "accelerate>=1.1.0"。load_wemm_sentence_transformer("tencent/WeMM-Embedding-9B", device="cuda:0")で読み込み。- テキストと
{ "image": . }、{ "video": . }を一緒にエンコードし、truncate_dimを目標の Matryoshka 次元に設定。 vllm serve . --runner poolingやリポジトリの SGLang パッチでスケール。
公式スタート:Hugging Face コレクション と 技術レポート。
よくある質問
音声は対応していますか?
いいえ。テキスト・画像・動画・視覚ドキュメントに対応し、音声は MMEB-v3 で 0 と扱われます。
オープンソースですか?
はい。Tencent 独自のコードとウェイトは Apache 2.0 で、Hugging Face と GitHub に公開されています。
切り詰めない場合の埋め込み次元は?
9B は 4096、4B は 2560、2B は 2048。任意の Matryoshka 次元に切り詰め可能です。
代替案
- Qwen3-VL-Embedding:従来のAlibabaマルチモーダル埋め込み。
- Qwen3-Embedding:テキスト特化のQwen埋め込みツイン。
- Voyage-3-Large:ホステッドなエンタープライズ埋め込み・リランクAPI。
ヒント
- GPUに制約があるなら 2B から始め、256次元に切り詰めてください。画像・動画性能の約98.7%を保持します。
- mean pooling ではなく専用
<embedding>トークン+last-token pooling を使い、学習時の設定に合わせてください。 - MMEB 数値を引用する前に技術レポートのリーダーボードを再確認してください。音声のサブスコアは意図的に0です。
コメント
まだコメントがありません。最初のコメントを投稿してください!