WeMM-Embedding
WeMM-Embedding は、Tencent の WeChat Vision チームが 2026-08-25 に公開した汎用マルチモーダル埋め込みモデル群です。テキスト・画像・動画・視覚ドキュメント・インターリーブしたマルチモーダル入力を、単一の L2 正規化埋め込み空間にマッピングします。そのため、複数のエンコーダーを用意せずに 1 つのモデルで複数形式をインデックス・検索できます。2B / 4B / 9B の3サイズで、いずれも Alibaba のオープンな Qwen3.5 をベースにし、Apache 2.0 で公開されています。
Qwen3-VL-Embedding(従来のAlibabaマルチモーダル埋め込み)、Qwen3-Embedding(テキスト特化ツイン)、Voyage-3-Large(ホステッドなエンタープライズ埋め込みAPI)と比べてみてください。
主な機能
- 真のマルチモーダル:各モデルはテキスト・画像・動画・スキャン/視覚ドキュメント・それらの混在を受け付け、専用の
<embedding>トークンで last-token pooling して固定次元ベクトルを返します。 - Matryoshka 次元:9B は 64, 128, 256, 512, 1024, 2048, 4096、4B は最大 2560、2B は最大 2048 に対応。より小さい次元に切り詰めても品質の大半を保持(2Bは256次元でフル次元の画像・動画性能の約98.7%)。
- Qwen3.5 ベース:Alibaba の Qwen3.5-9B / 4B / 2B をファインチューニングしたもの。ゼロから作らずオープンな基盤を再利用。
- サービング経路:vLLM(0.27+)と SGLang(0.5.9)の pooling バックエンド、および
wemm_sentence_transformersローダーに対応。 - Apache 2.0:コード・パラメータ・ウェイトが公開。第三者コンポーネントは元のライセンスを維持。
限界:音声入力には非対応のため、MMEB-v3 の音声スコアは意図的に 0 です。フラッグシップの 9B は相応の GPU がなければ実用的ではありません。
使用シナリオ
- マルチモーダルRAG:1つの WeMM インデックスでドキュメント・画像・クリップを検索でき、複数のベクトルストアが不要になります。
- 視覚ドキュメント検索:PDF・スライド・スキャン画像をテキストと同じ空間に。
- 動画検索:MMEB-v3 評価コードの64フレームサンプリングで、クリップを画像・テキストと一緒に索引化。
- Qwen3.5 利用中のチーム:ベースがQwenのため、Qwen3.5 ワークフローからの移行が容易。
料金
WeMM-Embedding は Apache 2.0 のオープンウェイトのため、トークン単価はありません。コストは自前の計算資源です。
| モデル | 価格 | 備考 |
|---|---|---|
| WeMM-Embedding-2B | 無料(Apache 2.0) | Matryoshka 64-2048。 |
| WeMM-Embedding-4B | 無料(Apache 2.0) | Matryoshka 64-2560。 |
| WeMM-Embedding-9B | 無料(Apache 2.0) | Matryoshka 64-4096。MMEB-v2/v3最高スコア。 |
2026-08-25 時点で Inference Provider は未対応のため、vLLM / SGLang でのセルフホストが必要です。
はじめに
pip install torch transformers==5.2.0 "qwen-vl-utils[decord]==0.0.14" sentence-transformers==5.7.0 "accelerate>=1.1.0"。load_wemm_sentence_transformer("tencent/WeMM-Embedding-9B", device="cuda:0")で読み込み。- テキストと
{ "image": ... }、{ "video": ... }を一緒にエンコードし、truncate_dimを目標の Matryoshka 次元に設定。 vllm serve ... --runner poolingやリポジトリの SGLang パッチでスケール。
公式スタート:Hugging Face コレクション と 技術レポート。
よくある質問
音声は対応していますか?
いいえ。テキスト・画像・動画・視覚ドキュメントに対応し、音声は MMEB-v3 で 0 と扱われます。
オープンソースですか?
はい。Tencent 独自のコードとウェイトは Apache 2.0 で、Hugging Face と GitHub に公開されています。
切り詰めない場合の埋め込み次元は?
9B は 4096、4B は 2560、2B は 2048。任意の Matryoshka 次元に切り詰め可能です。
代替案
- Qwen3-VL-Embedding:従来のAlibabaマルチモーダル埋め込み。
- Qwen3-Embedding:テキスト特化のQwen埋め込みツイン。
- Voyage-3-Large:ホステッドなエンタープライズ埋め込み・リランクAPI。
ヒント
- GPUに制約があるなら 2B から始め、256次元に切り詰めてください。画像・動画性能の約98.7%を保持します。
- mean pooling ではなく専用
<embedding>トークン+last-token pooling を使い、学習時の設定に合わせてください。 - MMEB 数値を引用する前に技術レポートのリーダーボードを再確認してください。音声のサブスコアは意図的に0です。
まとめ
WeMM-Embedding は、Qwen3.5 ベースでテキスト・画像・動画・視覚ドキュメントを単一空間に統合した、Tencent の Apache 2.0 マルチモーダル埋め込みモデル群です。Hugging Face コレクション から始め、Qwen3.5 系かホステッドな Voyage-3-Large が自社の検索スタックに合うか判断してください。
コメント
まだコメントがありません。最初のコメントを投稿してください!
関連ツール
Qwen3-VL-Embedding
huggingface.co/Qwen/Qwen3-VL-Embedding-2B
以前の Qwen3-VL 埋め込みスナップショット。再確認:Hugging Face には 2B / 8B が今も掲載。旧の最新マルチモーダル王冠は捨てる。
BGE-M3
huggingface.co/BAAI/bge-m3
2024年BAAI多言語埋め込みスナップショット。再確認:MITカードは残る。2026年のMIRACL/MTEB王冠ではない。
EmbeddingGemma
ai.google.dev/gemma
Google DeepMind の軽量多言語テキスト埋め込みモデル。デバイス上 AI 向けに最適化され、200MB 未満の RAM で動作。
関連インサイト

Grok Bot と Hermes Bot:一人に、ようやく参謀本部と事務局がつく
Grok Bot は Cursor Pro+ に入った。Hermes Bot は VPS で走る。より賢いチャット窓ではない。助言するのは参謀本部、実行するのは事務局、決裁するのはあなただ。
Windows で OpenCode Go を Codex に繋ぐ。二セット目のツールは開くな
ChatGPT でログインした Codex デスクトップは、ピッカーにほぼ GPT しか出さない。Windows では OpenCode Go だけを開けば、すでに課金している Grok、GLM、Kimi、DeepSeek、MiniMax が同じセレクタに戻る。鍵はマシンから出ず、ネイティブ GPT もそのまま残る。
Codex を閉じ込めているのはモデルではなく、ピッカーだ
OpenCode Go、Grok、Z.ai にはすでに課金しているのに、Codex のピッカーはほぼ GPT しか出さない。コミュニティ製の codex-router が教えるのは手順ではない。すでに買ったモデル能力をセレクタに戻すこと。鍵はマシンから出ず、ネイティブ GPT もそのまま残る。