WeMM-Embedding
WeMM-Embedding 是腾讯微信视觉团队于 2026-08-25 发布的通用多模态嵌入模型家族。它将文本、图像、视频、视觉文档以及交错的多模态输入统一映射到同一个 L2 归一化嵌入空间,因此一个模型即可跨格式完成索引与检索,无需分别运行多个编码器。家族提供 2B、4B、9B 三档,均基于阿里开源的 Qwen3.5 底座构建,并以 Apache 2.0 开源。
对比 Qwen3-VL-Embedding(此前的阿里多模态嵌入词条)、Qwen3-Embedding(纯文本嵌入双胞胎)以及 Voyage-3-Large(托管型企业级嵌入 API)。
核心功能
- 真正多模态:每个模型可接收文本、图像、视频与扫描/视觉文档及交错内容,通过专用
<embedding>token 做 last-token pooling,返回固定维度向量。 - Matryoshka 维度:9B 支持 64、128、256、512、1024、2048、4096;4B 最高 2560;2B 最高 2048。截断到更小维度仍保留大部分质量(2B 在 256 维下保留约 98.7% 的满维图像与视频性能)。
- Qwen3.5 底座:由阿里的 Qwen3.5-9B / 4B / 2B 微调而来,复用开放底座而非从零训练。
- 服务路径:原生支持 vLLM(0.27+)与 SGLang(0.5.9)的 pooling 后端,并提供
wemm_sentence_transformers加载器,接口与常见 encode 一致。 - Apache 2.0:代码、权重与参数公开;第三方组件保留各自许可。
局限:不支持音频输入,因此 MMEB-v3 音频得分为 0 系设计使然;旗舰 9B 需要较大显存才实用。
适用场景
- 多模态 RAG:用一个 WeMM 索引覆盖文档、图像与片段,跨格式检索只需一个向量库而非多个。
- 视觉文档搜索:PDF、幻灯片与扫描页与文本落入同一嵌入空间。
- 视频检索:MMEB-v3 代码路径中的 64 帧采样,将片段与图像、文本一并索引。
- 已在用 Qwen3.5 的团队:底座为 Qwen,从 Qwen3.5 工作流迁移顺滑。
定价方案
WeMM-Embedding 为 Apache 2.0 开放权重,因此没有按 token 定价,成本即自有算力。
| 模型 | 价格 | 说明 |
|---|---|---|
| WeMM-Embedding-2B | 免费(Apache 2.0) | Matryoshka 64-2048。 |
| WeMM-Embedding-4B | 免费(Apache 2.0) | Matryoshka 64-2560。 |
| WeMM-Embedding-9B | 免费(Apache 2.0) | Matryoshka 64-4096。MMEB-v2/v3 得分最高。 |
截至 2026-08-25 尚无任何 Inference Provider 托管,需通过 vLLM 或 SGLang 自托管。
快速开始
pip install torch transformers==5.2.0 "qwen-vl-utils[decord]==0.0.14" sentence-transformers==5.7.0 "accelerate>=1.1.0"。- 用
load_wemm_sentence_transformer("tencent/WeMM-Embedding-9B", device="cuda:0")加载。 - 将文本、
{ "image": . }、{ "video": . }一起编码,并按需设置truncate_dim到目标 Matryoshka 维度。 - 用
vllm serve . --runner pooling或仓库中的 SGLang 补丁扩展。
官方起点:Hugging Face 集合 与 技术报告。
常见问题
支持音频吗?
不支持。支持文本、图像、视频与视觉文档;音频在 MMEB-v3 中计为 0。
是开源的吗?
是。腾讯自有代码与权重为 Apache 2.0,已发布在 Hugging Face 与 GitHub。
不截断时嵌入维度是多少?
9B 返回 4096,4B 返回 2560,2B 返回 2048。可截断到任意列出的 Matryoshka 维度。
替代方案
- Qwen3-VL-Embedding:此前的阿里多模态嵌入快照。
- Qwen3-Embedding:纯文本 Qwen 嵌入双胞胎。
- Voyage-3-Large:托管型企业级嵌入与重排 API。
使用技巧
- 若显存受限,从 2B 开始并截断到 256 维,保留约 98.7% 的满维图像与视频质量。
- 使用专用
<embedding>token 与 last-token pooling,而非 mean pooling,以匹配训练方式。 - 引用 MMEB 数字前先复核技术报告中的榜单;音频子项为 0 系设计使然。
评论
还没有评论。成为第一个评论的人!
相关工具
Month Visit180DR: 91AS: 85
Month Visit50000DR: 85AS: 88
Month Visit245DR: 91AS: 85