WeMM-Embedding logo

WeMM-Embedding

打开

腾讯微信视觉团队推出的通用多模态嵌入模型家族(2B/4B/9B),基于 Qwen3.5。文本、图像、视频与视觉文档统一映射到 L2 归一化空间。Apache 2.0。

分享:

WeMM-Embedding

WeMM-Embedding 是腾讯微信视觉团队于 2026-08-25 发布的通用多模态嵌入模型家族。它将文本、图像、视频、视觉文档以及交错的多模态输入统一映射到同一个 L2 归一化嵌入空间,因此一个模型即可跨格式完成索引与检索,无需分别运行多个编码器。家族提供 2B、4B、9B 三档,均基于阿里开源的 Qwen3.5 底座构建,并以 Apache 2.0 开源。

对比 Qwen3-VL-Embedding(此前的阿里多模态嵌入词条)、Qwen3-Embedding(纯文本嵌入双胞胎)以及 Voyage-3-Large(托管型企业级嵌入 API)。

核心功能

  • 真正多模态:每个模型可接收文本、图像、视频与扫描/视觉文档及交错内容,通过专用 <embedding> token 做 last-token pooling,返回固定维度向量。
  • Matryoshka 维度:9B 支持 64、128、256、512、1024、2048、4096;4B 最高 2560;2B 最高 2048。截断到更小维度仍保留大部分质量(2B 在 256 维下保留约 98.7% 的满维图像与视频性能)。
  • Qwen3.5 底座:由阿里的 Qwen3.5-9B / 4B / 2B 微调而来,复用开放底座而非从零训练。
  • 服务路径:原生支持 vLLM(0.27+)与 SGLang(0.5.9)的 pooling 后端,并提供 wemm_sentence_transformers 加载器,接口与常见 encode 一致。
  • Apache 2.0:代码、权重与参数公开;第三方组件保留各自许可。

局限:不支持音频输入,因此 MMEB-v3 音频得分为 0 系设计使然;旗舰 9B 需要较大显存才实用。

适用场景

  • 多模态 RAG:用一个 WeMM 索引覆盖文档、图像与片段,跨格式检索只需一个向量库而非多个。
  • 视觉文档搜索:PDF、幻灯片与扫描页与文本落入同一嵌入空间。
  • 视频检索:MMEB-v3 代码路径中的 64 帧采样,将片段与图像、文本一并索引。
  • 已在用 Qwen3.5 的团队:底座为 Qwen,从 Qwen3.5 工作流迁移顺滑。

定价方案

WeMM-Embedding 为 Apache 2.0 开放权重,因此没有按 token 定价,成本即自有算力。

模型 价格 说明
WeMM-Embedding-2B 免费(Apache 2.0) Matryoshka 64-2048。
WeMM-Embedding-4B 免费(Apache 2.0) Matryoshka 64-2560。
WeMM-Embedding-9B 免费(Apache 2.0) Matryoshka 64-4096。MMEB-v2/v3 得分最高。

截至 2026-08-25 尚无任何 Inference Provider 托管,需通过 vLLM 或 SGLang 自托管。

快速开始

  1. pip install torch transformers==5.2.0 "qwen-vl-utils[decord]==0.0.14" sentence-transformers==5.7.0 "accelerate>=1.1.0"
  2. load_wemm_sentence_transformer("tencent/WeMM-Embedding-9B", device="cuda:0") 加载。
  3. 将文本、{ "image": ... }{ "video": ... } 一起编码,并按需设置 truncate_dim 到目标 Matryoshka 维度。
  4. vllm serve ... --runner pooling 或仓库中的 SGLang 补丁扩展。

官方起点:Hugging Face 集合技术报告

常见问题

支持音频吗?

不支持。支持文本、图像、视频与视觉文档;音频在 MMEB-v3 中计为 0。

是开源的吗?

是。腾讯自有代码与权重为 Apache 2.0,已发布在 Hugging Face 与 GitHub。

不截断时嵌入维度是多少?

9B 返回 4096,4B 返回 2560,2B 返回 2048。可截断到任意列出的 Matryoshka 维度。

替代方案

使用技巧

  1. 若显存受限,从 2B 开始并截断到 256 维,保留约 98.7% 的满维图像与视频质量。
  2. 使用专用 <embedding> token 与 last-token pooling,而非 mean pooling,以匹配训练方式。
  3. 引用 MMEB 数字前先复核技术报告中的榜单;音频子项为 0 系设计使然。

总结

WeMM-Embedding 是腾讯推出的 Apache 2.0 多模态嵌入家族,基于 Qwen3.5 底座,将文本、图像、视频与视觉文档统一于单一空间。先从 Hugging Face 集合入手,再判断 Qwen3.5 谱系或托管方案如 Voyage-3-Large 是否更适合你的检索栈。

评论

还没有评论。成为第一个评论的人!