WeMM-Embedding
WeMM-Embedding 是腾讯微信视觉团队于 2026-08-25 发布的通用多模态嵌入模型家族。它将文本、图像、视频、视觉文档以及交错的多模态输入统一映射到同一个 L2 归一化嵌入空间,因此一个模型即可跨格式完成索引与检索,无需分别运行多个编码器。家族提供 2B、4B、9B 三档,均基于阿里开源的 Qwen3.5 底座构建,并以 Apache 2.0 开源。
对比 Qwen3-VL-Embedding(此前的阿里多模态嵌入词条)、Qwen3-Embedding(纯文本嵌入双胞胎)以及 Voyage-3-Large(托管型企业级嵌入 API)。
核心功能
- 真正多模态:每个模型可接收文本、图像、视频与扫描/视觉文档及交错内容,通过专用
<embedding>token 做 last-token pooling,返回固定维度向量。 - Matryoshka 维度:9B 支持 64、128、256、512、1024、2048、4096;4B 最高 2560;2B 最高 2048。截断到更小维度仍保留大部分质量(2B 在 256 维下保留约 98.7% 的满维图像与视频性能)。
- Qwen3.5 底座:由阿里的 Qwen3.5-9B / 4B / 2B 微调而来,复用开放底座而非从零训练。
- 服务路径:原生支持 vLLM(0.27+)与 SGLang(0.5.9)的 pooling 后端,并提供
wemm_sentence_transformers加载器,接口与常见 encode 一致。 - Apache 2.0:代码、权重与参数公开;第三方组件保留各自许可。
局限:不支持音频输入,因此 MMEB-v3 音频得分为 0 系设计使然;旗舰 9B 需要较大显存才实用。
适用场景
- 多模态 RAG:用一个 WeMM 索引覆盖文档、图像与片段,跨格式检索只需一个向量库而非多个。
- 视觉文档搜索:PDF、幻灯片与扫描页与文本落入同一嵌入空间。
- 视频检索:MMEB-v3 代码路径中的 64 帧采样,将片段与图像、文本一并索引。
- 已在用 Qwen3.5 的团队:底座为 Qwen,从 Qwen3.5 工作流迁移顺滑。
定价方案
WeMM-Embedding 为 Apache 2.0 开放权重,因此没有按 token 定价,成本即自有算力。
| 模型 | 价格 | 说明 |
|---|---|---|
| WeMM-Embedding-2B | 免费(Apache 2.0) | Matryoshka 64-2048。 |
| WeMM-Embedding-4B | 免费(Apache 2.0) | Matryoshka 64-2560。 |
| WeMM-Embedding-9B | 免费(Apache 2.0) | Matryoshka 64-4096。MMEB-v2/v3 得分最高。 |
截至 2026-08-25 尚无任何 Inference Provider 托管,需通过 vLLM 或 SGLang 自托管。
快速开始
pip install torch transformers==5.2.0 "qwen-vl-utils[decord]==0.0.14" sentence-transformers==5.7.0 "accelerate>=1.1.0"。- 用
load_wemm_sentence_transformer("tencent/WeMM-Embedding-9B", device="cuda:0")加载。 - 将文本、
{ "image": ... }、{ "video": ... }一起编码,并按需设置truncate_dim到目标 Matryoshka 维度。 - 用
vllm serve ... --runner pooling或仓库中的 SGLang 补丁扩展。
官方起点:Hugging Face 集合 与 技术报告。
常见问题
支持音频吗?
不支持。支持文本、图像、视频与视觉文档;音频在 MMEB-v3 中计为 0。
是开源的吗?
是。腾讯自有代码与权重为 Apache 2.0,已发布在 Hugging Face 与 GitHub。
不截断时嵌入维度是多少?
9B 返回 4096,4B 返回 2560,2B 返回 2048。可截断到任意列出的 Matryoshka 维度。
替代方案
- Qwen3-VL-Embedding:此前的阿里多模态嵌入快照。
- Qwen3-Embedding:纯文本 Qwen 嵌入双胞胎。
- Voyage-3-Large:托管型企业级嵌入与重排 API。
使用技巧
- 若显存受限,从 2B 开始并截断到 256 维,保留约 98.7% 的满维图像与视频质量。
- 使用专用
<embedding>token 与 last-token pooling,而非 mean pooling,以匹配训练方式。 - 引用 MMEB 数字前先复核技术报告中的榜单;音频子项为 0 系设计使然。
总结
WeMM-Embedding 是腾讯推出的 Apache 2.0 多模态嵌入家族,基于 Qwen3.5 底座,将文本、图像、视频与视觉文档统一于单一空间。先从 Hugging Face 集合入手,再判断 Qwen3.5 谱系或托管方案如 Voyage-3-Large 是否更适合你的检索栈。
评论
还没有评论。成为第一个评论的人!
相关工具
Qwen3-VL-Embedding
huggingface.co/Qwen/Qwen3-VL-Embedding-2B
上一代 Qwen3-VL 嵌入快照。复核:Hugging Face 仍列出 2B / 8B。旧的最新多模态嵌入王冠不当普查。
BGE-M3
huggingface.co/BAAI/bge-m3
2024 年 BAAI 多语言嵌入模型快照。复核:MIT 卡仍在。不是 2026 年 MIRACL 或 MTEB 王冠。
EmbeddingGemma
ai.google.dev/gemma
Google DeepMind 的轻量级多语言文本嵌入模型,专为设备端 AI 优化,内存占用小于 200MB。
相关洞察

Grok Bot、Hermes Bot:一个人,终于配上了智囊团和秘书处
Grok Bot 进了 Cursor Pro+,Hermes Bot 能跑在 VPS 上。它们不是更聪明的聊天框。出主意的是智囊团,抓落实的是秘书处,拍板的还是你。
Windows 上把 OpenCode Go 接进 Codex,别再新开一套工具
ChatGPT 登录的 Codex 桌面版,默认选择器几乎只露出 GPT。Windows 上只开 OpenCode Go 这一家,就能把已经付过钱的 Grok、GLM、Kimi、DeepSeek、MiniMax 接回同一个 picker。密钥不出本机,原生 GPT 也不动。
锁死 Codex 的不是模型,是选择器
你已经为 OpenCode Go、Grok、Z.ai 付过钱了,但 Codex 的 picker 默认只露出 GPT。社区项目 codex-router 做的不是再教一遍安装步骤,而是把已经买过的模型能力接回选择器:密钥不出本机,原生 GPT 也不动。