LensVLM-9B
LensVLM-9B 是苹果在 2026-09-22 发布的 9B 视觉语言模型,权重、论文与推理代码一起放在 Hugging Face 上。它的想法说起来很简单:别再拿 token 喂长文档,改成把文档渲染成图片,然后让模型自己决定哪些页面值得花高价「还原」成不压缩的形式。
它的压缩旋钮很特别。视觉编码器会把固定尺寸的图片映射成固定数量的视觉 token,所以缩小渲染分辨率就能直接缩小 token 成本。苹果的论文解释了为什么单靠这一招会失败:压缩率一高,字符就小到视觉编码器根本分辨不出来,准确率迅速崩掉。LensVLM 就是为这个问题做的。
工作方式
这个模型被后训练成两步走:
- 扫描。 先把整份文档当作压缩的页面图片读进来,token 很便宜。
- 选择性展开。 调用学到的工具,只把相关页面还原成未压缩形式,可以是重新渲染的文本,也可以是高分辨率图片。
训练让模型学会什么时候该展开、该用哪个工具。苹果的分析发现:经过训练,视觉压缩对渲染方式的鲁棒性明显提高;压缩率越大,模型越依赖展开后的内容,而不是硬读那些很小的字。论文还给出了一条实用建议:渲染类文本适合用文本展开,而版式本身承载信息的原生文档更适合用高分辨率图片展开。
论文给出的数据
| 指标 | 结果 |
|---|---|
| 基础模型 | Qwen3.5-9B-Base |
| 4.3 倍有效压缩 | 准确率与全文上界相当 |
| 最高 10.1 倍压缩 | 优于基于检索、文本压缩与视觉压缩的基线 |
| 评测范围 | 七个文本问答基准 |
| 文本问答之外 | 可泛化到多模态文档与代码理解 |
| 许可 | Apple Machine Learning Research Model License(代码为 Apple Sample Code License) |
真正值得注意的是曲线的形状,而不是某个单独的数字:压缩率越高,它相对其他方法的领先幅度越大。这跟大多数长上下文的取巧办法正好相反。
社区热度
截至 2026-09-24,模型卡显示 147 个 like、455 次下载,配套代码仓库约 50 star。按前沿模型的标准这些数字不大,对研究发布来说也算正常;但论文发布后第二天就被顶上了 Hacker News 首页,说明从业者对这条技术路线的兴趣高于下载量所显示的。
适用场景
- 长文档问答。 年报、手册、合同这类场景,全文上下文就是账单里最贵的那部分。
- 不用检索的 RAG。 不做分块和向量检索,直接把压缩后的页面图交给模型,让它自己展开需要的部分。苹果正是拿这条路线做的对比实验。
- 版式敏感文档。 表格和表单这类靠视觉排布表达含义的场景,对关键页使用高分辨率展开。
- 文档与代码混合。 官方说明该能力也泛化到代码理解。
快速开始
git clone https://github.com/apple-aiml-research/ml-lensvlm
cd ml-lensvlm
pip install -r requirements.txt
python scripts/run_demo.py --model apple/LensVLM-9B
跑自己的文档:
python demo.py \
--model apple/LensVLM-9B \
--text_file document.txt \
--question "What is the main finding?" \
--compression 10x
压缩率可选 5x、10x、15x。建议从 10x 开始,然后确认你关心的问题还答得对,因为即使平均值好看,准确率曲线依然是因负载而异的。
限制
- 研究版,不是产品。 没有托管接口,权重得自己跑,代码要用苹果仓库里的那份。
- 苹果自有许可。 权重适用 Apple Machine Learning Research Model License,代码适用 Apple Sample Code License,都不是标准开源许可,商用前请自己读条款。
- 对比对象是全文上界,不是前沿模型。 LensVLM 的优势在效率,而它本质上仍是一个 9B 模型在看压缩图片答题。
- 压缩本身是有损的。 展开工具只能找回模型主动要求的那几页,没被展开的页面保持压缩状态,错误也正是从这里来的。
- 论文早于权重。 arXiv 预印本是 2026 年 5 月的,权重和代码 9 月才放出来。
常见问题
LensVLM-9B 是开源的吗?
权重可以公开下载,代码也是公开的,但用的是苹果自己的研究许可与示例代码许可,不是 OSI 认证的开源许可。请按自己的用途核对条款。
需要 GPU 吗?
需要一个能跑 9B 视觉语言模型的硬件环境,仓库里的 demo 脚本是官方支持的路径。
它和「OCR 加文本模型」有什么区别?
OCR 先把页面变成文字,会丢掉版式,还要单独跑一遍。LensVLM 把页面保留为图片,只为展开的那几页额外付费。
它能替代检索吗?
不一定。苹果与基于检索的基线做了对比,在高压缩率下准确率更好,这意味着对某些负载它是检索的替代方案,而不是普遍替换。
替代方案
- Mistral OCR 4.1:想要结构化文本而不是压缩图片时用它。
- Qwen-VL:没有压缩技巧的通用视觉语言系列。
- Ling 3.0 Flash VL:对成本敏感的流水线可以考虑的小尺寸多模态选项。
总结
LensVLM-9B 把上下文当成一个渲染决策而不是 token 预算,而选择性展开是让整套想法成立的关键。它是研究发布,许可是自有的,也没有托管接口,所以不能当作 API 的即插即用替代。但对于账单主要花在长文档上的团队,这是本季度最值得实测的、检索之外的另一条路。
评论
还没有评论。成为第一个评论的人!
相关工具
相关洞察
ChatGPT 额度不够用?在 Codex 里切换 DeepSeek 和 Grok
Codex Router 让你继续使用熟悉的 Codex 工作台,同时把任务交给 DeepSeek、Grok 等外部模型。看懂它怎样工作、额度怎么算,以及“不用翻墙”的前提。

Obsidian CLI + Codex:把笔记库变成 Agent 的知识引擎
Obsidian CLI 让 Codex、Claude Code、Gemini CLI 等 Agent 能以可搜索、可追踪、保留双链语义的方式读写本地 Vault。本文用真实社区案例和可复制工作流说明如何搭建。
GPT-6 Astra 没追上 Fable 5.1,追上的是账单
Artificial Analysis 智能指数上 Fable 5.1 66 分、Astra 61 分,Astra 没追上智力。但完成同一批任务的成本只要 Fable 5.1 的不到一半,真正收紧的是账单,不是脑子。