LensVLM-9B logo

LensVLM-9B

打开

苹果发布的 9B 视觉语言模型:把文档当作压缩图片来读,只把真正相关的页面放大还原,在 4.3 倍压缩下仍保持全文级别的准确率。

分享:
查看替代方案

LensVLM-9B

LensVLM-9B 是苹果在 2026-09-22 发布的 9B 视觉语言模型,权重、论文与推理代码一起放在 Hugging Face 上。它的想法说起来很简单:别再拿 token 喂长文档,改成把文档渲染成图片,然后让模型自己决定哪些页面值得花高价「还原」成不压缩的形式。

它的压缩旋钮很特别。视觉编码器会把固定尺寸的图片映射成固定数量的视觉 token,所以缩小渲染分辨率就能直接缩小 token 成本。苹果的论文解释了为什么单靠这一招会失败:压缩率一高,字符就小到视觉编码器根本分辨不出来,准确率迅速崩掉。LensVLM 就是为这个问题做的。

工作方式

这个模型被后训练成两步走:

  1. 扫描。 先把整份文档当作压缩的页面图片读进来,token 很便宜。
  2. 选择性展开。 调用学到的工具,只把相关页面还原成未压缩形式,可以是重新渲染的文本,也可以是高分辨率图片。

训练让模型学会什么时候该展开、该用哪个工具。苹果的分析发现:经过训练,视觉压缩对渲染方式的鲁棒性明显提高;压缩率越大,模型越依赖展开后的内容,而不是硬读那些很小的字。论文还给出了一条实用建议:渲染类文本适合用文本展开,而版式本身承载信息的原生文档更适合用高分辨率图片展开。

论文给出的数据

指标 结果
基础模型 Qwen3.5-9B-Base
4.3 倍有效压缩 准确率与全文上界相当
最高 10.1 倍压缩 优于基于检索、文本压缩与视觉压缩的基线
评测范围 七个文本问答基准
文本问答之外 可泛化到多模态文档与代码理解
许可 Apple Machine Learning Research Model License(代码为 Apple Sample Code License)

真正值得注意的是曲线的形状,而不是某个单独的数字:压缩率越高,它相对其他方法的领先幅度越大。这跟大多数长上下文的取巧办法正好相反。

社区热度

截至 2026-09-24,模型卡显示 147 个 like、455 次下载,配套代码仓库约 50 star。按前沿模型的标准这些数字不大,对研究发布来说也算正常;但论文发布后第二天就被顶上了 Hacker News 首页,说明从业者对这条技术路线的兴趣高于下载量所显示的。

适用场景

  • 长文档问答。 年报、手册、合同这类场景,全文上下文就是账单里最贵的那部分。
  • 不用检索的 RAG。 不做分块和向量检索,直接把压缩后的页面图交给模型,让它自己展开需要的部分。苹果正是拿这条路线做的对比实验。
  • 版式敏感文档。 表格和表单这类靠视觉排布表达含义的场景,对关键页使用高分辨率展开。
  • 文档与代码混合。 官方说明该能力也泛化到代码理解。

快速开始

git clone https://github.com/apple-aiml-research/ml-lensvlm
cd ml-lensvlm
pip install -r requirements.txt
python scripts/run_demo.py --model apple/LensVLM-9B

跑自己的文档:

python demo.py \
  --model apple/LensVLM-9B \
  --text_file document.txt \
  --question "What is the main finding?" \
  --compression 10x

压缩率可选 5x、10x、15x。建议从 10x 开始,然后确认你关心的问题还答得对,因为即使平均值好看,准确率曲线依然是因负载而异的。

限制

  • 研究版,不是产品。 没有托管接口,权重得自己跑,代码要用苹果仓库里的那份。
  • 苹果自有许可。 权重适用 Apple Machine Learning Research Model License,代码适用 Apple Sample Code License,都不是标准开源许可,商用前请自己读条款。
  • 对比对象是全文上界,不是前沿模型。 LensVLM 的优势在效率,而它本质上仍是一个 9B 模型在看压缩图片答题。
  • 压缩本身是有损的。 展开工具只能找回模型主动要求的那几页,没被展开的页面保持压缩状态,错误也正是从这里来的。
  • 论文早于权重。 arXiv 预印本是 2026 年 5 月的,权重和代码 9 月才放出来。

常见问题

LensVLM-9B 是开源的吗?

权重可以公开下载,代码也是公开的,但用的是苹果自己的研究许可与示例代码许可,不是 OSI 认证的开源许可。请按自己的用途核对条款。

需要 GPU 吗?

需要一个能跑 9B 视觉语言模型的硬件环境,仓库里的 demo 脚本是官方支持的路径。

它和「OCR 加文本模型」有什么区别?

OCR 先把页面变成文字,会丢掉版式,还要单独跑一遍。LensVLM 把页面保留为图片,只为展开的那几页额外付费。

它能替代检索吗?

不一定。苹果与基于检索的基线做了对比,在高压缩率下准确率更好,这意味着对某些负载它是检索的替代方案,而不是普遍替换。

替代方案

  • Mistral OCR 4.1:想要结构化文本而不是压缩图片时用它。
  • Qwen-VL:没有压缩技巧的通用视觉语言系列。
  • Ling 3.0 Flash VL:对成本敏感的流水线可以考虑的小尺寸多模态选项。

总结

LensVLM-9B 把上下文当成一个渲染决策而不是 token 预算,而选择性展开是让整套想法成立的关键。它是研究发布,许可是自有的,也没有托管接口,所以不能当作 API 的即插即用替代。但对于账单主要花在长文档上的团队,这是本季度最值得实测的、检索之外的另一条路。

评论

还没有评论。成为第一个评论的人!