LensVLM-9B
LensVLM-9B は Apple が 2026-09-22 に公開した 9B の視覚言語モデルで、重み、論文、推論コードが Hugging Face にまとめて置かれています。発想はシンプルです。長い文書をトークンとして与えるのをやめ、画像として描画し、どのページを高コストな非圧縮形式に戻すかはモデル自身に決めさせます。
圧縮のつまみが独特です。視覚エンコーダは固定サイズの画像を固定数の視覚トークンに写像するため、描画解像度を下げればそのままトークンコストが下がります。Apple の論文は、これだけでは失敗する理由も説明しています。圧縮率が上がると文字がエンコーダの実効解像度を下回り、判別できなくなって精度が急速に崩れるのです。LensVLM はそこを埋めるモデルです。
仕組み
モデルは 2 段階で動くよう事後学習されています。
- スキャン。 文書全体を圧縮されたページ画像として読み込みます。トークンは安く済みます。
- 選択的展開。 学習済みのツールを呼び出し、必要なページだけを非圧縮の形に戻します。再描画したテキストでも、高解像度の画像でもかまいません。
訓練によって、いつ展開すべきか、どのツールを使うべきかを学びます。Apple の分析では、訓練により視覚圧縮が描画条件に対して頑健になり、圧縮率が上がるほどモデルは小さな文字を無理に読むのではなく展開後の内容に頼るようになります。論文は実務的な指針も示しています。描画されたテキストにはテキスト展開が、レイアウト自体が情報を持つネイティブ文書には高解像度の画像展開が適しています。
論文が報告する数値
| 指標 | 結果 |
|---|---|
| ベースモデル | Qwen3.5-9B-Base |
| 4.3 倍の実効圧縮 | 全文の上限と同程度の精度 |
| 最大 10.1 倍の圧縮 | 検索ベース、テキスト圧縮、視覚圧縮の各ベースラインを上回る |
| 評価範囲 | 7 つのテキスト QA ベンチマーク |
| テキスト QA 以外 | マルチモーダル文書とコード理解にも汎化 |
| ライセンス | Apple Machine Learning Research Model License(コードは Apple Sample Code License) |
注目すべきは個々の数値ではなく曲線の形です。圧縮率が上がるほど、他の手法に対する優位が広がります。これは多くの長文コンテキストの小技とは逆の挙動です。
コミュニティの反応
2026-09-24 時点で、モデルカードは 147 のいいねと 455 のダウンロード、付属のコードリポジトリは約 50 スターです。フロンティアモデルの基準では控えめですが、研究リリースとしては普通の数字です。ただし公開翌日に論文が Hacker News のトップページに上がっており、実務家の関心はダウンロード数以上に高いことがうかがえます。
想定される用途
- 長文書の質問応答。 年次報告書、マニュアル、契約書など、全文コンテキストが請求の中で最も高い部分になる場面。
- 検索を使わない RAG。 チャンク分割と埋め込み検索の代わりに、圧縮したページ画像を渡し、必要な部分を展開させます。Apple はまさにこの比較をベンチマークしています。
- レイアウト依存の文書。 表や帳票など、視覚的な配置が意味を持つ文書で、重要なページに高解像度展開を使う。
- 文書とコードの混在。 コード理解にも汎化すると公式に説明されています。
クイックスタート
git clone https://github.com/apple-aiml-research/ml-lensvlm
cd ml-lensvlm
pip install -r requirements.txt
python scripts/run_demo.py --model apple/LensVLM-9B
自分の文書を試す場合:
python demo.py \
--model apple/LensVLM-9B \
--text_file document.txt \
--question "What is the main finding?" \
--compression 10x
圧縮率は 5x、10x、15x から選べます。まず 10x から始め、自分が知りたい問いにまだ正しく答えられるかを確認してください。平均が良く見えても、精度の曲線はワークロードごとに異なります。
制限
- 研究リリースであり製品ではありません。 ホスト型エンドポイントはなく、重みは自分で動かし、コードは Apple のリポジトリのものを使います。
- Apple 独自のライセンス。 重みは Apple Machine Learning Research Model License、コードは Apple Sample Code License で、いずれも標準的なオープンソースライセンスではありません。商用利用の前に必ず確認してください。
- 比較対象は全文の上限で、フロンティアモデルではありません。 LensVLM の強みは効率であり、本質的には圧縮画像を読む 9B モデルです。
- 圧縮は設計上非可逆です。 展開ツールが取り戻せるのはモデルが要求したページだけで、展開されなかったページは圧縮されたまま残ります。誤りの温床はそこです。
- 論文は重みより先行しています。 arXiv のプレプリントは 2026 年 5 月、重みとコードは 9 月に公開されました。
よくある質問
LensVLM-9B はオープンソースですか?
重みは公開されておりコードも公開されていますが、適用されるのは Apple 独自の研究ライセンスとサンプルコードライセンスで、OSI 承認のオープンソースライセンスではありません。用途に応じて条件を確認してください。
実行に GPU は必要ですか?
9B の視覚言語モデルを動かせるハードウェアが必要です。公式にサポートされているのはリポジトリのデモスクリプトです。
OCR とテキストモデルの組み合わせと何が違いますか?
OCR はページを先に文字へ変換するため、レイアウトが失われ、別の処理も必要になります。LensVLM はページを画像のまま保持し、展開したページにだけ追加コストを払います。
検索の代替になりますか?
一概には言えません。Apple は検索ベースのベースラインと比較し、高い圧縮率でより良い精度を報告しています。つまり一部のワークロードでは検索の代替になり得ますが、普遍的な置き換えではありません。
代替案
- Mistral OCR 4.1: 圧縮画像ではなく構造化テキストが欲しい場合。
- Qwen-VL: 圧縮の仕掛けを持たない汎用の視覚言語シリーズ。
- Ling 3.0 Flash VL: コストに敏感なパイプライン向けの小さめのマルチモーダル選択肢。
まとめ
LensVLM-9B は、コンテキストをトークンの予算ではなく描画の判断として扱います。そして選択的展開こそが、その発想を成立させている部分です。研究リリースでライセンスも独自、ホスト型エンドポイントもないため、API の即時代替にはなりません。ただし請求の大半が長文書に由来するチームにとって、今四半期に試す価値が最も高い、検索以外の選択肢です。
コメント
まだコメントがありません。最初のコメントを投稿してください!