Tech & AI News
Hacker News

LensVLM: Compressing long context as images, expanding only relevant pages

Apple’s LensVLM-9B is a vision language model that processes long-context documents by scanning compressed images and selectively expanding only relevant pages. Developers can integrate the model using Transformers, vLLM, or SGLang libraries. It is accessible through various deployment methods, including local applications, Docker containers, and cloud-based notebooks like Google Colab and Kaggle.