Hacker News
LensVLM: Compressing long context as images, expanding only relevant pages
Apple’s LensVLM-9B is a vision language model that processes long-context documents by scanning compressed images and selectively expanding only relevant pages. Developers can integrate the model using Transformers, vLLM, or SGLang libraries. It is accessible through various deployment methods, including local applications, Docker containers, and cloud-based notebooks like Google Colab and Kaggle.