Zum Hauptinhalt springen
SpezialmodellOpen Weights

LensVLM-9B

Apple

Veröffentlicht
-
Datenstand
3. Oktober 2026

LensVLM-9B ist Apples Vision-Language-Modell für lange Dokumente. Es scannt komprimierte Bilddarstellungen von Text und erweitert nur die Seiten, die für die aktuelle Frage relevant sind. Dadurch bleibt die visuelle Verarbeitung selektiv, statt jedes Dokument vollständig in hoher Auflösung zu laden.

Der 9-Milliarden-Parameter-Checkpoint läuft lokal mit Transformers, vLLM oder SGLang unter der Apple Machine Learning Research Model License. Die veröffentlichte Demo bietet 5-fache, 10-fache und 15-fache Kompression. Einen gehosteten Inference Provider nennt die Model Card nicht.

Technische Daten und Zugang

AngabeWert und Quelle
Modellkennung
apple/LensVLM-9BQuelle
Modellklasse
Vision-Language-Modell für selektive Kontext-ErweiterungQuelle
Parameter
9 MilliardenQuelle
Kompression
5-fach, 10-fach oder 15-fach als EingabekompressionQuelle
Zugang
Lokale Ausführung, kein gehosteter Inference Provider auf Hugging FaceQuelle
Lizenz
Apple Machine Learning Research Model LicenseQuelle