Zum Hauptinhalt springen
SprachmodellOffene Gewichte

Ling-3.0-flash-VL

InclusionAI

Veröffentlicht
-
Datenstand
3. Oktober 2026

Neu an Ling-3.0-flash-VL gegenüber Ling 3.0 Flash sind native Bild- und Videoeingaben. VideoRoPE bildet räumliche Positionen und zeitliche Abläufe ab, etwa für Fragen zu Ereignissen in längeren Videos. InclusionAI ergänzt die Sprachbasis dafür um einen visuellen Encoder.

Das MoE-Modell aktiviert 5,5 seiner 124 Milliarden Parameter pro Token und verarbeitet bis zu 256K Token Kontext. Die lokalen Gewichte stehen unter MIT.

Technische Daten und Zugang

AngabeWert und Quelle
Modellkennung
inclusionAI/Ling-3.0-flash-VLQuelle
Modellklasse
Multimodales Sprachmodell mit Vision-EncoderQuelle
Parameter
124 Milliarden insgesamt, 5,5 Milliarden aktivQuelle
Kontextfenster
Bis zu 256K Token laut ModellkarteQuelle
Architektur
ViT-Vision-Encoder, MLP-Projektor, VideoRoPE und Sparse-MoE-BackboneQuelle
Eingabe
Text, Bilder und VideoQuelle
Lizenz