Zum Hauptinhalt springen
AudiomodellOffene Gewichte

MOSS-Audio-4B-Thinking

OpenMOSS Team

Veröffentlicht
13. April 2026
Datenstand
3. Oktober 2026

MOSS-Audio-4B-Thinking verbindet Audioverständnis mit Text-Reasoning. Das rund 4,6 Milliarden Parameter große Modell verarbeitet Audio und Text und beantwortet Fragen, beschreibt Aufnahmen oder erzeugt zeitmarkierte Transkripte.

Die Ausgabe bleibt Text. Trotz des Audioinputs ist MOSS-Audio-4B-Thinking kein Sprachsynthesizer und erzeugt keine gesprochene Antwort. Die Gewichte stehen unter Apache-2.0 lokal zur Verfügung.

Technische Daten und Zugang

AngabeWert und Quelle
Modellklasse
Audioverständnis und Text-ReasoningQuelle
Zugang
Lokale GewichteQuelle
Eingabe
Audio und TextQuelle
Ausgabe
TextQuelle
Checkpoint
OpenMOSS-Team/MOSS-Audio-4B-ThinkingQuelle
Lizenz
Apache-2.0Quelle
Aufgaben
ASR, Audio-Fragen, Audiobeschreibung und Zeitstempel-ASRQuelle
Reasoning
Generiert Textantworten mit einem Qwen3-4B-Backbone, nicht gesprochene AudioantwortenQuelle
Repository
Offizielles OpenMOSS-Audio-RepositoryQuelle