- Startseite
- KI-Modelle
- Qwen3.8-Omni-Flash-Realtime
Qwen3.8-Omni-Flash-Realtime
Alibaba
- Veröffentlicht
- 21. September 2026
- Datenstand
- 3. Oktober 2026
- Modellklasse
Qwen3.8-Omni-Flash-Realtime verbindet Live-Eingaben aus Text, Audio und Video mit Text- und Audioausgabe. Die Realtime-Dokumentation führt WebSocket, WebRTC und AOQ als Transporte auf; Funktionsaufrufe und MCP gehören zum dokumentierten Aktionspfad.
Die Variante hat einen 196.608-Token-Eingabekontext und bis zu 65.536 Ausgabe-Token. Die Tarife unterscheiden sich zwischen Beijing und Singapur. Bei Sprachausgabe werden Audio und der zugehörige Text berechnet. Ein separater neuer Gewichts-Checkpoint ist nicht veröffentlicht.
Technische Daten und Zugang
| Angabe | Wert und Quelle |
|---|---|
| Modellklasse | Omnimodales EchtzeitmodellQuelle |
| Zugang | Alibaba Cloud Model Studio APIQuelle |
| Eingabe | Text, Audio und VideoQuelle |
| Ausgabe | Text und AudioQuelle |
| API-Modellkennung | qwen3.8-omni-flash-realtimeQuelle |
| Audiohistorie | Bis zu 100 Audio-Turns oder 600 Sekunden; Video bis zu 50 Turns oder 240 SekundenQuelle |
| Transport | WebSocket, WebRTC oder AOQQuelle |
| Einordnung | Echtzeit-API-Variante ohne separat veröffentlichte neue GewichteQuelle |
| Ratenlimit Singapur | 60 Anfragen und 2 Mio. Token pro MinuteQuelle |
Seite 1 von 4
Messungen ohne passende Vergleichswerte
Für diese Messungen fehlen passende Vergleichswerte unter gleichen Testbedingungen. Die Originalwerte und Quellen bleiben hier nachlesbar.
SEED content stability, Chinese (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 0.74
- Bewertung
- 0.74
- Messgröße
- content-stability WER/CER
- Einheit
- %
- Benchmark-Version
- arXiv:2609.25611v1, Table 11
- Kategorie
- audio
- Richtung
- Weniger ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Qwen3.8-Omni technical report
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. Zero-Shot-Stimmklonen. Die Tabelle trennt Inhaltsstabilität, Stimmähnlichkeit und den gesamten Klonwert nach Teilgruppen.
- Einordnung
- Vom Anbieter berichtetes Ergebnis für Zero-Shot-Stimmklonen. Es handelt sich nicht um eine unabhängig reproduzierte Kohorte.
SEED content stability, English (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 0.89
- Bewertung
- 0.89
- Messgröße
- content-stability WER/CER
- Einheit
- %
- Benchmark-Version
- arXiv:2609.25611v1, Table 11
- Kategorie
- audio
- Richtung
- Weniger ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Qwen3.8-Omni technical report
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. Zero-Shot-Stimmklonen. Die Tabelle trennt Inhaltsstabilität, Stimmähnlichkeit und den gesamten Klonwert nach Teilgruppen.
- Einordnung
- Vom Anbieter berichtetes Ergebnis für Zero-Shot-Stimmklonen. Es handelt sich nicht um eine unabhängig reproduzierte Kohorte.
SEED content stability, hard (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 5.29
- Bewertung
- 5.29
- Messgröße
- content-stability WER/CER
- Einheit
- %
- Benchmark-Version
- arXiv:2609.25611v1, Table 11
- Kategorie
- audio
- Richtung
- Weniger ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Qwen3.8-Omni technical report
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. Zero-Shot-Stimmklonen. Die Tabelle trennt Inhaltsstabilität, Stimmähnlichkeit und den gesamten Klonwert nach Teilgruppen.
- Einordnung
- Vom Anbieter berichtetes Ergebnis für Zero-Shot-Stimmklonen. Es handelt sich nicht um eine unabhängig reproduzierte Kohorte.
SpeechSuperClue content stability, multilingual (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 3.34
- Bewertung
- 3.34
- Messgröße
- content-stability WER/CER
- Einheit
- %
- Benchmark-Version
- arXiv:2609.25611v1, Table 11
- Kategorie
- audio
- Richtung
- Weniger ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Qwen3.8-Omni technical report
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. Zero-Shot-Stimmklonen. Die Tabelle trennt Inhaltsstabilität, Stimmähnlichkeit und den gesamten Klonwert nach Teilgruppen.
- Einordnung
- Vom Anbieter berichtetes Ergebnis für Zero-Shot-Stimmklonen. Es handelt sich nicht um eine unabhängig reproduzierte Kohorte.
SpeechSuperClue content stability, cross-lingual (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 4
- Bewertung
- 4
- Messgröße
- content-stability WER/CER
- Einheit
- %
- Benchmark-Version
- arXiv:2609.25611v1, Table 11
- Kategorie
- audio
- Richtung
- Weniger ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Qwen3.8-Omni technical report
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. Zero-Shot-Stimmklonen. Die Tabelle trennt Inhaltsstabilität, Stimmähnlichkeit und den gesamten Klonwert nach Teilgruppen.
- Einordnung
- Vom Anbieter berichtetes Ergebnis für Zero-Shot-Stimmklonen. Es handelt sich nicht um eine unabhängig reproduzierte Kohorte.
SwanBench-Speech content stability, Chinese (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 1.96
- Bewertung
- 1.96
- Messgröße
- content-stability WER/CER
- Einheit
- %
- Benchmark-Version
- arXiv:2609.25611v1, Table 11
- Kategorie
- audio
- Richtung
- Weniger ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Qwen3.8-Omni technical report
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. Zero-Shot-Stimmklonen. Die Tabelle trennt Inhaltsstabilität, Stimmähnlichkeit und den gesamten Klonwert nach Teilgruppen.
- Einordnung
- Vom Anbieter berichtetes Ergebnis für Zero-Shot-Stimmklonen. Es handelt sich nicht um eine unabhängig reproduzierte Kohorte.
SwanBench-Speech content stability, English (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 2.37
- Bewertung
- 2.37
- Messgröße
- content-stability WER/CER
- Einheit
- %
- Benchmark-Version
- arXiv:2609.25611v1, Table 11
- Kategorie
- audio
- Richtung
- Weniger ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Qwen3.8-Omni technical report
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. Zero-Shot-Stimmklonen. Die Tabelle trennt Inhaltsstabilität, Stimmähnlichkeit und den gesamten Klonwert nach Teilgruppen.
- Einordnung
- Vom Anbieter berichtetes Ergebnis für Zero-Shot-Stimmklonen. Es handelt sich nicht um eine unabhängig reproduzierte Kohorte.
LongSpeechGeneration content stability, Chinese (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 1.74
- Bewertung
- 1.74
- Messgröße
- content-stability WER/CER
- Einheit
- %
- Benchmark-Version
- arXiv:2609.25611v1, Table 11
- Kategorie
- audio
- Richtung
- Weniger ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Qwen3.8-Omni technical report
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. Zero-Shot-Stimmklonen. Die Tabelle trennt Inhaltsstabilität, Stimmähnlichkeit und den gesamten Klonwert nach Teilgruppen.
- Einordnung
- Vom Anbieter berichtetes Ergebnis für Zero-Shot-Stimmklonen. Es handelt sich nicht um eine unabhängig reproduzierte Kohorte.
LongSpeechGeneration content stability, English (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 1.59
- Bewertung
- 1.59
- Messgröße
- content-stability WER/CER
- Einheit
- %
- Benchmark-Version
- arXiv:2609.25611v1, Table 11
- Kategorie
- audio
- Richtung
- Weniger ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Qwen3.8-Omni technical report
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. Zero-Shot-Stimmklonen. Die Tabelle trennt Inhaltsstabilität, Stimmähnlichkeit und den gesamten Klonwert nach Teilgruppen.
- Einordnung
- Vom Anbieter berichtetes Ergebnis für Zero-Shot-Stimmklonen. Es handelt sich nicht um eine unabhängig reproduzierte Kohorte.
SEED Custom Voice content stability, Chinese (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 0.83
- Bewertung
- 0.83
- Messgröße
- content-stability WER/CER
- Einheit
- %
- Benchmark-Version
- arXiv:2609.25611v1, Table 12
- Kategorie
- audio
- Richtung
- Weniger ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Qwen3.8-Omni technical report
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. Custom-Voice-Evaluation. WER/CER werden niedriger bewertet, Ähnlichkeit, Genauigkeit und Erfolgsrate höher.
- Einordnung
- Vom Anbieter berichtetes Ergebnis für Custom Voice. Es handelt sich nicht um eine unabhängig reproduzierte Kohorte.
SEED Custom Voice content stability, English (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 0.93
- Bewertung
- 0.93
- Messgröße
- content-stability WER/CER
- Einheit
- %
- Benchmark-Version
- arXiv:2609.25611v1, Table 12
- Kategorie
- audio
- Richtung
- Weniger ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Qwen3.8-Omni technical report
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. Custom-Voice-Evaluation. WER/CER werden niedriger bewertet, Ähnlichkeit, Genauigkeit und Erfolgsrate höher.
- Einordnung
- Vom Anbieter berichtetes Ergebnis für Custom Voice. Es handelt sich nicht um eine unabhängig reproduzierte Kohorte.
SEED Custom Voice content stability, hard (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 5.22
- Bewertung
- 5.22
- Messgröße
- content-stability WER/CER
- Einheit
- %
- Benchmark-Version
- arXiv:2609.25611v1, Table 12
- Kategorie
- audio
- Richtung
- Weniger ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Qwen3.8-Omni technical report
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. Custom-Voice-Evaluation. WER/CER werden niedriger bewertet, Ähnlichkeit, Genauigkeit und Erfolgsrate höher.
- Einordnung
- Vom Anbieter berichtetes Ergebnis für Custom Voice. Es handelt sich nicht um eine unabhängig reproduzierte Kohorte.
Seite 1 von 4
Veröffentlichte Preise
Die Preise gelten für die jeweils genannte Einheit. Auflösung, Ausgabelänge und Anbieter können die Kosten verändern.
- Preise China (Peking)
- Je 1 Mio. Token in CNY. Audioeingabe 6, Audioausgabe 12; Text-/Bild-/Videoeingabe 1,5, Textausgabe 4,5Quelle
- Preise Singapur
- Je 1 Mio. Token in CNY. Audioeingabe 6,781, Audioausgabe 13,636; Text-/Bild-/Videoeingabe 1,677, Textausgabe 5,104Quelle
- Abrechnung von Sprache
- Sprachausgabe wird als Audio und als zugehöriger Text berechnetQuelle
- Gratis-Kontingent
- 1 Mio. Token in China (Peking), 90 Tage gültig; gilt nicht automatisch für andere RegionenQuelle
Quellen und Datenstand
Alle Angaben verweisen auf die zugrunde liegende Dokumentation oder das jeweilige Leaderboard.