- Startseite
- KI-Modelle
- Confucius4-R2T2
AudiomodellOffene Gewichte
Confucius4-R2T2
NetEase Youdao
- Veröffentlicht
- -
- Datenstand
- 3. Oktober 2026
- Modellklasse
- Zugang
Confucius4-R2T2 ist ein Streaming-ASR-Modell für Chinesisch und Englisch. Es baut auf Qwen3-ASR-1.7B auf, hält einen stabilen Präfix im Transkript und erlaubt konfigurierbare Dekodier-Chunks von 80 Millisekunden bis zwei Sekunden.
Die Modellkarte nennt etwa 200 bis 600 Millisekunden durchschnittliche Latenz. Die Gewichte sind lokal nutzbar und stehen unter der NetEase Model Use License Agreement.
Technische Daten und Zugang
| Angabe | Wert und Quelle |
|---|---|
| Modellklasse | Streaming-SpracherkennungQuelle |
| Zugang | Lokale GewichteQuelle |
| Eingabe | Chinesisches und englisches AudioQuelle |
| Ausgabe | Stabiles Streaming-TranskriptQuelle |
| Checkpoint | netease-youdao/Confucius4-R2T2Quelle |
| Lizenz | NetEase Model Use License AgreementQuelle |
| Basismodell | Auf Qwen/Qwen3-ASR-1.7B aufgebautQuelle |
| Latenz | Durchschnittlich etwa 200 bis 600 MillisekundenQuelle |
| Dekodierung | Konfigurierbare Chunks von 80 Millisekunden bis 2 SekundenQuelle |
Seite 1 von 2
Messungen ohne passende Vergleichswerte
Für diese Messungen fehlen passende Vergleichswerte unter gleichen Testbedingungen. Die Originalwerte und Quellen bleiben hier nachlesbar.
AMI WER (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 11.37
- Bewertung
- 11.37
- Messgröße
- word error rate
- Einheit
- %
- Benchmark-Version
- source version not stated
- Kategorie
- audio
- Richtung
- Weniger ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Confucius4-R2T2 model card
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. 160 ms representative streaming configuration; true streaming, append-only
- Einordnung
- Quellenspezifische Beobachtung. Sie begründet keine vergleichbare modellübergreifende Testkohorte.
GigaSpeech clean WER (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 9.6
- Bewertung
- 9.6
- Messgröße
- word error rate
- Einheit
- %
- Benchmark-Version
- source version not stated
- Kategorie
- audio
- Richtung
- Weniger ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Confucius4-R2T2 model card
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. 160 ms representative streaming configuration; true streaming, append-only
- Einordnung
- Quellenspezifische Beobachtung. Sie begründet keine vergleichbare modellübergreifende Testkohorte.
LibriSpeech clean WER (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 2.13
- Bewertung
- 2.13
- Messgröße
- word error rate
- Einheit
- %
- Benchmark-Version
- source version not stated
- Kategorie
- audio
- Richtung
- Weniger ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Confucius4-R2T2 model card
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. 160 ms representative streaming configuration; true streaming, append-only
- Einordnung
- Quellenspezifische Beobachtung. Sie begründet keine vergleichbare modellübergreifende Testkohorte.
LibriSpeech other WER (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 4.88
- Bewertung
- 4.88
- Messgröße
- word error rate
- Einheit
- %
- Benchmark-Version
- source version not stated
- Kategorie
- audio
- Richtung
- Weniger ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Confucius4-R2T2 model card
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. 160 ms representative streaming configuration; true streaming, append-only
- Einordnung
- Quellenspezifische Beobachtung. Sie begründet keine vergleichbare modellübergreifende Testkohorte.
SPGISpeech WER (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 3
- Bewertung
- 3
- Messgröße
- word error rate
- Einheit
- %
- Benchmark-Version
- source version not stated
- Kategorie
- audio
- Richtung
- Weniger ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Confucius4-R2T2 model card
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. 160 ms representative streaming configuration; true streaming, append-only
- Einordnung
- Quellenspezifische Beobachtung. Sie begründet keine vergleichbare modellübergreifende Testkohorte.
VoxPopuli WER (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 3.07
- Bewertung
- 3.07
- Messgröße
- word error rate
- Einheit
- %
- Benchmark-Version
- source version not stated
- Kategorie
- audio
- Richtung
- Weniger ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Confucius4-R2T2 model card
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. 160 ms representative streaming configuration; true streaming, append-only
- Einordnung
- Quellenspezifische Beobachtung. Sie begründet keine vergleichbare modellübergreifende Testkohorte.
Earnings22 WER (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 9.36
- Bewertung
- 9.36
- Messgröße
- word error rate
- Einheit
- %
- Benchmark-Version
- source version not stated
- Kategorie
- audio
- Richtung
- Weniger ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Confucius4-R2T2 model card
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. 160 ms representative streaming configuration; true streaming, append-only
- Einordnung
- Quellenspezifische Beobachtung. Sie begründet keine vergleichbare modellübergreifende Testkohorte.
TED-LIUM WER (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 3.34
- Bewertung
- 3.34
- Messgröße
- word error rate
- Einheit
- %
- Benchmark-Version
- source version not stated
- Kategorie
- audio
- Richtung
- Weniger ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Confucius4-R2T2 model card
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. 160 ms representative streaming configuration; true streaming, append-only
- Einordnung
- Quellenspezifische Beobachtung. Sie begründet keine vergleichbare modellübergreifende Testkohorte.
EN-RealSI WER (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 8.4
- Bewertung
- 8.4
- Messgröße
- word error rate
- Einheit
- %
- Benchmark-Version
- source version not stated
- Kategorie
- audio
- Richtung
- Weniger ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Confucius4-R2T2 model card
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. 160 ms representative streaming configuration; true streaming, append-only
- Einordnung
- Quellenspezifische Beobachtung. Sie begründet keine vergleichbare modellübergreifende Testkohorte.
Wenet-net CER (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 5.87
- Bewertung
- 5.87
- Messgröße
- character error rate
- Einheit
- %
- Benchmark-Version
- source version not stated
- Kategorie
- audio
- Richtung
- Weniger ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Confucius4-R2T2 model card
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. 160 ms representative streaming configuration
- Einordnung
- Quellenspezifische Beobachtung. Sie begründet keine vergleichbare modellübergreifende Testkohorte.
Wenet-meeting CER (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 7.27
- Bewertung
- 7.27
- Messgröße
- character error rate
- Einheit
- %
- Benchmark-Version
- source version not stated
- Kategorie
- audio
- Richtung
- Weniger ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Confucius4-R2T2 model card
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. 160 ms representative streaming configuration
- Einordnung
- Quellenspezifische Beobachtung. Sie begründet keine vergleichbare modellübergreifende Testkohorte.
SPEECHIO-06 CER (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 7.3
- Bewertung
- 7.3
- Messgröße
- character error rate
- Einheit
- %
- Benchmark-Version
- source version not stated
- Kategorie
- audio
- Richtung
- Weniger ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Confucius4-R2T2 model card
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. 160 ms representative streaming configuration
- Einordnung
- Quellenspezifische Beobachtung. Sie begründet keine vergleichbare modellübergreifende Testkohorte.
Seite 1 von 2
Quellen und Datenstand
Alle Angaben verweisen auf die zugrunde liegende Dokumentation oder das jeweilige Leaderboard.
| Art | Nachweis und Datenstand |
|---|---|
| Recherchestand | Recherchestand 4. Oktober 2026. 1 Quellen-URLs geprüft. Das dokumentiert die geprüften Quellen, nicht sämtliche Veröffentlichungen zu diesem Modell. |
| Weitere Quelle | Confucius4-R2T2 model card (abgerufen 3. Oktober 2026; 4. Oktober 2026) · Confucius4-R2T2 model card · Redaktionelle Beschreibung geprüft am 3. Oktober 2026 |