- Startseite
- KI-Modelle
- Cartesia Ink-2
Cartesia Ink-2
Cartesia
- Veröffentlicht
- 9. Juli 2026
- Datenstand
- 3. Oktober 2026
- Modellklasse
- Zugang
Cartesia Ink-2 ist ein Streaming-ASR-Modell für Sprachagenten. Cartesia nennt etwa 0,1 Sekunden vom Ende der gesprochenen Eingabe bis zum finalen Transkript (TTFT). Das ist nicht die Zeit bis zum ersten Teilergebnis. Das Modell ergänzt Transkription um semantisches Endpointing und strukturierte Entitäten.
Der Endpunkt ink-2 ist über die Cartesia-API und Play erreichbar. Zur Einführung wurde Englisch genannt, eine neuere Produktseite nennt zusätzlich Spanisch, Französisch, Hindi und Japanisch. Die Sprachangaben der offiziellen Quellen sind nicht einheitlich. Die Abrechnung nutzt drei Credits pro Audiosekunde, deren Dollarpreis vom Tarif abhängt.
Technische Daten und Zugang
| Angabe | Wert und Quelle |
|---|---|
| Modellklasse | Streaming-SpracherkennungQuelle |
| Zugang | Cartesia API und PlayQuelle |
| Eingabe | AudioQuelle |
| Ausgabe | Transkript und strukturierte EntitätenQuelle |
| API-Modellkennung | ink-2Quelle |
| Sprachen | Englisch zum Start laut Ankündigung; die aktuelle Ink-Produktseite nennt zusätzlich Spanisch, Französisch, Hindi und Japanisch. Die Angaben zur Sprachabdeckung sind nicht einheitlich.Quelle |
| Latenz bis zum finalen Transkript | Laut Anbieter etwa 0,1 Sekunden ab dem Ende der gesprochenen Eingabe bis zum finalen Transkript (TTFT), nicht bis zum ersten TeilergebnisQuelle |
| Funktionen | Semantisches Endpointing und strukturierte EntitätserkennungQuelle |
Messungen ohne passende Vergleichswerte
Für diese Messungen fehlen passende Vergleichswerte unter gleichen Testbedingungen. Die Originalwerte und Quellen bleiben hier nachlesbar.
VoiceCodeBench: CTEM (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 89.541
- Bewertung
- 89.541
- Messgröße
- canonical token/entity match
- Einheit
- %
- Benchmark-Version
- 1
- Kategorie
- general
- Aufgabe
- ctem
- Aufgabenbezeichnung
- CTEM
- Richtung
- Mehr ist besser
- Vergleichskohorte
- vals-voice-code-bench:1:ctem
- Quellentyp
- independent-evaluator
- Auswertung
- Vals AI
- Status
- active
- Abrufdatum
- 2026-09-29
- Methodik
- Kennung des Quellmodells: cartesia/ink-2. Name des Quellmodells: Ink 2. Anbieter laut Quelle: Cartesia. Evaluator: Vals AI. Datensatztyp: public. Stand der Rangliste: 2026-09-24. Latenz in Sekunden: 69.197. Standardfehler: 0. Quellenkennung: vals-ai. Kennung der Evidenzaufnahme: vals-voice-code-bench-2026-09-29-7d87ad468e81. Prüfsumme der Quelldaten: 7d87ad468e8136922daec73432384e9d40b0f52e64cc6e6a0e73db7d6e7c264c. Parserversion: vals-astro-v2. Importiert am: 2026-09-29
VoiceCodeBench: Overall (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 62
- Bewertung
- 62
- Messgröße
- task success rate
- Einheit
- %
- Benchmark-Version
- 1
- Kategorie
- general
- Aufgabe
- overall
- Aufgabenbezeichnung
- Overall
- Richtung
- Mehr ist besser
- Vergleichskohorte
- vals-voice-code-bench:1:overall
- Quellentyp
- independent-evaluator
- Auswertung
- Vals AI
- Status
- active
- Abrufdatum
- 2026-09-29
- Methodik
- Kennung des Quellmodells: cartesia/ink-2. Name des Quellmodells: Ink 2. Anbieter laut Quelle: Cartesia. Evaluator: Vals AI. Datensatztyp: public. Stand der Rangliste: 2026-09-24. Latenz in Sekunden: 69.197. Standardfehler: 0. Quellenkennung: vals-ai. Kennung der Evidenzaufnahme: vals-voice-code-bench-2026-09-29-7d87ad468e81. Prüfsumme der Quelldaten: 7d87ad468e8136922daec73432384e9d40b0f52e64cc6e6a0e73db7d6e7c264c. Parserversion: vals-astro-v2. Importiert am: 2026-09-29
Endpointing precision (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 89
- Bewertung
- 89
- Messgröße
- precision
- Einheit
- %
- Benchmark-Version
- source version not stated
- Kategorie
- audio
- Richtung
- Mehr ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Cartesia Ink-2 announcement
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. Internal July 2026 endpointing benchmark
- Einordnung
- Die von Cartesia berichteten Werte und die datierten Vals-Beobachtungen nutzen unterschiedliche Metriken und Kohorten. Daraus wird keine quellenübergreifende Rangfolge abgeleitet.
Endpointing recall (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 97
- Bewertung
- 97
- Messgröße
- recall
- Einheit
- %
- Benchmark-Version
- source version not stated
- Kategorie
- audio
- Richtung
- Mehr ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Cartesia Ink-2 announcement
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. Internal July 2026 endpointing benchmark
- Einordnung
- Die von Cartesia berichteten Werte und die datierten Vals-Beobachtungen nutzen unterschiedliche Metriken und Kohorten. Daraus wird keine quellenübergreifende Rangfolge abgeleitet.
Endpointing F1 (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 93
- Bewertung
- 93
- Messgröße
- F1
- Einheit
- %
- Benchmark-Version
- source version not stated
- Kategorie
- audio
- Richtung
- Mehr ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Cartesia Ink-2 announcement
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. Internal July 2026 endpointing benchmark
- Einordnung
- Die von Cartesia berichteten Werte und die datierten Vals-Beobachtungen nutzen unterschiedliche Metriken und Kohorten. Daraus wird keine quellenübergreifende Rangfolge abgeleitet.
VoiceCodeBench: WER (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 9.249
- Bewertung
- 9.249
- Messgröße
- word error rate
- Einheit
- %
- Benchmark-Version
- 1
- Kategorie
- general
- Aufgabe
- wer
- Aufgabenbezeichnung
- WER
- Richtung
- Weniger ist besser
- Vergleichskohorte
- vals-voice-code-bench:1:wer
- Quellentyp
- independent-evaluator
- Auswertung
- Vals AI
- Status
- active
- Abrufdatum
- 2026-09-29
- Methodik
- Kennung des Quellmodells: cartesia/ink-2. Name des Quellmodells: Ink 2. Anbieter laut Quelle: Cartesia. Evaluator: Vals AI. Datensatztyp: public. Stand der Rangliste: 2026-09-24. Latenz in Sekunden: 69.197. Standardfehler: 0. Quellenkennung: vals-ai. Kennung der Evidenzaufnahme: vals-voice-code-bench-2026-09-29-7d87ad468e81. Prüfsumme der Quelldaten: 7d87ad468e8136922daec73432384e9d40b0f52e64cc6e6a0e73db7d6e7c264c. Parserversion: vals-astro-v2. Importiert am: 2026-09-29
AA-AgentTalk3 WER (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 3.4
- Bewertung
- 3.4
- Messgröße
- word error rate
- Einheit
- %
- Benchmark-Version
- source version not stated
- Kategorie
- audio
- Richtung
- Weniger ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Cartesia Ink-2 announcement
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. Cartesia report of AA leaderboard, June 2026
- Einordnung
- Die von Cartesia berichteten Werte und die datierten Vals-Beobachtungen nutzen unterschiedliche Metriken und Kohorten. Daraus wird keine quellenübergreifende Rangfolge abgeleitet.
VoxPopuli WER (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 2.4
- Bewertung
- 2.4
- Messgröße
- word error rate
- Einheit
- %
- Benchmark-Version
- source version not stated
- Kategorie
- audio
- Richtung
- Weniger ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Cartesia Ink-2 announcement
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. Cartesia report of AA leaderboard, June 2026
- Einordnung
- Die von Cartesia berichteten Werte und die datierten Vals-Beobachtungen nutzen unterschiedliche Metriken und Kohorten. Daraus wird keine quellenübergreifende Rangfolge abgeleitet.
Earnings22 WER (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 5.3
- Bewertung
- 5.3
- Messgröße
- word error rate
- Einheit
- %
- Benchmark-Version
- source version not stated
- Kategorie
- audio
- Richtung
- Weniger ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Cartesia Ink-2 announcement
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. Cartesia report of AA leaderboard, June 2026
- Einordnung
- Die von Cartesia berichteten Werte und die datierten Vals-Beobachtungen nutzen unterschiedliche Metriken und Kohorten. Daraus wird keine quellenübergreifende Rangfolge abgeleitet.
WER across 14 English accents (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 8
- Bewertung
- 8
- Messgröße
- word error rate
- Einheit
- %
- Benchmark-Version
- source version not stated
- Kategorie
- audio
- Richtung
- Weniger ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Cartesia Ink-2 announcement
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. Cartesia report; competitors Ink 8, Flux 10, Scribe 12, Universal 3.5 13
- Einordnung
- Die von Cartesia berichteten Werte und die datierten Vals-Beobachtungen nutzen unterschiedliche Metriken und Kohorten. Daraus wird keine quellenübergreifende Rangfolge abgeleitet.
WER (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 6.5
- Bewertung
- 6.5
- Messgröße
- word error rate
- Einheit
- %
- Benchmark-Version
- source version not stated
- Kategorie
- audio
- Richtung
- Weniger ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Cartesia Ink-2 announcement
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. 36 real calls; July 2026 internal comparison
- Einordnung
- Die von Cartesia berichteten Werte und die datierten Vals-Beobachtungen nutzen unterschiedliche Metriken und Kohorten. Daraus wird keine quellenübergreifende Rangfolge abgeleitet.
Veröffentlichte Preise
Die Preise gelten für die jeweils genannte Einheit. Auflösung, Ausgabelänge und Anbieter können die Kosten verändern.
- Preis
- 3 Credits pro Audiosekunde; der Dollarpreis und Mehrverbrauch hängen vom Tarif abQuelle
Quellen und Datenstand
Alle Angaben verweisen auf die zugrunde liegende Dokumentation oder das jeweilige Leaderboard.
| Art | Nachweis und Datenstand |
|---|---|
| Recherchestand | Recherchestand 4. Oktober 2026. 1 Quellen-URLs geprüft. Das dokumentiert die geprüften Quellen, nicht sämtliche Veröffentlichungen zu diesem Modell. |
| Ungeklärt | benchmark-cohorts Originalwortlaut Die von Cartesia berichteten WER- und Endpointing-Werte, die aktuellen Vals-Zeilen mit WAcc/CTEM/TSR und die datierte Vals-Aufnahme vom 29. September 2026 mit WER/CTEM/TSR verwenden unterschiedliche Metriken oder Kohorten. Sie bleiben getrennt, werden weder überschrieben noch gemeinsam gerankt. |
| Weitere Quelle | Cartesia Ink-2 announcement (abgerufen 3. Oktober 2026; 4. Oktober 2026) · Cartesia Ink-2 announcement · Redaktionelle Beschreibung geprüft am 3. Oktober 2026 |
| Weitere Quelle | Cartesia Ink product page (abgerufen 3. Oktober 2026) · Cartesia Ink product page · Redaktionelle Beschreibung geprüft am 3. Oktober 2026 |
| Weitere Quelle | Cartesia pricing (abgerufen 3. Oktober 2026) · Cartesia pricing · Redaktionelle Beschreibung geprüft am 3. Oktober 2026 |
| Weitere Quelle | Vals AI (abgerufen 29. September 2026) |