Zum Hauptinhalt springen
AudiomodellAktiv

Cartesia Ink-2

Cartesia

Veröffentlicht
9. Juli 2026
Datenstand
3. Oktober 2026

Cartesia Ink-2 ist ein Streaming-ASR-Modell für Sprachagenten. Cartesia nennt etwa 0,1 Sekunden vom Ende der gesprochenen Eingabe bis zum finalen Transkript (TTFT). Das ist nicht die Zeit bis zum ersten Teilergebnis. Das Modell ergänzt Transkription um semantisches Endpointing und strukturierte Entitäten.

Der Endpunkt ink-2 ist über die Cartesia-API und Play erreichbar. Zur Einführung wurde Englisch genannt, eine neuere Produktseite nennt zusätzlich Spanisch, Französisch, Hindi und Japanisch. Die Sprachangaben der offiziellen Quellen sind nicht einheitlich. Die Abrechnung nutzt drei Credits pro Audiosekunde, deren Dollarpreis vom Tarif abhängt.

Technische Daten und Zugang

AngabeWert und Quelle
Modellklasse
Streaming-SpracherkennungQuelle
Zugang
Cartesia API und PlayQuelle
Eingabe
AudioQuelle
Ausgabe
Transkript und strukturierte EntitätenQuelle
API-Modellkennung
ink-2Quelle
Sprachen
Englisch zum Start laut Ankündigung; die aktuelle Ink-Produktseite nennt zusätzlich Spanisch, Französisch, Hindi und Japanisch. Die Angaben zur Sprachabdeckung sind nicht einheitlich.Quelle
Latenz bis zum finalen Transkript
Laut Anbieter etwa 0,1 Sekunden ab dem Ende der gesprochenen Eingabe bis zum finalen Transkript (TTFT), nicht bis zum ersten TeilergebnisQuelle
Funktionen
Semantisches Endpointing und strukturierte EntitätserkennungQuelle