Cartesia Sonic

Sprachausgabe (TTS)Nicht verfügbar
von OtherModell-ID: cartesia-sonic

Cartesia's ultra-low-latency TTS (~90ms TTFB). State-space model with voice cloning support.

Status
Nicht verfügbar
Eingabe → Ausgabe
Text → Audio
Entwickler
Other
Aktualisiert
23. September 2026

Cartesia Sonic ist derzeit nicht verfügbar

Die Angaben auf dieser Seite kannst du weiter nachlesen. Mit einer der verfügbaren Alternativen unten kannst du sofort ein vergleichbares Modell nutzen.

Zu den Alternativen
01

Vergleichbare Modelle

Alle dieser Kategorie
02

Playground

Cartesia Sonic ausprobieren

Eingabe & Ergebnis

Derzeit nicht verfügbar

Derzeit nicht verfügbar.

Der Playground ist deaktiviert. Vergleichbare Modelle findest du in derselben Kategorie: Alternativen ansehen

Cartesia Sonic ausprobieren

0 / 4.000

Erweiterte Einstellungen (2)
Ergebnis
Die erzeugte Sprache erscheint hier.

Dieser Lauf

Kein Preis – derzeit nicht verfügbar.

Neu hier?

10 Gratis-Credits (0,10 $) bei Anmeldung mit Google

Nutzbar 24 Stunden nach der Anmeldung, bis zu 5 Läufe pro Tag und höchstens 2 Credits je Lauf. Andere Anmeldearten starten ohne Guthaben.

03

Über Cartesia Sonic

Kurz gesagtStand: 23. September 2026

Cartesia Sonic ist ein Modell von Other aus der Kategorie Sprachausgabe (TTS). Über Railwail ist Cartesia Sonic derzeit nicht verfügbar.

Hintergrund

Über Cartesia AI

Gegründet 2023 · San Francisco, California, USA

Cartesia AI was founded in 2023 by Karan Goel and Albert Gu, the academic team behind the influential state-space model line of research at Stanford and CMU (S4, H3, Mamba, Mamba-2). Co-founders also include Arjun Desai, Brandon Yang and Chris Re (Stanford advisor). The company set out to build voice and multimodal foundation models on a state-space backbone instead of Transformers in order to achieve sub-100 ms latency and stream-friendly inference. Cartesia raised a $27M seed in March 2024 led by Index Ventures with participation from Conviction, A* and Lightspeed, followed by a $64M Series A in October 2024 led by Kleiner Perkins at a reported $325M valuation. Sonic, the company's first product, launched in May 2024 and quickly became one of the lowest-latency commercial TTS systems on the market.

Cartesia AI besuchen

Architektur

State-space model (Mamba family) text-to-speech with neural codec output

Cartesia Sonic is a streaming text-to-speech model built on the structured state-space modelling (SSM) architecture pioneered by Cartesia's founders (S4, H3, Mamba, Mamba-2). Unlike Transformer-based TTS systems that scale quadratically with sequence length, Sonic uses linear-time SSMs with selective scan, which lets the model maintain a small constant-memory recurrent state and generate audio chunks as text streams in. Cartesia reports a model first-byte latency of around 75-90 ms on their hosted API, which is faster than ElevenLabs Turbo and OpenAI TTS-1. Sonic outputs 24 kHz PCM via a neural codec decoder, supports streaming text input (so it can start speaking before the LLM finishes its sentence) and offers voice cloning from short reference samples (3-30 seconds). Sonic 2 added improved prosody, multilingual coverage (15+ languages) and reduced WER. The system is offered exclusively as a hosted API; weights are not released.

Parameter
Undisclosed
Kontext
24.000 Token

Fähigkeiten

  • Sub-100 ms first-byte latency suitable for real-time voice agents
  • State-space (Mamba-family) backbone with linear-time inference
  • Streaming text input and streaming audio output via WebSocket or gRPC
  • Instant voice cloning from short reference audio
  • Multilingual: English, Spanish, French, German, Portuguese, Mandarin, Japanese and more
  • Emotion and pace controls via inline tags
  • 24 kHz PCM, MP3 and Opus output formats
  • Best for: real-time voice agents, IVR systems, conversational AI, low-latency phone bots

Training & Lizenz

Cartesia has not disclosed the training corpus. Public statements describe a 'diverse multilingual speech dataset' with permissioned voice talent for the stock voice library.

Lizenz: Proprietary commercial API. Voice clones produced from customer audio remain customer property under the Terms of Service; commercial use is permitted on paid tiers.

Sicherheitstests: Voice-cloning policy requires explicit consent statements; outputs include an inaudible watermark and audio fingerprinting to detect misuse.

Bekannte Grenzen

  • Closed weights, hosted-only
  • Voice clone quality below ElevenLabs Multilingual V2 for nuanced emotional acting
  • Limited SSML / fine-grained prosody control
  • Hard cap of around 24,000 input characters per request
  • Mandarin and Japanese still less polished than English/Spanish
04

Preise

Derzeit nicht verfügbar. Für dieses Modell gibt es derzeit keinen Preis, deshalb lässt es sich nicht ausführen.

05

API

Rufe Cartesia Sonic mit deinem Railwail-API-Schlüssel auf. Diese Modell-ID gehört in die Anfrage:

Kein geprüftes API-Beispiel

Die öffentliche API übergibt ein anderes Eingabeformat, als dieses Modell braucht. Nutze den Playground oben.

06

Spezifikationen

Modell-ID
cartesia-sonic
Entwickler
Other
Eingabe
Text
Ausgabe
Audio
Ausgabeformate
MP3, WAV, OPUS
Modellgröße
Undisclosed
Lizenz
Proprietary commercial API. Voice clones produced from customer audio remain customer property under the Terms of Service; commercial use is permitted on paid tiers.
Katalogeintrag aktualisiert
23. September 2026

Eingabeparameter

Eingaben und Einstellungen laut Eingabeschema des Modells. Welche davon die API annimmt, zeigt das Beispiel im Abschnitt API.

  • inputPflicht

    Text to convert to speech

    Typ: Text
    Standard: –
    Erlaubte Werte: bis 4.000 Zeichen
  • speed
    Typ: Zahl
    Standard: 1
    Erlaubte Werte: 0,5 bis 2
  • voice
    Typ: Auswahl
    Standard: sonic-default
    Erlaubte Werte: sonic-default, neutral-male, neutral-female, warm-female oder british-male
  • response_format
    Typ: Auswahl
    Standard: mp3
    Erlaubte Werte: mp3, wav oder opus

Schlagwörter

  • cartesia
  • tts
  • low-latency
  • voice-cloning
  • realtime
07

Einsatzgebiete

Wofür es genutzt wird

  • Real-time voice agents and AI receptionists
  • Low-latency IVR / phone call automation
  • Live narration for video and streaming
  • Voice cloning for branded virtual assistants
  • Streaming TTS chained with LLM output
08

Häufige Fragen

Was ist Cartesia Sonic?

Cartesia Sonic ist ein Modell von Other aus der Kategorie Sprachausgabe (TTS). Es steht im Railwail-Katalog, lässt sich derzeit aber nicht ausführen.

Was kostet Cartesia Sonic bei Railwail?

Cartesia Sonic lässt sich über Railwail derzeit nicht ausführen, deshalb gibt es keinen aktuellen Preis. Verfügbare Alternativen mit Preisen stehen weiter unten auf dieser Seite.

Welche Einstellungen unterstützt Cartesia Sonic?

Laut Eingabeschema kennt Cartesia Sonic diese Parameter: input (bis 4.000 Zeichen), speed (0,5 bis 2), voice (sonic-default, neutral-male, neutral-female, warm-female oder british-male) und response_format (mp3, wav oder opus).

Wie schnell ist Cartesia Sonic?

Für Cartesia Sonic gibt es bei Railwail noch zu wenige gemessene Läufe, um eine Laufzeit anzugeben. Sie hängt von der Eingabe, den Einstellungen und der Auslastung beim Anbieter ab.

Ist Cartesia Sonic besser als AudioLDM 2?

Das hängt von der Aufgabe ab. Cartesia Sonic (Other) und AudioLDM 2 (Haohe Liu) sind beide Modelle aus der Kategorie Sprachausgabe (TTS). Die Vergleichsseite zeigt Preise und Spezifikationen nebeneinander.

Cartesia Sonic und AudioLDM 2 vergleichen

Kann ich Cartesia Sonic gerade nutzen?

Derzeit nicht verfügbar. Die Seite bleibt online; verfügbare Alternativen aus derselben Kategorie stehen weiter unten.

Alle Modelle über eine API

Ein API-Schlüssel für alle Modelle auf Railwail. Abgerechnet wird über vorab gekaufte Credits, 1 Credit = 0,01 $.