Cartesia Sonic

Sinteză vocală (TTS)Indisponibil
de OtherID model: cartesia-sonic

Cartesia's ultra-low-latency TTS (~90ms TTFB). State-space model with voice cloning support.

Status
Indisponibil
Intrare → ieșire
Text → Audio
Dezvoltator
Other
Actualizat
23 septembrie 2026

Cartesia Sonic nu este disponibil în acest moment

Poți citi în continuare detaliile pe această pagină. Alege una dintre alternativele disponibile de mai jos pentru a rula imediat un model comparabil.

Mergi la alternative
01
02

Playground

Încearcă Cartesia Sonic

Intrare & rezultat

Indisponibil în prezent

Indisponibil în prezent.

Playground-ul este dezactivat. Modele comparabile găsești în aceeași categorie: Vezi alternativele

Încearcă Cartesia Sonic

0 / 4.000

Setări avansate (2)
Rezultat
Vocea generată apare aici.

Această rulare

Fără preț – momentan indisponibil.

Nou aici?

10 credite gratuite (0,10 USD) când te înregistrezi cu Google

Utilizabil 24 ore după înregistrare, până la 5 rulări pe zi și maximum 2 credite pe rulare. Alte metode de conectare încep fără credite.

03

Despre Cartesia Sonic

Pe scurtDin 23 septembrie 2026

Cartesia Sonic este un model de Other din categoria Sinteză vocală (TTS). Cartesia Sonic nu este disponibil în prezent pe Railwail.

Fundal

Despre Cartesia AI

Fondat 2023 · San Francisco, California, USA

Cartesia AI was founded in 2023 by Karan Goel and Albert Gu, the academic team behind the influential state-space model line of research at Stanford and CMU (S4, H3, Mamba, Mamba-2). Co-founders also include Arjun Desai, Brandon Yang and Chris Re (Stanford advisor). The company set out to build voice and multimodal foundation models on a state-space backbone instead of Transformers in order to achieve sub-100 ms latency and stream-friendly inference. Cartesia raised a $27M seed in March 2024 led by Index Ventures with participation from Conviction, A* and Lightspeed, followed by a $64M Series A in October 2024 led by Kleiner Perkins at a reported $325M valuation. Sonic, the company's first product, launched in May 2024 and quickly became one of the lowest-latency commercial TTS systems on the market.

Vizitează Cartesia AI

Arhitectură

State-space model (Mamba family) text-to-speech with neural codec output

Cartesia Sonic is a streaming text-to-speech model built on the structured state-space modelling (SSM) architecture pioneered by Cartesia's founders (S4, H3, Mamba, Mamba-2). Unlike Transformer-based TTS systems that scale quadratically with sequence length, Sonic uses linear-time SSMs with selective scan, which lets the model maintain a small constant-memory recurrent state and generate audio chunks as text streams in. Cartesia reports a model first-byte latency of around 75-90 ms on their hosted API, which is faster than ElevenLabs Turbo and OpenAI TTS-1. Sonic outputs 24 kHz PCM via a neural codec decoder, supports streaming text input (so it can start speaking before the LLM finishes its sentence) and offers voice cloning from short reference samples (3-30 seconds). Sonic 2 added improved prosody, multilingual coverage (15+ languages) and reduced WER. The system is offered exclusively as a hosted API; weights are not released.

Parametri
Undisclosed
Context
24.000 tokeni

Capabilități

  • Sub-100 ms first-byte latency suitable for real-time voice agents
  • State-space (Mamba-family) backbone with linear-time inference
  • Streaming text input and streaming audio output via WebSocket or gRPC
  • Instant voice cloning from short reference audio
  • Multilingual: English, Spanish, French, German, Portuguese, Mandarin, Japanese and more
  • Emotion and pace controls via inline tags
  • 24 kHz PCM, MP3 and Opus output formats
  • Best for: real-time voice agents, IVR systems, conversational AI, low-latency phone bots

Antrenament & licență

Cartesia has not disclosed the training corpus. Public statements describe a 'diverse multilingual speech dataset' with permissioned voice talent for the stock voice library.

Licență: Proprietary commercial API. Voice clones produced from customer audio remain customer property under the Terms of Service; commercial use is permitted on paid tiers.

Teste de siguranță: Voice-cloning policy requires explicit consent statements; outputs include an inaudible watermark and audio fingerprinting to detect misuse.

Limitări cunoscute

  • Closed weights, hosted-only
  • Voice clone quality below ElevenLabs Multilingual V2 for nuanced emotional acting
  • Limited SSML / fine-grained prosody control
  • Hard cap of around 24,000 input characters per request
  • Mandarin and Japanese still less polished than English/Spanish
04

Prețuri

Indisponibil în prezent. Nu există preț pentru acest model în acest moment, deci nu poate fi executat.

05

API

Apelează Cartesia Sonic cu cheia ta API Railwail. Folosește acest ID de model în cerere:

Niciun exemplu API verificat

API-ul public transmite un format de intrare diferit de ceea ce are nevoie acest model. Folosește playground-ul de mai sus.

06

Specificații

ID model
cartesia-sonic
Dezvoltator
Other
Intrare
Text
Ieșire
Audio
Formate de ieșire
MP3, WAV, OPUS
Dimensiune model
Undisclosed
Licență
Proprietary commercial API. Voice clones produced from customer audio remain customer property under the Terms of Service; commercial use is permitted on paid tiers.
Intrare catalog actualizată
23 septembrie 2026

Parametri de intrare

Intrări și setări din schema de intrare a modelului. Exemplul din secțiunea API arată care dintre ele acceptă API-ul.

  • inputobligatoriu

    Text to convert to speech

    Tip: Text
    Implicit: –
    Valori permise: până la 4.000 caractere
  • speed
    Tip: Număr
    Implicit: 1
    Valori permise: 0,5 până la 2
  • voice
    Tip: Alegere
    Implicit: sonic-default
    Valori permise: sonic-default, neutral-male, neutral-female, warm-female sau british-male
  • response_format
    Tip: Alegere
    Implicit: mp3
    Valori permise: mp3, wav sau opus

Etichete

  • cartesia
  • tts
  • low-latency
  • voice-cloning
  • realtime
07

Cazuri de utilizare

Pentru ce se folosește

  • Real-time voice agents and AI receptionists
  • Low-latency IVR / phone call automation
  • Live narration for video and streaming
  • Voice cloning for branded virtual assistants
  • Streaming TTS chained with LLM output
08

Întrebări frecvente

Ce este Cartesia Sonic?

Cartesia Sonic este un model de Other din categoria Sinteză vocală (TTS). Este listat pe Railwail, dar nu poate fi rulat în acest moment.

Cât costă Cartesia Sonic pe Railwail?

Cartesia Sonic nu poate fi rulat pe Railwail în acest moment, deci nu există preț curent. Alternativele disponibile cu prețuri sunt listate mai jos pe această pagină.

Ce setări acceptă Cartesia Sonic?

Conform schemei sale de intrare, Cartesia Sonic cunoaște acești parametri: input (până la 4.000 caractere), speed (0,5 până la 2), voice (sonic-default, neutral-male, neutral-female, warm-female sau british-male) și response_format (mp3, wav sau opus).

Cât de rapid este Cartesia Sonic?

Nu sunt suficiente rulări măsurate ale Cartesia Sonic pe Railwail încă pentru a indica un timp de rulare. Depinde de intrare, de setări și de sarcina la furnizor.

Este Cartesia Sonic mai bun decât AudioLDM 2?

Depinde de sarcină. Cartesia Sonic (Other) și AudioLDM 2 (Haohe Liu) sunt ambele modele din categoria Sinteză vocală (TTS). Pagina de comparație arată prețurile și specificațiile lor una lângă alta.

Compară Cartesia Sonic și AudioLDM 2

Pot folosi Cartesia Sonic chiar acum?

Indisponibil în prezent. Pagina rămâne online; alternativele disponibile din aceeași categorie sunt listate mai jos.

Toate modelele printr-o singură API

O cheie API pentru fiecare model pe Railwail. Utilizarea se percepe din credite prepay, 1 credit = 0,01 USD.