Cartesia Sonic

Synthèse vocaleNon disponible
par OtherID du modèle: cartesia-sonic

Cartesia's ultra-low-latency TTS (~90ms TTFB). State-space model with voice cloning support.

Statut
Non disponible
Entrée → Sortie
Texte → Audio
Développeur
Other
Mis à jour
23 septembre 2026

Cartesia Sonic n'est actuellement pas disponible

Vous pouvez toujours consulter les détails sur cette page. Choisissez l'une des alternatives disponibles ci-dessous pour exécuter immédiatement un modèle comparable.

Voir les alternatives
01

Modèles comparables

Tous dans cette catégorie
02

Playground

Essayer Cartesia Sonic

Entrée & résultat

Actuellement indisponible

Actuellement indisponible.

Le playground est désactivé. Vous pouvez trouver des modèles comparables dans la même catégorie : Parcourir les alternatives

Essayer Cartesia Sonic

0 / 4.000

Paramètres avancés (2)
Résultat
La parole générée apparaît ici.

Cette exécution

Pas de prix – actuellement indisponible.

Nouveau par ici ?

10 crédits gratuits (0,10 $US) lors de l'inscription avec Google

Utilisable 24 heures après l'inscription, jusqu'à 5 exécutions par jour et au maximum 2 crédits par exécution. Les autres méthodes de connexion commencent sans crédits.

03

À propos de Cartesia Sonic

RésuméAu 23 septembre 2026

Cartesia Sonic est un modèle de Other dans la catégorie Synthèse vocale. Cartesia Sonic n'est actuellement pas disponible sur Railwail.

Arrière-plan

À propos de Cartesia AI

Fondée 2023 · San Francisco, California, USA

Cartesia AI was founded in 2023 by Karan Goel and Albert Gu, the academic team behind the influential state-space model line of research at Stanford and CMU (S4, H3, Mamba, Mamba-2). Co-founders also include Arjun Desai, Brandon Yang and Chris Re (Stanford advisor). The company set out to build voice and multimodal foundation models on a state-space backbone instead of Transformers in order to achieve sub-100 ms latency and stream-friendly inference. Cartesia raised a $27M seed in March 2024 led by Index Ventures with participation from Conviction, A* and Lightspeed, followed by a $64M Series A in October 2024 led by Kleiner Perkins at a reported $325M valuation. Sonic, the company's first product, launched in May 2024 and quickly became one of the lowest-latency commercial TTS systems on the market.

Visiter Cartesia AI

Architecture

State-space model (Mamba family) text-to-speech with neural codec output

Cartesia Sonic is a streaming text-to-speech model built on the structured state-space modelling (SSM) architecture pioneered by Cartesia's founders (S4, H3, Mamba, Mamba-2). Unlike Transformer-based TTS systems that scale quadratically with sequence length, Sonic uses linear-time SSMs with selective scan, which lets the model maintain a small constant-memory recurrent state and generate audio chunks as text streams in. Cartesia reports a model first-byte latency of around 75-90 ms on their hosted API, which is faster than ElevenLabs Turbo and OpenAI TTS-1. Sonic outputs 24 kHz PCM via a neural codec decoder, supports streaming text input (so it can start speaking before the LLM finishes its sentence) and offers voice cloning from short reference samples (3-30 seconds). Sonic 2 added improved prosody, multilingual coverage (15+ languages) and reduced WER. The system is offered exclusively as a hosted API; weights are not released.

Paramètres
Undisclosed
Contexte
24.000 tokens

Capacités

  • Sub-100 ms first-byte latency suitable for real-time voice agents
  • State-space (Mamba-family) backbone with linear-time inference
  • Streaming text input and streaming audio output via WebSocket or gRPC
  • Instant voice cloning from short reference audio
  • Multilingual: English, Spanish, French, German, Portuguese, Mandarin, Japanese and more
  • Emotion and pace controls via inline tags
  • 24 kHz PCM, MP3 and Opus output formats
  • Best for: real-time voice agents, IVR systems, conversational AI, low-latency phone bots

Formation & licence

Cartesia has not disclosed the training corpus. Public statements describe a 'diverse multilingual speech dataset' with permissioned voice talent for the stock voice library.

Licence: Proprietary commercial API. Voice clones produced from customer audio remain customer property under the Terms of Service; commercial use is permitted on paid tiers.

Tests de sécurité: Voice-cloning policy requires explicit consent statements; outputs include an inaudible watermark and audio fingerprinting to detect misuse.

Limitations connues

  • Closed weights, hosted-only
  • Voice clone quality below ElevenLabs Multilingual V2 for nuanced emotional acting
  • Limited SSML / fine-grained prosody control
  • Hard cap of around 24,000 input characters per request
  • Mandarin and Japanese still less polished than English/Spanish
04

Tarification

Actuellement indisponible. Il n'y a actuellement pas de prix pour ce modèle, il ne peut donc pas être exécuté.

05

API

Appelez Cartesia Sonic avec votre clé API Railwail. Utilisez cet ID de modèle dans la requête :

Aucun exemple API vérifié

L'API publique transmet un format d'entrée différent de celui dont ce modèle a besoin. Utilisez le playground ci-dessus.

06

Spécifications

ID du modèle
cartesia-sonic
Développeur
Other
Catégorie
Synthèse vocale
Entrée
Texte
Sortie
Audio
Formats de sortie
MP3, WAV, OPUS
Taille du modèle
Undisclosed
Licence
Proprietary commercial API. Voice clones produced from customer audio remain customer property under the Terms of Service; commercial use is permitted on paid tiers.
Entrée du catalogue mise à jour
23 septembre 2026

Paramètres d'entrée

Entrées et paramètres du schéma d'entrée du modèle. L'exemple dans la section API montre lesquels l'API accepte.

  • inputObligatoire

    Text to convert to speech

    Type: Texte
    Défaut: –
    Valeurs autorisées: jusqu'à 4.000 caractères
  • speed
    Type: Nombre
    Défaut: 1
    Valeurs autorisées: 0,5 à 2
  • voice
    Type: Choix
    Défaut: sonic-default
    Valeurs autorisées: sonic-default, neutral-male, neutral-female, warm-female ou british-male
  • response_format
    Type: Choix
    Défaut: mp3
    Valeurs autorisées: mp3, wav ou opus

Étiquettes

  • cartesia
  • tts
  • low-latency
  • voice-cloning
  • realtime
07

Cas d'usage

À quoi ça sert

  • Real-time voice agents and AI receptionists
  • Low-latency IVR / phone call automation
  • Live narration for video and streaming
  • Voice cloning for branded virtual assistants
  • Streaming TTS chained with LLM output
08

Questions fréquemment posées

Qu'est-ce que Cartesia Sonic ?

Cartesia Sonic est un modèle de Other dans la catégorie Synthèse vocale. Il est listé sur Railwail mais ne peut pas être exécuté pour le moment.

Combien coûte Cartesia Sonic sur Railwail ?

Cartesia Sonic ne peut pas être exécuté sur Railwail pour le moment, il n'y a donc pas de prix actuel. Les alternatives disponibles avec leurs prix sont listées plus bas sur cette page.

Quels paramètres Cartesia Sonic supporte-t-il ?

Selon son schéma d'entrée, Cartesia Sonic connaît ces paramètres : input (jusqu'à 4.000 caractères), speed (0,5 à 2), voice (sonic-default, neutral-male, neutral-female, warm-female ou british-male) et response_format (mp3, wav ou opus).

Quelle est la vitesse de Cartesia Sonic ?

Il n'y a pas encore assez d'exécutions mesurées de Cartesia Sonic sur Railwail pour indiquer un temps d'exécution. Cela dépend de l'entrée, des paramètres et de la charge chez le fournisseur.

Cartesia Sonic est-il meilleur que AudioLDM 2 ?

Cela dépend de la tâche. Cartesia Sonic (Other) et AudioLDM 2 (Haohe Liu) sont tous deux des modèles de la catégorie Synthèse vocale. La page de comparaison affiche leurs prix et spécifications côte à côte.

Comparer Cartesia Sonic et AudioLDM 2

Puis-je utiliser Cartesia Sonic maintenant ?

Actuellement indisponible. La page reste en ligne ; les alternatives disponibles de la même catégorie sont listées plus bas.

Tous les modèles via une API

Une clé API pour tous les modèles sur Railwail. L'utilisation est facturée à partir de crédits prépayés, 1 crédit = 0,01 $US.