F5-TTS

Synthèse vocaleNon disponible
par X-LANCE (SJTU)ID du modèle: f5-tts

Open-source flow-matching TTS with strong zero-shot voice cloning. Code MIT, weights CC-BY-NC.

Statut
Non disponible
Entrée → Sortie
Texte → Audio
Développeur
X-LANCE (SJTU)
Mis à jour
23 septembre 2026

F5-TTS n'est actuellement pas disponible

Actuellement indisponible : ce modèle a été désactivé.

Vous pouvez toujours consulter les détails sur cette page. Choisissez l'une des alternatives disponibles ci-dessous pour exécuter immédiatement un modèle comparable.

Voir les alternatives
01

Modèles comparables

Tous dans cette catégorie
  • AudioLDM 2Haohe Liu

    Latent-diffusion model for general-purpose text-to-audio. Generates speech, music, and sound effects with a unified prior.

    ≈ 0,0157 $US/exécution

  • Kokoro TTS 82MCommunity

    Open-weights 82M-parameter TTS. Punches above its size class on naturalness benchmarks at a fraction of the inference cost of larger models.

    ≈ 0,00030 $US/exécution

  • OpenVoice v2Community

    MyShell OpenVoice v2. Multilingual zero-shot voice cloning with accurate tone-color reproduction and style/emotion control.

    ≈ 0,0673 $US/exécution

02

Playground

Essayer F5-TTS

Entrée & résultat

Actuellement indisponible

Actuellement indisponible : ce modèle a été désactivé.

Le playground est désactivé. Vous pouvez trouver des modèles comparables dans la même catégorie : Parcourir les alternatives

Essayer F5-TTS

0 / 4.000

Text to speak in the cloned voice

Voice sample *Record up to 30 s · file up to 60 s, 10 MB

10 to 30 seconds of clear speech, one speaker, no music or background noise.

Paramètres avancés (3)

Transcript of the reference clip (improves quality)

Résultat
La parole générée apparaît ici.

Cette exécution

Pas de prix – actuellement indisponible.

Nouveau par ici ?

10 crédits gratuits (0,10 $US) lors de l'inscription avec Google

Utilisable 24 heures après l'inscription, jusqu'à 5 exécutions par jour et au maximum 2 crédits par exécution. Les autres méthodes de connexion commencent sans crédits.

03

Examples

Real outputs from the public examples of this model on Replicate, with the prompt and settings that produced them. They were not generated live on this page.
04

À propos de F5-TTS

RésuméAu 23 septembre 2026

F5-TTS est un modèle de X-LANCE (SJTU) dans la catégorie Synthèse vocale. F5-TTS n'est actuellement pas disponible sur Railwail.

Arrière-plan

À propos de SWivid (Shanghai Jiao Tong University et al.)

Fondée 2024 · Shanghai, China

F5-TTS was released in October 2024 by the SWivid research collective, an open-source group anchored at Shanghai Jiao Tong University with contributors from the X-LANCE Lab, Microsoft Research Asia and the Chinese University of Hong Kong. Lead authors Yushen Chen, Zhikang Niu, Ziyang Ma, Keqi Deng, Haian Lin, Wendi He, Xiaofei Wang, Tomoki Toda, Kai Yu and Xie Chen released F5-TTS under MIT licence on GitHub together with model weights and a Hugging Face demo. The work followed the earlier E2-TTS (Microsoft) paper and quickly became one of the most popular open-weights TTS models of 2024-2025, frequently cited as the best fully open alternative to ElevenLabs for English and Chinese voice cloning.

Visiter SWivid (Shanghai Jiao Tong University et al.)

Architecture

Flow-matching non-autoregressive TTS with Diffusion Transformer (DiT)

F5-TTS (Fairy-tale Fast Flow Matching TTS) is a non-autoregressive text-to-speech system that replaces the encoder-decoder pipeline with a single Diffusion Transformer trained with conditional flow matching. Text is first converted to character tokens and zero-padded to the target mel-spectrogram length, then concatenated with a noisy mel reference for the target voice. A DiT backbone with ConvNeXt v2 blocks predicts the velocity field that maps Gaussian noise to a clean mel-spectrogram, which is then converted to a waveform via Vocos vocoder. Training data is the 100k-hour open Emilia dataset (multilingual long-form audio scraped from podcasts and audiobooks). Because there is no autoregressive decoder, F5-TTS achieves real-time factor below 0.2 on a single A10 GPU while keeping competitive WER with VALL-E and NaturalSpeech 3. The model is famous for very high-quality zero-shot voice cloning from a single 5-15 second reference clip.

Paramètres
~330M (Base) and ~1.4B (Large)
Contexte
30 tokens

Capacités

  • Zero-shot voice cloning from ~10 s of reference audio with no fine-tuning
  • Non-autoregressive flow matching with real-time-factor < 0.2 on a single GPU
  • Open weights under MIT licence, multiple checkpoints (Base, Small, Multilingual)
  • English and Chinese out of the box; community fine-tunes for German, French, Japanese, Spanish
  • Up to 30 s of generated audio per inference
  • Speed control by adjusting the duration prompt
  • Best for: research, on-device TTS, voice cloning prototypes, commercial products built on open weights

Formation & licence

Pretrained on the 100,000-hour open Emilia dataset of multilingual long-form audio with weakly supervised transcripts. Additional community fine-tunes use LibriSpeech, AISHELL-3 and bespoke audiobook collections.

Licence: Code and weights under MIT licence; commercial use permitted.

Tests de sécurité: No formal red-team report. Authors publish a model card recommending consent for voice cloning and a model-output watermark, which is optional.

Limitations connues

  • No formal SSML / emotion tags
  • Quality degrades on noisy reference audio
  • Multilingual coverage outside English/Chinese depends on community checkpoints
  • 30-second hard cap per generation
  • Voice cloning quality slightly below ElevenLabs Multilingual V2 on emotional acting
05

Tarification

Actuellement indisponible : ce modèle a été désactivé. Il n'y a actuellement pas de prix pour ce modèle, il ne peut donc pas être exécuté.

06

API

Appelez F5-TTS avec votre clé API Railwail. Utilisez cet ID de modèle dans la requête :

Aucun exemple API vérifié

L'API publique transmet un format d'entrée différent de celui dont ce modèle a besoin. Utilisez le playground ci-dessus.

07

Spécifications

ID du modèle
f5-tts
Développeur
X-LANCE (SJTU)
Catégorie
Synthèse vocale
Entrée
Texte
Sortie
Audio
Taille du modèle
~330M (Base) and ~1.4B (Large)
Licence
Code and weights under MIT licence; commercial use permitted.
Entrée du catalogue mise à jour
23 septembre 2026

Paramètres d'entrée

Entrées et paramètres du schéma d'entrée du modèle. L'exemple dans la section API montre lesquels l'API accepte.

  • audioObligatoire

    Reference clip to clone; requires consent

    Type: –
    Défaut: –
    Valeurs autorisées: –
  • gen_textObligatoire

    Text to speak in the cloned voice

    Type: Texte
    Défaut: –
    Valeurs autorisées: jusqu'à 4.000 caractères
  • speed
    Type: Nombre
    Défaut: 1
    Valeurs autorisées: 0,1 à 3
  • ref_text

    Transcript of the reference clip (improves quality)

    Type: Texte
    Défaut: –
    Valeurs autorisées: –
  • remove_silence
    Type: Oui/Non
    Défaut: true
    Valeurs autorisées: –

Étiquettes

  • f5
  • tts
  • open-weights
  • voice-cloning
  • research
  • pricing-tbd
08

Cas d'usage

À quoi ça sert

  • Open-weights voice cloning research
  • On-device TTS for desktop and edge
  • Indie game and audiobook narration
  • Custom commercial products built on open weights
  • Academic benchmarks for flow-matching TTS
09

Questions fréquemment posées

Qu'est-ce que F5-TTS ?

F5-TTS est un modèle de X-LANCE (SJTU) dans la catégorie Synthèse vocale. Il est listé sur Railwail mais ne peut pas être exécuté pour le moment.

Combien coûte F5-TTS sur Railwail ?

F5-TTS ne peut pas être exécuté sur Railwail pour le moment, il n'y a donc pas de prix actuel. Les alternatives disponibles avec leurs prix sont listées plus bas sur cette page.

Quels paramètres F5-TTS supporte-t-il ?

Selon son schéma d'entrée, F5-TTS connaît ces paramètres : audio, gen_text (jusqu'à 4.000 caractères), speed (0,1 à 3), ref_text et remove_silence.

Quelle est la vitesse de F5-TTS ?

Il n'y a pas encore assez d'exécutions mesurées de F5-TTS sur Railwail pour indiquer un temps d'exécution. Cela dépend de l'entrée, des paramètres et de la charge chez le fournisseur.

F5-TTS est-il meilleur que AudioLDM 2 ?

Cela dépend de la tâche. F5-TTS (X-LANCE (SJTU)) et AudioLDM 2 (Haohe Liu) sont tous deux des modèles de la catégorie Synthèse vocale. La page de comparaison affiche leurs prix et spécifications côte à côte.

Comparer F5-TTS et AudioLDM 2

Puis-je utiliser F5-TTS maintenant ?

Actuellement indisponible : ce modèle a été désactivé. La page reste en ligne ; les alternatives disponibles de la même catégorie sont listées plus bas.

Tous les modèles via une API

Une clé API pour tous les modèles sur Railwail. L'utilisation est facturée à partir de crédits prépayés, 1 crédit = 0,01 $US.