F5-TTS

Síntesis de vozNo disponible
de X-LANCE (SJTU)ID del modelo: f5-tts

Open-source flow-matching TTS with strong zero-shot voice cloning. Code MIT, weights CC-BY-NC.

Estado
No disponible
Entrada → Salida
Texto → Audio
Desarrollador
X-LANCE (SJTU)
Actualizado
23 de septiembre de 2026

F5-TTS no está disponible actualmente

Actualmente no disponible: este modelo ha sido desactivado.

Puedes seguir leyendo los detalles en esta página. Elige una de las alternativas disponibles abajo para ejecutar un modelo comparable de inmediato.

Ir a alternativas
01

Modelos comparables

Todos en esta categoría
  • AudioLDM 2Haohe Liu

    Latent-diffusion model for general-purpose text-to-audio. Generates speech, music, and sound effects with a unified prior.

    ≈ 0,0157 US$/ejecución

  • Kokoro TTS 82MCommunity

    Open-weights 82M-parameter TTS. Punches above its size class on naturalness benchmarks at a fraction of the inference cost of larger models.

    ≈ 0,00030 US$/ejecución

  • OpenVoice v2Community

    MyShell OpenVoice v2. Multilingual zero-shot voice cloning with accurate tone-color reproduction and style/emotion control.

    ≈ 0,0673 US$/ejecución

02

Playground

Probar F5-TTS

Entrada y salida

No disponible actualmente

Actualmente no disponible: este modelo ha sido desactivado.

El área de pruebas está desactivada. Puedes encontrar modelos comparables en la misma categoría: Explorar alternativas

Probar F5-TTS

0 / 4000

Text to speak in the cloned voice

Voice sample *Record up to 30 s · file up to 60 s, 10 MB

10 to 30 seconds of clear speech, one speaker, no music or background noise.

Configuración avanzada (3)

Transcript of the reference clip (improves quality)

Resultado
La voz generada aparece aquí.

Esta ejecución

Sin precio – actualmente no disponible.

¿Eres nuevo aquí?

10 créditos gratis (0,10 US$) cuando te registres con Google

Disponible 24 horas después del registro, hasta 5 ejecuciones por día y como máximo 2 créditos por ejecución. Otros métodos de inicio de sesión comienzan sin créditos.

03

Examples

Real outputs from the public examples of this model on Replicate, with the prompt and settings that produced them. They were not generated live on this page.
04

Acerca de F5-TTS

ResumenA fecha de 23 de septiembre de 2026

F5-TTS es un modelo de X-LANCE (SJTU) en la categoría Síntesis de voz. F5-TTS no está disponible en Railwail en este momento.

Fondo

Acerca de SWivid (Shanghai Jiao Tong University et al.)

Fundado en 2024 · Shanghai, China

F5-TTS was released in October 2024 by the SWivid research collective, an open-source group anchored at Shanghai Jiao Tong University with contributors from the X-LANCE Lab, Microsoft Research Asia and the Chinese University of Hong Kong. Lead authors Yushen Chen, Zhikang Niu, Ziyang Ma, Keqi Deng, Haian Lin, Wendi He, Xiaofei Wang, Tomoki Toda, Kai Yu and Xie Chen released F5-TTS under MIT licence on GitHub together with model weights and a Hugging Face demo. The work followed the earlier E2-TTS (Microsoft) paper and quickly became one of the most popular open-weights TTS models of 2024-2025, frequently cited as the best fully open alternative to ElevenLabs for English and Chinese voice cloning.

Visitar SWivid (Shanghai Jiao Tong University et al.)

Arquitectura

Flow-matching non-autoregressive TTS with Diffusion Transformer (DiT)

F5-TTS (Fairy-tale Fast Flow Matching TTS) is a non-autoregressive text-to-speech system that replaces the encoder-decoder pipeline with a single Diffusion Transformer trained with conditional flow matching. Text is first converted to character tokens and zero-padded to the target mel-spectrogram length, then concatenated with a noisy mel reference for the target voice. A DiT backbone with ConvNeXt v2 blocks predicts the velocity field that maps Gaussian noise to a clean mel-spectrogram, which is then converted to a waveform via Vocos vocoder. Training data is the 100k-hour open Emilia dataset (multilingual long-form audio scraped from podcasts and audiobooks). Because there is no autoregressive decoder, F5-TTS achieves real-time factor below 0.2 on a single A10 GPU while keeping competitive WER with VALL-E and NaturalSpeech 3. The model is famous for very high-quality zero-shot voice cloning from a single 5-15 second reference clip.

Parámetros
~330M (Base) and ~1.4B (Large)
Contexto
30 tokens

Capacidades

  • Zero-shot voice cloning from ~10 s of reference audio with no fine-tuning
  • Non-autoregressive flow matching with real-time-factor < 0.2 on a single GPU
  • Open weights under MIT licence, multiple checkpoints (Base, Small, Multilingual)
  • English and Chinese out of the box; community fine-tunes for German, French, Japanese, Spanish
  • Up to 30 s of generated audio per inference
  • Speed control by adjusting the duration prompt
  • Best for: research, on-device TTS, voice cloning prototypes, commercial products built on open weights

Entrenamiento y licencia

Pretrained on the 100,000-hour open Emilia dataset of multilingual long-form audio with weakly supervised transcripts. Additional community fine-tunes use LibriSpeech, AISHELL-3 and bespoke audiobook collections.

Licencia: Code and weights under MIT licence; commercial use permitted.

Pruebas de seguridad: No formal red-team report. Authors publish a model card recommending consent for voice cloning and a model-output watermark, which is optional.

Limitaciones conocidas

  • No formal SSML / emotion tags
  • Quality degrades on noisy reference audio
  • Multilingual coverage outside English/Chinese depends on community checkpoints
  • 30-second hard cap per generation
  • Voice cloning quality slightly below ElevenLabs Multilingual V2 on emotional acting
05

Precios

Actualmente no disponible: este modelo ha sido desactivado. No hay precio para este modelo en este momento, por lo que no se puede ejecutar.

06

API

Llama a F5-TTS con tu clave API de Railwail. Usa este ID de modelo en la solicitud:

Sin ejemplo de API verificado

La API pública pasa un formato de entrada diferente al que necesita este modelo. Usa el playground anterior.

07

Especificaciones

ID del modelo
f5-tts
Desarrollador
X-LANCE (SJTU)
Entrada
Texto
Salida
Audio
Tamaño del modelo
~330M (Base) and ~1.4B (Large)
Licencia
Code and weights under MIT licence; commercial use permitted.
Entrada del catálogo actualizada
23 de septiembre de 2026

Parámetros de entrada

Entradas y configuración del esquema de entrada del modelo. El ejemplo en la sección API muestra cuáles de ellas acepta la API.

  • audioObligatorio

    Reference clip to clone; requires consent

    Tipo: –
    Predeterminado: –
    Valores permitidos: –
  • gen_textObligatorio

    Text to speak in the cloned voice

    Tipo: Texto
    Predeterminado: –
    Valores permitidos: Hasta 4000 caracteres
  • speed
    Tipo: Número
    Predeterminado: 1
    Valores permitidos: 0,1 a 3
  • ref_text

    Transcript of the reference clip (improves quality)

    Tipo: Texto
    Predeterminado: –
    Valores permitidos: –
  • remove_silence
    Tipo: Sí/No
    Predeterminado: true
    Valores permitidos: –

Etiquetas

  • f5
  • tts
  • open-weights
  • voice-cloning
  • research
  • pricing-tbd
08

Casos de uso

Para qué se utiliza

  • Open-weights voice cloning research
  • On-device TTS for desktop and edge
  • Indie game and audiobook narration
  • Custom commercial products built on open weights
  • Academic benchmarks for flow-matching TTS
09

Preguntas frecuentes

¿Qué es F5-TTS?

F5-TTS es un modelo de X-LANCE (SJTU) en la categoría Síntesis de voz. Aparece en el catálogo de Railwail pero no se puede ejecutar en este momento.

¿Cuánto cuesta F5-TTS en Railwail?

F5-TTS no se puede ejecutar en Railwail en este momento, por lo que no hay precio actual. Las alternativas disponibles con precios se enumeran más abajo en esta página.

¿Qué configuraciones admite F5-TTS?

Según su esquema de entrada, F5-TTS conoce estos parámetros: audio, gen_text (Hasta 4000 caracteres), speed (0,1 a 3), ref_text y remove_silence.

¿Qué velocidad tiene F5-TTS?

Aún no hay suficientes ejecuciones medidas de F5-TTS en Railwail para indicar un tiempo de ejecución. Depende de la entrada, la configuración y la carga en el proveedor.

¿Es F5-TTS mejor que AudioLDM 2?

Depende de la tarea. F5-TTS (X-LANCE (SJTU)) y AudioLDM 2 (Haohe Liu) son ambos modelos en la categoría Síntesis de voz. La página de comparación muestra sus precios y especificaciones lado a lado.

Comparar F5-TTS y AudioLDM 2

¿Puedo usar F5-TTS ahora mismo?

Actualmente no disponible: este modelo ha sido desactivado. La página se mantiene en línea; las alternativas disponibles de la misma categoría se enumeran más abajo.

Todos los modelos a través de una API

Una clave API para todos los modelos en Railwail. El uso se cobra desde créditos prepagados, 1 crédito = 0,01 US$.