F5-TTS

Conversão de texto em falaIndisponível
por X-LANCE (SJTU)ID do modelo: f5-tts

Open-source flow-matching TTS with strong zero-shot voice cloning. Code MIT, weights CC-BY-NC.

Status
Indisponível
Entrada → Saída
Texto → Áudio
Desenvolvedor
X-LANCE (SJTU)
Atualizado
23 de setembro de 2026

F5-TTS não está disponível no momento

Atualmente indisponível: este modelo foi desativado.

Você ainda pode ler os detalhes nesta página. Escolha uma das alternativas disponíveis abaixo para executar um modelo comparável imediatamente.

Ir para alternativas
01

Modelos comparáveis

Todos nesta categoria
  • AudioLDM 2Haohe Liu

    Latent-diffusion model for general-purpose text-to-audio. Generates speech, music, and sound effects with a unified prior.

    ≈ US$ 0,0157/execução

  • Kokoro TTS 82MCommunity

    Open-weights 82M-parameter TTS. Punches above its size class on naturalness benchmarks at a fraction of the inference cost of larger models.

    ≈ US$ 0,00030/execução

  • OpenVoice v2Community

    MyShell OpenVoice v2. Multilingual zero-shot voice cloning with accurate tone-color reproduction and style/emotion control.

    ≈ US$ 0,0673/execução

02

Playground

Experimentar F5-TTS

Entrada & saída

Indisponível no momento

Atualmente indisponível: este modelo foi desativado.

O playground está desativado. Encontre modelos comparáveis na mesma categoria: Ver alternativas

Experimentar F5-TTS

0 / 4.000

Text to speak in the cloned voice

Voice sample *Record up to 30 s · file up to 60 s, 10 MB

10 to 30 seconds of clear speech, one speaker, no music or background noise.

Configurações avançadas (3)

Transcript of the reference clip (improves quality)

Resultado
A fala gerada aparece aqui.

Esta execução

Sem preço – indisponível no momento.

Novo por aqui?

10 créditos grátis (US$ 0,10) ao se inscrever com Google

Utilizável 24 horas após inscrição, até 5 execuções por dia e no máximo 2 créditos por execução. Outros métodos de login começam sem créditos.

03

Examples

Real outputs from the public examples of this model on Replicate, with the prompt and settings that produced them. They were not generated live on this page.
04

Sobre F5-TTS

ResumoA partir de 23 de setembro de 2026

F5-TTS é um modelo de X-LANCE (SJTU) na categoria Conversão de texto em fala. F5-TTS não está disponível no Railwail no momento.

Fundo

Sobre SWivid (Shanghai Jiao Tong University et al.)

Fundado em 2024 · Shanghai, China

F5-TTS was released in October 2024 by the SWivid research collective, an open-source group anchored at Shanghai Jiao Tong University with contributors from the X-LANCE Lab, Microsoft Research Asia and the Chinese University of Hong Kong. Lead authors Yushen Chen, Zhikang Niu, Ziyang Ma, Keqi Deng, Haian Lin, Wendi He, Xiaofei Wang, Tomoki Toda, Kai Yu and Xie Chen released F5-TTS under MIT licence on GitHub together with model weights and a Hugging Face demo. The work followed the earlier E2-TTS (Microsoft) paper and quickly became one of the most popular open-weights TTS models of 2024-2025, frequently cited as the best fully open alternative to ElevenLabs for English and Chinese voice cloning.

Visite SWivid (Shanghai Jiao Tong University et al.)

Arquitetura

Flow-matching non-autoregressive TTS with Diffusion Transformer (DiT)

F5-TTS (Fairy-tale Fast Flow Matching TTS) is a non-autoregressive text-to-speech system that replaces the encoder-decoder pipeline with a single Diffusion Transformer trained with conditional flow matching. Text is first converted to character tokens and zero-padded to the target mel-spectrogram length, then concatenated with a noisy mel reference for the target voice. A DiT backbone with ConvNeXt v2 blocks predicts the velocity field that maps Gaussian noise to a clean mel-spectrogram, which is then converted to a waveform via Vocos vocoder. Training data is the 100k-hour open Emilia dataset (multilingual long-form audio scraped from podcasts and audiobooks). Because there is no autoregressive decoder, F5-TTS achieves real-time factor below 0.2 on a single A10 GPU while keeping competitive WER with VALL-E and NaturalSpeech 3. The model is famous for very high-quality zero-shot voice cloning from a single 5-15 second reference clip.

Parâmetros
~330M (Base) and ~1.4B (Large)
Contexto
30 tokens

Capacidades

  • Zero-shot voice cloning from ~10 s of reference audio with no fine-tuning
  • Non-autoregressive flow matching with real-time-factor < 0.2 on a single GPU
  • Open weights under MIT licence, multiple checkpoints (Base, Small, Multilingual)
  • English and Chinese out of the box; community fine-tunes for German, French, Japanese, Spanish
  • Up to 30 s of generated audio per inference
  • Speed control by adjusting the duration prompt
  • Best for: research, on-device TTS, voice cloning prototypes, commercial products built on open weights

Treinamento & licença

Pretrained on the 100,000-hour open Emilia dataset of multilingual long-form audio with weakly supervised transcripts. Additional community fine-tunes use LibriSpeech, AISHELL-3 and bespoke audiobook collections.

Licença: Code and weights under MIT licence; commercial use permitted.

Testes de segurança: No formal red-team report. Authors publish a model card recommending consent for voice cloning and a model-output watermark, which is optional.

Limitações conhecidas

  • No formal SSML / emotion tags
  • Quality degrades on noisy reference audio
  • Multilingual coverage outside English/Chinese depends on community checkpoints
  • 30-second hard cap per generation
  • Voice cloning quality slightly below ElevenLabs Multilingual V2 on emotional acting
05

Preços

Atualmente indisponível: este modelo foi desativado. Não há preço para este modelo no momento, portanto não pode ser executado.

06

API

Chame F5-TTS com sua chave de API Railwail. Use este ID de modelo na solicitação:

Nenhum exemplo de API verificado

A API pública passa um formato de entrada diferente do que este modelo precisa. Use o playground acima.

07

Especificações

ID do modelo
f5-tts
Desenvolvedor
X-LANCE (SJTU)
Entrada
Texto
Saída
Áudio
Tamanho do modelo
~330M (Base) and ~1.4B (Large)
Licença
Code and weights under MIT licence; commercial use permitted.
Entrada do catálogo atualizada
23 de setembro de 2026

Parâmetros de entrada

Entradas e configurações do esquema de entrada do modelo. O exemplo na seção API mostra quais delas a API aceita.

  • audioobrigatório

    Reference clip to clone; requires consent

    Tipo: –
    Padrão: –
    Valores permitidos: –
  • gen_textobrigatório

    Text to speak in the cloned voice

    Tipo: Texto
    Padrão: –
    Valores permitidos: até 4.000 caracteres
  • speed
    Tipo: Número
    Padrão: 1
    Valores permitidos: 0,1 a 3
  • ref_text

    Transcript of the reference clip (improves quality)

    Tipo: Texto
    Padrão: –
    Valores permitidos: –
  • remove_silence
    Tipo: Sim/Não
    Padrão: true
    Valores permitidos: –

Etiquetas

  • f5
  • tts
  • open-weights
  • voice-cloning
  • research
  • pricing-tbd
08

Casos de uso

Para que é utilizado

  • Open-weights voice cloning research
  • On-device TTS for desktop and edge
  • Indie game and audiobook narration
  • Custom commercial products built on open weights
  • Academic benchmarks for flow-matching TTS
09

Perguntas frequentes

O que é F5-TTS?

F5-TTS é um modelo de X-LANCE (SJTU) na categoria Conversão de texto em fala. Está listado no Railwail, mas não pode ser executado no momento.

Quanto custa F5-TTS no Railwail?

F5-TTS não pode ser executado no Railwail no momento, portanto não há preço atual. Alternativas disponíveis com preços estão listadas mais abaixo nesta página.

Quais configurações F5-TTS suporta?

De acordo com seu esquema de entrada, F5-TTS conhece estes parâmetros: audio, gen_text (até 4.000 caracteres), speed (0,1 a 3), ref_text e remove_silence.

Qual é a velocidade de F5-TTS?

Ainda não há execuções medidas suficientes de F5-TTS no Railwail para indicar um tempo de execução. Depende da entrada, das configurações e da carga no provedor.

F5-TTS é melhor que AudioLDM 2?

Depende da tarefa. F5-TTS (X-LANCE (SJTU)) e AudioLDM 2 (Haohe Liu) são ambos modelos na categoria Conversão de texto em fala. A página de comparação mostra seus preços e especificações lado a lado.

Comparar F5-TTS e AudioLDM 2

Posso usar F5-TTS agora?

Atualmente indisponível: este modelo foi desativado. A página permanece online; alternativas disponíveis da mesma categoria estão listadas mais abaixo.

Todos os modelos através de uma API

Uma chave API para todos os modelos no Railwail. O uso é cobrado a partir de créditos pré-pagos, 1 crédito = US$ 0,01.