F5-TTS

Szövegfelolvasás (TTS)Nem elérhető
X-LANCE (SJTU) általModell-azonosító: f5-tts

Open-source flow-matching TTS with strong zero-shot voice cloning. Code MIT, weights CC-BY-NC.

Állapot
Nem elérhető
Bemenet → kimenet
Szöveg → Hang
Fejlesztő
X-LANCE (SJTU)
Frissítve
2026. szeptember 23.

F5-TTS jelenleg nem elérhető

Jelenleg nem elérhető: ezt a modellt deaktiválták.

Az oldal részleteit továbbra is elolvashatja. Az alábbi elérhető alternatívák közül válasszon egy hasonló modell azonnali futtatásához.

Ugrás az alternatívákhoz
01
  • AudioLDM 2Haohe Liu

    Latent-diffusion model for general-purpose text-to-audio. Generates speech, music, and sound effects with a unified prior.

    ≈ 0,0157 USD/futás

  • Kokoro TTS 82MCommunity

    Open-weights 82M-parameter TTS. Punches above its size class on naturalness benchmarks at a fraction of the inference cost of larger models.

    ≈ 0,00030 USD/futás

  • OpenVoice v2Community

    MyShell OpenVoice v2. Multilingual zero-shot voice cloning with accurate tone-color reproduction and style/emotion control.

    ≈ 0,0673 USD/futás

02

Playground

Próbáld ki: F5-TTS

Bemenet és kimenet

Jelenleg nem elérhető

Jelenleg nem elérhető: ezt a modellt deaktiválták.

A játszótér letiltva van. Hasonló modelleket találsz ugyanabban a kategóriában: Alternatívák megtekintése

Próbáld ki: F5-TTS

0 / 4000

Text to speak in the cloned voice

Voice sample *Record up to 30 s · file up to 60 s, 10 MB

10 to 30 seconds of clear speech, one speaker, no music or background noise.

Speciális beállítások (3)

Transcript of the reference clip (improves quality)

Eredmény
A generált beszéd itt jelenik meg.

Ez a futtatás

Nincs ár – jelenleg nem elérhető.

Új vagy itt?

10 ingyenes kredit (0,10 USD) Google-fiókkal való regisztrációkor

Használható 24 órával a regisztráció után, naponta legfeljebb 5 futtatás és futtatásonként legfeljebb 2 kredit. Más bejelentkezési módok kreditek nélkül indulnak.

03

Examples

Real outputs from the public examples of this model on Replicate, with the prompt and settings that produced them. They were not generated live on this page.
04

A F5-TTS névjegye

Röviden2026. szeptember 23. szerint

A F5-TTS a X-LANCE (SJTU) által fejlesztett modell a Szövegfelolvasás (TTS) kategóriában. A F5-TTS jelenleg nem érhető el a Railwail-en.

Háttér

A SWivid (Shanghai Jiao Tong University et al.) névjegye

Alapítva: 2024 · Shanghai, China

F5-TTS was released in October 2024 by the SWivid research collective, an open-source group anchored at Shanghai Jiao Tong University with contributors from the X-LANCE Lab, Microsoft Research Asia and the Chinese University of Hong Kong. Lead authors Yushen Chen, Zhikang Niu, Ziyang Ma, Keqi Deng, Haian Lin, Wendi He, Xiaofei Wang, Tomoki Toda, Kai Yu and Xie Chen released F5-TTS under MIT licence on GitHub together with model weights and a Hugging Face demo. The work followed the earlier E2-TTS (Microsoft) paper and quickly became one of the most popular open-weights TTS models of 2024-2025, frequently cited as the best fully open alternative to ElevenLabs for English and Chinese voice cloning.

SWivid (Shanghai Jiao Tong University et al.) meglátogatása

Architektúra

Flow-matching non-autoregressive TTS with Diffusion Transformer (DiT)

F5-TTS (Fairy-tale Fast Flow Matching TTS) is a non-autoregressive text-to-speech system that replaces the encoder-decoder pipeline with a single Diffusion Transformer trained with conditional flow matching. Text is first converted to character tokens and zero-padded to the target mel-spectrogram length, then concatenated with a noisy mel reference for the target voice. A DiT backbone with ConvNeXt v2 blocks predicts the velocity field that maps Gaussian noise to a clean mel-spectrogram, which is then converted to a waveform via Vocos vocoder. Training data is the 100k-hour open Emilia dataset (multilingual long-form audio scraped from podcasts and audiobooks). Because there is no autoregressive decoder, F5-TTS achieves real-time factor below 0.2 on a single A10 GPU while keeping competitive WER with VALL-E and NaturalSpeech 3. The model is famous for very high-quality zero-shot voice cloning from a single 5-15 second reference clip.

Paraméterek
~330M (Base) and ~1.4B (Large)
Kontextus
30 token

Képességek

  • Zero-shot voice cloning from ~10 s of reference audio with no fine-tuning
  • Non-autoregressive flow matching with real-time-factor < 0.2 on a single GPU
  • Open weights under MIT licence, multiple checkpoints (Base, Small, Multilingual)
  • English and Chinese out of the box; community fine-tunes for German, French, Japanese, Spanish
  • Up to 30 s of generated audio per inference
  • Speed control by adjusting the duration prompt
  • Best for: research, on-device TTS, voice cloning prototypes, commercial products built on open weights

Képzés és licenc

Pretrained on the 100,000-hour open Emilia dataset of multilingual long-form audio with weakly supervised transcripts. Additional community fine-tunes use LibriSpeech, AISHELL-3 and bespoke audiobook collections.

Licenc: Code and weights under MIT licence; commercial use permitted.

Biztonsági tesztelés: No formal red-team report. Authors publish a model card recommending consent for voice cloning and a model-output watermark, which is optional.

Ismert korlátozások

  • No formal SSML / emotion tags
  • Quality degrades on noisy reference audio
  • Multilingual coverage outside English/Chinese depends on community checkpoints
  • 30-second hard cap per generation
  • Voice cloning quality slightly below ElevenLabs Multilingual V2 on emotional acting
05

Árak

Jelenleg nem elérhető: ezt a modellt deaktiválták. Jelenleg nincs ár ehhez a modellhez, ezért nem futtatható.

06

API

Hívja meg a F5-TTS modellt a Railwail API-kulcsával. Használja ezt a modell-azonosítót a kérésben:

Nincs ellenőrzött API-példa

A nyilvános API más bemeneti formátumot továbbít, mint amit ez a modell igényel. Használja a fenti Playground-ot.

07

Specifikációk

Modell-azonosító
f5-tts
Fejlesztő
X-LANCE (SJTU)
Bemenet
Szöveg
Kimenet
Hang
Modell mérete
~330M (Base) and ~1.4B (Large)
Licenc
Code and weights under MIT licence; commercial use permitted.
Katalógus bejegyzés frissítve
2026. szeptember 23.

Bemeneti paraméterek

A modell bemeneti sémájából származó bemenetek és beállítások. Az API szakaszban szereplő példa mutatja, hogy az API melyiket fogadja el.

  • audiokötelező

    Reference clip to clone; requires consent

    Típus: –
    Alapértelmezett: –
    Engedélyezett értékek: –
  • gen_textkötelező

    Text to speak in the cloned voice

    Típus: Szöveg
    Alapértelmezett: –
    Engedélyezett értékek: legfeljebb 4000 karakter
  • speed
    Típus: Szám
    Alapértelmezett: 1
    Engedélyezett értékek: 0,1 és 3 között
  • ref_text

    Transcript of the reference clip (improves quality)

    Típus: Szöveg
    Alapértelmezett: –
    Engedélyezett értékek: –
  • remove_silence
    Típus: Igen/nem
    Alapértelmezett: true
    Engedélyezett értékek: –

Címkék

  • f5
  • tts
  • open-weights
  • voice-cloning
  • research
  • pricing-tbd
08

Felhasználási esetek

Mire használják

  • Open-weights voice cloning research
  • On-device TTS for desktop and edge
  • Indie game and audiobook narration
  • Custom commercial products built on open weights
  • Academic benchmarks for flow-matching TTS
09

Gyakran ismételt kérdések

Mi az a F5-TTS?

A F5-TTS a X-LANCE (SJTU) által fejlesztett modell a Szövegfelolvasás (TTS) kategóriában. A Railwail katalógusában szerepel, de jelenleg nem futtatható.

Mennyibe kerül a F5-TTS a Railwail-on?

A F5-TTS jelenleg nem futtatható a Railwail-on, ezért nincs aktuális ár. Az elérhető alternatívák árakkal az oldal alább találhatók.

Milyen beállításokat támogat a F5-TTS?

A bemeneti séma szerint a F5-TTS ezeket a paramétereket ismeri: audio, gen_text (legfeljebb 4000 karakter), speed (0,1 és 3 között), ref_text és remove_silence.

Milyen gyors a F5-TTS?

A F5-TTS-nek még nincs elég mért futtatása a Railwail-on ahhoz, hogy futási időt adjunk meg. Ez a bemenettől, a beállításoktól és a szolgáltató terhelésétől függ.

A F5-TTS jobb, mint a AudioLDM 2?

Ez a feladattól függ. A F5-TTS (X-LANCE (SJTU)) és a AudioLDM 2 (Haohe Liu) egyaránt modellek a Szövegfelolvasás (TTS) kategóriában. Az összehasonlítás oldal az árakat és specifikációkat egymás mellett mutatja.

F5-TTS és AudioLDM 2 összehasonlítása

Használhatom a F5-TTS-t most?

Jelenleg nem elérhető: ezt a modellt deaktiválták. Az oldal online marad; az ugyanabból a kategóriából elérhető alternatívák az oldal alább találhatók.

Összes modell egy API-n keresztül

Egy API-kulcs a Railwail összes modelljéhez. A használat előre feltöltött kreditek alapján kerül felszámításra, 1 kredit = 0,01 USD.