F5-TTS

Synteza mowyNiedostępne
od X-LANCE (SJTU)ID modelu: f5-tts

Open-source flow-matching TTS with strong zero-shot voice cloning. Code MIT, weights CC-BY-NC.

Status
Niedostępne
Wejście → Wyjście
Tekst → Audio
Deweloper
X-LANCE (SJTU)
Zaktualizowano
23 września 2026

F5-TTS jest obecnie niedostępny

Obecnie niedostępne: ten model został dezaktywowany.

Możesz nadal przeczytać szczegóły na tej stronie. Wybierz jedną z dostępnych alternatyw poniżej, aby od razu uruchomić porównywalny model.

Przejdź do alternatyw
01

Porównywalne modele

Wszystkie w tej kategorii
  • AudioLDM 2Haohe Liu

    Latent-diffusion model for general-purpose text-to-audio. Generates speech, music, and sound effects with a unified prior.

    ≈ 0,0157 USD/uruchomienie

  • Kokoro TTS 82MCommunity

    Open-weights 82M-parameter TTS. Punches above its size class on naturalness benchmarks at a fraction of the inference cost of larger models.

    ≈ 0,00030 USD/uruchomienie

  • OpenVoice v2Community

    MyShell OpenVoice v2. Multilingual zero-shot voice cloning with accurate tone-color reproduction and style/emotion control.

    ≈ 0,0673 USD/uruchomienie

02

Playground

Spróbuj F5-TTS

Wejście i wyjście

Niedostępny

Obecnie niedostępne: ten model został dezaktywowany.

Plac zabaw jest wyłączony. Porównywalne modele znajdziesz w tej samej kategorii: Przeglądaj alternatywy

Spróbuj F5-TTS

0 / 4000

Text to speak in the cloned voice

Voice sample *Record up to 30 s · file up to 60 s, 10 MB

10 to 30 seconds of clear speech, one speaker, no music or background noise.

Ustawienia zaawansowane (3)

Transcript of the reference clip (improves quality)

Wynik
Wygenerowana mowa pojawi się tutaj.

To uruchomienie

Brak ceny – obecnie niedostępne.

Nowy tutaj?

10 darmowych kredytów (0,10 USD) po zarejestrowaniu się przez Google

Dostępne 24 godzin po rejestracji, do 5 uruchomień dziennie i maksymalnie 2 kredytów na uruchomienie. Inne metody logowania uruchamiają się bez kredytów.

03

Examples

Real outputs from the public examples of this model on Replicate, with the prompt and settings that produced them. They were not generated live on this page.
04

O F5-TTS

Krótko mówiącStan na 23 września 2026

F5-TTS to model opracowany przez X-LANCE (SJTU) w kategorii Synteza mowy. F5-TTS nie jest obecnie dostępny w serwisie Railwail.

Tło

O SWivid (Shanghai Jiao Tong University et al.)

Założona 2024 · Shanghai, China

F5-TTS was released in October 2024 by the SWivid research collective, an open-source group anchored at Shanghai Jiao Tong University with contributors from the X-LANCE Lab, Microsoft Research Asia and the Chinese University of Hong Kong. Lead authors Yushen Chen, Zhikang Niu, Ziyang Ma, Keqi Deng, Haian Lin, Wendi He, Xiaofei Wang, Tomoki Toda, Kai Yu and Xie Chen released F5-TTS under MIT licence on GitHub together with model weights and a Hugging Face demo. The work followed the earlier E2-TTS (Microsoft) paper and quickly became one of the most popular open-weights TTS models of 2024-2025, frequently cited as the best fully open alternative to ElevenLabs for English and Chinese voice cloning.

Odwiedź SWivid (Shanghai Jiao Tong University et al.)

Architektura

Flow-matching non-autoregressive TTS with Diffusion Transformer (DiT)

F5-TTS (Fairy-tale Fast Flow Matching TTS) is a non-autoregressive text-to-speech system that replaces the encoder-decoder pipeline with a single Diffusion Transformer trained with conditional flow matching. Text is first converted to character tokens and zero-padded to the target mel-spectrogram length, then concatenated with a noisy mel reference for the target voice. A DiT backbone with ConvNeXt v2 blocks predicts the velocity field that maps Gaussian noise to a clean mel-spectrogram, which is then converted to a waveform via Vocos vocoder. Training data is the 100k-hour open Emilia dataset (multilingual long-form audio scraped from podcasts and audiobooks). Because there is no autoregressive decoder, F5-TTS achieves real-time factor below 0.2 on a single A10 GPU while keeping competitive WER with VALL-E and NaturalSpeech 3. The model is famous for very high-quality zero-shot voice cloning from a single 5-15 second reference clip.

Parametry
~330M (Base) and ~1.4B (Large)
Kontekst
30 tokenów

Możliwości

  • Zero-shot voice cloning from ~10 s of reference audio with no fine-tuning
  • Non-autoregressive flow matching with real-time-factor < 0.2 on a single GPU
  • Open weights under MIT licence, multiple checkpoints (Base, Small, Multilingual)
  • English and Chinese out of the box; community fine-tunes for German, French, Japanese, Spanish
  • Up to 30 s of generated audio per inference
  • Speed control by adjusting the duration prompt
  • Best for: research, on-device TTS, voice cloning prototypes, commercial products built on open weights

Trening i licencja

Pretrained on the 100,000-hour open Emilia dataset of multilingual long-form audio with weakly supervised transcripts. Additional community fine-tunes use LibriSpeech, AISHELL-3 and bespoke audiobook collections.

Licencja: Code and weights under MIT licence; commercial use permitted.

Testy bezpieczeństwa: No formal red-team report. Authors publish a model card recommending consent for voice cloning and a model-output watermark, which is optional.

Znane ograniczenia

  • No formal SSML / emotion tags
  • Quality degrades on noisy reference audio
  • Multilingual coverage outside English/Chinese depends on community checkpoints
  • 30-second hard cap per generation
  • Voice cloning quality slightly below ElevenLabs Multilingual V2 on emotional acting
05

Ceny

Obecnie niedostępne: ten model został dezaktywowany. Dla tego modelu nie ma ceny w tej chwili, dlatego nie można go uruchomić.

06

API

Wywołaj F5-TTS za pomocą klucza API Railwail. Użyj tego ID modelu w żądaniu:

Brak zweryfikowanego przykładu API

Publiczny API przekazuje inny format wejściowy niż wymaga ten model. Użyj placu zabaw powyżej.

07

Specyfikacje

ID modelu
f5-tts
Deweloper
X-LANCE (SJTU)
Kategoria
Synteza mowy
Wejście
Tekst
Wyjście
Audio
Rozmiar modelu
~330M (Base) and ~1.4B (Large)
Licencja
Code and weights under MIT licence; commercial use permitted.
Wpis w katalogu zaktualizowany
23 września 2026

Parametry wejściowe

Dane wejściowe i ustawienia ze schematu wejściowego modelu. Przykład w sekcji API pokazuje, które z nich API akceptuje.

  • audiowymagane

    Reference clip to clone; requires consent

    Typ: –
    Domyślnie: –
    Dozwolone wartości: –
  • gen_textwymagane

    Text to speak in the cloned voice

    Typ: Tekst
    Domyślnie: –
    Dozwolone wartości: do 4000 znaków
  • speed
    Typ: Liczba
    Domyślnie: 1
    Dozwolone wartości: 0,1 do 3
  • ref_text

    Transcript of the reference clip (improves quality)

    Typ: Tekst
    Domyślnie: –
    Dozwolone wartości: –
  • remove_silence
    Typ: Tak/Nie
    Domyślnie: true
    Dozwolone wartości: –

Tagi

  • f5
  • tts
  • open-weights
  • voice-cloning
  • research
  • pricing-tbd
08

Przypadki użycia

Do czego się go używa

  • Open-weights voice cloning research
  • On-device TTS for desktop and edge
  • Indie game and audiobook narration
  • Custom commercial products built on open weights
  • Academic benchmarks for flow-matching TTS
09

Często zadawane pytania

Co to jest F5-TTS?

F5-TTS to model opracowany przez X-LANCE (SJTU) w kategorii Synteza mowy. Jest wymieniony w katalogu Railwail, ale nie może być uruchomiony w tej chwili.

Ile kosztuje F5-TTS w serwisie Railwail?

F5-TTS nie może być uruchomiony w serwisie Railwail w tej chwili, dlatego nie ma aktualnej ceny. Dostępne alternatywy z cenami są wymienione poniżej na tej stronie.

Jakie ustawienia obsługuje F5-TTS?

Zgodnie ze schematem wejściowym, F5-TTS obsługuje te parametry: audio, gen_text (do 4000 znaków), speed (0,1 do 3), ref_text i remove_silence.

Jak szybki jest F5-TTS?

Dla F5-TTS jest jeszcze zbyt mało zmierzonych przebiegów w serwisie Railwail, aby podać czas przebiegu. Zależy to od wejścia, ustawień i obciążenia u dostawcy.

Czy F5-TTS jest lepszy niż AudioLDM 2?

To zależy od zadania. F5-TTS (X-LANCE (SJTU)) i AudioLDM 2 (Haohe Liu) to oba modele z kategorii Synteza mowy. Strona porównania pokazuje ich ceny i specyfikacje obok siebie.

Porównaj F5-TTS i AudioLDM 2

Czy mogę używać F5-TTS teraz?

Obecnie niedostępne: ten model został dezaktywowany. Strona pozostaje online; dostępne alternatywy z tej samej kategorii są wymienione poniżej.

Wszystkie modele przez jedno API

Jeden klucz API dla każdego modelu na Railwail. Opłaty pobierane są z przedpłaconych kredytów, 1 kredyt = 0,01 USD.