F5-TTS

Sprachausgabe (TTS)Nicht verfügbar
von X-LANCE (SJTU)Modell-ID: f5-tts

Open-source flow-matching TTS with strong zero-shot voice cloning. Code MIT, weights CC-BY-NC.

Status
Nicht verfügbar
Eingabe → Ausgabe
Text → Audio
Entwickler
X-LANCE (SJTU)
Aktualisiert
23. September 2026

F5-TTS ist derzeit nicht verfügbar

Derzeit nicht verfügbar: Dieses Modell ist deaktiviert.

Die Angaben auf dieser Seite kannst du weiter nachlesen. Mit einer der verfügbaren Alternativen unten kannst du sofort ein vergleichbares Modell nutzen.

Zu den Alternativen
01

Vergleichbare Modelle

Alle dieser Kategorie
  • AudioLDM 2Haohe Liu

    Latent-diffusion model for general-purpose text-to-audio. Generates speech, music, and sound effects with a unified prior.

    ca. $ 0.0157/Lauf

  • Kokoro TTS 82MCommunity

    Open-weights 82M-parameter TTS. Punches above its size class on naturalness benchmarks at a fraction of the inference cost of larger models.

    ca. $ 0.00030/Lauf

  • OpenVoice v2Community

    MyShell OpenVoice v2. Multilingual zero-shot voice cloning with accurate tone-color reproduction and style/emotion control.

    ca. $ 0.0673/Lauf

02

Playground

F5-TTS ausprobieren

Eingabe & Ergebnis

Derzeit nicht verfügbar

Derzeit nicht verfügbar: Dieses Modell ist deaktiviert.

Der Playground ist deaktiviert. Vergleichbare Modelle findest du in derselben Kategorie: Alternativen ansehen

F5-TTS ausprobieren

0 / 4'000

Text to speak in the cloned voice

Stimmprobe *Aufnahme bis 30 s · Datei bis 60 s, 10 MB

10 bis 30 Sekunden deutlich gesprochen, eine Person, ohne Musik oder Hintergrundlärm.

Erweiterte Einstellungen (3)

Transcript of the reference clip (improves quality)

Ergebnis
Die erzeugte Sprache erscheint hier.

Dieser Lauf

Kein Preis – derzeit nicht verfügbar.

Neu hier?

10 Gratis-Credits ($ 0.10) bei Anmeldung mit Google

Nutzbar 24 Stunden nach der Anmeldung, bis zu 5 Läufe pro Tag und höchstens 2 Credits je Lauf. Andere Anmeldearten starten ohne Guthaben.

03

Beispiele

Echte Ergebnisse aus den öffentlichen Beispielen dieses Modells auf Replicate, mit dem Prompt und den Einstellungen, die sie erzeugt haben. Sie wurden nicht live auf dieser Seite erzeugt.
04

Über F5-TTS

Kurz gesagtStand: 23. September 2026

F5-TTS ist ein Modell von X-LANCE (SJTU) aus der Kategorie Sprachausgabe (TTS). Über Railwail ist F5-TTS derzeit nicht verfügbar.

Hintergrund

Über SWivid (Shanghai Jiao Tong University et al.)

Gegründet 2024 · Shanghai, China

F5-TTS was released in October 2024 by the SWivid research collective, an open-source group anchored at Shanghai Jiao Tong University with contributors from the X-LANCE Lab, Microsoft Research Asia and the Chinese University of Hong Kong. Lead authors Yushen Chen, Zhikang Niu, Ziyang Ma, Keqi Deng, Haian Lin, Wendi He, Xiaofei Wang, Tomoki Toda, Kai Yu and Xie Chen released F5-TTS under MIT licence on GitHub together with model weights and a Hugging Face demo. The work followed the earlier E2-TTS (Microsoft) paper and quickly became one of the most popular open-weights TTS models of 2024-2025, frequently cited as the best fully open alternative to ElevenLabs for English and Chinese voice cloning.

SWivid (Shanghai Jiao Tong University et al.) besuchen

Architektur

Flow-matching non-autoregressive TTS with Diffusion Transformer (DiT)

F5-TTS (Fairy-tale Fast Flow Matching TTS) is a non-autoregressive text-to-speech system that replaces the encoder-decoder pipeline with a single Diffusion Transformer trained with conditional flow matching. Text is first converted to character tokens and zero-padded to the target mel-spectrogram length, then concatenated with a noisy mel reference for the target voice. A DiT backbone with ConvNeXt v2 blocks predicts the velocity field that maps Gaussian noise to a clean mel-spectrogram, which is then converted to a waveform via Vocos vocoder. Training data is the 100k-hour open Emilia dataset (multilingual long-form audio scraped from podcasts and audiobooks). Because there is no autoregressive decoder, F5-TTS achieves real-time factor below 0.2 on a single A10 GPU while keeping competitive WER with VALL-E and NaturalSpeech 3. The model is famous for very high-quality zero-shot voice cloning from a single 5-15 second reference clip.

Parameter
~330M (Base) and ~1.4B (Large)
Kontext
30 Token

Fähigkeiten

  • Zero-shot voice cloning from ~10 s of reference audio with no fine-tuning
  • Non-autoregressive flow matching with real-time-factor < 0.2 on a single GPU
  • Open weights under MIT licence, multiple checkpoints (Base, Small, Multilingual)
  • English and Chinese out of the box; community fine-tunes for German, French, Japanese, Spanish
  • Up to 30 s of generated audio per inference
  • Speed control by adjusting the duration prompt
  • Best for: research, on-device TTS, voice cloning prototypes, commercial products built on open weights

Training & Lizenz

Pretrained on the 100,000-hour open Emilia dataset of multilingual long-form audio with weakly supervised transcripts. Additional community fine-tunes use LibriSpeech, AISHELL-3 and bespoke audiobook collections.

Lizenz: Code and weights under MIT licence; commercial use permitted.

Sicherheitstests: No formal red-team report. Authors publish a model card recommending consent for voice cloning and a model-output watermark, which is optional.

Bekannte Grenzen

  • No formal SSML / emotion tags
  • Quality degrades on noisy reference audio
  • Multilingual coverage outside English/Chinese depends on community checkpoints
  • 30-second hard cap per generation
  • Voice cloning quality slightly below ElevenLabs Multilingual V2 on emotional acting
05

Preise

Derzeit nicht verfügbar: Dieses Modell ist deaktiviert. Für dieses Modell gibt es derzeit keinen Preis, deshalb lässt es sich nicht ausführen.

06

API

Rufe F5-TTS mit deinem Railwail-API-Schlüssel auf. Diese Modell-ID gehört in die Anfrage:

Kein geprüftes API-Beispiel

Die öffentliche API übergibt ein anderes Eingabeformat, als dieses Modell braucht. Nutze den Playground oben.

07

Spezifikationen

Modell-ID
f5-tts
Entwickler
X-LANCE (SJTU)
Eingabe
Text
Ausgabe
Audio
Modellgrösse
~330M (Base) and ~1.4B (Large)
Lizenz
Code and weights under MIT licence; commercial use permitted.
Katalogeintrag aktualisiert
23. September 2026

Eingabeparameter

Eingaben und Einstellungen laut Eingabeschema des Modells. Welche davon die API annimmt, zeigt das Beispiel im Abschnitt API.

  • audioPflicht

    Reference clip to clone; requires consent

    Typ: –
    Standard: –
    Erlaubte Werte: –
  • gen_textPflicht

    Text to speak in the cloned voice

    Typ: Text
    Standard: –
    Erlaubte Werte: bis 4'000 Zeichen
  • speed
    Typ: Zahl
    Standard: 1
    Erlaubte Werte: 0.1 bis 3
  • ref_text

    Transcript of the reference clip (improves quality)

    Typ: Text
    Standard: –
    Erlaubte Werte: –
  • remove_silence
    Typ: Ja/Nein
    Standard: true
    Erlaubte Werte: –

Schlagwörter

  • f5
  • tts
  • open-weights
  • voice-cloning
  • research
  • pricing-tbd
08

Einsatzgebiete

Wofür es genutzt wird

  • Open-weights voice cloning research
  • On-device TTS for desktop and edge
  • Indie game and audiobook narration
  • Custom commercial products built on open weights
  • Academic benchmarks for flow-matching TTS
09

Häufige Fragen

Was ist F5-TTS?

F5-TTS ist ein Modell von X-LANCE (SJTU) aus der Kategorie Sprachausgabe (TTS). Es steht im Railwail-Katalog, lässt sich derzeit aber nicht ausführen.

Was kostet F5-TTS bei Railwail?

F5-TTS lässt sich über Railwail derzeit nicht ausführen, deshalb gibt es keinen aktuellen Preis. Verfügbare Alternativen mit Preisen stehen weiter unten auf dieser Seite.

Welche Einstellungen unterstützt F5-TTS?

Laut Eingabeschema kennt F5-TTS diese Parameter: audio, gen_text (bis 4'000 Zeichen), speed (0.1 bis 3), ref_text und remove_silence.

Wie schnell ist F5-TTS?

Für F5-TTS gibt es bei Railwail noch zu wenige gemessene Läufe, um eine Laufzeit anzugeben. Sie hängt von der Eingabe, den Einstellungen und der Auslastung beim Anbieter ab.

Ist F5-TTS besser als AudioLDM 2?

Das hängt von der Aufgabe ab. F5-TTS (X-LANCE (SJTU)) und AudioLDM 2 (Haohe Liu) sind beide Modelle aus der Kategorie Sprachausgabe (TTS). Die Vergleichsseite zeigt Preise und Spezifikationen nebeneinander.

F5-TTS und AudioLDM 2 vergleichen

Kann ich F5-TTS gerade nutzen?

Derzeit nicht verfügbar: Dieses Modell ist deaktiviert. Die Seite bleibt online; verfügbare Alternativen aus derselben Kategorie stehen weiter unten.

Alle Modelle über eine API

Ein API-Schlüssel für alle Modelle auf Railwail. Abgerechnet wird über vorab gekaufte Credits, 1 Credit = $ 0.01.