F5-TTS

Σύνθεση ομιλίαςΜη διαθέσιμο
από X-LANCE (SJTU)Αναγνωριστικό μοντέλου: f5-tts

Open-source flow-matching TTS with strong zero-shot voice cloning. Code MIT, weights CC-BY-NC.

Κατάσταση
Μη διαθέσιμο
Είσοδος → Έξοδος
Κείμενο → Ήχος
Προγραμματιστής
X-LANCE (SJTU)
Ενημερώθηκε
23 Σεπτεμβρίου 2026

Το F5-TTS δεν είναι διαθέσιμο αυτή τη στιγμή

Προς το παρόν μη διαθέσιμο: αυτό το μοντέλο έχει απενεργοποιηθεί.

Μπορείτε να διαβάσετε τις λεπτομέρειες σε αυτήν τη σελίδα. Επιλέξτε μία από τις διαθέσιμες εναλλακτικές λύσεις παρακάτω για να εκτελέσετε αμέσως ένα συγκρίσιμο μοντέλο.

Μετάβαση στις εναλλακτικές λύσεις
01

Συγκρίσιμα μοντέλα

Όλα σε αυτήν την κατηγορία
  • AudioLDM 2Haohe Liu

    Latent-diffusion model for general-purpose text-to-audio. Generates speech, music, and sound effects with a unified prior.

    ≈ 0,0157 $/εκτέλεση

  • Kokoro TTS 82MCommunity

    Open-weights 82M-parameter TTS. Punches above its size class on naturalness benchmarks at a fraction of the inference cost of larger models.

    ≈ 0,00030 $/εκτέλεση

  • OpenVoice v2Community

    MyShell OpenVoice v2. Multilingual zero-shot voice cloning with accurate tone-color reproduction and style/emotion control.

    ≈ 0,0673 $/εκτέλεση

02

Playground

Δοκιμάστε F5-TTS

Είσοδος & Έξοδος

Προς το παρόν μη διαθέσιμο

Προς το παρόν μη διαθέσιμο: αυτό το μοντέλο έχει απενεργοποιηθεί.

Το playground είναι απενεργοποιημένο. Μπορείτε να βρείτε συγκρίσιμα μοντέλα στην ίδια κατηγορία: Περιήγηση εναλλακτικών λύσεων

Δοκιμάστε F5-TTS

0 / 4.000

Text to speak in the cloned voice

Voice sample *Record up to 30 s · file up to 60 s, 10 MB

10 to 30 seconds of clear speech, one speaker, no music or background noise.

Προηγμένες ρυθμίσεις (3)

Transcript of the reference clip (improves quality)

Αποτέλεσμα
Η δημιουργημένη ομιλία εμφανίζεται εδώ.

Αυτή η εκτέλεση

Χωρίς τιμή – προς το παρόν μη διαθέσιμο.

Νέος εδώ;

10 δωρεάν πιστωτικές μονάδες (0,10 $) όταν εγγραφείς με Google

Χρησιμοποιήσιμο 24 ώρες μετά την εγγραφή, έως 5 εκτελέσεις ανά ημέρα και το πολύ 2 πιστωτικές μονάδες ανά εκτέλεση. Άλλες μέθοδοι σύνδεσης ξεκινούν χωρίς πιστωτικές μονάδες.

03

Examples

Real outputs from the public examples of this model on Replicate, with the prompt and settings that produced them. They were not generated live on this page.
04

Σχετικά με το F5-TTS

ΣύντομαΗμερομηνία: 23 Σεπτεμβρίου 2026

Το F5-TTS είναι ένα μοντέλο του X-LANCE (SJTU) στην κατηγορία Σύνθεση ομιλίας. Το F5-TTS δεν είναι διαθέσιμο στο Railwail αυτή τη στιγμή.

Φόντο

Σχετικά με SWivid (Shanghai Jiao Tong University et al.)

Ιδρύθηκε 2024 · Shanghai, China

F5-TTS was released in October 2024 by the SWivid research collective, an open-source group anchored at Shanghai Jiao Tong University with contributors from the X-LANCE Lab, Microsoft Research Asia and the Chinese University of Hong Kong. Lead authors Yushen Chen, Zhikang Niu, Ziyang Ma, Keqi Deng, Haian Lin, Wendi He, Xiaofei Wang, Tomoki Toda, Kai Yu and Xie Chen released F5-TTS under MIT licence on GitHub together with model weights and a Hugging Face demo. The work followed the earlier E2-TTS (Microsoft) paper and quickly became one of the most popular open-weights TTS models of 2024-2025, frequently cited as the best fully open alternative to ElevenLabs for English and Chinese voice cloning.

Επισκεφθείτε SWivid (Shanghai Jiao Tong University et al.)

Αρχιτεκτονική

Flow-matching non-autoregressive TTS with Diffusion Transformer (DiT)

F5-TTS (Fairy-tale Fast Flow Matching TTS) is a non-autoregressive text-to-speech system that replaces the encoder-decoder pipeline with a single Diffusion Transformer trained with conditional flow matching. Text is first converted to character tokens and zero-padded to the target mel-spectrogram length, then concatenated with a noisy mel reference for the target voice. A DiT backbone with ConvNeXt v2 blocks predicts the velocity field that maps Gaussian noise to a clean mel-spectrogram, which is then converted to a waveform via Vocos vocoder. Training data is the 100k-hour open Emilia dataset (multilingual long-form audio scraped from podcasts and audiobooks). Because there is no autoregressive decoder, F5-TTS achieves real-time factor below 0.2 on a single A10 GPU while keeping competitive WER with VALL-E and NaturalSpeech 3. The model is famous for very high-quality zero-shot voice cloning from a single 5-15 second reference clip.

Παράμετροι
~330M (Base) and ~1.4B (Large)
Περιεχόμενο
30 tokens

Δυνατότητες

  • Zero-shot voice cloning from ~10 s of reference audio with no fine-tuning
  • Non-autoregressive flow matching with real-time-factor < 0.2 on a single GPU
  • Open weights under MIT licence, multiple checkpoints (Base, Small, Multilingual)
  • English and Chinese out of the box; community fine-tunes for German, French, Japanese, Spanish
  • Up to 30 s of generated audio per inference
  • Speed control by adjusting the duration prompt
  • Best for: research, on-device TTS, voice cloning prototypes, commercial products built on open weights

Εκπαίδευση & άδεια

Pretrained on the 100,000-hour open Emilia dataset of multilingual long-form audio with weakly supervised transcripts. Additional community fine-tunes use LibriSpeech, AISHELL-3 and bespoke audiobook collections.

Άδεια: Code and weights under MIT licence; commercial use permitted.

Δοκιμές ασφάλειας: No formal red-team report. Authors publish a model card recommending consent for voice cloning and a model-output watermark, which is optional.

Γνωστοί περιορισμοί

  • No formal SSML / emotion tags
  • Quality degrades on noisy reference audio
  • Multilingual coverage outside English/Chinese depends on community checkpoints
  • 30-second hard cap per generation
  • Voice cloning quality slightly below ElevenLabs Multilingual V2 on emotional acting
05

Τιμολόγηση

Προς το παρόν μη διαθέσιμο: αυτό το μοντέλο έχει απενεργοποιηθεί. Δεν υπάρχει τιμή για αυτό το μοντέλο αυτή τη στιγμή, επομένως δεν μπορεί να εκτελεστεί.

06

API

Καλέστε το F5-TTS με το κλειδί Railwail API. Χρησιμοποιήστε αυτό το ID μοντέλου στο αίτημα:

Κανένα επαληθευμένο παράδειγμα API

Το δημόσιο API περνά μια διαφορετική μορφή εισόδου από αυτή που χρειάζεται αυτό το μοντέλο. Χρησιμοποιήστε το playground παραπάνω.

07

Προδιαγραφές

ID μοντέλου
f5-tts
Ανάπτυξη
X-LANCE (SJTU)
Είσοδος
Κείμενο
Έξοδος
Ήχος
Μέγεθος μοντέλου
~330M (Base) and ~1.4B (Large)
Άδεια
Code and weights under MIT licence; commercial use permitted.
Καταχώρηση καταλόγου ενημερώθηκε
23 Σεπτεμβρίου 2026

Παράμετροι εισόδου

Εισόδους και ρυθμίσεις από το σχήμα εισόδου του μοντέλου. Το παράδειγμα στην ενότητα API δείχνει ποιες από αυτές δέχεται το API.

  • audioΥποχρεωτικό

    Reference clip to clone; requires consent

    Τύπος: –
    Προεπιλογή: –
    Επιτρεπόμενες τιμές: –
  • gen_textΥποχρεωτικό

    Text to speak in the cloned voice

    Τύπος: Κείμενο
    Προεπιλογή: –
    Επιτρεπόμενες τιμές: Έως 4.000 χαρακτήρες
  • speed
    Τύπος: Αριθμός
    Προεπιλογή: 1
    Επιτρεπόμενες τιμές: 0,1 έως 3
  • ref_text

    Transcript of the reference clip (improves quality)

    Τύπος: Κείμενο
    Προεπιλογή: –
    Επιτρεπόμενες τιμές: –
  • remove_silence
    Τύπος: Ναι/Όχι
    Προεπιλογή: true
    Επιτρεπόμενες τιμές: –

Ετικέτες

  • f5
  • tts
  • open-weights
  • voice-cloning
  • research
  • pricing-tbd
08

Περιπτώσεις χρήσης

Για τι χρησιμοποιείται

  • Open-weights voice cloning research
  • On-device TTS for desktop and edge
  • Indie game and audiobook narration
  • Custom commercial products built on open weights
  • Academic benchmarks for flow-matching TTS
09

Συχνές ερωτήσεις

Τι είναι F5-TTS;

Το F5-TTS είναι ένα μοντέλο του X-LANCE (SJTU) στην κατηγορία Σύνθεση ομιλίας. Είναι καταχωρημένο στο Railwail αλλά δεν μπορεί να εκτελεστεί αυτή τη στιγμή.

Πόσο κοστίζει το F5-TTS στο Railwail;

Το F5-TTS δεν μπορεί να εκτελεστεί στο Railwail αυτή τη στιγμή, επομένως δεν υπάρχει τρέχουσα τιμή. Διαθέσιμες εναλλακτικές λύσεις με τιμές παρατίθενται παρακάτω σε αυτήν τη σελίδα.

Ποιες ρυθμίσεις υποστηρίζει το F5-TTS;

Σύμφωνα με το σχήμα εισόδου του, το F5-TTS γνωρίζει αυτές τις παραμέτρους: audio, gen_text (Έως 4.000 χαρακτήρες), speed (0,1 έως 3), ref_text και remove_silence.

Πόσο γρήγορο είναι το F5-TTS;

Δεν υπάρχουν αρκετές μετρημένες εκτελέσεις του F5-TTS στο Railwail ακόμα για να δηλωθεί ένας χρόνος εκτέλεσης. Εξαρτάται από την είσοδο, τις ρυθμίσεις και το φορτίο στον πάροχο.

Είναι το F5-TTS καλύτερο από το AudioLDM 2;

Αυτό εξαρτάται από την εργασία. Το F5-TTS (X-LANCE (SJTU)) και το AudioLDM 2 (Haohe Liu) είναι και τα δύο μοντέλα στην κατηγορία Σύνθεση ομιλίας. Η σελίδα σύγκρισης δείχνει τις τιμές και τις προδιαγραφές τους παράλληλα.

Σύγκριση F5-TTS και AudioLDM 2

Μπορώ να χρησιμοποιήσω το F5-TTS τώρα;

Προς το παρόν μη διαθέσιμο: αυτό το μοντέλο έχει απενεργοποιηθεί. Η σελίδα παραμένει ενεργή· διαθέσιμες εναλλακτικές λύσεις από την ίδια κατηγορία παρατίθενται παρακάτω.

Όλα τα μοντέλα μέσω ενός API

Ένα κλειδί API για κάθε μοντέλο στο Railwail. Η χρήση χρεώνεται από προπληρωμένα πιστωτικά, 1 πιστωτικό = 0,01 $.