F5-TTS

Metin-Konuşma (TTS)Mevcut Değil
X-LANCE (SJTU) tarafındanModel Kimliği: f5-tts

Open-source flow-matching TTS with strong zero-shot voice cloning. Code MIT, weights CC-BY-NC.

Durum
Mevcut Değil
Giriş → Çıkış
Metin → Ses
Geliştirici
X-LANCE (SJTU)
Güncellendi
23 Eylül 2026

F5-TTS şu anda kullanılamıyor

Şu anda kullanılamıyor: bu model devre dışı bırakılmıştır.

Bu sayfadaki ayrıntıları yine de okuyabilirsiniz. Hemen karşılaştırılabilir bir modeli çalıştırmak için aşağıdaki mevcut alternatiflerden birini seçin.

Alternatiflere Git
01

Karşılaştırılabilir modeller

Bu kategorideki tümü
  • AudioLDM 2Haohe Liu

    Latent-diffusion model for general-purpose text-to-audio. Generates speech, music, and sound effects with a unified prior.

    ≈ $0,0157/çalıştırma

  • Kokoro TTS 82MCommunity

    Open-weights 82M-parameter TTS. Punches above its size class on naturalness benchmarks at a fraction of the inference cost of larger models.

    ≈ $0,00030/çalıştırma

  • OpenVoice v2Community

    MyShell OpenVoice v2. Multilingual zero-shot voice cloning with accurate tone-color reproduction and style/emotion control.

    ≈ $0,0673/çalıştırma

02

Playground

F5-TTS'ı deneyin

Giriş & Sonuç

Şu anda kullanılamıyor

Şu anda kullanılamıyor: bu model devre dışı bırakılmıştır.

Oyun alanı devre dışıdır. Aynı kategoride karşılaştırılabilir modeller bulabilirsiniz: Alternatifleri görüntüle

F5-TTS'ı deneyin

0 / 4.000

Text to speak in the cloned voice

Voice sample *Record up to 30 s · file up to 60 s, 10 MB

10 to 30 seconds of clear speech, one speaker, no music or background noise.

Gelişmiş ayarlar (3)

Transcript of the reference clip (improves quality)

Sonuç
Oluşturulan konuşma burada görünür.

Bu çalıştırma

Fiyat yok – şu anda kullanılamıyor.

Yeni misiniz?

Google ile kaydolduğunuzda 10 ücretsiz kredi ($0,10)

Kaydolduktan 24 saat sonra kullanılabilir, günde 5 çalıştırmaya kadar ve çalıştırma başına en fazla 2 kredi. Diğer oturum açma yöntemleri kredi olmadan başlar.

03

Examples

Real outputs from the public examples of this model on Replicate, with the prompt and settings that produced them. They were not generated live on this page.
04

F5-TTS Hakkında

Özet23 Eylül 2026 itibariyle

F5-TTS, X-LANCE (SJTU) tarafından Metin-Konuşma (TTS) kategorisinde geliştirilen bir modeldir. F5-TTS şu anda Railwail üzerinde kullanılamıyor.

Arka plan

SWivid (Shanghai Jiao Tong University et al.) hakkında

Kuruluş yılı 2024 · Shanghai, China

F5-TTS was released in October 2024 by the SWivid research collective, an open-source group anchored at Shanghai Jiao Tong University with contributors from the X-LANCE Lab, Microsoft Research Asia and the Chinese University of Hong Kong. Lead authors Yushen Chen, Zhikang Niu, Ziyang Ma, Keqi Deng, Haian Lin, Wendi He, Xiaofei Wang, Tomoki Toda, Kai Yu and Xie Chen released F5-TTS under MIT licence on GitHub together with model weights and a Hugging Face demo. The work followed the earlier E2-TTS (Microsoft) paper and quickly became one of the most popular open-weights TTS models of 2024-2025, frequently cited as the best fully open alternative to ElevenLabs for English and Chinese voice cloning.

SWivid (Shanghai Jiao Tong University et al.) ziyaret edin

Mimari

Flow-matching non-autoregressive TTS with Diffusion Transformer (DiT)

F5-TTS (Fairy-tale Fast Flow Matching TTS) is a non-autoregressive text-to-speech system that replaces the encoder-decoder pipeline with a single Diffusion Transformer trained with conditional flow matching. Text is first converted to character tokens and zero-padded to the target mel-spectrogram length, then concatenated with a noisy mel reference for the target voice. A DiT backbone with ConvNeXt v2 blocks predicts the velocity field that maps Gaussian noise to a clean mel-spectrogram, which is then converted to a waveform via Vocos vocoder. Training data is the 100k-hour open Emilia dataset (multilingual long-form audio scraped from podcasts and audiobooks). Because there is no autoregressive decoder, F5-TTS achieves real-time factor below 0.2 on a single A10 GPU while keeping competitive WER with VALL-E and NaturalSpeech 3. The model is famous for very high-quality zero-shot voice cloning from a single 5-15 second reference clip.

Parametreler
~330M (Base) and ~1.4B (Large)
Bağlam
30 token

Yetenekler

  • Zero-shot voice cloning from ~10 s of reference audio with no fine-tuning
  • Non-autoregressive flow matching with real-time-factor < 0.2 on a single GPU
  • Open weights under MIT licence, multiple checkpoints (Base, Small, Multilingual)
  • English and Chinese out of the box; community fine-tunes for German, French, Japanese, Spanish
  • Up to 30 s of generated audio per inference
  • Speed control by adjusting the duration prompt
  • Best for: research, on-device TTS, voice cloning prototypes, commercial products built on open weights

Eğitim ve lisans

Pretrained on the 100,000-hour open Emilia dataset of multilingual long-form audio with weakly supervised transcripts. Additional community fine-tunes use LibriSpeech, AISHELL-3 and bespoke audiobook collections.

Lisans: Code and weights under MIT licence; commercial use permitted.

Güvenlik testleri: No formal red-team report. Authors publish a model card recommending consent for voice cloning and a model-output watermark, which is optional.

Bilinen sınırlamalar

  • No formal SSML / emotion tags
  • Quality degrades on noisy reference audio
  • Multilingual coverage outside English/Chinese depends on community checkpoints
  • 30-second hard cap per generation
  • Voice cloning quality slightly below ElevenLabs Multilingual V2 on emotional acting
05

Fiyatlandırma

Şu anda kullanılamıyor: bu model devre dışı bırakılmıştır. Bu modelin şu anda bir fiyatı yok, bu nedenle çalıştırılamıyor.

06

API

F5-TTS öğesini Railwail API anahtarınızla çağırın. İstekte bu model kimliğini kullanın:

Doğrulanmış API örneği yok

Genel API, bu modelin ihtiyaç duyduğundan farklı bir giriş biçimi iletir. Yukarıdaki oyun alanını kullanın.

07

Özellikler

Model Kimliği
f5-tts
Geliştirici
X-LANCE (SJTU)
Giriş
Metin
Çıkış
Ses
Model boyutu
~330M (Base) and ~1.4B (Large)
Lisans
Code and weights under MIT licence; commercial use permitted.
Katalog girişi güncellendi
23 Eylül 2026

Giriş Parametreleri

Modelin giriş şemasından giriş ve ayarlar. API bölümündeki örnek, API'nin hangilerini kabul ettiğini gösterir.

  • audiogerekli

    Reference clip to clone; requires consent

    Tür: –
    Varsayılan: –
    İzin verilen değerler: –
  • gen_textgerekli

    Text to speak in the cloned voice

    Tür: Metin
    Varsayılan: –
    İzin verilen değerler: en fazla 4.000 karakter
  • speed
    Tür: Sayı
    Varsayılan: 1
    İzin verilen değerler: 0,1 ile 3 arasında
  • ref_text

    Transcript of the reference clip (improves quality)

    Tür: Metin
    Varsayılan: –
    İzin verilen değerler: –
  • remove_silence
    Tür: Evet/Hayır
    Varsayılan: true
    İzin verilen değerler: –

Etiketler

  • f5
  • tts
  • open-weights
  • voice-cloning
  • research
  • pricing-tbd
08

Kullanım Alanları

Nerelerde Kullanılır

  • Open-weights voice cloning research
  • On-device TTS for desktop and edge
  • Indie game and audiobook narration
  • Custom commercial products built on open weights
  • Academic benchmarks for flow-matching TTS
09

Sık Sorulan Sorular

F5-TTS nedir?

F5-TTS, X-LANCE (SJTU) tarafından Metin-Konuşma (TTS) kategorisinde oluşturulan bir modeldir. Railwail'de listelenmiştir ancak şu anda çalıştırılamaz.

F5-TTS Railwail'de ne kadar maliyetlidir?

F5-TTS şu anda Railwail'de çalıştırılamaz, bu nedenle mevcut bir fiyat yoktur. Fiyatları olan mevcut alternatifler bu sayfanın aşağısında listelenmiştir.

F5-TTS hangi ayarları destekler?

Giriş şemasına göre F5-TTS şu parametreleri bilir: audio, gen_text (en fazla 4.000 karakter), speed (0,1 ile 3 arasında), ref_text ve remove_silence.

F5-TTS ne kadar hızlıdır?

Railwail'de F5-TTS için henüz çalıştırma süresi belirtmek için yeterli ölçülen çalıştırma yoktur. Bu, giriş, ayarlar ve sağlayıcıdaki yüke bağlıdır.

F5-TTS, AudioLDM 2'dan daha iyi midir?

Bu göreve bağlıdır. F5-TTS (X-LANCE (SJTU)) ve AudioLDM 2 (Haohe Liu) her ikisi de Metin-Konuşma (TTS) kategorisinde modellerdir. Karşılaştırma sayfası fiyatlarını ve özelliklerini yan yana gösterir.

F5-TTS ve AudioLDM 2'ı karşılaştır

F5-TTS'yi şu anda kullanabilir miyim?

Şu anda kullanılamıyor: bu model devre dışı bırakılmıştır. Sayfa çevrimiçi kalır; aynı kategoriden mevcut alternatifler aşağıda listelenmiştir.

Tüm Modeller Tek Bir API Aracılığıyla

Railwail'deki her model için bir API anahtarı. Kullanım, ön ödemeli kredilerden tahsil edilir, 1 kredi = $0,01.