F5-TTS

Синтез мовлення (TTS)Недоступно
від X-LANCE (SJTU)ID моделі: f5-tts

Open-source flow-matching TTS with strong zero-shot voice cloning. Code MIT, weights CC-BY-NC.

Статус
Недоступно
Вхід → вихід
Текст → Аудіо
Розробник
X-LANCE (SJTU)
Оновлено
23 вересня 2026 р.

F5-TTS наразі недоступна

Наразі недоступно: цю модель деактивовано.

Ви можете прочитати деталі на цій сторінці. Виберіть одну з доступних альтернатив нижче, щоб одразу запустити порівняну модель.

До альтернатив
01

Порівнювані моделі

Усі в цій категорії
  • AudioLDM 2Haohe Liu

    Latent-diffusion model for general-purpose text-to-audio. Generates speech, music, and sound effects with a unified prior.

    ≈ 0,0157 USD/запуск

  • Kokoro TTS 82MCommunity

    Open-weights 82M-parameter TTS. Punches above its size class on naturalness benchmarks at a fraction of the inference cost of larger models.

    ≈ 0,00030 USD/запуск

  • OpenVoice v2Community

    MyShell OpenVoice v2. Multilingual zero-shot voice cloning with accurate tone-color reproduction and style/emotion control.

    ≈ 0,0673 USD/запуск

02

Playground

Спробувати F5-TTS

Введення та результат

Наразі недоступна

Наразі недоступно: цю модель деактивовано.

Playground вимкнено. Порівняльні моделі ви знайдете в тій же категорії: Переглянути альтернативи

Спробувати F5-TTS

0 / 4 000

Text to speak in the cloned voice

Voice sample *Record up to 30 s · file up to 60 s, 10 MB

10 to 30 seconds of clear speech, one speaker, no music or background noise.

Розширені налаштування (3)

Transcript of the reference clip (improves quality)

Результат
Згенероване мовлення з'явиться тут.

Цей запуск

Без ціни – наразі недоступно.

Новенький?

10 безплатних кредитів (0,10 USD) при реєстрації через Google

Доступно 24 годин після реєстрації, до 5 запусків на день і максимум 2 кредитів за запуск. Інші способи входу стартують без кредитів.

03

Examples

Real outputs from the public examples of this model on Replicate, with the prompt and settings that produced them. They were not generated live on this page.
04

Про F5-TTS

КороткоСтаном на 23 вересня 2026 р.

F5-TTS — це модель від X-LANCE (SJTU) у категорії Синтез мовлення (TTS). На Railwail F5-TTS наразі недоступна.

Фон

Про SWivid (Shanghai Jiao Tong University et al.)

Засновано 2024 · Shanghai, China

F5-TTS was released in October 2024 by the SWivid research collective, an open-source group anchored at Shanghai Jiao Tong University with contributors from the X-LANCE Lab, Microsoft Research Asia and the Chinese University of Hong Kong. Lead authors Yushen Chen, Zhikang Niu, Ziyang Ma, Keqi Deng, Haian Lin, Wendi He, Xiaofei Wang, Tomoki Toda, Kai Yu and Xie Chen released F5-TTS under MIT licence on GitHub together with model weights and a Hugging Face demo. The work followed the earlier E2-TTS (Microsoft) paper and quickly became one of the most popular open-weights TTS models of 2024-2025, frequently cited as the best fully open alternative to ElevenLabs for English and Chinese voice cloning.

Відвідати SWivid (Shanghai Jiao Tong University et al.)

Архітектура

Flow-matching non-autoregressive TTS with Diffusion Transformer (DiT)

F5-TTS (Fairy-tale Fast Flow Matching TTS) is a non-autoregressive text-to-speech system that replaces the encoder-decoder pipeline with a single Diffusion Transformer trained with conditional flow matching. Text is first converted to character tokens and zero-padded to the target mel-spectrogram length, then concatenated with a noisy mel reference for the target voice. A DiT backbone with ConvNeXt v2 blocks predicts the velocity field that maps Gaussian noise to a clean mel-spectrogram, which is then converted to a waveform via Vocos vocoder. Training data is the 100k-hour open Emilia dataset (multilingual long-form audio scraped from podcasts and audiobooks). Because there is no autoregressive decoder, F5-TTS achieves real-time factor below 0.2 on a single A10 GPU while keeping competitive WER with VALL-E and NaturalSpeech 3. The model is famous for very high-quality zero-shot voice cloning from a single 5-15 second reference clip.

Параметри
~330M (Base) and ~1.4B (Large)
Контекст
30 токенів

Можливості

  • Zero-shot voice cloning from ~10 s of reference audio with no fine-tuning
  • Non-autoregressive flow matching with real-time-factor < 0.2 on a single GPU
  • Open weights under MIT licence, multiple checkpoints (Base, Small, Multilingual)
  • English and Chinese out of the box; community fine-tunes for German, French, Japanese, Spanish
  • Up to 30 s of generated audio per inference
  • Speed control by adjusting the duration prompt
  • Best for: research, on-device TTS, voice cloning prototypes, commercial products built on open weights

Навчання та ліцензія

Pretrained on the 100,000-hour open Emilia dataset of multilingual long-form audio with weakly supervised transcripts. Additional community fine-tunes use LibriSpeech, AISHELL-3 and bespoke audiobook collections.

Ліцензія: Code and weights under MIT licence; commercial use permitted.

Тестування безпеки: No formal red-team report. Authors publish a model card recommending consent for voice cloning and a model-output watermark, which is optional.

Відомі обмеження

  • No formal SSML / emotion tags
  • Quality degrades on noisy reference audio
  • Multilingual coverage outside English/Chinese depends on community checkpoints
  • 30-second hard cap per generation
  • Voice cloning quality slightly below ElevenLabs Multilingual V2 on emotional acting
05

Ціни

Наразі недоступно: цю модель деактивовано. Наразі для цієї моделі немає ціни, тому її не можна запустити.

06

API

Викличте F5-TTS за допомогою вашого API-ключа Railwail. Використовуйте цей ID моделі в запиті:

Немає перевіреного прикладу API

Публічний API передає інший формат введення, ніж потребує ця модель. Використовуйте playground вище.

07

Характеристики

ID моделі
f5-tts
Розробник
X-LANCE (SJTU)
Вхідні дані
Текст
Вихідні дані
Аудіо
Розмір моделі
~330M (Base) and ~1.4B (Large)
Ліцензія
Code and weights under MIT licence; commercial use permitted.
Запис у каталозі оновлено
23 вересня 2026 р.

Вхідні параметри

Вхідні дані та налаштування зі схеми вхідних даних моделі. Приклад у розділі API показує, які з них приймає API.

  • audioобов'язково

    Reference clip to clone; requires consent

    Тип: –
    За замовчуванням: –
    Допустимі значення: –
  • gen_textобов'язково

    Text to speak in the cloned voice

    Тип: Текст
    За замовчуванням: –
    Допустимі значення: до 4 000 символів
  • speed
    Тип: Число
    За замовчуванням: 1
    Допустимі значення: 0,1 до 3
  • ref_text

    Transcript of the reference clip (improves quality)

    Тип: Текст
    За замовчуванням: –
    Допустимі значення: –
  • remove_silence
    Тип: Так/Ні
    За замовчуванням: true
    Допустимі значення: –

Теги

  • f5
  • tts
  • open-weights
  • voice-cloning
  • research
  • pricing-tbd
08

Варіанти використання

Для чого це використовується

  • Open-weights voice cloning research
  • On-device TTS for desktop and edge
  • Indie game and audiobook narration
  • Custom commercial products built on open weights
  • Academic benchmarks for flow-matching TTS
09

Часті питання

Що таке F5-TTS?

F5-TTS — це модель від X-LANCE (SJTU) у категорії Синтез мовлення (TTS). Вона внесена до каталогу Railwail, але наразі не може бути запущена.

Скільки коштує F5-TTS на Railwail?

F5-TTS наразі не можна запустити на Railwail, тому поточної ціни немає. Доступні альтернативи з цінами наведені далі на цій сторінці.

Які налаштування підтримує F5-TTS?

Згідно зі схемою введення, F5-TTS знає такі параметри: audio, gen_text (до 4 000 символів), speed (0,1 до 3), ref_text і remove_silence.

Наскільки швидкий F5-TTS?

На Railwail поки що недостатньо виміряних запусків F5-TTS, щоб вказати час виконання. Це залежить від введення, налаштувань та навантаження у постачальника.

Чи F5-TTS краще за AudioLDM 2?

Це залежить від завдання. F5-TTS (X-LANCE (SJTU)) і AudioLDM 2 (Haohe Liu) — обидві моделі в категорії Синтез мовлення (TTS). На сторінці порівняння показані їхні ціни та специфікації поруч.

Порівняти F5-TTS і AudioLDM 2

Чи можу я використовувати F5-TTS прямо зараз?

Наразі недоступно: цю модель деактивовано. Сторінка залишається в мережі; доступні альтернативи з тієї ж категорії наведені далі.

Усі моделі через один API

Один API-ключ для всіх моделей на Railwail. Використання оплачується з попередньо поповнених кредитів, 1 кредит = 0,01 USD.