StyleTTS 2

Síntesis de vozDisponible
de CommunityID del modelo: styletts-2

Style-based TTS using diffusion and adversarial training. Human-level naturalness in zero-shot voice synthesis from a 3-5s reference clip.

Precio
≈ USD 0.00040/ejecución
Entrada → Salida
Texto → Audio
Desarrollador
Community
Actualizado
23 de septiembre de 2026
01

Playground

Probar StyleTTS 2

Sin formulario de entrada

≈ USD 0.00040/ejecución

Aún no hay formulario de entrada para este modelo

Sus entradas aún no están documentadas. Para evitar errores por entradas incorrectas, no ofrecemos un formulario aquí. Elige un modelo comparable en su lugar.

02

Examples

Real outputs from the public examples of this model on Replicate, with the prompt and settings that produced them. They were not generated live on this page.
  • Prompt

    StyleTTS 2 is a text-to-speech model that leverages style diffusion and adversarial training with large speech language models to achieve human-level text-to-speech synthesis.
  • Prompt

    If the supply of fruit is greater than the family needs, it may be made a source of income by sending the fresh fruit to the market if there is one near enough, or by preserving, canning, and making jelly for sale. To make such an enterprise a success the fruit and work must be first class. There is magic in the word 'Homemade,' when the product appeals to the eye and the palate; but many careless and incompetent people have found to their sorrow that this word has not magic enough to float inferior goods on the market. As a rule large canning and preserving establishments are clean and have the best appliances, and they employ chemists and skilled labor. The home product must be very good to compete with the attractive goods that are sent out from such establishments. Yet for first-class homemade products there is a market in all large cities. All first-class grocers have customers who purchase such goods.
03

Acerca de StyleTTS 2

ResumenA partir de 23 de septiembre de 2026

StyleTTS 2 es un modelo de Community en la categoría Síntesis de voz. En Railwail, StyleTTS 2 cuesta ≈ USD 0.00040 por ejecución.

04

Precios

Precios en dólares estadounidenses. El uso se cobra con créditos prepagados.
Ejecución típica (≈ 1 s en T4)USD 0.00040 por ejecución
Tiempo de GPU (T4)USD 0.00027 por segundo de GPU
  • Se factura por el tiempo de GPU que realmente toma la ejecución. Cuando comienza la ejecución, se reserva 3× el precio típico de tu saldo y se liquida después.
  • 1 crédito = USD 0.01

Calculadora de costos

Calculadora de precios

s

Típico según el proveedor: aprox. 1.4 s

Total

USD 0.04

4 créditos

Por ejecución

USD 0.0004 · 0.04 créditos

Se factura el tiempo real de GPU; este es un estimado.

05

API

Llama a StyleTTS 2 con tu clave de API de Railwail. Usa este ID de modelo en la solicitud:

Sin ejemplo de API verificado

Las entradas de este modelo aún no están documentadas.

06

Especificaciones

ID del modelo
styletts-2
Desarrollador
Community
Entrada
Texto
Salida
Audio
Facturación
Por uso (tokens o tiempo de GPU)
Entrada del catálogo actualizada
23 de septiembre de 2026

Etiquetas

  • styletts
  • tts
  • voice-cloning
  • diffusion
  • open-source
07

Casos de uso

08

Preguntas frecuentes

¿Qué es StyleTTS 2?

StyleTTS 2 es un modelo de Community en la categoría Síntesis de voz.

¿Cuánto cuesta StyleTTS 2 en Railwail?

En Railwail, StyleTTS 2 cuesta ≈ USD 0.00040 por ejecución. Se te cobra por lo que cada solicitud realmente usa. El uso se paga con créditos prepagados; 1 crédito equivale a USD 0.01.

¿Qué tan rápido es StyleTTS 2?

Aún no hay suficientes ejecuciones medidas de StyleTTS 2 en Railwail para indicar un tiempo de ejecución. Depende de la entrada, la configuración y la carga en el proveedor.

¿Es StyleTTS 2 mejor que AudioLDM 2?

Eso depende de la tarea. StyleTTS 2 (Community) y AudioLDM 2 (Haohe Liu) son ambos modelos en la categoría Síntesis de voz. La página de comparación muestra sus precios y especificaciones lado a lado.

Comparar StyleTTS 2 y AudioLDM 2
09

Modelos comparables

Todos en esta categoría
  • AudioLDM 2Haohe Liu

    Latent-diffusion model for general-purpose text-to-audio. Generates speech, music, and sound effects with a unified prior.

    ≈ USD 0.0157/ejecución

    3,825 % más caro por unidad

    Comparar StyleTTS 2 vs. AudioLDM 2
  • Kokoro TTS 82MCommunity

    Open-weights 82M-parameter TTS. Punches above its size class on naturalness benchmarks at a fraction of the inference cost of larger models.

    ≈ USD 0.00030/ejecución

    25 % más barato por unidad

    Comparar StyleTTS 2 vs. Kokoro TTS 82M
  • OpenVoice v2Community

    MyShell OpenVoice v2. Multilingual zero-shot voice cloning with accurate tone-color reproduction and style/emotion control.

    ≈ USD 0.0673/ejecución

    16,725 % más caro por unidad

    Comparar StyleTTS 2 vs. OpenVoice v2

Todos los modelos a través de una API

Una clave API para todos los modelos en Railwail. El uso se cobra con créditos prepagados, 1 crédito = USD 0.01.