WhisperX

Reconocimiento de vozDisponible
de CommunityID del modelo: whisperx

WhisperX (Large v3) with forced alignment for accurate word-level timestamps plus optional speaker diarization. Uses VAD to cut long files into segments and a wav2vec2 aligner to pin each word to its exact time. Useful for subtitles and per-speaker transcripts.

Precio
≈ USD 0.0241/ejecución
Entrada → Salida
Audio → Texto
Desarrollador
Community
Actualizado
23 de septiembre de 2026
01

Playground

Probar WhisperX

Entrada y salida

≈ USD 0.0241/ejecución
Probar WhisperX

URL or upload of the audio file to transcribe

Configuración avanzada (3)
Resultado
La transcripción aparece aquí.

Esta ejecución

aprox. USD 0.0241 · 2.41 créditos

Se reservan USD 0.0721 (7.21 créditos) al inicio; se factura el tiempo real de GPU.

Para cuentas sin compra previa: las ejecuciones superiores a 2 créditos requieren una recarga.

¿Nuevo aquí?

10 créditos gratis (USD 0.10) cuando te registras con Google

Utilizable 24 horas después del registro, hasta 5 ejecuciones por día y como máximo 2 créditos por ejecución. Otros métodos de inicio de sesión comienzan sin créditos.

02

Examples

Real outputs from the public examples of this model on Replicate, with the prompt and settings that produced them. They were not generated live on this page.
  • Output (JSON, shortened)

    {
      "segments": [
        {
          "end": 30.811,
          "text": "The little tales they tell are false. The door was barred, locked and bolted as well. Ripe pears are fit for a queen's table. A big wet stain was on the round carpet. The kite dipped and swayed but stayed aloft. The pleasant hours fly by much too soon. The room was crowded with a mild wob.",
          "start": 2.585
        },
        {
          "end": 48.592,
          "text": "The room was crowded with a wild mob. This strong arm shall shield your honor. She blushed when he gave her a white orchid. The beetle droned in the hot June sun.",
          "start": 33.029
        }
      ],
      "detected_language": "en"
    }
03

Acerca de WhisperX

ResumenA partir de 23 de septiembre de 2026

WhisperX es un modelo de Community en la categoría Reconocimiento de voz. En Railwail, WhisperX cuesta ≈ USD 0.0241 por ejecución.

04

Precios

Precios en dólares estadounidenses. El uso se cobra con créditos prepagados.
Ejecución típica (≈ 14 s en A100 (80GB))USD 0.0241 por ejecución
Tiempo de GPU (A100 (80GB))USD 0.00168 por segundo de GPU
  • Se factura por el tiempo de GPU que realmente toma la ejecución. Cuando comienza la ejecución, se reserva 3× el precio típico de tu saldo y se liquida después.
  • 1 crédito = USD 0.01

Calculadora de costos

Calculadora de precios

s

Típico según el proveedor: aprox. 14.3 s

Total

USD 2.41

241 créditos

Por ejecución

USD 0.0241 · 2.41 créditos

Se factura el tiempo real de GPU; este es un estimado.

05

API

Llama a WhisperX con tu clave de API de Railwail. Usa este ID de modelo en la solicitud:

Sin ejemplo de API verificado

La API pública pasa un formato de entrada diferente al que necesita este modelo. Usa el playground anterior.

06

Especificaciones

ID del modelo
whisperx
Desarrollador
Community
Entrada
Audio
Salida
Texto
Facturación
Por uso (tokens o tiempo de GPU)
Entrada del catálogo actualizada
23 de septiembre de 2026

Parámetros de entrada

Entradas y configuraciones del esquema de entrada del modelo. El ejemplo en la sección API muestra cuáles de ellas acepta la API.

  • audio_filerequerido

    URL or upload of the audio file to transcribe

    Tipo: Texto
    Predeterminado: –
    Valores permitidos: –
  • language

    Optional ISO-639-1 language code; auto-detected if omitted

    Tipo: Texto
    Predeterminado: –
    Valores permitidos: –
  • batch_size
    Tipo: Número entero
    Predeterminado: 64
    Valores permitidos: 1 a 64
  • diarization
    Tipo: Sí/No
    Predeterminado: false
    Valores permitidos: –
  • align_output
    Tipo: Sí/No
    Predeterminado: true
    Valores permitidos: –

Etiquetas

  • replicate
  • whisperx
  • stt
  • transcription
  • diarization
  • word-timestamps
  • multilingual
07

Casos de uso

08

Preguntas frecuentes

¿Qué es WhisperX?

WhisperX es un modelo de Community en la categoría Reconocimiento de voz.

¿Cuánto cuesta WhisperX en Railwail?

En Railwail, WhisperX cuesta ≈ USD 0.0241 por ejecución. Se te cobra por lo que cada solicitud realmente usa. El uso se paga con créditos prepagados; 1 crédito equivale a USD 0.01.

¿Qué configuraciones admite WhisperX?

Según su esquema de entrada, WhisperX conoce estos parámetros: audio_file, language, batch_size (1 a 64), diarization y align_output.

¿Qué tan rápido es WhisperX?

Aún no hay suficientes ejecuciones medidas de WhisperX en Railwail para indicar un tiempo de ejecución. Depende de la entrada, la configuración y la carga en el proveedor.

¿Es WhisperX mejor que Incredibly Fast Whisper?

Eso depende de la tarea. WhisperX (Community) y Incredibly Fast Whisper (Community) son ambos modelos en la categoría Reconocimiento de voz. La página de comparación muestra sus precios y especificaciones lado a lado.

Comparar WhisperX y Incredibly Fast Whisper
09

Modelos comparables

Todos en esta categoría
  • Whisper Large v3 wrapped with Hugging Face Transformers optimizations (batched inference, flash attention) for very high throughput. Transcribes hours of audio in minutes on a single GPU. Maintained by Vaibhav Srivastav. Good when you need bulk transcription fast.

    ≈ USD 0.0056/ejecución

    77 % más barato por unidad

    Comparar WhisperX vs. Incredibly Fast Whisper
  • WhisperOpenAI

    OpenAI's Whisper running on Replicate. General-purpose speech recognition trained on 680k hours of multilingual audio. Transcribes and translates 99 languages, robust to accents and background noise, and outputs plain text, segments, or word-level timestamps.

    ≈ USD 0.0034/ejecución

    86 % más barato por unidad

    Comparar WhisperX vs. Whisper
  • SeamlessM4TCommunity

    Meta's SeamlessM4T multimodal translation model. Takes speech or text input and produces transcription or translation across about 100 languages, including speech-to-text and speech-to-speech. One model covers ASR plus cross-lingual translation without chaining separate systems.

    ≈ USD 0.156/ejecución

    547 % más caro por unidad

    Comparar WhisperX vs. SeamlessM4T

Todos los modelos a través de una API

Una clave API para todos los modelos en Railwail. El uso se cobra con créditos prepagados, 1 crédito = USD 0.01.