WhisperX

Reconnaissance vocaleDisponible
par CommunityID du modèle: whisperx

WhisperX (Large v3) with forced alignment for accurate word-level timestamps plus optional speaker diarization. Uses VAD to cut long files into segments and a wav2vec2 aligner to pin each word to its exact time. Useful for subtitles and per-speaker transcripts.

Prix
≈ 0,0241 $US/exécution
Entrée → Sortie
Audio → Texte
Développeur
Community
Mis à jour
23 septembre 2026
01

Playground

Essayer WhisperX

Entrée et résultat

≈ 0,0241 $US/exécution
Essayer WhisperX

URL or upload of the audio file to transcribe

Paramètres avancés (3)
Résultat
La transcription apparaît ici.

Cette exécution

environ 0,0241 $US · 2,41 crédits

0,0721 $US (7,21 crédits) sont réservés au démarrage ; le temps GPU réel est facturé.

Pour les comptes sans achat antérieur : les exécutions au-delà de 2 crédits nécessitent un rechargement.

Nouveau par ici ?

10 crédits gratuits (0,10 $US) lors de l'inscription avec Google

Utilisable 24 heures après l'inscription, jusqu'à 5 exécutions par jour et au maximum 2 crédits par exécution. Les autres méthodes de connexion commencent sans crédits.

02

Examples

Real outputs from the public examples of this model on Replicate, with the prompt and settings that produced them. They were not generated live on this page.
  • Output (JSON, shortened)

    {
      "segments": [
        {
          "end": 30.811,
          "text": "The little tales they tell are false. The door was barred, locked and bolted as well. Ripe pears are fit for a queen's table. A big wet stain was on the round carpet. The kite dipped and swayed but stayed aloft. The pleasant hours fly by much too soon. The room was crowded with a mild wob.",
          "start": 2.585
        },
        {
          "end": 48.592,
          "text": "The room was crowded with a wild mob. This strong arm shall shield your honor. She blushed when he gave her a white orchid. The beetle droned in the hot June sun.",
          "start": 33.029
        }
      ],
      "detected_language": "en"
    }
03

À propos de WhisperX

RésuméAu 23 septembre 2026

WhisperX est un modèle de Community dans la catégorie Reconnaissance vocale. Sur Railwail, WhisperX coûte ≈ 0,0241 $US par exécution.

04

Tarification

Prix en dollars US. L'utilisation est facturée à partir de crédits prépayés.
Exécution typique (≈ 14 s sur A100 (80GB))0,0241 $US par exécution
Temps GPU (A100 (80GB))0,00168 $US par seconde GPU
  • Facturé selon le temps GPU réellement utilisé. Au démarrage, 3× le prix typique est réservé sur votre solde et régularisé ensuite.
  • 1 crédit = 0,01 $US

Calculateur de coûts

Calculateur de prix

s

Typique selon le fournisseur : environ 14,3 s

Total

2,41 $US

241 crédits

Par exécution

0,0241 $US · 2,41 crédits

Facturé selon le temps GPU réel ; ceci est une estimation.

05

API

Appelez WhisperX avec votre clé API Railwail. Utilisez cet ID de modèle dans la requête :

Aucun exemple API vérifié

L'API publique transmet un format d'entrée différent de celui dont ce modèle a besoin. Utilisez le playground ci-dessus.

06

Spécifications

ID du modèle
whisperx
Développeur
Community
Entrée
Audio
Sortie
Texte
Facturation
À l'usage (tokens ou temps GPU)
Entrée du catalogue mise à jour
23 septembre 2026

Paramètres d'entrée

Entrées et paramètres du schéma d'entrée du modèle. L'exemple dans la section API montre lesquels l'API accepte.

  • audio_fileObligatoire

    URL or upload of the audio file to transcribe

    Type: Texte
    Défaut: –
    Valeurs autorisées: –
  • language

    Optional ISO-639-1 language code; auto-detected if omitted

    Type: Texte
    Défaut: –
    Valeurs autorisées: –
  • batch_size
    Type: Nombre entier
    Défaut: 64
    Valeurs autorisées: 1 à 64
  • diarization
    Type: Oui/Non
    Défaut: false
    Valeurs autorisées: –
  • align_output
    Type: Oui/Non
    Défaut: true
    Valeurs autorisées: –

Étiquettes

  • replicate
  • whisperx
  • stt
  • transcription
  • diarization
  • word-timestamps
  • multilingual
07

Cas d'usage

08

Questions fréquemment posées

Qu'est-ce que WhisperX ?

WhisperX est un modèle de Community dans la catégorie Reconnaissance vocale.

Combien coûte WhisperX sur Railwail ?

Sur Railwail, WhisperX coûte ≈ 0,0241 $US par exécution. Vous êtes facturé pour ce que chaque requête utilise réellement. L'utilisation est payée à partir de crédits prépayés ; 1 crédit équivaut à 0,01 $US.

Quels paramètres WhisperX supporte-t-il ?

Selon son schéma d'entrée, WhisperX connaît ces paramètres : audio_file, language, batch_size (1 à 64), diarization et align_output.

Quelle est la vitesse de WhisperX ?

Il n'y a pas encore assez d'exécutions mesurées de WhisperX sur Railwail pour indiquer un temps d'exécution. Cela dépend de l'entrée, des paramètres et de la charge chez le fournisseur.

WhisperX est-il meilleur que Incredibly Fast Whisper ?

Cela dépend de la tâche. WhisperX (Community) et Incredibly Fast Whisper (Community) sont tous deux des modèles de la catégorie Reconnaissance vocale. La page de comparaison affiche leurs prix et spécifications côte à côte.

Comparer WhisperX et Incredibly Fast Whisper
09

Modèles comparables

Tous dans cette catégorie
  • Whisper Large v3 wrapped with Hugging Face Transformers optimizations (batched inference, flash attention) for very high throughput. Transcribes hours of audio in minutes on a single GPU. Maintained by Vaibhav Srivastav. Good when you need bulk transcription fast.

    ≈ 0,0056 $US/exécution

    77 % moins cher par unité

    Comparer WhisperX et Incredibly Fast Whisper
  • WhisperOpenAI

    OpenAI's Whisper running on Replicate. General-purpose speech recognition trained on 680k hours of multilingual audio. Transcribes and translates 99 languages, robust to accents and background noise, and outputs plain text, segments, or word-level timestamps.

    ≈ 0,0034 $US/exécution

    86 % moins cher par unité

    Comparer WhisperX et Whisper
  • SeamlessM4TCommunity

    Meta's SeamlessM4T multimodal translation model. Takes speech or text input and produces transcription or translation across about 100 languages, including speech-to-text and speech-to-speech. One model covers ASR plus cross-lingual translation without chaining separate systems.

    ≈ 0,156 $US/exécution

    547 % plus cher par unité

    Comparer WhisperX et SeamlessM4T

Tous les modèles via une seule API

Une clé API pour tous les modèles sur Railwail. L'utilisation est facturée à partir de crédits prépayés, 1 crédit = 0,01 $US.