Whisper Diarization

Reconnaissance vocaleDisponible
par CommunityID du modèle: whisper-diarization

Whisper Large v3 Turbo combined with pyannote 4.0 for speaker diarization, returning who-said-what segments with timestamps. Built by Thomas Mol. Returns a clean JSON of speaker-labeled segments, handy for meeting notes, interviews, and podcasts.

Prix
≈ 0,0063 $US/exécution
Entrée → Sortie
Audio → Texte
Développeur
Community
Mis à jour
23 septembre 2026
01

Playground

Essayer Whisper Diarization

Entrée et résultat

≈ 0,0063 $US/exécution
Essayer Whisper Diarization

0 / 1 000

URL of the audio file to transcribe and diarize

Paramètres avancés (2)

Optional fixed speaker count; estimated if omitted

Résultat
La transcription apparaît ici.

Cette exécution

environ 0,0063 $US · 0,63 crédits

0,0188 $US (1,88 crédits) sont réservés au démarrage ; le temps GPU réel est facturé.

Nouveau par ici ?

10 crédits gratuits (0,10 $US) à l'inscription avec Google

Utilisable 24 heures après l'inscription, jusqu'à 5 exécutions par jour et au maximum 2 crédits par exécution. Les autres méthodes de connexion commencent sans crédits. Suffisant pour 5 exécutions de ce modèle.

02

Examples

Real outputs from the public examples of this model on Replicate, with the prompt and settings that produced them. They were not generated live on this page.
  • Prompt

    LLama, AI, Meta.

    Output (JSON, shortened)

    {
      "language": "en",
      "segments": [
        {
          "end": 4.48,
          "text": "Let me ask you about AI.",
          "start": 2.94,
          "words": [
            {
              "end": 3.12,
              "word": "Let",
              "start": 2.94,
              "speaker": "SPEAKER_01",
              "probability": 0.685546875
            },
            {
              "end": 3.26,
              "word": "me",
              "start": 3.12,
              "speaker": "SPEAKER_01",
              "probability": 0.9990234375
            },
            {
              "end": 3.74,
              "word": "ask",
              "start": 3.26,
              "speaker": "SPEAKER_01",
              "probability": 0.998046875
            },
            {
              "end": 3.86,
              "word": "you",
              "start": 3.74,
              "speaker": "SPEAKER_01",
              "probability": 0.9921875
            },
            {
              "end": 4.1,
              "word": "about",
              "start": 3.86,
              "speaker": "SPEAKER_01",
              "probability": 0.9990234375
            },
            {
              "end": 4.48,
              "word": "AI.",
              "start": 4.1,
              "speaker": "SPEAKER_01",
              "probability": 0.966796875
            }
          ],
          "speaker": "SPEAKER_01",
          "duration": 1.5400000000000005,
          "avg_logprob": -0.17070312313735486
        },
        {
          "end": 11.66,
          "text": "It seems like this year for the entirety of the human civilization is an interesting year for the development of artificial intelligence.",
          "start": 4.72,
          "words": [
            {…

    Settings

    language
    en
03

À propos de Whisper Diarization

RésuméAu 23 septembre 2026

Whisper Diarization est un modèle de Community dans la catégorie Reconnaissance vocale. Sur Railwail, Whisper Diarization coûte ≈ 0,0063 $US par exécution.

04

Tarification

Prix en dollars américains. L'utilisation est facturée à partir de crédits prépayés.
Exécution typique (≈ 5 s sur L40S)0,0063 $US par exécution
Temps GPU (L40S)0,00117 $US par seconde GPU
  • Facturée selon le temps GPU que l'exécution prend réellement. Au démarrage, 3× le prix typique est réservé de votre solde et régularisé ensuite.
  • 1 crédit = 0,01 $US

Calculatrice de coûts

Calculatrice de prix

s

Typique selon le fournisseur : environ 5,3 s

Total

0,63 $US

63 crédits

Par exécution

0,0063 $US · 0,63 crédits

Facturé selon le temps GPU réel ; ceci est une estimation.

05

API

Appelez Whisper Diarization avec votre clé API Railwail. Utilisez cet ID de modèle dans la requête :

Aucun exemple API vérifié

L'API publique transmet un format d'entrée différent de celui dont ce modèle a besoin. Utilisez le playground ci-dessus.

06

Spécifications

ID du modèle
whisper-diarization
Développeur
Community
Entrée
Audio
Sortie
Texte
Facturation
À l'usage (tokens ou temps GPU)
Entrée du catalogue mise à jour
23 septembre 2026

Paramètres d'entrée

Entrées et paramètres du schéma d'entrée du modèle. L'exemple dans la section API montre lesquels l'API accepte.

  • file_urlObligatoire

    URL of the audio file to transcribe and diarize

    Type: Texte
    Par défaut: –
    Valeurs autorisées: –
  • prompt

    Optional vocabulary or context hint

    Type: Texte
    Par défaut: –
    Valeurs autorisées: Jusqu'à 1 000 caractères
  • language

    Optional ISO-639-1 language code; auto-detected if omitted

    Type: Texte
    Par défaut: –
    Valeurs autorisées: –
  • translate
    Type: Oui/Non
    Par défaut: false
    Valeurs autorisées: –
  • num_speakers

    Optional fixed speaker count; estimated if omitted

    Type: Nombre entier
    Par défaut: –
    Valeurs autorisées: 1 à 50

Étiquettes

  • replicate
  • whisper
  • stt
  • transcription
  • diarization
  • speaker-labels
  • multilingual
07

Cas d'usage

08

Questions fréquemment posées

Qu'est-ce que Whisper Diarization ?

Whisper Diarization est un modèle de Community dans la catégorie Reconnaissance vocale.

Combien coûte Whisper Diarization sur Railwail ?

Sur Railwail, Whisper Diarization coûte ≈ 0,0063 $US par exécution. Vous êtes facturé pour ce que chaque requête utilise réellement. L'utilisation est payée à partir de crédits prépayés ; 1 crédit équivaut à 0,01 $US.

Quels paramètres Whisper Diarization supporte-t-il ?

Selon son schéma d'entrée, Whisper Diarization connaît ces paramètres : file_url, prompt (Jusqu'à 1 000 caractères), language, translate et num_speakers (1 à 50).

Quelle est la vitesse de Whisper Diarization ?

Il n'y a pas encore assez d'exécutions mesurées de Whisper Diarization sur Railwail pour indiquer un temps d'exécution. Cela dépend de l'entrée, des paramètres et de la charge chez le fournisseur.

Whisper Diarization est-il meilleur que Incredibly Fast Whisper ?

Cela dépend de la tâche. Whisper Diarization (Community) et Incredibly Fast Whisper (Community) sont tous deux des modèles de la catégorie Reconnaissance vocale. La page de comparaison affiche leurs prix et spécifications côte à côte.

Comparer Whisper Diarization et Incredibly Fast Whisper
09

Modèles comparables

Tous dans cette catégorie
  • Whisper Large v3 wrapped with Hugging Face Transformers optimizations (batched inference, flash attention) for very high throughput. Transcribes hours of audio in minutes on a single GPU. Maintained by Vaibhav Srivastav. Good when you need bulk transcription fast.

    ≈ 0,0056 $US/exécution

    11 % moins cher par unité

    Comparer Whisper Diarization et Incredibly Fast Whisper
  • WhisperOpenAI

    OpenAI's Whisper running on Replicate. General-purpose speech recognition trained on 680k hours of multilingual audio. Transcribes and translates 99 languages, robust to accents and background noise, and outputs plain text, segments, or word-level timestamps.

    ≈ 0,0034 $US/exécution

    46 % moins cher par unité

    Comparer Whisper Diarization et Whisper
  • SeamlessM4TCommunity

    Meta's SeamlessM4T multimodal translation model. Takes speech or text input and produces transcription or translation across about 100 languages, including speech-to-text and speech-to-speech. One model covers ASR plus cross-lingual translation without chaining separate systems.

    ≈ 0,156 $US/exécution

    2 376 % plus cher par unité

    Comparer Whisper Diarization et SeamlessM4T

Tous les modèles via une API

Une clé API pour tous les modèles sur Railwail. L'utilisation est facturée à partir de crédits prépayés, 1 crédit = 0,01 $US.