Whisper Diarization

Taligenkänning (STT)Tillgänglig
av CommunityModell-ID: whisper-diarization

Whisper Large v3 Turbo combined with pyannote 4.0 for speaker diarization, returning who-said-what segments with timestamps. Built by Thomas Mol. Returns a clean JSON of speaker-labeled segments, handy for meeting notes, interviews, and podcasts.

Pris
≈ 0,0063 US$/körning
Inmatning → utmatning
Audio → Text
Utvecklare
Community
Uppdaterad
23 september 2026
01

Playground

Prova Whisper Diarization

Inmatning & resultat

≈ 0,0063 US$/körning
Prova Whisper Diarization

0 / 1 000

URL of the audio file to transcribe and diarize

Avancerade inställningar (2)

Optional fixed speaker count; estimated if omitted

Resultat
Transkriptet visas här.

Denna körning

ca. 0,0063 US$ · 0,63 credits

0,0188 US$ (1,88 credits) reserveras vid start; den faktiska GPU-tiden faktureras.

Ny här?

10 gratis credits (0,10 US$) när du registrerar dig med Google

Användbar 24 timmar efter registrering, upp till 5 körningar per dag och högst 2 credits per körning. Andra inloggningsmetoder startar utan credits. Räcker för 5 körningar av denna modell.

02

Examples

Real outputs from the public examples of this model on Replicate, with the prompt and settings that produced them. They were not generated live on this page.
  • Prompt

    LLama, AI, Meta.

    Output (JSON, shortened)

    {
      "language": "en",
      "segments": [
        {
          "end": 4.48,
          "text": "Let me ask you about AI.",
          "start": 2.94,
          "words": [
            {
              "end": 3.12,
              "word": "Let",
              "start": 2.94,
              "speaker": "SPEAKER_01",
              "probability": 0.685546875
            },
            {
              "end": 3.26,
              "word": "me",
              "start": 3.12,
              "speaker": "SPEAKER_01",
              "probability": 0.9990234375
            },
            {
              "end": 3.74,
              "word": "ask",
              "start": 3.26,
              "speaker": "SPEAKER_01",
              "probability": 0.998046875
            },
            {
              "end": 3.86,
              "word": "you",
              "start": 3.74,
              "speaker": "SPEAKER_01",
              "probability": 0.9921875
            },
            {
              "end": 4.1,
              "word": "about",
              "start": 3.86,
              "speaker": "SPEAKER_01",
              "probability": 0.9990234375
            },
            {
              "end": 4.48,
              "word": "AI.",
              "start": 4.1,
              "speaker": "SPEAKER_01",
              "probability": 0.966796875
            }
          ],
          "speaker": "SPEAKER_01",
          "duration": 1.5400000000000005,
          "avg_logprob": -0.17070312313735486
        },
        {
          "end": 11.66,
          "text": "It seems like this year for the entirety of the human civilization is an interesting year for the development of artificial intelligence.",
          "start": 4.72,
          "words": [
            {…

    Settings

    language
    en
03

Om Whisper Diarization

Kort sagtFrån och med 23 september 2026

Whisper Diarization är en modell av Community i kategorin Taligenkänning (STT). På Railwail kostar Whisper Diarization ≈ 0,0063 US$ per körning.

04

Priser

Priser i US-dollar. Användningen debiteras från förbetald kredit.
Typisk körning (≈ 5 s på L40S)0,0063 US$ per körning
GPU-tid (L40S)0,00117 US$ per GPU-sekund
  • Faktureras enligt den GPU-tid som körningen faktiskt tar. När körningen startar reserveras 3× det typiska priset från ditt saldo och regleras efteråt.
  • 1 kredit = 0,01 US$

Kostnadsräknare

Prisräknare

s

Typisk enligt leverantören: ca 5,3 s

Totalt

0,63 US$

63 krediter

Per körning

0,0063 US$ · 0,63 krediter

Faktureras enligt faktisk GPU-tid; detta är en uppskattning.

05

API

Anropa Whisper Diarization med din Railwail API-nyckel. Använd detta modell-ID i begäran:

Inget verifierat API-exempel

Det offentliga API:et skickar ett annat inmatningsformat än vad denna modell behöver. Använd lekplatsen ovan.

06

Specifikationer

Modell-ID
whisper-diarization
Utvecklare
Community
Inmatning
Audio
Utmatning
Text
Fakturering
Efter användning (tokens eller GPU-tid)
Kataloginlägg uppdaterat
23 september 2026

Indataparametrar

Inmatningar och inställningar från modellens indataschema. Exemplet i API-avsnittet visar vilka som API:et accepterar.

  • file_urlobligatorisk

    URL of the audio file to transcribe and diarize

    Typ: Text
    Standard: –
    Tillåtna värden: –
  • prompt

    Optional vocabulary or context hint

    Typ: Text
    Standard: –
    Tillåtna värden: upp till 1 000 tecken
  • language

    Optional ISO-639-1 language code; auto-detected if omitted

    Typ: Text
    Standard: –
    Tillåtna värden: –
  • translate
    Typ: Ja/Nej
    Standard: false
    Tillåtna värden: –
  • num_speakers

    Optional fixed speaker count; estimated if omitted

    Typ: Heltal
    Standard: –
    Tillåtna värden: 1 till 50

Taggar

  • replicate
  • whisper
  • stt
  • transcription
  • diarization
  • speaker-labels
  • multilingual
07

Användningsfall

08

Vanliga frågor

Vad är Whisper Diarization?

Whisper Diarization är en modell av Community i kategorin Taligenkänning (STT).

Vad kostar Whisper Diarization på Railwail?

På Railwail kostar Whisper Diarization ≈ 0,0063 US$ per körning. Du debiteras för det som varje begäran faktiskt använder. Användningen betalas från förbetald kredit; 1 kredit motsvarar 0,01 US$.

Vilka inställningar stöder Whisper Diarization?

Enligt sitt inmatningsschema känner Whisper Diarization till dessa parametrar: file_url, prompt (upp till 1 000 tecken), language, translate och num_speakers (1 till 50).

Hur snabb är Whisper Diarization?

Det finns ännu inte tillräckligt många uppmätta körningar av Whisper Diarization på Railwail för att ange en körningstid. Det beror på inmatningen, inställningarna och belastningen hos leverantören.

Är Whisper Diarization bättre än Incredibly Fast Whisper?

Det beror på uppgiften. Whisper Diarization (Community) och Incredibly Fast Whisper (Community) är båda modeller i kategorin Taligenkänning (STT). Jämförelsesidan visar deras priser och specifikationer sida vid sida.

Jämför Whisper Diarization och Incredibly Fast Whisper
09

Jämförbara modeller

Alla i denna kategori
  • Whisper Large v3 wrapped with Hugging Face Transformers optimizations (batched inference, flash attention) for very high throughput. Transcribes hours of audio in minutes on a single GPU. Maintained by Vaibhav Srivastav. Good when you need bulk transcription fast.

    ≈ 0,0056 US$/körning

    11 % billigare per enhet

    Jämför Whisper Diarization och Incredibly Fast Whisper
  • WhisperOpenAI

    OpenAI's Whisper running on Replicate. General-purpose speech recognition trained on 680k hours of multilingual audio. Transcribes and translates 99 languages, robust to accents and background noise, and outputs plain text, segments, or word-level timestamps.

    ≈ 0,0034 US$/körning

    46 % billigare per enhet

    Jämför Whisper Diarization och Whisper
  • SeamlessM4TCommunity

    Meta's SeamlessM4T multimodal translation model. Takes speech or text input and produces transcription or translation across about 100 languages, including speech-to-text and speech-to-speech. One model covers ASR plus cross-lingual translation without chaining separate systems.

    ≈ 0,156 US$/körning

    2 376 % dyrare per enhet

    Jämför Whisper Diarization och SeamlessM4T

Alla modeller via ett API

En API-nyckel för alla modeller på Railwail. Användningen debiteras från förbetald kredit, 1 kredit = 0,01 US$.