Whisper Diarization

Talestemme-til-tekst (STT)Tilgængelig
af CommunityModell-ID: whisper-diarization

Whisper Large v3 Turbo combined with pyannote 4.0 for speaker diarization, returning who-said-what segments with timestamps. Built by Thomas Mol. Returns a clean JSON of speaker-labeled segments, handy for meeting notes, interviews, and podcasts.

Pris
≈ 0,0063 US$/kørsel
Input → output
Lyd → Tekst
Udvikler
Community
Opdateret
23. september 2026
01

Playground

Prøv Whisper Diarization

Input & resultat

≈ 0,0063 US$/kørsel
Prøv Whisper Diarization

0 / 1.000

URL of the audio file to transcribe and diarize

Avancerede indstillinger (2)

Optional fixed speaker count; estimated if omitted

Resultat
Transskriptionen vises her.

Denne kørsel

ca. 0,0063 US$ · 0,63 credits

0,0188 US$ (1,88 credits) reserveres ved start; den faktiske GPU-tid faktureres.

Ny her?

10 gratis credits (0,10 US$) når du tilmelder dig med Google

Kan bruges 24 timer efter tilmelding, op til 5 kørsler pr. dag og højst 2 credits pr. kørsel. Andre login-metoder starter uden credits. Nok til 5 kørsler af denne model.

02

Examples

Real outputs from the public examples of this model on Replicate, with the prompt and settings that produced them. They were not generated live on this page.
  • Prompt

    LLama, AI, Meta.

    Output (JSON, shortened)

    {
      "language": "en",
      "segments": [
        {
          "end": 4.48,
          "text": "Let me ask you about AI.",
          "start": 2.94,
          "words": [
            {
              "end": 3.12,
              "word": "Let",
              "start": 2.94,
              "speaker": "SPEAKER_01",
              "probability": 0.685546875
            },
            {
              "end": 3.26,
              "word": "me",
              "start": 3.12,
              "speaker": "SPEAKER_01",
              "probability": 0.9990234375
            },
            {
              "end": 3.74,
              "word": "ask",
              "start": 3.26,
              "speaker": "SPEAKER_01",
              "probability": 0.998046875
            },
            {
              "end": 3.86,
              "word": "you",
              "start": 3.74,
              "speaker": "SPEAKER_01",
              "probability": 0.9921875
            },
            {
              "end": 4.1,
              "word": "about",
              "start": 3.86,
              "speaker": "SPEAKER_01",
              "probability": 0.9990234375
            },
            {
              "end": 4.48,
              "word": "AI.",
              "start": 4.1,
              "speaker": "SPEAKER_01",
              "probability": 0.966796875
            }
          ],
          "speaker": "SPEAKER_01",
          "duration": 1.5400000000000005,
          "avg_logprob": -0.17070312313735486
        },
        {
          "end": 11.66,
          "text": "It seems like this year for the entirety of the human civilization is an interesting year for the development of artificial intelligence.",
          "start": 4.72,
          "words": [
            {…

    Settings

    language
    en
03

Om Whisper Diarization

Kort sagtFra 23. september 2026

Whisper Diarization er en model af Community i kategorien Talestemme-til-tekst (STT). På Railwail koster Whisper Diarization ≈ 0,0063 US$ pr. kørsel.

04

Priser

Priser i US-dollar. Forbrug debiteres fra forudbetalte credits.
Typisk kørsel (≈ 5 s på L40S)0,0063 US$ pr. kørsel
GPU-tid (L40S)0,00117 US$ pr. GPU-sekund
  • Faktureres efter den GPU-tid, som kørslen faktisk tager. NÃ¥r kørslen starter, reserveres 3× den typiske pris fra din saldo og afregnes efterfølgende.
  • 1 kredit = 0,01 US$

Omkostningsberegner

Prisberegner

s

Typisk ifølge udbyderen: ca. 5,3 s

I alt

0,63 US$

63 credits

Pr. kørsel

0,0063 US$ · 0,63 credits

Fakturering efter faktisk GPU-tid; dette er et estimat.

05

API

Kald Whisper Diarization med din Railwail API-nøgle. Brug dette model-ID i anmodningen:

Intet bekræftet API-eksempel

Den offentlige API sender et andet inputformat end det, som denne model har brug for. Brug playground ovenfor.

06

Specifikationer

Model-ID
whisper-diarization
Udvikler
Community
Input
Lyd
Output
Tekst
Fakturering
Efter forbrug (tokens eller GPU-tid)
Katalogelement opdateret
23. september 2026

Inputparametre

Inputs og indstillinger fra modellens inputskema. Eksemplet i API-afsnittet viser, hvilke af dem API'en accepterer.

  • file_urlpÃ¥krævet

    URL of the audio file to transcribe and diarize

    Type: Tekst
    Standard: –
    Tilladte værdier: –
  • prompt

    Optional vocabulary or context hint

    Type: Tekst
    Standard: –
    Tilladte værdier: op til 1.000 tegn
  • language

    Optional ISO-639-1 language code; auto-detected if omitted

    Type: Tekst
    Standard: –
    Tilladte værdier: –
  • translate
    Type: Ja/Nej
    Standard: false
    Tilladte værdier: –
  • num_speakers

    Optional fixed speaker count; estimated if omitted

    Type: Heltal
    Standard: –
    Tilladte værdier: 1 til 50

Tags

  • replicate
  • whisper
  • stt
  • transcription
  • diarization
  • speaker-labels
  • multilingual
07

Anvendelsestilfælde

08

Ofte stillede spørgsmål

Hvad er Whisper Diarization?

Whisper Diarization er en model fra Community i kategorien Talestemme-til-tekst (STT).

Hvad koster Whisper Diarization på Railwail?

På Railwail koster Whisper Diarization ≈ 0,0063 US$ pr. kørsel. Du betaler for det, som hver anmodning faktisk bruger. Forbrug betales fra forudbetalte credits; 1 credit svarer til 0,01 US$.

Hvilke indstillinger understøtter Whisper Diarization?

Ifølge dens inputskema kender Whisper Diarization disse parametre: file_url, prompt (op til 1.000 tegn), language, translate og num_speakers (1 til 50).

Hvor hurtig er Whisper Diarization?

Der er endnu ikke nok målte kørsler af Whisper Diarization på Railwail til at angive en udførelsestid. Det afhænger af inputtet, indstillingerne og belastningen hos provideren.

Er Whisper Diarization bedre end Incredibly Fast Whisper?

Det afhænger af opgaven. Whisper Diarization (Community) og Incredibly Fast Whisper (Community) er begge modeller i kategorien Talestemme-til-tekst (STT). Sammenligningssiden viser deres priser og specifikationer side om side.

Sammenlign Whisper Diarization og Incredibly Fast Whisper
09

Sammenlignelige modeller

Alle i denne kategori
  • Whisper Large v3 wrapped with Hugging Face Transformers optimizations (batched inference, flash attention) for very high throughput. Transcribes hours of audio in minutes on a single GPU. Maintained by Vaibhav Srivastav. Good when you need bulk transcription fast.

    ≈ 0,0056 US$/kørsel

    11 % billigere pr. enhed

    Sammenlign Whisper Diarization og Incredibly Fast Whisper
  • WhisperOpenAI

    OpenAI's Whisper running on Replicate. General-purpose speech recognition trained on 680k hours of multilingual audio. Transcribes and translates 99 languages, robust to accents and background noise, and outputs plain text, segments, or word-level timestamps.

    ≈ 0,0034 US$/kørsel

    46 % billigere pr. enhed

    Sammenlign Whisper Diarization og Whisper
  • SeamlessM4TCommunity

    Meta's SeamlessM4T multimodal translation model. Takes speech or text input and produces transcription or translation across about 100 languages, including speech-to-text and speech-to-speech. One model covers ASR plus cross-lingual translation without chaining separate systems.

    ≈ 0,156 US$/kørsel

    2.376 % dyrere pr. enhed

    Sammenlign Whisper Diarization og SeamlessM4T

Alle modeller via én API

En API-nøgle til alle modeller på Railwail. Forbrug debiteres fra forudbetalte credits, 1 credit = 0,01 US$.