Whisper Diarization

Převod řeči na textDostupné
od CommunityID modelu: whisper-diarization

Whisper Large v3 Turbo combined with pyannote 4.0 for speaker diarization, returning who-said-what segments with timestamps. Built by Thomas Mol. Returns a clean JSON of speaker-labeled segments, handy for meeting notes, interviews, and podcasts.

Cena
≈ 0,0063 US$/spuštění
Vstup → výstup
Audio → Text
Vývojář
Community
Aktualizováno
23. září 2026
01

Playground

Vyzkoušet Whisper Diarization

Vstup a výstup

≈ 0,0063 US$/spuštění
Vyzkoušet Whisper Diarization

0 / 1 000

URL of the audio file to transcribe and diarize

Pokročilá nastavení (2)

Optional fixed speaker count; estimated if omitted

Výsledek
Přepis se zobrazí zde.

Tento běh

přibližně 0,0063 US$ · 0,63 credits

Na začátku se rezervuje 0,0188 US$ (1,88 credits), fakturuje se skutečný čas GPU.

Nový zde?

10 bezplatných credits (0,10 US$) při registraci přes Google

Použitelné 24 hodin po registraci, až 5 běhů za den a maximálně 2 credits za běh. Ostatní způsoby přihlášení začínají bez credits. Stačí na 5 spuštění tohoto modelu.

02

Examples

Real outputs from the public examples of this model on Replicate, with the prompt and settings that produced them. They were not generated live on this page.
  • Prompt

    LLama, AI, Meta.

    Output (JSON, shortened)

    {
      "language": "en",
      "segments": [
        {
          "end": 4.48,
          "text": "Let me ask you about AI.",
          "start": 2.94,
          "words": [
            {
              "end": 3.12,
              "word": "Let",
              "start": 2.94,
              "speaker": "SPEAKER_01",
              "probability": 0.685546875
            },
            {
              "end": 3.26,
              "word": "me",
              "start": 3.12,
              "speaker": "SPEAKER_01",
              "probability": 0.9990234375
            },
            {
              "end": 3.74,
              "word": "ask",
              "start": 3.26,
              "speaker": "SPEAKER_01",
              "probability": 0.998046875
            },
            {
              "end": 3.86,
              "word": "you",
              "start": 3.74,
              "speaker": "SPEAKER_01",
              "probability": 0.9921875
            },
            {
              "end": 4.1,
              "word": "about",
              "start": 3.86,
              "speaker": "SPEAKER_01",
              "probability": 0.9990234375
            },
            {
              "end": 4.48,
              "word": "AI.",
              "start": 4.1,
              "speaker": "SPEAKER_01",
              "probability": 0.966796875
            }
          ],
          "speaker": "SPEAKER_01",
          "duration": 1.5400000000000005,
          "avg_logprob": -0.17070312313735486
        },
        {
          "end": 11.66,
          "text": "It seems like this year for the entirety of the human civilization is an interesting year for the development of artificial intelligence.",
          "start": 4.72,
          "words": [
            {…

    Settings

    language
    en
03

O Whisper Diarization

StručněStav: 23. září 2026

Whisper Diarization je model od Community v kategorii Převod řeči na text. Na Railwail stojí Whisper Diarization ≈ 0,0063 US$ za spuštění.

04

Ceny

Ceny v USD. Použití se účtuje z předplacených kreditů.
Typické spuštění (≈ 5 s na L40S)0,0063 US$ za spuštění
GPU čas (L40S)0,00117 US$ za GPU sekundu
  • Účtuje se GPU čas, který spuštění skutečně trvá. Při spuštění je z vašeho zůstatku rezervováno 3× typická cena a později se vypořádá.
  • 1 kredit = 0,01 US$

Kalkulátor nákladů

Kalkulátor cen

s

Typicky podle poskytovatele: přibližně 5,3 s

Celkem

0,63 US$

63 kreditů

Na spuštění

0,0063 US$ · 0,63 kreditů

Účtuje se skutečný čas GPU; jedná se o odhad.

05

API

Volejte Whisper Diarization s vaším API klíčem Railwail. V požadavku použijte toto ID modelu:

Žádný ověřený příklad API

Veřejné API předává jiný formát vstupu, než tento model potřebuje. Použijte playground výše.

06

Specifikace

ID modelu
whisper-diarization
Vývojář
Community
Vstup
Audio
Výstup
Text
Fakturace
Podle použití (tokeny nebo GPU čas)
Záznam v katalogu aktualizován
23. září 2026

Vstupní parametry

Vstupy a nastavení ze vstupního schématu modelu. Příklad v sekci API ukazuje, které z nich API přijímá.

  • file_urlpovinné

    URL of the audio file to transcribe and diarize

    Typ: Text
    Výchozí: –
    Povolené hodnoty: –
  • prompt

    Optional vocabulary or context hint

    Typ: Text
    Výchozí: –
    Povolené hodnoty: až 1 000 znaků
  • language

    Optional ISO-639-1 language code; auto-detected if omitted

    Typ: Text
    Výchozí: –
    Povolené hodnoty: –
  • translate
    Typ: Ano/Ne
    Výchozí: false
    Povolené hodnoty: –
  • num_speakers

    Optional fixed speaker count; estimated if omitted

    Typ: Celé číslo
    Výchozí: –
    Povolené hodnoty: 1 až 50

Štítky

  • replicate
  • whisper
  • stt
  • transcription
  • diarization
  • speaker-labels
  • multilingual
07

Případy použití

08

Často kladené otázky

Co je Whisper Diarization?

Whisper Diarization je model od Community v kategorii Převod řeči na text.

Kolik stojí Whisper Diarization na Railwail?

Na Railwail stojí Whisper Diarization ≈ 0,0063 US$ za spuštění. Platíte za to, co každý požadavek skutečně spotřebuje. Použití se platí z předplacených kreditů; 1 kredit se rovná 0,01 US$.

Jaká nastavení Whisper Diarization podporuje?

Podle schématu vstupu Whisper Diarization zná tyto parametry: file_url, prompt (až 1 000 znaků), language, translate a num_speakers (1 až 50).

Jak rychlý je Whisper Diarization?

Pro Whisper Diarization je na Railwail zatím příliš málo naměřených spuštění na uvedení doby běhu. Závisí na vstupu, nastavení a zátěži u poskytovatele.

Je Whisper Diarization lepší než Incredibly Fast Whisper?

Záleží na úkolu. Whisper Diarization (Community) a Incredibly Fast Whisper (Community) jsou oba modely v kategorii Převod řeči na text. Stránka porovnání zobrazuje jejich ceny a specifikace vedle sebe.

Porovnat Whisper Diarization a Incredibly Fast Whisper
09

Srovnatelné modely

Všechny v této kategorii
  • Whisper Large v3 wrapped with Hugging Face Transformers optimizations (batched inference, flash attention) for very high throughput. Transcribes hours of audio in minutes on a single GPU. Maintained by Vaibhav Srivastav. Good when you need bulk transcription fast.

    ≈ 0,0056 US$/spuštění

    11 % levnější na jednotku

    Porovnat Whisper Diarization a Incredibly Fast Whisper
  • WhisperOpenAI

    OpenAI's Whisper running on Replicate. General-purpose speech recognition trained on 680k hours of multilingual audio. Transcribes and translates 99 languages, robust to accents and background noise, and outputs plain text, segments, or word-level timestamps.

    ≈ 0,0034 US$/spuštění

    46 % levnější na jednotku

    Porovnat Whisper Diarization a Whisper
  • SeamlessM4TCommunity

    Meta's SeamlessM4T multimodal translation model. Takes speech or text input and produces transcription or translation across about 100 languages, including speech-to-text and speech-to-speech. One model covers ASR plus cross-lingual translation without chaining separate systems.

    ≈ 0,156 US$/spuštění

    2 376 % dražší na jednotku

    Porovnat Whisper Diarization a SeamlessM4T

Všechny modely přes jednu API

Jeden API klíč pro všechny modely na Railwail. Použití se účtuje z předplacených kreditů, 1 kredit = 0,01 US$.