Whisper Diarization

Rozpoznawanie mowyDostępne
od CommunityID modelu: whisper-diarization

Whisper Large v3 Turbo combined with pyannote 4.0 for speaker diarization, returning who-said-what segments with timestamps. Built by Thomas Mol. Returns a clean JSON of speaker-labeled segments, handy for meeting notes, interviews, and podcasts.

Cena
≈ 0,0063 USD/uruchomienie
Wejście → Wyjście
Audio → Tekst
Deweloper
Community
Zaktualizowano
23 września 2026
01

Playground

Spróbuj Whisper Diarization

Wejście i wyjście

≈ 0,0063 USD/uruchomienie
Spróbuj Whisper Diarization

0 / 1000

URL of the audio file to transcribe and diarize

Ustawienia zaawansowane (2)

Optional fixed speaker count; estimated if omitted

Wynik
Transkrypcja pojawi się tutaj.

To uruchomienie

ok. 0,0063 USD · 0,63 kredytów

Na początek rezerwowane jest 0,0188 USD (1,88 kredytów); rozliczana jest rzeczywista czas GPU.

Nowy tutaj?

10 darmowych kredytów (0,10 USD) po zarejestrowaniu się przez Google

Dostępne 24 godzin po rejestracji, do 5 uruchomień dziennie i maksymalnie 2 kredytów na uruchomienie. Inne metody logowania uruchamiają się bez kredytów. Wystarczy na 5 uruchomień tego modelu.

02

Examples

Real outputs from the public examples of this model on Replicate, with the prompt and settings that produced them. They were not generated live on this page.
  • Prompt

    LLama, AI, Meta.

    Output (JSON, shortened)

    {
      "language": "en",
      "segments": [
        {
          "end": 4.48,
          "text": "Let me ask you about AI.",
          "start": 2.94,
          "words": [
            {
              "end": 3.12,
              "word": "Let",
              "start": 2.94,
              "speaker": "SPEAKER_01",
              "probability": 0.685546875
            },
            {
              "end": 3.26,
              "word": "me",
              "start": 3.12,
              "speaker": "SPEAKER_01",
              "probability": 0.9990234375
            },
            {
              "end": 3.74,
              "word": "ask",
              "start": 3.26,
              "speaker": "SPEAKER_01",
              "probability": 0.998046875
            },
            {
              "end": 3.86,
              "word": "you",
              "start": 3.74,
              "speaker": "SPEAKER_01",
              "probability": 0.9921875
            },
            {
              "end": 4.1,
              "word": "about",
              "start": 3.86,
              "speaker": "SPEAKER_01",
              "probability": 0.9990234375
            },
            {
              "end": 4.48,
              "word": "AI.",
              "start": 4.1,
              "speaker": "SPEAKER_01",
              "probability": 0.966796875
            }
          ],
          "speaker": "SPEAKER_01",
          "duration": 1.5400000000000005,
          "avg_logprob": -0.17070312313735486
        },
        {
          "end": 11.66,
          "text": "It seems like this year for the entirety of the human civilization is an interesting year for the development of artificial intelligence.",
          "start": 4.72,
          "words": [
            {…

    Settings

    language
    en
03

O Whisper Diarization

Krótko mówiącStan na 23 września 2026

Whisper Diarization to model opracowany przez Community w kategorii Rozpoznawanie mowy. W serwisie Railwail Whisper Diarization kosztuje ≈ 0,0063 USD za uruchomienie.

04

Ceny

Ceny w dolarach amerykańskich. Użycie jest rozliczane z prepłaconych kredytów.
Typowe uruchomienie (≈ 5 s na L40S)0,0063 USD za uruchomienie
Czas GPU (L40S)0,00117 USD za sekundę GPU
  • Rozliczane są czasy GPU, które przebieg faktycznie zajmuje. Po uruchomieniu przebiegu 3× typowej ceny jest rezerwowane z Twojego salda i rozliczane później.
  • 1 kredyt = 0,01 USD

Kalkulator kosztów

Kalkulator cen

s

Typowo według dostawcy: ok. 5,3 s

Razem

0,63 USD

63 kredytów

Za uruchomienie

0,0063 USD · 0,63 kredytów

Rozliczane są rzeczywiste sekundy GPU; wartość jest szacunkiem.

05

API

Wywołaj Whisper Diarization za pomocą klucza API Railwail. Użyj tego ID modelu w żądaniu:

Brak zweryfikowanego przykładu API

Publiczny API przekazuje inny format wejściowy niż wymaga ten model. Użyj placu zabaw powyżej.

06

Specyfikacje

ID modelu
whisper-diarization
Deweloper
Community
Wejście
Audio
Wyjście
Tekst
Rozliczenie
Według użycia (tokeny lub czas GPU)
Wpis w katalogu zaktualizowany
23 września 2026

Parametry wejściowe

Dane wejściowe i ustawienia ze schematu wejściowego modelu. Przykład w sekcji API pokazuje, które z nich API akceptuje.

  • file_urlwymagane

    URL of the audio file to transcribe and diarize

    Typ: Tekst
    Domyślnie: –
    Dozwolone wartości: –
  • prompt

    Optional vocabulary or context hint

    Typ: Tekst
    Domyślnie: –
    Dozwolone wartości: do 1000 znaków
  • language

    Optional ISO-639-1 language code; auto-detected if omitted

    Typ: Tekst
    Domyślnie: –
    Dozwolone wartości: –
  • translate
    Typ: Tak/Nie
    Domyślnie: false
    Dozwolone wartości: –
  • num_speakers

    Optional fixed speaker count; estimated if omitted

    Typ: Liczba całkowita
    Domyślnie: –
    Dozwolone wartości: 1 do 50

Tagi

  • replicate
  • whisper
  • stt
  • transcription
  • diarization
  • speaker-labels
  • multilingual
07

Przypadki użycia

08

Często zadawane pytania

Co to jest Whisper Diarization?

Whisper Diarization to model opracowany przez Community w kategorii Rozpoznawanie mowy.

Ile kosztuje Whisper Diarization w serwisie Railwail?

W serwisie Railwail Whisper Diarization kosztuje ≈ 0,0063 USD za uruchomienie. Opłata jest pobierana za to, co faktycznie zużywa każde żądanie. Użycie jest opłacane z przedpłaconych kredytów; 1 kredyt równa się 0,01 USD.

Jakie ustawienia obsługuje Whisper Diarization?

Zgodnie ze schematem wejściowym, Whisper Diarization obsługuje te parametry: file_url, prompt (do 1000 znaków), language, translate i num_speakers (1 do 50).

Jak szybki jest Whisper Diarization?

Dla Whisper Diarization jest jeszcze zbyt mało zmierzonych przebiegów w serwisie Railwail, aby podać czas przebiegu. Zależy to od wejścia, ustawień i obciążenia u dostawcy.

Czy Whisper Diarization jest lepszy niż Incredibly Fast Whisper?

To zależy od zadania. Whisper Diarization (Community) i Incredibly Fast Whisper (Community) to oba modele z kategorii Rozpoznawanie mowy. Strona porównania pokazuje ich ceny i specyfikacje obok siebie.

Porównaj Whisper Diarization i Incredibly Fast Whisper
09

Porównywalne modele

Wszystkie w tej kategorii
  • Whisper Large v3 wrapped with Hugging Face Transformers optimizations (batched inference, flash attention) for very high throughput. Transcribes hours of audio in minutes on a single GPU. Maintained by Vaibhav Srivastav. Good when you need bulk transcription fast.

    ≈ 0,0056 USD/uruchomienie

    11 % taniej za jednostkę

    Porównaj Whisper Diarization i Incredibly Fast Whisper
  • WhisperOpenAI

    OpenAI's Whisper running on Replicate. General-purpose speech recognition trained on 680k hours of multilingual audio. Transcribes and translates 99 languages, robust to accents and background noise, and outputs plain text, segments, or word-level timestamps.

    ≈ 0,0034 USD/uruchomienie

    46 % taniej za jednostkę

    Porównaj Whisper Diarization i Whisper
  • SeamlessM4TCommunity

    Meta's SeamlessM4T multimodal translation model. Takes speech or text input and produces transcription or translation across about 100 languages, including speech-to-text and speech-to-speech. One model covers ASR plus cross-lingual translation without chaining separate systems.

    ≈ 0,156 USD/uruchomienie

    2376 % drożej za jednostkę

    Porównaj Whisper Diarization i SeamlessM4T

Wszystkie modele przez jedno API

Jeden klucz API dla każdego modelu na Railwail. Opłaty pobierane są z przedpłaconych kredytów, 1 kredyt = 0,01 USD.