Whisper Diarization

Spracherkennung (STT)Verfügbar
von CommunityModell-ID: whisper-diarization

Whisper Large v3 Turbo combined with pyannote 4.0 for speaker diarization, returning who-said-what segments with timestamps. Built by Thomas Mol. Returns a clean JSON of speaker-labeled segments, handy for meeting notes, interviews, and podcasts.

Preis
ca. $ 0,0063/Lauf
Eingabe → Ausgabe
Audio → Text
Entwickler
Community
Aktualisiert
23. September 2026
01

Playground

Whisper Diarization ausprobieren

Eingabe & Ergebnis

ca. $ 0,0063/Lauf
Whisper Diarization ausprobieren

0 / 1 000

URL of the audio file to transcribe and diarize

Erweiterte Einstellungen (2)

Optional fixed speaker count; estimated if omitted

Ergebnis
Das Transkript erscheint hier.

Dieser Lauf

ca. $ 0,0063 · 0,63 Credits

Beim Start werden $ 0,0188 (1,88 Credits) vorgemerkt, abgerechnet wird die tatsächliche GPU-Zeit.

Neu hier?

10 Gratis-Credits ($ 0,10) bei Anmeldung mit Google

Nutzbar 24 Stunden nach der Anmeldung, bis zu 5 Läufe pro Tag und höchstens 2 Credits je Lauf. Andere Anmeldearten starten ohne Guthaben. Reicht für 5 Läufe dieses Modells.

02

Beispiele

Echte Ergebnisse aus den öffentlichen Beispielen dieses Modells auf Replicate, mit dem Prompt und den Einstellungen, die sie erzeugt haben. Sie wurden nicht live auf dieser Seite erzeugt.
  • Prompt

    LLama, AI, Meta.

    Ausgabe (JSON, gekürzt)

    {
      "language": "en",
      "segments": [
        {
          "end": 4.48,
          "text": "Let me ask you about AI.",
          "start": 2.94,
          "words": [
            {
              "end": 3.12,
              "word": "Let",
              "start": 2.94,
              "speaker": "SPEAKER_01",
              "probability": 0.685546875
            },
            {
              "end": 3.26,
              "word": "me",
              "start": 3.12,
              "speaker": "SPEAKER_01",
              "probability": 0.9990234375
            },
            {
              "end": 3.74,
              "word": "ask",
              "start": 3.26,
              "speaker": "SPEAKER_01",
              "probability": 0.998046875
            },
            {
              "end": 3.86,
              "word": "you",
              "start": 3.74,
              "speaker": "SPEAKER_01",
              "probability": 0.9921875
            },
            {
              "end": 4.1,
              "word": "about",
              "start": 3.86,
              "speaker": "SPEAKER_01",
              "probability": 0.9990234375
            },
            {
              "end": 4.48,
              "word": "AI.",
              "start": 4.1,
              "speaker": "SPEAKER_01",
              "probability": 0.966796875
            }
          ],
          "speaker": "SPEAKER_01",
          "duration": 1.5400000000000005,
          "avg_logprob": -0.17070312313735486
        },
        {
          "end": 11.66,
          "text": "It seems like this year for the entirety of the human civilization is an interesting year for the development of artificial intelligence.",
          "start": 4.72,
          "words": [
            {…

    Einstellungen

    language
    en
03

Über Whisper Diarization

Kurz gesagtStand: 23. September 2026

Whisper Diarization ist ein Modell von Community aus der Kategorie Spracherkennung (STT). Über Railwail kostet Whisper Diarization ca. $ 0,0063 pro Lauf.

04

Preise

Preise in US-Dollar. Abgerechnet wird über vorab gekaufte Credits.
Typischer Lauf (ca. 5 s auf L40S)$ 0,0063 pro Lauf
GPU-Zeit (L40S)$ 0,00117 pro GPU-Sekunde
  • Abgerechnet wird die GPU-Zeit, die der Lauf tatsächlich braucht. Beim Start wird das 3-Fache des typischen Preises vom Guthaben vorgemerkt und danach verrechnet.
  • 1 Credit = $ 0,01

Kostenrechner

Preisrechner

s

Typisch laut Anbieter: ca. 5,3 s

Gesamt

$ 0,63

63 Credits

Je Lauf

$ 0,0063 · 0,63 Credits

Abgerechnet wird die tatsächliche GPU-Zeit; der Wert ist eine Schätzung.

05

API

Rufe Whisper Diarization mit deinem Railwail-API-Schlüssel auf. Diese Modell-ID gehört in die Anfrage:

Kein geprüftes API-Beispiel

Die öffentliche API übergibt ein anderes Eingabeformat, als dieses Modell braucht. Nutze den Playground oben.

06

Spezifikationen

Modell-ID
whisper-diarization
Entwickler
Community
Eingabe
Audio
Ausgabe
Text
Abrechnung
Nach Verbrauch (Token bzw. GPU-Zeit)
Katalogeintrag aktualisiert
23. September 2026

Eingabeparameter

Eingaben und Einstellungen laut Eingabeschema des Modells. Welche davon die API annimmt, zeigt das Beispiel im Abschnitt API.

  • file_urlPflicht

    URL of the audio file to transcribe and diarize

    Typ: Text
    Standard: –
    Erlaubte Werte: –
  • prompt

    Optional vocabulary or context hint

    Typ: Text
    Standard: –
    Erlaubte Werte: bis 1 000 Zeichen
  • language

    Optional ISO-639-1 language code; auto-detected if omitted

    Typ: Text
    Standard: –
    Erlaubte Werte: –
  • translate
    Typ: Ja/Nein
    Standard: false
    Erlaubte Werte: –
  • num_speakers

    Optional fixed speaker count; estimated if omitted

    Typ: Ganzzahl
    Standard: –
    Erlaubte Werte: 1 bis 50

Schlagwörter

  • replicate
  • whisper
  • stt
  • transcription
  • diarization
  • speaker-labels
  • multilingual
07

Einsatzgebiete

08

Häufige Fragen

Was ist Whisper Diarization?

Whisper Diarization ist ein Modell von Community aus der Kategorie Spracherkennung (STT).

Was kostet Whisper Diarization bei Railwail?

Über Railwail kostet Whisper Diarization ca. $ 0,0063 pro Lauf. Abgerechnet wird, was jede Anfrage tatsächlich verbraucht. Bezahlt wird mit vorab gekauften Credits; 1 Credit entspricht $ 0,01.

Welche Einstellungen unterstützt Whisper Diarization?

Laut Eingabeschema kennt Whisper Diarization diese Parameter: file_url, prompt (bis 1 000 Zeichen), language, translate und num_speakers (1 bis 50).

Wie schnell ist Whisper Diarization?

Für Whisper Diarization gibt es bei Railwail noch zu wenige gemessene Läufe, um eine Laufzeit anzugeben. Sie hängt von der Eingabe, den Einstellungen und der Auslastung beim Anbieter ab.

Ist Whisper Diarization besser als Incredibly Fast Whisper?

Das hängt von der Aufgabe ab. Whisper Diarization (Community) und Incredibly Fast Whisper (Community) sind beide Modelle aus der Kategorie Spracherkennung (STT). Die Vergleichsseite zeigt Preise und Spezifikationen nebeneinander.

Whisper Diarization und Incredibly Fast Whisper vergleichen
09

Vergleichbare Modelle

Alle dieser Kategorie
  • Whisper Large v3 wrapped with Hugging Face Transformers optimizations (batched inference, flash attention) for very high throughput. Transcribes hours of audio in minutes on a single GPU. Maintained by Vaibhav Srivastav. Good when you need bulk transcription fast.

    ca. $ 0,0056/Lauf

    11 % günstiger je Einheit

    Whisper Diarization und Incredibly Fast Whisper vergleichen
  • WhisperOpenAI

    OpenAI's Whisper running on Replicate. General-purpose speech recognition trained on 680k hours of multilingual audio. Transcribes and translates 99 languages, robust to accents and background noise, and outputs plain text, segments, or word-level timestamps.

    ca. $ 0,0034/Lauf

    46 % günstiger je Einheit

    Whisper Diarization und Whisper vergleichen
  • SeamlessM4TCommunity

    Meta's SeamlessM4T multimodal translation model. Takes speech or text input and produces transcription or translation across about 100 languages, including speech-to-text and speech-to-speech. One model covers ASR plus cross-lingual translation without chaining separate systems.

    ca. $ 0,156/Lauf

    2 376 % teurer je Einheit

    Whisper Diarization und SeamlessM4T vergleichen

Alle Modelle über eine API

Ein API-Schlüssel für alle Modelle auf Railwail. Abgerechnet wird über vorab gekaufte Credits, 1 Credit = $ 0,01.