Whisper Diarization

Conversão de fala em textoDisponível
por CommunityID do modelo: whisper-diarization

Whisper Large v3 Turbo combined with pyannote 4.0 for speaker diarization, returning who-said-what segments with timestamps. Built by Thomas Mol. Returns a clean JSON of speaker-labeled segments, handy for meeting notes, interviews, and podcasts.

Preço
≈ US$ 0,0063/execução
Entrada → Saída
Áudio → Texto
Desenvolvedor
Community
Atualizado
23 de setembro de 2026
01

Playground

Experimentar Whisper Diarization

Entrada & saída

≈ US$ 0,0063/execução
Experimentar Whisper Diarization

0 / 1.000

URL of the audio file to transcribe and diarize

Configurações avançadas (2)

Optional fixed speaker count; estimated if omitted

Resultado
A transcrição aparece aqui.

Esta execução

cerca de US$ 0,0063 · 0,63 créditos

US$ 0,0188 (1,88 créditos) são reservados no início; o tempo real de GPU é cobrado.

Novo por aqui?

10 créditos grátis (US$ 0,10) ao se inscrever com Google

Utilizável 24 horas após inscrição, até 5 execuções por dia e no máximo 2 créditos por execução. Outros métodos de login começam sem créditos. Suficiente para 5 execuções deste modelo.

02

Examples

Real outputs from the public examples of this model on Replicate, with the prompt and settings that produced them. They were not generated live on this page.
  • Prompt

    LLama, AI, Meta.

    Output (JSON, shortened)

    {
      "language": "en",
      "segments": [
        {
          "end": 4.48,
          "text": "Let me ask you about AI.",
          "start": 2.94,
          "words": [
            {
              "end": 3.12,
              "word": "Let",
              "start": 2.94,
              "speaker": "SPEAKER_01",
              "probability": 0.685546875
            },
            {
              "end": 3.26,
              "word": "me",
              "start": 3.12,
              "speaker": "SPEAKER_01",
              "probability": 0.9990234375
            },
            {
              "end": 3.74,
              "word": "ask",
              "start": 3.26,
              "speaker": "SPEAKER_01",
              "probability": 0.998046875
            },
            {
              "end": 3.86,
              "word": "you",
              "start": 3.74,
              "speaker": "SPEAKER_01",
              "probability": 0.9921875
            },
            {
              "end": 4.1,
              "word": "about",
              "start": 3.86,
              "speaker": "SPEAKER_01",
              "probability": 0.9990234375
            },
            {
              "end": 4.48,
              "word": "AI.",
              "start": 4.1,
              "speaker": "SPEAKER_01",
              "probability": 0.966796875
            }
          ],
          "speaker": "SPEAKER_01",
          "duration": 1.5400000000000005,
          "avg_logprob": -0.17070312313735486
        },
        {
          "end": 11.66,
          "text": "It seems like this year for the entirety of the human civilization is an interesting year for the development of artificial intelligence.",
          "start": 4.72,
          "words": [
            {…

    Settings

    language
    en
03

Sobre Whisper Diarization

ResumoA partir de 23 de setembro de 2026

Whisper Diarization é um modelo de Community na categoria Conversão de fala em texto. No Railwail, Whisper Diarization custa ≈ US$ 0,0063 por execução.

04

Preços

Preços em dólares americanos. O uso é cobrado a partir de créditos pré-pagos.
Execução típica (≈ 5 s em L40S)US$ 0,0063 por execução
Tempo de GPU (L40S)US$ 0,00117 por segundo de GPU
  • Faturado pelo tempo de GPU que a execução realmente leva. Quando a execução começa, 3× o preço típico é reservado do seu saldo e liquidado depois.
  • 1 crédito = US$ 0,01

Calculadora de custos

Calculadora de preços

s

Típico conforme o provedor: cerca de 5,3 s

Total

US$ 0,63

63 créditos

Por execução

US$ 0,0063 · 0,63 créditos

Faturado pelo tempo real de GPU; este é uma estimativa.

05

API

Chame Whisper Diarization com sua chave de API Railwail. Use este ID de modelo na solicitação:

Nenhum exemplo de API verificado

A API pública passa um formato de entrada diferente do que este modelo precisa. Use o playground acima.

06

Especificações

ID do modelo
whisper-diarization
Desenvolvedor
Community
Entrada
Áudio
Saída
Texto
Faturamento
Por uso (tokens ou tempo de GPU)
Entrada do catálogo atualizada
23 de setembro de 2026

Parâmetros de entrada

Entradas e configurações do esquema de entrada do modelo. O exemplo na seção API mostra quais delas a API aceita.

  • file_urlobrigatório

    URL of the audio file to transcribe and diarize

    Tipo: Texto
    Padrão: –
    Valores permitidos: –
  • prompt

    Optional vocabulary or context hint

    Tipo: Texto
    Padrão: –
    Valores permitidos: até 1.000 caracteres
  • language

    Optional ISO-639-1 language code; auto-detected if omitted

    Tipo: Texto
    Padrão: –
    Valores permitidos: –
  • translate
    Tipo: Sim/Não
    Padrão: false
    Valores permitidos: –
  • num_speakers

    Optional fixed speaker count; estimated if omitted

    Tipo: Número inteiro
    Padrão: –
    Valores permitidos: 1 a 50

Etiquetas

  • replicate
  • whisper
  • stt
  • transcription
  • diarization
  • speaker-labels
  • multilingual
07

Casos de uso

08

Perguntas frequentes

O que é Whisper Diarization?

Whisper Diarization é um modelo de Community na categoria Conversão de fala em texto.

Quanto custa Whisper Diarization no Railwail?

No Railwail, Whisper Diarization custa ≈ US$ 0,0063 por execução. Você é cobrado pelo que cada solicitação realmente usa. O uso é pago com créditos pré-pagos; 1 crédito equivale a US$ 0,01.

Quais configurações Whisper Diarization suporta?

De acordo com seu esquema de entrada, Whisper Diarization conhece estes parâmetros: file_url, prompt (até 1.000 caracteres), language, translate e num_speakers (1 a 50).

Qual é a velocidade de Whisper Diarization?

Ainda não há execuções medidas suficientes de Whisper Diarization no Railwail para indicar um tempo de execução. Depende da entrada, das configurações e da carga no provedor.

Whisper Diarization é melhor que Incredibly Fast Whisper?

Depende da tarefa. Whisper Diarization (Community) e Incredibly Fast Whisper (Community) são ambos modelos na categoria Conversão de fala em texto. A página de comparação mostra seus preços e especificações lado a lado.

Comparar Whisper Diarization e Incredibly Fast Whisper
09

Modelos comparáveis

Todos nesta categoria
  • Whisper Large v3 wrapped with Hugging Face Transformers optimizations (batched inference, flash attention) for very high throughput. Transcribes hours of audio in minutes on a single GPU. Maintained by Vaibhav Srivastav. Good when you need bulk transcription fast.

    ≈ US$ 0,0056/execução

    11 % mais barato por unidade

    Comparar Whisper Diarization vs. Incredibly Fast Whisper
  • WhisperOpenAI

    OpenAI's Whisper running on Replicate. General-purpose speech recognition trained on 680k hours of multilingual audio. Transcribes and translates 99 languages, robust to accents and background noise, and outputs plain text, segments, or word-level timestamps.

    ≈ US$ 0,0034/execução

    46 % mais barato por unidade

    Comparar Whisper Diarization vs. Whisper
  • SeamlessM4TCommunity

    Meta's SeamlessM4T multimodal translation model. Takes speech or text input and produces transcription or translation across about 100 languages, including speech-to-text and speech-to-speech. One model covers ASR plus cross-lingual translation without chaining separate systems.

    ≈ US$ 0,156/execução

    2.376 % mais caro por unidade

    Comparar Whisper Diarization vs. SeamlessM4T

Todos os modelos através de uma API

Uma chave API para todos os modelos no Railwail. O uso é cobrado a partir de créditos pré-pagos, 1 crédito = US$ 0,01.