Whisper Diarization

Reconocimiento de vozDisponible
de CommunityID del modelo: whisper-diarization

Whisper Large v3 Turbo combined with pyannote 4.0 for speaker diarization, returning who-said-what segments with timestamps. Built by Thomas Mol. Returns a clean JSON of speaker-labeled segments, handy for meeting notes, interviews, and podcasts.

Precio
≈ 0,0063 US$/ejecución
Entrada → Salida
Audio → Texto
Desarrollador
Community
Actualizado
23 de septiembre de 2026
01

Playground

Probar Whisper Diarization

Entrada y salida

≈ 0,0063 US$/ejecución
Probar Whisper Diarization

0 / 1000

URL of the audio file to transcribe and diarize

Configuración avanzada (2)

Optional fixed speaker count; estimated if omitted

Resultado
La transcripción aparece aquí.

Esta ejecución

aprox. 0,0063 US$ · 0,63 créditos

Se reservan 0,0188 US$ (1,88 créditos) al inicio; se factura el tiempo real de GPU.

¿Eres nuevo aquí?

10 créditos gratis (0,10 US$) cuando te registres con Google

Disponible 24 horas después del registro, hasta 5 ejecuciones por día y como máximo 2 créditos por ejecución. Otros métodos de inicio de sesión comienzan sin créditos. Suficiente para 5 ejecuciones de este modelo.

02

Examples

Real outputs from the public examples of this model on Replicate, with the prompt and settings that produced them. They were not generated live on this page.
  • Prompt

    LLama, AI, Meta.

    Output (JSON, shortened)

    {
      "language": "en",
      "segments": [
        {
          "end": 4.48,
          "text": "Let me ask you about AI.",
          "start": 2.94,
          "words": [
            {
              "end": 3.12,
              "word": "Let",
              "start": 2.94,
              "speaker": "SPEAKER_01",
              "probability": 0.685546875
            },
            {
              "end": 3.26,
              "word": "me",
              "start": 3.12,
              "speaker": "SPEAKER_01",
              "probability": 0.9990234375
            },
            {
              "end": 3.74,
              "word": "ask",
              "start": 3.26,
              "speaker": "SPEAKER_01",
              "probability": 0.998046875
            },
            {
              "end": 3.86,
              "word": "you",
              "start": 3.74,
              "speaker": "SPEAKER_01",
              "probability": 0.9921875
            },
            {
              "end": 4.1,
              "word": "about",
              "start": 3.86,
              "speaker": "SPEAKER_01",
              "probability": 0.9990234375
            },
            {
              "end": 4.48,
              "word": "AI.",
              "start": 4.1,
              "speaker": "SPEAKER_01",
              "probability": 0.966796875
            }
          ],
          "speaker": "SPEAKER_01",
          "duration": 1.5400000000000005,
          "avg_logprob": -0.17070312313735486
        },
        {
          "end": 11.66,
          "text": "It seems like this year for the entirety of the human civilization is an interesting year for the development of artificial intelligence.",
          "start": 4.72,
          "words": [
            {…

    Settings

    language
    en
03

Acerca de Whisper Diarization

ResumenA fecha de 23 de septiembre de 2026

Whisper Diarization es un modelo de Community en la categoría Reconocimiento de voz. En Railwail, Whisper Diarization cuesta ≈ 0,0063 US$ por ejecución.

04

Precios

Precios en dólares estadounidenses. El uso se cobra con créditos prepagados.
Ejecución típica (≈ 5 s en L40S)0,0063 US$ por ejecución
Tiempo de GPU (L40S)0,00117 US$ por segundo de GPU
  • Se factura por el tiempo de GPU que realmente tarda la ejecución. Cuando comienza la ejecución, se reserva 3× el precio típico de tu saldo y se liquida después.
  • 1 crédito = 0,01 US$

Calculadora de costes

Calculadora de precios

s

Típico según el proveedor: aprox. 5,3 s

Total

0,63 US$

63 créditos

Por ejecución

0,0063 US$ · 0,63 créditos

Se factura el tiempo real de GPU; este es un estimado.

05

API

Llama a Whisper Diarization con tu clave API de Railwail. Usa este ID de modelo en la solicitud:

Sin ejemplo de API verificado

La API pública pasa un formato de entrada diferente al que necesita este modelo. Usa el playground anterior.

06

Especificaciones

ID del modelo
whisper-diarization
Desarrollador
Community
Entrada
Audio
Salida
Texto
Facturación
Por uso (tokens o tiempo de GPU)
Entrada del catálogo actualizada
23 de septiembre de 2026

Parámetros de entrada

Entradas y configuración del esquema de entrada del modelo. El ejemplo en la sección API muestra cuáles de ellas acepta la API.

  • file_urlObligatorio

    URL of the audio file to transcribe and diarize

    Tipo: Texto
    Predeterminado: –
    Valores permitidos: –
  • prompt

    Optional vocabulary or context hint

    Tipo: Texto
    Predeterminado: –
    Valores permitidos: Hasta 1000 caracteres
  • language

    Optional ISO-639-1 language code; auto-detected if omitted

    Tipo: Texto
    Predeterminado: –
    Valores permitidos: –
  • translate
    Tipo: Sí/No
    Predeterminado: false
    Valores permitidos: –
  • num_speakers

    Optional fixed speaker count; estimated if omitted

    Tipo: Número entero
    Predeterminado: –
    Valores permitidos: 1 a 50

Etiquetas

  • replicate
  • whisper
  • stt
  • transcription
  • diarization
  • speaker-labels
  • multilingual
07

Casos de uso

08

Preguntas frecuentes

¿Qué es Whisper Diarization?

Whisper Diarization es un modelo de Community en la categoría Reconocimiento de voz.

¿Cuánto cuesta Whisper Diarization en Railwail?

En Railwail, Whisper Diarization cuesta ≈ 0,0063 US$ por ejecución. Se te cobra por lo que cada solicitud realmente consume. El uso se paga con créditos prepagados; 1 crédito equivale a 0,01 US$.

¿Qué configuraciones admite Whisper Diarization?

Según su esquema de entrada, Whisper Diarization conoce estos parámetros: file_url, prompt (Hasta 1000 caracteres), language, translate y num_speakers (1 a 50).

¿Qué velocidad tiene Whisper Diarization?

Aún no hay suficientes ejecuciones medidas de Whisper Diarization en Railwail para indicar un tiempo de ejecución. Depende de la entrada, la configuración y la carga en el proveedor.

¿Es Whisper Diarization mejor que Incredibly Fast Whisper?

Depende de la tarea. Whisper Diarization (Community) y Incredibly Fast Whisper (Community) son ambos modelos en la categoría Reconocimiento de voz. La página de comparación muestra sus precios y especificaciones lado a lado.

Comparar Whisper Diarization y Incredibly Fast Whisper
09

Modelos comparables

Todos en esta categoría
  • Whisper Large v3 wrapped with Hugging Face Transformers optimizations (batched inference, flash attention) for very high throughput. Transcribes hours of audio in minutes on a single GPU. Maintained by Vaibhav Srivastav. Good when you need bulk transcription fast.

    ≈ 0,0056 US$/ejecución

    11 % más barato por unidad

    Comparar Whisper Diarization vs. Incredibly Fast Whisper
  • WhisperOpenAI

    OpenAI's Whisper running on Replicate. General-purpose speech recognition trained on 680k hours of multilingual audio. Transcribes and translates 99 languages, robust to accents and background noise, and outputs plain text, segments, or word-level timestamps.

    ≈ 0,0034 US$/ejecución

    46 % más barato por unidad

    Comparar Whisper Diarization vs. Whisper
  • SeamlessM4TCommunity

    Meta's SeamlessM4T multimodal translation model. Takes speech or text input and produces transcription or translation across about 100 languages, including speech-to-text and speech-to-speech. One model covers ASR plus cross-lingual translation without chaining separate systems.

    ≈ 0,156 US$/ejecución

    2376 % más caro por unidad

    Comparar Whisper Diarization vs. SeamlessM4T

Todos los modelos a través de una API

Una clave API para todos los modelos en Railwail. El uso se cobra desde créditos prepagados, 1 crédito = 0,01 US$.