Deepgram Nova-3

Reconocimiento de vozNo disponible
de OtherID del modelo: nova-3

Deepgram's flagship STT. First to offer realtime multilingual transcription with self-serve customization.

Estado
No disponible
Entrada → Salida
Audio → Texto
Desarrollador
Other
Actualizado
23 de septiembre de 2026

Deepgram Nova-3 no está disponible en este momento

Puedes seguir leyendo los detalles en esta página. Elige una de las alternativas disponibles abajo para ejecutar un modelo comparable de inmediato.

Ir a alternativas
01

Modelos comparables

Todos en esta categoría
  • Whisper Large v3 wrapped with Hugging Face Transformers optimizations (batched inference, flash attention) for very high throughput. Transcribes hours of audio in minutes on a single GPU. Maintained by Vaibhav Srivastav. Good when you need bulk transcription fast.

  • WhisperOpenAI

    OpenAI's Whisper running on Replicate. General-purpose speech recognition trained on 680k hours of multilingual audio. Transcribes and translates 99 languages, robust to accents and background noise, and outputs plain text, segments, or word-level timestamps.

    ≈ USD 0.0034/ejecución

    Comparar Deepgram Nova-3 vs. Whisper
  • SeamlessM4TCommunity

    Meta's SeamlessM4T multimodal translation model. Takes speech or text input and produces transcription or translation across about 100 languages, including speech-to-text and speech-to-speech. One model covers ASR plus cross-lingual translation without chaining separate systems.

02

Playground

Probar Deepgram Nova-3

Entrada y salida

No disponible actualmente

Actualmente no disponible.

El área de pruebas está desactivada. Encuentra modelos comparables en la misma categoría: Explorar alternativas

Probar Deepgram Nova-3

0 / 1,000

URL or upload path to audio file

Configuración avanzada (2)
Resultado
La transcripción aparece aquí.

Esta ejecución

Sin precio – actualmente no disponible.

¿Nuevo aquí?

10 créditos gratis (USD 0.10) cuando te registras con Google

Utilizable 24 horas después del registro, hasta 5 ejecuciones por día y como máximo 2 créditos por ejecución. Otros métodos de inicio de sesión comienzan sin créditos.

03

Acerca de Deepgram Nova-3

ResumenA partir de 23 de septiembre de 2026

Deepgram Nova-3 es un modelo de Other en la categoría Reconocimiento de voz. Deepgram Nova-3 no está disponible en Railwail en este momento.

Fondo

Acerca de Deepgram

Fundado en 2015 · San Francisco, California, USA

Deepgram was founded in 2015 by Scott Stephenson (CEO) and Noah Shutty after they finished PhDs in dark-matter physics at the University of Michigan and built a Hadoop pipeline to search audio archives. The company pivoted to commercial speech recognition in 2018 and became one of the first speech vendors to ship a fully end-to-end deep-learning ASR pipeline rather than the classical Kaldi stack. Deepgram has raised over $86M in venture funding from Tiger Global, Y Combinator, Wing, Madrona and NVIDIA's NVentures, with a 2024 Series C at a reported $1B+ valuation. The Nova model family launched in 2023 (Nova-1), followed by Nova-2 (2024) and Nova-3 (January 2025), positioning Deepgram as the fastest commercial ASR provider with sub-300 ms streaming and self-hostable deployments.

Visitar Deepgram

Arquitectura

End-to-end encoder-decoder speech-to-text with self-supervised pretraining

Deepgram Nova-3 is an end-to-end deep-learning automatic speech recognition model trained on what Deepgram describes as the largest commercial training corpus among production ASR providers, including 50,000+ hours of curated multi-domain audio plus self-supervised pretraining on hundreds of thousands of hours of unlabelled speech. Nova-3 introduced a unified multilingual model that natively handles English, Spanish, French, German, Italian, Portuguese, Hindi, Japanese, Mandarin, Korean and 10+ more, with on-the-fly code-switching inside a single audio file. New capabilities include keyword prompting (custom vocabulary at request time without retraining), Self-Hosted edition for HIPAA/SOC2 deployments, and improved noise robustness on call-centre and phone audio. The streaming variant runs at sub-300 ms latency over WebSocket, while the pre-recorded variant supports up to 4 hours per file. Outputs include diarisation, punctuation, smart formatting, language detection and topic/intent metadata.

Parámetros
Undisclosed (multi-billion)
Contexto
14,400 tokens

Capacidades

  • Real-time streaming ASR at sub-300 ms latency
  • Multilingual single model with code-switching across 36+ languages
  • Keyword prompting for runtime custom vocabulary
  • Speaker diarisation, punctuation and smart formatting
  • Phone-call optimised (8 kHz, low-bandwidth, noisy)
  • Self-Hosted deployment for HIPAA / SOC2 / on-premises
  • Up to 4 hours of audio per pre-recorded request
  • Best for: call centres, real-time meeting transcription, voice agents, compliance recording

Entrenamiento y licencia

Self-supervised pretraining on hundreds of thousands of hours of unlabelled audio plus supervised training on 50,000+ hours of curated, labelled multilingual speech. Data is sourced from licensed corpora, customer opt-in audio and publicly available datasets.

Licencia: Proprietary commercial API and Self-Hosted licence. Commercial use is permitted; Self-Hosted requires a separate enterprise agreement.

Pruebas de seguridad: SOC 2 Type II and HIPAA compliant; no model-output watermarking required for transcripts; bias testing reported in the Nova-3 launch blog.

Limitaciones conocidas

  • Word Error Rate worse than Whisper Large v3 on some long-form audiobook tasks
  • Streaming diarisation can mislabel speakers in fast cross-talk
  • Self-Hosted edition has high hardware requirements
  • Code-switching quality varies between language pairs
  • Closed weights for hosted API
04

Precios

Actualmente no disponible. No hay precio para este modelo en este momento, por lo que no se puede ejecutar.

05

API

Llama a Deepgram Nova-3 con tu clave de API de Railwail. Usa este ID de modelo en la solicitud:

Sin ejemplo de API verificado

La API pública pasa un formato de entrada diferente al que necesita este modelo. Usa el playground anterior.

06

Especificaciones

ID del modelo
nova-3
Desarrollador
Other
Entrada
Audio
Salida
Texto
Formatos de salida
JSON, SRT, VTT
Tamaño del modelo
Undisclosed (multi-billion)
Licencia
Proprietary commercial API and Self-Hosted licence. Commercial use is permitted; Self-Hosted requires a separate enterprise agreement.
Entrada del catálogo actualizada
23 de septiembre de 2026

Parámetros de entrada

Entradas y configuraciones del esquema de entrada del modelo. El ejemplo en la sección API muestra cuáles de ellas acepta la API.

  • filerequerido

    URL or upload path to audio file

    Tipo: Texto
    Predeterminado: –
    Valores permitidos: –
  • prompt

    Optional context to guide transcription

    Tipo: Texto
    Predeterminado: –
    Valores permitidos: hasta 1,000 caracteres
  • language

    Optional ISO-639-1 language code (e.g. en, de, fr)

    Tipo: Texto
    Predeterminado: –
    Valores permitidos: –
  • temperature
    Tipo: Número
    Predeterminado: 0
    Valores permitidos: 0 a 1
  • response_format
    Tipo: Opción
    Predeterminado: json
    Valores permitidos: json, text, srt o vtt

Etiquetas

  • deepgram
  • stt
  • transcription
  • realtime
  • multilingual
  • per-minute
07

Casos de uso

Para qué se utiliza

  • Real-time call-centre transcription and analytics
  • Voice agent transcript layer
  • Live closed captioning
  • Compliance recording for finance and healthcare
  • Meeting transcription with diarisation
08

Preguntas frecuentes

¿Qué es Deepgram Nova-3?

Deepgram Nova-3 es un modelo de Other en la categoría Reconocimiento de voz. Está listado en Railwail pero no se puede ejecutar en este momento.

¿Cuánto cuesta Deepgram Nova-3 en Railwail?

Deepgram Nova-3 no se puede ejecutar en Railwail en este momento, por lo que no hay precio actual. Las alternativas disponibles con precios se enumeran más abajo en esta página.

¿Qué configuraciones admite Deepgram Nova-3?

Según su esquema de entrada, Deepgram Nova-3 conoce estos parámetros: file, prompt (hasta 1,000 caracteres), language, temperature (0 a 1) y response_format (json, text, srt o vtt).

¿Qué tan rápido es Deepgram Nova-3?

Aún no hay suficientes ejecuciones medidas de Deepgram Nova-3 en Railwail para indicar un tiempo de ejecución. Depende de la entrada, la configuración y la carga en el proveedor.

¿Es Deepgram Nova-3 mejor que Incredibly Fast Whisper?

Eso depende de la tarea. Deepgram Nova-3 (Other) y Incredibly Fast Whisper (Community) son ambos modelos en la categoría Reconocimiento de voz. La página de comparación muestra sus precios y especificaciones lado a lado.

Comparar Deepgram Nova-3 y Incredibly Fast Whisper

¿Puedo usar Deepgram Nova-3 ahora mismo?

Actualmente no disponible. La página permanece en línea; las alternativas disponibles de la misma categoría se enumeran más abajo.

Todos los modelos a través de una API

Una clave API para todos los modelos en Railwail. El uso se cobra con créditos prepagados, 1 crédito = USD 0.01.