Whisper Large v3 Turbo

Talestemme-til-tekst (STT)Ikke tilgængelig
af OpenAIModell-ID: whisper-large-v3-turbo

OpenAI's distilled Whisper Large v3. ~216x realtime, 99+ languages, MIT-licensed weights.

Status
Ikke tilgængelig
Input → output
Lyd → Tekst
Udvikler
OpenAI
Opdateret
23. september 2026

Whisper Large v3 Turbo er i øjeblikket utilgængelig

Ikke tilgængelig i øjeblikket: dette model er deaktiveret.

Du kan stadig læse detaljerne på denne side. Vælg en af de tilgængelige alternativer nedenfor for at køre en sammenlignelig model med det samme.

Gå til alternativer
01

Sammenlignelige modeller

Alle i denne kategori
  • Whisper Large v3 wrapped with Hugging Face Transformers optimizations (batched inference, flash attention) for very high throughput. Transcribes hours of audio in minutes on a single GPU. Maintained by Vaibhav Srivastav. Good when you need bulk transcription fast.

    ≈ 0,0056 US$/kørsel

  • WhisperOpenAI

    OpenAI's Whisper running on Replicate. General-purpose speech recognition trained on 680k hours of multilingual audio. Transcribes and translates 99 languages, robust to accents and background noise, and outputs plain text, segments, or word-level timestamps.

    ≈ 0,0034 US$/kørsel

  • SeamlessM4TCommunity

    Meta's SeamlessM4T multimodal translation model. Takes speech or text input and produces transcription or translation across about 100 languages, including speech-to-text and speech-to-speech. One model covers ASR plus cross-lingual translation without chaining separate systems.

    ≈ 0,156 US$/kørsel

02

Playground

Prøv Whisper Large v3 Turbo

Ingen inputmaske

Derzeit nicht verfügbar

Ikke tilgængelig i øjeblikket: dette model er deaktiveret.

Playground'en er deaktiveret. Du finder sammenlignelige modeller i samme kategori: Se alternativer

03

Om Whisper Large v3 Turbo

Kort sagtFra 23. september 2026

Whisper Large v3 Turbo er en model af OpenAI i kategorien Talestemme-til-tekst (STT). Whisper Large v3 Turbo er i øjeblikket ikke tilgængelig på Railwail.

Baggrund

Om OpenAI

Grundlagt 2015 · San Francisco, California, USA

OpenAI was founded in December 2015 by Sam Altman, Elon Musk, Greg Brockman, Ilya Sutskever, Wojciech Zaremba and John Schulman, restructured to capped-profit OpenAI LP in 2019. Whisper Large v3 Turbo was released in October 2024 as a distilled fast variant of Whisper Large v3, designed to deliver approximately 8x faster inference at near-identical accuracy by reducing the decoder depth from 32 to 4 layers. The release was led by the original Whisper authors (Alec Radford, Jong Wook Kim, Tao Xu) and remained under the MIT licence. Turbo was distributed via GitHub, the Hugging Face Hub and the OpenAI Whisper API as the new default model where supported, replacing many in-production deployments of Whisper Large v3 within weeks of launch.

Besøg OpenAI

Arkitektur

Distilled encoder-decoder Transformer (4-layer decoder) for speech recognition

Whisper Large v3 Turbo is a distilled variant of Whisper Large v3 that keeps the same 32-layer audio encoder and 128-mel front-end but shrinks the decoder from 32 to just 4 Transformer layers, taking the total parameter count from 1.55B to 809M. The smaller decoder gives roughly 8x faster inference on long-form audio (and 4-5x faster on short clips) at a WER cost of approximately 0.5-1 percentage points on most benchmarks. The model was distilled on the same multilingual corpus as Large v3 (5 million hours total, of which 4 million are pseudo-labelled) with knowledge-distillation losses from the Large v3 teacher. Translation-to-English capability was deliberately removed to focus capacity on transcription quality. The 30-second sliding window, 99-language coverage and special task tokens are unchanged. Turbo runs in real-time on consumer GPUs (RTX 3060) and at 3-4x real-time on Apple Silicon CPUs via whisper.cpp.

Parametre
809M
Kontekst
30 tokens

Funktioner

  • 8x faster long-form transcription than Whisper Large v3
  • 99-language transcription with automatic language detection
  • Word-level timestamps preserved
  • Runs in real-time on a single consumer GPU (RTX 3060 / M2 Pro)
  • Half the memory footprint of Large v3 (809M vs 1.55B)
  • Open weights under MIT licence
  • Drop-in replacement for Large v3 in most pipelines
  • Best for: production ASR on commodity hardware, on-premise transcription, batch processing

Træning og licens

Distilled from Whisper Large v3 on the same 5-million-hour multilingual audio corpus with knowledge-distillation losses. Translation-to-English data was excluded.

Licens: MIT licence for code and weights; commercial use permitted.

Sikkerhedstests: Inherits all hallucination and bias caveats from Whisper Large v3; no separate red-team report.

Kendte begrænsninger

  • No translation-to-English mode (transcription only)
  • WER 0.5-1 pp worse than Large v3 on average
  • Same 30-second hard window requires chunking
  • Same hallucination behaviour on silent / music-only audio
  • No native diarisation
04

Priser

Ikke tilgængelig i øjeblikket: dette model er deaktiveret. Der er i øjeblikket ingen pris for denne model, så den kan ikke køres.

05

API

Kald Whisper Large v3 Turbo med din Railwail API-nøgle. Brug dette model-ID i anmodningen:

I øjeblikket utilgængelig

Modellen har ingen bekræftet pris eller er deaktiveret; API-kald afvises.

06

Specifikationer

Model-ID
whisper-large-v3-turbo
Udvikler
OpenAI
Input
Lyd
Output
Tekst
Outputformater
JSON, SRT, VTT
Livscyklus
Ikke tilgængelig
Modelstørrelse
809M
Licens
MIT licence for code and weights; commercial use permitted.
Katalogelement opdateret
23. september 2026

Inputparametre

Inputs og indstillinger fra modellens inputskema. Eksemplet i API-afsnittet viser, hvilke af dem API'en accepterer.

  • filepåkrævet

    URL or upload path to audio file

    Type: Tekst
    Standard: –
    Tilladte værdier: –
  • prompt

    Optional context to guide transcription

    Type: Tekst
    Standard: –
    Tilladte værdier: op til 1.000 tegn
  • language

    Optional ISO-639-1 language code (e.g. en, de, fr)

    Type: Tekst
    Standard: –
    Tilladte værdier: –
  • temperature
    Type: Tal
    Standard: 0
    Tilladte værdier: 0 til 1
  • response_format
    Type: Valg
    Standard: json
    Tilladte værdier: json, text, srt eller vtt

Tags

  • openai
  • whisper
  • stt
  • transcription
  • open-weights
  • multilingual
  • per-minute
07

Anvendelsestilfælde

Hvad det bruges til

  • Real-time transcription on consumer GPUs
  • Batch transcription of large podcast / lecture archives
  • On-device transcription via whisper.cpp
  • Cost-sensitive production ASR pipelines
  • Edge deployments where bandwidth is limited
08

Ofte stillede spørgsmål

Hvad er Whisper Large v3 Turbo?

Whisper Large v3 Turbo er en model fra OpenAI i kategorien Talestemme-til-tekst (STT). Den er opført på Railwail, men kan ikke køres i øjeblikket.

Hvad koster Whisper Large v3 Turbo på Railwail?

Whisper Large v3 Turbo kan ikke køres på Railwail i øjeblikket, så der er ingen aktuel pris. Tilgængelige alternativer med priser er angivet længere nede på denne side.

Hvilke indstillinger understøtter Whisper Large v3 Turbo?

Ifølge dens inputskema kender Whisper Large v3 Turbo disse parametre: file, prompt (op til 1.000 tegn), language, temperature (0 til 1) og response_format (json, text, srt eller vtt).

Hvor hurtig er Whisper Large v3 Turbo?

Der er endnu ikke nok målte kørsler af Whisper Large v3 Turbo på Railwail til at angive en udførelsestid. Det afhænger af inputtet, indstillingerne og belastningen hos provideren.

Er Whisper Large v3 Turbo bedre end Incredibly Fast Whisper?

Det afhænger af opgaven. Whisper Large v3 Turbo (OpenAI) og Incredibly Fast Whisper (Community) er begge modeller i kategorien Talestemme-til-tekst (STT). Sammenligningssiden viser deres priser og specifikationer side om side.

Sammenlign Whisper Large v3 Turbo og Incredibly Fast Whisper

Kan jeg bruge Whisper Large v3 Turbo lige nu?

Ikke tilgængelig i øjeblikket: dette model er deaktiveret. Siden forbliver online; tilgængelige alternativer fra samme kategori er angivet længere nede.

Alle modeller via én API

En API-nøgle til alle modeller på Railwail. Forbrug debiteres fra forudbetalte credits, 1 credit = 0,01 US$.