Whisper Large v3 Turbo

Taligenkänning (STT)Inte tillgänglig
av OpenAIModell-ID: whisper-large-v3-turbo

OpenAI's distilled Whisper Large v3. ~216x realtime, 99+ languages, MIT-licensed weights.

Status
Inte tillgänglig
Inmatning → utmatning
Audio → Text
Utvecklare
OpenAI
Uppdaterad
23 september 2026

Whisper Large v3 Turbo är för närvarande otillgänglig

Inte tillgänglig för närvarande: denna modell är inaktiverad.

Du kan fortfarande läsa detaljerna på denna sida. Välj ett av de tillgängliga alternativen nedan för att köra en jämförbar modell direkt.

Gå till alternativ
01

Jämförbara modeller

Alla i denna kategori
  • Whisper Large v3 wrapped with Hugging Face Transformers optimizations (batched inference, flash attention) for very high throughput. Transcribes hours of audio in minutes on a single GPU. Maintained by Vaibhav Srivastav. Good when you need bulk transcription fast.

    ≈ 0,0056 US$/körning

  • WhisperOpenAI

    OpenAI's Whisper running on Replicate. General-purpose speech recognition trained on 680k hours of multilingual audio. Transcribes and translates 99 languages, robust to accents and background noise, and outputs plain text, segments, or word-level timestamps.

    ≈ 0,0034 US$/körning

  • SeamlessM4TCommunity

    Meta's SeamlessM4T multimodal translation model. Takes speech or text input and produces transcription or translation across about 100 languages, including speech-to-text and speech-to-speech. One model covers ASR plus cross-lingual translation without chaining separate systems.

    ≈ 0,156 US$/körning

02

Playground

Prova Whisper Large v3 Turbo

Ingen inmatningsformulär

Inte tillgänglig för närvarande

Inte tillgänglig för närvarande: denna modell är inaktiverad.

Lekplatsen är inaktiverad. Du hittar jämförbara modeller i samma kategori: Visa alternativ

03

Om Whisper Large v3 Turbo

Kort sagtFrån och med 23 september 2026

Whisper Large v3 Turbo är en modell av OpenAI i kategorin Taligenkänning (STT). Whisper Large v3 Turbo är för närvarande inte tillgänglig på Railwail.

Bakgrund

Om OpenAI

Grundat 2015 · San Francisco, California, USA

OpenAI was founded in December 2015 by Sam Altman, Elon Musk, Greg Brockman, Ilya Sutskever, Wojciech Zaremba and John Schulman, restructured to capped-profit OpenAI LP in 2019. Whisper Large v3 Turbo was released in October 2024 as a distilled fast variant of Whisper Large v3, designed to deliver approximately 8x faster inference at near-identical accuracy by reducing the decoder depth from 32 to 4 layers. The release was led by the original Whisper authors (Alec Radford, Jong Wook Kim, Tao Xu) and remained under the MIT licence. Turbo was distributed via GitHub, the Hugging Face Hub and the OpenAI Whisper API as the new default model where supported, replacing many in-production deployments of Whisper Large v3 within weeks of launch.

Besök OpenAI

Arkitektur

Distilled encoder-decoder Transformer (4-layer decoder) for speech recognition

Whisper Large v3 Turbo is a distilled variant of Whisper Large v3 that keeps the same 32-layer audio encoder and 128-mel front-end but shrinks the decoder from 32 to just 4 Transformer layers, taking the total parameter count from 1.55B to 809M. The smaller decoder gives roughly 8x faster inference on long-form audio (and 4-5x faster on short clips) at a WER cost of approximately 0.5-1 percentage points on most benchmarks. The model was distilled on the same multilingual corpus as Large v3 (5 million hours total, of which 4 million are pseudo-labelled) with knowledge-distillation losses from the Large v3 teacher. Translation-to-English capability was deliberately removed to focus capacity on transcription quality. The 30-second sliding window, 99-language coverage and special task tokens are unchanged. Turbo runs in real-time on consumer GPUs (RTX 3060) and at 3-4x real-time on Apple Silicon CPUs via whisper.cpp.

Parameter
809M
Kontext
30 tokens

Funktioner

  • 8x faster long-form transcription than Whisper Large v3
  • 99-language transcription with automatic language detection
  • Word-level timestamps preserved
  • Runs in real-time on a single consumer GPU (RTX 3060 / M2 Pro)
  • Half the memory footprint of Large v3 (809M vs 1.55B)
  • Open weights under MIT licence
  • Drop-in replacement for Large v3 in most pipelines
  • Best for: production ASR on commodity hardware, on-premise transcription, batch processing

Träning & licens

Distilled from Whisper Large v3 on the same 5-million-hour multilingual audio corpus with knowledge-distillation losses. Translation-to-English data was excluded.

Licens: MIT licence for code and weights; commercial use permitted.

Säkerhetstestning: Inherits all hallucination and bias caveats from Whisper Large v3; no separate red-team report.

Kända begränsningar

  • No translation-to-English mode (transcription only)
  • WER 0.5-1 pp worse than Large v3 on average
  • Same 30-second hard window requires chunking
  • Same hallucination behaviour on silent / music-only audio
  • No native diarisation
04

Priser

Inte tillgänglig för närvarande: denna modell är inaktiverad. Det finns ingen pris för denna modell för närvarande, så den kan inte köras.

05

API

Anropa Whisper Large v3 Turbo med din Railwail API-nyckel. Använd detta modell-ID i begäran:

För närvarande otillgänglig

Modellen har inget verifierat pris eller är inaktiverad; API-anrop avvisas.

06

Specifikationer

Modell-ID
whisper-large-v3-turbo
Utvecklare
OpenAI
Inmatning
Audio
Utmatning
Text
Utmatningsformat
JSON, SRT, VTT
Livscykel
Inte tillgänglig
Modellstorlek
809M
Licens
MIT licence for code and weights; commercial use permitted.
Kataloginlägg uppdaterat
23 september 2026

Indataparametrar

Inmatningar och inställningar från modellens indataschema. Exemplet i API-avsnittet visar vilka som API:et accepterar.

  • fileobligatorisk

    URL or upload path to audio file

    Typ: Text
    Standard: –
    Tillåtna värden: –
  • prompt

    Optional context to guide transcription

    Typ: Text
    Standard: –
    Tillåtna värden: upp till 1 000 tecken
  • language

    Optional ISO-639-1 language code (e.g. en, de, fr)

    Typ: Text
    Standard: –
    Tillåtna värden: –
  • temperature
    Typ: Tal
    Standard: 0
    Tillåtna värden: 0 till 1
  • response_format
    Typ: Val
    Standard: json
    Tillåtna värden: json, text, srt eller vtt

Taggar

  • openai
  • whisper
  • stt
  • transcription
  • open-weights
  • multilingual
  • per-minute
07

Användningsfall

Vad det används till

  • Real-time transcription on consumer GPUs
  • Batch transcription of large podcast / lecture archives
  • On-device transcription via whisper.cpp
  • Cost-sensitive production ASR pipelines
  • Edge deployments where bandwidth is limited
08

Vanliga frågor

Vad är Whisper Large v3 Turbo?

Whisper Large v3 Turbo är en modell av OpenAI i kategorin Taligenkänning (STT). Den finns i Railwail-katalogen men kan inte köras för närvarande.

Vad kostar Whisper Large v3 Turbo på Railwail?

Whisper Large v3 Turbo kan inte köras på Railwail för närvarande, så det finns inget aktuellt pris. Tillgängliga alternativ med priser visas längre ned på denna sida.

Vilka inställningar stöder Whisper Large v3 Turbo?

Enligt sitt inmatningsschema känner Whisper Large v3 Turbo till dessa parametrar: file, prompt (upp till 1 000 tecken), language, temperature (0 till 1) och response_format (json, text, srt eller vtt).

Hur snabb är Whisper Large v3 Turbo?

Det finns ännu inte tillräckligt många uppmätta körningar av Whisper Large v3 Turbo på Railwail för att ange en körningstid. Det beror på inmatningen, inställningarna och belastningen hos leverantören.

Är Whisper Large v3 Turbo bättre än Incredibly Fast Whisper?

Det beror på uppgiften. Whisper Large v3 Turbo (OpenAI) och Incredibly Fast Whisper (Community) är båda modeller i kategorin Taligenkänning (STT). Jämförelsesidan visar deras priser och specifikationer sida vid sida.

Jämför Whisper Large v3 Turbo och Incredibly Fast Whisper

Kan jag använda Whisper Large v3 Turbo just nu?

Inte tillgänglig för närvarande: denna modell är inaktiverad. Sidan förblir online; tillgängliga alternativ från samma kategori visas längre ned.

Alla modeller via ett API

En API-nyckel för alla modeller på Railwail. Användningen debiteras från förbetald kredit, 1 kredit = 0,01 US$.