ElevenLabs Scribe v1

Riconoscimento vocale (STT)Non disponibile
di ElevenLabsID modello: scribe-v1

ElevenLabs' STT. 99 languages, word-level timestamps, speaker diarization, audio-event tagging.

Stato
Non disponibile
Input → output
Audio → Testo
Sviluppatore
ElevenLabs
Aggiornato
25 giugno 2026

ElevenLabs Scribe v1 non è attualmente disponibile

Attualmente non disponibile: questo modello è stato disattivato.

Puoi comunque leggere i dettagli su questa pagina. Scegli una delle alternative disponibili di seguito per eseguire subito un modello comparabile.

Vai alle alternative
01

Modelli comparabili

Tutti in questa categoria
  • Whisper Large v3 wrapped with Hugging Face Transformers optimizations (batched inference, flash attention) for very high throughput. Transcribes hours of audio in minutes on a single GPU. Maintained by Vaibhav Srivastav. Good when you need bulk transcription fast.

    ≈ 0,0056 USD/esecuzione

  • WhisperOpenAI

    OpenAI's Whisper running on Replicate. General-purpose speech recognition trained on 680k hours of multilingual audio. Transcribes and translates 99 languages, robust to accents and background noise, and outputs plain text, segments, or word-level timestamps.

    ≈ 0,0034 USD/esecuzione

  • SeamlessM4TCommunity

    Meta's SeamlessM4T multimodal translation model. Takes speech or text input and produces transcription or translation across about 100 languages, including speech-to-text and speech-to-speech. One model covers ASR plus cross-lingual translation without chaining separate systems.

    ≈ 0,156 USD/esecuzione

02

Playground

Prova ElevenLabs Scribe v1

Nessuna maschera di input

Attualmente non disponibile

Attualmente non disponibile: questo modello è stato disattivato.

Il playground è disabilitato. Trovi modelli comparabili nella stessa categoria: Visualizza alternative

03

Informazioni su ElevenLabs Scribe v1

RiassuntoA partire da 25 giugno 2026

ElevenLabs Scribe v1 è un modello di ElevenLabs nella categoria Riconoscimento vocale (STT). ElevenLabs Scribe v1 non è attualmente disponibile su Railwail.

Sfondo

Informazioni su ElevenLabs

Fondato 2022 · London, UK / New York, USA

ElevenLabs was founded in 2022 by Piotr Dabkowski and Mati Staniszewski, two Polish technologists who had worked at Google and Palantir. The company became famous for high-quality multilingual text-to-speech and AI dubbing, and in February 2025 expanded into the inverse problem with Scribe v1, the company's first dedicated automatic speech recognition model. Scribe was developed in part to power ElevenLabs' Dubbing Studio (transcribe source audio, translate, then re-synthesise in the target language), and is offered as a standalone API to enterprise customers who want a single vendor for the full STT-to-TTS pipeline. ElevenLabs has raised over $280M to date, with a Series C in January 2025 at a $3.3B valuation.

Visita ElevenLabs

Architettura

Proprietary encoder-decoder speech-to-text Transformer

ElevenLabs Scribe v1 is a hosted automatic speech recognition model launched in February 2025. ElevenLabs has not published a technical report, but the launch blog describes a Transformer encoder-decoder ASR architecture trained on a large multilingual speech corpus covering 99 languages, with particular emphasis on accuracy in long-tail languages where Whisper Large v3 underperforms. Scribe outperformed Whisper Large v3 and Deepgram Nova-2 in the company's published FLEURS and Common Voice evaluations across many language pairs, and ranked first overall in a head-to-head benchmark on Hindi, Mandarin, German and Italian. The model supports speaker diarisation up to 32 speakers, word-level timestamps with sub-100 ms precision, character-level confidence scores, automatic non-speech event detection ([applause], [laughter], [music]) and audio-event classification. Maximum file size is 1 GB and maximum audio length is 2 hours per request.

Parametri
Undisclosed
Contesto
7200 token

Capacità

  • 99-language multilingual ASR including many low-resource languages
  • Speaker diarisation up to 32 speakers
  • Word-level timestamps with sub-100 ms precision
  • Non-speech event detection ([applause], [laughter], [music])
  • Character-level confidence scores
  • Up to 2 hours per request, 1 GB file limit
  • Direct integration with ElevenLabs Dubbing Studio (STT to translate to TTS)
  • Best for: dubbing pipelines, multilingual transcription, podcast indexing, media analytics

Addestramento e licenza

Not disclosed. ElevenLabs reports training on a 'large multilingual corpus' with curation for long-tail languages; data is described as a mix of licensed and crowd-sourced opt-in audio.

Licenza: Proprietary commercial API. Commercial use permitted on paid plans.

Test di sicurezza: Same KYC and identity-verification practices as the rest of the ElevenLabs platform; no formal red-team report for ASR.

Limitazioni note

  • No streaming mode at launch (file-based only)
  • Hard cap of 2 hours per request
  • Pricing per minute higher than Deepgram Nova-3 for English
  • Closed weights, hosted only
  • Diarisation accuracy degrades in noisy cross-talk
04

Prezzi

Attualmente non disponibile: questo modello è stato disattivato. Al momento non c'è un prezzo per questo modello, quindi non può essere eseguito.

05

API

Chiama ElevenLabs Scribe v1 con la tua chiave API Railwail. Usa questo ID modello nella richiesta:

Nessun esempio API verificato

L'API pubblica passa un formato di input diverso da quello richiesto da questo modello. Usa il playground sopra.

06

Specifiche

ID modello
scribe-v1
Sviluppatore
ElevenLabs
Input
Audio
Output
Testo
Dimensione del modello
Undisclosed
Licenza
Proprietary commercial API. Commercial use permitted on paid plans.
Voce di catalogo aggiornata
25 giugno 2026

Etichette

  • elevenlabs
  • scribe
  • stt
  • transcription
  • diarization
  • per-minute
07

Casi d'uso

A cosa serve

  • AI dubbing pipelines (STT to translate to TTS)
  • Multilingual podcast and media transcription
  • Search and indexing of audio archives
  • Meeting transcription with speaker diarisation
  • Accessibility captioning for video
08

Domande frequenti

Cos'è ElevenLabs Scribe v1?

ElevenLabs Scribe v1 è un modello di ElevenLabs nella categoria Riconoscimento vocale (STT). È elencato su Railwail ma non può essere eseguito al momento.

Quanto costa ElevenLabs Scribe v1 su Railwail?

ElevenLabs Scribe v1 non può essere eseguito su Railwail al momento, quindi non c'è un prezzo attuale. Le alternative disponibili con i prezzi sono elencate più in basso in questa pagina.

Quanto è veloce ElevenLabs Scribe v1?

Non ci sono ancora abbastanza esecuzioni misurate di ElevenLabs Scribe v1 su Railwail per indicare un tempo di esecuzione. Dipende dall'input, dalle impostazioni e dal carico presso il provider.

ElevenLabs Scribe v1 è migliore di Incredibly Fast Whisper?

Dipende dall'attività. ElevenLabs Scribe v1 (ElevenLabs) e Incredibly Fast Whisper (Community) sono entrambi modelli nella categoria Riconoscimento vocale (STT). La pagina di confronto mostra i loro prezzi e le specifiche affiancati.

Confronta ElevenLabs Scribe v1 e Incredibly Fast Whisper

Posso usare ElevenLabs Scribe v1 adesso?

Attualmente non disponibile: questo modello è stato disattivato. La pagina rimane online; le alternative disponibili della stessa categoria sono elencate più in basso.

Tutti i modelli tramite un'API

Una chiave API per tutti i modelli su Railwail. L'utilizzo viene addebitato da crediti prepagati, 1 credito = 0,01 USD.