ElevenLabs Scribe v1

Αναγνώριση ομιλίαςΜη διαθέσιμο
από ElevenLabsΑναγνωριστικό μοντέλου: scribe-v1

ElevenLabs' STT. 99 languages, word-level timestamps, speaker diarization, audio-event tagging.

Κατάσταση
Μη διαθέσιμο
Είσοδος → Έξοδος
Ήχος → Κείμενο
Προγραμματιστής
ElevenLabs
Ενημερώθηκε
25 Ιουνίου 2026

Το ElevenLabs Scribe v1 δεν είναι διαθέσιμο αυτή τη στιγμή

Προς το παρόν μη διαθέσιμο: αυτό το μοντέλο έχει απενεργοποιηθεί.

Μπορείτε να διαβάσετε τις λεπτομέρειες σε αυτήν τη σελίδα. Επιλέξτε μία από τις διαθέσιμες εναλλακτικές λύσεις παρακάτω για να εκτελέσετε αμέσως ένα συγκρίσιμο μοντέλο.

Μετάβαση στις εναλλακτικές λύσεις
01

Συγκρίσιμα μοντέλα

Όλα σε αυτήν την κατηγορία
  • Whisper Large v3 wrapped with Hugging Face Transformers optimizations (batched inference, flash attention) for very high throughput. Transcribes hours of audio in minutes on a single GPU. Maintained by Vaibhav Srivastav. Good when you need bulk transcription fast.

    ≈ 0,0056 $/εκτέλεση

  • WhisperOpenAI

    OpenAI's Whisper running on Replicate. General-purpose speech recognition trained on 680k hours of multilingual audio. Transcribes and translates 99 languages, robust to accents and background noise, and outputs plain text, segments, or word-level timestamps.

    ≈ 0,0034 $/εκτέλεση

  • SeamlessM4TCommunity

    Meta's SeamlessM4T multimodal translation model. Takes speech or text input and produces transcription or translation across about 100 languages, including speech-to-text and speech-to-speech. One model covers ASR plus cross-lingual translation without chaining separate systems.

    ≈ 0,156 $/εκτέλεση

02

Playground

Δοκιμάστε ElevenLabs Scribe v1

Χωρίς φόρμα εισόδου

Προς το παρόν μη διαθέσιμο

Προς το παρόν μη διαθέσιμο: αυτό το μοντέλο έχει απενεργοποιηθεί.

Το playground είναι απενεργοποιημένο. Μπορείτε να βρείτε συγκρίσιμα μοντέλα στην ίδια κατηγορία: Περιήγηση εναλλακτικών λύσεων

03

Σχετικά με το ElevenLabs Scribe v1

ΣύντομαΗμερομηνία: 25 Ιουνίου 2026

Το ElevenLabs Scribe v1 είναι ένα μοντέλο του ElevenLabs στην κατηγορία Αναγνώριση ομιλίας. Το ElevenLabs Scribe v1 δεν είναι διαθέσιμο στο Railwail αυτή τη στιγμή.

Φόντο

Σχετικά με ElevenLabs

Ιδρύθηκε 2022 · London, UK / New York, USA

ElevenLabs was founded in 2022 by Piotr Dabkowski and Mati Staniszewski, two Polish technologists who had worked at Google and Palantir. The company became famous for high-quality multilingual text-to-speech and AI dubbing, and in February 2025 expanded into the inverse problem with Scribe v1, the company's first dedicated automatic speech recognition model. Scribe was developed in part to power ElevenLabs' Dubbing Studio (transcribe source audio, translate, then re-synthesise in the target language), and is offered as a standalone API to enterprise customers who want a single vendor for the full STT-to-TTS pipeline. ElevenLabs has raised over $280M to date, with a Series C in January 2025 at a $3.3B valuation.

Επισκεφθείτε ElevenLabs

Αρχιτεκτονική

Proprietary encoder-decoder speech-to-text Transformer

ElevenLabs Scribe v1 is a hosted automatic speech recognition model launched in February 2025. ElevenLabs has not published a technical report, but the launch blog describes a Transformer encoder-decoder ASR architecture trained on a large multilingual speech corpus covering 99 languages, with particular emphasis on accuracy in long-tail languages where Whisper Large v3 underperforms. Scribe outperformed Whisper Large v3 and Deepgram Nova-2 in the company's published FLEURS and Common Voice evaluations across many language pairs, and ranked first overall in a head-to-head benchmark on Hindi, Mandarin, German and Italian. The model supports speaker diarisation up to 32 speakers, word-level timestamps with sub-100 ms precision, character-level confidence scores, automatic non-speech event detection ([applause], [laughter], [music]) and audio-event classification. Maximum file size is 1 GB and maximum audio length is 2 hours per request.

Παράμετροι
Undisclosed
Περιεχόμενο
7,200 tokens

Δυνατότητες

  • 99-language multilingual ASR including many low-resource languages
  • Speaker diarisation up to 32 speakers
  • Word-level timestamps with sub-100 ms precision
  • Non-speech event detection ([applause], [laughter], [music])
  • Character-level confidence scores
  • Up to 2 hours per request, 1 GB file limit
  • Direct integration with ElevenLabs Dubbing Studio (STT to translate to TTS)
  • Best for: dubbing pipelines, multilingual transcription, podcast indexing, media analytics

Εκπαίδευση & άδεια

Not disclosed. ElevenLabs reports training on a 'large multilingual corpus' with curation for long-tail languages; data is described as a mix of licensed and crowd-sourced opt-in audio.

Άδεια: Proprietary commercial API. Commercial use permitted on paid plans.

Δοκιμές ασφάλειας: Same KYC and identity-verification practices as the rest of the ElevenLabs platform; no formal red-team report for ASR.

Γνωστοί περιορισμοί

  • No streaming mode at launch (file-based only)
  • Hard cap of 2 hours per request
  • Pricing per minute higher than Deepgram Nova-3 for English
  • Closed weights, hosted only
  • Diarisation accuracy degrades in noisy cross-talk
04

Τιμολόγηση

Προς το παρόν μη διαθέσιμο: αυτό το μοντέλο έχει απενεργοποιηθεί. Δεν υπάρχει τιμή για αυτό το μοντέλο αυτή τη στιγμή, επομένως δεν μπορεί να εκτελεστεί.

05

API

Καλέστε το ElevenLabs Scribe v1 με το κλειδί Railwail API. Χρησιμοποιήστε αυτό το ID μοντέλου στο αίτημα:

Κανένα επαληθευμένο παράδειγμα API

Το δημόσιο API περνά μια διαφορετική μορφή εισόδου από αυτή που χρειάζεται αυτό το μοντέλο. Χρησιμοποιήστε το playground παραπάνω.

06

Προδιαγραφές

ID μοντέλου
scribe-v1
Ανάπτυξη
ElevenLabs
Είσοδος
Ήχος
Έξοδος
Κείμενο
Μέγεθος μοντέλου
Undisclosed
Άδεια
Proprietary commercial API. Commercial use permitted on paid plans.
Καταχώρηση καταλόγου ενημερώθηκε
25 Ιουνίου 2026

Ετικέτες

  • elevenlabs
  • scribe
  • stt
  • transcription
  • diarization
  • per-minute
07

Περιπτώσεις χρήσης

Για τι χρησιμοποιείται

  • AI dubbing pipelines (STT to translate to TTS)
  • Multilingual podcast and media transcription
  • Search and indexing of audio archives
  • Meeting transcription with speaker diarisation
  • Accessibility captioning for video
08

Συχνές ερωτήσεις

Τι είναι ElevenLabs Scribe v1;

Το ElevenLabs Scribe v1 είναι ένα μοντέλο του ElevenLabs στην κατηγορία Αναγνώριση ομιλίας. Είναι καταχωρημένο στο Railwail αλλά δεν μπορεί να εκτελεστεί αυτή τη στιγμή.

Πόσο κοστίζει το ElevenLabs Scribe v1 στο Railwail;

Το ElevenLabs Scribe v1 δεν μπορεί να εκτελεστεί στο Railwail αυτή τη στιγμή, επομένως δεν υπάρχει τρέχουσα τιμή. Διαθέσιμες εναλλακτικές λύσεις με τιμές παρατίθενται παρακάτω σε αυτήν τη σελίδα.

Πόσο γρήγορο είναι το ElevenLabs Scribe v1;

Δεν υπάρχουν αρκετές μετρημένες εκτελέσεις του ElevenLabs Scribe v1 στο Railwail ακόμα για να δηλωθεί ένας χρόνος εκτέλεσης. Εξαρτάται από την είσοδο, τις ρυθμίσεις και το φορτίο στον πάροχο.

Είναι το ElevenLabs Scribe v1 καλύτερο από το Incredibly Fast Whisper;

Αυτό εξαρτάται από την εργασία. Το ElevenLabs Scribe v1 (ElevenLabs) και το Incredibly Fast Whisper (Community) είναι και τα δύο μοντέλα στην κατηγορία Αναγνώριση ομιλίας. Η σελίδα σύγκρισης δείχνει τις τιμές και τις προδιαγραφές τους παράλληλα.

Σύγκριση ElevenLabs Scribe v1 και Incredibly Fast Whisper

Μπορώ να χρησιμοποιήσω το ElevenLabs Scribe v1 τώρα;

Προς το παρόν μη διαθέσιμο: αυτό το μοντέλο έχει απενεργοποιηθεί. Η σελίδα παραμένει ενεργή· διαθέσιμες εναλλακτικές λύσεις από την ίδια κατηγορία παρατίθενται παρακάτω.

Όλα τα μοντέλα μέσω ενός API

Ένα κλειδί API για κάθε μοντέλο στο Railwail. Η χρήση χρεώνεται από προπληρωμένα πιστωτικά, 1 πιστωτικό = 0,01 $.