SeamlessM4T
seamless-communicationMeta's SeamlessM4T multimodal translation model. Takes speech or text input and produces transcription or translation across about 100 languages, including speech-to-text and speech-to-speech. One model covers ASR plus cross-lingual translation without chaining separate systems.
- Precio
- ≈ USD 0.156/ejecución
- Entrada → Salida
- Audio → Texto
- Desarrollador
- Community
- Actualizado
- 23 de septiembre de 2026
Playground
Probar SeamlessM4T
Entrada y salida
Esta ejecución
aprox. USD 0.156 · 15.6 créditos
Se reservan USD 0.468 (46.8 créditos) al inicio; se factura el tiempo real de GPU.
Para cuentas sin compra previa: las ejecuciones superiores a 2 créditos requieren una recarga.
¿Nuevo aquí?
10 créditos gratis (USD 0.10) cuando te registras con Google
Utilizable 24 horas después del registro, hasta 5 ejecuciones por día y como máximo 2 créditos por ejecución. Otros métodos de inicio de sesión comienzan sin créditos.
Examples
- Duración: 0:08
Output (JSON, shortened)
{ "text_output": "MetaAI's seamless M4T model is democratizing spoken communication across language barriers.", "audio_output": null }Output (JSON, shortened)
{ "text_output": "Eg kaller Chen Xi, på kinesisk desse to ordene betyr morgon og håp ⁇", "audio_output": null }
Acerca de SeamlessM4T
SeamlessM4T es un modelo de Community en la categoría Reconocimiento de voz. En Railwail, SeamlessM4T cuesta ≈ USD 0.156 por ejecución.
Precios
| Ejecución típica (≈ 133 s en L40S) | USD 0.156 por ejecución |
|---|---|
| Tiempo de GPU (L40S) | USD 0.00117 por segundo de GPU |
- Se factura por el tiempo de GPU que realmente toma la ejecución. Cuando comienza la ejecución, se reserva 3× el precio típico de tu saldo y se liquida después.
- 1 crédito = USD 0.01
Calculadora de costos
Calculadora de precios
Típico según el proveedor: aprox. 133.3 s
Total
USD 15.60
1,560 créditos
Por ejecución
USD 0.156 · 15.6 créditos
Se factura el tiempo real de GPU; este es un estimado.
API
Sin ejemplo de API verificado
La API pública pasa un formato de entrada diferente al que necesita este modelo. Usa el playground anterior.
Especificaciones
- ID del modelo
seamless-communication- Desarrollador
- Community
- Categoría
- Reconocimiento de voz
- Entrada
- Audio
- Salida
- Texto
- Facturación
- Por uso (tokens o tiempo de GPU)
- Entrada del catálogo actualizada
- 23 de septiembre de 2026
Parámetros de entrada
Entradas y configuraciones del esquema de entrada del modelo. El ejemplo en la sección API muestra cuáles de ellas acepta la API.
input_audiorequeridoURL or upload of the source audio
Tipo: TextoPredeterminado: –Valores permitidos: –task_nameTipo: OpciónPredeterminado:ASR (Automatic Speech Recognition)Valores permitidos: S2ST (Speech to Speech translation), S2TT (Speech to Text translation), T2ST (Text to Speech translation), T2TT (Text to Text translation) o ASR (Automatic Speech Recognition)input_text_languageLanguage of input text when using a text-input task
Tipo: TextoPredeterminado: –Valores permitidos: –target_language_text_onlyTarget language for text output (e.g. English, German)
Tipo: TextoPredeterminado: –Valores permitidos: –
Etiquetas
- replicate
- meta
- seamless
- stt
- transcription
- translation
- multilingual
- open-weights
Casos de uso
Preguntas frecuentes
¿Qué es SeamlessM4T?
SeamlessM4T es un modelo de Community en la categoría Reconocimiento de voz.
¿Cuánto cuesta SeamlessM4T en Railwail?
En Railwail, SeamlessM4T cuesta ≈ USD 0.156 por ejecución. Se te cobra por lo que cada solicitud realmente usa. El uso se paga con créditos prepagados; 1 crédito equivale a USD 0.01.
¿Qué configuraciones admite SeamlessM4T?
Según su esquema de entrada, SeamlessM4T conoce estos parámetros: input_audio, task_name (S2ST (Speech to Speech translation), S2TT (Speech to Text translation), T2ST (Text to Speech translation), T2TT (Text to Text translation) o ASR (Automatic Speech Recognition)), input_text_language y target_language_text_only.
¿Qué tan rápido es SeamlessM4T?
Aún no hay suficientes ejecuciones medidas de SeamlessM4T en Railwail para indicar un tiempo de ejecución. Depende de la entrada, la configuración y la carga en el proveedor.
¿Es SeamlessM4T mejor que Incredibly Fast Whisper?
Eso depende de la tarea. SeamlessM4T (Community) y Incredibly Fast Whisper (Community) son ambos modelos en la categoría Reconocimiento de voz. La página de comparación muestra sus precios y especificaciones lado a lado.
Comparar SeamlessM4T y Incredibly Fast WhisperModelos comparables
Todos en esta categoría- Incredibly Fast WhisperCommunity
Whisper Large v3 wrapped with Hugging Face Transformers optimizations (batched inference, flash attention) for very high throughput. Transcribes hours of audio in minutes on a single GPU. Maintained by Vaibhav Srivastav. Good when you need bulk transcription fast.
- WhisperOpenAI
OpenAI's Whisper running on Replicate. General-purpose speech recognition trained on 680k hours of multilingual audio. Transcribes and translates 99 languages, robust to accents and background noise, and outputs plain text, segments, or word-level timestamps.
- SeamlessM4T v2 Large (Speech)Community
Meta SeamlessM4T v2 Large speech mode. Speech-to-speech, speech-to-text, and text-to-speech translation across 100+ languages in a single unified model.
≈ USD 0.0012/ejecución
99 % más barato por unidad
Comparar SeamlessM4T vs. SeamlessM4T v2 Large (Speech)
Todos los modelos a través de una API
Una clave API para todos los modelos en Railwail. El uso se cobra con créditos prepagados, 1 crédito = USD 0.01.