SeamlessM4T

Reconocimiento de vozDisponible
de CommunityID del modelo: seamless-communication

Meta's SeamlessM4T multimodal translation model. Takes speech or text input and produces transcription or translation across about 100 languages, including speech-to-text and speech-to-speech. One model covers ASR plus cross-lingual translation without chaining separate systems.

Precio
≈ USD 0.156/ejecución
Entrada → Salida
Audio → Texto
Desarrollador
Community
Actualizado
23 de septiembre de 2026
01

Playground

Probar SeamlessM4T

Entrada y salida

≈ USD 0.156/ejecución
Probar SeamlessM4T

URL or upload of the source audio

Configuración avanzada (3)

Language of input text when using a text-input task

Target language for text output (e.g. English, German)

Resultado
La transcripción aparece aquí.

Esta ejecución

aprox. USD 0.156 · 15.6 créditos

Se reservan USD 0.468 (46.8 créditos) al inicio; se factura el tiempo real de GPU.

Para cuentas sin compra previa: las ejecuciones superiores a 2 créditos requieren una recarga.

¿Nuevo aquí?

10 créditos gratis (USD 0.10) cuando te registras con Google

Utilizable 24 horas después del registro, hasta 5 ejecuciones por día y como máximo 2 créditos por ejecución. Otros métodos de inicio de sesión comienzan sin créditos.

02

Examples

Real outputs from the public examples of this model on Replicate, with the prompt and settings that produced them. They were not generated live on this page.
  • Output (JSON, shortened)

    {
      "text_output": "MetaAI's seamless M4T model is democratizing spoken communication across language barriers.",
      "audio_output": null
    }
  • Output (JSON, shortened)

    {
      "text_output": "Eg kaller Chen Xi, på kinesisk desse to ordene betyr morgon og håp ⁇",
      "audio_output": null
    }
03

Acerca de SeamlessM4T

ResumenA partir de 23 de septiembre de 2026

SeamlessM4T es un modelo de Community en la categoría Reconocimiento de voz. En Railwail, SeamlessM4T cuesta ≈ USD 0.156 por ejecución.

04

Precios

Precios en dólares estadounidenses. El uso se cobra con créditos prepagados.
Ejecución típica (≈ 133 s en L40S)USD 0.156 por ejecución
Tiempo de GPU (L40S)USD 0.00117 por segundo de GPU
  • Se factura por el tiempo de GPU que realmente toma la ejecución. Cuando comienza la ejecución, se reserva 3× el precio típico de tu saldo y se liquida después.
  • 1 crédito = USD 0.01

Calculadora de costos

Calculadora de precios

s

Típico según el proveedor: aprox. 133.3 s

Total

USD 15.60

1,560 créditos

Por ejecución

USD 0.156 · 15.6 créditos

Se factura el tiempo real de GPU; este es un estimado.

05

API

Llama a SeamlessM4T con tu clave de API de Railwail. Usa este ID de modelo en la solicitud:

Sin ejemplo de API verificado

La API pública pasa un formato de entrada diferente al que necesita este modelo. Usa el playground anterior.

06

Especificaciones

ID del modelo
seamless-communication
Desarrollador
Community
Entrada
Audio
Salida
Texto
Facturación
Por uso (tokens o tiempo de GPU)
Entrada del catálogo actualizada
23 de septiembre de 2026

Parámetros de entrada

Entradas y configuraciones del esquema de entrada del modelo. El ejemplo en la sección API muestra cuáles de ellas acepta la API.

  • input_audiorequerido

    URL or upload of the source audio

    Tipo: Texto
    Predeterminado: –
    Valores permitidos: –
  • task_name
    Tipo: Opción
    Predeterminado: ASR (Automatic Speech Recognition)
    Valores permitidos: S2ST (Speech to Speech translation), S2TT (Speech to Text translation), T2ST (Text to Speech translation), T2TT (Text to Text translation) o ASR (Automatic Speech Recognition)
  • input_text_language

    Language of input text when using a text-input task

    Tipo: Texto
    Predeterminado: –
    Valores permitidos: –
  • target_language_text_only

    Target language for text output (e.g. English, German)

    Tipo: Texto
    Predeterminado: –
    Valores permitidos: –

Etiquetas

  • replicate
  • meta
  • seamless
  • stt
  • transcription
  • translation
  • multilingual
  • open-weights
07

Casos de uso

08

Preguntas frecuentes

¿Qué es SeamlessM4T?

SeamlessM4T es un modelo de Community en la categoría Reconocimiento de voz.

¿Cuánto cuesta SeamlessM4T en Railwail?

En Railwail, SeamlessM4T cuesta ≈ USD 0.156 por ejecución. Se te cobra por lo que cada solicitud realmente usa. El uso se paga con créditos prepagados; 1 crédito equivale a USD 0.01.

¿Qué configuraciones admite SeamlessM4T?

Según su esquema de entrada, SeamlessM4T conoce estos parámetros: input_audio, task_name (S2ST (Speech to Speech translation), S2TT (Speech to Text translation), T2ST (Text to Speech translation), T2TT (Text to Text translation) o ASR (Automatic Speech Recognition)), input_text_language y target_language_text_only.

¿Qué tan rápido es SeamlessM4T?

Aún no hay suficientes ejecuciones medidas de SeamlessM4T en Railwail para indicar un tiempo de ejecución. Depende de la entrada, la configuración y la carga en el proveedor.

¿Es SeamlessM4T mejor que Incredibly Fast Whisper?

Eso depende de la tarea. SeamlessM4T (Community) y Incredibly Fast Whisper (Community) son ambos modelos en la categoría Reconocimiento de voz. La página de comparación muestra sus precios y especificaciones lado a lado.

Comparar SeamlessM4T y Incredibly Fast Whisper
09

Modelos comparables

Todos en esta categoría
  • Whisper Large v3 wrapped with Hugging Face Transformers optimizations (batched inference, flash attention) for very high throughput. Transcribes hours of audio in minutes on a single GPU. Maintained by Vaibhav Srivastav. Good when you need bulk transcription fast.

    ≈ USD 0.0056/ejecución

    96 % más barato por unidad

    Comparar SeamlessM4T vs. Incredibly Fast Whisper
  • WhisperOpenAI

    OpenAI's Whisper running on Replicate. General-purpose speech recognition trained on 680k hours of multilingual audio. Transcribes and translates 99 languages, robust to accents and background noise, and outputs plain text, segments, or word-level timestamps.

    ≈ USD 0.0034/ejecución

    98 % más barato por unidad

    Comparar SeamlessM4T vs. Whisper
  • Meta SeamlessM4T v2 Large speech mode. Speech-to-speech, speech-to-text, and text-to-speech translation across 100+ languages in a single unified model.

    ≈ USD 0.0012/ejecución

    99 % más barato por unidad

    Comparar SeamlessM4T vs. SeamlessM4T v2 Large (Speech)

Todos los modelos a través de una API

Una clave API para todos los modelos en Railwail. El uso se cobra con créditos prepagados, 1 crédito = USD 0.01.