Molmo 7B

MultimodalDisponible
de CommunityID del modelo: molmo-7b

Allen AI Molmo 7B-D on Replicate. Open vision-language model trained on the PixMo data, notable for pointing at and locating objects in images, not just describing them.

Precio
≈ USD 0.0505/ejecución
Entrada → Salida
Texto + Imagen → Texto
Desarrollador
Community
Actualizado
23 de septiembre de 2026
01

Playground

Probar Molmo 7B

Entrada y salida

≈ USD 0.0505/ejecución
Probar Molmo 7B

0 / 16,000

Configuración avanzada (1)
Resultado
La respuesta aparece aquí.

Esta ejecución

aprox. USD 0.0505 · 5.05 créditos

Se reservan USD 0.1513 (15.13 créditos) al inicio; se factura el tiempo real de GPU.

Para cuentas sin compra previa: las ejecuciones superiores a 2 créditos requieren una recarga.

¿Nuevo aquí?

10 créditos gratis (USD 0.10) cuando te registras con Google

Utilizable 24 horas después del registro, hasta 5 ejecuciones por día y como máximo 2 créditos por ejecución. Otros métodos de inicio de sesión comienzan sin créditos.

02

Examples

Real outputs from the public examples of this model on Replicate, with the prompt and settings that produced them. They were not generated live on this page.
  • InputInput

    Prompt

    What do you see? Give me a detailed answer

    Response

    I see a charming scene featuring a large, fluffy white dog sitting on a wooden bench in the middle of a field. The dog appears to be a poodle mix, with curly fur covering its entire body. It's sitting upright with its front paws hanging over the edge of the bench, looking directly at the camera with a happy expression. The dog's tongue is hanging out, and its eyes are dark and expressive. The bench is made of dark brown wood with a lattice design on the backrest. It's positioned on a patch of brown, dead grass, which suggests it might be late fall or early winter. In the background, there's a vast field filled with tall, brown grass, and further back, I can see a line of bare trees against a light blue sky. The overall atmosphere is peaceful and serene. The dog seems to be enjoying its time outdoors, perhaps waiting for its owner or just taking in the scenery. The contrast between the white, fluffy dog and the brown

03

Acerca de Molmo 7B

ResumenA partir de 23 de septiembre de 2026

Molmo 7B es un modelo de Community en la categoría Multimodal. En Railwail, Molmo 7B cuesta ≈ USD 0.0505 por ejecución.

Molmo 7B-D from Allen AI is an open vision-language model trained on the PixMo human-annotated dataset. Beyond captioning and visual question answering it can point to and localize specific objects in an image, returning coordinates, which is useful for grounding and agentic UI tasks. This Replicate endpoint takes an image plus a prompt and returns text answers or pointing outputs. Fully open weights and data.
04

Precios

Precios en dólares estadounidenses. El uso se cobra con créditos prepagados.
Ejecución típica (≈ 43 s en L40S)USD 0.0505 por ejecución
Tiempo de GPU (L40S)USD 0.00117 por segundo de GPU
  • Se factura por el tiempo de GPU que realmente toma la ejecución. Cuando comienza la ejecución, se reserva 3× el precio típico de tu saldo y se liquida después.
  • 1 crédito = USD 0.01

Calculadora de costos

Calculadora de precios

s

Típico según el proveedor: aprox. 43.1 s

Total

USD 5.05

505 créditos

Por ejecución

USD 0.0505 · 5.05 créditos

Se factura el tiempo real de GPU; este es un estimado.

05

API

Llama a Molmo 7B con tu clave de API de Railwail. Usa este ID de modelo en la solicitud:

Sin ejemplo de API verificado

La API pública pasa un formato de entrada diferente al que necesita este modelo. Usa el playground anterior.

06

Especificaciones

ID del modelo
molmo-7b
Desarrollador
Community
Categoría
Multimodal
Entrada
Texto, Imagen
Salida
Texto
Facturación
Por uso (tokens o tiempo de GPU)
Entrada del catálogo actualizada
23 de septiembre de 2026

Parámetros de entrada

Entradas y configuraciones del esquema de entrada del modelo. El ejemplo en la sección API muestra cuáles de ellas acepta la API.

  • promptrequerido

    Question about the image

    Tipo: Texto
    Predeterminado: –
    Valores permitidos: hasta 16,000 caracteres
  • image_url

    Image URL to analyze

    Tipo: Texto
    Predeterminado: –
    Valores permitidos: –
  • max_tokens
    Tipo: Número entero
    Predeterminado: 1024
    Valores permitidos: 1 a 4,096

Etiquetas

  • replicate
  • allenai
  • molmo
  • vision-understanding
  • open-weights
  • grounding
07

Preguntas frecuentes

¿Qué es Molmo 7B?

Molmo 7B es un modelo de Community en la categoría Multimodal.

¿Cuánto cuesta Molmo 7B en Railwail?

En Railwail, Molmo 7B cuesta ≈ USD 0.0505 por ejecución. Se te cobra por lo que cada solicitud realmente usa. El uso se paga con créditos prepagados; 1 crédito equivale a USD 0.01.

¿Qué configuraciones admite Molmo 7B?

Según su esquema de entrada, Molmo 7B conoce estos parámetros: prompt (hasta 16,000 caracteres), image_url y max_tokens (1 a 4,096).

¿Qué tan rápido es Molmo 7B?

Aún no hay suficientes ejecuciones medidas de Molmo 7B en Railwail para indicar un tiempo de ejecución. Depende de la entrada, la configuración y la carga en el proveedor.

¿Es Molmo 7B mejor que BLIP?

Eso depende de la tarea. Molmo 7B (Community) y BLIP (Salesforce) son ambos modelos en la categoría Multimodal. La página de comparación muestra sus precios y especificaciones lado a lado.

Comparar Molmo 7B y BLIP

¿Puede Molmo 7B procesar imágenes?

Sí. Molmo 7B acepta imágenes como entrada además de texto.

08

Modelos comparables

Todos en esta categoría
  • BLIPSalesforce

    Salesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.

    ≈ USD 0.00030/ejecución

    99 % más barato por unidad

    Comparar Molmo 7B vs. BLIP
  • pharmapsychotic's CLIP Interrogator. Takes an image and produces a Stable-Diffusion-style text prompt by combining BLIP captioning with CLIP to rank likely subjects, artists, mediums and styles. Commonly used to reverse-engineer a prompt from an existing picture.

    ≈ USD 0.0457/ejecución

    10 % más barato por unidad

    Comparar Molmo 7B vs. CLIP Interrogator
  • Monocular depth-estimation model trained on 595k labeled and 62M unlabeled images. Strong zero-shot generalization in indoor and outdoor scenes.

    ≈ USD 0.0050/ejecución

    90 % más barato por unidad

    Comparar Molmo 7B vs. Depth Anything v2

Todos los modelos a través de una API

Una clave API para todos los modelos en Railwail. El uso se cobra con créditos prepagados, 1 crédito = USD 0.01.