Molmo 7B

MultimodalDisponível
por CommunityID do modelo: molmo-7b

Allen AI Molmo 7B-D on Replicate. Open vision-language model trained on the PixMo data, notable for pointing at and locating objects in images, not just describing them.

Preço
≈ US$ 0,0505/execução
Entrada → Saída
Texto + Imagem → Texto
Desenvolvedor
Community
Atualizado
23 de setembro de 2026
01

Playground

Experimentar Molmo 7B

Entrada & saída

≈ US$ 0,0505/execução
Experimentar Molmo 7B

0 / 16.000

Configurações avançadas (1)
Resultado
A resposta aparece aqui.

Esta execução

cerca de US$ 0,0505 · 5,05 créditos

US$ 0,1513 (15,13 créditos) são reservados no início; o tempo real de GPU é cobrado.

Para contas sem compra anterior: execuções acima de 2 créditos precisam de recarga.

Novo por aqui?

10 créditos grátis (US$ 0,10) ao se inscrever com Google

Utilizável 24 horas após inscrição, até 5 execuções por dia e no máximo 2 créditos por execução. Outros métodos de login começam sem créditos.

02

Examples

Real outputs from the public examples of this model on Replicate, with the prompt and settings that produced them. They were not generated live on this page.
  • InputInput

    Prompt

    What do you see? Give me a detailed answer

    Response

    I see a charming scene featuring a large, fluffy white dog sitting on a wooden bench in the middle of a field. The dog appears to be a poodle mix, with curly fur covering its entire body. It's sitting upright with its front paws hanging over the edge of the bench, looking directly at the camera with a happy expression. The dog's tongue is hanging out, and its eyes are dark and expressive. The bench is made of dark brown wood with a lattice design on the backrest. It's positioned on a patch of brown, dead grass, which suggests it might be late fall or early winter. In the background, there's a vast field filled with tall, brown grass, and further back, I can see a line of bare trees against a light blue sky. The overall atmosphere is peaceful and serene. The dog seems to be enjoying its time outdoors, perhaps waiting for its owner or just taking in the scenery. The contrast between the white, fluffy dog and the brown

03

Sobre Molmo 7B

ResumoA partir de 23 de setembro de 2026

Molmo 7B é um modelo de Community na categoria Multimodal. No Railwail, Molmo 7B custa ≈ US$ 0,0505 por execução.

Molmo 7B-D from Allen AI is an open vision-language model trained on the PixMo human-annotated dataset. Beyond captioning and visual question answering it can point to and localize specific objects in an image, returning coordinates, which is useful for grounding and agentic UI tasks. This Replicate endpoint takes an image plus a prompt and returns text answers or pointing outputs. Fully open weights and data.
04

Preços

Preços em dólares americanos. O uso é cobrado a partir de créditos pré-pagos.
Execução típica (≈ 43 s em L40S)US$ 0,0505 por execução
Tempo de GPU (L40S)US$ 0,00117 por segundo de GPU
  • Faturado pelo tempo de GPU que a execução realmente leva. Quando a execução começa, 3× o preço típico é reservado do seu saldo e liquidado depois.
  • 1 crédito = US$ 0,01

Calculadora de custos

Calculadora de preços

s

Típico conforme o provedor: cerca de 43,1 s

Total

US$ 5,05

505 créditos

Por execução

US$ 0,0505 · 5,05 créditos

Faturado pelo tempo real de GPU; este é uma estimativa.

05

API

Chame Molmo 7B com sua chave de API Railwail. Use este ID de modelo na solicitação:

Nenhum exemplo de API verificado

A API pública passa um formato de entrada diferente do que este modelo precisa. Use o playground acima.

06

Especificações

ID do modelo
molmo-7b
Desenvolvedor
Community
Categoria
Multimodal
Entrada
Texto, Imagem
Saída
Texto
Faturamento
Por uso (tokens ou tempo de GPU)
Entrada do catálogo atualizada
23 de setembro de 2026

Parâmetros de entrada

Entradas e configurações do esquema de entrada do modelo. O exemplo na seção API mostra quais delas a API aceita.

  • promptobrigatório

    Question about the image

    Tipo: Texto
    Padrão: –
    Valores permitidos: até 16.000 caracteres
  • image_url

    Image URL to analyze

    Tipo: Texto
    Padrão: –
    Valores permitidos: –
  • max_tokens
    Tipo: Número inteiro
    Padrão: 1024
    Valores permitidos: 1 a 4.096

Etiquetas

  • replicate
  • allenai
  • molmo
  • vision-understanding
  • open-weights
  • grounding
07

Perguntas frequentes

O que é Molmo 7B?

Molmo 7B é um modelo de Community na categoria Multimodal.

Quanto custa Molmo 7B no Railwail?

No Railwail, Molmo 7B custa ≈ US$ 0,0505 por execução. Você é cobrado pelo que cada solicitação realmente usa. O uso é pago com créditos pré-pagos; 1 crédito equivale a US$ 0,01.

Quais configurações Molmo 7B suporta?

De acordo com seu esquema de entrada, Molmo 7B conhece estes parâmetros: prompt (até 16.000 caracteres), image_url e max_tokens (1 a 4.096).

Qual é a velocidade de Molmo 7B?

Ainda não há execuções medidas suficientes de Molmo 7B no Railwail para indicar um tempo de execução. Depende da entrada, das configurações e da carga no provedor.

Molmo 7B é melhor que BLIP?

Depende da tarefa. Molmo 7B (Community) e BLIP (Salesforce) são ambos modelos na categoria Multimodal. A página de comparação mostra seus preços e especificações lado a lado.

Comparar Molmo 7B e BLIP

Molmo 7B pode processar imagens?

Sim. Molmo 7B aceita imagens como entrada além de texto.

08

Modelos comparáveis

Todos nesta categoria
  • BLIPSalesforce

    Salesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.

    ≈ US$ 0,00030/execução

    99 % mais barato por unidade

    Comparar Molmo 7B vs. BLIP
  • pharmapsychotic's CLIP Interrogator. Takes an image and produces a Stable-Diffusion-style text prompt by combining BLIP captioning with CLIP to rank likely subjects, artists, mediums and styles. Commonly used to reverse-engineer a prompt from an existing picture.

    ≈ US$ 0,0457/execução

    10 % mais barato por unidade

    Comparar Molmo 7B vs. CLIP Interrogator
  • Monocular depth-estimation model trained on 595k labeled and 62M unlabeled images. Strong zero-shot generalization in indoor and outdoor scenes.

    ≈ US$ 0,0050/execução

    90 % mais barato por unidade

    Comparar Molmo 7B vs. Depth Anything v2

Todos os modelos através de uma API

Uma chave API para todos os modelos no Railwail. O uso é cobrado a partir de créditos pré-pagos, 1 crédito = US$ 0,01.