BLIP

MultimodalDisponível
por SalesforceID do modelo: blip-captioning

Salesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.

Preço
≈ US$ 0,00030/execução
Entrada → Saída
Texto + Imagem → Texto
Desenvolvedor
Salesforce
Atualizado
23 de setembro de 2026
01

Playground

Experimentar BLIP

Entrada & saída

≈ US$ 0,00030/execução
Experimentar BLIP

Question for visual question answering mode

Resultado
A resposta aparece aqui.

Esta execução

cerca de US$ 0,0003 · 0,03 créditos

US$ 0,0009 (0,09 créditos) são reservados no início; o tempo real de GPU é cobrado.

Novo por aqui?

10 créditos grátis (US$ 0,10) ao se inscrever com Google

Utilizável 24 horas após inscrição, até 5 execuções por dia e no máximo 2 créditos por execução. Outros métodos de login começam sem créditos. Suficiente para 111 execuções deste modelo.

02

Examples

Real outputs from the public examples of this model on Replicate, with the prompt and settings that produced them. They were not generated live on this page.
  • InputInput

    Prompt

    image_captioning

    Output (JSON, shortened)

    [
      {
        "text": "Caption: a woman sitting on the beach with a dog"
      }
    ]
  • InputInput

    Prompt

    what is in the sky?

    Output (JSON, shortened)

    [
      {
        "text": "Answer: moon"
      }
    ]
  • InputInput

    Prompt

    what is in the lake?

    Output (JSON, shortened)

    [
      {
        "text": "Answer: swans"
      }
    ]
03

Sobre BLIP

ResumoA partir de 23 de setembro de 2026

BLIP é um modelo de Salesforce na categoria Multimodal. No Railwail, BLIP custa ≈ US$ 0,00030 por execução.

BLIP (Bootstrapping Language-Image Pre-training) from Salesforce Research unifies captioning and VQA in one model. In caption mode it returns a concise description of the scene; in question-answering mode it answers a free-form question grounded in the image. It is one of the most-run captioning models on Replicate and a common building block for image search and accessibility alt-text.
04

Preços

Preços em dólares americanos. O uso é cobrado a partir de créditos pré-pagos.
Execução típica (≈ 1 s em T4)US$ 0,00030 por execução
Tempo de GPU (T4)US$ 0,00027 por segundo de GPU
  • Faturado pelo tempo de GPU que a execução realmente leva. Quando a execução começa, 3× o preço típico é reservado do seu saldo e liquidado depois.
  • 1 crédito = US$ 0,01

Calculadora de custos

Calculadora de preços

s

Típico conforme o provedor: cerca de 1 s

Total

US$ 0,03

3 créditos

Por execução

US$ 0,0003 · 0,03 créditos

Faturado pelo tempo real de GPU; este é uma estimativa.

05

API

Chame BLIP com sua chave de API Railwail. Use este ID de modelo na solicitação:

Nenhum exemplo de API verificado

A API pública passa um formato de entrada diferente do que este modelo precisa. Use o playground acima.

06

Especificações

ID do modelo
blip-captioning
Desenvolvedor
Salesforce
Categoria
Multimodal
Entrada
Texto, Imagem
Saída
Texto
Faturamento
Por uso (tokens ou tempo de GPU)
Entrada do catálogo atualizada
23 de setembro de 2026

Parâmetros de entrada

Entradas e configurações do esquema de entrada do modelo. O exemplo na seção API mostra quais delas a API aceita.

  • imageobrigatório

    Image to caption or ask about

    Tipo: Texto
    Padrão: –
    Valores permitidos: –
  • task
    Tipo: Escolha
    Padrão: image_captioning
    Valores permitidos: image_captioning ou visual_question_answering
  • question

    Question for visual question answering mode

    Tipo: Texto
    Padrão: –
    Valores permitidos: –

Etiquetas

  • replicate
  • blip
  • captioning
  • vqa
  • salesforce
  • vision-understanding
  • image
07

Perguntas frequentes

O que é BLIP?

BLIP é um modelo de Salesforce na categoria Multimodal.

Quanto custa BLIP no Railwail?

No Railwail, BLIP custa ≈ US$ 0,00030 por execução. Você é cobrado pelo que cada solicitação realmente usa. O uso é pago com créditos pré-pagos; 1 crédito equivale a US$ 0,01.

Quais configurações BLIP suporta?

De acordo com seu esquema de entrada, BLIP conhece estes parâmetros: image, task (image_captioning ou visual_question_answering) e question.

Qual é a velocidade de BLIP?

Ainda não há execuções medidas suficientes de BLIP no Railwail para indicar um tempo de execução. Depende da entrada, das configurações e da carga no provedor.

BLIP é melhor que CLIP Interrogator?

Depende da tarefa. BLIP (Salesforce) e CLIP Interrogator (Community) são ambos modelos na categoria Multimodal. A página de comparação mostra seus preços e especificações lado a lado.

Comparar BLIP e CLIP Interrogator

BLIP pode processar imagens?

Sim. BLIP aceita imagens como entrada além de texto.

08

Modelos comparáveis

Todos nesta categoria
  • pharmapsychotic's CLIP Interrogator. Takes an image and produces a Stable-Diffusion-style text prompt by combining BLIP captioning with CLIP to rank likely subjects, artists, mediums and styles. Commonly used to reverse-engineer a prompt from an existing picture.

    ≈ US$ 0,0457/execução

    15.133 % mais caro por unidade

    Comparar BLIP vs. CLIP Interrogator
  • Monocular depth-estimation model trained on 595k labeled and 62M unlabeled images. Strong zero-shot generalization in indoor and outdoor scenes.

    ≈ US$ 0,0050/execução

    1.567 % mais caro por unidade

    Comparar BLIP vs. Depth Anything v2
  • Meta Segment Anything 2. Promptable segmentation across images and video with temporal memory. Zero-shot, point/box/mask prompts, fast on a single H100.

    ≈ US$ 0,018/execução

    5.900 % mais caro por unidade

    Comparar BLIP vs. SAM 2 (Segment Anything 2)

Todos os modelos através de uma API

Uma chave API para todos os modelos no Railwail. O uso é cobrado a partir de créditos pré-pagos, 1 crédito = US$ 0,01.