BLIP
blip-captioningSalesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.
- Preço
- ≈ US$ 0,00030/execução
- Entrada → Saída
- Texto + Imagem → Texto
- Desenvolvedor
- Salesforce
- Atualizado
- 23 de setembro de 2026
Playground
Experimentar BLIP
Entrada & saída
Esta execução
cerca de US$ 0,0003 · 0,03 créditos
US$ 0,0009 (0,09 créditos) são reservados no início; o tempo real de GPU é cobrado.
Novo por aqui?
10 créditos grátis (US$ 0,10) ao se inscrever com Google
Utilizável 24 horas após inscrição, até 5 execuções por dia e no máximo 2 créditos por execução. Outros métodos de login começam sem créditos. Suficiente para 111 execuções deste modelo.
Examples
InputPrompt
image_captioning
Output (JSON, shortened)
[ { "text": "Caption: a woman sitting on the beach with a dog" } ]
InputPrompt
what is in the sky?
Output (JSON, shortened)
[ { "text": "Answer: moon" } ]
InputPrompt
what is in the lake?
Output (JSON, shortened)
[ { "text": "Answer: swans" } ]
Sobre BLIP
BLIP é um modelo de Salesforce na categoria Multimodal. No Railwail, BLIP custa ≈ US$ 0,00030 por execução.
Preços
| Execução típica (≈ 1 s em T4) | US$ 0,00030 por execução |
|---|---|
| Tempo de GPU (T4) | US$ 0,00027 por segundo de GPU |
- Faturado pelo tempo de GPU que a execução realmente leva. Quando a execução começa, 3× o preço típico é reservado do seu saldo e liquidado depois.
- 1 crédito = US$ 0,01
Calculadora de custos
Calculadora de preços
Típico conforme o provedor: cerca de 1 s
Total
US$ 0,03
3 créditos
Por execução
US$ 0,0003 · 0,03 créditos
Faturado pelo tempo real de GPU; este é uma estimativa.
API
Nenhum exemplo de API verificado
A API pública passa um formato de entrada diferente do que este modelo precisa. Use o playground acima.
Especificações
- ID do modelo
blip-captioning- Desenvolvedor
- Salesforce
- Categoria
- Multimodal
- Entrada
- Texto, Imagem
- Saída
- Texto
- Faturamento
- Por uso (tokens ou tempo de GPU)
- Entrada do catálogo atualizada
- 23 de setembro de 2026
Parâmetros de entrada
Entradas e configurações do esquema de entrada do modelo. O exemplo na seção API mostra quais delas a API aceita.
imageobrigatórioImage to caption or ask about
Tipo: TextoPadrão: –Valores permitidos: –taskTipo: EscolhaPadrão:image_captioningValores permitidos: image_captioning ou visual_question_answeringquestionQuestion for visual question answering mode
Tipo: TextoPadrão: –Valores permitidos: –
Etiquetas
- replicate
- blip
- captioning
- vqa
- salesforce
- vision-understanding
- image
Perguntas frequentes
O que é BLIP?
BLIP é um modelo de Salesforce na categoria Multimodal.
Quanto custa BLIP no Railwail?
No Railwail, BLIP custa ≈ US$ 0,00030 por execução. Você é cobrado pelo que cada solicitação realmente usa. O uso é pago com créditos pré-pagos; 1 crédito equivale a US$ 0,01.
Quais configurações BLIP suporta?
De acordo com seu esquema de entrada, BLIP conhece estes parâmetros: image, task (image_captioning ou visual_question_answering) e question.
Qual é a velocidade de BLIP?
Ainda não há execuções medidas suficientes de BLIP no Railwail para indicar um tempo de execução. Depende da entrada, das configurações e da carga no provedor.
BLIP é melhor que CLIP Interrogator?
Depende da tarefa. BLIP (Salesforce) e CLIP Interrogator (Community) são ambos modelos na categoria Multimodal. A página de comparação mostra seus preços e especificações lado a lado.
Comparar BLIP e CLIP InterrogatorBLIP pode processar imagens?
Sim. BLIP aceita imagens como entrada além de texto.
Modelos comparáveis
Todos nesta categoria- CLIP InterrogatorCommunity
pharmapsychotic's CLIP Interrogator. Takes an image and produces a Stable-Diffusion-style text prompt by combining BLIP captioning with CLIP to rank likely subjects, artists, mediums and styles. Commonly used to reverse-engineer a prompt from an existing picture.
- Depth Anything v2Community
Monocular depth-estimation model trained on 595k labeled and 62M unlabeled images. Strong zero-shot generalization in indoor and outdoor scenes.
Meta Segment Anything 2. Promptable segmentation across images and video with temporal memory. Zero-shot, point/box/mask prompts, fast on a single H100.
Todos os modelos através de uma API
Uma chave API para todos os modelos no Railwail. O uso é cobrado a partir de créditos pré-pagos, 1 crédito = US$ 0,01.