BLIP

MultimodaleDisponibile
di SalesforceID modello: blip-captioning

Salesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.

Prezzo
≈ 0,00030 USD/esecuzione
Input → output
Testo + Immagine → Testo
Sviluppatore
Salesforce
Aggiornato
23 settembre 2026
01

Playground

Prova BLIP

Input e output

≈ 0,00030 USD/esecuzione
Prova BLIP

Question for visual question answering mode

Risultato
La risposta appare qui.

Questa esecuzione

circa 0,0003 USD · 0,03 crediti

0,0009 USD (0,09 crediti) sono riservati all'inizio; il tempo GPU effettivo viene fatturato.

Nuovo qui?

10 crediti gratuiti (0,10 USD) quando ti iscrivi con Google

Utilizzabile 24 ore dopo l'iscrizione, fino a 5 esecuzioni al giorno e al massimo 2 crediti per esecuzione. Altri metodi di accesso iniziano senza crediti. Sufficiente per 111 esecuzioni di questo modello.

02

Examples

Real outputs from the public examples of this model on Replicate, with the prompt and settings that produced them. They were not generated live on this page.
  • InputInput

    Prompt

    image_captioning

    Output (JSON, shortened)

    [
      {
        "text": "Caption: a woman sitting on the beach with a dog"
      }
    ]
  • InputInput

    Prompt

    what is in the sky?

    Output (JSON, shortened)

    [
      {
        "text": "Answer: moon"
      }
    ]
  • InputInput

    Prompt

    what is in the lake?

    Output (JSON, shortened)

    [
      {
        "text": "Answer: swans"
      }
    ]
03

Informazioni su BLIP

RiassuntoA partire da 23 settembre 2026

BLIP è un modello di Salesforce nella categoria Multimodale. Su Railwail, BLIP costa ≈ 0,00030 USD per esecuzione.

BLIP (Bootstrapping Language-Image Pre-training) from Salesforce Research unifies captioning and VQA in one model. In caption mode it returns a concise description of the scene; in question-answering mode it answers a free-form question grounded in the image. It is one of the most-run captioning models on Replicate and a common building block for image search and accessibility alt-text.
04

Prezzi

Prezzi in dollari USA. L'utilizzo viene addebitato dai crediti prepagati.
Esecuzione tipica (≈ 1 s su T4)0,00030 USD per esecuzione
Tempo GPU (T4)0,00027 USD per secondo GPU
  • Fatturato in base al tempo GPU effettivamente utilizzato. All'avvio, 3× il prezzo tipico viene riservato dal tuo saldo e regolato successivamente.
  • 1 credito = 0,01 USD

Calcolatore di costi

Calcolatore prezzi

s

Tipico secondo il provider: circa 1 s

Totale

0,03 USD

3 crediti

Per esecuzione

0,0003 USD · 0,03 crediti

Fatturato in base al tempo GPU effettivo; questo è una stima.

05

API

Chiama BLIP con la tua chiave API Railwail. Usa questo ID modello nella richiesta:

Nessun esempio API verificato

L'API pubblica passa un formato di input diverso da quello richiesto da questo modello. Usa il playground sopra.

06

Specifiche

ID modello
blip-captioning
Sviluppatore
Salesforce
Categoria
Multimodale
Input
Testo, Immagine
Output
Testo
Fatturazione
In base all'utilizzo (token o tempo GPU)
Voce di catalogo aggiornata
23 settembre 2026

Parametri di input

Input e impostazioni dallo schema di input del modello. L'esempio nella sezione API mostra quali di essi l'API accetta.

  • imageObbligatorio

    Image to caption or ask about

    Tipo: Testo
    Predefinito: –
    Valori consentiti: –
  • task
    Tipo: Scelta
    Predefinito: image_captioning
    Valori consentiti: image_captioning o visual_question_answering
  • question

    Question for visual question answering mode

    Tipo: Testo
    Predefinito: –
    Valori consentiti: –

Etichette

  • replicate
  • blip
  • captioning
  • vqa
  • salesforce
  • vision-understanding
  • image
07

Domande frequenti

Cos'è BLIP?

BLIP è un modello di Salesforce nella categoria Multimodale.

Quanto costa BLIP su Railwail?

Su Railwail, BLIP costa ≈ 0,00030 USD per esecuzione. Ti viene addebitato ciò che ogni richiesta utilizza effettivamente. L'utilizzo viene pagato con crediti prepagati; 1 credito equivale a 0,01 USD.

Quali impostazioni supporta BLIP?

Secondo il suo schema di input, BLIP conosce questi parametri: image, task (image_captioning o visual_question_answering) e question.

Quanto è veloce BLIP?

Non ci sono ancora abbastanza esecuzioni misurate di BLIP su Railwail per indicare un tempo di esecuzione. Dipende dall'input, dalle impostazioni e dal carico presso il provider.

BLIP è migliore di CLIP Interrogator?

Dipende dall'attività. BLIP (Salesforce) e CLIP Interrogator (Community) sono entrambi modelli nella categoria Multimodale. La pagina di confronto mostra i loro prezzi e le specifiche affiancati.

Confronta BLIP e CLIP Interrogator

BLIP può elaborare immagini?

Sì. BLIP accetta immagini come input oltre al testo.

08

Modelli comparabili

Tutti in questa categoria
  • pharmapsychotic's CLIP Interrogator. Takes an image and produces a Stable-Diffusion-style text prompt by combining BLIP captioning with CLIP to rank likely subjects, artists, mediums and styles. Commonly used to reverse-engineer a prompt from an existing picture.

    ≈ 0,0457 USD/esecuzione

    15.133 % più costoso per unità

    Confronta BLIP e CLIP Interrogator
  • Monocular depth-estimation model trained on 595k labeled and 62M unlabeled images. Strong zero-shot generalization in indoor and outdoor scenes.

    ≈ 0,0050 USD/esecuzione

    1567 % più costoso per unità

    Confronta BLIP e Depth Anything v2
  • Meta Segment Anything 2. Promptable segmentation across images and video with temporal memory. Zero-shot, point/box/mask prompts, fast on a single H100.

    ≈ 0,018 USD/esecuzione

    5900 % più costoso per unità

    Confronta BLIP e SAM 2 (Segment Anything 2)

Tutti i modelli tramite un'API

Una chiave API per tutti i modelli su Railwail. L'utilizzo viene addebitato da crediti prepagati, 1 credito = 0,01 USD.