BLIP

MultimodalDisponible
par SalesforceID du modèle: blip-captioning

Salesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.

Prix
≈ 0,00030 $US/exécution
Entrée → Sortie
Texte + Image → Texte
Développeur
Salesforce
Mis à jour
23 septembre 2026
01

Playground

Essayer BLIP

Entrée & résultat

≈ 0,00030 $US/exécution
Essayer BLIP

Question for visual question answering mode

Résultat
La réponse apparaît ici.

Cette exécution

environ 0,0003 $US · 0,03 crédits

0,0009 $US (0,09 crédits) sont réservés au démarrage ; le temps GPU réel est facturé.

Nouveau par ici ?

10 crédits gratuits (0,10 $US) lors de l'inscription avec Google

Utilisable 24 heures après l'inscription, jusqu'à 5 exécutions par jour et au maximum 2 crédits par exécution. Les autres méthodes de connexion commencent sans crédits. Suffisant pour 111 exécutions de ce modèle.

02

Examples

Real outputs from the public examples of this model on Replicate, with the prompt and settings that produced them. They were not generated live on this page.
  • InputInput

    Prompt

    image_captioning

    Output (JSON, shortened)

    [
      {
        "text": "Caption: a woman sitting on the beach with a dog"
      }
    ]
  • InputInput

    Prompt

    what is in the sky?

    Output (JSON, shortened)

    [
      {
        "text": "Answer: moon"
      }
    ]
  • InputInput

    Prompt

    what is in the lake?

    Output (JSON, shortened)

    [
      {
        "text": "Answer: swans"
      }
    ]
03

À propos de BLIP

RésuméAu 23 septembre 2026

BLIP est un modèle de Salesforce dans la catégorie Multimodal. Sur Railwail, BLIP coûte ≈ 0,00030 $US par exécution.

BLIP (Bootstrapping Language-Image Pre-training) from Salesforce Research unifies captioning and VQA in one model. In caption mode it returns a concise description of the scene; in question-answering mode it answers a free-form question grounded in the image. It is one of the most-run captioning models on Replicate and a common building block for image search and accessibility alt-text.
04

Tarification

Prix en dollars américains. L'utilisation est facturée à partir de crédits prépayés.
Exécution typique (≈ 1 s sur T4)0,00030 $US par exécution
Temps GPU (T4)0,00027 $US par seconde GPU
  • Facturée selon le temps GPU que l'exécution prend réellement. Au démarrage, 3× le prix typique est réservé de votre solde et régularisé ensuite.
  • 1 crédit = 0,01 $US

Calculateur de coûts

Calculatrice de prix

s

Typique selon le fournisseur : environ 1 s

Total

0,03 $US

3 crédits

Par exécution

0,0003 $US · 0,03 crédits

Facturé selon le temps GPU réel ; il s'agit d'une estimation.

05

API

Appelez BLIP avec votre clé API Railwail. Utilisez cet ID de modèle dans la requête :

Aucun exemple API vérifié

L'API publique transmet un format d'entrée différent de celui dont ce modèle a besoin. Utilisez le playground ci-dessus.

06

Spécifications

ID du modèle
blip-captioning
Développeur
Salesforce
Catégorie
Multimodal
Entrée
Texte, Image
Sortie
Texte
Facturation
À l'usage (tokens ou temps GPU)
Entrée du catalogue mise à jour
23 septembre 2026

Paramètres d'entrée

Entrées et paramètres du schéma d'entrée du modèle. L'exemple dans la section API montre lesquels l'API accepte.

  • imageObligatoire

    Image to caption or ask about

    Type: Texte
    Défaut: –
    Valeurs autorisées: –
  • task
    Type: Choix
    Défaut: image_captioning
    Valeurs autorisées: image_captioning ou visual_question_answering
  • question

    Question for visual question answering mode

    Type: Texte
    Défaut: –
    Valeurs autorisées: –

Étiquettes

  • replicate
  • blip
  • captioning
  • vqa
  • salesforce
  • vision-understanding
  • image
07

Questions fréquemment posées

Qu'est-ce que BLIP ?

BLIP est un modèle de Salesforce dans la catégorie Multimodal.

Combien coûte BLIP sur Railwail ?

Sur Railwail, BLIP coûte ≈ 0,00030 $US par exécution. Vous êtes facturé pour ce que chaque requête utilise réellement. L'utilisation est payée à partir de crédits prépayés ; 1 crédit équivaut à 0,01 $US.

Quels paramètres BLIP supporte-t-il ?

Selon son schéma d'entrée, BLIP connaît ces paramètres : image, task (image_captioning ou visual_question_answering) et question.

Quelle est la vitesse de BLIP ?

Il n'y a pas encore assez d'exécutions mesurées de BLIP sur Railwail pour indiquer un temps d'exécution. Cela dépend de l'entrée, des paramètres et de la charge chez le fournisseur.

BLIP est-il meilleur que CLIP Interrogator ?

Cela dépend de la tâche. BLIP (Salesforce) et CLIP Interrogator (Community) sont tous deux des modèles de la catégorie Multimodal. La page de comparaison affiche leurs prix et spécifications côte à côte.

Comparer BLIP et CLIP Interrogator

BLIP peut-il traiter des images ?

Oui. BLIP accepte les images en entrée en plus du texte.

08

Modèles comparables

Tous dans cette catégorie
  • pharmapsychotic's CLIP Interrogator. Takes an image and produces a Stable-Diffusion-style text prompt by combining BLIP captioning with CLIP to rank likely subjects, artists, mediums and styles. Commonly used to reverse-engineer a prompt from an existing picture.

    ≈ 0,0457 $US/exécution

    15.133 % plus cher par unité

    Comparer BLIP et CLIP Interrogator
  • Monocular depth-estimation model trained on 595k labeled and 62M unlabeled images. Strong zero-shot generalization in indoor and outdoor scenes.

    ≈ 0,0050 $US/exécution

    1.567 % plus cher par unité

    Comparer BLIP et Depth Anything v2
  • Meta Segment Anything 2. Promptable segmentation across images and video with temporal memory. Zero-shot, point/box/mask prompts, fast on a single H100.

    ≈ 0,018 $US/exécution

    5.900 % plus cher par unité

    Comparer BLIP et SAM 2 (Segment Anything 2)

Tous les modèles via une API

Une clé API pour tous les modèles sur Railwail. L'utilisation est facturée à partir de crédits prépayés, 1 crédit = 0,01 $US.