BLIP
blip-captioningSalesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.
- Prix
- ≈ 0,00030 $US/exécution
- Entrée → Sortie
- Texte + Image → Texte
- Développeur
- Salesforce
- Mis à jour
- 23 septembre 2026
Playground
Essayer BLIP
Entrée & résultat
Cette exécution
environ 0,0003 $US · 0,03 crédits
0,0009 $US (0,09 crédits) sont réservés au démarrage ; le temps GPU réel est facturé.
Nouveau par ici ?
10 crédits gratuits (0,10 $US) lors de l'inscription avec Google
Utilisable 24 heures après l'inscription, jusqu'à 5 exécutions par jour et au maximum 2 crédits par exécution. Les autres méthodes de connexion commencent sans crédits. Suffisant pour 111 exécutions de ce modèle.
Examples
InputPrompt
image_captioning
Output (JSON, shortened)
[ { "text": "Caption: a woman sitting on the beach with a dog" } ]
InputPrompt
what is in the sky?
Output (JSON, shortened)
[ { "text": "Answer: moon" } ]
InputPrompt
what is in the lake?
Output (JSON, shortened)
[ { "text": "Answer: swans" } ]
À propos de BLIP
BLIP est un modèle de Salesforce dans la catégorie Multimodal. Sur Railwail, BLIP coûte ≈ 0,00030 $US par exécution.
Tarification
| Exécution typique (≈ 1 s sur T4) | 0,00030 $US par exécution |
|---|---|
| Temps GPU (T4) | 0,00027Â $US par seconde GPU |
- Facturée selon le temps GPU que l'exécution prend réellement. Au démarrage, 3× le prix typique est réservé de votre solde et régularisé ensuite.
- 1 crédit = 0,01 $US
Calculateur de coûts
Calculatrice de prix
Typique selon le fournisseur : environ 1 s
Total
0,03Â $US
3 crédits
Par exécution
0,0003 $US · 0,03 crédits
Facturé selon le temps GPU réel ; il s'agit d'une estimation.
API
Aucun exemple API vérifié
L'API publique transmet un format d'entrée différent de celui dont ce modèle a besoin. Utilisez le playground ci-dessus.
Spécifications
- ID du modèle
blip-captioning- Développeur
- Salesforce
- Catégorie
- Multimodal
- Entrée
- Texte, Image
- Sortie
- Texte
- Facturation
- À l'usage (tokens ou temps GPU)
- Entrée du catalogue mise à jour
- 23 septembre 2026
Paramètres d'entrée
Entrées et paramètres du schéma d'entrée du modèle. L'exemple dans la section API montre lesquels l'API accepte.
imageObligatoireImage to caption or ask about
Type: TexteDéfaut: –Valeurs autorisées: –taskType: ChoixDéfaut:image_captioningValeurs autorisées: image_captioning ou visual_question_answeringquestionQuestion for visual question answering mode
Type: TexteDéfaut: –Valeurs autorisées: –
Étiquettes
- replicate
- blip
- captioning
- vqa
- salesforce
- vision-understanding
- image
Questions fréquemment posées
Qu'est-ce que BLIP ?
BLIP est un modèle de Salesforce dans la catégorie Multimodal.
Combien coûte BLIP sur Railwail ?
Sur Railwail, BLIP coûte ≈ 0,00030 $US par exécution. Vous êtes facturé pour ce que chaque requête utilise réellement. L'utilisation est payée à partir de crédits prépayés ; 1 crédit équivaut à 0,01 $US.
Quels paramètres BLIP supporte-t-il ?
Selon son schéma d'entrée, BLIP connaît ces paramètres : image, task (image_captioning ou visual_question_answering) et question.
Quelle est la vitesse de BLIP ?
Il n'y a pas encore assez d'exécutions mesurées de BLIP sur Railwail pour indiquer un temps d'exécution. Cela dépend de l'entrée, des paramètres et de la charge chez le fournisseur.
BLIP est-il meilleur que CLIP Interrogator ?
Cela dépend de la tâche. BLIP (Salesforce) et CLIP Interrogator (Community) sont tous deux des modèles de la catégorie Multimodal. La page de comparaison affiche leurs prix et spécifications côte à côte.
Comparer BLIP et CLIP InterrogatorBLIP peut-il traiter des images ?
Oui. BLIP accepte les images en entrée en plus du texte.
Modèles comparables
Tous dans cette catégorie- CLIP InterrogatorCommunity
pharmapsychotic's CLIP Interrogator. Takes an image and produces a Stable-Diffusion-style text prompt by combining BLIP captioning with CLIP to rank likely subjects, artists, mediums and styles. Commonly used to reverse-engineer a prompt from an existing picture.
- Depth Anything v2Community
Monocular depth-estimation model trained on 595k labeled and 62M unlabeled images. Strong zero-shot generalization in indoor and outdoor scenes.
Meta Segment Anything 2. Promptable segmentation across images and video with temporal memory. Zero-shot, point/box/mask prompts, fast on a single H100.
Tous les modèles via une API
Une clé API pour tous les modèles sur Railwail. L'utilisation est facturée à partir de crédits prépayés, 1 crédit = 0,01 $US.