BLIP
blip-captioningSalesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.
- Prijs
- ≈ US$ 0,00030/uitvoering
- Invoer → Uitvoer
- Tekst + Afbeelding → Tekst
- Ontwikkelaar
- Salesforce
- Bijgewerkt
- 23 september 2026
Playground
BLIP proberen
Invoer & resultaat
Deze uitvoering
ongeveer US$ 0,0003 · 0,03 credits
US$Â 0,0009 (0,09 credits) worden gereserveerd bij het starten; de werkelijke GPU-tijd wordt gefactureerd.
Nieuw hier?
10 gratis credits (US$Â 0,10) wanneer je je aanmeldt met Google
Bruikbaar 24 uur na aanmelding, tot 5 uitvoeringen per dag en maximaal 2 credits per uitvoering. Andere aanmeldmethoden starten zonder credits. Voldoende voor 111 uitvoeringen van dit model.
Examples
InputPrompt
image_captioning
Output (JSON, shortened)
[ { "text": "Caption: a woman sitting on the beach with a dog" } ]
InputPrompt
what is in the sky?
Output (JSON, shortened)
[ { "text": "Answer: moon" } ]
InputPrompt
what is in the lake?
Output (JSON, shortened)
[ { "text": "Answer: swans" } ]
Over BLIP
BLIP is een model van Salesforce in de categorie Multimodaal. Op Railwail kost BLIP ≈ US$ 0,00030 per uitvoering.
Prijzen
| Typische uitvoering (≈ 1 s op T4) | US$ 0,00030 per uitvoering |
|---|---|
| GPU-tijd (T4) | US$Â 0,00027 per GPU-seconde |
- Afgerekend wordt de GPU-tijd die de run werkelijk gebruikt. Wanneer de run start, wordt het 3-voudige van de typische prijs van uw saldo gereserveerd en later verrekend.
- 1 credit = US$Â 0,01
Kostencalculator
Prijscalculator
Typisch volgens de provider: ongeveer 1 s
Totaal
US$Â 0,03
3 credits
Per run
US$ 0,0003 · 0,03 credits
Afgerekend wordt de werkelijke GPU-tijd; dit is een schatting.
API
Geen geverifieerd API-voorbeeld
De openbare API geeft een ander invoerformaat door dan dit model nodig heeft. Gebruik de playground hierboven.
Specificaties
- Model-ID
blip-captioning- Ontwikkelaar
- Salesforce
- Categorie
- Multimodaal
- Invoer
- Tekst, Afbeelding
- Uitvoer
- Tekst
- Facturering
- Op basis van gebruik (tokens of GPU-tijd)
- Catalogusitem bijgewerkt
- 23 september 2026
Invoerparameters
Invoeren en instellingen uit het invoerschema van het model. Het voorbeeld in de API-sectie toont welke daarvan de API accepteert.
imageVerplichtImage to caption or ask about
Type: TekstStandaard: –Toegestane waarden: –taskType: KeuzeStandaard:image_captioningToegestane waarden: image_captioning of visual_question_answeringquestionQuestion for visual question answering mode
Type: TekstStandaard: –Toegestane waarden: –
Tags
- replicate
- blip
- captioning
- vqa
- salesforce
- vision-understanding
- image
Veelgestelde vragen
Wat is BLIP?
BLIP is een model van Salesforce in de categorie Multimodaal.
Hoeveel kost BLIP op Railwail?
Op Railwail kost BLIP ≈ US$ 0,00030 per uitvoering. U betaalt voor wat elke aanvraag daadwerkelijk verbruikt. Gebruik wordt betaald met vooraf gekochte credits; 1 credit is gelijk aan US$ 0,01.
Welke instellingen ondersteunt BLIP?
Volgens het invoerschema kent BLIP deze parameters: image, task (image_captioning of visual_question_answering) en question.
Hoe snel is BLIP?
Er zijn nog niet genoeg gemeten runs van BLIP op Railwail om een uitvoeringstijd op te geven. Dit hangt af van de invoer, de instellingen en de belasting bij de provider.
Is BLIP beter dan CLIP Interrogator?
Dat hangt van de taak af. BLIP (Salesforce) en CLIP Interrogator (Community) zijn beide modellen in de categorie Multimodaal. De vergelijkingspagina toont hun prijzen en specificaties naast elkaar.
BLIP en CLIP Interrogator vergelijkenKan BLIP afbeeldingen verwerken?
Ja. BLIP accepteert afbeeldingen als invoer naast tekst.
Vergelijkbare modellen
Alle in deze categorie- CLIP InterrogatorCommunity
pharmapsychotic's CLIP Interrogator. Takes an image and produces a Stable-Diffusion-style text prompt by combining BLIP captioning with CLIP to rank likely subjects, artists, mediums and styles. Commonly used to reverse-engineer a prompt from an existing picture.
- Depth Anything v2Community
Monocular depth-estimation model trained on 595k labeled and 62M unlabeled images. Strong zero-shot generalization in indoor and outdoor scenes.
Meta Segment Anything 2. Promptable segmentation across images and video with temporal memory. Zero-shot, point/box/mask prompts, fast on a single H100.
Alle modellen via één API
Één API-sleutel voor elk model op Railwail. Gebruik wordt afgerekend via vooraf gekochte credits, 1 credit = US$ 0,01.