BLIP
blip-captioningSalesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.
- Hinta
- ≈ 0,00030 $/suoritus
- Syöte → tulos
- Teksti + Kuva → Teksti
- Kehittäjä
- Salesforce
- Päivitetty
- 23. syyskuuta 2026
Leikkikenttä
Kokeile BLIP
Syöte ja tulos
Tämä suoritus
noin 0,0003 $ · 0,03 creditiä
Alussa varataan 0,0009 $ (0,09 creditiä); todellinen GPU-aika laskutetaan.
Uusi täällä?
10 ilmaista creditiä (0,10 $) kun rekisteröidyt Googlella
Käytettävissä 24 tuntia rekisteröinnin jälkeen, enintään 5 suoritusta päivässä ja enintään 2 creditiä suoritusta kohti. Muut kirjautumismenetelmät alkavat ilman creditejä. Riittää 111 suoritukseen tästä mallista.
Examples
InputPrompt
image_captioning
Output (JSON, shortened)
[ { "text": "Caption: a woman sitting on the beach with a dog" } ]
InputPrompt
what is in the sky?
Output (JSON, shortened)
[ { "text": "Answer: moon" } ]
InputPrompt
what is in the lake?
Output (JSON, shortened)
[ { "text": "Answer: swans" } ]
Tietoja: BLIP
BLIP on Salesforce-kehittäjän malli kategoriasta Multimodaali. Railwailissa BLIP maksaa ≈ 0,00030 $ per suoritus.
Hinnat
| Tyypillinen suoritus (≈ 1 s T4:lla) | 0,00030 $ per suoritus |
|---|---|
| GPU-aika (T4) | 0,00027 $ per GPU-sekunti |
- Laskutus perustuu suorituksen todelliseen GPU-aikaan. Kun suoritus alkaa, 3-kertainen tyypillinen hinta varataan saldostasi ja selvitetään jälkikäteen.
- 1 krediitti = 0,01 $
Kustannuslaskin
Hintalaskin
Palveluntarjoajan mukaan tyypillinen: noin 1 s
Yhteensä
0,03 $
3 krediittiä
Suoritusta kohti
0,0003 $ · 0,03 krediittiä
Laskutus perustuu todelliseen GPU-aikaan; tämä on arvio.
API
Ei vahvistettua API-esimerkkiä
Julkinen API välittää eri syötemuotoa kuin tämä malli tarvitsee. Käytä yllä olevaa leikkikenttää.
Tekniset tiedot
- Mallin tunnus
blip-captioning- Kehittäjä
- Salesforce
- Kategoria
- Multimodaali
- Syöte
- Teksti, Kuva
- Tuloste
- Teksti
- Laskutus
- Käytön mukaan (tokeneja tai GPU-aikaa)
- Luettelokirjaus päivitetty
- 23. syyskuuta 2026
Syöteparametrit
Mallin syötökaavion syötteet ja asetukset. API-osion esimerkki näyttää, mitkä niistä API hyväksyy.
imagepakollinenImage to caption or ask about
Tyyppi: TekstiOletus: –Sallitut arvot: –taskTyyppi: ValintaOletus:image_captioningSallitut arvot: image_captioning tai visual_question_answeringquestionQuestion for visual question answering mode
Tyyppi: TekstiOletus: –Sallitut arvot: –
Tunnisteet
- replicate
- blip
- captioning
- vqa
- salesforce
- vision-understanding
- image
Usein kysytyt kysymykset
Mikä on BLIP?
BLIP on Salesforcen kehittämä malli Multimodaali-kategoriassa.
Paljonko BLIP maksaa Railwailissa?
Railwailissa BLIP maksaa ≈ 0,00030 $ per suoritus. Sinua veloitetaan siitä, mitä kukin pyyntö todella käyttää. Käyttö maksetaan ennakkoon ostettujen krediittien avulla; 1 krediitti vastaa 0,01 $.
Mitä asetuksia BLIP tukee?
Syötteen rakenteen mukaan BLIP tuntee nämä parametrit: image, task (image_captioning tai visual_question_answering) ja question.
Kuinka nopea BLIP on?
BLIPlla ei ole vielä tarpeeksi mitattuja suorituksia Railwailissa suoritusajan ilmoittamiseksi. Se riippuu syötteestä, asetuksista ja palveluntarjoajan kuormituksesta.
Onko BLIP parempi kuin CLIP Interrogator?
Se riippuu tehtävästä. BLIP (Salesforce) ja CLIP Interrogator (Community) ovat molemmat malleja Multimodaali-kategoriassa. Vertailussa näkyvät niiden hinnat ja tekniset tiedot rinnakkain.
Vertaa BLIP ja CLIP InterrogatorVoiko BLIP käsitellä kuvia?
Kyllä. BLIP hyväksyy kuvia syötteenä tekstin lisäksi.
Vertailukelpoiset mallit
Kaikki tässä kategoriassa- CLIP InterrogatorCommunity
pharmapsychotic's CLIP Interrogator. Takes an image and produces a Stable-Diffusion-style text prompt by combining BLIP captioning with CLIP to rank likely subjects, artists, mediums and styles. Commonly used to reverse-engineer a prompt from an existing picture.
- Depth Anything v2Community
Monocular depth-estimation model trained on 595k labeled and 62M unlabeled images. Strong zero-shot generalization in indoor and outdoor scenes.
Meta Segment Anything 2. Promptable segmentation across images and video with temporal memory. Zero-shot, point/box/mask prompts, fast on a single H100.
Kaikki mallit yhden API:n kautta
Yksi API-avain kaikille Railwailin malleille. Käyttö laskutetaan prepaid-krediiteistä, 1 krediitti = 0,01 $.