BLIP
blip-captioningSalesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.
- Ár
- ≈ 0,00030 USD/futás
- Bemenet → kimenet
- Szöveg + Kép → Szöveg
- Fejlesztő
- Salesforce
- Frissítve
- 2026. szeptember 23.
Playground
Próbáld ki: BLIP
Bemenet és kimenet
Ez a futtatás
kb. 0,0003 USD · 0,03 kredit
A kezdéskor 0,0009 USD (0,09 kredit) kerül foglalásra; a tényleges GPU-idő alapján történik a számlázás.
Új vagy itt?
10 ingyenes kredit (0,10 USD) Google-fiókkal való regisztrációkor
Használható 24 órával a regisztráció után, naponta legfeljebb 5 futtatás és futtatásonként legfeljebb 2 kredit. Más bejelentkezési módok kreditek nélkül indulnak. Elegendő 111 futtatáshoz.
Examples
InputPrompt
image_captioning
Output (JSON, shortened)
[ { "text": "Caption: a woman sitting on the beach with a dog" } ]
InputPrompt
what is in the sky?
Output (JSON, shortened)
[ { "text": "Answer: moon" } ]
InputPrompt
what is in the lake?
Output (JSON, shortened)
[ { "text": "Answer: swans" } ]
A BLIP névjegye
A BLIP a Salesforce által fejlesztett modell a Multimodális kategóriában. A Railwail-en a BLIP ára ≈ 0,00030 USD futásonként.
Árak
| Tipikus futás (≈ 1 s a(z) T4 eszközön) | 0,00030 USD futásonként |
|---|---|
| GPU-idő (T4) | 0,00027 USD GPU-másodpercenként |
- A futás által ténylegesen igénybevett GPU-idő alapján történik a számlázás. A futás indításakor a tipikus ár 3-szerese kerül foglalásra az egyenlegéből, majd később elszámolásra.
- 1 kredit = 0,01 USD
Költségkalkulátor
Árkalkulátor
A szolgáltató szerint tipikus: kb. 1 mp
Összesen
0,03 USD
3 kredit
Futásonként
0,0003 USD · 0,03 kredit
A tényleges GPU-idő alapján számlázva; ez egy becslés.
API
Nincs ellenőrzött API-példa
A nyilvános API más bemeneti formátumot továbbít, mint amit ez a modell igényel. Használja a fenti Playground-ot.
Specifikációk
- Modell-azonosító
blip-captioning- Fejlesztő
- Salesforce
- Kategória
- Multimodális
- Bemenet
- Szöveg, Kép
- Kimenet
- Szöveg
- Számlázás
- Használat alapján (tokenek vagy GPU-idő)
- Katalógus bejegyzés frissítve
- 2026. szeptember 23.
Bemeneti paraméterek
A modell bemeneti sémájából származó bemenetek és beállítások. Az API szakaszban szereplő példa mutatja, hogy az API melyiket fogadja el.
imagekötelezőImage to caption or ask about
Típus: SzövegAlapértelmezett: –Engedélyezett értékek: –taskTípus: VálasztásAlapértelmezett:image_captioningEngedélyezett értékek: image_captioning vagy visual_question_answeringquestionQuestion for visual question answering mode
Típus: SzövegAlapértelmezett: –Engedélyezett értékek: –
Címkék
- replicate
- blip
- captioning
- vqa
- salesforce
- vision-understanding
- image
Gyakran ismételt kérdések
Mi az a BLIP?
A BLIP a Salesforce által fejlesztett modell a Multimodális kategóriában.
Mennyibe kerül a BLIP a Railwail-on?
A Railwail-en a BLIP ára ≈ 0,00030 USD futásonként. Az egyes kérések tényleges felhasználásáért kell fizetni. A használatért előre vásárolt kreditek alapján kell fizetni; 1 kredit = 0,01 USD.
Milyen beállításokat támogat a BLIP?
A bemeneti séma szerint a BLIP ezeket a paramétereket ismeri: image, task (image_captioning vagy visual_question_answering) és question.
Milyen gyors a BLIP?
A BLIP-nek még nincs elég mért futtatása a Railwail-on ahhoz, hogy futási időt adjunk meg. Ez a bemenettől, a beállításoktól és a szolgáltató terhelésétől függ.
A BLIP jobb, mint a CLIP Interrogator?
Ez a feladattól függ. A BLIP (Salesforce) és a CLIP Interrogator (Community) egyaránt modellek a Multimodális kategóriában. Az összehasonlítás oldal az árakat és specifikációkat egymás mellett mutatja.
BLIP és CLIP Interrogator összehasonlításaA BLIP képes képeket feldolgozni?
Igen. A BLIP szöveg mellett képeket is fogad bemenetként.
Hasonló modellek
Ebben a kategóriában az összes- CLIP InterrogatorCommunity
pharmapsychotic's CLIP Interrogator. Takes an image and produces a Stable-Diffusion-style text prompt by combining BLIP captioning with CLIP to rank likely subjects, artists, mediums and styles. Commonly used to reverse-engineer a prompt from an existing picture.
- Depth Anything v2Community
Monocular depth-estimation model trained on 595k labeled and 62M unlabeled images. Strong zero-shot generalization in indoor and outdoor scenes.
Meta Segment Anything 2. Promptable segmentation across images and video with temporal memory. Zero-shot, point/box/mask prompts, fast on a single H100.
Összes modell egy API-n keresztül
Egy API-kulcs a Railwail összes modelljéhez. A használat előre feltöltött kreditek alapján kerül felszámításra, 1 kredit = 0,01 USD.