BLIP
blip-captioningSalesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.
- Preis
- ca. 0,00030 $/Lauf
- Eingabe → Ausgabe
- Text + Bild → Text
- Entwickler
- Salesforce
- Aktualisiert
- 23. September 2026
Playground
BLIP ausprobieren
Eingabe & Ergebnis
Dieser Lauf
ca. 0,0003 $ · 0,03 Credits
Beim Start werden 0,0009 $ (0,09 Credits) vorgemerkt, abgerechnet wird die tatsächliche GPU-Zeit.
Neu hier?
10 Gratis-Credits (0,10 $) bei Anmeldung mit Google
Nutzbar 24 Stunden nach der Anmeldung, bis zu 5 Läufe pro Tag und höchstens 2 Credits je Lauf. Andere Anmeldearten starten ohne Guthaben. Reicht für 111 Läufe dieses Modells.
Beispiele
EingabePrompt
image_captioning
Ausgabe (JSON, gekürzt)
[ { "text": "Caption: a woman sitting on the beach with a dog" } ]
EingabePrompt
what is in the sky?
Ausgabe (JSON, gekürzt)
[ { "text": "Answer: moon" } ]
EingabePrompt
what is in the lake?
Ausgabe (JSON, gekürzt)
[ { "text": "Answer: swans" } ]
Über BLIP
BLIP ist ein Modell von Salesforce aus der Kategorie Multimodal. Über Railwail kostet BLIP ca. 0,00030 $ pro Lauf.
Preise
| Typischer Lauf (ca. 1 s auf T4) | 0,00030 $ pro Lauf |
|---|---|
| GPU-Zeit (T4) | 0,00027 $ pro GPU-Sekunde |
- Abgerechnet wird die GPU-Zeit, die der Lauf tatsächlich braucht. Beim Start wird das 3-Fache des typischen Preises vom Guthaben vorgemerkt und danach verrechnet.
- 1 Credit = 0,01 $
Kostenrechner
Preisrechner
Typisch laut Anbieter: ca. 1 s
Gesamt
0,03 $
3 Credits
Je Lauf
0,0003 $ · 0,03 Credits
Abgerechnet wird die tatsächliche GPU-Zeit; der Wert ist eine Schätzung.
API
Kein geprüftes API-Beispiel
Die öffentliche API übergibt ein anderes Eingabeformat, als dieses Modell braucht. Nutze den Playground oben.
Spezifikationen
- Modell-ID
blip-captioning- Entwickler
- Salesforce
- Kategorie
- Multimodal
- Eingabe
- Text, Bild
- Ausgabe
- Text
- Abrechnung
- Nach Verbrauch (Token bzw. GPU-Zeit)
- Katalogeintrag aktualisiert
- 23. September 2026
Eingabeparameter
Eingaben und Einstellungen laut Eingabeschema des Modells. Welche davon die API annimmt, zeigt das Beispiel im Abschnitt API.
imagePflichtImage to caption or ask about
Typ: TextStandard: –Erlaubte Werte: –taskTyp: AuswahlStandard:image_captioningErlaubte Werte: image_captioning oder visual_question_answeringquestionQuestion for visual question answering mode
Typ: TextStandard: –Erlaubte Werte: –
Schlagwörter
- replicate
- blip
- captioning
- vqa
- salesforce
- vision-understanding
- image
Häufige Fragen
Was ist BLIP?
BLIP ist ein Modell von Salesforce aus der Kategorie Multimodal.
Was kostet BLIP bei Railwail?
Über Railwail kostet BLIP ca. 0,00030 $ pro Lauf. Abgerechnet wird, was jede Anfrage tatsächlich verbraucht. Bezahlt wird mit vorab gekauften Credits; 1 Credit entspricht 0,01 $.
Welche Einstellungen unterstützt BLIP?
Laut Eingabeschema kennt BLIP diese Parameter: image, task (image_captioning oder visual_question_answering) und question.
Wie schnell ist BLIP?
Für BLIP gibt es bei Railwail noch zu wenige gemessene Läufe, um eine Laufzeit anzugeben. Sie hängt von der Eingabe, den Einstellungen und der Auslastung beim Anbieter ab.
Ist BLIP besser als CLIP Interrogator?
Das hängt von der Aufgabe ab. BLIP (Salesforce) und CLIP Interrogator (Community) sind beide Modelle aus der Kategorie Multimodal. Die Vergleichsseite zeigt Preise und Spezifikationen nebeneinander.
BLIP und CLIP Interrogator vergleichenKann BLIP Bilder verarbeiten?
Ja. BLIP nimmt neben Text auch Bilder als Eingabe an.
Vergleichbare Modelle
Alle dieser Kategorie- CLIP InterrogatorCommunity
pharmapsychotic's CLIP Interrogator. Takes an image and produces a Stable-Diffusion-style text prompt by combining BLIP captioning with CLIP to rank likely subjects, artists, mediums and styles. Commonly used to reverse-engineer a prompt from an existing picture.
- Depth Anything v2Community
Monocular depth-estimation model trained on 595k labeled and 62M unlabeled images. Strong zero-shot generalization in indoor and outdoor scenes.
Meta Segment Anything 2. Promptable segmentation across images and video with temporal memory. Zero-shot, point/box/mask prompts, fast on a single H100.
Alle Modelle über eine API
Ein API-Schlüssel für alle Modelle auf Railwail. Abgerechnet wird über vorab gekaufte Credits, 1 Credit = 0,01 $.