BLIP
blip-captioningSalesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.
- Fiyat
- ≈ $0,00030/çalıştırma
- Giriş → Çıkış
- Metin + Görüntü → Metin
- Geliştirici
- Salesforce
- Güncellendi
- 23 Eylül 2026
Playground
BLIP'ı deneyin
Giriş & Sonuç
Bu çalıştırma
yaklaşık $0,0003 · 0,03 kredi
Başlangıçta $0,0009 (0,09 kredi) ayrılır; gerçek GPU süresi faturalandırılır.
Yeni misiniz?
Google ile kaydolduğunuzda 10 ücretsiz kredi ($0,10)
Kaydolduktan 24 saat sonra kullanılabilir, günde 5 çalıştırmaya kadar ve çalıştırma başına en fazla 2 kredi. Diğer oturum açma yöntemleri kredi olmadan başlar. Bu model için 111 çalıştırma yeterli.
Examples
InputPrompt
image_captioning
Output (JSON, shortened)
[ { "text": "Caption: a woman sitting on the beach with a dog" } ]
InputPrompt
what is in the sky?
Output (JSON, shortened)
[ { "text": "Answer: moon" } ]
InputPrompt
what is in the lake?
Output (JSON, shortened)
[ { "text": "Answer: swans" } ]
BLIP Hakkında
BLIP, Salesforce tarafından Multimodal kategorisinde geliştirilen bir modeldir. Railwail üzerinde BLIP maliyeti ≈ $0,00030 çalıştırma başına.
Fiyatlandırma
| Tipik çalıştırma (≈ 1 s, T4 üzerinde) | $0,00030 çalıştırma başına |
|---|---|
| GPU Süresi (T4) | $0,00027 GPU saniyesi başına |
- Çalıştırmanın gerçekten aldığı GPU süresi için faturalandırılır. Çalıştırma başladığında, bakiyenizden tipik fiyatın 3 katı ayrılır ve daha sonra kapatılır.
- 1 kredi = $0,01
Maliyet Hesaplayıcı
Fiyat hesaplayıcı
Sağlayıcıya göre tipik: yaklaşık 1 s
Toplam
$0,03
3 kredi
Çalışma başına
$0,0003 · 0,03 kredi
Gerçek GPU süresi faturalandırılır; bu bir tahmindir.
API
Doğrulanmış API örneği yok
Genel API, bu modelin ihtiyaç duyduğundan farklı bir giriş biçimi iletir. Yukarıdaki oyun alanını kullanın.
Özellikler
- Model Kimliği
blip-captioning- Geliştirici
- Salesforce
- Kategori
- Multimodal
- Giriş
- Metin, Görüntü
- Çıkış
- Metin
- Faturalandırma
- Kullanıma göre (token veya GPU süresi)
- Katalog girişi güncellendi
- 23 Eylül 2026
Giriş Parametreleri
Modelin giriş şemasından giriş ve ayarlar. API bölümündeki örnek, API'nin hangilerini kabul ettiğini gösterir.
imagegerekliImage to caption or ask about
Tür: MetinVarsayılan: –İzin verilen değerler: –taskTür: SeçimVarsayılan:image_captioningİzin verilen değerler: image_captioning veya visual_question_answeringquestionQuestion for visual question answering mode
Tür: MetinVarsayılan: –İzin verilen değerler: –
Etiketler
- replicate
- blip
- captioning
- vqa
- salesforce
- vision-understanding
- image
Sık Sorulan Sorular
BLIP nedir?
BLIP, Salesforce tarafından Multimodal kategorisinde oluşturulan bir modeldir.
BLIP Railwail'de ne kadar maliyetlidir?
Railwail üzerinde BLIP maliyeti ≈ $0,00030 çalıştırma başına. Her istek gerçekten ne kadar kullanırsa o kadar ücretlendirilirsiniz. Kullanım ön ödemeli kredilerden ödenir; 1 kredi $0,01 değerindedir.
BLIP hangi ayarları destekler?
Giriş şemasına göre BLIP şu parametreleri bilir: image, task (image_captioning veya visual_question_answering) ve question.
BLIP ne kadar hızlıdır?
Railwail'de BLIP için henüz çalıştırma süresi belirtmek için yeterli ölçülen çalıştırma yoktur. Bu, giriş, ayarlar ve sağlayıcıdaki yüke bağlıdır.
BLIP, CLIP Interrogator'dan daha iyi midir?
Bu göreve bağlıdır. BLIP (Salesforce) ve CLIP Interrogator (Community) her ikisi de Multimodal kategorisinde modellerdir. Karşılaştırma sayfası fiyatlarını ve özelliklerini yan yana gösterir.
BLIP ve CLIP Interrogator'ı karşılaştırBLIP görüntüleri işleyebilir mi?
Evet. BLIP metne ek olarak giriş olarak görüntüleri kabul eder.
Karşılaştırılabilir modeller
Bu kategorideki tümü- CLIP InterrogatorCommunity
pharmapsychotic's CLIP Interrogator. Takes an image and produces a Stable-Diffusion-style text prompt by combining BLIP captioning with CLIP to rank likely subjects, artists, mediums and styles. Commonly used to reverse-engineer a prompt from an existing picture.
- Depth Anything v2Community
Monocular depth-estimation model trained on 595k labeled and 62M unlabeled images. Strong zero-shot generalization in indoor and outdoor scenes.
Meta Segment Anything 2. Promptable segmentation across images and video with temporal memory. Zero-shot, point/box/mask prompts, fast on a single H100.
Tüm Modeller Tek Bir API Aracılığıyla
Railwail'deki her model için bir API anahtarı. Kullanım, ön ödemeli kredilerden tahsil edilir, 1 kredi = $0,01.