BLIP

MultimodalneDostępne
od SalesforceID modelu: blip-captioning

Salesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.

Cena
≈ 0,00030 USD/uruchomienie
Wejście → Wyjście
Tekst + Obraz → Tekst
Deweloper
Salesforce
Zaktualizowano
23 września 2026
01

Playground

Spróbuj BLIP

Wejście i wyjście

≈ 0,00030 USD/uruchomienie
Spróbuj BLIP

Question for visual question answering mode

Wynik
Odpowiedź pojawi się tutaj.

To uruchomienie

ok. 0,0003 USD · 0,03 kredytów

Na początek rezerwowane jest 0,0009 USD (0,09 kredytów); rozliczana jest rzeczywista czas GPU.

Nowy tutaj?

10 darmowych kredytów (0,10 USD) po zarejestrowaniu się przez Google

Dostępne 24 godzin po rejestracji, do 5 uruchomień dziennie i maksymalnie 2 kredytów na uruchomienie. Inne metody logowania uruchamiają się bez kredytów. Wystarczy na 111 uruchomień tego modelu.

02

Examples

Real outputs from the public examples of this model on Replicate, with the prompt and settings that produced them. They were not generated live on this page.
  • InputInput

    Prompt

    image_captioning

    Output (JSON, shortened)

    [
      {
        "text": "Caption: a woman sitting on the beach with a dog"
      }
    ]
  • InputInput

    Prompt

    what is in the sky?

    Output (JSON, shortened)

    [
      {
        "text": "Answer: moon"
      }
    ]
  • InputInput

    Prompt

    what is in the lake?

    Output (JSON, shortened)

    [
      {
        "text": "Answer: swans"
      }
    ]
03

O BLIP

Krótko mówiącStan na 23 września 2026

BLIP to model opracowany przez Salesforce w kategorii Multimodalne. W serwisie Railwail BLIP kosztuje ≈ 0,00030 USD za uruchomienie.

BLIP (Bootstrapping Language-Image Pre-training) from Salesforce Research unifies captioning and VQA in one model. In caption mode it returns a concise description of the scene; in question-answering mode it answers a free-form question grounded in the image. It is one of the most-run captioning models on Replicate and a common building block for image search and accessibility alt-text.
04

Ceny

Ceny w dolarach amerykańskich. Użycie jest rozliczane z prepłaconych kredytów.
Typowe uruchomienie (≈ 1 s na T4)0,00030 USD za uruchomienie
Czas GPU (T4)0,00027 USD za sekundę GPU
  • Rozliczane są czasy GPU, które przebieg faktycznie zajmuje. Po uruchomieniu przebiegu 3× typowej ceny jest rezerwowane z Twojego salda i rozliczane później.
  • 1 kredyt = 0,01 USD

Kalkulator kosztów

Kalkulator cen

s

Typowo według dostawcy: ok. 1 s

Razem

0,03 USD

3 kredytów

Za uruchomienie

0,0003 USD · 0,03 kredytów

Rozliczane są rzeczywiste sekundy GPU; wartość jest szacunkiem.

05

API

Wywołaj BLIP za pomocą klucza API Railwail. Użyj tego ID modelu w żądaniu:

Brak zweryfikowanego przykładu API

Publiczny API przekazuje inny format wejściowy niż wymaga ten model. Użyj placu zabaw powyżej.

06

Specyfikacje

ID modelu
blip-captioning
Deweloper
Salesforce
Kategoria
Multimodalne
Wejście
Tekst, Obraz
Wyjście
Tekst
Rozliczenie
Według użycia (tokeny lub czas GPU)
Wpis w katalogu zaktualizowany
23 września 2026

Parametry wejściowe

Dane wejściowe i ustawienia ze schematu wejściowego modelu. Przykład w sekcji API pokazuje, które z nich API akceptuje.

  • imagewymagane

    Image to caption or ask about

    Typ: Tekst
    Domyślnie: –
    Dozwolone wartości: –
  • task
    Typ: Wybór
    Domyślnie: image_captioning
    Dozwolone wartości: image_captioning lub visual_question_answering
  • question

    Question for visual question answering mode

    Typ: Tekst
    Domyślnie: –
    Dozwolone wartości: –

Tagi

  • replicate
  • blip
  • captioning
  • vqa
  • salesforce
  • vision-understanding
  • image
07

Często zadawane pytania

Co to jest BLIP?

BLIP to model opracowany przez Salesforce w kategorii Multimodalne.

Ile kosztuje BLIP w serwisie Railwail?

W serwisie Railwail BLIP kosztuje ≈ 0,00030 USD za uruchomienie. Opłata jest pobierana za to, co faktycznie zużywa każde żądanie. Użycie jest opłacane z przedpłaconych kredytów; 1 kredyt równa się 0,01 USD.

Jakie ustawienia obsługuje BLIP?

Zgodnie ze schematem wejściowym, BLIP obsługuje te parametry: image, task (image_captioning lub visual_question_answering) i question.

Jak szybki jest BLIP?

Dla BLIP jest jeszcze zbyt mało zmierzonych przebiegów w serwisie Railwail, aby podać czas przebiegu. Zależy to od wejścia, ustawień i obciążenia u dostawcy.

Czy BLIP jest lepszy niż CLIP Interrogator?

To zależy od zadania. BLIP (Salesforce) i CLIP Interrogator (Community) to oba modele z kategorii Multimodalne. Strona porównania pokazuje ich ceny i specyfikacje obok siebie.

Porównaj BLIP i CLIP Interrogator

Czy BLIP może przetwarzać obrazy?

Tak. BLIP akceptuje obrazy jako wejście oprócz tekstu.

08

Porównywalne modele

Wszystkie w tej kategorii
  • pharmapsychotic's CLIP Interrogator. Takes an image and produces a Stable-Diffusion-style text prompt by combining BLIP captioning with CLIP to rank likely subjects, artists, mediums and styles. Commonly used to reverse-engineer a prompt from an existing picture.

    ≈ 0,0457 USD/uruchomienie

    15 133 % drożej za jednostkę

    Porównaj BLIP i CLIP Interrogator
  • Monocular depth-estimation model trained on 595k labeled and 62M unlabeled images. Strong zero-shot generalization in indoor and outdoor scenes.

    ≈ 0,0050 USD/uruchomienie

    1567 % drożej za jednostkę

    Porównaj BLIP i Depth Anything v2
  • Meta Segment Anything 2. Promptable segmentation across images and video with temporal memory. Zero-shot, point/box/mask prompts, fast on a single H100.

    ≈ 0,018 USD/uruchomienie

    5900 % drożej za jednostkę

    Porównaj BLIP i SAM 2 (Segment Anything 2)

Wszystkie modele przez jedno API

Jeden klucz API dla każdego modelu na Railwail. Opłaty pobierane są z przedpłaconych kredytów, 1 kredyt = 0,01 USD.