BLIP

MultimodaaliSaatavilla
kehittäjä: SalesforceMallin tunnus: blip-captioning

Salesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.

Hinta
≈ 0,00030 $/suoritus
Syöte → tulos
Teksti + Kuva → Teksti
Kehittäjä
Salesforce
Päivitetty
23. syyskuuta 2026
01

Leikkikenttä

Kokeile BLIP

Syöte ja tulos

≈ 0,00030 $/suoritus
Kokeile BLIP

Question for visual question answering mode

Tulos
Vastaus ilmestyy tähän.

Tämä suoritus

noin 0,0003 $ · 0,03 creditiä

Alussa varataan 0,0009 $ (0,09 creditiä); todellinen GPU-aika laskutetaan.

Uusi täällä?

10 ilmaista creditiä (0,10 $) kun rekisteröidyt Googlella

Käytettävissä 24 tuntia rekisteröinnin jälkeen, enintään 5 suoritusta päivässä ja enintään 2 creditiä suoritusta kohti. Muut kirjautumismenetelmät alkavat ilman creditejä. Riittää 111 suoritukseen tästä mallista.

02

Examples

Real outputs from the public examples of this model on Replicate, with the prompt and settings that produced them. They were not generated live on this page.
  • InputInput

    Prompt

    image_captioning

    Output (JSON, shortened)

    [
      {
        "text": "Caption: a woman sitting on the beach with a dog"
      }
    ]
  • InputInput

    Prompt

    what is in the sky?

    Output (JSON, shortened)

    [
      {
        "text": "Answer: moon"
      }
    ]
  • InputInput

    Prompt

    what is in the lake?

    Output (JSON, shortened)

    [
      {
        "text": "Answer: swans"
      }
    ]
03

Tietoja: BLIP

Lyhyesti23. syyskuuta 2026 alkaen

BLIP on Salesforce-kehittäjän malli kategoriasta Multimodaali. Railwailissa BLIP maksaa ≈ 0,00030 $ per suoritus.

BLIP (Bootstrapping Language-Image Pre-training) from Salesforce Research unifies captioning and VQA in one model. In caption mode it returns a concise description of the scene; in question-answering mode it answers a free-form question grounded in the image. It is one of the most-run captioning models on Replicate and a common building block for image search and accessibility alt-text.
04

Hinnat

Hinnat Yhdysvaltain dollareissa. Käyttö laskutetaan prepaid-krediiteistä.
Tyypillinen suoritus (≈ 1 s T4:lla)0,00030 $ per suoritus
GPU-aika (T4)0,00027 $ per GPU-sekunti
  • Laskutus perustuu suorituksen todelliseen GPU-aikaan. Kun suoritus alkaa, 3-kertainen tyypillinen hinta varataan saldostasi ja selvitetään jälkikäteen.
  • 1 krediitti = 0,01 $

Kustannuslaskin

Hintalaskin

s

Palveluntarjoajan mukaan tyypillinen: noin 1 s

Yhteensä

0,03 $

3 krediittiä

Suoritusta kohti

0,0003 $ · 0,03 krediittiä

Laskutus perustuu todelliseen GPU-aikaan; tämä on arvio.

05

API

Kutsu BLIP Railwail-API-avaimellasi. Käytä tätä mallin tunnusta pyynnössä:

Ei vahvistettua API-esimerkkiä

Julkinen API välittää eri syötemuotoa kuin tämä malli tarvitsee. Käytä yllä olevaa leikkikenttää.

06

Tekniset tiedot

Mallin tunnus
blip-captioning
Kehittäjä
Salesforce
Kategoria
Multimodaali
Syöte
Teksti, Kuva
Tuloste
Teksti
Laskutus
Käytön mukaan (tokeneja tai GPU-aikaa)
Luettelokirjaus päivitetty
23. syyskuuta 2026

Syöteparametrit

Mallin syötökaavion syötteet ja asetukset. API-osion esimerkki näyttää, mitkä niistä API hyväksyy.

  • imagepakollinen

    Image to caption or ask about

    Tyyppi: Teksti
    Oletus: –
    Sallitut arvot: –
  • task
    Tyyppi: Valinta
    Oletus: image_captioning
    Sallitut arvot: image_captioning tai visual_question_answering
  • question

    Question for visual question answering mode

    Tyyppi: Teksti
    Oletus: –
    Sallitut arvot: –

Tunnisteet

  • replicate
  • blip
  • captioning
  • vqa
  • salesforce
  • vision-understanding
  • image
07

Usein kysytyt kysymykset

Mikä on BLIP?

BLIP on Salesforcen kehittämä malli Multimodaali-kategoriassa.

Paljonko BLIP maksaa Railwailissa?

Railwailissa BLIP maksaa ≈ 0,00030 $ per suoritus. Sinua veloitetaan siitä, mitä kukin pyyntö todella käyttää. Käyttö maksetaan ennakkoon ostettujen krediittien avulla; 1 krediitti vastaa 0,01 $.

Mitä asetuksia BLIP tukee?

Syötteen rakenteen mukaan BLIP tuntee nämä parametrit: image, task (image_captioning tai visual_question_answering) ja question.

Kuinka nopea BLIP on?

BLIPlla ei ole vielä tarpeeksi mitattuja suorituksia Railwailissa suoritusajan ilmoittamiseksi. Se riippuu syötteestä, asetuksista ja palveluntarjoajan kuormituksesta.

Onko BLIP parempi kuin CLIP Interrogator?

Se riippuu tehtävästä. BLIP (Salesforce) ja CLIP Interrogator (Community) ovat molemmat malleja Multimodaali-kategoriassa. Vertailussa näkyvät niiden hinnat ja tekniset tiedot rinnakkain.

Vertaa BLIP ja CLIP Interrogator

Voiko BLIP käsitellä kuvia?

Kyllä. BLIP hyväksyy kuvia syötteenä tekstin lisäksi.

08

Vertailukelpoiset mallit

Kaikki tässä kategoriassa
  • pharmapsychotic's CLIP Interrogator. Takes an image and produces a Stable-Diffusion-style text prompt by combining BLIP captioning with CLIP to rank likely subjects, artists, mediums and styles. Commonly used to reverse-engineer a prompt from an existing picture.

    ≈ 0,0457 $/suoritus

    15 133 % kalliimpi yksikköä kohti

    Vertaa BLIP ja CLIP Interrogator
  • Monocular depth-estimation model trained on 595k labeled and 62M unlabeled images. Strong zero-shot generalization in indoor and outdoor scenes.

    ≈ 0,0050 $/suoritus

    1 567 % kalliimpi yksikköä kohti

    Vertaa BLIP ja Depth Anything v2
  • Meta Segment Anything 2. Promptable segmentation across images and video with temporal memory. Zero-shot, point/box/mask prompts, fast on a single H100.

    ≈ 0,018 $/suoritus

    5 900 % kalliimpi yksikköä kohti

    Vertaa BLIP ja SAM 2 (Segment Anything 2)

Kaikki mallit yhden API:n kautta

Yksi API-avain kaikille Railwailin malleille. Käyttö laskutetaan prepaid-krediiteistä, 1 krediitti = 0,01 $.