CogVLM2 19B
cogvlm2-19bTsinghua CogVLM2 19B with Llama-3 8B base plus 11B vision expert. Strong document understanding and visual reasoning, 8k context.
- Ár
- ≈ 0,0114 USD/futás
- Kontextus
- 8192 token
- Max. kimenet
- 2048 token
- Bemenet → kimenet
- Szöveg + Kép → Szöveg
- Fejlesztő
- Community
- Frissítve
- 2026. szeptember 23.
Playground
Próbáld ki: CogVLM2 19B
Nincs beviteli forma
Ehhez a modellhez még nincs beviteli forma
A bemenete még nincs dokumentálva. Hogy ne hiúsuljon meg egy futtatás rossz bemenet miatt, itt nem kínálunk formot. Válassz helyette egy hasonló modellt.
Examples
InputPrompt
Describe this image.
Response
The image captures a well-lit, modern library or bookstore with a distinct industrial aesthetic. The main focus is a large, wooden bookshelf filled with an assortment of books, creating a warm and inviting atmosphere. The bookshelf is positioned against a rustic brick wall, which adds a touch of vintage charm to the space. The room is illuminated by hanging light bulbs, which dangle from the ceiling in a casual manner. There are also decorative elements such as a potted plant, a small framed sign, and a table with various items on it, enhancing the cozy ambiance. A person is seated at a desk in the foreground, suggesting the space is functional for reading or studying.
A CogVLM2 19B névjegye
A CogVLM2 19B a Community által fejlesztett modell a Multimodális kategóriában. A Railwail-en a CogVLM2 19B ára ≈ 0,0114 USD futásonként. A kontextablak 8192 tokent tartalmaz, egy válasz pedig legfeljebb 2048 token hosszú lehet.
Árak
| Tipikus futás (≈ 10 s a(z) L40S eszközön) | 0,0114 USD futásonként |
|---|---|
| GPU-idő (L40S) | 0,00117 USD GPU-másodpercenként |
- A futás által ténylegesen igénybevett GPU-idő alapján történik a számlázás. A futás indításakor a tipikus ár 3-szerese kerül foglalásra az egyenlegéből, majd később elszámolásra.
- 1 kredit = 0,01 USD
Költségkalkulátor
Árkalkulátor
A szolgáltató szerint tipikus: kb. 9,7 mp
Összesen
1,14 USD
114 kredit
Futásonként
0,0114 USD · 1,14 kredit
A tényleges GPU-idő alapján számlázva; ez egy becslés.
API
Nincs ellenőrzött API-példa
A nyilvános API más bemeneti formátumot továbbít, mint amit ez a modell igényel. Használja a fenti Playground-ot.
Specifikációk
- Modell-azonosító
cogvlm2-19b- Fejlesztő
- Community
- Kategória
- Multimodális
- Bemenet
- Szöveg, Kép
- Kimenet
- Szöveg
- Kontextusablak
- 8192 token
- Max. kimenet
- 2048 token
- Számlázás
- Használat alapján (tokenek vagy GPU-idő)
- Katalógus bejegyzés frissítve
- 2026. szeptember 23.
Címkék
- replicate
- multimodal
- vision-understanding
- tsinghua
- open-weights
Gyakran ismételt kérdések
Mi az a CogVLM2 19B?
A CogVLM2 19B a Community által fejlesztett modell a Multimodális kategóriában.
Mennyibe kerül a CogVLM2 19B a Railwail-on?
A Railwail-en a CogVLM2 19B ára ≈ 0,0114 USD futásonként. Az egyes kérések tényleges felhasználásáért kell fizetni. A használatért előre vásárolt kreditek alapján kell fizetni; 1 kredit = 0,01 USD.
Mekkora a CogVLM2 19B kontextablaka?
A CogVLM2 19B kontextablaka 8192 tokent tartalmaz. Egy válasz legfeljebb 2048 token hosszú lehet.
Milyen gyors a CogVLM2 19B?
A CogVLM2 19B-nek még nincs elég mért futtatása a Railwail-on ahhoz, hogy futási időt adjunk meg. Ez a bemenettől, a beállításoktól és a szolgáltató terhelésétől függ.
A CogVLM2 19B jobb, mint a BLIP?
Ez a feladattól függ. A CogVLM2 19B (Community) és a BLIP (Salesforce) egyaránt modellek a Multimodális kategóriában. Az összehasonlítás oldal az árakat és specifikációkat egymás mellett mutatja.
CogVLM2 19B és BLIP összehasonlításaA CogVLM2 19B képes képeket feldolgozni?
Igen. A CogVLM2 19B szöveg mellett képeket is fogad bemenetként.
Hasonló modellek
Ebben a kategóriában az összes- BLIPSalesforce
Salesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.
- CLIP InterrogatorCommunity
pharmapsychotic's CLIP Interrogator. Takes an image and produces a Stable-Diffusion-style text prompt by combining BLIP captioning with CLIP to rank likely subjects, artists, mediums and styles. Commonly used to reverse-engineer a prompt from an existing picture.
- Depth Anything v2Community
Monocular depth-estimation model trained on 595k labeled and 62M unlabeled images. Strong zero-shot generalization in indoor and outdoor scenes.
Összes modell egy API-n keresztül
Egy API-kulcs a Railwail összes modelljéhez. A használat előre feltöltött kreditek alapján kerül felszámításra, 1 kredit = 0,01 USD.