DeepSeek-VL 7B
deepseek-vl-7bDeepSeek-VL 7B chat model. Vision-language model with hybrid vision encoder and strong real-world visual question answering performance.
- Cena
- ≈ 0,0086 US$/spuštění
- Kontext
- 4 096 tokenů
- Max. výstup
- 2 048 tokenů
- Vstup → výstup
- Text + Obrázek → Text
- Vývojář
- DeepSeek
- Aktualizováno
- 23. září 2026
Playground
Vyzkoušet DeepSeek-VL 7B
Žádný formulář vstupu
Pro tento model zatím není formulář vstupu
Jeho vstupy nejsou zatím zdokumentovány. Aby se žádné spuštění neprovádělo s chybným vstupem, zde nenabízíme formulář. Místo toho si vyberte srovnatelný model.
Examples
InputPrompt
Describe each stage of this image
Response
The image depicts a three-stage process for training a vision-language model. 1. Stage 1: Training VL Adapter: In this stage, a vision-language adapter is trained using supervised fine-tuning. The adapter is trained on image-text pairs and pure language sequences. 2. Stage 2: Joint VL Pre-training: In this stage, a joint vision-language model is pre-trained using self-supervised learning. The model is trained on image-text pairs and pure language sequences. 3. Stage 3: Supervised Fine-tuning: In this stage, the model is fine-tuned on supervised tasks using image-text pairs and pure language sequences. The model is trained using a hybrid vision-language adapter, which combines a vision-language adapter with a language model. The model is trained on a variety of tasks, including image captioning, visual question answering, and visual reasoning. The model is able to understand the visual content of an image and generate a natural language description or answer.
InputPrompt
Describe this image
Response
The image you've provided is a meme featuring a French Bulldog lying on its side on a blue wooden floor. The dog's head is resting on its paws, and it appears to be sleeping. The meme has a text overlay that reads "MONDAY. JUST...MONDAY." This suggests that the meme is making a humorous comment about the start of the work week. The dog's relaxed posture and the text overlay together create a light-hearted and relatable message.
O DeepSeek-VL 7B
DeepSeek-VL 7B je model od DeepSeek v kategorii Multimodální. Na Railwail stojí DeepSeek-VL 7B ≈ 0,0086 US$ za spuštění. Kontextní okno obsahuje 4 096 tokenů, odpověď může být dlouhá až 2 048 tokenů.
Ceny
| Typické spuštění (≈ 7 s na L40S) | 0,0086 US$ za spuštění |
|---|---|
| GPU čas (L40S) | 0,00117 US$ za GPU sekundu |
- Účtuje se GPU čas, který spuštění skutečně trvá. Při spuštění je z vašeho zůstatku rezervováno 3× typická cena a později se vypořádá.
- 1 kredit = 0,01 US$
Kalkulátor nákladů
Kalkulátor cen
Typicky podle poskytovatele: přibližně 7,3 s
Celkem
0,86 US$
86 kreditů
Na spuštění
0,0086 US$ · 0,86 kreditů
Účtuje se skutečný čas GPU; jedná se o odhad.
API
Žádný ověřený příklad API
Veřejné API předává jiný formát vstupu, než tento model potřebuje. Použijte playground výše.
Specifikace
- ID modelu
deepseek-vl-7b- Vývojář
- DeepSeek
- Kategorie
- Multimodální
- Vstup
- Text, Obrázek
- Výstup
- Text
- Kontextové okno
- 4 096 tokenů
- Max. výstup
- 2 048 tokenů
- Fakturace
- Podle použití (tokeny nebo GPU čas)
- Záznam v katalogu aktualizován
- 23. září 2026
Štítky
- replicate
- multimodal
- vision-understanding
- deepseek
- open-weights
Často kladené otázky
Co je DeepSeek-VL 7B?
DeepSeek-VL 7B je model od DeepSeek v kategorii Multimodální.
Kolik stojí DeepSeek-VL 7B na Railwail?
Na Railwail stojí DeepSeek-VL 7B ≈ 0,0086 US$ za spuštění. Platíte za to, co každý požadavek skutečně spotřebuje. Použití se platí z předplacených kreditů; 1 kredit se rovná 0,01 US$.
Jaké je kontextní okno DeepSeek-VL 7B?
Kontextní okno DeepSeek-VL 7B obsahuje 4 096 tokenů. Odpověď může být dlouhá až 2 048 tokenů.
Jak rychlý je DeepSeek-VL 7B?
Pro DeepSeek-VL 7B je na Railwail zatím příliš málo naměřených spuštění na uvedení doby běhu. Závisí na vstupu, nastavení a zátěži u poskytovatele.
Je DeepSeek-VL 7B lepší než BLIP?
Záleží na úkolu. DeepSeek-VL 7B (DeepSeek) a BLIP (Salesforce) jsou oba modely v kategorii Multimodální. Stránka porovnání zobrazuje jejich ceny a specifikace vedle sebe.
Porovnat DeepSeek-VL 7B a BLIPMůže DeepSeek-VL 7B zpracovávat obrázky?
Ano. DeepSeek-VL 7B přijímá obrázky jako vstup kromě textu.
Srovnatelné modely
Všechny v této kategorii- BLIPSalesforce
Salesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.
- CLIP InterrogatorCommunity
pharmapsychotic's CLIP Interrogator. Takes an image and produces a Stable-Diffusion-style text prompt by combining BLIP captioning with CLIP to rank likely subjects, artists, mediums and styles. Commonly used to reverse-engineer a prompt from an existing picture.
- Depth Anything v2Community
Monocular depth-estimation model trained on 595k labeled and 62M unlabeled images. Strong zero-shot generalization in indoor and outdoor scenes.
Všechny modely přes jednu API
Jeden API klíč pro všechny modely na Railwail. Použití se účtuje z předplacených kreditů, 1 kredit = 0,01 US$.