CogVLM2 19B
cogvlm2-19bTsinghua CogVLM2 19B with Llama-3 8B base plus 11B vision expert. Strong document understanding and visual reasoning, 8k context.
- Preço
- ≈ US$ 0,0114/execução
- Contexto
- 8.192 tokens
- Saída máxima
- 2.048 tokens
- Entrada → Saída
- Texto + Imagem → Texto
- Desenvolvedor
- Community
- Atualizado
- 23 de setembro de 2026
Playground
Experimentar CogVLM2 19B
Sem formulário de entrada
Ainda não há formulário de entrada para este modelo
Suas entradas ainda não foram documentadas. Para que nenhuma execução falhe com uma entrada incorreta, não oferecemos um formulário aqui. Escolha um modelo comparável em vez disso.
Examples
InputPrompt
Describe this image.
Response
The image captures a well-lit, modern library or bookstore with a distinct industrial aesthetic. The main focus is a large, wooden bookshelf filled with an assortment of books, creating a warm and inviting atmosphere. The bookshelf is positioned against a rustic brick wall, which adds a touch of vintage charm to the space. The room is illuminated by hanging light bulbs, which dangle from the ceiling in a casual manner. There are also decorative elements such as a potted plant, a small framed sign, and a table with various items on it, enhancing the cozy ambiance. A person is seated at a desk in the foreground, suggesting the space is functional for reading or studying.
Sobre CogVLM2 19B
CogVLM2 19B é um modelo de Community na categoria Multimodal. No Railwail, CogVLM2 19B custa ≈ US$ 0,0114 por execução. A janela de contexto contém 8.192 tokens, e uma resposta pode ter até 2.048 tokens.
Preços
| Execução típica (≈ 10 s em L40S) | US$ 0,0114 por execução |
|---|---|
| Tempo de GPU (L40S) | US$ 0,00117 por segundo de GPU |
- Faturado pelo tempo de GPU que a execução realmente leva. Quando a execução começa, 3× o preço típico é reservado do seu saldo e liquidado depois.
- 1 crédito = US$ 0,01
Calculadora de custos
Calculadora de preços
Típico conforme o provedor: cerca de 9,7 s
Total
US$ 1,14
114 créditos
Por execução
US$ 0,0114 · 1,14 créditos
Faturado pelo tempo real de GPU; este é uma estimativa.
API
Nenhum exemplo de API verificado
A API pública passa um formato de entrada diferente do que este modelo precisa. Use o playground acima.
Especificações
- ID do modelo
cogvlm2-19b- Desenvolvedor
- Community
- Categoria
- Multimodal
- Entrada
- Texto, Imagem
- Saída
- Texto
- Janela de contexto
- 8.192 tokens
- Saída máx.
- 2.048 tokens
- Faturamento
- Por uso (tokens ou tempo de GPU)
- Entrada do catálogo atualizada
- 23 de setembro de 2026
Etiquetas
- replicate
- multimodal
- vision-understanding
- tsinghua
- open-weights
Perguntas frequentes
O que é CogVLM2 19B?
CogVLM2 19B é um modelo de Community na categoria Multimodal.
Quanto custa CogVLM2 19B no Railwail?
No Railwail, CogVLM2 19B custa ≈ US$ 0,0114 por execução. Você é cobrado pelo que cada solicitação realmente usa. O uso é pago com créditos pré-pagos; 1 crédito equivale a US$ 0,01.
Qual é a janela de contexto de CogVLM2 19B?
A janela de contexto de CogVLM2 19B contém 8.192 tokens. Uma resposta pode ter até 2.048 tokens.
Qual é a velocidade de CogVLM2 19B?
Ainda não há execuções medidas suficientes de CogVLM2 19B no Railwail para indicar um tempo de execução. Depende da entrada, das configurações e da carga no provedor.
CogVLM2 19B é melhor que BLIP?
Depende da tarefa. CogVLM2 19B (Community) e BLIP (Salesforce) são ambos modelos na categoria Multimodal. A página de comparação mostra seus preços e especificações lado a lado.
Comparar CogVLM2 19B e BLIPCogVLM2 19B pode processar imagens?
Sim. CogVLM2 19B aceita imagens como entrada além de texto.
Modelos comparáveis
Todos nesta categoria- BLIPSalesforce
Salesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.
- CLIP InterrogatorCommunity
pharmapsychotic's CLIP Interrogator. Takes an image and produces a Stable-Diffusion-style text prompt by combining BLIP captioning with CLIP to rank likely subjects, artists, mediums and styles. Commonly used to reverse-engineer a prompt from an existing picture.
- Depth Anything v2Community
Monocular depth-estimation model trained on 595k labeled and 62M unlabeled images. Strong zero-shot generalization in indoor and outdoor scenes.
Todos os modelos através de uma API
Uma chave API para todos os modelos no Railwail. O uso é cobrado a partir de créditos pré-pagos, 1 crédito = US$ 0,01.