Llama 3.2 Vision 11B (Ollama)
llama-3-2-vision-11b-ollamaMeta Llama 3.2 11B Vision served via Ollama on Replicate. Open-weights multimodal model for image captioning, document and chart reading, and visual question answering.
- Preço
- ≈ US$ 0,0039/execução
- Entrada → Saída
- Texto + Imagem → Texto
- Desenvolvedor
- Community
- Atualizado
- 23 de setembro de 2026
Playground
Experimentar Llama 3.2 Vision 11B (Ollama)
Entrada & saída
Esta execução
cerca de US$ 0,0039 · 0,39 créditos
US$ 0,0116 (1,16 créditos) são reservados no início; o tempo real de GPU é cobrado.
Novo por aqui?
10 créditos grátis (US$ 0,10) ao se inscrever com Google
Utilizável 24 horas após inscrição, até 5 execuções por dia e no máximo 2 créditos por execução. Outros métodos de login começam sem créditos. Suficiente para 8 execuções deste modelo.
Examples
InputPrompt
Where to find this monument? Can you give me other recommendations around the area?
Response
**Wat Phra Kaew (Temple of the Emerald Buddha)** in Bangkok, Thailand. Located within the Grand Palace complex, Wat Phra Kaew is a highly revered and sacred site that houses the iconic Emerald Buddha image. The temple's design incorporates traditional Thai architecture with intricate details and ornate decorations, featuring an imposing spire topped by a golden finial adorned with images of mythical creatures. **Recommendations for Your Visit:** * **Grand Palace**: Explore the sprawling palace grounds, which include several other notable temples and buildings. * **Wat Arun (Temple of Dawn)**: A nearby temple famous for its distinctive spire covered in colorful ceramics and glints of gold. * **Chao Phraya River Cruise**: Take a boat ride along the river to admire the city's skyline and learn about its history. * **Jim Thompson House Museum**: Visit this museum dedicated to Thai art and culture, featuring traditional architecture and beautiful gardens. Wat Phra Kaew is an absolute must-visit attraction when in Bangkok. With these recommendations, you'll have a well-rounded experience of the city's rich cultural heritage.
InputPrompt
How long does it take from invoice date to due date? Be short and concise.
Response
From the invoice date of 11/02/2019 to the due date of 26/02/2019, there is a difference of **15 days**. This calculation was performed by subtracting the invoice date from the due date: 26/02/2019 - 11/02/2019 = 15
InputPrompt
What happens when you take out white cat from this chain?
Response
The white cat is not present in the food web. The correct term for a wild animal would be "wildcat." If we were to remove a wildcat from the ecosystem, it would no longer be able to hunt or prey on other animals. This could have cascading effects throughout the entire ecosystem. *Answer*: Wildcat will lose its source of food and nutrients
Sobre Llama 3.2 Vision 11B (Ollama)
Llama 3.2 Vision 11B (Ollama) é um modelo de Community na categoria Multimodal. No Railwail, Llama 3.2 Vision 11B (Ollama) custa ≈ US$ 0,0039 por execução.
Preços
| Execução típica (≈ 3 s em L40S) | US$ 0,0039 por execução |
|---|---|
| Tempo de GPU (L40S) | US$ 0,00117 por segundo de GPU |
- Faturado pelo tempo de GPU que a execução realmente leva. Quando a execução começa, 3× o preço típico é reservado do seu saldo e liquidado depois.
- 1 crédito = US$ 0,01
Calculadora de custos
Calculadora de preços
Típico conforme o provedor: cerca de 3,3 s
Total
US$ 0,39
39 créditos
Por execução
US$ 0,0039 · 0,39 créditos
Faturado pelo tempo real de GPU; este é uma estimativa.
API
Nenhum exemplo de API verificado
A API pública passa um formato de entrada diferente do que este modelo precisa. Use o playground acima.
Especificações
- ID do modelo
llama-3-2-vision-11b-ollama- Desenvolvedor
- Community
- Categoria
- Multimodal
- Entrada
- Texto, Imagem
- Saída
- Texto
- Faturamento
- Por uso (tokens ou tempo de GPU)
- Entrada do catálogo atualizada
- 23 de setembro de 2026
Parâmetros de entrada
Entradas e configurações do esquema de entrada do modelo. O exemplo na seção API mostra quais delas a API aceita.
promptobrigatórioQuestion about the image
Tipo: TextoPadrão: –Valores permitidos: até 16.000 caracteresimage_urlImage URL to analyze
Tipo: TextoPadrão: –Valores permitidos: –max_tokensTipo: Número inteiroPadrão:1024Valores permitidos: 1 a 4.096temperatureTipo: NúmeroPadrão:0.7Valores permitidos: 0 a 2
Etiquetas
- replicate
- meta
- llama
- vision-understanding
- open-weights
- ollama
Perguntas frequentes
O que é Llama 3.2 Vision 11B (Ollama)?
Llama 3.2 Vision 11B (Ollama) é um modelo de Community na categoria Multimodal.
Quanto custa Llama 3.2 Vision 11B (Ollama) no Railwail?
No Railwail, Llama 3.2 Vision 11B (Ollama) custa ≈ US$ 0,0039 por execução. Você é cobrado pelo que cada solicitação realmente usa. O uso é pago com créditos pré-pagos; 1 crédito equivale a US$ 0,01.
Quais configurações Llama 3.2 Vision 11B (Ollama) suporta?
De acordo com seu esquema de entrada, Llama 3.2 Vision 11B (Ollama) conhece estes parâmetros: prompt (até 16.000 caracteres), image_url, max_tokens (1 a 4.096) e temperature (0 a 2).
Qual é a velocidade de Llama 3.2 Vision 11B (Ollama)?
Ainda não há execuções medidas suficientes de Llama 3.2 Vision 11B (Ollama) no Railwail para indicar um tempo de execução. Depende da entrada, das configurações e da carga no provedor.
Llama 3.2 Vision 11B (Ollama) é melhor que BLIP?
Depende da tarefa. Llama 3.2 Vision 11B (Ollama) (Community) e BLIP (Salesforce) são ambos modelos na categoria Multimodal. A página de comparação mostra seus preços e especificações lado a lado.
Comparar Llama 3.2 Vision 11B (Ollama) e BLIPLlama 3.2 Vision 11B (Ollama) pode processar imagens?
Sim. Llama 3.2 Vision 11B (Ollama) aceita imagens como entrada além de texto.
Modelos comparáveis
Todos nesta categoria- BLIPSalesforce
Salesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.
- CLIP InterrogatorCommunity
pharmapsychotic's CLIP Interrogator. Takes an image and produces a Stable-Diffusion-style text prompt by combining BLIP captioning with CLIP to rank likely subjects, artists, mediums and styles. Commonly used to reverse-engineer a prompt from an existing picture.
≈ US$ 0,0457/execução
1.072 % mais caro por unidade
Comparar Llama 3.2 Vision 11B (Ollama) vs. CLIP Interrogator - Depth Anything v2Community
Monocular depth-estimation model trained on 595k labeled and 62M unlabeled images. Strong zero-shot generalization in indoor and outdoor scenes.
≈ US$ 0,0050/execução
28 % mais caro por unidade
Comparar Llama 3.2 Vision 11B (Ollama) vs. Depth Anything v2
Todos os modelos através de uma API
Uma chave API para todos os modelos no Railwail. O uso é cobrado a partir de créditos pré-pagos, 1 crédito = US$ 0,01.