Llama 3.2 90B Vision (multimodal)

MultimodalIndisponível
por MetaID do modelo: llama-3-2-90b-vision-mm

Meta's flagship vision-language model. 90B parameters, image understanding + chat, strong VQA performance.

Status
Indisponível
Contexto
131.072 tokens
Saída máxima
8.192 tokens
Entrada → Saída
Texto + Imagem → Texto
Desenvolvedor
Meta
Atualizado
25 de junho de 2026

Llama 3.2 90B Vision (multimodal) não está disponível no momento

Atualmente indisponível: este modelo foi desativado.

Você ainda pode ler os detalhes nesta página. Escolha uma das alternativas disponíveis abaixo para executar um modelo comparável imediatamente.

Ir para alternativas
01

Modelos comparáveis

Todos nesta categoria
  • BLIPSalesforce

    Salesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.

    ≈ US$ 0,00030/execução

  • Anthropic's April 2026 flagship. 87.6% on SWE-bench Verified, 3x higher image resolution, output self-verification, vision + reasoning.

    US$ 6,00/1M entrada

  • Anthropic's balanced mid-tier model from February 2026. Best price/performance for production workloads: 5x cheaper than Opus, near-flagship quality.

    US$ 3,60/1M entrada

02

Playground

Experimentar Llama 3.2 90B Vision (multimodal)

Chat

Indisponível no momento

Atualmente indisponível: este modelo foi desativado.

O playground está desativado. Encontre modelos comparáveis na mesma categoria: Ver alternativas

Experimentar Llama 3.2 90B Vision (multimodal)

Envie uma mensagem. A resposta chega completa assim que o modelo termina (sem streaming).

Prompt do sistema
Comprimento máximo da resposta (tokens)

Esta execução

Sem preço – indisponível no momento.

Novo por aqui?

5 créditos grátis (US$ 0,05) ao se inscrever com Google

Utilizável 24 horas após inscrição, até 5 execuções por dia e no máximo 2 créditos por execução. Outros métodos de login começam sem créditos.

03

Sobre Llama 3.2 90B Vision (multimodal)

ResumoA partir de 25 de junho de 2026

Llama 3.2 90B Vision (multimodal) é um modelo de Meta na categoria Multimodal. Llama 3.2 90B Vision (multimodal) não está disponível no Railwail no momento. A janela de contexto contém 131.072 tokens, e uma resposta pode ter até 8.192 tokens.

Fundo

Sobre Meta AI (FAIR)

Fundado em 2013 · Menlo Park, California, USA

Meta AI is the research arm of Meta Platforms, established in 2013 as Facebook AI Research (FAIR) by Yann LeCun. FAIR has open-sourced many foundational models including PyTorch, RoBERTa, DETR, SAM and the LLaMA family. LLaMA 1 was released in February 2023, LLaMA 2 in July 2023, LLaMA 3 in April 2024 and LLaMA 3.1 (405B) in July 2024. Llama 3.2 launched in September 2024 at Meta Connect, introducing the first multimodal models in the LLaMA family (vision-enabled 11B and 90B) together with tiny on-device text-only siblings (1B, 3B). All Llama 3.2 vision weights are released under the Llama 3 Community Licence and are widely used by enterprise customers via Meta's partner ecosystem (Hugging Face, AWS Bedrock, Azure AI Studio, Google Vertex, Together AI, Groq, Fireworks).

Visite Meta AI (FAIR)

Arquitetura

Decoder-only Transformer with cross-attended vision encoder

Llama 3.2 90B Vision combines the 70B-parameter Llama 3.1 text backbone (extended to 90B with vision components) and a Vision Transformer image encoder integrated via cross-attention adapter layers, similar in spirit to Flamingo but reusing the LLaMA architecture. The vision tower processes each image to a sequence of visual tokens which are injected into specific cross-attention layers of the LLM decoder while the original text-only weights remain frozen during the multimodal training stage, preserving text-only performance. Pretraining used 6B image-text pairs followed by multi-stage supervised fine-tuning and Direct Preference Optimisation (DPO) on a curated set of image instructions, math and chart data. The model supports a 128K context window and accepts up to 1120x1120 image inputs natively (with tiling for larger images). It does not support video or audio. Llama 3.2 90B Vision is released under the Llama 3 Community Licence (free for commercial use under 700M MAU).

Parâmetros
90B
Contexto
128.000 tokens

Capacidades

  • Open-weights 90B vision-language model under Llama 3 Community Licence
  • 128K token context window
  • Image input up to 1120x1120 with tiling for larger images
  • Chart, diagram, OCR and document understanding
  • Strong on MMMU, MathVista, ChartQA and DocVQA among open-weights models
  • Multilingual: English, German, French, Italian, Portuguese, Spanish, Hindi, Thai
  • Tool use and JSON output via Llama 3.1 alignment recipe
  • Best for: open-weights multimodal apps, on-premise document AI, indie research

Treinamento & licença

Pretrained on 6B image-text pairs from public web and licensed sources; supervised fine-tuning and DPO on curated multimodal instruction data. Text knowledge inherited from Llama 3.1 (15T tokens).

Licença: Llama 3 Community Licence: free for commercial use up to 700M MAU; redistribution must include the licence and acceptable use policy.

Testes de segurança: Meta publishes a comprehensive model card with red-team findings on CBRN, child-safety and hate-speech vectors, plus Llama Guard 3 and Prompt Guard 2 companion models for production safety.

Limitações conhecidas

  • No video or audio input
  • Latency and cost dominated by 90B params; requires multi-GPU serving
  • Licence restricts the largest hyperscaler use cases
  • Vision quality below GPT-4o and Claude 3.5 Sonnet on hardest charts
  • English-centric in vision domain
04

Preços

Atualmente indisponível: este modelo foi desativado. Não há preço para este modelo no momento, portanto não pode ser executado.

05

API

Chame Llama 3.2 90B Vision (multimodal) com sua chave de API Railwail. Use este ID de modelo na solicitação:

Indisponível no momento

O modelo não tem preço verificado ou está desativado; chamadas de API são recusadas.

06

Especificações

ID do modelo
llama-3-2-90b-vision-mm
Desenvolvedor
Meta
Categoria
Multimodal
Entrada
Texto, Imagem
Saída
Texto
Janela de contexto
131.072 tokens
Saída máx.
8.192 tokens
Tamanho do modelo
90B
Licença
Llama 3 Community Licence: free for commercial use up to 700M MAU; redistribution must include the licence and acceptable use policy.
Entrada do catálogo atualizada
25 de junho de 2026

Etiquetas

  • meta
  • llama
  • multimodal
  • vision
  • open-weights
07

Casos de uso

Para que é utilizado

  • Open-weights document AI and OCR pipelines
  • On-premise vision-language assistants
  • Chart and diagram understanding for analytics
  • Compliance and regulated-industry multimodal apps
  • Research baselines for vision-language models
08

Perguntas frequentes

O que é Llama 3.2 90B Vision (multimodal)?

Llama 3.2 90B Vision (multimodal) é um modelo de Meta na categoria Multimodal. Está listado no Railwail, mas não pode ser executado no momento.

Quanto custa Llama 3.2 90B Vision (multimodal) no Railwail?

Llama 3.2 90B Vision (multimodal) não pode ser executado no Railwail no momento, portanto não há preço atual. Alternativas disponíveis com preços estão listadas mais abaixo nesta página.

Qual é a janela de contexto de Llama 3.2 90B Vision (multimodal)?

A janela de contexto de Llama 3.2 90B Vision (multimodal) contém 131.072 tokens. Uma resposta pode ter até 8.192 tokens.

Qual é a velocidade de Llama 3.2 90B Vision (multimodal)?

Ainda não há execuções medidas suficientes de Llama 3.2 90B Vision (multimodal) no Railwail para indicar um tempo de execução. Depende da entrada, das configurações e da carga no provedor.

Llama 3.2 90B Vision (multimodal) é melhor que BLIP?

Depende da tarefa. Llama 3.2 90B Vision (multimodal) (Meta) e BLIP (Salesforce) são ambos modelos na categoria Multimodal. A página de comparação mostra seus preços e especificações lado a lado.

Comparar Llama 3.2 90B Vision (multimodal) e BLIP

Llama 3.2 90B Vision (multimodal) pode processar imagens?

Sim. Llama 3.2 90B Vision (multimodal) aceita imagens como entrada além de texto.

Posso usar Llama 3.2 90B Vision (multimodal) agora?

Atualmente indisponível: este modelo foi desativado. A página permanece online; alternativas disponíveis da mesma categoria estão listadas mais abaixo.

Todos os modelos através de uma API

Uma chave API para todos os modelos no Railwail. O uso é cobrado a partir de créditos pré-pagos, 1 crédito = US$ 0,01.