Llama 3.2 90B Vision (multimodal)

MultimodaleNon disponibile
di MetaID modello: llama-3-2-90b-vision-mm

Meta's flagship vision-language model. 90B parameters, image understanding + chat, strong VQA performance.

Stato
Non disponibile
Contesto
131.072 token
Max. output
8192 token
Input → output
Testo + Immagine → Testo
Sviluppatore
Meta
Aggiornato
25 giugno 2026

Llama 3.2 90B Vision (multimodal) non è attualmente disponibile

Attualmente non disponibile: questo modello è stato disattivato.

Puoi comunque leggere i dettagli su questa pagina. Scegli una delle alternative disponibili di seguito per eseguire subito un modello comparabile.

Vai alle alternative
01

Modelli comparabili

Tutti in questa categoria
  • BLIPSalesforce

    Salesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.

    ≈ 0,00030 USD/esecuzione

  • Anthropic's April 2026 flagship. 87.6% on SWE-bench Verified, 3x higher image resolution, output self-verification, vision + reasoning.

    6,00 USD/1M in

  • Anthropic's balanced mid-tier model from February 2026. Best price/performance for production workloads: 5x cheaper than Opus, near-flagship quality.

    3,60 USD/1M in

02

Playground

Prova Llama 3.2 90B Vision (multimodal)

Chat

Attualmente non disponibile

Attualmente non disponibile: questo modello è stato disattivato.

Il playground è disabilitato. Trovi modelli comparabili nella stessa categoria: Visualizza alternative

Prova Llama 3.2 90B Vision (multimodal)

Invia un messaggio. La risposta arriva completa quando il modello ha finito (senza streaming).

Prompt di sistema
Lunghezza massima della risposta (token)

Questa esecuzione

Nessun prezzo – attualmente non disponibile.

Nuovo qui?

5 crediti gratuiti (0,05 USD) quando ti iscrivi con Google

Utilizzabile 24 ore dopo l'iscrizione, fino a 5 esecuzioni al giorno e al massimo 2 crediti per esecuzione. Altri metodi di accesso iniziano senza crediti.

03

Informazioni su Llama 3.2 90B Vision (multimodal)

RiassuntoA partire da 25 giugno 2026

Llama 3.2 90B Vision (multimodal) è un modello di Meta nella categoria Multimodale. Llama 3.2 90B Vision (multimodal) non è attualmente disponibile su Railwail. La finestra di contesto contiene 131.072 token e una risposta può essere lunga fino a 8192 token.

Sfondo

Informazioni su Meta AI (FAIR)

Fondato 2013 · Menlo Park, California, USA

Meta AI is the research arm of Meta Platforms, established in 2013 as Facebook AI Research (FAIR) by Yann LeCun. FAIR has open-sourced many foundational models including PyTorch, RoBERTa, DETR, SAM and the LLaMA family. LLaMA 1 was released in February 2023, LLaMA 2 in July 2023, LLaMA 3 in April 2024 and LLaMA 3.1 (405B) in July 2024. Llama 3.2 launched in September 2024 at Meta Connect, introducing the first multimodal models in the LLaMA family (vision-enabled 11B and 90B) together with tiny on-device text-only siblings (1B, 3B). All Llama 3.2 vision weights are released under the Llama 3 Community Licence and are widely used by enterprise customers via Meta's partner ecosystem (Hugging Face, AWS Bedrock, Azure AI Studio, Google Vertex, Together AI, Groq, Fireworks).

Visita Meta AI (FAIR)

Architettura

Decoder-only Transformer with cross-attended vision encoder

Llama 3.2 90B Vision combines the 70B-parameter Llama 3.1 text backbone (extended to 90B with vision components) and a Vision Transformer image encoder integrated via cross-attention adapter layers, similar in spirit to Flamingo but reusing the LLaMA architecture. The vision tower processes each image to a sequence of visual tokens which are injected into specific cross-attention layers of the LLM decoder while the original text-only weights remain frozen during the multimodal training stage, preserving text-only performance. Pretraining used 6B image-text pairs followed by multi-stage supervised fine-tuning and Direct Preference Optimisation (DPO) on a curated set of image instructions, math and chart data. The model supports a 128K context window and accepts up to 1120x1120 image inputs natively (with tiling for larger images). It does not support video or audio. Llama 3.2 90B Vision is released under the Llama 3 Community Licence (free for commercial use under 700M MAU).

Parametri
90B
Contesto
128.000 token

Capacità

  • Open-weights 90B vision-language model under Llama 3 Community Licence
  • 128K token context window
  • Image input up to 1120x1120 with tiling for larger images
  • Chart, diagram, OCR and document understanding
  • Strong on MMMU, MathVista, ChartQA and DocVQA among open-weights models
  • Multilingual: English, German, French, Italian, Portuguese, Spanish, Hindi, Thai
  • Tool use and JSON output via Llama 3.1 alignment recipe
  • Best for: open-weights multimodal apps, on-premise document AI, indie research

Addestramento e licenza

Pretrained on 6B image-text pairs from public web and licensed sources; supervised fine-tuning and DPO on curated multimodal instruction data. Text knowledge inherited from Llama 3.1 (15T tokens).

Licenza: Llama 3 Community Licence: free for commercial use up to 700M MAU; redistribution must include the licence and acceptable use policy.

Test di sicurezza: Meta publishes a comprehensive model card with red-team findings on CBRN, child-safety and hate-speech vectors, plus Llama Guard 3 and Prompt Guard 2 companion models for production safety.

Limitazioni note

  • No video or audio input
  • Latency and cost dominated by 90B params; requires multi-GPU serving
  • Licence restricts the largest hyperscaler use cases
  • Vision quality below GPT-4o and Claude 3.5 Sonnet on hardest charts
  • English-centric in vision domain
04

Prezzi

Attualmente non disponibile: questo modello è stato disattivato. Al momento non c'è un prezzo per questo modello, quindi non può essere eseguito.

05

API

Chiama Llama 3.2 90B Vision (multimodal) con la tua chiave API Railwail. Usa questo ID modello nella richiesta:

Attualmente non disponibile

Il modello non ha un prezzo verificato o è disattivato; le chiamate API vengono rifiutate.

06

Specifiche

ID modello
llama-3-2-90b-vision-mm
Sviluppatore
Meta
Categoria
Multimodale
Input
Testo, Immagine
Output
Testo
Finestra di contesto
131.072 token
Output massimo
8192 token
Dimensione del modello
90B
Licenza
Llama 3 Community Licence: free for commercial use up to 700M MAU; redistribution must include the licence and acceptable use policy.
Voce di catalogo aggiornata
25 giugno 2026

Etichette

  • meta
  • llama
  • multimodal
  • vision
  • open-weights
07

Casi d'uso

A cosa serve

  • Open-weights document AI and OCR pipelines
  • On-premise vision-language assistants
  • Chart and diagram understanding for analytics
  • Compliance and regulated-industry multimodal apps
  • Research baselines for vision-language models
08

Domande frequenti

Cos'è Llama 3.2 90B Vision (multimodal)?

Llama 3.2 90B Vision (multimodal) è un modello di Meta nella categoria Multimodale. È elencato su Railwail ma non può essere eseguito al momento.

Quanto costa Llama 3.2 90B Vision (multimodal) su Railwail?

Llama 3.2 90B Vision (multimodal) non può essere eseguito su Railwail al momento, quindi non c'è un prezzo attuale. Le alternative disponibili con i prezzi sono elencate più in basso in questa pagina.

Qual è la finestra di contesto di Llama 3.2 90B Vision (multimodal)?

La finestra di contesto di Llama 3.2 90B Vision (multimodal) contiene 131.072 token. Una risposta può essere lunga fino a 8192 token.

Quanto è veloce Llama 3.2 90B Vision (multimodal)?

Non ci sono ancora abbastanza esecuzioni misurate di Llama 3.2 90B Vision (multimodal) su Railwail per indicare un tempo di esecuzione. Dipende dall'input, dalle impostazioni e dal carico presso il provider.

Llama 3.2 90B Vision (multimodal) è migliore di BLIP?

Dipende dall'attività. Llama 3.2 90B Vision (multimodal) (Meta) e BLIP (Salesforce) sono entrambi modelli nella categoria Multimodale. La pagina di confronto mostra i loro prezzi e le specifiche affiancati.

Confronta Llama 3.2 90B Vision (multimodal) e BLIP

Llama 3.2 90B Vision (multimodal) può elaborare immagini?

Sì. Llama 3.2 90B Vision (multimodal) accetta immagini come input oltre al testo.

Posso usare Llama 3.2 90B Vision (multimodal) adesso?

Attualmente non disponibile: questo modello è stato disattivato. La pagina rimane online; le alternative disponibili della stessa categoria sono elencate più in basso.

Tutti i modelli tramite un'API

Una chiave API per tutti i modelli su Railwail. L'utilizzo viene addebitato da crediti prepagati, 1 credito = 0,01 USD.