Llama 3.2 90B Vision (multimodal)

MultimodalInte tillgänglig
av MetaModell-ID: llama-3-2-90b-vision-mm

Meta's flagship vision-language model. 90B parameters, image understanding + chat, strong VQA performance.

Status
Inte tillgänglig
Kontext
131 072 tokens
Max. utdata
8 192 tokens
Inmatning → utmatning
Text + Bild → Text
Utvecklare
Meta
Uppdaterad
25 juni 2026

Llama 3.2 90B Vision (multimodal) är för närvarande otillgänglig

Inte tillgänglig för närvarande: denna modell är inaktiverad.

Du kan fortfarande läsa detaljerna på denna sida. Välj ett av de tillgängliga alternativen nedan för att köra en jämförbar modell direkt.

Gå till alternativ
01

Jämförbara modeller

Alla i denna kategori
  • BLIPSalesforce

    Salesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.

    ≈ 0,00030 US$/körning

  • Anthropic's April 2026 flagship. 87.6% on SWE-bench Verified, 3x higher image resolution, output self-verification, vision + reasoning.

    6,00 US$/1M in

  • Anthropic's balanced mid-tier model from February 2026. Best price/performance for production workloads: 5x cheaper than Opus, near-flagship quality.

    3,60 US$/1M in

02

Playground

Prova Llama 3.2 90B Vision (multimodal)

Chatt

Inte tillgänglig för närvarande

Inte tillgänglig för närvarande: denna modell är inaktiverad.

Lekplatsen är inaktiverad. Du hittar jämförbara modeller i samma kategori: Visa alternativ

Prova Llama 3.2 90B Vision (multimodal)

Skicka ett meddelande. Svaret kommer i sin helhet när modellen är klar (ingen streaming).

Systemprompt
Max. svarslängd (tokens)

Denna körning

Inget pris – för närvarande otillgängligt.

Ny här?

5 gratis credits (0,05 US$) när du registrerar dig med Google

Användbar 24 timmar efter registrering, upp till 5 körningar per dag och högst 2 credits per körning. Andra inloggningsmetoder startar utan credits.

03

Om Llama 3.2 90B Vision (multimodal)

Kort sagtFrån och med 25 juni 2026

Llama 3.2 90B Vision (multimodal) är en modell av Meta i kategorin Multimodal. Llama 3.2 90B Vision (multimodal) är för närvarande inte tillgänglig på Railwail. Kontextfönstret innehåller 131 072 tokens, och ett svar kan vara upp till 8 192 tokens långt.

Bakgrund

Om Meta AI (FAIR)

Grundat 2013 · Menlo Park, California, USA

Meta AI is the research arm of Meta Platforms, established in 2013 as Facebook AI Research (FAIR) by Yann LeCun. FAIR has open-sourced many foundational models including PyTorch, RoBERTa, DETR, SAM and the LLaMA family. LLaMA 1 was released in February 2023, LLaMA 2 in July 2023, LLaMA 3 in April 2024 and LLaMA 3.1 (405B) in July 2024. Llama 3.2 launched in September 2024 at Meta Connect, introducing the first multimodal models in the LLaMA family (vision-enabled 11B and 90B) together with tiny on-device text-only siblings (1B, 3B). All Llama 3.2 vision weights are released under the Llama 3 Community Licence and are widely used by enterprise customers via Meta's partner ecosystem (Hugging Face, AWS Bedrock, Azure AI Studio, Google Vertex, Together AI, Groq, Fireworks).

Besök Meta AI (FAIR)

Arkitektur

Decoder-only Transformer with cross-attended vision encoder

Llama 3.2 90B Vision combines the 70B-parameter Llama 3.1 text backbone (extended to 90B with vision components) and a Vision Transformer image encoder integrated via cross-attention adapter layers, similar in spirit to Flamingo but reusing the LLaMA architecture. The vision tower processes each image to a sequence of visual tokens which are injected into specific cross-attention layers of the LLM decoder while the original text-only weights remain frozen during the multimodal training stage, preserving text-only performance. Pretraining used 6B image-text pairs followed by multi-stage supervised fine-tuning and Direct Preference Optimisation (DPO) on a curated set of image instructions, math and chart data. The model supports a 128K context window and accepts up to 1120x1120 image inputs natively (with tiling for larger images). It does not support video or audio. Llama 3.2 90B Vision is released under the Llama 3 Community Licence (free for commercial use under 700M MAU).

Parameter
90B
Kontext
128 000 tokens

Funktioner

  • Open-weights 90B vision-language model under Llama 3 Community Licence
  • 128K token context window
  • Image input up to 1120x1120 with tiling for larger images
  • Chart, diagram, OCR and document understanding
  • Strong on MMMU, MathVista, ChartQA and DocVQA among open-weights models
  • Multilingual: English, German, French, Italian, Portuguese, Spanish, Hindi, Thai
  • Tool use and JSON output via Llama 3.1 alignment recipe
  • Best for: open-weights multimodal apps, on-premise document AI, indie research

Träning & licens

Pretrained on 6B image-text pairs from public web and licensed sources; supervised fine-tuning and DPO on curated multimodal instruction data. Text knowledge inherited from Llama 3.1 (15T tokens).

Licens: Llama 3 Community Licence: free for commercial use up to 700M MAU; redistribution must include the licence and acceptable use policy.

Säkerhetstestning: Meta publishes a comprehensive model card with red-team findings on CBRN, child-safety and hate-speech vectors, plus Llama Guard 3 and Prompt Guard 2 companion models for production safety.

Kända begränsningar

  • No video or audio input
  • Latency and cost dominated by 90B params; requires multi-GPU serving
  • Licence restricts the largest hyperscaler use cases
  • Vision quality below GPT-4o and Claude 3.5 Sonnet on hardest charts
  • English-centric in vision domain
04

Priser

Inte tillgänglig för närvarande: denna modell är inaktiverad. Det finns ingen pris för denna modell för närvarande, så den kan inte köras.

05

API

Anropa Llama 3.2 90B Vision (multimodal) med din Railwail API-nyckel. Använd detta modell-ID i begäran:
llama-3-2-90b-vision-mmAPI-dokumentationHämta API-nyckel

För närvarande otillgänglig

Modellen har inget verifierat pris eller är inaktiverad; API-anrop avvisas.

06

Specifikationer

Modell-ID
llama-3-2-90b-vision-mm
Utvecklare
Meta
Kategori
Multimodal
Inmatning
Text, Bild
Utmatning
Text
Kontextfönster
131 072 tokens
Max. utmatning
8 192 tokens
Modellstorlek
90B
Licens
Llama 3 Community Licence: free for commercial use up to 700M MAU; redistribution must include the licence and acceptable use policy.
Kataloginlägg uppdaterat
25 juni 2026

Taggar

  • meta
  • llama
  • multimodal
  • vision
  • open-weights
07

Användningsfall

Vad det används till

  • Open-weights document AI and OCR pipelines
  • On-premise vision-language assistants
  • Chart and diagram understanding for analytics
  • Compliance and regulated-industry multimodal apps
  • Research baselines for vision-language models
08

Vanliga frågor

Vad är Llama 3.2 90B Vision (multimodal)?

Llama 3.2 90B Vision (multimodal) är en modell av Meta i kategorin Multimodal. Den finns i Railwail-katalogen men kan inte köras för närvarande.

Vad kostar Llama 3.2 90B Vision (multimodal) på Railwail?

Llama 3.2 90B Vision (multimodal) kan inte köras på Railwail för närvarande, så det finns inget aktuellt pris. Tillgängliga alternativ med priser visas längre ned på denna sida.

Hur stort är kontextfönstret för Llama 3.2 90B Vision (multimodal)?

Kontextfönstret för Llama 3.2 90B Vision (multimodal) innehåller 131 072 tokens. Ett svar kan vara upp till 8 192 tokens långt.

Hur snabb är Llama 3.2 90B Vision (multimodal)?

Det finns ännu inte tillräckligt många uppmätta körningar av Llama 3.2 90B Vision (multimodal) på Railwail för att ange en körningstid. Det beror på inmatningen, inställningarna och belastningen hos leverantören.

Är Llama 3.2 90B Vision (multimodal) bättre än BLIP?

Det beror på uppgiften. Llama 3.2 90B Vision (multimodal) (Meta) och BLIP (Salesforce) är båda modeller i kategorin Multimodal. Jämförelsesidan visar deras priser och specifikationer sida vid sida.

Jämför Llama 3.2 90B Vision (multimodal) och BLIP

Kan Llama 3.2 90B Vision (multimodal) bearbeta bilder?

Ja. Llama 3.2 90B Vision (multimodal) accepterar bilder som inmatning utöver text.

Kan jag använda Llama 3.2 90B Vision (multimodal) just nu?

Inte tillgänglig för närvarande: denna modell är inaktiverad. Sidan förblir online; tillgängliga alternativ från samma kategori visas längre ned.

Alla modeller via ett API

En API-nyckel för alla modeller på Railwail. Användningen debiteras från förbetald kredit, 1 kredit = 0,01 US$.