Llama 3.2 90B Vision (multimodal)

MultimodálníNedostupné
od MetaID modelu: llama-3-2-90b-vision-mm

Meta's flagship vision-language model. 90B parameters, image understanding + chat, strong VQA performance.

Stav
Nedostupné
Kontext
131,072 tokenů
Max. výstup
8,192 tokenů
Vstup → výstup
Text + Obrázek → Text
Vývojář
Meta
Aktualizováno
25. června 2026

Llama 3.2 90B Vision (multimodal) není momentálně dostupný

Momentálně nedostupné: tento model byl deaktivován.

Podrobnosti na této stránce si můžete přečíst. Vyberte jednu z dostupných alternativ níže a spusťte porovnatelný model hned.

Na alternativy
01

Srovnatelné modely

Všechny v této kategorii
  • BLIPSalesforce

    Salesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.

    ≈ 0,00030 US$/spuštění

  • Anthropic's April 2026 flagship. 87.6% on SWE-bench Verified, 3x higher image resolution, output self-verification, vision + reasoning.

    6,00 US$/1M vstup

  • Anthropic's balanced mid-tier model from February 2026. Best price/performance for production workloads: 5x cheaper than Opus, near-flagship quality.

    3,60 US$/1M vstup

02

Playground

Vyzkoušet Llama 3.2 90B Vision (multimodal)

Chat

Momentálně nedostupné

Momentálně nedostupné: tento model byl deaktivován.

Playground je zakázán. Srovnatelné modely najdete ve stejné kategorii: Zobrazit alternativy

Vyzkoušet Llama 3.2 90B Vision (multimodal)

Pošli zprávu. Odpověď přijde kompletní, jakmile je model hotov (bez streamování).

Systémový prompt
Maximální délka odpovědi (tokeny)

Tento běh

Bez ceny – momentálně nedostupné.

Nový zde?

5 bezplatných credits (0,05 US$) při registraci přes Google

Použitelné 24 hodin po registraci, až 5 běhů za den a maximálně 2 credits za běh. Ostatní způsoby přihlášení začínají bez credits.

03

O Llama 3.2 90B Vision (multimodal)

StručněStav: 25. června 2026

Llama 3.2 90B Vision (multimodal) je model od Meta v kategorii Multimodální. Llama 3.2 90B Vision (multimodal) není na Railwail v současné době dostupný. Kontextní okno obsahuje 131,072 tokenů, odpověď může být dlouhá až 8,192 tokenů.

Pozadí

O Meta AI (FAIR)

Založeno 2013 · Menlo Park, California, USA

Meta AI is the research arm of Meta Platforms, established in 2013 as Facebook AI Research (FAIR) by Yann LeCun. FAIR has open-sourced many foundational models including PyTorch, RoBERTa, DETR, SAM and the LLaMA family. LLaMA 1 was released in February 2023, LLaMA 2 in July 2023, LLaMA 3 in April 2024 and LLaMA 3.1 (405B) in July 2024. Llama 3.2 launched in September 2024 at Meta Connect, introducing the first multimodal models in the LLaMA family (vision-enabled 11B and 90B) together with tiny on-device text-only siblings (1B, 3B). All Llama 3.2 vision weights are released under the Llama 3 Community Licence and are widely used by enterprise customers via Meta's partner ecosystem (Hugging Face, AWS Bedrock, Azure AI Studio, Google Vertex, Together AI, Groq, Fireworks).

Navštívit Meta AI (FAIR)

Architektura

Decoder-only Transformer with cross-attended vision encoder

Llama 3.2 90B Vision combines the 70B-parameter Llama 3.1 text backbone (extended to 90B with vision components) and a Vision Transformer image encoder integrated via cross-attention adapter layers, similar in spirit to Flamingo but reusing the LLaMA architecture. The vision tower processes each image to a sequence of visual tokens which are injected into specific cross-attention layers of the LLM decoder while the original text-only weights remain frozen during the multimodal training stage, preserving text-only performance. Pretraining used 6B image-text pairs followed by multi-stage supervised fine-tuning and Direct Preference Optimisation (DPO) on a curated set of image instructions, math and chart data. The model supports a 128K context window and accepts up to 1120x1120 image inputs natively (with tiling for larger images). It does not support video or audio. Llama 3.2 90B Vision is released under the Llama 3 Community Licence (free for commercial use under 700M MAU).

Parametry
90B
Kontext
128,000 tokenů

Schopnosti

  • Open-weights 90B vision-language model under Llama 3 Community Licence
  • 128K token context window
  • Image input up to 1120x1120 with tiling for larger images
  • Chart, diagram, OCR and document understanding
  • Strong on MMMU, MathVista, ChartQA and DocVQA among open-weights models
  • Multilingual: English, German, French, Italian, Portuguese, Spanish, Hindi, Thai
  • Tool use and JSON output via Llama 3.1 alignment recipe
  • Best for: open-weights multimodal apps, on-premise document AI, indie research

Trénování a licence

Pretrained on 6B image-text pairs from public web and licensed sources; supervised fine-tuning and DPO on curated multimodal instruction data. Text knowledge inherited from Llama 3.1 (15T tokens).

Licence: Llama 3 Community Licence: free for commercial use up to 700M MAU; redistribution must include the licence and acceptable use policy.

Bezpečnostní testy: Meta publishes a comprehensive model card with red-team findings on CBRN, child-safety and hate-speech vectors, plus Llama Guard 3 and Prompt Guard 2 companion models for production safety.

Známá omezení

  • No video or audio input
  • Latency and cost dominated by 90B params; requires multi-GPU serving
  • Licence restricts the largest hyperscaler use cases
  • Vision quality below GPT-4o and Claude 3.5 Sonnet on hardest charts
  • English-centric in vision domain
04

Ceny

Momentálně nedostupné: tento model byl deaktivován. Pro tento model momentálně není cena, takže jej nelze spustit.

05

API

Volejte Llama 3.2 90B Vision (multimodal) s vaším API klíčem Railwail. V požadavku použijte toto ID modelu:
llama-3-2-90b-vision-mmDokumentace APIZískat API klíč

Momentálně nedostupné

Model nemá ověřenou cenu nebo je deaktivován; volání API jsou odmítnuta.

06

Specifikace

ID modelu
llama-3-2-90b-vision-mm
Vývojář
Meta
Vstup
Text, Obrázek
Výstup
Text
Kontextové okno
131,072 tokenů
Max. výstup
8,192 tokenů
Velikost modelu
90B
Licence
Llama 3 Community Licence: free for commercial use up to 700M MAU; redistribution must include the licence and acceptable use policy.
Záznam v katalogu aktualizován
25. června 2026

Štítky

  • meta
  • llama
  • multimodal
  • vision
  • open-weights
07

Případy použití

K čemu se používá

  • Open-weights document AI and OCR pipelines
  • On-premise vision-language assistants
  • Chart and diagram understanding for analytics
  • Compliance and regulated-industry multimodal apps
  • Research baselines for vision-language models
08

Často kladené otázky

Co je Llama 3.2 90B Vision (multimodal)?

Llama 3.2 90B Vision (multimodal) je model od Meta v kategorii Multimodální. Je uveden na Railwail, ale momentálně jej nelze spustit.

Kolik stojí Llama 3.2 90B Vision (multimodal) na Railwail?

Llama 3.2 90B Vision (multimodal) se momentálně na Railwail nedá spustit, takže není aktuální cena. Dostupné alternativy s cenami jsou uvedeny dále na této stránce.

Jaké je kontextní okno Llama 3.2 90B Vision (multimodal)?

Kontextní okno Llama 3.2 90B Vision (multimodal) obsahuje 131,072 tokenů. Odpověď může být dlouhá až 8,192 tokenů.

Jak rychlý je Llama 3.2 90B Vision (multimodal)?

Pro Llama 3.2 90B Vision (multimodal) je na Railwail zatím příliš málo naměřených spuštění na uvedení doby běhu. Závisí na vstupu, nastavení a zátěži u poskytovatele.

Je Llama 3.2 90B Vision (multimodal) lepší než BLIP?

Záleží na úkolu. Llama 3.2 90B Vision (multimodal) (Meta) a BLIP (Salesforce) jsou oba modely v kategorii Multimodální. Stránka porovnání zobrazuje jejich ceny a specifikace vedle sebe.

Porovnat Llama 3.2 90B Vision (multimodal) a BLIP

Může Llama 3.2 90B Vision (multimodal) zpracovávat obrázky?

Ano. Llama 3.2 90B Vision (multimodal) přijímá obrázky jako vstup kromě textu.

Mohu Llama 3.2 90B Vision (multimodal) používat hned teď?

Momentálně nedostupné: tento model byl deaktivován. Stránka zůstává online; dostupné alternativy ze stejné kategorie jsou uvedeny dále.

Všechny modely přes jednu API

Jeden API klíč pro všechny modely na Railwail. Použití se účtuje z předplacených kreditů, 1 kredit = 0,01 US$.