Llama 3.2 90B Vision (multimodal)

MultimodálisNem elérhető
Meta általModell-azonosító: llama-3-2-90b-vision-mm

Meta's flagship vision-language model. 90B parameters, image understanding + chat, strong VQA performance.

Állapot
Nem elérhető
Kontextus
131 072 token
Max. kimenet
8192 token
Bemenet → kimenet
Szöveg + Kép → Szöveg
Fejlesztő
Meta
Frissítve
2026. június 25.

Llama 3.2 90B Vision (multimodal) jelenleg nem elérhető

Jelenleg nem elérhető: ezt a modellt deaktiválták.

Az oldal részleteit továbbra is elolvashatja. Az alábbi elérhető alternatívák közül válasszon egy hasonló modell azonnali futtatásához.

Ugrás az alternatívákhoz
01
  • BLIPSalesforce

    Salesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.

    ≈ 0,00030 USD/futás

  • Anthropic's April 2026 flagship. 87.6% on SWE-bench Verified, 3x higher image resolution, output self-verification, vision + reasoning.

    6,00 USD/1M be

  • Anthropic's balanced mid-tier model from February 2026. Best price/performance for production workloads: 5x cheaper than Opus, near-flagship quality.

    3,60 USD/1M be

02

Playground

Próbáld ki: Llama 3.2 90B Vision (multimodal)

Csevegés

Jelenleg nem elérhető

Jelenleg nem elérhető: ezt a modellt deaktiválták.

A játszótér letiltva van. Hasonló modelleket találsz ugyanabban a kategóriában: Alternatívák megtekintése

Próbáld ki: Llama 3.2 90B Vision (multimodal)

Írjon üzenetet. A válasz teljes egészében megérkezik, amikor a modell kész (nincs streaming).

Rendszer-prompt
Max. válaszlength (tokenek)

Ez a futtatás

Nincs ár – jelenleg nem elérhető.

Új vagy itt?

5 ingyenes kredit (0,05 USD) Google-fiókkal való regisztrációkor

Használható 24 órával a regisztráció után, naponta legfeljebb 5 futtatás és futtatásonként legfeljebb 2 kredit. Más bejelentkezési módok kreditek nélkül indulnak.

03

A Llama 3.2 90B Vision (multimodal) névjegye

Röviden2026. június 25. szerint

A Llama 3.2 90B Vision (multimodal) a Meta által fejlesztett modell a Multimodális kategóriában. A Llama 3.2 90B Vision (multimodal) jelenleg nem érhető el a Railwail-en. A kontextablak 131 072 tokent tartalmaz, egy válasz pedig legfeljebb 8192 token hosszú lehet.

Háttér

A Meta AI (FAIR) névjegye

Alapítva: 2013 · Menlo Park, California, USA

Meta AI is the research arm of Meta Platforms, established in 2013 as Facebook AI Research (FAIR) by Yann LeCun. FAIR has open-sourced many foundational models including PyTorch, RoBERTa, DETR, SAM and the LLaMA family. LLaMA 1 was released in February 2023, LLaMA 2 in July 2023, LLaMA 3 in April 2024 and LLaMA 3.1 (405B) in July 2024. Llama 3.2 launched in September 2024 at Meta Connect, introducing the first multimodal models in the LLaMA family (vision-enabled 11B and 90B) together with tiny on-device text-only siblings (1B, 3B). All Llama 3.2 vision weights are released under the Llama 3 Community Licence and are widely used by enterprise customers via Meta's partner ecosystem (Hugging Face, AWS Bedrock, Azure AI Studio, Google Vertex, Together AI, Groq, Fireworks).

Meta AI (FAIR) meglátogatása

Architektúra

Decoder-only Transformer with cross-attended vision encoder

Llama 3.2 90B Vision combines the 70B-parameter Llama 3.1 text backbone (extended to 90B with vision components) and a Vision Transformer image encoder integrated via cross-attention adapter layers, similar in spirit to Flamingo but reusing the LLaMA architecture. The vision tower processes each image to a sequence of visual tokens which are injected into specific cross-attention layers of the LLM decoder while the original text-only weights remain frozen during the multimodal training stage, preserving text-only performance. Pretraining used 6B image-text pairs followed by multi-stage supervised fine-tuning and Direct Preference Optimisation (DPO) on a curated set of image instructions, math and chart data. The model supports a 128K context window and accepts up to 1120x1120 image inputs natively (with tiling for larger images). It does not support video or audio. Llama 3.2 90B Vision is released under the Llama 3 Community Licence (free for commercial use under 700M MAU).

Paraméterek
90B
Kontextus
128 000 token

Képességek

  • Open-weights 90B vision-language model under Llama 3 Community Licence
  • 128K token context window
  • Image input up to 1120x1120 with tiling for larger images
  • Chart, diagram, OCR and document understanding
  • Strong on MMMU, MathVista, ChartQA and DocVQA among open-weights models
  • Multilingual: English, German, French, Italian, Portuguese, Spanish, Hindi, Thai
  • Tool use and JSON output via Llama 3.1 alignment recipe
  • Best for: open-weights multimodal apps, on-premise document AI, indie research

Képzés és licenc

Pretrained on 6B image-text pairs from public web and licensed sources; supervised fine-tuning and DPO on curated multimodal instruction data. Text knowledge inherited from Llama 3.1 (15T tokens).

Licenc: Llama 3 Community Licence: free for commercial use up to 700M MAU; redistribution must include the licence and acceptable use policy.

Biztonsági tesztelés: Meta publishes a comprehensive model card with red-team findings on CBRN, child-safety and hate-speech vectors, plus Llama Guard 3 and Prompt Guard 2 companion models for production safety.

Ismert korlátozások

  • No video or audio input
  • Latency and cost dominated by 90B params; requires multi-GPU serving
  • Licence restricts the largest hyperscaler use cases
  • Vision quality below GPT-4o and Claude 3.5 Sonnet on hardest charts
  • English-centric in vision domain
04

Árak

Jelenleg nem elérhető: ezt a modellt deaktiválták. Jelenleg nincs ár ehhez a modellhez, ezért nem futtatható.

05

API

Hívja meg a Llama 3.2 90B Vision (multimodal) modellt a Railwail API-kulcsával. Használja ezt a modell-azonosítót a kérésben:

Jelenleg nem elérhető

A modellnek nincs ellenőrzött ára vagy deaktiválva van; az API-hívások visszautasítottak.

06

Specifikációk

Modell-azonosító
llama-3-2-90b-vision-mm
Fejlesztő
Meta
Kategória
Multimodális
Bemenet
Szöveg, Kép
Kimenet
Szöveg
Kontextusablak
131 072 token
Max. kimenet
8192 token
Modell mérete
90B
Licenc
Llama 3 Community Licence: free for commercial use up to 700M MAU; redistribution must include the licence and acceptable use policy.
Katalógus bejegyzés frissítve
2026. június 25.

Címkék

  • meta
  • llama
  • multimodal
  • vision
  • open-weights
07

Felhasználási esetek

Mire használják

  • Open-weights document AI and OCR pipelines
  • On-premise vision-language assistants
  • Chart and diagram understanding for analytics
  • Compliance and regulated-industry multimodal apps
  • Research baselines for vision-language models
08

Gyakran ismételt kérdések

Mi az a Llama 3.2 90B Vision (multimodal)?

A Llama 3.2 90B Vision (multimodal) a Meta által fejlesztett modell a Multimodális kategóriában. A Railwail katalógusában szerepel, de jelenleg nem futtatható.

Mennyibe kerül a Llama 3.2 90B Vision (multimodal) a Railwail-on?

A Llama 3.2 90B Vision (multimodal) jelenleg nem futtatható a Railwail-on, ezért nincs aktuális ár. Az elérhető alternatívák árakkal az oldal alább találhatók.

Mekkora a Llama 3.2 90B Vision (multimodal) kontextablaka?

A Llama 3.2 90B Vision (multimodal) kontextablaka 131 072 tokent tartalmaz. Egy válasz legfeljebb 8192 token hosszú lehet.

Milyen gyors a Llama 3.2 90B Vision (multimodal)?

A Llama 3.2 90B Vision (multimodal)-nek még nincs elég mért futtatása a Railwail-on ahhoz, hogy futási időt adjunk meg. Ez a bemenettől, a beállításoktól és a szolgáltató terhelésétől függ.

A Llama 3.2 90B Vision (multimodal) jobb, mint a BLIP?

Ez a feladattól függ. A Llama 3.2 90B Vision (multimodal) (Meta) és a BLIP (Salesforce) egyaránt modellek a Multimodális kategóriában. Az összehasonlítás oldal az árakat és specifikációkat egymás mellett mutatja.

Llama 3.2 90B Vision (multimodal) és BLIP összehasonlítása

A Llama 3.2 90B Vision (multimodal) képes képeket feldolgozni?

Igen. A Llama 3.2 90B Vision (multimodal) szöveg mellett képeket is fogad bemenetként.

Használhatom a Llama 3.2 90B Vision (multimodal)-t most?

Jelenleg nem elérhető: ezt a modellt deaktiválták. Az oldal online marad; az ugyanabból a kategóriából elérhető alternatívák az oldal alább találhatók.

Összes modell egy API-n keresztül

Egy API-kulcs a Railwail összes modelljéhez. A használat előre feltöltött kreditek alapján kerül felszámításra, 1 kredit = 0,01 USD.