Llama 3.2 90B Vision (multimodal)

MultimodaaliEi saatavilla
kehittäjä: MetaMallin tunnus: llama-3-2-90b-vision-mm

Meta's flagship vision-language model. 90B parameters, image understanding + chat, strong VQA performance.

Tila
Ei saatavilla
Konteksti
131 072 tokenia
Enint. tuloste
8 192 tokenia
Syöte → tulos
Teksti + Kuva → Teksti
Kehittäjä
Meta
Päivitetty
25. kesäkuuta 2026

Llama 3.2 90B Vision (multimodal) ei ole tällä hetkellä saatavilla

Ei tällä hetkellä saatavilla: tämä malli on poistettu käytöstä.

Voit silti lukea tiedot tältä sivulta. Valitse yksi alla olevista saatavilla olevista vaihtoehdoista suorittaaksesi vertailukelpoisen mallin heti.

Siirry vaihtoehtoihin
01

Vertailukelpoiset mallit

Kaikki tässä kategoriassa
  • BLIPSalesforce

    Salesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.

    ≈ 0,00030 $/suoritus

  • Anthropic's April 2026 flagship. 87.6% on SWE-bench Verified, 3x higher image resolution, output self-verification, vision + reasoning.

    6,00 $/1M in

  • Anthropic's balanced mid-tier model from February 2026. Best price/performance for production workloads: 5x cheaper than Opus, near-flagship quality.

    3,60 $/1M in

02

Leikkikenttä

Kokeile Llama 3.2 90B Vision (multimodal)

Chat

Ei tällä hetkellä saatavilla

Ei tällä hetkellä saatavilla: tämä malli on poistettu käytöstä.

Leikkikenttä on poistettu käytöstä. Vertailukelpoisia malleja löydät samasta kategoriasta: Selaa vaihtoehtoja

Kokeile Llama 3.2 90B Vision (multimodal)

Lähetä viesti. Vastaus saapuu kokonaisuudessaan, kun malli on valmis (ei suoratoistoa).

Järjestelmäkehote
Enint. vastausten pituus (tokenit)

Tämä suoritus

Ei hintaa – ei tällä hetkellä saatavilla.

Uusi täällä?

5 ilmaista creditiä (0,05 $) kun rekisteröidyt Googlella

Käytettävissä 24 tuntia rekisteröinnin jälkeen, enintään 5 suoritusta päivässä ja enintään 2 creditiä suoritusta kohti. Muut kirjautumismenetelmät alkavat ilman creditejä.

03

Tietoja: Llama 3.2 90B Vision (multimodal)

Lyhyesti25. kesäkuuta 2026 alkaen

Llama 3.2 90B Vision (multimodal) on Meta-kehittäjän malli kategoriasta Multimodaali. Llama 3.2 90B Vision (multimodal) ei ole tällä hetkellä saatavilla Railwailissa. Kontekstiikkuna sisältää 131 072 tokenia, ja vastaus voi olla enintään 8 192 tokenia pitkä.

Tausta

Tietoja: Meta AI (FAIR)

Perustettu 2013 · Menlo Park, California, USA

Meta AI is the research arm of Meta Platforms, established in 2013 as Facebook AI Research (FAIR) by Yann LeCun. FAIR has open-sourced many foundational models including PyTorch, RoBERTa, DETR, SAM and the LLaMA family. LLaMA 1 was released in February 2023, LLaMA 2 in July 2023, LLaMA 3 in April 2024 and LLaMA 3.1 (405B) in July 2024. Llama 3.2 launched in September 2024 at Meta Connect, introducing the first multimodal models in the LLaMA family (vision-enabled 11B and 90B) together with tiny on-device text-only siblings (1B, 3B). All Llama 3.2 vision weights are released under the Llama 3 Community Licence and are widely used by enterprise customers via Meta's partner ecosystem (Hugging Face, AWS Bedrock, Azure AI Studio, Google Vertex, Together AI, Groq, Fireworks).

Vieraile sivustolla Meta AI (FAIR)

Arkkitehtuuri

Decoder-only Transformer with cross-attended vision encoder

Llama 3.2 90B Vision combines the 70B-parameter Llama 3.1 text backbone (extended to 90B with vision components) and a Vision Transformer image encoder integrated via cross-attention adapter layers, similar in spirit to Flamingo but reusing the LLaMA architecture. The vision tower processes each image to a sequence of visual tokens which are injected into specific cross-attention layers of the LLM decoder while the original text-only weights remain frozen during the multimodal training stage, preserving text-only performance. Pretraining used 6B image-text pairs followed by multi-stage supervised fine-tuning and Direct Preference Optimisation (DPO) on a curated set of image instructions, math and chart data. The model supports a 128K context window and accepts up to 1120x1120 image inputs natively (with tiling for larger images). It does not support video or audio. Llama 3.2 90B Vision is released under the Llama 3 Community Licence (free for commercial use under 700M MAU).

Parametrit
90B
Konteksti
128 000 tokenia

Ominaisuudet

  • Open-weights 90B vision-language model under Llama 3 Community Licence
  • 128K token context window
  • Image input up to 1120x1120 with tiling for larger images
  • Chart, diagram, OCR and document understanding
  • Strong on MMMU, MathVista, ChartQA and DocVQA among open-weights models
  • Multilingual: English, German, French, Italian, Portuguese, Spanish, Hindi, Thai
  • Tool use and JSON output via Llama 3.1 alignment recipe
  • Best for: open-weights multimodal apps, on-premise document AI, indie research

Koulutus ja lisenssi

Pretrained on 6B image-text pairs from public web and licensed sources; supervised fine-tuning and DPO on curated multimodal instruction data. Text knowledge inherited from Llama 3.1 (15T tokens).

Lisenssi: Llama 3 Community Licence: free for commercial use up to 700M MAU; redistribution must include the licence and acceptable use policy.

Turvallisuustestit: Meta publishes a comprehensive model card with red-team findings on CBRN, child-safety and hate-speech vectors, plus Llama Guard 3 and Prompt Guard 2 companion models for production safety.

Tunnetut rajoitukset

  • No video or audio input
  • Latency and cost dominated by 90B params; requires multi-GPU serving
  • Licence restricts the largest hyperscaler use cases
  • Vision quality below GPT-4o and Claude 3.5 Sonnet on hardest charts
  • English-centric in vision domain
04

Hinnat

Ei tällä hetkellä saatavilla: tämä malli on poistettu käytöstä. Tällä hetkellä tälle mallille ei ole hintaa, joten sitä ei voi suorittaa.

05

API

Kutsu Llama 3.2 90B Vision (multimodal) Railwail-API-avaimellasi. Käytä tätä mallin tunnusta pyynnössä:
llama-3-2-90b-vision-mmAPI-dokumentaatioHanki API-avain

Tällä hetkellä ei saatavilla

Mallilla ei ole vahvistettua hintaa tai se on poistettu käytöstä; API-kutsut hylätään.

06

Tekniset tiedot

Mallin tunnus
llama-3-2-90b-vision-mm
Kehittäjä
Meta
Kategoria
Multimodaali
Syöte
Teksti, Kuva
Tuloste
Teksti
Konteksti-ikkuna
131 072 tokenia
Enimmäistuloste
8 192 tokenia
Mallin koko
90B
Lisenssi
Llama 3 Community Licence: free for commercial use up to 700M MAU; redistribution must include the licence and acceptable use policy.
Luettelokirjaus päivitetty
25. kesäkuuta 2026

Tunnisteet

  • meta
  • llama
  • multimodal
  • vision
  • open-weights
07

Käyttötapaukset

Mihin sitä käytetään

  • Open-weights document AI and OCR pipelines
  • On-premise vision-language assistants
  • Chart and diagram understanding for analytics
  • Compliance and regulated-industry multimodal apps
  • Research baselines for vision-language models
08

Usein kysytyt kysymykset

Mikä on Llama 3.2 90B Vision (multimodal)?

Llama 3.2 90B Vision (multimodal) on Metan kehittämä malli Multimodaali-kategoriassa. Se on listattu Railwailissa, mutta sitä ei voi tällä hetkellä suorittaa.

Paljonko Llama 3.2 90B Vision (multimodal) maksaa Railwailissa?

Llama 3.2 90B Vision (multimodal)ta ei voi tällä hetkellä suorittaa Railwailissa, joten nykyistä hintaa ei ole. Saatavilla olevat vaihtoehdot hintojen kanssa on lueteltu tämän sivun alempana.

Mikä on Llama 3.2 90B Vision (multimodal)n kontekstiikkuna?

Llama 3.2 90B Vision (multimodal)n kontekstiikkuna sisältää 131 072 tokenia. Vastaus voi olla enintään 8 192 tokenia pitkä.

Kuinka nopea Llama 3.2 90B Vision (multimodal) on?

Llama 3.2 90B Vision (multimodal)lla ei ole vielä tarpeeksi mitattuja suorituksia Railwailissa suoritusajan ilmoittamiseksi. Se riippuu syötteestä, asetuksista ja palveluntarjoajan kuormituksesta.

Onko Llama 3.2 90B Vision (multimodal) parempi kuin BLIP?

Se riippuu tehtävästä. Llama 3.2 90B Vision (multimodal) (Meta) ja BLIP (Salesforce) ovat molemmat malleja Multimodaali-kategoriassa. Vertailussa näkyvät niiden hinnat ja tekniset tiedot rinnakkain.

Vertaa Llama 3.2 90B Vision (multimodal) ja BLIP

Voiko Llama 3.2 90B Vision (multimodal) käsitellä kuvia?

Kyllä. Llama 3.2 90B Vision (multimodal) hyväksyy kuvia syötteenä tekstin lisäksi.

Voiko Llama 3.2 90B Vision (multimodal)a käyttää juuri nyt?

Ei tällä hetkellä saatavilla: tämä malli on poistettu käytöstä. Sivu pysyy verkossa; saatavilla olevat vaihtoehdot samasta kategoriasta on lueteltu alempana.

Kaikki mallit yhden API:n kautta

Yksi API-avain kaikille Railwailin malleille. Käyttö laskutetaan prepaid-krediiteistä, 1 krediitti = 0,01 $.