Llama 3.2 90B Vision (multimodal)

MultimodalneNiedostępne
od MetaID modelu: llama-3-2-90b-vision-mm

Meta's flagship vision-language model. 90B parameters, image understanding + chat, strong VQA performance.

Status
Niedostępne
Kontekst
131 072 tokenów
Maks. wyjście
8192 tokenów
Wejście → Wyjście
Tekst + Obraz → Tekst
Deweloper
Meta
Zaktualizowano
25 czerwca 2026

Llama 3.2 90B Vision (multimodal) jest obecnie niedostępny

Obecnie niedostępne: ten model został dezaktywowany.

Możesz nadal przeczytać szczegóły na tej stronie. Wybierz jedną z dostępnych alternatyw poniżej, aby od razu uruchomić porównywalny model.

Przejdź do alternatyw
01

Porównywalne modele

Wszystkie w tej kategorii
  • BLIPSalesforce

    Salesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.

    ≈ 0,00030 USD/uruchomienie

  • Anthropic's April 2026 flagship. 87.6% on SWE-bench Verified, 3x higher image resolution, output self-verification, vision + reasoning.

    6,00 USD/1M wej.

  • Anthropic's balanced mid-tier model from February 2026. Best price/performance for production workloads: 5x cheaper than Opus, near-flagship quality.

    3,60 USD/1M wej.

02

Playground

Spróbuj Llama 3.2 90B Vision (multimodal)

Chat

Niedostępny

Obecnie niedostępne: ten model został dezaktywowany.

Plac zabaw jest wyłączony. Porównywalne modele znajdziesz w tej samej kategorii: Przeglądaj alternatywy

Spróbuj Llama 3.2 90B Vision (multimodal)

Wyślij wiadomość. Odpowiedź pojawi się w całości, gdy model będzie gotowy (bez streamingu).

Prompt systemowy
Maks. długość odpowiedzi (tokeny)

To uruchomienie

Brak ceny – obecnie niedostępne.

Nowy tutaj?

5 darmowych kredytów (0,05 USD) po zarejestrowaniu się przez Google

Dostępne 24 godzin po rejestracji, do 5 uruchomień dziennie i maksymalnie 2 kredytów na uruchomienie. Inne metody logowania uruchamiają się bez kredytów.

03

O Llama 3.2 90B Vision (multimodal)

Krótko mówiącStan na 25 czerwca 2026

Llama 3.2 90B Vision (multimodal) to model opracowany przez Meta w kategorii Multimodalne. Llama 3.2 90B Vision (multimodal) nie jest obecnie dostępny w serwisie Railwail. Okno kontekstu zawiera 131 072 tokenów, a jedna odpowiedź może mieć do 8192 tokenów.

Tło

O Meta AI (FAIR)

Założona 2013 · Menlo Park, California, USA

Meta AI is the research arm of Meta Platforms, established in 2013 as Facebook AI Research (FAIR) by Yann LeCun. FAIR has open-sourced many foundational models including PyTorch, RoBERTa, DETR, SAM and the LLaMA family. LLaMA 1 was released in February 2023, LLaMA 2 in July 2023, LLaMA 3 in April 2024 and LLaMA 3.1 (405B) in July 2024. Llama 3.2 launched in September 2024 at Meta Connect, introducing the first multimodal models in the LLaMA family (vision-enabled 11B and 90B) together with tiny on-device text-only siblings (1B, 3B). All Llama 3.2 vision weights are released under the Llama 3 Community Licence and are widely used by enterprise customers via Meta's partner ecosystem (Hugging Face, AWS Bedrock, Azure AI Studio, Google Vertex, Together AI, Groq, Fireworks).

Odwiedź Meta AI (FAIR)

Architektura

Decoder-only Transformer with cross-attended vision encoder

Llama 3.2 90B Vision combines the 70B-parameter Llama 3.1 text backbone (extended to 90B with vision components) and a Vision Transformer image encoder integrated via cross-attention adapter layers, similar in spirit to Flamingo but reusing the LLaMA architecture. The vision tower processes each image to a sequence of visual tokens which are injected into specific cross-attention layers of the LLM decoder while the original text-only weights remain frozen during the multimodal training stage, preserving text-only performance. Pretraining used 6B image-text pairs followed by multi-stage supervised fine-tuning and Direct Preference Optimisation (DPO) on a curated set of image instructions, math and chart data. The model supports a 128K context window and accepts up to 1120x1120 image inputs natively (with tiling for larger images). It does not support video or audio. Llama 3.2 90B Vision is released under the Llama 3 Community Licence (free for commercial use under 700M MAU).

Parametry
90B
Kontekst
128 000 tokenów

Możliwości

  • Open-weights 90B vision-language model under Llama 3 Community Licence
  • 128K token context window
  • Image input up to 1120x1120 with tiling for larger images
  • Chart, diagram, OCR and document understanding
  • Strong on MMMU, MathVista, ChartQA and DocVQA among open-weights models
  • Multilingual: English, German, French, Italian, Portuguese, Spanish, Hindi, Thai
  • Tool use and JSON output via Llama 3.1 alignment recipe
  • Best for: open-weights multimodal apps, on-premise document AI, indie research

Trening i licencja

Pretrained on 6B image-text pairs from public web and licensed sources; supervised fine-tuning and DPO on curated multimodal instruction data. Text knowledge inherited from Llama 3.1 (15T tokens).

Licencja: Llama 3 Community Licence: free for commercial use up to 700M MAU; redistribution must include the licence and acceptable use policy.

Testy bezpieczeństwa: Meta publishes a comprehensive model card with red-team findings on CBRN, child-safety and hate-speech vectors, plus Llama Guard 3 and Prompt Guard 2 companion models for production safety.

Znane ograniczenia

  • No video or audio input
  • Latency and cost dominated by 90B params; requires multi-GPU serving
  • Licence restricts the largest hyperscaler use cases
  • Vision quality below GPT-4o and Claude 3.5 Sonnet on hardest charts
  • English-centric in vision domain
04

Ceny

Obecnie niedostępne: ten model został dezaktywowany. Dla tego modelu nie ma ceny w tej chwili, dlatego nie można go uruchomić.

05

API

Wywołaj Llama 3.2 90B Vision (multimodal) za pomocą klucza API Railwail. Użyj tego ID modelu w żądaniu:
llama-3-2-90b-vision-mmDokumentacja APIUzyskaj klucz API

Obecnie niedostępne

Model nie ma zweryfikowanej ceny lub jest wyłączony; wywołania API są odrzucane.

06

Specyfikacje

ID modelu
llama-3-2-90b-vision-mm
Deweloper
Meta
Kategoria
Multimodalne
Wejście
Tekst, Obraz
Wyjście
Tekst
Okno kontekstu
131 072 tokenów
Maks. wyjście
8192 tokenów
Rozmiar modelu
90B
Licencja
Llama 3 Community Licence: free for commercial use up to 700M MAU; redistribution must include the licence and acceptable use policy.
Wpis w katalogu zaktualizowany
25 czerwca 2026

Tagi

  • meta
  • llama
  • multimodal
  • vision
  • open-weights
07

Przypadki użycia

Do czego się go używa

  • Open-weights document AI and OCR pipelines
  • On-premise vision-language assistants
  • Chart and diagram understanding for analytics
  • Compliance and regulated-industry multimodal apps
  • Research baselines for vision-language models
08

Często zadawane pytania

Co to jest Llama 3.2 90B Vision (multimodal)?

Llama 3.2 90B Vision (multimodal) to model opracowany przez Meta w kategorii Multimodalne. Jest wymieniony w katalogu Railwail, ale nie może być uruchomiony w tej chwili.

Ile kosztuje Llama 3.2 90B Vision (multimodal) w serwisie Railwail?

Llama 3.2 90B Vision (multimodal) nie może być uruchomiony w serwisie Railwail w tej chwili, dlatego nie ma aktualnej ceny. Dostępne alternatywy z cenami są wymienione poniżej na tej stronie.

Jakie jest okno kontekstu Llama 3.2 90B Vision (multimodal)?

Okno kontekstu Llama 3.2 90B Vision (multimodal) zawiera 131 072 tokenów. Jedna odpowiedź może mieć do 8192 tokenów.

Jak szybki jest Llama 3.2 90B Vision (multimodal)?

Dla Llama 3.2 90B Vision (multimodal) jest jeszcze zbyt mało zmierzonych przebiegów w serwisie Railwail, aby podać czas przebiegu. Zależy to od wejścia, ustawień i obciążenia u dostawcy.

Czy Llama 3.2 90B Vision (multimodal) jest lepszy niż BLIP?

To zależy od zadania. Llama 3.2 90B Vision (multimodal) (Meta) i BLIP (Salesforce) to oba modele z kategorii Multimodalne. Strona porównania pokazuje ich ceny i specyfikacje obok siebie.

Porównaj Llama 3.2 90B Vision (multimodal) i BLIP

Czy Llama 3.2 90B Vision (multimodal) może przetwarzać obrazy?

Tak. Llama 3.2 90B Vision (multimodal) akceptuje obrazy jako wejście oprócz tekstu.

Czy mogę używać Llama 3.2 90B Vision (multimodal) teraz?

Obecnie niedostępne: ten model został dezaktywowany. Strona pozostaje online; dostępne alternatywy z tej samej kategorii są wymienione poniżej.

Wszystkie modele przez jedno API

Jeden klucz API dla każdego modelu na Railwail. Opłaty pobierane są z przedpłaconych kredytów, 1 kredyt = 0,01 USD.