Llama 3.2 90B Vision (multimodal)

MultimodalΜη διαθέσιμο
από MetaΑναγνωριστικό μοντέλου: llama-3-2-90b-vision-mm

Meta's flagship vision-language model. 90B parameters, image understanding + chat, strong VQA performance.

Κατάσταση
Μη διαθέσιμο
Περιεχόμενο
131,072 tokens
Μέγ. έξοδος
8,192 tokens
Είσοδος → Έξοδος
Κείμενο + Εικόνα → Κείμενο
Προγραμματιστής
Meta
Ενημερώθηκε
25 Ιουνίου 2026

Το Llama 3.2 90B Vision (multimodal) δεν είναι διαθέσιμο αυτή τη στιγμή

Προς το παρόν μη διαθέσιμο: αυτό το μοντέλο έχει απενεργοποιηθεί.

Μπορείτε να διαβάσετε τις λεπτομέρειες σε αυτήν τη σελίδα. Επιλέξτε μία από τις διαθέσιμες εναλλακτικές λύσεις παρακάτω για να εκτελέσετε αμέσως ένα συγκρίσιμο μοντέλο.

Μετάβαση στις εναλλακτικές λύσεις
01

Συγκρίσιμα μοντέλα

Όλα σε αυτήν την κατηγορία
  • BLIPSalesforce

    Salesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.

    ≈ 0,00030 $/εκτέλεση

  • Anthropic's April 2026 flagship. 87.6% on SWE-bench Verified, 3x higher image resolution, output self-verification, vision + reasoning.

    6,00 $/1M in

  • Anthropic's balanced mid-tier model from February 2026. Best price/performance for production workloads: 5x cheaper than Opus, near-flagship quality.

    3,60 $/1M in

02

Playground

Δοκιμάστε Llama 3.2 90B Vision (multimodal)

Συνομιλία

Προς το παρόν μη διαθέσιμο

Προς το παρόν μη διαθέσιμο: αυτό το μοντέλο έχει απενεργοποιηθεί.

Το playground είναι απενεργοποιημένο. Μπορείτε να βρείτε συγκρίσιμα μοντέλα στην ίδια κατηγορία: Περιήγηση εναλλακτικών λύσεων

Δοκιμάστε Llama 3.2 90B Vision (multimodal)

Στείλτε ένα μήνυμα. Η απάντηση φτάνει πλήρης όταν το μοντέλο τελειώσει (χωρίς streaming).

System prompt
Μέγ. μήκος απάντησης (tokens)

Αυτή η εκτέλεση

Χωρίς τιμή – προς το παρόν μη διαθέσιμο.

Νέος εδώ;

5 δωρεάν πιστωτικές μονάδες (0,05 $) όταν εγγραφείς με Google

Χρησιμοποιήσιμο 24 ώρες μετά την εγγραφή, έως 5 εκτελέσεις ανά ημέρα και το πολύ 2 πιστωτικές μονάδες ανά εκτέλεση. Άλλες μέθοδοι σύνδεσης ξεκινούν χωρίς πιστωτικές μονάδες.

03

Σχετικά με το Llama 3.2 90B Vision (multimodal)

ΣύντομαΗμερομηνία: 25 Ιουνίου 2026

Το Llama 3.2 90B Vision (multimodal) είναι ένα μοντέλο του Meta στην κατηγορία Multimodal. Το Llama 3.2 90B Vision (multimodal) δεν είναι διαθέσιμο στο Railwail αυτή τη στιγμή. Το παράθυρο περιεχομένου περιέχει 131,072 tokens, και μια απάντηση μπορεί να είναι έως 8,192 tokens.

Φόντο

Σχετικά με Meta AI (FAIR)

Ιδρύθηκε 2013 · Menlo Park, California, USA

Meta AI is the research arm of Meta Platforms, established in 2013 as Facebook AI Research (FAIR) by Yann LeCun. FAIR has open-sourced many foundational models including PyTorch, RoBERTa, DETR, SAM and the LLaMA family. LLaMA 1 was released in February 2023, LLaMA 2 in July 2023, LLaMA 3 in April 2024 and LLaMA 3.1 (405B) in July 2024. Llama 3.2 launched in September 2024 at Meta Connect, introducing the first multimodal models in the LLaMA family (vision-enabled 11B and 90B) together with tiny on-device text-only siblings (1B, 3B). All Llama 3.2 vision weights are released under the Llama 3 Community Licence and are widely used by enterprise customers via Meta's partner ecosystem (Hugging Face, AWS Bedrock, Azure AI Studio, Google Vertex, Together AI, Groq, Fireworks).

Επισκεφθείτε Meta AI (FAIR)

Αρχιτεκτονική

Decoder-only Transformer with cross-attended vision encoder

Llama 3.2 90B Vision combines the 70B-parameter Llama 3.1 text backbone (extended to 90B with vision components) and a Vision Transformer image encoder integrated via cross-attention adapter layers, similar in spirit to Flamingo but reusing the LLaMA architecture. The vision tower processes each image to a sequence of visual tokens which are injected into specific cross-attention layers of the LLM decoder while the original text-only weights remain frozen during the multimodal training stage, preserving text-only performance. Pretraining used 6B image-text pairs followed by multi-stage supervised fine-tuning and Direct Preference Optimisation (DPO) on a curated set of image instructions, math and chart data. The model supports a 128K context window and accepts up to 1120x1120 image inputs natively (with tiling for larger images). It does not support video or audio. Llama 3.2 90B Vision is released under the Llama 3 Community Licence (free for commercial use under 700M MAU).

Παράμετροι
90B
Περιεχόμενο
128,000 tokens

Δυνατότητες

  • Open-weights 90B vision-language model under Llama 3 Community Licence
  • 128K token context window
  • Image input up to 1120x1120 with tiling for larger images
  • Chart, diagram, OCR and document understanding
  • Strong on MMMU, MathVista, ChartQA and DocVQA among open-weights models
  • Multilingual: English, German, French, Italian, Portuguese, Spanish, Hindi, Thai
  • Tool use and JSON output via Llama 3.1 alignment recipe
  • Best for: open-weights multimodal apps, on-premise document AI, indie research

Εκπαίδευση & άδεια

Pretrained on 6B image-text pairs from public web and licensed sources; supervised fine-tuning and DPO on curated multimodal instruction data. Text knowledge inherited from Llama 3.1 (15T tokens).

Άδεια: Llama 3 Community Licence: free for commercial use up to 700M MAU; redistribution must include the licence and acceptable use policy.

Δοκιμές ασφάλειας: Meta publishes a comprehensive model card with red-team findings on CBRN, child-safety and hate-speech vectors, plus Llama Guard 3 and Prompt Guard 2 companion models for production safety.

Γνωστοί περιορισμοί

  • No video or audio input
  • Latency and cost dominated by 90B params; requires multi-GPU serving
  • Licence restricts the largest hyperscaler use cases
  • Vision quality below GPT-4o and Claude 3.5 Sonnet on hardest charts
  • English-centric in vision domain
04

Τιμολόγηση

Προς το παρόν μη διαθέσιμο: αυτό το μοντέλο έχει απενεργοποιηθεί. Δεν υπάρχει τιμή για αυτό το μοντέλο αυτή τη στιγμή, επομένως δεν μπορεί να εκτελεστεί.

05

API

Καλέστε το Llama 3.2 90B Vision (multimodal) με το κλειδί Railwail API. Χρησιμοποιήστε αυτό το ID μοντέλου στο αίτημα:

Προς το παρόν μη διαθέσιμο

Το μοντέλο δεν έχει επαληθευμένη τιμή ή είναι απενεργοποιημένο· οι κλήσεις API απορρίπτονται.

06

Προδιαγραφές

ID μοντέλου
llama-3-2-90b-vision-mm
Ανάπτυξη
Meta
Κατηγορία
Multimodal
Είσοδος
Κείμενο, Εικόνα
Έξοδος
Κείμενο
Παράθυρο περιεχομένου
131,072 tokens
Μέγ. έξοδος
8,192 tokens
Μέγεθος μοντέλου
90B
Άδεια
Llama 3 Community Licence: free for commercial use up to 700M MAU; redistribution must include the licence and acceptable use policy.
Καταχώρηση καταλόγου ενημερώθηκε
25 Ιουνίου 2026

Ετικέτες

  • meta
  • llama
  • multimodal
  • vision
  • open-weights
07

Περιπτώσεις χρήσης

Για τι χρησιμοποιείται

  • Open-weights document AI and OCR pipelines
  • On-premise vision-language assistants
  • Chart and diagram understanding for analytics
  • Compliance and regulated-industry multimodal apps
  • Research baselines for vision-language models
08

Συχνές ερωτήσεις

Τι είναι Llama 3.2 90B Vision (multimodal);

Το Llama 3.2 90B Vision (multimodal) είναι ένα μοντέλο του Meta στην κατηγορία Multimodal. Είναι καταχωρημένο στο Railwail αλλά δεν μπορεί να εκτελεστεί αυτή τη στιγμή.

Πόσο κοστίζει το Llama 3.2 90B Vision (multimodal) στο Railwail;

Το Llama 3.2 90B Vision (multimodal) δεν μπορεί να εκτελεστεί στο Railwail αυτή τη στιγμή, επομένως δεν υπάρχει τρέχουσα τιμή. Διαθέσιμες εναλλακτικές λύσεις με τιμές παρατίθενται παρακάτω σε αυτήν τη σελίδα.

Ποιο είναι το παράθυρο περιεχομένου του Llama 3.2 90B Vision (multimodal);

Το παράθυρο περιεχομένου του Llama 3.2 90B Vision (multimodal) περιέχει 131,072 tokens. Μια απάντηση μπορεί να είναι έως 8,192 tokens.

Πόσο γρήγορο είναι το Llama 3.2 90B Vision (multimodal);

Δεν υπάρχουν αρκετές μετρημένες εκτελέσεις του Llama 3.2 90B Vision (multimodal) στο Railwail ακόμα για να δηλωθεί ένας χρόνος εκτέλεσης. Εξαρτάται από την είσοδο, τις ρυθμίσεις και το φορτίο στον πάροχο.

Είναι το Llama 3.2 90B Vision (multimodal) καλύτερο από το BLIP;

Αυτό εξαρτάται από την εργασία. Το Llama 3.2 90B Vision (multimodal) (Meta) και το BLIP (Salesforce) είναι και τα δύο μοντέλα στην κατηγορία Multimodal. Η σελίδα σύγκρισης δείχνει τις τιμές και τις προδιαγραφές τους παράλληλα.

Σύγκριση Llama 3.2 90B Vision (multimodal) και BLIP

Μπορεί το Llama 3.2 90B Vision (multimodal) να επεξεργαστεί εικόνες;

Ναι. Το Llama 3.2 90B Vision (multimodal) δέχεται εικόνες ως είσοδο εκτός από κείμενο.

Μπορώ να χρησιμοποιήσω το Llama 3.2 90B Vision (multimodal) τώρα;

Προς το παρόν μη διαθέσιμο: αυτό το μοντέλο έχει απενεργοποιηθεί. Η σελίδα παραμένει ενεργή· διαθέσιμες εναλλακτικές λύσεις από την ίδια κατηγορία παρατίθενται παρακάτω.

Όλα τα μοντέλα μέσω ενός API

Ένα κλειδί API για κάθε μοντέλο στο Railwail. Η χρήση χρεώνεται από προπληρωμένα πιστωτικά, 1 πιστωτικό = 0,01 $.