Grok 2 Vision

MultimodalΑποσύρθηκεΜη διαθέσιμο
από xAIΑναγνωριστικό μοντέλου: grok-2-vision

xAI's vision-capable Grok 2 snapshot. Image-in, text-out with strong multilingual instruction following.

Κατάσταση
Μη διαθέσιμο
Περιεχόμενο
32.768 tokens
Μέγ. έξοδος
4.096 tokens
Είσοδος → Έξοδος
Κείμενο + Εικόνα → Κείμενο
Προγραμματιστής
xAI
Ενημερώθηκε
24 Σεπτεμβρίου 2026

Το Grok 2 Vision δεν είναι διαθέσιμο αυτή τη στιγμή

Προς το παρόν μη διαθέσιμο: αυτό το μοντέλο έχει απενεργοποιηθεί.

Μπορείτε να διαβάσετε τις λεπτομέρειες σε αυτήν τη σελίδα. Επιλέξτε μία από τις διαθέσιμες εναλλακτικές λύσεις παρακάτω για να εκτελέσετε αμέσως ένα συγκρίσιμο μοντέλο.

Μετάβαση στις εναλλακτικές λύσεις

Ο πάροχος απέσυρε αυτό το μοντέλο.

01

Συγκρίσιμα μοντέλα

Όλα σε αυτήν την κατηγορία
  • BLIPSalesforce

    Salesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.

    ≈ 0,00030 $/εκτέλεση

  • Anthropic's April 2026 flagship. 87.6% on SWE-bench Verified, 3x higher image resolution, output self-verification, vision + reasoning.

    6,00 $/1M in

  • Anthropic's balanced mid-tier model from February 2026. Best price/performance for production workloads: 5x cheaper than Opus, near-flagship quality.

    3,60 $/1M in

02

Playground

Δοκιμάστε Grok 2 Vision

Χωρίς φόρμα εισόδου

Προς το παρόν μη διαθέσιμο

Προς το παρόν μη διαθέσιμο: αυτό το μοντέλο έχει απενεργοποιηθεί.

Το playground είναι απενεργοποιημένο. Μπορείτε να βρείτε συγκρίσιμα μοντέλα στην ίδια κατηγορία: Περιήγηση εναλλακτικών λύσεων

03

Σχετικά με το Grok 2 Vision

ΣύντομαΗμερομηνία: 24 Σεπτεμβρίου 2026

Το Grok 2 Vision είναι ένα μοντέλο του xAI στην κατηγορία Multimodal. Το Grok 2 Vision δεν είναι διαθέσιμο στο Railwail αυτή τη στιγμή. Το παράθυρο περιεχομένου περιέχει 32.768 tokens, και μια απάντηση μπορεί να είναι έως 4.096 tokens.

Φόντο

Σχετικά με xAI

Ιδρύθηκε 2023 · Palo Alto, California, USA

xAI was founded in March 2023 by Elon Musk together with co-founders from DeepMind, OpenAI, Google Research and Microsoft Research, including Igor Babuschkin, Manuel Kroiss, Yuhuai Wu (now back at Google), Christian Szegedy, Jimmy Ba, Toby Pohlen, Ross Nordeen, Kyle Kosic and Greg Yang. The company is closely affiliated with X (formerly Twitter), Tesla and SpaceX. xAI raised $6B Series B in May 2024 followed by $6B Series C in December 2024 at a reported $50B valuation, with backers including Andreessen Horowitz, Sequoia, Fidelity, Kingdom Holding, Lightspeed and Saudi Prince Alwaleed. The flagship Grok model family launched in late 2023 (Grok-1, briefly open-sourced under Apache 2.0), Grok-2 in August 2024 and Grok-3 in February 2025. Grok 2 Vision arrived in October 2024 as xAI's first multimodal model with image input, made available via the X premium feature and the xAI API.

Επισκεφθείτε xAI

Αρχιτεκτονική

Decoder-only Transformer with vision encoder (multimodal LLM)

Grok 2 Vision (model id grok-2-vision-1212 and successors) is a multimodal large language model that adds an image encoder to xAI's Grok 2 text backbone. The architecture follows the now-standard cross-attention multimodal LLM pattern: a Vision Transformer encodes the input image into visual tokens, which are projected into the LLM token space and concatenated with text tokens before the decoder. xAI has not published a technical paper, but the model card mentions a 'mixture of public web data, X data and licensed sources' with a knowledge cutoff in mid-2024. The model accepts up to 10 images per request, with a maximum image side of around 8,000 pixels, and supports the standard chat/completion API with a 131,072-token context window. Grok 2 Vision is positioned as a competitor to GPT-4o and Claude 3.5 Sonnet for chart understanding, OCR-heavy documents and screenshot reasoning. xAI ships safety filters consistent with their stated 'maximum truth-seeking' posture, which is more permissive on controversial content than OpenAI.

Παράμετροι
Undisclosed
Περιεχόμενο
131.072 tokens

Δυνατότητες

  • Image and text input (up to 10 images per request)
  • 131,072-token context window
  • Chart, diagram and screenshot reasoning
  • OCR-heavy document understanding (PDFs as images)
  • Real-time search-grounded responses via X / Grok web tool
  • JSON / structured output and function calling
  • More permissive content policy than OpenAI / Anthropic on controversial topics
  • Best for: chart and screenshot QA, X-integrated agents, code-with-image bug reports

Εκπαίδευση & άδεια

Not disclosed. xAI references 'public web data, licensed third-party data and X user posts that have opted in', with a knowledge cutoff in mid-2024.

Άδεια: Proprietary commercial API and X Premium product. Generated outputs may be used commercially under the xAI terms.

Δοκιμές ασφάλειας: xAI publishes a 'maximum truth-seeking' policy with intentionally lighter content filtering than peers; bias and jailbreak testing is referenced but no formal red-team report.

Γνωστοί περιορισμοί

  • Closed weights, hosted only
  • No video or audio input (image-only multimodal)
  • Quality on math / vision benchmarks below GPT-4o and Claude 3.5 Sonnet
  • Lighter safety filtering may produce unsafe content
  • Knowledge cutoff mid-2024 without web tool
04

Τιμολόγηση

Προς το παρόν μη διαθέσιμο: αυτό το μοντέλο έχει απενεργοποιηθεί. Δεν υπάρχει τιμή για αυτό το μοντέλο αυτή τη στιγμή, επομένως δεν μπορεί να εκτελεστεί.

05

API

Καλέστε το Grok 2 Vision με το κλειδί Railwail API. Χρησιμοποιήστε αυτό το ID μοντέλου στο αίτημα:

Κανένα επαληθευμένο παράδειγμα API

Το δημόσιο API περνά μια διαφορετική μορφή εισόδου από αυτή που χρειάζεται αυτό το μοντέλο. Χρησιμοποιήστε το playground παραπάνω.

06

Προδιαγραφές

ID μοντέλου
grok-2-vision
Ανάπτυξη
xAI
Κατηγορία
Multimodal
Είσοδος
Κείμενο, Εικόνα
Έξοδος
Κείμενο
Παράθυρο περιεχομένου
32.768 tokens
Μέγ. έξοδος
4.096 tokens
Κύκλος ζωής
Αποσύρθηκε
Μέγεθος μοντέλου
Undisclosed
Άδεια
Proprietary commercial API and X Premium product. Generated outputs may be used commercially under the xAI terms.
Καταχώρηση καταλόγου ενημερώθηκε
24 Σεπτεμβρίου 2026

Ετικέτες

  • xai
  • vision
  • legacy
07

Περιπτώσεις χρήσης

Για τι χρησιμοποιείται

  • Chart and screenshot question answering
  • OCR-heavy document understanding
  • X-integrated AI assistants and search agents
  • Code-with-image bug analysis
  • Image-grounded customer support
08

Συχνές ερωτήσεις

Τι είναι Grok 2 Vision;

Το Grok 2 Vision είναι ένα μοντέλο του xAI στην κατηγορία Multimodal. Είναι καταχωρημένο στο Railwail αλλά δεν μπορεί να εκτελεστεί αυτή τη στιγμή.

Πόσο κοστίζει το Grok 2 Vision στο Railwail;

Το Grok 2 Vision δεν μπορεί να εκτελεστεί στο Railwail αυτή τη στιγμή, επομένως δεν υπάρχει τρέχουσα τιμή. Διαθέσιμες εναλλακτικές λύσεις με τιμές παρατίθενται παρακάτω σε αυτήν τη σελίδα.

Ποιο είναι το παράθυρο περιεχομένου του Grok 2 Vision;

Το παράθυρο περιεχομένου του Grok 2 Vision περιέχει 32.768 tokens. Μια απάντηση μπορεί να είναι έως 4.096 tokens.

Πόσο γρήγορο είναι το Grok 2 Vision;

Δεν υπάρχουν αρκετές μετρημένες εκτελέσεις του Grok 2 Vision στο Railwail ακόμα για να δηλωθεί ένας χρόνος εκτέλεσης. Εξαρτάται από την είσοδο, τις ρυθμίσεις και το φορτίο στον πάροχο.

Είναι το Grok 2 Vision καλύτερο από το BLIP;

Αυτό εξαρτάται από την εργασία. Το Grok 2 Vision (xAI) και το BLIP (Salesforce) είναι και τα δύο μοντέλα στην κατηγορία Multimodal. Η σελίδα σύγκρισης δείχνει τις τιμές και τις προδιαγραφές τους παράλληλα.

Σύγκριση Grok 2 Vision και BLIP

Μπορεί το Grok 2 Vision να επεξεργαστεί εικόνες;

Ναι. Το Grok 2 Vision δέχεται εικόνες ως είσοδο εκτός από κείμενο.

Μπορώ να χρησιμοποιήσω το Grok 2 Vision τώρα;

Προς το παρόν μη διαθέσιμο: αυτό το μοντέλο έχει απενεργοποιηθεί. Η σελίδα παραμένει ενεργή· διαθέσιμες εναλλακτικές λύσεις από την ίδια κατηγορία παρατίθενται παρακάτω.

Όλα τα μοντέλα μέσω ενός API

Ένα κλειδί API για κάθε μοντέλο στο Railwail. Η χρήση χρεώνεται από προπληρωμένα πιστωτικά, 1 πιστωτικό = 0,01 $.