Grok 2 Vision

MultimodalRetiréNon disponible
par xAIID du modèle: grok-2-vision

xAI's vision-capable Grok 2 snapshot. Image-in, text-out with strong multilingual instruction following.

Statut
Non disponible
Contexte
32 768 tokens
Max. sortie
4 096 tokens
Entrée → Sortie
Texte + Image → Texte
Développeur
xAI
Mis à jour
24 septembre 2026

Grok 2 Vision n'est actuellement pas disponible

Actuellement indisponible : ce modèle a été désactivé.

Vous pouvez toujours consulter les détails sur cette page. Choisissez l'une des alternatives disponibles ci-dessous pour exécuter immédiatement un modèle comparable.

Voir les alternatives

Le fournisseur a retiré ce modèle.

01

Modèles comparables

Tous dans cette catégorie
  • BLIPSalesforce

    Salesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.

    ≈ 0,00030 $US/exécution

  • Anthropic's April 2026 flagship. 87.6% on SWE-bench Verified, 3x higher image resolution, output self-verification, vision + reasoning.

    6,00 $US/1M entrée

  • Anthropic's balanced mid-tier model from February 2026. Best price/performance for production workloads: 5x cheaper than Opus, near-flagship quality.

    3,60 $US/1M entrée

02

Playground

Essayer Grok 2 Vision

Pas de formulaire d'entrée

Actuellement indisponible

Actuellement indisponible : ce modèle a été désactivé.

Le terrain de jeu est désactivé. Vous pouvez trouver des modèles comparables dans la même catégorie : Parcourir les alternatives

03

À propos de Grok 2 Vision

RésuméAu 24 septembre 2026

Grok 2 Vision est un modèle de xAI dans la catégorie Multimodal. Grok 2 Vision n'est actuellement pas disponible sur Railwail. La fenêtre de contexte contient 32 768 tokens, et une réponse peut faire jusqu'à 4 096 tokens.

Arrière-plan

À propos de xAI

Fondée 2023 · Palo Alto, California, USA

xAI was founded in March 2023 by Elon Musk together with co-founders from DeepMind, OpenAI, Google Research and Microsoft Research, including Igor Babuschkin, Manuel Kroiss, Yuhuai Wu (now back at Google), Christian Szegedy, Jimmy Ba, Toby Pohlen, Ross Nordeen, Kyle Kosic and Greg Yang. The company is closely affiliated with X (formerly Twitter), Tesla and SpaceX. xAI raised $6B Series B in May 2024 followed by $6B Series C in December 2024 at a reported $50B valuation, with backers including Andreessen Horowitz, Sequoia, Fidelity, Kingdom Holding, Lightspeed and Saudi Prince Alwaleed. The flagship Grok model family launched in late 2023 (Grok-1, briefly open-sourced under Apache 2.0), Grok-2 in August 2024 and Grok-3 in February 2025. Grok 2 Vision arrived in October 2024 as xAI's first multimodal model with image input, made available via the X premium feature and the xAI API.

Visiter xAI

Architecture

Decoder-only Transformer with vision encoder (multimodal LLM)

Grok 2 Vision (model id grok-2-vision-1212 and successors) is a multimodal large language model that adds an image encoder to xAI's Grok 2 text backbone. The architecture follows the now-standard cross-attention multimodal LLM pattern: a Vision Transformer encodes the input image into visual tokens, which are projected into the LLM token space and concatenated with text tokens before the decoder. xAI has not published a technical paper, but the model card mentions a 'mixture of public web data, X data and licensed sources' with a knowledge cutoff in mid-2024. The model accepts up to 10 images per request, with a maximum image side of around 8,000 pixels, and supports the standard chat/completion API with a 131,072-token context window. Grok 2 Vision is positioned as a competitor to GPT-4o and Claude 3.5 Sonnet for chart understanding, OCR-heavy documents and screenshot reasoning. xAI ships safety filters consistent with their stated 'maximum truth-seeking' posture, which is more permissive on controversial content than OpenAI.

Paramètres
Undisclosed
Contexte
131 072 tokens

Capacités

  • Image and text input (up to 10 images per request)
  • 131,072-token context window
  • Chart, diagram and screenshot reasoning
  • OCR-heavy document understanding (PDFs as images)
  • Real-time search-grounded responses via X / Grok web tool
  • JSON / structured output and function calling
  • More permissive content policy than OpenAI / Anthropic on controversial topics
  • Best for: chart and screenshot QA, X-integrated agents, code-with-image bug reports

Entraînement et licence

Not disclosed. xAI references 'public web data, licensed third-party data and X user posts that have opted in', with a knowledge cutoff in mid-2024.

Licence: Proprietary commercial API and X Premium product. Generated outputs may be used commercially under the xAI terms.

Tests de sécurité: xAI publishes a 'maximum truth-seeking' policy with intentionally lighter content filtering than peers; bias and jailbreak testing is referenced but no formal red-team report.

Limitations connues

  • Closed weights, hosted only
  • No video or audio input (image-only multimodal)
  • Quality on math / vision benchmarks below GPT-4o and Claude 3.5 Sonnet
  • Lighter safety filtering may produce unsafe content
  • Knowledge cutoff mid-2024 without web tool
04

Tarification

Actuellement indisponible : ce modèle a été désactivé. Il n'y a pas de prix pour ce modèle pour le moment, il ne peut donc pas être exécuté.

05

API

Appelez Grok 2 Vision avec votre clé API Railwail. Utilisez cet ID de modèle dans la requête :

Aucun exemple API vérifié

L'API publique transmet un format d'entrée différent de celui dont ce modèle a besoin. Utilisez le playground ci-dessus.

06

Spécifications

ID du modèle
grok-2-vision
Développeur
xAI
Catégorie
Multimodal
Entrée
Texte, Image
Sortie
Texte
Fenêtre de contexte
32 768 tokens
Sortie max.
4 096 tokens
Cycle de vie
Retiré
Taille du modèle
Undisclosed
Licence
Proprietary commercial API and X Premium product. Generated outputs may be used commercially under the xAI terms.
Entrée du catalogue mise à jour
24 septembre 2026

Étiquettes

  • xai
  • vision
  • legacy
07

Cas d'usage

À quoi ça sert

  • Chart and screenshot question answering
  • OCR-heavy document understanding
  • X-integrated AI assistants and search agents
  • Code-with-image bug analysis
  • Image-grounded customer support
08

Questions fréquemment posées

Qu'est-ce que Grok 2 Vision ?

Grok 2 Vision est un modèle de xAI dans la catégorie Multimodal. Il est listé sur Railwail mais ne peut pas être exécuté pour le moment.

Combien coûte Grok 2 Vision sur Railwail ?

Grok 2 Vision ne peut pas être exécuté sur Railwail pour le moment, il n'y a donc pas de prix actuel. Les alternatives disponibles avec leurs prix sont listées plus bas sur cette page.

Quelle est la fenêtre de contexte de Grok 2 Vision ?

La fenêtre de contexte de Grok 2 Vision contient 32 768 tokens. Une réponse peut faire jusqu'à 4 096 tokens.

Quelle est la vitesse de Grok 2 Vision ?

Il n'y a pas encore assez d'exécutions mesurées de Grok 2 Vision sur Railwail pour indiquer un temps d'exécution. Cela dépend de l'entrée, des paramètres et de la charge chez le fournisseur.

Grok 2 Vision est-il meilleur que BLIP ?

Cela dépend de la tâche. Grok 2 Vision (xAI) et BLIP (Salesforce) sont tous deux des modèles de la catégorie Multimodal. La page de comparaison affiche leurs prix et spécifications côte à côte.

Comparer Grok 2 Vision et BLIP

Grok 2 Vision peut-il traiter des images ?

Oui. Grok 2 Vision accepte les images en entrée en plus du texte.

Puis-je utiliser Grok 2 Vision maintenant ?

Actuellement indisponible : ce modèle a été désactivé. La page reste en ligne ; les alternatives disponibles de la même catégorie sont listées plus bas.

Tous les modèles via une API

Une clé API pour tous les modèles sur Railwail. L'utilisation est facturée à partir de crédits prépayés, 1 crédit = 0,01 $US.