Grok 2 Vision

MultimodalKaldırıldıMevcut Değil
xAI tarafındanModel Kimliği: grok-2-vision

xAI's vision-capable Grok 2 snapshot. Image-in, text-out with strong multilingual instruction following.

Durum
Mevcut Değil
Bağlam
32.768 token
Maks. Çıkış
4.096 token
Giriş → Çıkış
Metin + Görüntü → Metin
Geliştirici
xAI
Güncellendi
24 Eylül 2026

Grok 2 Vision şu anda kullanılamıyor

Şu anda kullanılamıyor: bu model devre dışı bırakılmıştır.

Bu sayfadaki ayrıntıları yine de okuyabilirsiniz. Hemen karşılaştırılabilir bir modeli çalıştırmak için aşağıdaki mevcut alternatiflerden birini seçin.

Alternatiflere Git

Sağlayıcı bu modeli kaldırdı.

01

Karşılaştırılabilir modeller

Bu kategorideki tümü
  • BLIPSalesforce

    Salesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.

    ≈ $0,00030/çalıştırma

  • Anthropic's April 2026 flagship. 87.6% on SWE-bench Verified, 3x higher image resolution, output self-verification, vision + reasoning.

    $6,00/1M giriş

  • Anthropic's balanced mid-tier model from February 2026. Best price/performance for production workloads: 5x cheaper than Opus, near-flagship quality.

    $3,60/1M giriş

02

Playground

Grok 2 Vision'ı deneyin

Giriş formu yok

Şu anda kullanılamıyor

Şu anda kullanılamıyor: bu model devre dışı bırakılmıştır.

Oyun alanı devre dışıdır. Aynı kategoride karşılaştırılabilir modeller bulabilirsiniz: Alternatifleri görüntüle

03

Grok 2 Vision Hakkında

Özet24 Eylül 2026 itibariyle

Grok 2 Vision, xAI tarafından Multimodal kategorisinde geliştirilen bir modeldir. Grok 2 Vision şu anda Railwail üzerinde kullanılamıyor. Kontekst penceresi 32.768 token içerir ve bir yanıt en fazla 4.096 token uzunluğunda olabilir.

Arka plan

xAI hakkında

Kuruluş yılı 2023 · Palo Alto, California, USA

xAI was founded in March 2023 by Elon Musk together with co-founders from DeepMind, OpenAI, Google Research and Microsoft Research, including Igor Babuschkin, Manuel Kroiss, Yuhuai Wu (now back at Google), Christian Szegedy, Jimmy Ba, Toby Pohlen, Ross Nordeen, Kyle Kosic and Greg Yang. The company is closely affiliated with X (formerly Twitter), Tesla and SpaceX. xAI raised $6B Series B in May 2024 followed by $6B Series C in December 2024 at a reported $50B valuation, with backers including Andreessen Horowitz, Sequoia, Fidelity, Kingdom Holding, Lightspeed and Saudi Prince Alwaleed. The flagship Grok model family launched in late 2023 (Grok-1, briefly open-sourced under Apache 2.0), Grok-2 in August 2024 and Grok-3 in February 2025. Grok 2 Vision arrived in October 2024 as xAI's first multimodal model with image input, made available via the X premium feature and the xAI API.

xAI ziyaret edin

Mimari

Decoder-only Transformer with vision encoder (multimodal LLM)

Grok 2 Vision (model id grok-2-vision-1212 and successors) is a multimodal large language model that adds an image encoder to xAI's Grok 2 text backbone. The architecture follows the now-standard cross-attention multimodal LLM pattern: a Vision Transformer encodes the input image into visual tokens, which are projected into the LLM token space and concatenated with text tokens before the decoder. xAI has not published a technical paper, but the model card mentions a 'mixture of public web data, X data and licensed sources' with a knowledge cutoff in mid-2024. The model accepts up to 10 images per request, with a maximum image side of around 8,000 pixels, and supports the standard chat/completion API with a 131,072-token context window. Grok 2 Vision is positioned as a competitor to GPT-4o and Claude 3.5 Sonnet for chart understanding, OCR-heavy documents and screenshot reasoning. xAI ships safety filters consistent with their stated 'maximum truth-seeking' posture, which is more permissive on controversial content than OpenAI.

Parametreler
Undisclosed
Bağlam
131.072 token

Yetenekler

  • Image and text input (up to 10 images per request)
  • 131,072-token context window
  • Chart, diagram and screenshot reasoning
  • OCR-heavy document understanding (PDFs as images)
  • Real-time search-grounded responses via X / Grok web tool
  • JSON / structured output and function calling
  • More permissive content policy than OpenAI / Anthropic on controversial topics
  • Best for: chart and screenshot QA, X-integrated agents, code-with-image bug reports

Eğitim ve lisans

Not disclosed. xAI references 'public web data, licensed third-party data and X user posts that have opted in', with a knowledge cutoff in mid-2024.

Lisans: Proprietary commercial API and X Premium product. Generated outputs may be used commercially under the xAI terms.

Güvenlik testleri: xAI publishes a 'maximum truth-seeking' policy with intentionally lighter content filtering than peers; bias and jailbreak testing is referenced but no formal red-team report.

Bilinen sınırlamalar

  • Closed weights, hosted only
  • No video or audio input (image-only multimodal)
  • Quality on math / vision benchmarks below GPT-4o and Claude 3.5 Sonnet
  • Lighter safety filtering may produce unsafe content
  • Knowledge cutoff mid-2024 without web tool
04

Fiyatlandırma

Şu anda kullanılamıyor: bu model devre dışı bırakılmıştır. Bu modelin şu anda bir fiyatı yok, bu nedenle çalıştırılamıyor.

05

API

Grok 2 Vision öğesini Railwail API anahtarınızla çağırın. İstekte bu model kimliğini kullanın:

Doğrulanmış API örneği yok

Genel API, bu modelin ihtiyaç duyduğundan farklı bir giriş biçimi iletir. Yukarıdaki oyun alanını kullanın.

06

Özellikler

Model Kimliği
grok-2-vision
Geliştirici
xAI
Kategori
Multimodal
Giriş
Metin, Görüntü
Çıkış
Metin
Bağlam penceresi
32.768 token
Maks. çıkış
4.096 token
Yaşam döngüsü
Kaldırıldı
Model boyutu
Undisclosed
Lisans
Proprietary commercial API and X Premium product. Generated outputs may be used commercially under the xAI terms.
Katalog girişi güncellendi
24 Eylül 2026

Etiketler

  • xai
  • vision
  • legacy
07

Kullanım Alanları

Nerelerde Kullanılır

  • Chart and screenshot question answering
  • OCR-heavy document understanding
  • X-integrated AI assistants and search agents
  • Code-with-image bug analysis
  • Image-grounded customer support
08

Sık Sorulan Sorular

Grok 2 Vision nedir?

Grok 2 Vision, xAI tarafından Multimodal kategorisinde oluşturulan bir modeldir. Railwail'de listelenmiştir ancak şu anda çalıştırılamaz.

Grok 2 Vision Railwail'de ne kadar maliyetlidir?

Grok 2 Vision şu anda Railwail'de çalıştırılamaz, bu nedenle mevcut bir fiyat yoktur. Fiyatları olan mevcut alternatifler bu sayfanın aşağısında listelenmiştir.

Grok 2 Vision'nin kontekst penceresi ne kadardır?

Grok 2 Vision'nin kontekst penceresi 32.768 token içerir. Bir yanıt en fazla 4.096 token uzunluğunda olabilir.

Grok 2 Vision ne kadar hızlıdır?

Railwail'de Grok 2 Vision için henüz çalıştırma süresi belirtmek için yeterli ölçülen çalıştırma yoktur. Bu, giriş, ayarlar ve sağlayıcıdaki yüke bağlıdır.

Grok 2 Vision, BLIP'dan daha iyi midir?

Bu göreve bağlıdır. Grok 2 Vision (xAI) ve BLIP (Salesforce) her ikisi de Multimodal kategorisinde modellerdir. Karşılaştırma sayfası fiyatlarını ve özelliklerini yan yana gösterir.

Grok 2 Vision ve BLIP'ı karşılaştır

Grok 2 Vision görüntüleri işleyebilir mi?

Evet. Grok 2 Vision metne ek olarak giriş olarak görüntüleri kabul eder.

Grok 2 Vision'yi şu anda kullanabilir miyim?

Şu anda kullanılamıyor: bu model devre dışı bırakılmıştır. Sayfa çevrimiçi kalır; aynı kategoriden mevcut alternatifler aşağıda listelenmiştir.

Tüm Modeller Tek Bir API Aracılığıyla

Railwail'deki her model için bir API anahtarı. Kullanım, ön ödemeli kredilerden tahsil edilir, 1 kredi = $0,01.