Grok 2 Vision

MultimodalUtgåttIkke tilgjengelig
av xAIModell-ID: grok-2-vision

xAI's vision-capable Grok 2 snapshot. Image-in, text-out with strong multilingual instruction following.

Status
Ikke tilgjengelig
Kontekst
32 768 tokens
Maks. utdata
4 096 tokens
Input → output
Tekst + Bilde → Tekst
Utvikler
xAI
Oppdatert
24. september 2026

Grok 2 Vision er for øyeblikket utilgjengelig

Ikke tilgjengelig for øyeblikket: dette modellen er deaktivert.

Du kan fortsatt lese detaljene på denne siden. Velg ett av de tilgjengelige alternativene nedenfor for å kjøre en sammenlignbar modell med en gang.

Gå til alternativer

Leverandøren har faset ut denne modellen.

01

Sammenlignbare modeller

Alle i denne kategorien
  • BLIPSalesforce

    Salesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.

    ≈ 0,00030 USD/kjøring

  • Anthropic's April 2026 flagship. 87.6% on SWE-bench Verified, 3x higher image resolution, output self-verification, vision + reasoning.

    6,00 USD/1M inn

  • Anthropic's balanced mid-tier model from February 2026. Best price/performance for production workloads: 5x cheaper than Opus, near-flagship quality.

    3,60 USD/1M inn

02

Playground

Prøv Grok 2 Vision

Ingen innmaskering

Ikke tilgjengelig for øyeblikket

Ikke tilgjengelig for øyeblikket: dette modellen er deaktivert.

Lekeplassen er deaktivert. Du finner sammenlignbare modeller i samme kategori: Se alternativer

03

Om Grok 2 Vision

Kort sagtPer 24. september 2026

Grok 2 Vision er en modell fra xAI i kategorien Multimodal. Grok 2 Vision er for øyeblikket ikke tilgjengelig på Railwail. Kontekstvinduet inneholder 32 768 tokens, og ett svar kan være opptil 4 096 tokens langt.

Bakgrunn

Om xAI

Grunnlagt 2023 · Palo Alto, California, USA

xAI was founded in March 2023 by Elon Musk together with co-founders from DeepMind, OpenAI, Google Research and Microsoft Research, including Igor Babuschkin, Manuel Kroiss, Yuhuai Wu (now back at Google), Christian Szegedy, Jimmy Ba, Toby Pohlen, Ross Nordeen, Kyle Kosic and Greg Yang. The company is closely affiliated with X (formerly Twitter), Tesla and SpaceX. xAI raised $6B Series B in May 2024 followed by $6B Series C in December 2024 at a reported $50B valuation, with backers including Andreessen Horowitz, Sequoia, Fidelity, Kingdom Holding, Lightspeed and Saudi Prince Alwaleed. The flagship Grok model family launched in late 2023 (Grok-1, briefly open-sourced under Apache 2.0), Grok-2 in August 2024 and Grok-3 in February 2025. Grok 2 Vision arrived in October 2024 as xAI's first multimodal model with image input, made available via the X premium feature and the xAI API.

Besøk xAI

Arkitektur

Decoder-only Transformer with vision encoder (multimodal LLM)

Grok 2 Vision (model id grok-2-vision-1212 and successors) is a multimodal large language model that adds an image encoder to xAI's Grok 2 text backbone. The architecture follows the now-standard cross-attention multimodal LLM pattern: a Vision Transformer encodes the input image into visual tokens, which are projected into the LLM token space and concatenated with text tokens before the decoder. xAI has not published a technical paper, but the model card mentions a 'mixture of public web data, X data and licensed sources' with a knowledge cutoff in mid-2024. The model accepts up to 10 images per request, with a maximum image side of around 8,000 pixels, and supports the standard chat/completion API with a 131,072-token context window. Grok 2 Vision is positioned as a competitor to GPT-4o and Claude 3.5 Sonnet for chart understanding, OCR-heavy documents and screenshot reasoning. xAI ships safety filters consistent with their stated 'maximum truth-seeking' posture, which is more permissive on controversial content than OpenAI.

Parametere
Undisclosed
Kontekst
131 072 tokens

Evner

  • Image and text input (up to 10 images per request)
  • 131,072-token context window
  • Chart, diagram and screenshot reasoning
  • OCR-heavy document understanding (PDFs as images)
  • Real-time search-grounded responses via X / Grok web tool
  • JSON / structured output and function calling
  • More permissive content policy than OpenAI / Anthropic on controversial topics
  • Best for: chart and screenshot QA, X-integrated agents, code-with-image bug reports

Trening og lisens

Not disclosed. xAI references 'public web data, licensed third-party data and X user posts that have opted in', with a knowledge cutoff in mid-2024.

Lisens: Proprietary commercial API and X Premium product. Generated outputs may be used commercially under the xAI terms.

Sikkerhetstesting: xAI publishes a 'maximum truth-seeking' policy with intentionally lighter content filtering than peers; bias and jailbreak testing is referenced but no formal red-team report.

Kjente begrensninger

  • Closed weights, hosted only
  • No video or audio input (image-only multimodal)
  • Quality on math / vision benchmarks below GPT-4o and Claude 3.5 Sonnet
  • Lighter safety filtering may produce unsafe content
  • Knowledge cutoff mid-2024 without web tool
04

Priser

Ikke tilgjengelig for øyeblikket: dette modellen er deaktivert. Det er ingen pris for denne modellen for øyeblikket, så den kan ikke kjøres.

05

API

Ring Grok 2 Vision med din Railwail API-nøkkel. Bruk denne modell-IDen i forespørselen:

Ingen verifisert API-eksempel

Det offentlige API-et sender et annet inngangsformat enn det denne modellen trenger. Bruk lekeplassen ovenfor.

06

Spesifikasjoner

Modell-ID
grok-2-vision
Utvikler
xAI
Kategori
Multimodal
Inndata
Tekst, Bilde
Utdata
Tekst
Kontekstvindu
32 768 tokens
Maks. utdata
4 096 tokens
Livssyklus
Utgått
Modellstørrelse
Undisclosed
Lisens
Proprietary commercial API and X Premium product. Generated outputs may be used commercially under the xAI terms.
Katalogoppføring oppdatert
24. september 2026

Merkelapper

  • xai
  • vision
  • legacy
07

Brukstilfeller

Hva det brukes til

  • Chart and screenshot question answering
  • OCR-heavy document understanding
  • X-integrated AI assistants and search agents
  • Code-with-image bug analysis
  • Image-grounded customer support
08

Ofte stilte spørsmål

Hva er Grok 2 Vision?

Grok 2 Vision er en modell fra xAI i kategorien Multimodal. Den er oppført på Railwail, men kan ikke kjøres for øyeblikket.

Hvor mye koster Grok 2 Vision på Railwail?

Grok 2 Vision kan ikke kjøres på Railwail for øyeblikket, så det finnes ingen gjeldende pris. Tilgjengelige alternativer med priser er oppført lenger ned på denne siden.

Hvor stort er kontekstvinduet til Grok 2 Vision?

Kontekstvinduet til Grok 2 Vision inneholder 32 768 tokens. Ett svar kan være opptil 4 096 tokens langt.

Hvor rask er Grok 2 Vision?

Det finnes ennå ikke nok målte kjøringer av Grok 2 Vision på Railwail til å angi en kjøretid. Det avhenger av inndataene, innstillingene og belastningen hos leverandøren.

Er Grok 2 Vision bedre enn BLIP?

Det avhenger av oppgaven. Grok 2 Vision (xAI) og BLIP (Salesforce) er begge modeller i kategorien Multimodal. Sammenligningssiden viser prisene og spesifikasjonene deres side ved side.

Sammenlign Grok 2 Vision og BLIP

Kan Grok 2 Vision behandle bilder?

Ja. Grok 2 Vision godtar bilder som inndata i tillegg til tekst.

Kan jeg bruke Grok 2 Vision akkurat nå?

Ikke tilgjengelig for øyeblikket: dette modellen er deaktivert. Siden forblir online; tilgjengelige alternativer fra samme kategori er oppført lenger ned.

Alle modeller gjennom én API

Én API-nøkkel for alle modeller på Railwail. Bruk belastes fra forhåndsbetalt kreditt, 1 kreditt = 0,01 USD.