Qwen2-VL-72B Instruct

MultimodaalNiet beschikbaar
van Alibaba / QwenModel-ID: qwen2-vl-72b-instruct

Alibaba's 72B vision-language model with M-RoPE and dynamic resolution. Strong document and video understanding.

Status
Niet beschikbaar
Context
32.768 tokens
Max. uitvoer
8.192 tokens
Invoer → Uitvoer
Tekst + Afbeelding + Video → Tekst
Ontwikkelaar
Alibaba / Qwen
Bijgewerkt
25 juni 2026

Qwen2-VL-72B Instruct is momenteel niet beschikbaar

Momenteel niet beschikbaar: dit model is gedeactiveerd.

Je kunt de details op deze pagina nog steeds lezen. Kies een van de beschikbare alternatieven hieronder om direct een vergelijkbaar model uit te voeren.

Naar alternatieven
01

Vergelijkbare modellen

Alle in deze categorie
  • BLIPSalesforce

    Salesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.

    ≈ US$ 0,00030/uitvoering

  • Anthropic's April 2026 flagship. 87.6% on SWE-bench Verified, 3x higher image resolution, output self-verification, vision + reasoning.

    US$ 6,00/1M in

  • Anthropic's balanced mid-tier model from February 2026. Best price/performance for production workloads: 5x cheaper than Opus, near-flagship quality.

    US$ 3,60/1M in

02

Playground

Qwen2-VL-72B Instruct proberen

Chat

Momenteel niet beschikbaar

Momenteel niet beschikbaar: dit model is gedeactiveerd.

De playground is uitgeschakeld. Vergelijkbare modellen vind je in dezelfde categorie: Alternatieven bekijken

Qwen2-VL-72B Instruct proberen

Stuur een bericht. Het antwoord komt volledig binnen zodra het model klaar is (geen streaming).

Systeemprompt
Max. antwoordlengte (tokens)

Deze uitvoering

Geen prijs – momenteel niet beschikbaar.

Nieuw hier?

5 gratis credits (US$ 0,05) wanneer je je aanmeldt met Google

Bruikbaar 24 uur na aanmelding, tot 5 uitvoeringen per dag en maximaal 2 credits per uitvoering. Andere aanmeldmethoden starten zonder credits.

03

Over Qwen2-VL-72B Instruct

SamengevatPer 25 juni 2026

Qwen2-VL-72B Instruct is een model van Alibaba / Qwen in de categorie Multimodaal. Qwen2-VL-72B Instruct is momenteel niet beschikbaar op Railwail. Het contextvenster bevat 32.768 tokens, en een antwoord kan tot 8.192 tokens lang zijn.

Achtergrond

Over Alibaba DAMO Academy (Qwen Team)

Opgericht 2017 · Hangzhou, China

The Qwen (Tongyi Qianwen) team sits inside Alibaba Cloud's DAMO Academy, the company's research arm founded in 2017 in Hangzhou. The team is led by Junyang Lin and Le Hou and counts dozens of researchers across NLP, vision and speech. Qwen has produced one of the most prolific open-source model lines in the world, including Qwen-1.5, Qwen2 (June 2024), Qwen2.5 (September 2024), the Code, Math, Audio and VL (vision-language) families, and the December 2024 release of Qwen2.5-VL. Qwen2-VL launched in August 2024 in 2B, 7B and 72B sizes, all released on Hugging Face and ModelScope; the 72B Instruct variant became one of the top open-weights vision-language models worldwide, frequently matching closed-source peers on OCR-heavy benchmarks like DocVQA and ChartQA. Alibaba offers Qwen models commercially through Alibaba Cloud and Bailian.

Alibaba DAMO Academy (Qwen Team) bezoeken

Architectuur

Decoder-only Transformer with Naive Dynamic Resolution Vision Transformer

Qwen2-VL-72B-Instruct combines the Qwen2 72B decoder-only Transformer with a custom 675M ViT vision encoder using Naive Dynamic Resolution: instead of resizing every image to a fixed grid, the encoder accepts the native resolution and generates a variable number of visual tokens per image. The model also introduces Multimodal Rotary Position Embedding (M-RoPE) that encodes positions in time (for video), height and width separately, enabling single-stream multimodal video understanding. The model supports up to 20 minutes of video input via uniform frame sampling, single-frame image input at variable resolution up to ~16K visual tokens, and a 131,072-token text context window. Training proceeded in three stages: contrastive vision-language pretraining, multimodal pretraining on interleaved image-text and video-text data, and supervised fine-tuning with chain-of-thought multimodal instructions. Weights are released under the Qwen licence (free for commercial use under specific terms).

Parameters
72B (~73B with vision encoder)
Context
131.072 tokens

Mogelijkheden

  • Open-weights 72B vision-language model under permissive Qwen licence
  • Naive Dynamic Resolution: native image aspect ratio without fixed grid
  • Multimodal Rotary Position Embedding (M-RoPE) for joint image and video
  • Up to 20 minutes of video understanding
  • 131K-token text context
  • Top open-weights scores on DocVQA, ChartQA, MathVista, RealWorldQA
  • Strong OCR across English, Chinese, Japanese, Korean and European languages
  • Best for: open-weights document AI, video QA, OCR-heavy multilingual workloads

Training & licentie

Multi-stage curriculum: contrastive vision-language pretraining on large web image-text pairs, multimodal pretraining on interleaved image-text and video-text data, supervised fine-tuning on curated chain-of-thought multimodal instructions.

Licentie: Qwen Licence (commercial use permitted under 100M MAU; bespoke licence required above).

Veiligheidstests: Alibaba publishes a model card with safety evaluations and integrates Tongyi safety filters in cloud deployments; no separate full red-team report.

Bekende beperkingen

  • Serving 72B requires multi-GPU infrastructure
  • Video understanding limited to 20 minutes uniform sampling
  • Hallucination on extreme OCR cases
  • Licence has MAU and competing-services restrictions
  • Audio input requires separate Qwen-Audio model
04

Prijzen

Momenteel niet beschikbaar: dit model is gedeactiveerd. Er is momenteel geen prijs voor dit model, dus het kan niet worden uitgevoerd.

05

API

Roep Qwen2-VL-72B Instruct aan met je Railwail API-sleutel. Gebruik deze model-ID in het verzoek:

Momenteel niet beschikbaar

Het model heeft geen geverifieerde prijs of is gedeactiveerd; API-aanroepen worden geweigerd.

06

Specificaties

Model-ID
qwen2-vl-72b-instruct
Ontwikkelaar
Alibaba / Qwen
Categorie
Multimodaal
Invoer
Tekst, Afbeelding, Video
Uitvoer
Tekst
Contextvenster
32.768 tokens
Max. uitvoer
8.192 tokens
Modelgrootte
72B (~73B with vision encoder)
Licentie
Qwen Licence (commercial use permitted under 100M MAU; bespoke licence required above).
Catalogusitem bijgewerkt
25 juni 2026

Tags

  • qwen
  • alibaba
  • multimodal
  • vision
  • open-weights
  • video-understanding
  • pricing-tbd
07

Gebruiksscenario's

Waarvoor het wordt gebruikt

  • Open-weights document AI for multilingual OCR
  • Video question answering up to 20 minutes
  • Chart and diagram understanding for analytics
  • Chinese / Japanese / Korean OCR-heavy workloads
  • Multimodal AI assistants in Chinese cloud regions
08

Veelgestelde vragen

Wat is Qwen2-VL-72B Instruct?

Qwen2-VL-72B Instruct is een model van Alibaba / Qwen in de categorie Multimodaal. Het staat in de Railwail-catalogus, maar kan momenteel niet worden uitgevoerd.

Hoeveel kost Qwen2-VL-72B Instruct op Railwail?

Qwen2-VL-72B Instruct kan momenteel niet op Railwail worden uitgevoerd, dus er is geen huidige prijs. Beschikbare alternatieven met prijzen staan verderop op deze pagina.

Wat is het contextvenster van Qwen2-VL-72B Instruct?

Het contextvenster van Qwen2-VL-72B Instruct bevat 32.768 tokens. Een antwoord kan tot 8.192 tokens lang zijn.

Hoe snel is Qwen2-VL-72B Instruct?

Er zijn nog niet genoeg gemeten runs van Qwen2-VL-72B Instruct op Railwail om een uitvoeringstijd op te geven. Dit hangt af van de invoer, de instellingen en de belasting bij de provider.

Is Qwen2-VL-72B Instruct beter dan BLIP?

Dat hangt van de taak af. Qwen2-VL-72B Instruct (Alibaba / Qwen) en BLIP (Salesforce) zijn beide modellen in de categorie Multimodaal. De vergelijkingspagina toont hun prijzen en specificaties naast elkaar.

Qwen2-VL-72B Instruct en BLIP vergelijken

Kan Qwen2-VL-72B Instruct afbeeldingen verwerken?

Ja. Qwen2-VL-72B Instruct accepteert afbeeldingen als invoer naast tekst.

Kan ik Qwen2-VL-72B Instruct nu gebruiken?

Momenteel niet beschikbaar: dit model is gedeactiveerd. De pagina blijft online; beschikbare alternatieven uit dezelfde categorie staan verderop.

Alle modellen via één API

Één API-sleutel voor elk model op Railwail. Gebruik wordt afgerekend via vooraf gekochte credits, 1 credit = US$ 0,01.