Qwen2-VL-72B Instruct

MultimodalIkke tilgængelig
af Alibaba / QwenModell-ID: qwen2-vl-72b-instruct

Alibaba's 72B vision-language model with M-RoPE and dynamic resolution. Strong document and video understanding.

Status
Ikke tilgængelig
Kontekst
32,768 tokens
Maks. output
8,192 tokens
Input → output
Tekst + Billede + Video → Tekst
Udvikler
Alibaba / Qwen
Opdateret
25. juni 2026

Qwen2-VL-72B Instruct er i øjeblikket utilgængelig

Ikke tilgængelig i øjeblikket: dette model er deaktiveret.

Du kan stadig læse detaljerne på denne side. Vælg en af de tilgængelige alternativer nedenfor for at køre en sammenlignelig model med det samme.

Gå til alternativer
01

Sammenlignelige modeller

Alle i denne kategori
  • BLIPSalesforce

    Salesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.

    ≈ 0,00030 US$/kørsel

  • Anthropic's April 2026 flagship. 87.6% on SWE-bench Verified, 3x higher image resolution, output self-verification, vision + reasoning.

    6,00 US$/1M in

  • Anthropic's balanced mid-tier model from February 2026. Best price/performance for production workloads: 5x cheaper than Opus, near-flagship quality.

    3,60 US$/1M in

02

Playground

Prøv Qwen2-VL-72B Instruct

Chat

Derzeit nicht verfügbar

Ikke tilgængelig i øjeblikket: dette model er deaktiveret.

Playground'en er deaktiveret. Du finder sammenlignelige modeller i samme kategori: Se alternativer

Prøv Qwen2-VL-72B Instruct

Send en besked. Svaret ankommer fuldt ud, når modellen er færdig (uden streaming).

Systemprompt
Maks. svarslængde (tokens)

Denne kørsel

Ingen pris – ikke tilgængelig i øjeblikket.

Ny her?

5 gratis credits (0,05 US$) når du tilmelder dig med Google

Kan bruges 24 timer efter tilmelding, op til 5 kørsler pr. dag og højst 2 credits pr. kørsel. Andre login-metoder starter uden credits.

03

Om Qwen2-VL-72B Instruct

Kort sagtFra 25. juni 2026

Qwen2-VL-72B Instruct er en model af Alibaba / Qwen i kategorien Multimodal. Qwen2-VL-72B Instruct er i øjeblikket ikke tilgængelig på Railwail. Kontekstvinduet indeholder 32,768 tokens, og et svar kan være op til 8,192 tokens langt.

Baggrund

Om Alibaba DAMO Academy (Qwen Team)

Grundlagt 2017 · Hangzhou, China

The Qwen (Tongyi Qianwen) team sits inside Alibaba Cloud's DAMO Academy, the company's research arm founded in 2017 in Hangzhou. The team is led by Junyang Lin and Le Hou and counts dozens of researchers across NLP, vision and speech. Qwen has produced one of the most prolific open-source model lines in the world, including Qwen-1.5, Qwen2 (June 2024), Qwen2.5 (September 2024), the Code, Math, Audio and VL (vision-language) families, and the December 2024 release of Qwen2.5-VL. Qwen2-VL launched in August 2024 in 2B, 7B and 72B sizes, all released on Hugging Face and ModelScope; the 72B Instruct variant became one of the top open-weights vision-language models worldwide, frequently matching closed-source peers on OCR-heavy benchmarks like DocVQA and ChartQA. Alibaba offers Qwen models commercially through Alibaba Cloud and Bailian.

Besøg Alibaba DAMO Academy (Qwen Team)

Arkitektur

Decoder-only Transformer with Naive Dynamic Resolution Vision Transformer

Qwen2-VL-72B-Instruct combines the Qwen2 72B decoder-only Transformer with a custom 675M ViT vision encoder using Naive Dynamic Resolution: instead of resizing every image to a fixed grid, the encoder accepts the native resolution and generates a variable number of visual tokens per image. The model also introduces Multimodal Rotary Position Embedding (M-RoPE) that encodes positions in time (for video), height and width separately, enabling single-stream multimodal video understanding. The model supports up to 20 minutes of video input via uniform frame sampling, single-frame image input at variable resolution up to ~16K visual tokens, and a 131,072-token text context window. Training proceeded in three stages: contrastive vision-language pretraining, multimodal pretraining on interleaved image-text and video-text data, and supervised fine-tuning with chain-of-thought multimodal instructions. Weights are released under the Qwen licence (free for commercial use under specific terms).

Parametre
72B (~73B with vision encoder)
Kontekst
131,072 tokens

Funktioner

  • Open-weights 72B vision-language model under permissive Qwen licence
  • Naive Dynamic Resolution: native image aspect ratio without fixed grid
  • Multimodal Rotary Position Embedding (M-RoPE) for joint image and video
  • Up to 20 minutes of video understanding
  • 131K-token text context
  • Top open-weights scores on DocVQA, ChartQA, MathVista, RealWorldQA
  • Strong OCR across English, Chinese, Japanese, Korean and European languages
  • Best for: open-weights document AI, video QA, OCR-heavy multilingual workloads

Træning og licens

Multi-stage curriculum: contrastive vision-language pretraining on large web image-text pairs, multimodal pretraining on interleaved image-text and video-text data, supervised fine-tuning on curated chain-of-thought multimodal instructions.

Licens: Qwen Licence (commercial use permitted under 100M MAU; bespoke licence required above).

Sikkerhedstests: Alibaba publishes a model card with safety evaluations and integrates Tongyi safety filters in cloud deployments; no separate full red-team report.

Kendte begrænsninger

  • Serving 72B requires multi-GPU infrastructure
  • Video understanding limited to 20 minutes uniform sampling
  • Hallucination on extreme OCR cases
  • Licence has MAU and competing-services restrictions
  • Audio input requires separate Qwen-Audio model
04

Priser

Ikke tilgængelig i øjeblikket: dette model er deaktiveret. Der er i øjeblikket ingen pris for denne model, så den kan ikke køres.

05

API

Kald Qwen2-VL-72B Instruct med din Railwail API-nøgle. Brug dette model-ID i anmodningen:

I øjeblikket utilgængelig

Modellen har ingen bekræftet pris eller er deaktiveret; API-kald afvises.

06

Specifikationer

Model-ID
qwen2-vl-72b-instruct
Udvikler
Alibaba / Qwen
Kategori
Multimodal
Input
Tekst, Billede, Video
Output
Tekst
Kontekstvindue
32,768 tokens
Maks. output
8,192 tokens
Modelstørrelse
72B (~73B with vision encoder)
Licens
Qwen Licence (commercial use permitted under 100M MAU; bespoke licence required above).
Katalogelement opdateret
25. juni 2026

Tags

  • qwen
  • alibaba
  • multimodal
  • vision
  • open-weights
  • video-understanding
  • pricing-tbd
07

Anvendelsestilfælde

Hvad det bruges til

  • Open-weights document AI for multilingual OCR
  • Video question answering up to 20 minutes
  • Chart and diagram understanding for analytics
  • Chinese / Japanese / Korean OCR-heavy workloads
  • Multimodal AI assistants in Chinese cloud regions
08

Ofte stillede spørgsmål

Hvad er Qwen2-VL-72B Instruct?

Qwen2-VL-72B Instruct er en model fra Alibaba / Qwen i kategorien Multimodal. Den er opført på Railwail, men kan ikke køres i øjeblikket.

Hvad koster Qwen2-VL-72B Instruct på Railwail?

Qwen2-VL-72B Instruct kan ikke køres på Railwail i øjeblikket, så der er ingen aktuel pris. Tilgængelige alternativer med priser er angivet længere nede på denne side.

Hvad er kontekstvinduet for Qwen2-VL-72B Instruct?

Kontekstvinduet for Qwen2-VL-72B Instruct indeholder 32,768 tokens. Et svar kan være op til 8,192 tokens langt.

Hvor hurtig er Qwen2-VL-72B Instruct?

Der er endnu ikke nok målte kørsler af Qwen2-VL-72B Instruct på Railwail til at angive en udførelsestid. Det afhænger af inputtet, indstillingerne og belastningen hos provideren.

Er Qwen2-VL-72B Instruct bedre end BLIP?

Det afhænger af opgaven. Qwen2-VL-72B Instruct (Alibaba / Qwen) og BLIP (Salesforce) er begge modeller i kategorien Multimodal. Sammenligningssiden viser deres priser og specifikationer side om side.

Sammenlign Qwen2-VL-72B Instruct og BLIP

Kan Qwen2-VL-72B Instruct behandle billeder?

Ja. Qwen2-VL-72B Instruct accepterer billeder som input ud over tekst.

Kan jeg bruge Qwen2-VL-72B Instruct lige nu?

Ikke tilgængelig i øjeblikket: dette model er deaktiveret. Siden forbliver online; tilgængelige alternativer fra samme kategori er angivet længere nede.

Alle modeller via én API

En API-nøgle til alle modeller på Railwail. Forbrug debiteres fra forudbetalte credits, 1 credit = 0,01 US$.