Qwen2-VL-72B Instruct

MultimodalInte tillgänglig
av Alibaba / QwenModell-ID: qwen2-vl-72b-instruct

Alibaba's 72B vision-language model with M-RoPE and dynamic resolution. Strong document and video understanding.

Status
Inte tillgänglig
Kontext
32 768 tokens
Max. utdata
8 192 tokens
Inmatning → utmatning
Text + Bild + Video → Text
Utvecklare
Alibaba / Qwen
Uppdaterad
25 juni 2026

Qwen2-VL-72B Instruct är för närvarande otillgänglig

Inte tillgänglig för närvarande: denna modell är inaktiverad.

Du kan fortfarande läsa detaljerna på denna sida. Välj ett av de tillgängliga alternativen nedan för att köra en jämförbar modell direkt.

Gå till alternativ
01

Jämförbara modeller

Alla i denna kategori
  • BLIPSalesforce

    Salesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.

    ≈ 0,00030 US$/körning

  • Anthropic's April 2026 flagship. 87.6% on SWE-bench Verified, 3x higher image resolution, output self-verification, vision + reasoning.

    6,00 US$/1M in

  • Anthropic's balanced mid-tier model from February 2026. Best price/performance for production workloads: 5x cheaper than Opus, near-flagship quality.

    3,60 US$/1M in

02

Playground

Prova Qwen2-VL-72B Instruct

Chatt

Inte tillgänglig för närvarande

Inte tillgänglig för närvarande: denna modell är inaktiverad.

Lekplatsen är inaktiverad. Du hittar jämförbara modeller i samma kategori: Visa alternativ

Prova Qwen2-VL-72B Instruct

Skicka ett meddelande. Svaret kommer i sin helhet när modellen är klar (ingen streaming).

Systemprompt
Max. svarslängd (tokens)

Denna körning

Inget pris – för närvarande otillgängligt.

Ny här?

5 gratis credits (0,05 US$) när du registrerar dig med Google

Användbar 24 timmar efter registrering, upp till 5 körningar per dag och högst 2 credits per körning. Andra inloggningsmetoder startar utan credits.

03

Om Qwen2-VL-72B Instruct

Kort sagtFrån och med 25 juni 2026

Qwen2-VL-72B Instruct är en modell av Alibaba / Qwen i kategorin Multimodal. Qwen2-VL-72B Instruct är för närvarande inte tillgänglig på Railwail. Kontextfönstret innehåller 32 768 tokens, och ett svar kan vara upp till 8 192 tokens långt.

Bakgrund

Om Alibaba DAMO Academy (Qwen Team)

Grundat 2017 · Hangzhou, China

The Qwen (Tongyi Qianwen) team sits inside Alibaba Cloud's DAMO Academy, the company's research arm founded in 2017 in Hangzhou. The team is led by Junyang Lin and Le Hou and counts dozens of researchers across NLP, vision and speech. Qwen has produced one of the most prolific open-source model lines in the world, including Qwen-1.5, Qwen2 (June 2024), Qwen2.5 (September 2024), the Code, Math, Audio and VL (vision-language) families, and the December 2024 release of Qwen2.5-VL. Qwen2-VL launched in August 2024 in 2B, 7B and 72B sizes, all released on Hugging Face and ModelScope; the 72B Instruct variant became one of the top open-weights vision-language models worldwide, frequently matching closed-source peers on OCR-heavy benchmarks like DocVQA and ChartQA. Alibaba offers Qwen models commercially through Alibaba Cloud and Bailian.

Besök Alibaba DAMO Academy (Qwen Team)

Arkitektur

Decoder-only Transformer with Naive Dynamic Resolution Vision Transformer

Qwen2-VL-72B-Instruct combines the Qwen2 72B decoder-only Transformer with a custom 675M ViT vision encoder using Naive Dynamic Resolution: instead of resizing every image to a fixed grid, the encoder accepts the native resolution and generates a variable number of visual tokens per image. The model also introduces Multimodal Rotary Position Embedding (M-RoPE) that encodes positions in time (for video), height and width separately, enabling single-stream multimodal video understanding. The model supports up to 20 minutes of video input via uniform frame sampling, single-frame image input at variable resolution up to ~16K visual tokens, and a 131,072-token text context window. Training proceeded in three stages: contrastive vision-language pretraining, multimodal pretraining on interleaved image-text and video-text data, and supervised fine-tuning with chain-of-thought multimodal instructions. Weights are released under the Qwen licence (free for commercial use under specific terms).

Parameter
72B (~73B with vision encoder)
Kontext
131 072 tokens

Funktioner

  • Open-weights 72B vision-language model under permissive Qwen licence
  • Naive Dynamic Resolution: native image aspect ratio without fixed grid
  • Multimodal Rotary Position Embedding (M-RoPE) for joint image and video
  • Up to 20 minutes of video understanding
  • 131K-token text context
  • Top open-weights scores on DocVQA, ChartQA, MathVista, RealWorldQA
  • Strong OCR across English, Chinese, Japanese, Korean and European languages
  • Best for: open-weights document AI, video QA, OCR-heavy multilingual workloads

Träning & licens

Multi-stage curriculum: contrastive vision-language pretraining on large web image-text pairs, multimodal pretraining on interleaved image-text and video-text data, supervised fine-tuning on curated chain-of-thought multimodal instructions.

Licens: Qwen Licence (commercial use permitted under 100M MAU; bespoke licence required above).

Säkerhetstestning: Alibaba publishes a model card with safety evaluations and integrates Tongyi safety filters in cloud deployments; no separate full red-team report.

Kända begränsningar

  • Serving 72B requires multi-GPU infrastructure
  • Video understanding limited to 20 minutes uniform sampling
  • Hallucination on extreme OCR cases
  • Licence has MAU and competing-services restrictions
  • Audio input requires separate Qwen-Audio model
04

Priser

Inte tillgänglig för närvarande: denna modell är inaktiverad. Det finns ingen pris för denna modell för närvarande, så den kan inte köras.

05

API

Anropa Qwen2-VL-72B Instruct med din Railwail API-nyckel. Använd detta modell-ID i begäran:

För närvarande otillgänglig

Modellen har inget verifierat pris eller är inaktiverad; API-anrop avvisas.

06

Specifikationer

Modell-ID
qwen2-vl-72b-instruct
Utvecklare
Alibaba / Qwen
Kategori
Multimodal
Inmatning
Text, Bild, Video
Utmatning
Text
Kontextfönster
32 768 tokens
Max. utmatning
8 192 tokens
Modellstorlek
72B (~73B with vision encoder)
Licens
Qwen Licence (commercial use permitted under 100M MAU; bespoke licence required above).
Kataloginlägg uppdaterat
25 juni 2026

Taggar

  • qwen
  • alibaba
  • multimodal
  • vision
  • open-weights
  • video-understanding
  • pricing-tbd
07

Användningsfall

Vad det används till

  • Open-weights document AI for multilingual OCR
  • Video question answering up to 20 minutes
  • Chart and diagram understanding for analytics
  • Chinese / Japanese / Korean OCR-heavy workloads
  • Multimodal AI assistants in Chinese cloud regions
08

Vanliga frågor

Vad är Qwen2-VL-72B Instruct?

Qwen2-VL-72B Instruct är en modell av Alibaba / Qwen i kategorin Multimodal. Den finns i Railwail-katalogen men kan inte köras för närvarande.

Vad kostar Qwen2-VL-72B Instruct på Railwail?

Qwen2-VL-72B Instruct kan inte köras på Railwail för närvarande, så det finns inget aktuellt pris. Tillgängliga alternativ med priser visas längre ned på denna sida.

Hur stort är kontextfönstret för Qwen2-VL-72B Instruct?

Kontextfönstret för Qwen2-VL-72B Instruct innehåller 32 768 tokens. Ett svar kan vara upp till 8 192 tokens långt.

Hur snabb är Qwen2-VL-72B Instruct?

Det finns ännu inte tillräckligt många uppmätta körningar av Qwen2-VL-72B Instruct på Railwail för att ange en körningstid. Det beror på inmatningen, inställningarna och belastningen hos leverantören.

Är Qwen2-VL-72B Instruct bättre än BLIP?

Det beror på uppgiften. Qwen2-VL-72B Instruct (Alibaba / Qwen) och BLIP (Salesforce) är båda modeller i kategorin Multimodal. Jämförelsesidan visar deras priser och specifikationer sida vid sida.

Jämför Qwen2-VL-72B Instruct och BLIP

Kan Qwen2-VL-72B Instruct bearbeta bilder?

Ja. Qwen2-VL-72B Instruct accepterar bilder som inmatning utöver text.

Kan jag använda Qwen2-VL-72B Instruct just nu?

Inte tillgänglig för närvarande: denna modell är inaktiverad. Sidan förblir online; tillgängliga alternativ från samma kategori visas längre ned.

Alla modeller via ett API

En API-nyckel för alla modeller på Railwail. Användningen debiteras från förbetald kredit, 1 kredit = 0,01 US$.