Qwen2-VL-72B Instruct

MultimodalIkke tilgjengelig
av Alibaba / QwenModell-ID: qwen2-vl-72b-instruct

Alibaba's 72B vision-language model with M-RoPE and dynamic resolution. Strong document and video understanding.

Status
Ikke tilgjengelig
Kontekst
32 768 tokens
Maks. utdata
8 192 tokens
Input → output
Tekst + Bilde + Video → Tekst
Utvikler
Alibaba / Qwen
Oppdatert
25. juni 2026

Qwen2-VL-72B Instruct er for øyeblikket utilgjengelig

Ikke tilgjengelig for øyeblikket: dette modellen er deaktivert.

Du kan fortsatt lese detaljene på denne siden. Velg ett av de tilgjengelige alternativene nedenfor for å kjøre en sammenlignbar modell med en gang.

Gå til alternativer
01

Sammenlignbare modeller

Alle i denne kategorien
  • BLIPSalesforce

    Salesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.

    ≈ 0,00030 USD/kjøring

  • Anthropic's April 2026 flagship. 87.6% on SWE-bench Verified, 3x higher image resolution, output self-verification, vision + reasoning.

    6,00 USD/1M inn

  • Anthropic's balanced mid-tier model from February 2026. Best price/performance for production workloads: 5x cheaper than Opus, near-flagship quality.

    3,60 USD/1M inn

02

Playground

Prøv Qwen2-VL-72B Instruct

Chat

Ikke tilgjengelig for øyeblikket

Ikke tilgjengelig for øyeblikket: dette modellen er deaktivert.

Lekeplassen er deaktivert. Du finner sammenlignbare modeller i samme kategori: Se alternativer

Prøv Qwen2-VL-72B Instruct

Send en melding. Svaret kommer fullstendig når modellen er ferdig (ingen streaming).

Systemprompt
Maks. svarslengde (tokens)

Denne kjøringen

Ingen pris – ikke tilgjengelig for øyeblikket.

Ny her?

5 gratis credits (0,05 USD) når du registrerer deg med Google

Kan brukes 24 timer etter registrering, opptil 5 kjøringer per dag og maksimalt 2 credits per kjøring. Andre påloggingsmetoder starter uten credits.

03

Om Qwen2-VL-72B Instruct

Kort sagtPer 25. juni 2026

Qwen2-VL-72B Instruct er en modell fra Alibaba / Qwen i kategorien Multimodal. Qwen2-VL-72B Instruct er for øyeblikket ikke tilgjengelig på Railwail. Kontekstvinduet inneholder 32 768 tokens, og ett svar kan være opptil 8 192 tokens langt.

Bakgrunn

Om Alibaba DAMO Academy (Qwen Team)

Grunnlagt 2017 · Hangzhou, China

The Qwen (Tongyi Qianwen) team sits inside Alibaba Cloud's DAMO Academy, the company's research arm founded in 2017 in Hangzhou. The team is led by Junyang Lin and Le Hou and counts dozens of researchers across NLP, vision and speech. Qwen has produced one of the most prolific open-source model lines in the world, including Qwen-1.5, Qwen2 (June 2024), Qwen2.5 (September 2024), the Code, Math, Audio and VL (vision-language) families, and the December 2024 release of Qwen2.5-VL. Qwen2-VL launched in August 2024 in 2B, 7B and 72B sizes, all released on Hugging Face and ModelScope; the 72B Instruct variant became one of the top open-weights vision-language models worldwide, frequently matching closed-source peers on OCR-heavy benchmarks like DocVQA and ChartQA. Alibaba offers Qwen models commercially through Alibaba Cloud and Bailian.

Besøk Alibaba DAMO Academy (Qwen Team)

Arkitektur

Decoder-only Transformer with Naive Dynamic Resolution Vision Transformer

Qwen2-VL-72B-Instruct combines the Qwen2 72B decoder-only Transformer with a custom 675M ViT vision encoder using Naive Dynamic Resolution: instead of resizing every image to a fixed grid, the encoder accepts the native resolution and generates a variable number of visual tokens per image. The model also introduces Multimodal Rotary Position Embedding (M-RoPE) that encodes positions in time (for video), height and width separately, enabling single-stream multimodal video understanding. The model supports up to 20 minutes of video input via uniform frame sampling, single-frame image input at variable resolution up to ~16K visual tokens, and a 131,072-token text context window. Training proceeded in three stages: contrastive vision-language pretraining, multimodal pretraining on interleaved image-text and video-text data, and supervised fine-tuning with chain-of-thought multimodal instructions. Weights are released under the Qwen licence (free for commercial use under specific terms).

Parametere
72B (~73B with vision encoder)
Kontekst
131 072 tokens

Evner

  • Open-weights 72B vision-language model under permissive Qwen licence
  • Naive Dynamic Resolution: native image aspect ratio without fixed grid
  • Multimodal Rotary Position Embedding (M-RoPE) for joint image and video
  • Up to 20 minutes of video understanding
  • 131K-token text context
  • Top open-weights scores on DocVQA, ChartQA, MathVista, RealWorldQA
  • Strong OCR across English, Chinese, Japanese, Korean and European languages
  • Best for: open-weights document AI, video QA, OCR-heavy multilingual workloads

Trening og lisens

Multi-stage curriculum: contrastive vision-language pretraining on large web image-text pairs, multimodal pretraining on interleaved image-text and video-text data, supervised fine-tuning on curated chain-of-thought multimodal instructions.

Lisens: Qwen Licence (commercial use permitted under 100M MAU; bespoke licence required above).

Sikkerhetstesting: Alibaba publishes a model card with safety evaluations and integrates Tongyi safety filters in cloud deployments; no separate full red-team report.

Kjente begrensninger

  • Serving 72B requires multi-GPU infrastructure
  • Video understanding limited to 20 minutes uniform sampling
  • Hallucination on extreme OCR cases
  • Licence has MAU and competing-services restrictions
  • Audio input requires separate Qwen-Audio model
04

Priser

Ikke tilgjengelig for øyeblikket: dette modellen er deaktivert. Det er ingen pris for denne modellen for øyeblikket, så den kan ikke kjøres.

05

API

Ring Qwen2-VL-72B Instruct med din Railwail API-nøkkel. Bruk denne modell-IDen i forespørselen:

Ikke tilgjengelig for øyeblikket

Modellen har ingen verifisert pris eller er deaktivert; API-kall blir avvist.

06

Spesifikasjoner

Modell-ID
qwen2-vl-72b-instruct
Utvikler
Alibaba / Qwen
Kategori
Multimodal
Inndata
Tekst, Bilde, Video
Utdata
Tekst
Kontekstvindu
32 768 tokens
Maks. utdata
8 192 tokens
Modellstørrelse
72B (~73B with vision encoder)
Lisens
Qwen Licence (commercial use permitted under 100M MAU; bespoke licence required above).
Katalogoppføring oppdatert
25. juni 2026

Merkelapper

  • qwen
  • alibaba
  • multimodal
  • vision
  • open-weights
  • video-understanding
  • pricing-tbd
07

Brukstilfeller

Hva det brukes til

  • Open-weights document AI for multilingual OCR
  • Video question answering up to 20 minutes
  • Chart and diagram understanding for analytics
  • Chinese / Japanese / Korean OCR-heavy workloads
  • Multimodal AI assistants in Chinese cloud regions
08

Ofte stilte spørsmål

Hva er Qwen2-VL-72B Instruct?

Qwen2-VL-72B Instruct er en modell fra Alibaba / Qwen i kategorien Multimodal. Den er oppført på Railwail, men kan ikke kjøres for øyeblikket.

Hvor mye koster Qwen2-VL-72B Instruct på Railwail?

Qwen2-VL-72B Instruct kan ikke kjøres på Railwail for øyeblikket, så det finnes ingen gjeldende pris. Tilgjengelige alternativer med priser er oppført lenger ned på denne siden.

Hvor stort er kontekstvinduet til Qwen2-VL-72B Instruct?

Kontekstvinduet til Qwen2-VL-72B Instruct inneholder 32 768 tokens. Ett svar kan være opptil 8 192 tokens langt.

Hvor rask er Qwen2-VL-72B Instruct?

Det finnes ennå ikke nok målte kjøringer av Qwen2-VL-72B Instruct på Railwail til å angi en kjøretid. Det avhenger av inndataene, innstillingene og belastningen hos leverandøren.

Er Qwen2-VL-72B Instruct bedre enn BLIP?

Det avhenger av oppgaven. Qwen2-VL-72B Instruct (Alibaba / Qwen) og BLIP (Salesforce) er begge modeller i kategorien Multimodal. Sammenligningssiden viser prisene og spesifikasjonene deres side ved side.

Sammenlign Qwen2-VL-72B Instruct og BLIP

Kan Qwen2-VL-72B Instruct behandle bilder?

Ja. Qwen2-VL-72B Instruct godtar bilder som inndata i tillegg til tekst.

Kan jeg bruke Qwen2-VL-72B Instruct akkurat nå?

Ikke tilgjengelig for øyeblikket: dette modellen er deaktivert. Siden forblir online; tilgjengelige alternativer fra samme kategori er oppført lenger ned.

Alle modeller gjennom én API

Én API-nøkkel for alle modeller på Railwail. Bruk belastes fra forhåndsbetalt kreditt, 1 kreditt = 0,01 USD.