Qwen2-VL-72B Instruct

MultimodálisNem elérhető
Alibaba / Qwen általModell-azonosító: qwen2-vl-72b-instruct

Alibaba's 72B vision-language model with M-RoPE and dynamic resolution. Strong document and video understanding.

Állapot
Nem elérhető
Kontextus
32 768 token
Max. kimenet
8192 token
Bemenet → kimenet
Szöveg + Kép + Videó → Szöveg
Fejlesztő
Alibaba / Qwen
Frissítve
2026. június 25.

Qwen2-VL-72B Instruct jelenleg nem elérhető

Jelenleg nem elérhető: ezt a modellt deaktiválták.

Az oldal részleteit továbbra is elolvashatja. Az alábbi elérhető alternatívák közül válasszon egy hasonló modell azonnali futtatásához.

Ugrás az alternatívákhoz
01
  • BLIPSalesforce

    Salesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.

    ≈ 0,00030 USD/futás

  • Anthropic's April 2026 flagship. 87.6% on SWE-bench Verified, 3x higher image resolution, output self-verification, vision + reasoning.

    6,00 USD/1M be

  • Anthropic's balanced mid-tier model from February 2026. Best price/performance for production workloads: 5x cheaper than Opus, near-flagship quality.

    3,60 USD/1M be

02

Playground

Próbáld ki: Qwen2-VL-72B Instruct

Csevegés

Jelenleg nem elérhető

Jelenleg nem elérhető: ezt a modellt deaktiválták.

A játszótér letiltva van. Hasonló modelleket találsz ugyanabban a kategóriában: Alternatívák megtekintése

Próbáld ki: Qwen2-VL-72B Instruct

Írjon üzenetet. A válasz teljes egészében megérkezik, amikor a modell kész (nincs streaming).

Rendszer-prompt
Max. válaszlength (tokenek)

Ez a futtatás

Nincs ár – jelenleg nem elérhető.

Új vagy itt?

5 ingyenes kredit (0,05 USD) Google-fiókkal való regisztrációkor

Használható 24 órával a regisztráció után, naponta legfeljebb 5 futtatás és futtatásonként legfeljebb 2 kredit. Más bejelentkezési módok kreditek nélkül indulnak.

03

A Qwen2-VL-72B Instruct névjegye

Röviden2026. június 25. szerint

A Qwen2-VL-72B Instruct a Alibaba / Qwen által fejlesztett modell a Multimodális kategóriában. A Qwen2-VL-72B Instruct jelenleg nem érhető el a Railwail-en. A kontextablak 32 768 tokent tartalmaz, egy válasz pedig legfeljebb 8192 token hosszú lehet.

Háttér

A Alibaba DAMO Academy (Qwen Team) névjegye

Alapítva: 2017 · Hangzhou, China

The Qwen (Tongyi Qianwen) team sits inside Alibaba Cloud's DAMO Academy, the company's research arm founded in 2017 in Hangzhou. The team is led by Junyang Lin and Le Hou and counts dozens of researchers across NLP, vision and speech. Qwen has produced one of the most prolific open-source model lines in the world, including Qwen-1.5, Qwen2 (June 2024), Qwen2.5 (September 2024), the Code, Math, Audio and VL (vision-language) families, and the December 2024 release of Qwen2.5-VL. Qwen2-VL launched in August 2024 in 2B, 7B and 72B sizes, all released on Hugging Face and ModelScope; the 72B Instruct variant became one of the top open-weights vision-language models worldwide, frequently matching closed-source peers on OCR-heavy benchmarks like DocVQA and ChartQA. Alibaba offers Qwen models commercially through Alibaba Cloud and Bailian.

Alibaba DAMO Academy (Qwen Team) meglátogatása

Architektúra

Decoder-only Transformer with Naive Dynamic Resolution Vision Transformer

Qwen2-VL-72B-Instruct combines the Qwen2 72B decoder-only Transformer with a custom 675M ViT vision encoder using Naive Dynamic Resolution: instead of resizing every image to a fixed grid, the encoder accepts the native resolution and generates a variable number of visual tokens per image. The model also introduces Multimodal Rotary Position Embedding (M-RoPE) that encodes positions in time (for video), height and width separately, enabling single-stream multimodal video understanding. The model supports up to 20 minutes of video input via uniform frame sampling, single-frame image input at variable resolution up to ~16K visual tokens, and a 131,072-token text context window. Training proceeded in three stages: contrastive vision-language pretraining, multimodal pretraining on interleaved image-text and video-text data, and supervised fine-tuning with chain-of-thought multimodal instructions. Weights are released under the Qwen licence (free for commercial use under specific terms).

Paraméterek
72B (~73B with vision encoder)
Kontextus
131 072 token

Képességek

  • Open-weights 72B vision-language model under permissive Qwen licence
  • Naive Dynamic Resolution: native image aspect ratio without fixed grid
  • Multimodal Rotary Position Embedding (M-RoPE) for joint image and video
  • Up to 20 minutes of video understanding
  • 131K-token text context
  • Top open-weights scores on DocVQA, ChartQA, MathVista, RealWorldQA
  • Strong OCR across English, Chinese, Japanese, Korean and European languages
  • Best for: open-weights document AI, video QA, OCR-heavy multilingual workloads

Képzés és licenc

Multi-stage curriculum: contrastive vision-language pretraining on large web image-text pairs, multimodal pretraining on interleaved image-text and video-text data, supervised fine-tuning on curated chain-of-thought multimodal instructions.

Licenc: Qwen Licence (commercial use permitted under 100M MAU; bespoke licence required above).

Biztonsági tesztelés: Alibaba publishes a model card with safety evaluations and integrates Tongyi safety filters in cloud deployments; no separate full red-team report.

Ismert korlátozások

  • Serving 72B requires multi-GPU infrastructure
  • Video understanding limited to 20 minutes uniform sampling
  • Hallucination on extreme OCR cases
  • Licence has MAU and competing-services restrictions
  • Audio input requires separate Qwen-Audio model
04

Árak

Jelenleg nem elérhető: ezt a modellt deaktiválták. Jelenleg nincs ár ehhez a modellhez, ezért nem futtatható.

05

API

Hívja meg a Qwen2-VL-72B Instruct modellt a Railwail API-kulcsával. Használja ezt a modell-azonosítót a kérésben:

Jelenleg nem elérhető

A modellnek nincs ellenőrzött ára vagy deaktiválva van; az API-hívások visszautasítottak.

06

Specifikációk

Modell-azonosító
qwen2-vl-72b-instruct
Fejlesztő
Alibaba / Qwen
Kategória
Multimodális
Bemenet
Szöveg, Kép, Videó
Kimenet
Szöveg
Kontextusablak
32 768 token
Max. kimenet
8192 token
Modell mérete
72B (~73B with vision encoder)
Licenc
Qwen Licence (commercial use permitted under 100M MAU; bespoke licence required above).
Katalógus bejegyzés frissítve
2026. június 25.

Címkék

  • qwen
  • alibaba
  • multimodal
  • vision
  • open-weights
  • video-understanding
  • pricing-tbd
07

Felhasználási esetek

Mire használják

  • Open-weights document AI for multilingual OCR
  • Video question answering up to 20 minutes
  • Chart and diagram understanding for analytics
  • Chinese / Japanese / Korean OCR-heavy workloads
  • Multimodal AI assistants in Chinese cloud regions
08

Gyakran ismételt kérdések

Mi az a Qwen2-VL-72B Instruct?

A Qwen2-VL-72B Instruct a Alibaba / Qwen által fejlesztett modell a Multimodális kategóriában. A Railwail katalógusában szerepel, de jelenleg nem futtatható.

Mennyibe kerül a Qwen2-VL-72B Instruct a Railwail-on?

A Qwen2-VL-72B Instruct jelenleg nem futtatható a Railwail-on, ezért nincs aktuális ár. Az elérhető alternatívák árakkal az oldal alább találhatók.

Mekkora a Qwen2-VL-72B Instruct kontextablaka?

A Qwen2-VL-72B Instruct kontextablaka 32 768 tokent tartalmaz. Egy válasz legfeljebb 8192 token hosszú lehet.

Milyen gyors a Qwen2-VL-72B Instruct?

A Qwen2-VL-72B Instruct-nek még nincs elég mért futtatása a Railwail-on ahhoz, hogy futási időt adjunk meg. Ez a bemenettől, a beállításoktól és a szolgáltató terhelésétől függ.

A Qwen2-VL-72B Instruct jobb, mint a BLIP?

Ez a feladattól függ. A Qwen2-VL-72B Instruct (Alibaba / Qwen) és a BLIP (Salesforce) egyaránt modellek a Multimodális kategóriában. Az összehasonlítás oldal az árakat és specifikációkat egymás mellett mutatja.

Qwen2-VL-72B Instruct és BLIP összehasonlítása

A Qwen2-VL-72B Instruct képes képeket feldolgozni?

Igen. A Qwen2-VL-72B Instruct szöveg mellett képeket is fogad bemenetként.

Használhatom a Qwen2-VL-72B Instruct-t most?

Jelenleg nem elérhető: ezt a modellt deaktiválták. Az oldal online marad; az ugyanabból a kategóriából elérhető alternatívák az oldal alább találhatók.

Összes modell egy API-n keresztül

Egy API-kulcs a Railwail összes modelljéhez. A használat előre feltöltött kreditek alapján kerül felszámításra, 1 kredit = 0,01 USD.