Qwen2-VL-72B Instruct

MultimodaaliEi saatavilla
kehittäjä: Alibaba / QwenMallin tunnus: qwen2-vl-72b-instruct

Alibaba's 72B vision-language model with M-RoPE and dynamic resolution. Strong document and video understanding.

Tila
Ei saatavilla
Konteksti
32 768 tokenia
Enint. tuloste
8 192 tokenia
Syöte → tulos
Teksti + Kuva + Video → Teksti
Kehittäjä
Alibaba / Qwen
Päivitetty
25. kesäkuuta 2026

Qwen2-VL-72B Instruct ei ole tällä hetkellä saatavilla

Ei tällä hetkellä saatavilla: tämä malli on poistettu käytöstä.

Voit silti lukea tiedot tältä sivulta. Valitse yksi alla olevista saatavilla olevista vaihtoehdoista suorittaaksesi vertailukelpoisen mallin heti.

Siirry vaihtoehtoihin
01

Vertailukelpoiset mallit

Kaikki tässä kategoriassa
  • BLIPSalesforce

    Salesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.

    ≈ 0,00030 $/suoritus

  • Anthropic's April 2026 flagship. 87.6% on SWE-bench Verified, 3x higher image resolution, output self-verification, vision + reasoning.

    6,00 $/1M in

  • Anthropic's balanced mid-tier model from February 2026. Best price/performance for production workloads: 5x cheaper than Opus, near-flagship quality.

    3,60 $/1M in

02

Leikkikenttä

Kokeile Qwen2-VL-72B Instruct

Chat

Ei tällä hetkellä saatavilla

Ei tällä hetkellä saatavilla: tämä malli on poistettu käytöstä.

Leikkikenttä on poistettu käytöstä. Vertailukelpoisia malleja löydät samasta kategoriasta: Selaa vaihtoehtoja

Kokeile Qwen2-VL-72B Instruct

Lähetä viesti. Vastaus saapuu kokonaisuudessaan, kun malli on valmis (ei suoratoistoa).

Järjestelmäkehote
Enint. vastausten pituus (tokenit)

Tämä suoritus

Ei hintaa – ei tällä hetkellä saatavilla.

Uusi täällä?

5 ilmaista creditiä (0,05 $) kun rekisteröidyt Googlella

Käytettävissä 24 tuntia rekisteröinnin jälkeen, enintään 5 suoritusta päivässä ja enintään 2 creditiä suoritusta kohti. Muut kirjautumismenetelmät alkavat ilman creditejä.

03

Tietoja: Qwen2-VL-72B Instruct

Lyhyesti25. kesäkuuta 2026 alkaen

Qwen2-VL-72B Instruct on Alibaba / Qwen-kehittäjän malli kategoriasta Multimodaali. Qwen2-VL-72B Instruct ei ole tällä hetkellä saatavilla Railwailissa. Kontekstiikkuna sisältää 32 768 tokenia, ja vastaus voi olla enintään 8 192 tokenia pitkä.

Tausta

Tietoja: Alibaba DAMO Academy (Qwen Team)

Perustettu 2017 · Hangzhou, China

The Qwen (Tongyi Qianwen) team sits inside Alibaba Cloud's DAMO Academy, the company's research arm founded in 2017 in Hangzhou. The team is led by Junyang Lin and Le Hou and counts dozens of researchers across NLP, vision and speech. Qwen has produced one of the most prolific open-source model lines in the world, including Qwen-1.5, Qwen2 (June 2024), Qwen2.5 (September 2024), the Code, Math, Audio and VL (vision-language) families, and the December 2024 release of Qwen2.5-VL. Qwen2-VL launched in August 2024 in 2B, 7B and 72B sizes, all released on Hugging Face and ModelScope; the 72B Instruct variant became one of the top open-weights vision-language models worldwide, frequently matching closed-source peers on OCR-heavy benchmarks like DocVQA and ChartQA. Alibaba offers Qwen models commercially through Alibaba Cloud and Bailian.

Vieraile sivustolla Alibaba DAMO Academy (Qwen Team)

Arkkitehtuuri

Decoder-only Transformer with Naive Dynamic Resolution Vision Transformer

Qwen2-VL-72B-Instruct combines the Qwen2 72B decoder-only Transformer with a custom 675M ViT vision encoder using Naive Dynamic Resolution: instead of resizing every image to a fixed grid, the encoder accepts the native resolution and generates a variable number of visual tokens per image. The model also introduces Multimodal Rotary Position Embedding (M-RoPE) that encodes positions in time (for video), height and width separately, enabling single-stream multimodal video understanding. The model supports up to 20 minutes of video input via uniform frame sampling, single-frame image input at variable resolution up to ~16K visual tokens, and a 131,072-token text context window. Training proceeded in three stages: contrastive vision-language pretraining, multimodal pretraining on interleaved image-text and video-text data, and supervised fine-tuning with chain-of-thought multimodal instructions. Weights are released under the Qwen licence (free for commercial use under specific terms).

Parametrit
72B (~73B with vision encoder)
Konteksti
131 072 tokenia

Ominaisuudet

  • Open-weights 72B vision-language model under permissive Qwen licence
  • Naive Dynamic Resolution: native image aspect ratio without fixed grid
  • Multimodal Rotary Position Embedding (M-RoPE) for joint image and video
  • Up to 20 minutes of video understanding
  • 131K-token text context
  • Top open-weights scores on DocVQA, ChartQA, MathVista, RealWorldQA
  • Strong OCR across English, Chinese, Japanese, Korean and European languages
  • Best for: open-weights document AI, video QA, OCR-heavy multilingual workloads

Koulutus ja lisenssi

Multi-stage curriculum: contrastive vision-language pretraining on large web image-text pairs, multimodal pretraining on interleaved image-text and video-text data, supervised fine-tuning on curated chain-of-thought multimodal instructions.

Lisenssi: Qwen Licence (commercial use permitted under 100M MAU; bespoke licence required above).

Turvallisuustestit: Alibaba publishes a model card with safety evaluations and integrates Tongyi safety filters in cloud deployments; no separate full red-team report.

Tunnetut rajoitukset

  • Serving 72B requires multi-GPU infrastructure
  • Video understanding limited to 20 minutes uniform sampling
  • Hallucination on extreme OCR cases
  • Licence has MAU and competing-services restrictions
  • Audio input requires separate Qwen-Audio model
04

Hinnat

Ei tällä hetkellä saatavilla: tämä malli on poistettu käytöstä. Tällä hetkellä tälle mallille ei ole hintaa, joten sitä ei voi suorittaa.

05

API

Kutsu Qwen2-VL-72B Instruct Railwail-API-avaimellasi. Käytä tätä mallin tunnusta pyynnössä:

Tällä hetkellä ei saatavilla

Mallilla ei ole vahvistettua hintaa tai se on poistettu käytöstä; API-kutsut hylätään.

06

Tekniset tiedot

Mallin tunnus
qwen2-vl-72b-instruct
Kehittäjä
Alibaba / Qwen
Kategoria
Multimodaali
Syöte
Teksti, Kuva, Video
Tuloste
Teksti
Konteksti-ikkuna
32 768 tokenia
Enimmäistuloste
8 192 tokenia
Mallin koko
72B (~73B with vision encoder)
Lisenssi
Qwen Licence (commercial use permitted under 100M MAU; bespoke licence required above).
Luettelokirjaus päivitetty
25. kesäkuuta 2026

Tunnisteet

  • qwen
  • alibaba
  • multimodal
  • vision
  • open-weights
  • video-understanding
  • pricing-tbd
07

Käyttötapaukset

Mihin sitä käytetään

  • Open-weights document AI for multilingual OCR
  • Video question answering up to 20 minutes
  • Chart and diagram understanding for analytics
  • Chinese / Japanese / Korean OCR-heavy workloads
  • Multimodal AI assistants in Chinese cloud regions
08

Usein kysytyt kysymykset

Mikä on Qwen2-VL-72B Instruct?

Qwen2-VL-72B Instruct on Alibaba / Qwenn kehittämä malli Multimodaali-kategoriassa. Se on listattu Railwailissa, mutta sitä ei voi tällä hetkellä suorittaa.

Paljonko Qwen2-VL-72B Instruct maksaa Railwailissa?

Qwen2-VL-72B Instructta ei voi tällä hetkellä suorittaa Railwailissa, joten nykyistä hintaa ei ole. Saatavilla olevat vaihtoehdot hintojen kanssa on lueteltu tämän sivun alempana.

Mikä on Qwen2-VL-72B Instructn kontekstiikkuna?

Qwen2-VL-72B Instructn kontekstiikkuna sisältää 32 768 tokenia. Vastaus voi olla enintään 8 192 tokenia pitkä.

Kuinka nopea Qwen2-VL-72B Instruct on?

Qwen2-VL-72B Instructlla ei ole vielä tarpeeksi mitattuja suorituksia Railwailissa suoritusajan ilmoittamiseksi. Se riippuu syötteestä, asetuksista ja palveluntarjoajan kuormituksesta.

Onko Qwen2-VL-72B Instruct parempi kuin BLIP?

Se riippuu tehtävästä. Qwen2-VL-72B Instruct (Alibaba / Qwen) ja BLIP (Salesforce) ovat molemmat malleja Multimodaali-kategoriassa. Vertailussa näkyvät niiden hinnat ja tekniset tiedot rinnakkain.

Vertaa Qwen2-VL-72B Instruct ja BLIP

Voiko Qwen2-VL-72B Instruct käsitellä kuvia?

Kyllä. Qwen2-VL-72B Instruct hyväksyy kuvia syötteenä tekstin lisäksi.

Voiko Qwen2-VL-72B Instructa käyttää juuri nyt?

Ei tällä hetkellä saatavilla: tämä malli on poistettu käytöstä. Sivu pysyy verkossa; saatavilla olevat vaihtoehdot samasta kategoriasta on lueteltu alempana.

Kaikki mallit yhden API:n kautta

Yksi API-avain kaikille Railwailin malleille. Käyttö laskutetaan prepaid-krediiteistä, 1 krediitti = 0,01 $.