Qwen2-VL-72B Instruct

MultimodalMevcut Değil
Alibaba / Qwen tarafındanModel Kimliği: qwen2-vl-72b-instruct

Alibaba's 72B vision-language model with M-RoPE and dynamic resolution. Strong document and video understanding.

Durum
Mevcut Değil
Bağlam
32.768 token
Maks. Çıkış
8.192 token
Giriş → Çıkış
Metin + Görüntü + Video → Metin
Geliştirici
Alibaba / Qwen
Güncellendi
25 Haziran 2026

Qwen2-VL-72B Instruct şu anda kullanılamıyor

Şu anda kullanılamıyor: bu model devre dışı bırakılmıştır.

Bu sayfadaki ayrıntıları yine de okuyabilirsiniz. Hemen karşılaştırılabilir bir modeli çalıştırmak için aşağıdaki mevcut alternatiflerden birini seçin.

Alternatiflere Git
01

Karşılaştırılabilir modeller

Bu kategorideki tümü
  • BLIPSalesforce

    Salesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.

    ≈ $0,00030/çalıştırma

  • Anthropic's April 2026 flagship. 87.6% on SWE-bench Verified, 3x higher image resolution, output self-verification, vision + reasoning.

    $6,00/1M giriş

  • Anthropic's balanced mid-tier model from February 2026. Best price/performance for production workloads: 5x cheaper than Opus, near-flagship quality.

    $3,60/1M giriş

02

Playground

Qwen2-VL-72B Instruct'ı deneyin

Sohbet

Şu anda kullanılamıyor

Şu anda kullanılamıyor: bu model devre dışı bırakılmıştır.

Oyun alanı devre dışıdır. Aynı kategoride karşılaştırılabilir modeller bulabilirsiniz: Alternatifleri görüntüle

Qwen2-VL-72B Instruct'ı deneyin

Bir mesaj gönderin. Yanıt model işini bitirdikten sonra tamamen gelir (akışsız).

Sistem istemi
Maks. yanıt uzunluğu (token)

Bu çalıştırma

Fiyat yok – şu anda kullanılamıyor.

Yeni misiniz?

Google ile kaydolduğunuzda 5 ücretsiz kredi ($0,05)

Kaydolduktan 24 saat sonra kullanılabilir, günde 5 çalıştırmaya kadar ve çalıştırma başına en fazla 2 kredi. Diğer oturum açma yöntemleri kredi olmadan başlar.

03

Qwen2-VL-72B Instruct Hakkında

Özet25 Haziran 2026 itibariyle

Qwen2-VL-72B Instruct, Alibaba / Qwen tarafından Multimodal kategorisinde geliştirilen bir modeldir. Qwen2-VL-72B Instruct şu anda Railwail üzerinde kullanılamıyor. Kontekst penceresi 32.768 token içerir ve bir yanıt en fazla 8.192 token uzunluğunda olabilir.

Arka plan

Alibaba DAMO Academy (Qwen Team) hakkında

Kuruluş yılı 2017 · Hangzhou, China

The Qwen (Tongyi Qianwen) team sits inside Alibaba Cloud's DAMO Academy, the company's research arm founded in 2017 in Hangzhou. The team is led by Junyang Lin and Le Hou and counts dozens of researchers across NLP, vision and speech. Qwen has produced one of the most prolific open-source model lines in the world, including Qwen-1.5, Qwen2 (June 2024), Qwen2.5 (September 2024), the Code, Math, Audio and VL (vision-language) families, and the December 2024 release of Qwen2.5-VL. Qwen2-VL launched in August 2024 in 2B, 7B and 72B sizes, all released on Hugging Face and ModelScope; the 72B Instruct variant became one of the top open-weights vision-language models worldwide, frequently matching closed-source peers on OCR-heavy benchmarks like DocVQA and ChartQA. Alibaba offers Qwen models commercially through Alibaba Cloud and Bailian.

Alibaba DAMO Academy (Qwen Team) ziyaret edin

Mimari

Decoder-only Transformer with Naive Dynamic Resolution Vision Transformer

Qwen2-VL-72B-Instruct combines the Qwen2 72B decoder-only Transformer with a custom 675M ViT vision encoder using Naive Dynamic Resolution: instead of resizing every image to a fixed grid, the encoder accepts the native resolution and generates a variable number of visual tokens per image. The model also introduces Multimodal Rotary Position Embedding (M-RoPE) that encodes positions in time (for video), height and width separately, enabling single-stream multimodal video understanding. The model supports up to 20 minutes of video input via uniform frame sampling, single-frame image input at variable resolution up to ~16K visual tokens, and a 131,072-token text context window. Training proceeded in three stages: contrastive vision-language pretraining, multimodal pretraining on interleaved image-text and video-text data, and supervised fine-tuning with chain-of-thought multimodal instructions. Weights are released under the Qwen licence (free for commercial use under specific terms).

Parametreler
72B (~73B with vision encoder)
Bağlam
131.072 token

Yetenekler

  • Open-weights 72B vision-language model under permissive Qwen licence
  • Naive Dynamic Resolution: native image aspect ratio without fixed grid
  • Multimodal Rotary Position Embedding (M-RoPE) for joint image and video
  • Up to 20 minutes of video understanding
  • 131K-token text context
  • Top open-weights scores on DocVQA, ChartQA, MathVista, RealWorldQA
  • Strong OCR across English, Chinese, Japanese, Korean and European languages
  • Best for: open-weights document AI, video QA, OCR-heavy multilingual workloads

Eğitim ve lisans

Multi-stage curriculum: contrastive vision-language pretraining on large web image-text pairs, multimodal pretraining on interleaved image-text and video-text data, supervised fine-tuning on curated chain-of-thought multimodal instructions.

Lisans: Qwen Licence (commercial use permitted under 100M MAU; bespoke licence required above).

Güvenlik testleri: Alibaba publishes a model card with safety evaluations and integrates Tongyi safety filters in cloud deployments; no separate full red-team report.

Bilinen sınırlamalar

  • Serving 72B requires multi-GPU infrastructure
  • Video understanding limited to 20 minutes uniform sampling
  • Hallucination on extreme OCR cases
  • Licence has MAU and competing-services restrictions
  • Audio input requires separate Qwen-Audio model
04

Fiyatlandırma

Şu anda kullanılamıyor: bu model devre dışı bırakılmıştır. Bu modelin şu anda bir fiyatı yok, bu nedenle çalıştırılamıyor.

05

API

Qwen2-VL-72B Instruct öğesini Railwail API anahtarınızla çağırın. İstekte bu model kimliğini kullanın:
qwen2-vl-72b-instructAPI BelgeleriAPI Anahtarı Al

Şu anda kullanılamıyor

Modelin doğrulanmış bir fiyatı yok veya devre dışı bırakılmıştır; API çağrıları reddedilir.

06

Özellikler

Model Kimliği
qwen2-vl-72b-instruct
Geliştirici
Alibaba / Qwen
Kategori
Multimodal
Giriş
Metin, Görüntü, Video
Çıkış
Metin
Bağlam penceresi
32.768 token
Maks. çıkış
8.192 token
Model boyutu
72B (~73B with vision encoder)
Lisans
Qwen Licence (commercial use permitted under 100M MAU; bespoke licence required above).
Katalog girişi güncellendi
25 Haziran 2026

Etiketler

  • qwen
  • alibaba
  • multimodal
  • vision
  • open-weights
  • video-understanding
  • pricing-tbd
07

Kullanım Alanları

Nerelerde Kullanılır

  • Open-weights document AI for multilingual OCR
  • Video question answering up to 20 minutes
  • Chart and diagram understanding for analytics
  • Chinese / Japanese / Korean OCR-heavy workloads
  • Multimodal AI assistants in Chinese cloud regions
08

Sık Sorulan Sorular

Qwen2-VL-72B Instruct nedir?

Qwen2-VL-72B Instruct, Alibaba / Qwen tarafından Multimodal kategorisinde oluşturulan bir modeldir. Railwail'de listelenmiştir ancak şu anda çalıştırılamaz.

Qwen2-VL-72B Instruct Railwail'de ne kadar maliyetlidir?

Qwen2-VL-72B Instruct şu anda Railwail'de çalıştırılamaz, bu nedenle mevcut bir fiyat yoktur. Fiyatları olan mevcut alternatifler bu sayfanın aşağısında listelenmiştir.

Qwen2-VL-72B Instruct'nin kontekst penceresi ne kadardır?

Qwen2-VL-72B Instruct'nin kontekst penceresi 32.768 token içerir. Bir yanıt en fazla 8.192 token uzunluğunda olabilir.

Qwen2-VL-72B Instruct ne kadar hızlıdır?

Railwail'de Qwen2-VL-72B Instruct için henüz çalıştırma süresi belirtmek için yeterli ölçülen çalıştırma yoktur. Bu, giriş, ayarlar ve sağlayıcıdaki yüke bağlıdır.

Qwen2-VL-72B Instruct, BLIP'dan daha iyi midir?

Bu göreve bağlıdır. Qwen2-VL-72B Instruct (Alibaba / Qwen) ve BLIP (Salesforce) her ikisi de Multimodal kategorisinde modellerdir. Karşılaştırma sayfası fiyatlarını ve özelliklerini yan yana gösterir.

Qwen2-VL-72B Instruct ve BLIP'ı karşılaştır

Qwen2-VL-72B Instruct görüntüleri işleyebilir mi?

Evet. Qwen2-VL-72B Instruct metne ek olarak giriş olarak görüntüleri kabul eder.

Qwen2-VL-72B Instruct'yi şu anda kullanabilir miyim?

Şu anda kullanılamıyor: bu model devre dışı bırakılmıştır. Sayfa çevrimiçi kalır; aynı kategoriden mevcut alternatifler aşağıda listelenmiştir.

Tüm Modeller Tek Bir API Aracılığıyla

Railwail'deki her model için bir API anahtarı. Kullanım, ön ödemeli kredilerden tahsil edilir, 1 kredi = $0,01.