Qwen2-VL-72B Instruct

MultimodalNon disponible
par Alibaba / QwenID du modèle: qwen2-vl-72b-instruct

Alibaba's 72B vision-language model with M-RoPE and dynamic resolution. Strong document and video understanding.

Statut
Non disponible
Contexte
32 768 tokens
Max. sortie
8192 tokens
Entrée → Sortie
Texte + Image + Vidéo → Texte
Développeur
Alibaba / Qwen
Mis à jour
25 juin 2026

Qwen2-VL-72B Instruct n'est actuellement pas disponible

Actuellement indisponible : ce modèle a été désactivé.

Vous pouvez toujours consulter les détails sur cette page. Choisissez l'une des alternatives disponibles ci-dessous pour exécuter immédiatement un modèle comparable.

Voir les alternatives
01

Modèles comparables

Tous dans cette catégorie
  • BLIPSalesforce

    Salesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.

    ≈ 0,00030 $US/exécution

  • Anthropic's April 2026 flagship. 87.6% on SWE-bench Verified, 3x higher image resolution, output self-verification, vision + reasoning.

    6,00 $US/1M entrée

  • Anthropic's balanced mid-tier model from February 2026. Best price/performance for production workloads: 5x cheaper than Opus, near-flagship quality.

    3,60 $US/1M entrée

02

Playground

Essayer Qwen2-VL-72B Instruct

Chat

Actuellement indisponible

Actuellement indisponible : ce modèle a été désactivé.

Le terrain de jeu est désactivé. Vous pouvez trouver des modèles comparables dans la même catégorie : Parcourir les alternatives

Essayer Qwen2-VL-72B Instruct

Envoyez un message. La réponse arrive complète une fois que le modèle a terminé (sans streaming).

Prompt système
Longueur max. de la réponse (tokens)

Cette exécution

Pas de prix – actuellement indisponible.

Nouveau par ici ?

5 crédits gratuits (0,05 $US) à l'inscription avec Google

Utilisable 24 heures après l'inscription, jusqu'à 5 exécutions par jour et au maximum 2 crédits par exécution. Les autres méthodes de connexion commencent sans crédits.

03

À propos de Qwen2-VL-72B Instruct

RésuméAu 25 juin 2026

Qwen2-VL-72B Instruct est un modèle de Alibaba / Qwen dans la catégorie Multimodal. Qwen2-VL-72B Instruct n'est actuellement pas disponible sur Railwail. La fenêtre de contexte contient 32 768 tokens, et une réponse peut faire jusqu'à 8192 tokens.

Arrière-plan

À propos de Alibaba DAMO Academy (Qwen Team)

Fondée 2017 · Hangzhou, China

The Qwen (Tongyi Qianwen) team sits inside Alibaba Cloud's DAMO Academy, the company's research arm founded in 2017 in Hangzhou. The team is led by Junyang Lin and Le Hou and counts dozens of researchers across NLP, vision and speech. Qwen has produced one of the most prolific open-source model lines in the world, including Qwen-1.5, Qwen2 (June 2024), Qwen2.5 (September 2024), the Code, Math, Audio and VL (vision-language) families, and the December 2024 release of Qwen2.5-VL. Qwen2-VL launched in August 2024 in 2B, 7B and 72B sizes, all released on Hugging Face and ModelScope; the 72B Instruct variant became one of the top open-weights vision-language models worldwide, frequently matching closed-source peers on OCR-heavy benchmarks like DocVQA and ChartQA. Alibaba offers Qwen models commercially through Alibaba Cloud and Bailian.

Visiter Alibaba DAMO Academy (Qwen Team)

Architecture

Decoder-only Transformer with Naive Dynamic Resolution Vision Transformer

Qwen2-VL-72B-Instruct combines the Qwen2 72B decoder-only Transformer with a custom 675M ViT vision encoder using Naive Dynamic Resolution: instead of resizing every image to a fixed grid, the encoder accepts the native resolution and generates a variable number of visual tokens per image. The model also introduces Multimodal Rotary Position Embedding (M-RoPE) that encodes positions in time (for video), height and width separately, enabling single-stream multimodal video understanding. The model supports up to 20 minutes of video input via uniform frame sampling, single-frame image input at variable resolution up to ~16K visual tokens, and a 131,072-token text context window. Training proceeded in three stages: contrastive vision-language pretraining, multimodal pretraining on interleaved image-text and video-text data, and supervised fine-tuning with chain-of-thought multimodal instructions. Weights are released under the Qwen licence (free for commercial use under specific terms).

Paramètres
72B (~73B with vision encoder)
Contexte
131 072 tokens

Capacités

  • Open-weights 72B vision-language model under permissive Qwen licence
  • Naive Dynamic Resolution: native image aspect ratio without fixed grid
  • Multimodal Rotary Position Embedding (M-RoPE) for joint image and video
  • Up to 20 minutes of video understanding
  • 131K-token text context
  • Top open-weights scores on DocVQA, ChartQA, MathVista, RealWorldQA
  • Strong OCR across English, Chinese, Japanese, Korean and European languages
  • Best for: open-weights document AI, video QA, OCR-heavy multilingual workloads

Entraînement et licence

Multi-stage curriculum: contrastive vision-language pretraining on large web image-text pairs, multimodal pretraining on interleaved image-text and video-text data, supervised fine-tuning on curated chain-of-thought multimodal instructions.

Licence: Qwen Licence (commercial use permitted under 100M MAU; bespoke licence required above).

Tests de sécurité: Alibaba publishes a model card with safety evaluations and integrates Tongyi safety filters in cloud deployments; no separate full red-team report.

Limitations connues

  • Serving 72B requires multi-GPU infrastructure
  • Video understanding limited to 20 minutes uniform sampling
  • Hallucination on extreme OCR cases
  • Licence has MAU and competing-services restrictions
  • Audio input requires separate Qwen-Audio model
04

Tarification

Actuellement indisponible : ce modèle a été désactivé. Il n'y a pas de prix pour ce modèle pour le moment, il ne peut donc pas être exécuté.

05

API

Appelez Qwen2-VL-72B Instruct avec votre clé API Railwail. Utilisez cet ID de modèle dans la requête :

Actuellement indisponible

Le modèle n'a pas de prix vérifié ou est désactivé ; les appels API sont refusés.

06

Spécifications

ID du modèle
qwen2-vl-72b-instruct
Développeur
Alibaba / Qwen
Catégorie
Multimodal
Entrée
Texte, Image, Vidéo
Sortie
Texte
Fenêtre de contexte
32 768 tokens
Sortie max.
8192 tokens
Taille du modèle
72B (~73B with vision encoder)
Licence
Qwen Licence (commercial use permitted under 100M MAU; bespoke licence required above).
Entrée du catalogue mise à jour
25 juin 2026

Étiquettes

  • qwen
  • alibaba
  • multimodal
  • vision
  • open-weights
  • video-understanding
  • pricing-tbd
07

Cas d'usage

À quoi ça sert

  • Open-weights document AI for multilingual OCR
  • Video question answering up to 20 minutes
  • Chart and diagram understanding for analytics
  • Chinese / Japanese / Korean OCR-heavy workloads
  • Multimodal AI assistants in Chinese cloud regions
08

Questions fréquemment posées

Qu'est-ce que Qwen2-VL-72B Instruct ?

Qwen2-VL-72B Instruct est un modèle de Alibaba / Qwen dans la catégorie Multimodal. Il est listé sur Railwail mais ne peut pas être exécuté pour le moment.

Combien coûte Qwen2-VL-72B Instruct sur Railwail ?

Qwen2-VL-72B Instruct ne peut pas être exécuté sur Railwail pour le moment, il n'y a donc pas de prix actuel. Les alternatives disponibles avec leurs prix sont listées plus bas sur cette page.

Quelle est la fenêtre de contexte de Qwen2-VL-72B Instruct ?

La fenêtre de contexte de Qwen2-VL-72B Instruct contient 32 768 tokens. Une réponse peut faire jusqu'à 8192 tokens.

Quelle est la vitesse de Qwen2-VL-72B Instruct ?

Il n'y a pas encore assez d'exécutions mesurées de Qwen2-VL-72B Instruct sur Railwail pour indiquer un temps d'exécution. Cela dépend de l'entrée, des paramètres et de la charge chez le fournisseur.

Qwen2-VL-72B Instruct est-il meilleur que BLIP ?

Cela dépend de la tâche. Qwen2-VL-72B Instruct (Alibaba / Qwen) et BLIP (Salesforce) sont tous deux des modèles de la catégorie Multimodal. La page de comparaison affiche leurs prix et spécifications côte à côte.

Comparer Qwen2-VL-72B Instruct et BLIP

Qwen2-VL-72B Instruct peut-il traiter des images ?

Oui. Qwen2-VL-72B Instruct accepte les images en entrée en plus du texte.

Puis-je utiliser Qwen2-VL-72B Instruct maintenant ?

Actuellement indisponible : ce modèle a été désactivé. La page reste en ligne ; les alternatives disponibles de la même catégorie sont listées plus bas.

Tous les modèles via une API

Une clé API pour tous les modèles sur Railwail. L'utilisation est facturée à partir de crédits prépayés, 1 crédit = 0,01 $US.