Qwen2-VL-72B Instruct

MultimodalNo disponible
de Alibaba / QwenID del modelo: qwen2-vl-72b-instruct

Alibaba's 72B vision-language model with M-RoPE and dynamic resolution. Strong document and video understanding.

Estado
No disponible
Contexto
32,768 tokens
Salida máxima
8,192 tokens
Entrada → Salida
Texto + Imagen + Video → Texto
Desarrollador
Alibaba / Qwen
Actualizado
25 de junio de 2026

Qwen2-VL-72B Instruct no está disponible en este momento

Actualmente no disponible: este modelo ha sido desactivado.

Puedes seguir leyendo los detalles en esta página. Elige una de las alternativas disponibles abajo para ejecutar un modelo comparable de inmediato.

Ir a alternativas
01

Modelos comparables

Todos en esta categoría
  • BLIPSalesforce

    Salesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.

    ≈ USD 0.00030/ejecución

  • Anthropic's April 2026 flagship. 87.6% on SWE-bench Verified, 3x higher image resolution, output self-verification, vision + reasoning.

    USD 6.00/1M entrada

  • Anthropic's balanced mid-tier model from February 2026. Best price/performance for production workloads: 5x cheaper than Opus, near-flagship quality.

    USD 3.60/1M entrada

02

Playground

Probar Qwen2-VL-72B Instruct

Chat

No disponible actualmente

Actualmente no disponible: este modelo ha sido desactivado.

El área de pruebas está desactivada. Encuentra modelos comparables en la misma categoría: Explorar alternativas

Probar Qwen2-VL-72B Instruct

Envía un mensaje. La respuesta llega completa cuando el modelo termina (sin transmisión en tiempo real).

Indicación del sistema
Longitud máxima de respuesta (tokens)

Esta ejecución

Sin precio – actualmente no disponible.

¿Nuevo aquí?

5 créditos gratis (USD 0.05) cuando te registras con Google

Utilizable 24 horas después del registro, hasta 5 ejecuciones por día y como máximo 2 créditos por ejecución. Otros métodos de inicio de sesión comienzan sin créditos.

03

Acerca de Qwen2-VL-72B Instruct

ResumenA partir de 25 de junio de 2026

Qwen2-VL-72B Instruct es un modelo de Alibaba / Qwen en la categoría Multimodal. Qwen2-VL-72B Instruct no está disponible en Railwail en este momento. La ventana de contexto contiene 32,768 tokens, y una respuesta puede tener hasta 8,192 tokens.

Fondo

Acerca de Alibaba DAMO Academy (Qwen Team)

Fundado en 2017 · Hangzhou, China

The Qwen (Tongyi Qianwen) team sits inside Alibaba Cloud's DAMO Academy, the company's research arm founded in 2017 in Hangzhou. The team is led by Junyang Lin and Le Hou and counts dozens of researchers across NLP, vision and speech. Qwen has produced one of the most prolific open-source model lines in the world, including Qwen-1.5, Qwen2 (June 2024), Qwen2.5 (September 2024), the Code, Math, Audio and VL (vision-language) families, and the December 2024 release of Qwen2.5-VL. Qwen2-VL launched in August 2024 in 2B, 7B and 72B sizes, all released on Hugging Face and ModelScope; the 72B Instruct variant became one of the top open-weights vision-language models worldwide, frequently matching closed-source peers on OCR-heavy benchmarks like DocVQA and ChartQA. Alibaba offers Qwen models commercially through Alibaba Cloud and Bailian.

Visitar Alibaba DAMO Academy (Qwen Team)

Arquitectura

Decoder-only Transformer with Naive Dynamic Resolution Vision Transformer

Qwen2-VL-72B-Instruct combines the Qwen2 72B decoder-only Transformer with a custom 675M ViT vision encoder using Naive Dynamic Resolution: instead of resizing every image to a fixed grid, the encoder accepts the native resolution and generates a variable number of visual tokens per image. The model also introduces Multimodal Rotary Position Embedding (M-RoPE) that encodes positions in time (for video), height and width separately, enabling single-stream multimodal video understanding. The model supports up to 20 minutes of video input via uniform frame sampling, single-frame image input at variable resolution up to ~16K visual tokens, and a 131,072-token text context window. Training proceeded in three stages: contrastive vision-language pretraining, multimodal pretraining on interleaved image-text and video-text data, and supervised fine-tuning with chain-of-thought multimodal instructions. Weights are released under the Qwen licence (free for commercial use under specific terms).

Parámetros
72B (~73B with vision encoder)
Contexto
131,072 tokens

Capacidades

  • Open-weights 72B vision-language model under permissive Qwen licence
  • Naive Dynamic Resolution: native image aspect ratio without fixed grid
  • Multimodal Rotary Position Embedding (M-RoPE) for joint image and video
  • Up to 20 minutes of video understanding
  • 131K-token text context
  • Top open-weights scores on DocVQA, ChartQA, MathVista, RealWorldQA
  • Strong OCR across English, Chinese, Japanese, Korean and European languages
  • Best for: open-weights document AI, video QA, OCR-heavy multilingual workloads

Entrenamiento y licencia

Multi-stage curriculum: contrastive vision-language pretraining on large web image-text pairs, multimodal pretraining on interleaved image-text and video-text data, supervised fine-tuning on curated chain-of-thought multimodal instructions.

Licencia: Qwen Licence (commercial use permitted under 100M MAU; bespoke licence required above).

Pruebas de seguridad: Alibaba publishes a model card with safety evaluations and integrates Tongyi safety filters in cloud deployments; no separate full red-team report.

Limitaciones conocidas

  • Serving 72B requires multi-GPU infrastructure
  • Video understanding limited to 20 minutes uniform sampling
  • Hallucination on extreme OCR cases
  • Licence has MAU and competing-services restrictions
  • Audio input requires separate Qwen-Audio model
04

Precios

Actualmente no disponible: este modelo ha sido desactivado. No hay precio para este modelo en este momento, por lo que no se puede ejecutar.

05

API

Llama a Qwen2-VL-72B Instruct con tu clave de API de Railwail. Usa este ID de modelo en la solicitud:

Actualmente no disponible

El modelo no tiene un precio verificado o está desactivado; las llamadas a la API se rechazan.

06

Especificaciones

ID del modelo
qwen2-vl-72b-instruct
Desarrollador
Alibaba / Qwen
Categoría
Multimodal
Entrada
Texto, Imagen, Video
Salida
Texto
Ventana de contexto
32,768 tokens
Salida máxima
8,192 tokens
Tamaño del modelo
72B (~73B with vision encoder)
Licencia
Qwen Licence (commercial use permitted under 100M MAU; bespoke licence required above).
Entrada del catálogo actualizada
25 de junio de 2026

Etiquetas

  • qwen
  • alibaba
  • multimodal
  • vision
  • open-weights
  • video-understanding
  • pricing-tbd
07

Casos de uso

Para qué se utiliza

  • Open-weights document AI for multilingual OCR
  • Video question answering up to 20 minutes
  • Chart and diagram understanding for analytics
  • Chinese / Japanese / Korean OCR-heavy workloads
  • Multimodal AI assistants in Chinese cloud regions
08

Preguntas frecuentes

¿Qué es Qwen2-VL-72B Instruct?

Qwen2-VL-72B Instruct es un modelo de Alibaba / Qwen en la categoría Multimodal. Está listado en Railwail pero no se puede ejecutar en este momento.

¿Cuánto cuesta Qwen2-VL-72B Instruct en Railwail?

Qwen2-VL-72B Instruct no se puede ejecutar en Railwail en este momento, por lo que no hay precio actual. Las alternativas disponibles con precios se enumeran más abajo en esta página.

¿Cuál es la ventana de contexto de Qwen2-VL-72B Instruct?

La ventana de contexto de Qwen2-VL-72B Instruct contiene 32,768 tokens. Una respuesta puede tener hasta 8,192 tokens.

¿Qué tan rápido es Qwen2-VL-72B Instruct?

Aún no hay suficientes ejecuciones medidas de Qwen2-VL-72B Instruct en Railwail para indicar un tiempo de ejecución. Depende de la entrada, la configuración y la carga en el proveedor.

¿Es Qwen2-VL-72B Instruct mejor que BLIP?

Eso depende de la tarea. Qwen2-VL-72B Instruct (Alibaba / Qwen) y BLIP (Salesforce) son ambos modelos en la categoría Multimodal. La página de comparación muestra sus precios y especificaciones lado a lado.

Comparar Qwen2-VL-72B Instruct y BLIP

¿Puede Qwen2-VL-72B Instruct procesar imágenes?

Sí. Qwen2-VL-72B Instruct acepta imágenes como entrada además de texto.

¿Puedo usar Qwen2-VL-72B Instruct ahora mismo?

Actualmente no disponible: este modelo ha sido desactivado. La página permanece en línea; las alternativas disponibles de la misma categoría se enumeran más abajo.

Todos los modelos a través de una API

Una clave API para todos los modelos en Railwail. El uso se cobra con créditos prepagados, 1 crédito = USD 0.01.