Qwen2-VL-72B Instruct

MultimodalIndisponível
por Alibaba / QwenID do modelo: qwen2-vl-72b-instruct

Alibaba's 72B vision-language model with M-RoPE and dynamic resolution. Strong document and video understanding.

Status
Indisponível
Contexto
32.768 tokens
Saída máxima
8.192 tokens
Entrada → Saída
Texto + Imagem + Vídeo → Texto
Desenvolvedor
Alibaba / Qwen
Atualizado
25 de junho de 2026

Qwen2-VL-72B Instruct não está disponível no momento

Atualmente indisponível: este modelo foi desativado.

Você ainda pode ler os detalhes nesta página. Escolha uma das alternativas disponíveis abaixo para executar um modelo comparável imediatamente.

Ir para alternativas
01

Modelos comparáveis

Todos nesta categoria
  • BLIPSalesforce

    Salesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.

    ≈ US$ 0,00030/execução

  • Anthropic's April 2026 flagship. 87.6% on SWE-bench Verified, 3x higher image resolution, output self-verification, vision + reasoning.

    US$ 6,00/1M entrada

  • Anthropic's balanced mid-tier model from February 2026. Best price/performance for production workloads: 5x cheaper than Opus, near-flagship quality.

    US$ 3,60/1M entrada

02

Playground

Experimentar Qwen2-VL-72B Instruct

Chat

Indisponível no momento

Atualmente indisponível: este modelo foi desativado.

O playground está desativado. Encontre modelos comparáveis na mesma categoria: Ver alternativas

Experimentar Qwen2-VL-72B Instruct

Envie uma mensagem. A resposta chega completa assim que o modelo termina (sem streaming).

Prompt do sistema
Comprimento máximo da resposta (tokens)

Esta execução

Sem preço – indisponível no momento.

Novo por aqui?

5 créditos grátis (US$ 0,05) ao se inscrever com Google

Utilizável 24 horas após inscrição, até 5 execuções por dia e no máximo 2 créditos por execução. Outros métodos de login começam sem créditos.

03

Sobre Qwen2-VL-72B Instruct

ResumoA partir de 25 de junho de 2026

Qwen2-VL-72B Instruct é um modelo de Alibaba / Qwen na categoria Multimodal. Qwen2-VL-72B Instruct não está disponível no Railwail no momento. A janela de contexto contém 32.768 tokens, e uma resposta pode ter até 8.192 tokens.

Fundo

Sobre Alibaba DAMO Academy (Qwen Team)

Fundado em 2017 · Hangzhou, China

The Qwen (Tongyi Qianwen) team sits inside Alibaba Cloud's DAMO Academy, the company's research arm founded in 2017 in Hangzhou. The team is led by Junyang Lin and Le Hou and counts dozens of researchers across NLP, vision and speech. Qwen has produced one of the most prolific open-source model lines in the world, including Qwen-1.5, Qwen2 (June 2024), Qwen2.5 (September 2024), the Code, Math, Audio and VL (vision-language) families, and the December 2024 release of Qwen2.5-VL. Qwen2-VL launched in August 2024 in 2B, 7B and 72B sizes, all released on Hugging Face and ModelScope; the 72B Instruct variant became one of the top open-weights vision-language models worldwide, frequently matching closed-source peers on OCR-heavy benchmarks like DocVQA and ChartQA. Alibaba offers Qwen models commercially through Alibaba Cloud and Bailian.

Visite Alibaba DAMO Academy (Qwen Team)

Arquitetura

Decoder-only Transformer with Naive Dynamic Resolution Vision Transformer

Qwen2-VL-72B-Instruct combines the Qwen2 72B decoder-only Transformer with a custom 675M ViT vision encoder using Naive Dynamic Resolution: instead of resizing every image to a fixed grid, the encoder accepts the native resolution and generates a variable number of visual tokens per image. The model also introduces Multimodal Rotary Position Embedding (M-RoPE) that encodes positions in time (for video), height and width separately, enabling single-stream multimodal video understanding. The model supports up to 20 minutes of video input via uniform frame sampling, single-frame image input at variable resolution up to ~16K visual tokens, and a 131,072-token text context window. Training proceeded in three stages: contrastive vision-language pretraining, multimodal pretraining on interleaved image-text and video-text data, and supervised fine-tuning with chain-of-thought multimodal instructions. Weights are released under the Qwen licence (free for commercial use under specific terms).

Parâmetros
72B (~73B with vision encoder)
Contexto
131.072 tokens

Capacidades

  • Open-weights 72B vision-language model under permissive Qwen licence
  • Naive Dynamic Resolution: native image aspect ratio without fixed grid
  • Multimodal Rotary Position Embedding (M-RoPE) for joint image and video
  • Up to 20 minutes of video understanding
  • 131K-token text context
  • Top open-weights scores on DocVQA, ChartQA, MathVista, RealWorldQA
  • Strong OCR across English, Chinese, Japanese, Korean and European languages
  • Best for: open-weights document AI, video QA, OCR-heavy multilingual workloads

Treinamento & licença

Multi-stage curriculum: contrastive vision-language pretraining on large web image-text pairs, multimodal pretraining on interleaved image-text and video-text data, supervised fine-tuning on curated chain-of-thought multimodal instructions.

Licença: Qwen Licence (commercial use permitted under 100M MAU; bespoke licence required above).

Testes de segurança: Alibaba publishes a model card with safety evaluations and integrates Tongyi safety filters in cloud deployments; no separate full red-team report.

Limitações conhecidas

  • Serving 72B requires multi-GPU infrastructure
  • Video understanding limited to 20 minutes uniform sampling
  • Hallucination on extreme OCR cases
  • Licence has MAU and competing-services restrictions
  • Audio input requires separate Qwen-Audio model
04

Preços

Atualmente indisponível: este modelo foi desativado. Não há preço para este modelo no momento, portanto não pode ser executado.

05

API

Chame Qwen2-VL-72B Instruct com sua chave de API Railwail. Use este ID de modelo na solicitação:

Indisponível no momento

O modelo não tem preço verificado ou está desativado; chamadas de API são recusadas.

06

Especificações

ID do modelo
qwen2-vl-72b-instruct
Desenvolvedor
Alibaba / Qwen
Categoria
Multimodal
Entrada
Texto, Imagem, Vídeo
Saída
Texto
Janela de contexto
32.768 tokens
Saída máx.
8.192 tokens
Tamanho do modelo
72B (~73B with vision encoder)
Licença
Qwen Licence (commercial use permitted under 100M MAU; bespoke licence required above).
Entrada do catálogo atualizada
25 de junho de 2026

Etiquetas

  • qwen
  • alibaba
  • multimodal
  • vision
  • open-weights
  • video-understanding
  • pricing-tbd
07

Casos de uso

Para que é utilizado

  • Open-weights document AI for multilingual OCR
  • Video question answering up to 20 minutes
  • Chart and diagram understanding for analytics
  • Chinese / Japanese / Korean OCR-heavy workloads
  • Multimodal AI assistants in Chinese cloud regions
08

Perguntas frequentes

O que é Qwen2-VL-72B Instruct?

Qwen2-VL-72B Instruct é um modelo de Alibaba / Qwen na categoria Multimodal. Está listado no Railwail, mas não pode ser executado no momento.

Quanto custa Qwen2-VL-72B Instruct no Railwail?

Qwen2-VL-72B Instruct não pode ser executado no Railwail no momento, portanto não há preço atual. Alternativas disponíveis com preços estão listadas mais abaixo nesta página.

Qual é a janela de contexto de Qwen2-VL-72B Instruct?

A janela de contexto de Qwen2-VL-72B Instruct contém 32.768 tokens. Uma resposta pode ter até 8.192 tokens.

Qual é a velocidade de Qwen2-VL-72B Instruct?

Ainda não há execuções medidas suficientes de Qwen2-VL-72B Instruct no Railwail para indicar um tempo de execução. Depende da entrada, das configurações e da carga no provedor.

Qwen2-VL-72B Instruct é melhor que BLIP?

Depende da tarefa. Qwen2-VL-72B Instruct (Alibaba / Qwen) e BLIP (Salesforce) são ambos modelos na categoria Multimodal. A página de comparação mostra seus preços e especificações lado a lado.

Comparar Qwen2-VL-72B Instruct e BLIP

Qwen2-VL-72B Instruct pode processar imagens?

Sim. Qwen2-VL-72B Instruct aceita imagens como entrada além de texto.

Posso usar Qwen2-VL-72B Instruct agora?

Atualmente indisponível: este modelo foi desativado. A página permanece online; alternativas disponíveis da mesma categoria estão listadas mais abaixo.

Todos os modelos através de uma API

Uma chave API para todos os modelos no Railwail. O uso é cobrado a partir de créditos pré-pagos, 1 crédito = US$ 0,01.