Qwen2-VL-72B Instruct

МультимодальныеНедоступно
от Alibaba / QwenID модели: qwen2-vl-72b-instruct

Alibaba's 72B vision-language model with M-RoPE and dynamic resolution. Strong document and video understanding.

Статус
Недоступно
Контекст
32 768 токенов
Макс. выход
8 192 токенов
Вход → выход
Текст + Изображение + Видео → Текст
Разработчик
Alibaba / Qwen
Обновлено
25 июня 2026 г.

Qwen2-VL-72B Instruct сейчас недоступна

Недоступно: эта модель деактивирована.

Вы можете прочитать подробности на этой странице. Выберите одну из доступных альтернатив ниже, чтобы сразу запустить сравнимую модель.

К альтернативам
01

Сравнимые модели

Все в этой категории
  • BLIPSalesforce

    Salesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.

    ≈ 0,00030 $/запуск

  • Anthropic's April 2026 flagship. 87.6% on SWE-bench Verified, 3x higher image resolution, output self-verification, vision + reasoning.

    6,00 $/1M вход

  • Anthropic's balanced mid-tier model from February 2026. Best price/performance for production workloads: 5x cheaper than Opus, near-flagship quality.

    3,60 $/1M вход

02

Playground

Попробовать Qwen2-VL-72B Instruct

Чат

Сейчас недоступна

Недоступно: эта модель деактивирована.

Playground отключен. Сравнимые модели найдёте в той же категории: Посмотреть альтернативы

Попробовать Qwen2-VL-72B Instruct

Отправьте сообщение. Ответ придёт полностью, когда модель закончит работу (без потоковой передачи).

Системный промпт
Макс. длина ответа (токены)

Этот запуск

Нет цены – сейчас недоступно.

Впервые здесь?

5 бесплатных кредитов (0,05 $) при регистрации через Google

Доступно 24 часов после регистрации, до 5 запусков в день и максимум 2 кредитов за запуск. Другие способы входа начинают без кредитов.

03

О Qwen2-VL-72B Instruct

КороткоПо состоянию на 25 июня 2026 г.

Qwen2-VL-72B Instruct — это модель от Alibaba / Qwen в категории Мультимодальные. Qwen2-VL-72B Instruct сейчас недоступна на Railwail. Контекстное окно содержит 32 768 токенов, ответ может быть до 8 192 токенов.

Фон

О Alibaba DAMO Academy (Qwen Team)

Основана в 2017 · Hangzhou, China

The Qwen (Tongyi Qianwen) team sits inside Alibaba Cloud's DAMO Academy, the company's research arm founded in 2017 in Hangzhou. The team is led by Junyang Lin and Le Hou and counts dozens of researchers across NLP, vision and speech. Qwen has produced one of the most prolific open-source model lines in the world, including Qwen-1.5, Qwen2 (June 2024), Qwen2.5 (September 2024), the Code, Math, Audio and VL (vision-language) families, and the December 2024 release of Qwen2.5-VL. Qwen2-VL launched in August 2024 in 2B, 7B and 72B sizes, all released on Hugging Face and ModelScope; the 72B Instruct variant became one of the top open-weights vision-language models worldwide, frequently matching closed-source peers on OCR-heavy benchmarks like DocVQA and ChartQA. Alibaba offers Qwen models commercially through Alibaba Cloud and Bailian.

Посетить Alibaba DAMO Academy (Qwen Team)

Архитектура

Decoder-only Transformer with Naive Dynamic Resolution Vision Transformer

Qwen2-VL-72B-Instruct combines the Qwen2 72B decoder-only Transformer with a custom 675M ViT vision encoder using Naive Dynamic Resolution: instead of resizing every image to a fixed grid, the encoder accepts the native resolution and generates a variable number of visual tokens per image. The model also introduces Multimodal Rotary Position Embedding (M-RoPE) that encodes positions in time (for video), height and width separately, enabling single-stream multimodal video understanding. The model supports up to 20 minutes of video input via uniform frame sampling, single-frame image input at variable resolution up to ~16K visual tokens, and a 131,072-token text context window. Training proceeded in three stages: contrastive vision-language pretraining, multimodal pretraining on interleaved image-text and video-text data, and supervised fine-tuning with chain-of-thought multimodal instructions. Weights are released under the Qwen licence (free for commercial use under specific terms).

Параметры
72B (~73B with vision encoder)
Контекст
131 072 токенов

Возможности

  • Open-weights 72B vision-language model under permissive Qwen licence
  • Naive Dynamic Resolution: native image aspect ratio without fixed grid
  • Multimodal Rotary Position Embedding (M-RoPE) for joint image and video
  • Up to 20 minutes of video understanding
  • 131K-token text context
  • Top open-weights scores on DocVQA, ChartQA, MathVista, RealWorldQA
  • Strong OCR across English, Chinese, Japanese, Korean and European languages
  • Best for: open-weights document AI, video QA, OCR-heavy multilingual workloads

Обучение и лицензия

Multi-stage curriculum: contrastive vision-language pretraining on large web image-text pairs, multimodal pretraining on interleaved image-text and video-text data, supervised fine-tuning on curated chain-of-thought multimodal instructions.

Лицензия: Qwen Licence (commercial use permitted under 100M MAU; bespoke licence required above).

Тестирование безопасности: Alibaba publishes a model card with safety evaluations and integrates Tongyi safety filters in cloud deployments; no separate full red-team report.

Известные ограничения

  • Serving 72B requires multi-GPU infrastructure
  • Video understanding limited to 20 minutes uniform sampling
  • Hallucination on extreme OCR cases
  • Licence has MAU and competing-services restrictions
  • Audio input requires separate Qwen-Audio model
04

Цены

Недоступно: эта модель деактивирована. На данный момент для этой модели нет цены, поэтому её нельзя запустить.

05

API

Вызовите Qwen2-VL-72B Instruct с помощью вашего API-ключа Railwail. Используйте этот ID модели в запросе:

Временно недоступно

Модель не имеет проверенную цену или деактивирована; вызовы API отклоняются.

06

Спецификации

ID модели
qwen2-vl-72b-instruct
Разработчик
Alibaba / Qwen
Входные данные
Текст, Изображение, Видео
Выходные данные
Текст
Контекстное окно
32 768 токенов
Макс. выходные данные
8 192 токенов
Размер модели
72B (~73B with vision encoder)
Лицензия
Qwen Licence (commercial use permitted under 100M MAU; bespoke licence required above).
Запись в каталоге обновлена
25 июня 2026 г.

Теги

  • qwen
  • alibaba
  • multimodal
  • vision
  • open-weights
  • video-understanding
  • pricing-tbd
07

Применение

Для чего это используется

  • Open-weights document AI for multilingual OCR
  • Video question answering up to 20 minutes
  • Chart and diagram understanding for analytics
  • Chinese / Japanese / Korean OCR-heavy workloads
  • Multimodal AI assistants in Chinese cloud regions
08

Часто задаваемые вопросы

Что такое Qwen2-VL-72B Instruct?

Qwen2-VL-72B Instruct — модель от Alibaba / Qwen в категории Мультимодальные. Модель указана в каталоге Railwail, но сейчас её нельзя запустить.

Сколько стоит Qwen2-VL-72B Instruct на Railwail?

Qwen2-VL-72B Instruct сейчас нельзя запустить на Railwail, поэтому текущей цены нет. Доступные альтернативы с ценами указаны ниже на этой странице.

Какой размер контекстного окна у Qwen2-VL-72B Instruct?

Контекстное окно Qwen2-VL-72B Instruct содержит 32 768 токенов. Ответ может быть до 8 192 токенов.

Насколько быстра Qwen2-VL-72B Instruct?

На Railwail пока недостаточно измеренных запусков Qwen2-VL-72B Instruct, чтобы указать время выполнения. Оно зависит от входных данных, параметров и нагрузки на провайдера.

Qwen2-VL-72B Instruct лучше, чем BLIP?

Это зависит от задачи. Qwen2-VL-72B Instruct (Alibaba / Qwen) и BLIP (Salesforce) — обе модели в категории Мультимодальные. На странице сравнения показаны их цены и характеристики рядом.

Сравнить Qwen2-VL-72B Instruct и BLIP

Может ли Qwen2-VL-72B Instruct обрабатывать изображения?

Да. Qwen2-VL-72B Instruct принимает изображения на входе в дополнение к тексту.

Могу ли я использовать Qwen2-VL-72B Instruct прямо сейчас?

Недоступно: эта модель деактивирована. Страница остаётся в сети; доступные альтернативы из той же категории указаны ниже.

Все модели через один API

Один API-ключ для всех моделей на Railwail. Использование оплачивается из предоплаченных кредитов, 1 кредит = 0,01 $.