Qwen2-VL-72B Instruct

MultimodalΜη διαθέσιμο
από Alibaba / QwenΑναγνωριστικό μοντέλου: qwen2-vl-72b-instruct

Alibaba's 72B vision-language model with M-RoPE and dynamic resolution. Strong document and video understanding.

Κατάσταση
Μη διαθέσιμο
Περιεχόμενο
32,768 tokens
Μέγ. έξοδος
8,192 tokens
Είσοδος → Έξοδος
Κείμενο + Εικόνα + Βίντεο → Κείμενο
Προγραμματιστής
Alibaba / Qwen
Ενημερώθηκε
25 Ιουνίου 2026

Το Qwen2-VL-72B Instruct δεν είναι διαθέσιμο αυτή τη στιγμή

Προς το παρόν μη διαθέσιμο: αυτό το μοντέλο έχει απενεργοποιηθεί.

Μπορείτε να διαβάσετε τις λεπτομέρειες σε αυτήν τη σελίδα. Επιλέξτε μία από τις διαθέσιμες εναλλακτικές λύσεις παρακάτω για να εκτελέσετε αμέσως ένα συγκρίσιμο μοντέλο.

Μετάβαση στις εναλλακτικές λύσεις
01

Συγκρίσιμα μοντέλα

Όλα σε αυτήν την κατηγορία
  • BLIPSalesforce

    Salesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.

    ≈ 0,00030 $/εκτέλεση

  • Anthropic's April 2026 flagship. 87.6% on SWE-bench Verified, 3x higher image resolution, output self-verification, vision + reasoning.

    6,00 $/1M in

  • Anthropic's balanced mid-tier model from February 2026. Best price/performance for production workloads: 5x cheaper than Opus, near-flagship quality.

    3,60 $/1M in

02

Playground

Δοκιμάστε Qwen2-VL-72B Instruct

Συνομιλία

Προς το παρόν μη διαθέσιμο

Προς το παρόν μη διαθέσιμο: αυτό το μοντέλο έχει απενεργοποιηθεί.

Το playground είναι απενεργοποιημένο. Μπορείτε να βρείτε συγκρίσιμα μοντέλα στην ίδια κατηγορία: Περιήγηση εναλλακτικών λύσεων

Δοκιμάστε Qwen2-VL-72B Instruct

Στείλτε ένα μήνυμα. Η απάντηση φτάνει πλήρης όταν το μοντέλο τελειώσει (χωρίς streaming).

System prompt
Μέγ. μήκος απάντησης (tokens)

Αυτή η εκτέλεση

Χωρίς τιμή – προς το παρόν μη διαθέσιμο.

Νέος εδώ;

5 δωρεάν πιστωτικές μονάδες (0,05 $) όταν εγγραφείς με Google

Χρησιμοποιήσιμο 24 ώρες μετά την εγγραφή, έως 5 εκτελέσεις ανά ημέρα και το πολύ 2 πιστωτικές μονάδες ανά εκτέλεση. Άλλες μέθοδοι σύνδεσης ξεκινούν χωρίς πιστωτικές μονάδες.

03

Σχετικά με το Qwen2-VL-72B Instruct

ΣύντομαΗμερομηνία: 25 Ιουνίου 2026

Το Qwen2-VL-72B Instruct είναι ένα μοντέλο του Alibaba / Qwen στην κατηγορία Multimodal. Το Qwen2-VL-72B Instruct δεν είναι διαθέσιμο στο Railwail αυτή τη στιγμή. Το παράθυρο περιεχομένου περιέχει 32,768 tokens, και μια απάντηση μπορεί να είναι έως 8,192 tokens.

Φόντο

Σχετικά με Alibaba DAMO Academy (Qwen Team)

Ιδρύθηκε 2017 · Hangzhou, China

The Qwen (Tongyi Qianwen) team sits inside Alibaba Cloud's DAMO Academy, the company's research arm founded in 2017 in Hangzhou. The team is led by Junyang Lin and Le Hou and counts dozens of researchers across NLP, vision and speech. Qwen has produced one of the most prolific open-source model lines in the world, including Qwen-1.5, Qwen2 (June 2024), Qwen2.5 (September 2024), the Code, Math, Audio and VL (vision-language) families, and the December 2024 release of Qwen2.5-VL. Qwen2-VL launched in August 2024 in 2B, 7B and 72B sizes, all released on Hugging Face and ModelScope; the 72B Instruct variant became one of the top open-weights vision-language models worldwide, frequently matching closed-source peers on OCR-heavy benchmarks like DocVQA and ChartQA. Alibaba offers Qwen models commercially through Alibaba Cloud and Bailian.

Επισκεφθείτε Alibaba DAMO Academy (Qwen Team)

Αρχιτεκτονική

Decoder-only Transformer with Naive Dynamic Resolution Vision Transformer

Qwen2-VL-72B-Instruct combines the Qwen2 72B decoder-only Transformer with a custom 675M ViT vision encoder using Naive Dynamic Resolution: instead of resizing every image to a fixed grid, the encoder accepts the native resolution and generates a variable number of visual tokens per image. The model also introduces Multimodal Rotary Position Embedding (M-RoPE) that encodes positions in time (for video), height and width separately, enabling single-stream multimodal video understanding. The model supports up to 20 minutes of video input via uniform frame sampling, single-frame image input at variable resolution up to ~16K visual tokens, and a 131,072-token text context window. Training proceeded in three stages: contrastive vision-language pretraining, multimodal pretraining on interleaved image-text and video-text data, and supervised fine-tuning with chain-of-thought multimodal instructions. Weights are released under the Qwen licence (free for commercial use under specific terms).

Παράμετροι
72B (~73B with vision encoder)
Περιεχόμενο
131,072 tokens

Δυνατότητες

  • Open-weights 72B vision-language model under permissive Qwen licence
  • Naive Dynamic Resolution: native image aspect ratio without fixed grid
  • Multimodal Rotary Position Embedding (M-RoPE) for joint image and video
  • Up to 20 minutes of video understanding
  • 131K-token text context
  • Top open-weights scores on DocVQA, ChartQA, MathVista, RealWorldQA
  • Strong OCR across English, Chinese, Japanese, Korean and European languages
  • Best for: open-weights document AI, video QA, OCR-heavy multilingual workloads

Εκπαίδευση & άδεια

Multi-stage curriculum: contrastive vision-language pretraining on large web image-text pairs, multimodal pretraining on interleaved image-text and video-text data, supervised fine-tuning on curated chain-of-thought multimodal instructions.

Άδεια: Qwen Licence (commercial use permitted under 100M MAU; bespoke licence required above).

Δοκιμές ασφάλειας: Alibaba publishes a model card with safety evaluations and integrates Tongyi safety filters in cloud deployments; no separate full red-team report.

Γνωστοί περιορισμοί

  • Serving 72B requires multi-GPU infrastructure
  • Video understanding limited to 20 minutes uniform sampling
  • Hallucination on extreme OCR cases
  • Licence has MAU and competing-services restrictions
  • Audio input requires separate Qwen-Audio model
04

Τιμολόγηση

Προς το παρόν μη διαθέσιμο: αυτό το μοντέλο έχει απενεργοποιηθεί. Δεν υπάρχει τιμή για αυτό το μοντέλο αυτή τη στιγμή, επομένως δεν μπορεί να εκτελεστεί.

05

API

Καλέστε το Qwen2-VL-72B Instruct με το κλειδί Railwail API. Χρησιμοποιήστε αυτό το ID μοντέλου στο αίτημα:

Προς το παρόν μη διαθέσιμο

Το μοντέλο δεν έχει επαληθευμένη τιμή ή είναι απενεργοποιημένο· οι κλήσεις API απορρίπτονται.

06

Προδιαγραφές

ID μοντέλου
qwen2-vl-72b-instruct
Ανάπτυξη
Alibaba / Qwen
Κατηγορία
Multimodal
Είσοδος
Κείμενο, Εικόνα, Βίντεο
Έξοδος
Κείμενο
Παράθυρο περιεχομένου
32,768 tokens
Μέγ. έξοδος
8,192 tokens
Μέγεθος μοντέλου
72B (~73B with vision encoder)
Άδεια
Qwen Licence (commercial use permitted under 100M MAU; bespoke licence required above).
Καταχώρηση καταλόγου ενημερώθηκε
25 Ιουνίου 2026

Ετικέτες

  • qwen
  • alibaba
  • multimodal
  • vision
  • open-weights
  • video-understanding
  • pricing-tbd
07

Περιπτώσεις χρήσης

Για τι χρησιμοποιείται

  • Open-weights document AI for multilingual OCR
  • Video question answering up to 20 minutes
  • Chart and diagram understanding for analytics
  • Chinese / Japanese / Korean OCR-heavy workloads
  • Multimodal AI assistants in Chinese cloud regions
08

Συχνές ερωτήσεις

Τι είναι Qwen2-VL-72B Instruct;

Το Qwen2-VL-72B Instruct είναι ένα μοντέλο του Alibaba / Qwen στην κατηγορία Multimodal. Είναι καταχωρημένο στο Railwail αλλά δεν μπορεί να εκτελεστεί αυτή τη στιγμή.

Πόσο κοστίζει το Qwen2-VL-72B Instruct στο Railwail;

Το Qwen2-VL-72B Instruct δεν μπορεί να εκτελεστεί στο Railwail αυτή τη στιγμή, επομένως δεν υπάρχει τρέχουσα τιμή. Διαθέσιμες εναλλακτικές λύσεις με τιμές παρατίθενται παρακάτω σε αυτήν τη σελίδα.

Ποιο είναι το παράθυρο περιεχομένου του Qwen2-VL-72B Instruct;

Το παράθυρο περιεχομένου του Qwen2-VL-72B Instruct περιέχει 32,768 tokens. Μια απάντηση μπορεί να είναι έως 8,192 tokens.

Πόσο γρήγορο είναι το Qwen2-VL-72B Instruct;

Δεν υπάρχουν αρκετές μετρημένες εκτελέσεις του Qwen2-VL-72B Instruct στο Railwail ακόμα για να δηλωθεί ένας χρόνος εκτέλεσης. Εξαρτάται από την είσοδο, τις ρυθμίσεις και το φορτίο στον πάροχο.

Είναι το Qwen2-VL-72B Instruct καλύτερο από το BLIP;

Αυτό εξαρτάται από την εργασία. Το Qwen2-VL-72B Instruct (Alibaba / Qwen) και το BLIP (Salesforce) είναι και τα δύο μοντέλα στην κατηγορία Multimodal. Η σελίδα σύγκρισης δείχνει τις τιμές και τις προδιαγραφές τους παράλληλα.

Σύγκριση Qwen2-VL-72B Instruct και BLIP

Μπορεί το Qwen2-VL-72B Instruct να επεξεργαστεί εικόνες;

Ναι. Το Qwen2-VL-72B Instruct δέχεται εικόνες ως είσοδο εκτός από κείμενο.

Μπορώ να χρησιμοποιήσω το Qwen2-VL-72B Instruct τώρα;

Προς το παρόν μη διαθέσιμο: αυτό το μοντέλο έχει απενεργοποιηθεί. Η σελίδα παραμένει ενεργή· διαθέσιμες εναλλακτικές λύσεις από την ίδια κατηγορία παρατίθενται παρακάτω.

Όλα τα μοντέλα μέσω ενός API

Ένα κλειδί API για κάθε μοντέλο στο Railwail. Η χρήση χρεώνεται από προπληρωμένα πιστωτικά, 1 πιστωτικό = 0,01 $.