Qwen2-VL 7B Instruct

MultimodalDisponível
por CommunityID do modelo: qwen2-vl-7b-instruct-rep

Alibaba Qwen2-VL 7B served on Replicate. Open-weights vision-language model that chats about images and video, with dynamic resolution and strong OCR and document QA for its size.

Preço
≈ US$ 0,0024/execução
Entrada → Saída
Texto + Imagem + Vídeo → Texto
Desenvolvedor
Community
Atualizado
23 de setembro de 2026
01

Playground

Experimentar Qwen2-VL 7B Instruct

Entrada & saída

≈ US$ 0,0024/execução
Experimentar Qwen2-VL 7B Instruct

0 / 16.000

Configurações avançadas (2)
Resultado
A resposta aparece aqui.

Esta execução

cerca de US$ 0,0024 · 0,24 créditos

US$ 0,0072 (0,72 créditos) são reservados no início; o tempo real de GPU é cobrado.

Novo por aqui?

10 créditos grátis (US$ 0,10) ao se inscrever com Google

Utilizável 24 horas após inscrição, até 5 execuções por dia e no máximo 2 créditos por execução. Outros métodos de login começam sem créditos. Suficiente para 13 execuções deste modelo.

02

Examples

Real outputs from the public examples of this model on Replicate, with the prompt and settings that produced them. They were not generated live on this page.
  • Prompt

    Describe this video in detail.

    Response

    The video features a monkey riding a skateboard in a park. The monkey is wearing roller skates and is seen moving forward on the skateboard, with its arms outstretched for balance. The park is filled with people sitting on benches and walking around, enjoying the sunny day. The monkey appears to be enjoying itself, and the scene is filled with a sense of fun and playfulness. The park is surrounded by trees and greenery, creating a peaceful and relaxing atmosphere. Overall, the video captures a unique and entertaining moment of a monkey enjoying a day out in the park on roller skates.

  • Prompt

    Describe this in detail.

    Response

    The image shows a half of an avocado on the left side, with a pit visible inside. On the right side, there is a stylized letter "A" in a bold, uppercase font. The avocado and the letter "A" are separated by a white arrow pointing from the avocado to the letter "A," indicating a transformation or relationship between the two. The background is a light beige color.

  • Prompt

    Describe this in detail.

    Response

    The image depicts a dog, specifically a Golden Retriever, enjoying a slice of watermelon. The dog is positioned on the left side of the frame, with its head lowered towards the watermelon. The watermelon is placed on a wooden table, and the dog appears to be biting into the fruit, indicating it is eating it. The background is blurred, suggesting a natural outdoor setting with greenery. The overall scene conveys a sense of relaxation and enjoyment.

03

Sobre Qwen2-VL 7B Instruct

ResumoA partir de 23 de setembro de 2026

Qwen2-VL 7B Instruct é um modelo de Community na categoria Multimodal. No Railwail, Qwen2-VL 7B Instruct custa ≈ US$ 0,0024 por execução.

Qwen2-VL 7B Instruct is Alibaba's open-weights vision-language model packaged as a Replicate endpoint. It accepts an image (or video) plus a text prompt and answers questions, describes scenes, reads text in images and extracts structured data. Naive dynamic resolution and M-RoPE let it handle varied aspect ratios and longer visual inputs. A good self-hostable alternative to hosted VLMs for OCR and document tasks.
04

Preços

Preços em dólares americanos. O uso é cobrado a partir de créditos pré-pagos.
Execução típica (≈ 2 s em L40S)US$ 0,0024 por execução
Tempo de GPU (L40S)US$ 0,00117 por segundo de GPU
  • Faturado pelo tempo de GPU que a execução realmente leva. Quando a execução começa, 3× o preço típico é reservado do seu saldo e liquidado depois.
  • 1 crédito = US$ 0,01

Calculadora de custos

Calculadora de preços

s

Típico conforme o provedor: cerca de 2,1 s

Total

US$ 0,24

24 créditos

Por execução

US$ 0,0024 · 0,24 créditos

Faturado pelo tempo real de GPU; este é uma estimativa.

05

API

Chame Qwen2-VL 7B Instruct com sua chave de API Railwail. Use este ID de modelo na solicitação:

Nenhum exemplo de API verificado

A API pública passa um formato de entrada diferente do que este modelo precisa. Use o playground acima.

06

Especificações

ID do modelo
qwen2-vl-7b-instruct-rep
Desenvolvedor
Community
Categoria
Multimodal
Entrada
Texto, Imagem, Vídeo
Saída
Texto
Faturamento
Por uso (tokens ou tempo de GPU)
Entrada do catálogo atualizada
23 de setembro de 2026

Parâmetros de entrada

Entradas e configurações do esquema de entrada do modelo. O exemplo na seção API mostra quais delas a API aceita.

  • promptobrigatório

    Question about the image or video

    Tipo: Texto
    Padrão: –
    Valores permitidos: até 16.000 caracteres
  • image_url

    Image or video URL to analyze

    Tipo: Texto
    Padrão: –
    Valores permitidos: –
  • max_tokens
    Tipo: Número inteiro
    Padrão: 1024
    Valores permitidos: 1 a 4.096
  • temperature
    Tipo: Número
    Padrão: 0.7
    Valores permitidos: 0 a 2

Etiquetas

  • replicate
  • qwen
  • alibaba
  • vision-understanding
  • open-weights
  • ocr
07

Perguntas frequentes

O que é Qwen2-VL 7B Instruct?

Qwen2-VL 7B Instruct é um modelo de Community na categoria Multimodal.

Quanto custa Qwen2-VL 7B Instruct no Railwail?

No Railwail, Qwen2-VL 7B Instruct custa ≈ US$ 0,0024 por execução. Você é cobrado pelo que cada solicitação realmente usa. O uso é pago com créditos pré-pagos; 1 crédito equivale a US$ 0,01.

Quais configurações Qwen2-VL 7B Instruct suporta?

De acordo com seu esquema de entrada, Qwen2-VL 7B Instruct conhece estes parâmetros: prompt (até 16.000 caracteres), image_url, max_tokens (1 a 4.096) e temperature (0 a 2).

Qual é a velocidade de Qwen2-VL 7B Instruct?

Ainda não há execuções medidas suficientes de Qwen2-VL 7B Instruct no Railwail para indicar um tempo de execução. Depende da entrada, das configurações e da carga no provedor.

Qwen2-VL 7B Instruct é melhor que BLIP?

Depende da tarefa. Qwen2-VL 7B Instruct (Community) e BLIP (Salesforce) são ambos modelos na categoria Multimodal. A página de comparação mostra seus preços e especificações lado a lado.

Comparar Qwen2-VL 7B Instruct e BLIP

Qwen2-VL 7B Instruct pode processar imagens?

Sim. Qwen2-VL 7B Instruct aceita imagens como entrada além de texto.

08

Modelos comparáveis

Todos nesta categoria
  • BLIPSalesforce

    Salesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.

    ≈ US$ 0,00030/execução

    88 % mais barato por unidade

    Comparar Qwen2-VL 7B Instruct vs. BLIP
  • pharmapsychotic's CLIP Interrogator. Takes an image and produces a Stable-Diffusion-style text prompt by combining BLIP captioning with CLIP to rank likely subjects, artists, mediums and styles. Commonly used to reverse-engineer a prompt from an existing picture.

    ≈ US$ 0,0457/execução

    1.804 % mais caro por unidade

    Comparar Qwen2-VL 7B Instruct vs. CLIP Interrogator
  • Monocular depth-estimation model trained on 595k labeled and 62M unlabeled images. Strong zero-shot generalization in indoor and outdoor scenes.

    ≈ US$ 0,0050/execução

    108 % mais caro por unidade

    Comparar Qwen2-VL 7B Instruct vs. Depth Anything v2

Todos os modelos através de uma API

Uma chave API para todos os modelos no Railwail. O uso é cobrado a partir de créditos pré-pagos, 1 crédito = US$ 0,01.