ViTPose

MultimodalIndisponível
por ReplicateID do modelo: vitpose

ViTPose plain-vision-transformer pose estimator. State-of-the-art keypoint accuracy on MS-COCO with a minimal architecture.

Status
Indisponível
Entrada → Saída
Texto + Imagem → Texto
Desenvolvedor
Replicate
Atualizado
25 de junho de 2026

ViTPose não está disponível no momento

Atualmente indisponível: este modelo foi desativado.

Você ainda pode ler os detalhes nesta página. Escolha uma das alternativas disponíveis abaixo para executar um modelo comparável imediatamente.

Ir para alternativas
01

Modelos comparáveis

Todos nesta categoria
  • BLIPSalesforce

    Salesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.

    ≈ US$ 0,00030/execução

  • Anthropic's April 2026 flagship. 87.6% on SWE-bench Verified, 3x higher image resolution, output self-verification, vision + reasoning.

    US$ 6,00/1M entrada

  • Anthropic's balanced mid-tier model from February 2026. Best price/performance for production workloads: 5x cheaper than Opus, near-flagship quality.

    US$ 3,60/1M entrada

02

Playground

Experimentar ViTPose

Sem formulário de entrada

Indisponível no momento

Atualmente indisponível: este modelo foi desativado.

O playground está desativado. Encontre modelos comparáveis na mesma categoria: Ver alternativas

03

Sobre ViTPose

ResumoA partir de 25 de junho de 2026

ViTPose é um modelo de Replicate na categoria Multimodal. ViTPose não está disponível no Railwail no momento.

04

Preços

Atualmente indisponível: este modelo foi desativado. Não há preço para este modelo no momento, portanto não pode ser executado.

05

API

Chame ViTPose com sua chave de API Railwail. Use este ID de modelo na solicitação:

Nenhum exemplo de API verificado

A API pública passa um formato de entrada diferente do que este modelo precisa. Use o playground acima.

06

Especificações

ID do modelo
vitpose
Desenvolvedor
Replicate
Categoria
Multimodal
Entrada
Texto, Imagem
Saída
Texto
Entrada do catálogo atualizada
25 de junho de 2026

Etiquetas

  • replicate
  • pose
  • vision-understanding
  • transformer
  • open-source
07

Perguntas frequentes

O que é ViTPose?

ViTPose é um modelo de Replicate na categoria Multimodal. Está listado no Railwail, mas não pode ser executado no momento.

Quanto custa ViTPose no Railwail?

ViTPose não pode ser executado no Railwail no momento, portanto não há preço atual. Alternativas disponíveis com preços estão listadas mais abaixo nesta página.

Qual é a velocidade de ViTPose?

Ainda não há execuções medidas suficientes de ViTPose no Railwail para indicar um tempo de execução. Depende da entrada, das configurações e da carga no provedor.

ViTPose é melhor que BLIP?

Depende da tarefa. ViTPose (Replicate) e BLIP (Salesforce) são ambos modelos na categoria Multimodal. A página de comparação mostra seus preços e especificações lado a lado.

Comparar ViTPose e BLIP

ViTPose pode processar imagens?

Sim. ViTPose aceita imagens como entrada além de texto.

Posso usar ViTPose agora?

Atualmente indisponível: este modelo foi desativado. A página permanece online; alternativas disponíveis da mesma categoria estão listadas mais abaixo.

Todos os modelos através de uma API

Uma chave API para todos os modelos no Railwail. O uso é cobrado a partir de créditos pré-pagos, 1 crédito = US$ 0,01.