ViTPose

MultimodalNo disponible
de ReplicateID del modelo: vitpose

ViTPose plain-vision-transformer pose estimator. State-of-the-art keypoint accuracy on MS-COCO with a minimal architecture.

Estado
No disponible
Entrada → Salida
Texto + Imagen → Texto
Desarrollador
Replicate
Actualizado
25 de junio de 2026

ViTPose no está disponible en este momento

Actualmente no disponible: este modelo ha sido desactivado.

Puedes seguir leyendo los detalles en esta página. Elige una de las alternativas disponibles abajo para ejecutar un modelo comparable de inmediato.

Ir a alternativas
01

Modelos comparables

Todos en esta categoría
  • BLIPSalesforce

    Salesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.

    ≈ USD 0.00030/ejecución

  • Anthropic's April 2026 flagship. 87.6% on SWE-bench Verified, 3x higher image resolution, output self-verification, vision + reasoning.

    USD 6.00/1M entrada

  • Anthropic's balanced mid-tier model from February 2026. Best price/performance for production workloads: 5x cheaper than Opus, near-flagship quality.

    USD 3.60/1M entrada

02

Playground

Probar ViTPose

Sin formulario de entrada

No disponible actualmente

Actualmente no disponible: este modelo ha sido desactivado.

El área de pruebas está desactivada. Encuentra modelos comparables en la misma categoría: Explorar alternativas

03

Acerca de ViTPose

ResumenA partir de 25 de junio de 2026

ViTPose es un modelo de Replicate en la categoría Multimodal. ViTPose no está disponible en Railwail en este momento.

04

Precios

Actualmente no disponible: este modelo ha sido desactivado. No hay precio para este modelo en este momento, por lo que no se puede ejecutar.

05

API

Llama a ViTPose con tu clave de API de Railwail. Usa este ID de modelo en la solicitud:

Sin ejemplo de API verificado

La API pública pasa un formato de entrada diferente al que necesita este modelo. Usa el playground anterior.

06

Especificaciones

ID del modelo
vitpose
Desarrollador
Replicate
Categoría
Multimodal
Entrada
Texto, Imagen
Salida
Texto
Entrada del catálogo actualizada
25 de junio de 2026

Etiquetas

  • replicate
  • pose
  • vision-understanding
  • transformer
  • open-source
07

Preguntas frecuentes

¿Qué es ViTPose?

ViTPose es un modelo de Replicate en la categoría Multimodal. Está listado en Railwail pero no se puede ejecutar en este momento.

¿Cuánto cuesta ViTPose en Railwail?

ViTPose no se puede ejecutar en Railwail en este momento, por lo que no hay precio actual. Las alternativas disponibles con precios se enumeran más abajo en esta página.

¿Qué tan rápido es ViTPose?

Aún no hay suficientes ejecuciones medidas de ViTPose en Railwail para indicar un tiempo de ejecución. Depende de la entrada, la configuración y la carga en el proveedor.

¿Es ViTPose mejor que BLIP?

Eso depende de la tarea. ViTPose (Replicate) y BLIP (Salesforce) son ambos modelos en la categoría Multimodal. La página de comparación muestra sus precios y especificaciones lado a lado.

Comparar ViTPose y BLIP

¿Puede ViTPose procesar imágenes?

Sí. ViTPose acepta imágenes como entrada además de texto.

¿Puedo usar ViTPose ahora mismo?

Actualmente no disponible: este modelo ha sido desactivado. La página permanece en línea; las alternativas disponibles de la misma categoría se enumeran más abajo.

Todos los modelos a través de una API

Una clave API para todos los modelos en Railwail. El uso se cobra con créditos prepagados, 1 crédito = USD 0.01.