ViTPose
vitposeViTPose plain-vision-transformer pose estimator. State-of-the-art keypoint accuracy on MS-COCO with a minimal architecture.
- Stato
- Non disponibile
- Input → output
- Testo + Immagine → Testo
- Sviluppatore
- Replicate
- Aggiornato
- 25 giugno 2026
ViTPose non è attualmente disponibile
Attualmente non disponibile: questo modello è stato disattivato.
Puoi comunque leggere i dettagli su questa pagina. Scegli una delle alternative disponibili di seguito per eseguire subito un modello comparabile.
Vai alle alternativeModelli comparabili
Tutti in questa categoria- BLIPSalesforce
Salesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.
≈ 0,00030 USD/esecuzione
- Claude Opus 4.7Anthropic
Anthropic's April 2026 flagship. 87.6% on SWE-bench Verified, 3x higher image resolution, output self-verification, vision + reasoning.
6,00Â USD/1M in
- Claude Sonnet 4.6Anthropic
Anthropic's balanced mid-tier model from February 2026. Best price/performance for production workloads: 5x cheaper than Opus, near-flagship quality.
3,60Â USD/1M in
Playground
Prova ViTPose
Nessuna maschera di input
Attualmente non disponibile: questo modello è stato disattivato.
Il playground è disabilitato. Trovi modelli comparabili nella stessa categoria: Visualizza alternative
Informazioni su ViTPose
ViTPose è un modello di Replicate nella categoria Multimodale. ViTPose non è attualmente disponibile su Railwail.
Prezzi
Attualmente non disponibile: questo modello è stato disattivato. Al momento non c'è un prezzo per questo modello, quindi non può essere eseguito.
API
Nessun esempio API verificato
L'API pubblica passa un formato di input diverso da quello richiesto da questo modello. Usa il playground sopra.
Specifiche
- ID modello
vitpose- Sviluppatore
- Replicate
- Categoria
- Multimodale
- Input
- Testo, Immagine
- Output
- Testo
- Voce di catalogo aggiornata
- 25 giugno 2026
Etichette
- replicate
- pose
- vision-understanding
- transformer
- open-source
Domande frequenti
Cos'è ViTPose?
ViTPose è un modello di Replicate nella categoria Multimodale. È elencato su Railwail ma non può essere eseguito al momento.
Quanto costa ViTPose su Railwail?
ViTPose non può essere eseguito su Railwail al momento, quindi non c'è un prezzo attuale. Le alternative disponibili con i prezzi sono elencate più in basso in questa pagina.
Quanto è veloce ViTPose?
Non ci sono ancora abbastanza esecuzioni misurate di ViTPose su Railwail per indicare un tempo di esecuzione. Dipende dall'input, dalle impostazioni e dal carico presso il provider.
ViTPose è migliore di BLIP?
Dipende dall'attività . ViTPose (Replicate) e BLIP (Salesforce) sono entrambi modelli nella categoria Multimodale. La pagina di confronto mostra i loro prezzi e le specifiche affiancati.
Confronta ViTPose e BLIPViTPose può elaborare immagini?
Sì. ViTPose accetta immagini come input oltre al testo.
Posso usare ViTPose adesso?
Attualmente non disponibile: questo modello è stato disattivato. La pagina rimane online; le alternative disponibili della stessa categoria sono elencate più in basso.
Tutti i modelli tramite un'API
Una chiave API per tutti i modelli su Railwail. L'utilizzo viene addebitato da crediti prepagati, 1 credito = 0,01Â USD.