ViTPose

MultimodalInte tillgänglig
av ReplicateModell-ID: vitpose

ViTPose plain-vision-transformer pose estimator. State-of-the-art keypoint accuracy on MS-COCO with a minimal architecture.

Status
Inte tillgänglig
Inmatning → utmatning
Text + Bild → Text
Utvecklare
Replicate
Uppdaterad
25 juni 2026

ViTPose är för närvarande otillgänglig

Inte tillgänglig för närvarande: denna modell är inaktiverad.

Du kan fortfarande läsa detaljerna på denna sida. Välj ett av de tillgängliga alternativen nedan för att köra en jämförbar modell direkt.

Gå till alternativ
01

Jämförbara modeller

Alla i denna kategori
  • BLIPSalesforce

    Salesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.

    ≈ 0,00030 US$/körning

  • Anthropic's April 2026 flagship. 87.6% on SWE-bench Verified, 3x higher image resolution, output self-verification, vision + reasoning.

    6,00 US$/1M in

  • Anthropic's balanced mid-tier model from February 2026. Best price/performance for production workloads: 5x cheaper than Opus, near-flagship quality.

    3,60 US$/1M in

02

Playground

Prova ViTPose

Ingen inmatningsformulär

Inte tillgänglig för närvarande

Inte tillgänglig för närvarande: denna modell är inaktiverad.

Lekplatsen är inaktiverad. Du hittar jämförbara modeller i samma kategori: Visa alternativ

03

Om ViTPose

Kort sagtFrån och med 25 juni 2026

ViTPose är en modell av Replicate i kategorin Multimodal. ViTPose är för närvarande inte tillgänglig på Railwail.

04

Priser

Inte tillgänglig för närvarande: denna modell är inaktiverad. Det finns ingen pris för denna modell för närvarande, så den kan inte köras.

05

API

Anropa ViTPose med din Railwail API-nyckel. Använd detta modell-ID i begäran:

Inget verifierat API-exempel

Det offentliga API:et skickar ett annat inmatningsformat än vad denna modell behöver. Använd lekplatsen ovan.

06

Specifikationer

Modell-ID
vitpose
Utvecklare
Replicate
Kategori
Multimodal
Inmatning
Text, Bild
Utmatning
Text
Kataloginlägg uppdaterat
25 juni 2026

Taggar

  • replicate
  • pose
  • vision-understanding
  • transformer
  • open-source
07

Vanliga frågor

Vad är ViTPose?

ViTPose är en modell av Replicate i kategorin Multimodal. Den finns i Railwail-katalogen men kan inte köras för närvarande.

Vad kostar ViTPose på Railwail?

ViTPose kan inte köras på Railwail för närvarande, så det finns inget aktuellt pris. Tillgängliga alternativ med priser visas längre ned på denna sida.

Hur snabb är ViTPose?

Det finns ännu inte tillräckligt många uppmätta körningar av ViTPose på Railwail för att ange en körningstid. Det beror på inmatningen, inställningarna och belastningen hos leverantören.

Är ViTPose bättre än BLIP?

Det beror på uppgiften. ViTPose (Replicate) och BLIP (Salesforce) är båda modeller i kategorin Multimodal. Jämförelsesidan visar deras priser och specifikationer sida vid sida.

Jämför ViTPose och BLIP

Kan ViTPose bearbeta bilder?

Ja. ViTPose accepterar bilder som inmatning utöver text.

Kan jag använda ViTPose just nu?

Inte tillgänglig för närvarande: denna modell är inaktiverad. Sidan förblir online; tillgängliga alternativ från samma kategori visas längre ned.

Alla modeller via ett API

En API-nyckel för alla modeller på Railwail. Användningen debiteras från förbetald kredit, 1 kredit = 0,01 US$.