ViTPose
vitposeViTPose plain-vision-transformer pose estimator. State-of-the-art keypoint accuracy on MS-COCO with a minimal architecture.
- Status
- Nicht verfügbar
- Eingabe → Ausgabe
- Text + Bild → Text
- Entwickler
- Replicate
- Aktualisiert
- 25. Juni 2026
ViTPose ist derzeit nicht verfügbar
Derzeit nicht verfügbar: Dieses Modell ist deaktiviert.
Die Angaben auf dieser Seite kannst du weiter nachlesen. Mit einer der verfügbaren Alternativen unten kannst du sofort ein vergleichbares Modell nutzen.
Zu den AlternativenVergleichbare Modelle
Alle dieser Kategorie- BLIPSalesforce
Salesforce BLIP. Vision-language model for image captioning and visual question answering. Given an image it writes a short natural-language caption, or answers a question about the image when one is supplied. A widely used baseline for automatic captioning.
ca. $ 0,00030/Lauf
- Claude Opus 4.7Anthropic
Anthropic's April 2026 flagship. 87.6% on SWE-bench Verified, 3x higher image resolution, output self-verification, vision + reasoning.
$ 6,00/1 Mio. In
- Claude Sonnet 4.6Anthropic
Anthropic's balanced mid-tier model from February 2026. Best price/performance for production workloads: 5x cheaper than Opus, near-flagship quality.
$ 3,60/1 Mio. In
Playground
ViTPose ausprobieren
Keine Eingabemaske
Derzeit nicht verfügbar: Dieses Modell ist deaktiviert.
Der Playground ist deaktiviert. Vergleichbare Modelle findest du in derselben Kategorie: Alternativen ansehen
Über ViTPose
ViTPose ist ein Modell von Replicate aus der Kategorie Multimodal. Über Railwail ist ViTPose derzeit nicht verfügbar.
Preise
Derzeit nicht verfügbar: Dieses Modell ist deaktiviert. Für dieses Modell gibt es derzeit keinen Preis, deshalb lässt es sich nicht ausführen.
API
Kein geprüftes API-Beispiel
Die öffentliche API übergibt ein anderes Eingabeformat, als dieses Modell braucht. Nutze den Playground oben.
Spezifikationen
- Modell-ID
vitpose- Entwickler
- Replicate
- Kategorie
- Multimodal
- Eingabe
- Text, Bild
- Ausgabe
- Text
- Katalogeintrag aktualisiert
- 25. Juni 2026
Schlagwörter
- replicate
- pose
- vision-understanding
- transformer
- open-source
Häufige Fragen
Was ist ViTPose?
ViTPose ist ein Modell von Replicate aus der Kategorie Multimodal. Es steht im Railwail-Katalog, lässt sich derzeit aber nicht ausführen.
Was kostet ViTPose bei Railwail?
ViTPose lässt sich über Railwail derzeit nicht ausführen, deshalb gibt es keinen aktuellen Preis. Verfügbare Alternativen mit Preisen stehen weiter unten auf dieser Seite.
Wie schnell ist ViTPose?
Für ViTPose gibt es bei Railwail noch zu wenige gemessene Läufe, um eine Laufzeit anzugeben. Sie hängt von der Eingabe, den Einstellungen und der Auslastung beim Anbieter ab.
Ist ViTPose besser als BLIP?
Das hängt von der Aufgabe ab. ViTPose (Replicate) und BLIP (Salesforce) sind beide Modelle aus der Kategorie Multimodal. Die Vergleichsseite zeigt Preise und Spezifikationen nebeneinander.
ViTPose und BLIP vergleichenKann ViTPose Bilder verarbeiten?
Ja. ViTPose nimmt neben Text auch Bilder als Eingabe an.
Kann ich ViTPose gerade nutzen?
Derzeit nicht verfügbar: Dieses Modell ist deaktiviert. Die Seite bleibt online; verfügbare Alternativen aus derselben Kategorie stehen weiter unten.
Alle Modelle über eine API
Ein API-Schlüssel für alle Modelle auf Railwail. Abgerechnet wird über vorab gekaufte Credits, 1 Credit = $ 0,01.