OpenVLA-7B

Robotique / VLANon disponible
par OtherID du modèle: openvla-7b

Stanford/Berkeley open VLA trained on 970k Open-X-Embodiment episodes. Supports LoRA fine-tuning.

Statut
Non disponible
Entrée → Sortie
Texte + Image → Actions de robot
Développeur
Other
Mis à jour
23 septembre 2026

OpenVLA-7B n'est actuellement pas disponible

Vous pouvez toujours consulter les détails sur cette page. Choisissez l'une des alternatives disponibles ci-dessous pour exécuter immédiatement un modèle comparable.

01

Playground

OpenVLA-7B

Modèle de recherche

Actuellement indisponible

OpenVLA-7B est un modèle de robotique (vision-langage-action) et ne peut pas être exécuté via l'API railwail.

02

À propos de OpenVLA-7B

RésuméAu 23 septembre 2026

OpenVLA-7B est un modèle de Other dans la catégorie Robotique / VLA. OpenVLA-7B n'est actuellement pas disponible sur Railwail.

Arrière-plan

À propos de Stanford / UC Berkeley / Toyota Research Institute

Fondée 2024 · Stanford & Berkeley, California, USA

OpenVLA is the result of an academic-industry consortium led by Moo Jin Kim and colleagues at Stanford, UC Berkeley, and Toyota Research Institute (with contributors from MIT, Google DeepMind and Physical Intelligence). Released in June 2024, it was the first fully open-weights 7-billion-parameter Vision-Language-Action model trained on the Open-X-Embodiment dataset. OpenVLA was designed as a direct, reproducible, and parameter-efficient alternative to Google's closed RT-2 / RT-2-X, with the explicit goal of letting any lab fine-tune a 7B-class VLA on a single A100 / H100. The model, code, training recipe and fine-tuning toolkits (including LoRA) are all released under MIT-style permissive licences. OpenVLA quickly became a standard baseline in academic VLA research and the starting point for many downstream policies (CogACT, π-0-FAST baselines, embodied agent demos).

Visiter Stanford / UC Berkeley / Toyota Research Institute

Architecture

Vision-Language-Action (autoregressive discrete-token VLA)

OpenVLA combines a Llama-2-7B language backbone with a dual visual encoder that concatenates DINOv2 and SigLIP features, fused into the LLM via a Prismatic VLM-style projector. The model treats actions as discretised tokens: each continuous robot action dimension is binned into 256 bins, and the resulting tokens are appended to the LLM's vocabulary. Training is a single autoregressive next-token objective predicting both language and action tokens given image observations and a natural-language instruction. OpenVLA was trained on ~970k demonstration episodes from the Open-X-Embodiment dataset spanning 22+ robot embodiments and used Llama-2-7B as a pretrained text+code backbone, which the authors found markedly improves language grounding compared to scratch-trained VLAs. Parameter-efficient fine-tuning with LoRA is officially supported, making OpenVLA the de-facto open VLA workhorse.

Paramètres
7B

Capacités

  • Fully open-weights 7B Vision-Language-Action model
  • Llama-2-7B backbone with DINOv2 + SigLIP vision
  • Discrete action-token decoding (256 bins per DoF)
  • Trained on ~970k Open-X-Embodiment episodes
  • LoRA fine-tuning officially supported
  • Strong language-grounded manipulation across robots
  • Fits on a single A100 / H100 with quantisation
  • MIT-style permissive licence on weights and code
  • Best for: research, reproducible VLA baselines, fine-tuning on new robots.

Entraînement et licence

~970,000 robot demonstration episodes from the Open-X-Embodiment dataset (RT-X collection), spanning 22+ robot embodiments and a wide range of manipulation tasks. Llama-2-7B and the DINOv2 + SigLIP vision encoders provide web-scale pretraining priors.

Licence: MIT-style permissive licence on code and weights; Llama-2 components subject to Meta's Llama-2 Community Licence. Considered research-friendly open-weights.

Tests de sécurité: OpenVLA is a research artifact - no formal red-teaming. Safety in deployment is left to downstream systems (force limits, workspace constraints, e-stops).

Limitations connues

  • Discrete action tokens can limit smoothness vs diffusion policies
  • Inference latency on 7B is non-trivial for high-frequency control
  • Coverage skewed to Open-X tasks - novel embodiments need fine-tuning
  • Single-image / few-camera setup by default
  • English-only language conditioning
  • Llama-2 licence restrictions still apply to derived weights
03

Tarification

Actuellement indisponible. Il n'y a actuellement pas de prix pour ce modèle, il ne peut donc pas être exécuté.

04

API

Appelez OpenVLA-7B avec votre clé API Railwail. Utilisez cet ID de modèle dans la requête :

Non disponible via l'API

Les modèles de robotique s'exécutent sur du matériel robotique, pas via l'API railwail.

05

Spécifications

ID du modèle
openvla-7b
Développeur
Other
Catégorie
Robotique / VLA
Entrée
Texte, Image
Sortie
Actions de robot
Taille du modèle
7B
Licence
MIT-style permissive licence on code and weights; Llama-2 components subject to Meta's Llama-2 Community Licence. Considered research-friendly open-weights.
Entrée du catalogue mise à jour
23 septembre 2026

Étiquettes

  • stanford
  • berkeley
  • vla
  • robotics
  • research-only
  • open-weights
06

Cas d'usage

À quoi ça sert

  • Open VLA baseline for academic research
  • Fine-tuning to new robots via LoRA
  • Comparative studies vs RT-2 / π-0 / Octo
  • Language-conditioned manipulation research
  • Multi-task generalist policy training
  • Teaching VLA architecture and tokenisation
07

Questions fréquemment posées

Qu'est-ce que OpenVLA-7B ?

OpenVLA-7B est un modèle de Other dans la catégorie Robotique / VLA. Il est répertorié sur Railwail mais ne peut pas être exécuté pour le moment.

Combien coûte OpenVLA-7B sur Railwail ?

OpenVLA-7B ne peut pas être exécuté sur Railwail pour le moment, il n'y a donc pas de prix actuel. Les alternatives disponibles avec leurs prix sont listées plus bas sur cette page.

Quelle est la vitesse de OpenVLA-7B ?

Il n'y a pas encore assez d'exécutions mesurées de OpenVLA-7B sur Railwail pour indiquer un temps d'exécution. Cela dépend de l'entrée, des paramètres et de la charge chez le fournisseur.

Quand utiliser OpenVLA-7B ?

OpenVLA-7B appartient à la catégorie Robotique / VLA. La page de catégorie liste les autres modèles de ce type avec leurs prix.

Tous les modèles : Robotique / VLA

OpenVLA-7B peut-il traiter des images ?

Oui. OpenVLA-7B accepte les images en entrée en plus du texte.

Puis-je utiliser OpenVLA-7B maintenant ?

Actuellement indisponible. La page reste en ligne ; les alternatives disponibles de la même catégorie sont listées plus bas.

Tous les modèles via une seule API

Une clé API pour tous les modèles sur Railwail. L'utilisation est facturée à partir de crédits prépayés, 1 crédit = 0,01 $US.