Gemini Robotics-ER

Robotique / VLANon disponible
par Google DeepMindID du modèle: gemini-robotics-er

Embodied-reasoning variant of Gemini Robotics. Enhanced 3D spatial reasoning and trajectory planning.

Statut
Non disponible
Entrée → Sortie
Texte + Image → Actions de robot
Développeur
Google DeepMind
Mis à jour
23 septembre 2026

Gemini Robotics-ER n'est actuellement pas disponible

Vous pouvez toujours consulter les détails sur cette page. Choisissez l'une des alternatives disponibles ci-dessous pour exécuter immédiatement un modèle comparable.

01

Playground

Gemini Robotics-ER

Modèle de recherche

Actuellement indisponible

Gemini Robotics-ER est un modèle de robotique (vision-langage-action) et ne peut pas être exécuté via l'API railwail.

02

À propos de Gemini Robotics-ER

RésuméAu 23 septembre 2026

Gemini Robotics-ER est un modèle de Google DeepMind dans la catégorie Robotique / VLA. Gemini Robotics-ER n'est actuellement pas disponible sur Railwail.

Arrière-plan

À propos de Google DeepMind

Fondée 2010 · London, UK / Mountain View, USA

Google DeepMind announced Gemini Robotics-ER (Embodied Reasoning) alongside Gemini Robotics in March 2025. While Gemini Robotics is the action-producing VLA, Gemini Robotics-ER is the reasoning-focused sibling: a Vision-Language Model variant of Gemini 2.0 specialised for spatial understanding, 3D grounding, point/box prediction, trajectory planning and code generation for robotics. It is designed to be combined with classical motion planners, low-level controllers or with the Gemini Robotics VLA itself. DeepMind positions Gemini Robotics-ER as a 'reasoning brain' that a robot stack can call with multimodal prompts to decompose tasks, locate objects in 2D / 3D, and emit waypoints or Python control code. As with Gemini Robotics, access is limited to research and partner programs.

Visiter Google DeepMind

Architecture

Vision-Language Model for Embodied Reasoning (no end-to-end action head)

Gemini Robotics-ER is a fine-tuned variant of Gemini 2.0 specialised for embodied perception and planning rather than direct control. The architecture preserves the multimodal Transformer backbone of Gemini 2.0 (image, video, text, code) but is post-trained on a curated corpus of embodied tasks: object detection in 2D and 3D, point and bounding-box prediction, grasp prediction, motion-trajectory generation, and code-as-policy outputs that call robot APIs. It can accept egocentric robot camera streams and a natural-language task description, then produce structured outputs such as pixel-space points to grasp, 3D coordinates relative to the camera, planning steps, or Python snippets that drive a downstream controller. In combination with the Gemini Robotics VLA, Robotics-ER provides high-level reasoning while the VLA handles closed-loop low-level actions.

Paramètres
Undisclosed (Gemini 2.0-class)

Capacités

  • Spatial reasoning over 2D / 3D scenes
  • Point and bounding-box prediction for objects and grasps
  • Trajectory waypoint generation
  • Code-as-policy generation (Python that calls robot APIs)
  • Compositional task planning from natural language
  • Pair with motion planners or with Gemini Robotics VLA
  • Multimodal context: images, video, text, robot state
  • Improved zero-shot performance on embodied QA benchmarks
  • Best for: planning and grounding modules in research robotics stacks.

Formation & licence

Gemini 2.0 multimodal pretraining plus embodied post-training on object-detection, 3D grounding, grasp prediction, trajectory planning, and code-generation tasks for robotic control. Draws on Google's internal robot datasets and curated public embodied datasets.

Licence: Research-only / partner access through Google DeepMind. Not publicly downloadable.

Tests de sécurité: Covered under Google DeepMind's Frontier Safety Framework and Responsible AI evaluations, with specific embodied-AI red-teaming for physical-harm and unsafe-action scenarios.

Limitations connues

  • No direct low-level action output
  • Requires downstream controller or planner
  • Closed model - no public weights or API
  • Spatial reasoning still imperfect on cluttered scenes
  • Latency too high for tight inner control loops
  • Generalisation depends on prompt and tool stack
03

Tarification

Actuellement indisponible. Il n'y a actuellement pas de prix pour ce modèle, il ne peut donc pas être exécuté.

04

API

Appelez Gemini Robotics-ER avec votre clé API Railwail. Utilisez cet ID de modèle dans la requête :

Non disponible via l'API

Les modèles de robotique s'exécutent sur du matériel robotique, pas via l'API railwail.

05

Spécifications

ID du modèle
gemini-robotics-er
Développeur
Google DeepMind
Catégorie
Robotique / VLA
Entrée
Texte, Image
Sortie
Actions de robot
Cycle de vie
Version actuelle
Taille du modèle
Undisclosed (Gemini 2.0-class)
Licence
Research-only / partner access through Google DeepMind. Not publicly downloadable.
Entrée du catalogue mise à jour
23 septembre 2026

Étiquettes

  • google
  • deepmind
  • gemini
  • vla
  • robotics
  • research-only
  • weights-closed
  • embodied-reasoning
06

Cas d'usage

À quoi ça sert

  • High-level planner in hierarchical robot stacks
  • Grounding language to 2D / 3D scene primitives
  • Code-as-policy generation for manipulation
  • Embodied QA and instruction parsing
  • Companion to motion planners or VLA controllers
  • Academic embodied-reasoning research
07

Questions fréquemment posées

Qu'est-ce que Gemini Robotics-ER ?

Gemini Robotics-ER est un modèle de Google DeepMind dans la catégorie Robotique / VLA. Il est listé sur Railwail mais ne peut pas être exécuté pour le moment.

Combien coûte Gemini Robotics-ER sur Railwail ?

Gemini Robotics-ER ne peut pas être exécuté sur Railwail pour le moment, il n'y a donc pas de prix actuel. Les alternatives disponibles avec leurs prix sont listées plus bas sur cette page.

Quelle est la vitesse de Gemini Robotics-ER ?

Il n'y a pas encore assez d'exécutions mesurées de Gemini Robotics-ER sur Railwail pour indiquer un temps d'exécution. Cela dépend de l'entrée, des paramètres et de la charge chez le fournisseur.

Quand utiliser Gemini Robotics-ER ?

Gemini Robotics-ER appartient à la catégorie Robotique / VLA. La page de catégorie liste les autres modèles de ce type avec leurs prix.

Tous les modèles : Robotique / VLA

Gemini Robotics-ER peut-il traiter des images ?

Oui. Gemini Robotics-ER accepte les images en entrée en plus du texte.

Puis-je utiliser Gemini Robotics-ER maintenant ?

Actuellement indisponible. La page reste en ligne ; les alternatives disponibles de la même catégorie sont listées plus bas.

Tous les modèles via une API

Une clé API pour tous les modèles sur Railwail. L'utilisation est facturée à partir de crédits prépayés, 1 crédit = 0,01 $US.