Gemini Robotics-ER

Robótica / VLANo disponible
de Google DeepMindID del modelo: gemini-robotics-er

Embodied-reasoning variant of Gemini Robotics. Enhanced 3D spatial reasoning and trajectory planning.

Estado
No disponible
Entrada → Salida
Texto + Imagen → Acciones de robot
Desarrollador
Google DeepMind
Actualizado
23 de septiembre de 2026

Gemini Robotics-ER no está disponible actualmente

Puedes seguir leyendo los detalles en esta página. Elige una de las alternativas disponibles abajo para ejecutar un modelo comparable de inmediato.

01

Playground

Gemini Robotics-ER

Modelo de investigación

No disponible actualmente

Gemini Robotics-ER es un modelo de robótica (visión-lenguaje-acción) y no se puede ejecutar a través de la API de railwail.

02

Acerca de Gemini Robotics-ER

ResumenA fecha de 23 de septiembre de 2026

Gemini Robotics-ER es un modelo de Google DeepMind en la categoría Robótica / VLA. Gemini Robotics-ER no está disponible en Railwail en este momento.

Fondo

Acerca de Google DeepMind

Fundado en 2010 · London, UK / Mountain View, USA

Google DeepMind announced Gemini Robotics-ER (Embodied Reasoning) alongside Gemini Robotics in March 2025. While Gemini Robotics is the action-producing VLA, Gemini Robotics-ER is the reasoning-focused sibling: a Vision-Language Model variant of Gemini 2.0 specialised for spatial understanding, 3D grounding, point/box prediction, trajectory planning and code generation for robotics. It is designed to be combined with classical motion planners, low-level controllers or with the Gemini Robotics VLA itself. DeepMind positions Gemini Robotics-ER as a 'reasoning brain' that a robot stack can call with multimodal prompts to decompose tasks, locate objects in 2D / 3D, and emit waypoints or Python control code. As with Gemini Robotics, access is limited to research and partner programs.

Visitar Google DeepMind

Arquitectura

Vision-Language Model for Embodied Reasoning (no end-to-end action head)

Gemini Robotics-ER is a fine-tuned variant of Gemini 2.0 specialised for embodied perception and planning rather than direct control. The architecture preserves the multimodal Transformer backbone of Gemini 2.0 (image, video, text, code) but is post-trained on a curated corpus of embodied tasks: object detection in 2D and 3D, point and bounding-box prediction, grasp prediction, motion-trajectory generation, and code-as-policy outputs that call robot APIs. It can accept egocentric robot camera streams and a natural-language task description, then produce structured outputs such as pixel-space points to grasp, 3D coordinates relative to the camera, planning steps, or Python snippets that drive a downstream controller. In combination with the Gemini Robotics VLA, Robotics-ER provides high-level reasoning while the VLA handles closed-loop low-level actions.

Parámetros
Undisclosed (Gemini 2.0-class)

Capacidades

  • Spatial reasoning over 2D / 3D scenes
  • Point and bounding-box prediction for objects and grasps
  • Trajectory waypoint generation
  • Code-as-policy generation (Python that calls robot APIs)
  • Compositional task planning from natural language
  • Pair with motion planners or with Gemini Robotics VLA
  • Multimodal context: images, video, text, robot state
  • Improved zero-shot performance on embodied QA benchmarks
  • Best for: planning and grounding modules in research robotics stacks.

Entrenamiento y licencia

Gemini 2.0 multimodal pretraining plus embodied post-training on object-detection, 3D grounding, grasp prediction, trajectory planning, and code-generation tasks for robotic control. Draws on Google's internal robot datasets and curated public embodied datasets.

Licencia: Research-only / partner access through Google DeepMind. Not publicly downloadable.

Pruebas de seguridad: Covered under Google DeepMind's Frontier Safety Framework and Responsible AI evaluations, with specific embodied-AI red-teaming for physical-harm and unsafe-action scenarios.

Limitaciones conocidas

  • No direct low-level action output
  • Requires downstream controller or planner
  • Closed model - no public weights or API
  • Spatial reasoning still imperfect on cluttered scenes
  • Latency too high for tight inner control loops
  • Generalisation depends on prompt and tool stack
03

Precios

Actualmente no disponible. No hay precio para este modelo en este momento, por lo que no se puede ejecutar.

04

API

Llama a Gemini Robotics-ER con tu clave API de Railwail. Usa este ID de modelo en la solicitud:

No disponible a través de la API

Los modelos de robótica se ejecutan en hardware de robot, no a través de la API de railwail.

05

Especificaciones

ID del modelo
gemini-robotics-er
Desarrollador
Google DeepMind
Categoría
Robótica / VLA
Entrada
Texto, Imagen
Salida
Acciones de robot
Ciclo de vida
Versión actual
Tamaño del modelo
Undisclosed (Gemini 2.0-class)
Licencia
Research-only / partner access through Google DeepMind. Not publicly downloadable.
Entrada del catálogo actualizada
23 de septiembre de 2026

Etiquetas

  • google
  • deepmind
  • gemini
  • vla
  • robotics
  • research-only
  • weights-closed
  • embodied-reasoning
06

Casos de uso

Para qué se utiliza

  • High-level planner in hierarchical robot stacks
  • Grounding language to 2D / 3D scene primitives
  • Code-as-policy generation for manipulation
  • Embodied QA and instruction parsing
  • Companion to motion planners or VLA controllers
  • Academic embodied-reasoning research
07

Preguntas frecuentes

¿Qué es Gemini Robotics-ER?

Gemini Robotics-ER es un modelo de Google DeepMind en la categoría Robótica / VLA. Aparece en el catálogo de Railwail pero no se puede ejecutar en este momento.

¿Cuánto cuesta Gemini Robotics-ER en Railwail?

Gemini Robotics-ER no se puede ejecutar en Railwail en este momento, por lo que no hay precio actual. Las alternativas disponibles con precios se enumeran más abajo en esta página.

¿Qué velocidad tiene Gemini Robotics-ER?

Aún no hay suficientes ejecuciones medidas de Gemini Robotics-ER en Railwail para indicar un tiempo de ejecución. Depende de la entrada, la configuración y la carga en el proveedor.

¿Cuándo debo usar Gemini Robotics-ER?

Gemini Robotics-ER pertenece a la categoría Robótica / VLA. La página de categoría enumera los otros modelos de este tipo con sus precios.

Todos los modelos: Robótica / VLA

¿Puede Gemini Robotics-ER procesar imágenes?

Sí. Gemini Robotics-ER acepta imágenes como entrada además de texto.

¿Puedo usar Gemini Robotics-ER ahora mismo?

Actualmente no disponible. La página se mantiene en línea; las alternativas disponibles de la misma categoría se enumeran más abajo.

Todos los modelos a través de una API

Una clave API para todos los modelos en Railwail. El uso se cobra desde créditos prepagados, 1 crédito = 0,01 US$.