Gemini Robotics-ER

Robótica / VLAIndisponível
por Google DeepMindID do modelo: gemini-robotics-er

Embodied-reasoning variant of Gemini Robotics. Enhanced 3D spatial reasoning and trajectory planning.

Status
Indisponível
Entrada → Saída
Texto + Imagem → Ações de robô
Desenvolvedor
Google DeepMind
Atualizado
23 de setembro de 2026

Gemini Robotics-ER não está disponível no momento

Você ainda pode ler os detalhes nesta página. Escolha uma das alternativas disponíveis abaixo para executar um modelo comparável imediatamente.

01

Playground

Gemini Robotics-ER

Modelo de pesquisa

Indisponível no momento

Gemini Robotics-ER é um modelo de robótica (vision-language-action) e não pode ser executado através da API railwail.

02

Sobre Gemini Robotics-ER

ResumoA partir de 23 de setembro de 2026

Gemini Robotics-ER é um modelo de Google DeepMind na categoria Robótica / VLA. Gemini Robotics-ER não está disponível no Railwail no momento.

Fundo

Sobre Google DeepMind

Fundado em 2010 · London, UK / Mountain View, USA

Google DeepMind announced Gemini Robotics-ER (Embodied Reasoning) alongside Gemini Robotics in March 2025. While Gemini Robotics is the action-producing VLA, Gemini Robotics-ER is the reasoning-focused sibling: a Vision-Language Model variant of Gemini 2.0 specialised for spatial understanding, 3D grounding, point/box prediction, trajectory planning and code generation for robotics. It is designed to be combined with classical motion planners, low-level controllers or with the Gemini Robotics VLA itself. DeepMind positions Gemini Robotics-ER as a 'reasoning brain' that a robot stack can call with multimodal prompts to decompose tasks, locate objects in 2D / 3D, and emit waypoints or Python control code. As with Gemini Robotics, access is limited to research and partner programs.

Visite Google DeepMind

Arquitetura

Vision-Language Model for Embodied Reasoning (no end-to-end action head)

Gemini Robotics-ER is a fine-tuned variant of Gemini 2.0 specialised for embodied perception and planning rather than direct control. The architecture preserves the multimodal Transformer backbone of Gemini 2.0 (image, video, text, code) but is post-trained on a curated corpus of embodied tasks: object detection in 2D and 3D, point and bounding-box prediction, grasp prediction, motion-trajectory generation, and code-as-policy outputs that call robot APIs. It can accept egocentric robot camera streams and a natural-language task description, then produce structured outputs such as pixel-space points to grasp, 3D coordinates relative to the camera, planning steps, or Python snippets that drive a downstream controller. In combination with the Gemini Robotics VLA, Robotics-ER provides high-level reasoning while the VLA handles closed-loop low-level actions.

Parâmetros
Undisclosed (Gemini 2.0-class)

Capacidades

  • Spatial reasoning over 2D / 3D scenes
  • Point and bounding-box prediction for objects and grasps
  • Trajectory waypoint generation
  • Code-as-policy generation (Python that calls robot APIs)
  • Compositional task planning from natural language
  • Pair with motion planners or with Gemini Robotics VLA
  • Multimodal context: images, video, text, robot state
  • Improved zero-shot performance on embodied QA benchmarks
  • Best for: planning and grounding modules in research robotics stacks.

Treinamento & licença

Gemini 2.0 multimodal pretraining plus embodied post-training on object-detection, 3D grounding, grasp prediction, trajectory planning, and code-generation tasks for robotic control. Draws on Google's internal robot datasets and curated public embodied datasets.

Licença: Research-only / partner access through Google DeepMind. Not publicly downloadable.

Testes de segurança: Covered under Google DeepMind's Frontier Safety Framework and Responsible AI evaluations, with specific embodied-AI red-teaming for physical-harm and unsafe-action scenarios.

Limitações conhecidas

  • No direct low-level action output
  • Requires downstream controller or planner
  • Closed model - no public weights or API
  • Spatial reasoning still imperfect on cluttered scenes
  • Latency too high for tight inner control loops
  • Generalisation depends on prompt and tool stack
03

Preços

Atualmente indisponível. Não há preço para este modelo no momento, portanto não pode ser executado.

04

API

Chame Gemini Robotics-ER com sua chave de API Railwail. Use este ID de modelo na solicitação:

Não disponível via API

Modelos de robótica são executados em hardware de robô, não através da API railwail.

05

Especificações

ID do modelo
gemini-robotics-er
Desenvolvedor
Google DeepMind
Entrada
Texto, Imagem
Saída
Ações de robô
Ciclo de vida
Versão atual
Tamanho do modelo
Undisclosed (Gemini 2.0-class)
Licença
Research-only / partner access through Google DeepMind. Not publicly downloadable.
Entrada do catálogo atualizada
23 de setembro de 2026

Etiquetas

  • google
  • deepmind
  • gemini
  • vla
  • robotics
  • research-only
  • weights-closed
  • embodied-reasoning
06

Casos de uso

Para que é utilizado

  • High-level planner in hierarchical robot stacks
  • Grounding language to 2D / 3D scene primitives
  • Code-as-policy generation for manipulation
  • Embodied QA and instruction parsing
  • Companion to motion planners or VLA controllers
  • Academic embodied-reasoning research
07

Perguntas frequentes

O que é Gemini Robotics-ER?

Gemini Robotics-ER é um modelo de Google DeepMind na categoria Robótica / VLA. Está listado no Railwail, mas não pode ser executado no momento.

Quanto custa Gemini Robotics-ER no Railwail?

Gemini Robotics-ER não pode ser executado no Railwail no momento, portanto não há preço atual. Alternativas disponíveis com preços estão listadas mais abaixo nesta página.

Qual é a velocidade de Gemini Robotics-ER?

Ainda não há execuções medidas suficientes de Gemini Robotics-ER no Railwail para indicar um tempo de execução. Depende da entrada, das configurações e da carga no provedor.

Quando devo usar Gemini Robotics-ER?

Gemini Robotics-ER pertence à categoria Robótica / VLA. A página da categoria lista os outros modelos deste tipo com seus preços.

Todos os modelos: Robótica / VLA

Gemini Robotics-ER pode processar imagens?

Sim. Gemini Robotics-ER aceita imagens como entrada além de texto.

Posso usar Gemini Robotics-ER agora?

Atualmente indisponível. A página permanece online; alternativas disponíveis da mesma categoria estão listadas mais abaixo.

Todos os modelos através de uma API

Uma chave API para todos os modelos no Railwail. O uso é cobrado a partir de créditos pré-pagos, 1 crédito = US$ 0,01.