Octo Base

Robótica / VLANo disponible
de OtherID del modelo: octo-base

Berkeley/Stanford 93M transformer diffusion policy. Pretrained on 800k Open-X-Embodiment episodes.

Estado
No disponible
Entrada → Salida
Texto + Imagen → Acciones de robot
Desarrollador
Other
Actualizado
23 de septiembre de 2026

Octo Base no está disponible en este momento

Puedes seguir leyendo los detalles en esta página. Elige una de las alternativas disponibles abajo para ejecutar un modelo comparable de inmediato.

01

Playground

Octo Base

Modelo de investigación

No disponible actualmente

Octo Base es un modelo de robótica (visión-lenguaje-acción) y no se puede ejecutar a través de la API de railwail.

02

Acerca de Octo Base

ResumenA partir de 23 de septiembre de 2026

Octo Base es un modelo de Other en la categoría Robótica / VLA. Octo Base no está disponible en Railwail en este momento.

Fondo

Acerca de UC Berkeley / Stanford (Octo Model Team)

Fundado en 2023 · Berkeley & Stanford, California, USA

The Octo project is a collaboration of academic labs led by Sergey Levine (UC Berkeley BAIR) and Chelsea Finn (Stanford IRIS), with contributions from CMU, Google DeepMind, and Toyota Research Institute. Octo was first released in May 2024 alongside the Open-X-Embodiment dataset effort, with the goal of producing a generalist, fully open-source robot policy that any researcher can fine-tune on a new robot in hours. Octo introduced the recipe of a transformer policy with a diffusion action head trained on 800k cross-embodiment demonstrations, and it has become a de-facto baseline in academic VLA / generalist-policy research. The team released both Octo-Small (27M) and Octo-Base (93M) under Apache-2.0, alongside code, checkpoints and a fine-tuning toolkit.

Visitar UC Berkeley / Stanford (Octo Model Team)

Arquitectura

Transformer policy with diffusion action head (Vision-Language-Action)

Octo-Base is a transformer-based generalist robot policy. Inputs are tokenised RGB views and a natural-language instruction (encoded with a T5-base text encoder), interleaved with learnable readout tokens. The transformer trunk consumes this sequence and emits action latents that are decoded by a diffusion head producing continuous action chunks (default 4-step lookahead, 7-DoF end-effector deltas). The model was pretrained on roughly 800k demonstrations from 25 datasets in the Open-X-Embodiment collection, covering 9 robots, both single-arm and bimanual setups. Octo is intentionally embodiment-agnostic: action and proprioception spaces are encoded via shared adapters so the same backbone can be fine-tuned to new robots with as little as a few hundred demos. The diffusion head gives smooth, multimodal trajectories that outperform discrete-token VLAs on dexterous tasks at this scale.

Parámetros
93M

Capacidades

  • Generalist VLA policy across many robot embodiments
  • Trained on ~800k demos from Open-X-Embodiment
  • Diffusion action head produces smooth continuous actions
  • Natural-language instruction conditioning (T5 encoder)
  • Multi-view image inputs (primary + wrist cameras)
  • Designed for fast fine-tuning on new robots and tasks
  • Apache-2.0 open weights, code and recipes
  • Strong academic baseline for VLA papers
  • Best for: research, fine-tuning to new embodiments, generalist-policy benchmarks.

Entrenamiento y licencia

~800,000 robot trajectories drawn from 25 Open-X-Embodiment-compatible datasets across 9 robot embodiments (Franka, WidowX, Bridge, RT-1 Everyday Robots, Berkeley UR5, etc.). Trained on TPU v4 / v5 hardware.

Licencia: Apache-2.0 - fully open weights, code, and dataset references. Research-friendly; commercial use permitted under the licence.

Pruebas de seguridad: Octo is a research artifact; no formal red-teaming or RSP. Risks (unsafe robot motions) are mitigated at deployment time by application-specific safety controllers, not by the model itself.

Limitaciones conocidas

  • Modest 93M scale - underperforms 7B+ VLAs on hard generalisation
  • Optimised for 7-DoF end-effector control - bimanual humanoid action spaces need adapters
  • Limited language reasoning relative to LLM-backed VLAs
  • Image resolution capped (256x256)
  • Trained mostly on Western lab data - geographic bias
  • Long-horizon planning requires external prompt decomposition
03

Precios

Actualmente no disponible. No hay precio para este modelo en este momento, por lo que no se puede ejecutar.

04

API

Llama a Octo Base con tu clave de API de Railwail. Usa este ID de modelo en la solicitud:

No disponible a través de la API

Los modelos de robótica se ejecutan en hardware de robot, no a través de la API de railwail.

05

Especificaciones

ID del modelo
octo-base
Desarrollador
Other
Categoría
Robótica / VLA
Entrada
Texto, Imagen
Salida
Acciones de robot
Tamaño del modelo
93M
Licencia
Apache-2.0 - fully open weights, code, and dataset references. Research-friendly; commercial use permitted under the licence.
Entrada del catálogo actualizada
23 de septiembre de 2026

Etiquetas

  • berkeley
  • stanford
  • vla
  • robotics
  • research-only
  • open-weights
  • small
06

Casos de uso

Para qué se utiliza

  • Generalist policy fine-tuning for new robots
  • Academic research and ablations on VLAs
  • Baseline in cross-embodiment robot learning papers
  • Educational / coursework robotics projects
  • Bootstrapping data-efficient manipulation policies
  • Reproducible benchmarks on Open-X-Embodiment
07

Preguntas frecuentes

¿Qué es Octo Base?

Octo Base es un modelo de Other en la categoría Robótica / VLA. Está listado en Railwail pero no se puede ejecutar en este momento.

¿Cuánto cuesta Octo Base en Railwail?

Octo Base no se puede ejecutar en Railwail en este momento, por lo que no hay precio actual. Las alternativas disponibles con precios se enumeran más abajo en esta página.

¿Qué tan rápido es Octo Base?

Aún no hay suficientes ejecuciones medidas de Octo Base en Railwail para indicar un tiempo de ejecución. Depende de la entrada, la configuración y la carga en el proveedor.

¿Cuándo debo usar Octo Base?

Octo Base pertenece a la categoría Robótica / VLA. La página de categoría enumera los otros modelos de este tipo con sus precios.

Todos los modelos: Robótica / VLA

¿Puede Octo Base procesar imágenes?

Sí. Octo Base acepta imágenes como entrada además de texto.

¿Puedo usar Octo Base ahora mismo?

Actualmente no disponible. La página permanece en línea; las alternativas disponibles de la misma categoría se enumeran más abajo.

Todos los modelos a través de una API

Una clave API para todos los modelos en Railwail. El uso se cobra con créditos prepagados, 1 crédito = USD 0.01.