Los robots Duo y Apollo en la presentación oficial de Gemini Robotics ER 2
Los robots Duo y Apollo en la presentación oficial de Gemini Robotics ER 2Google DeepMind · Blog oficial de Google · CORPORATE_PRESS

Qué cambia con Gemini Robotics ER 2

Gemini Robotics ER 2 es un vision-language model: procesa imágenes y lenguaje para razonar sobre el mundo físico. Su función no es mover un brazo robótico directamente, sino interpretar lo que el robot ve, comunicarse con humanos sobre esa interpretación y planificar secuencias de acciones antes de que otro componente las ejecute.

La capacidad que Google destaca es la planificación de tareas de varios pasos con una duración de varios minutos. Es un dato relevante porque buena parte de los sistemas de robótica actuales operan sobre horizontes de planificación mucho más cortos, y encadenar pasos durante minutos exige mantener contexto y corregir errores sobre la marcha.

El modelo sucede a Gemini Robotics-ER 1.6, cuya documentación técnica se actualizó en diciembre de 2025 y que ya incorporaba entrada de texto, imagen, vídeo y audio, con salida de texto. ER 2 se presenta como la evolución de esa misma línea, no como un producto que arranca de cero.

Una familia de tres modelos, no un lanzamiento aislado

Junto a ER 2, Google DeepMind presentó Gemini Robotics 2 y Gemini Robotics On-Device 2. La nomenclatura separa funciones: ER 2 razona y planifica, mientras que los otros dos parecen orientados a la acción (VLA, vision-language-action) y a la ejecución local en el propio dispositivo sin depender de conexión a la nube.

Esa división por capas —razonamiento, acción, ejecución on-device— es la misma lógica que ya se ve en otros desarrollos de IA aplicada a hardware: separar el modelo que decide del modelo que ejecuta permite actualizar cada pieza a ritmos distintos y desplegar la parte más ligera en el propio robot, donde la latencia importa más que la potencia de cómputo.

Acceso desigual: quién puede probarlo ya

ER 2 está disponible en Google AI Studio, la plataforma donde desarrolladores externos pueden probar modelos de Google sin acuerdos comerciales previos. También está en private preview dentro de la Gemini Enterprise Agent Platform, lo que apunta a un uso corporativo controlado antes de una apertura más amplia.

Los modelos VLA y on-device, en cambio, solo se ofrecen a early-access partners. Es decir, las piezas que efectivamente mueven un robot físico siguen restringidas a un grupo reducido de colaboradores, mientras que el componente de razonamiento —el que interpreta y planifica— ya es accesible para cualquiera con una cuenta de AI Studio.

Esta diferencia de acceso importa para calibrar expectativas: quien lea sobre este lanzamiento no podrá, hoy, desplegar un robot completo con la tecnología anunciada. Podrá, sí, experimentar con la capa de razonamiento que la sustenta.

Lo que el anuncio no dice

Google no ha publicado precio, coste de licencia, tarifas de uso ni cifras de inversión asociadas a este lanzamiento. No hay, por tanto, forma de estimar qué modelo de negocio rodeará a esta familia de modelos ni cuánto costará integrarlos en un producto comercial.

Tampoco se han difundido benchmarks comparativos frente a otros sistemas de razonamiento robótico del mercado, ni casos de uso concretos con clientes nombrados más allá de la categoría genérica de 'early-access partners'. La calificación de ER 2 como el modelo 'más capaz' de la compañía es una afirmación de la propia Google, sin verificación independiente disponible.