El modelo de inteligencia artificial fue diseñado para funcionar como el “cerebro” de los robots, dándoles la capacidad de interpretar lo que ocurre a su alrededor, razonar qué deben hacer y convertir esas instrucciones en acciones físicas.
A diferencia de un modelo pensado únicamente para generar texto o imágenes, Gemini Robotics ER 2 está diseñado para razonar sobre el mundo físico. La propuesta busca que los robots puedan comprender instrucciones, analizar lo que ocurre a su alrededor y tomar decisiones para completar tareas de manera más autónoma.
La actualización ya se encuentra disponible para desarrolladores a través de la API de Gemini, Google AI Studio y en versión preliminar privada en Gemini Enterprise Agent Platform.
Un “cerebro” para comprender y planificar tareas
Gemini Robotics ER 2 está diseñado para asumir el razonamiento de alto nivel dentro de un sistema robótico. El modelo puede procesar información visual, comprender relaciones espaciales y utilizar diferentes herramientas para determinar cómo abordar una tarea.

Una de sus capacidades es dividir instrucciones complejas en una serie de acciones y supervisar el progreso mientras el robot las ejecuta. Esto permite que el sistema no solo responda a una orden puntual, sino que pueda analizar una situación y decidir qué debe suceder a continuación.
Google también destaca su capacidad para trabajar con video, lo que permite al modelo analizar secuencias de acciones y comprender cómo cambia un entorno con el paso del tiempo. A esto se suma la posibilidad de coordinar varios robots para completar tareas que requieren colaboración.
De la planificación a la acción física
Aunque Gemini Robotics ER 2 funciona como la capa de razonamiento, no es el encargado directo de controlar cada movimiento físico del robot. El modelo puede determinar qué debe hacerse y luego comunicarse con sistemas especializados que traducen esas decisiones en acciones concretas.

Google plantea esta arquitectura como una forma de conectar modelos de inteligencia artificial con distintos tipos de robots y tareas. Así, un mismo modelo de razonamiento puede encargarse de comprender una instrucción y planificarla, mientras otros sistemas se ocupan de ejecutar los movimientos necesarios.
Con Gemini Robotics ER 2, Google DeepMind busca avanzar hacia robots capaces de desenvolverse en entornos físicos menos predecibles, comprender instrucciones más complejas y colaborar tanto con personas como con otros robots.







