Google DeepMind ha presentado Gemini Robotics ER 2, una plataforma que eleva la capacidad de la robótica mediante la comprensión avanzada de video, la orquestación de tareas complejas y la colaboración entre múltiples sistemas. Este avance promete llevar la inteligencia de los modelos de IA directamente al hardware físico, transformando la automatización industrial.
Qué está pasando
Google DeepMind ha anunciado Gemini Robotics ER 2, un sistema diseñado para dotar a los robots de capacidades de comprensión de video de alta fidelidad y una capacidad avanzada de orquestación de tareas. Este nuevo marco permite que los robots no solo ejecuten comandos predefinidos, sino que interpreten entornos complejos a partir de flujos de video. La arquitectura está diseñada para gestionar la colaboración de múltiples robots en un mismo espacio de trabajo, permitiendo tareas que requieren coordinación simultánea y adaptativa.
Por qué importa
El salto de la IA a la robótica física es crucial para la automatización avanzada. La capacidad de comprensión de video permite que los robots operen en entornos no estructurados, como almacenes o fábricas dinámicas, donde la variabilidad del entorno es alta. La orquestación de tareas mejora la eficiencia de los flujos de trabajo complejos, reduciendo la necesidad de programación rígida y permitiendo la adaptación en tiempo real a fallos o cambios en el proceso.
Qué cambia en la práctica
Para los ingenieros y equipos de automatización, esto significa pasar de la programación secuencial a la definición de objetivos de alto nivel. Ahora es posible diseñar escenarios donde múltiples brazos robóticos coordinen acciones complejas, como el manejo de materiales delicados o la construcción en un entorno compartido, basándose únicamente en la observación visual del proceso. La integración de la inteligencia corporal completa (whole body intelligence) potencia la destreza y el manejo de interacciones físicas más naturales.
Qué vigilar
La competencia en robótica de IA está marcada por el desarrollo de modelos de visión y planificación de movimiento. Es clave seguir los avances de otros actores tecnológicos que busquen cerrar la brecha entre el modelo de lenguaje grande (LLM) y la acción física. La evolución se centrará en la robustez en tiempo real y la escalabilidad de la colaboración multi-agente en entornos industriales reales.
Más sobre este tema: IA para vídeo · Automatización con IA

