Noticias IA de ACIAPR

Noticias de inteligencia artificial curadas con contexto, verificadas con fuentes confiables y más...

Noticias IA · Verificadas

Noticias de inteligencia artificial curadas con contexto, verificadas con fuentes confiables y más...

Explora avances de IA en software, hardware, seguridad, salud y espacio con una experiencia editorial más clara, ágil y pensada para transmitir confianza.

Google DeepMind lleva Gemini Robotics 2 a robots con control corporal y colaboración
robotics

Google DeepMind lleva Gemini Robotics 2 a robots con control corporal y colaboración

Google DeepMind lleva Gemini Robotics 2 a robots con control corporal y colaboración

Google DeepMind presentó Gemini Robotics 2, una nueva generación de modelos para robótica que busca mover los sistemas físicos más allá de tareas repetitivas o teleoperadas. La compañía describe el lanzamiento como una capa de inteligencia para robots capaces de razonar sobre movimientos de cuerpo completo, manipular objetos con mayor destreza y coordinarse con otros robots en flujos de trabajo compartidos.

El anuncio fue publicado el 30 de julio por Google DeepMind y acompañado por una demostración en YouTube en la que robots identificados como Apollo y Duo ejecutan tareas de organización y colaboración. La transcripción del video no funciona como una explicación técnica extensa; muestra comandos y respuestas de los robots durante la prueba. Por eso, la base factual principal de esta nota es el anuncio oficial de DeepMind, el blog de Google sobre Gemini Robotics ER 2 y cobertura técnica independiente.

Tres modelos dentro del lanzamiento

DeepMind enmarca Gemini Robotics 2 como una familia de tres modelos. Gemini Robotics 2 es el modelo de visión-lenguaje-acción que convierte instrucciones visuales y de lenguaje en control motor para robots. Según la compañía, puede operar robots humanoides y sistemas de dos brazos, incluyendo tareas que combinan locomoción, postura y manipulación de objetos.

Gemini Robotics ER 2 cumple otro rol: actúa como una capa de razonamiento de alto nivel. Google lo describe como un “cerebro” para aplicaciones robóticas, capaz de entender video en tiempo real, planificar tareas de varios pasos, llamar herramientas como Google Search o funciones definidas por desarrolladores, y pasar la ejecución a modelos de acción de menor nivel. Google afirma que ER 2 está disponible a través de Gemini API, Google AI Studio y, en vista privada, Gemini Enterprise Agent Platform.

El tercer componente es Gemini Robotics On-Device 2, diseñado para correr localmente en el robot. Esa parte es importante porque la robótica no siempre puede depender de latencias de nube: muchas decisiones físicas necesitan respuesta inmediata, continuidad y adaptación al entorno.

Qué mostró Google y qué no prueba todavía

La promesa central es que un robot pueda observar una escena, interpretar una instrucción humana, dividirla en pasos y ajustar el plan si algo sale mal. En sus ejemplos, DeepMind habla de robots que limpian un cuarto desordenado, manipulan herramientas o trabajan juntos para completar una tarea que un solo cuerpo no resolvería tan rápido.

La cobertura técnica de MarkTechPost coincide en que el lanzamiento combina control corporal, destreza y colaboración multi-robot, y destaca que el avance está organizado en modelos con distintos niveles de acceso. Aun así, estas demostraciones no equivalen a robots generalistas listos para operar sin supervisión en hogares, hospitales o fábricas. DeepMind reconoce que la manipulación con múltiples dedos sigue siendo desafiante, incluso cuando reporta mejores resultados en tareas de cuerpo completo y con pinzas o grippers.

La noticia dentro de la carrera por la “IA física”

El lanzamiento es relevante porque muestra hacia dónde se está moviendo la competencia de IA: de chatbots y agentes de software hacia sistemas que toman decisiones en espacios físicos. En ese terreno, el modelo no solo debe producir texto correcto; debe coordinar percepción, planificación, herramientas, control motor y seguridad.

También marca una estrategia de plataforma. Al ofrecer ER 2 por Gemini API y AI Studio, Google intenta que desarrolladores y empresas experimenten con robótica usando piezas del ecosistema Gemini, no solo con modelos cerrados dentro de laboratorios.

La lectura editorial más prudente es que Gemini Robotics 2 representa un paso técnico importante en robótica basada en modelos multimodales, pero todavía no demuestra adopción comercial masiva ni autonomía plenamente resuelta. Lo confirmado es el lanzamiento, las capacidades que Google reporta, las vías de acceso anunciadas y las demos publicadas. Lo pendiente es ver cómo se comporta esta arquitectura fuera de entornos controlados, con costos reales, normas de seguridad y tareas físicas menos predecibles.

Fuentes: Google DeepMind, Google Blog, YouTube / Google DeepMind, MarkTechPost