Google DeepMind lanza tres modelos de IA física para robots colaborativos
Por Redacción Automatización LatAm · 30 de julio de 2026 · Fuente original: MarkTechPost
Foto: Nicodemus♐ · Openverse · Dominio público
Google DeepMind presenta Gemini Robotics 2, una suite de tres modelos de IA entrenados para control corporal completo, razonamiento encarnado y adaptación rápida a nuevas plataformas robóticas. Solo uno está disponible públicamente.
El anuncio de Google DeepMind: tres modelos para la próxima generación robótica
Google DeepMind ha liberado Gemini Robotics 2, presentada como la capa de inteligencia central para robots de nueva generación. La suite consta de tres componentes complementarios: un modelo visión-lenguaje-acción (VLA) capaz de controlar humanoides completos, Gemini Robotics ER 2 dedicado a razonamiento encarnado y orquestación de tareas, y un VLA compacto que se ejecuta directamente en el dispositivo del robot. La estrategia de lanzamiento es gradual: solo ER 2 está disponible públicamente hoy, mientras que los otros dos modelos permanecen bajo custodia de Google, con demostración de funcionamiento en brazos Apptronik Apollo 2 y Franka Duo.
Arquitectura técnica: visión-lenguaje-acción descentralizada
Los VLAs representan una evolución respecto a sistemas anteriores de control robótico. Estos modelos entrenan con millones de trayectorias de demostración humana o simulada, aprendiendo a mapear observaciones visuales directas (cámaras del robot) y comandos en lenguaje natural hacia secuencias de acciones motoras. La novedad técnica aquí es que Gemini Robotics 2 separa la inferencia pesada (razonamiento en la nube) de la ejecución ligera (en el robot). El componente on-device ejecuta microacciones con latencia baja, crítico para tareas de manipulación fina donde el tiempo de respuesta a perturbaciones determinan el éxito o fracaso. Esto contrasta con generaciones previas donde todo el razonamiento ocurría en servidores centrales, introduciendo retardos de cientos de milisegundos inaceptables en pick-and-place o ensamblaje.
Gemini Robotics ER 2 funciona como orquestador: recibe instrucciones de alto nivel (“ensambla esta válvula”), descompone la tarea en subtareas coordinadas entre múltiples robots, y monitorea el progreso mediante retroalimentación visual en tiempo real. Esta separación entre razonamiento estratégico (en la nube) y control táctico (en dispositivo) permite que un Franka Duo y un Apptronik Apollo 2 —arquitecturas completamente diferentes en términos de grados de libertad, velocidad y capacidad de carga— colaboren sin que ingenieros reescriban controladores personalizados.
Adaptación rápida: la promesa de horas a minutos
Un diferenciador clave es que el VLA on-device se adapta a nuevas morfologías robóticas en horas, no semanas. Tradicionalmente, integrar un nuevo brazo en una célula requiere reentrenamiento del modelo de control con datos específicos de ese hardware, calibración de parámetros dinámicos (fricción articular, elasticidad), y validación exhaustiva. Google afirma que Gemini Robotics 2 logra esto mediante few-shot adaptation: captura brevemente demostraciones con el nuevo robot (típicamente 30-100 ejemplos), extrae invariantes perceptuales del modelo preentrenado, y ajusta solo las capas de salida. Esto es posible porque el modelo base ha sido entrenado con suficiente diversidad de plataformas que generaliza características compartidas entre robots.
Lectura para la industria latinoamericana
En México, Brasil y Colombia, la adopción de robótica colaborativa crece en sectores como automotriz (Stellantis en Toluca, Volkswagen en Puebla), alimentos (Bimbo, Kraft Heinz), y minería (cobre en Chile). Sin embargo, la brecha actual es profunda: integrar un nuevo brazo en una planta típicamente requiere meses y especialistas externos costosos. La mayoría de integradores regionales —como proveedores en Monterrey o São Paulo— trabajan sobre plataformas Yaskawa, ABB o KUKA con licencias de software propietarias; escasos tienen experiencia con modelos de aprendizaje dinámico.
Gemini Robotics 2 es especialmente relevante para plantas medianas de LatAm que operan líneas mixtas: una sección ensambla componentes con Franka Emika (popular en Latinoamérica por bajo costo de entrada), otra realiza tareas de manipulación pesada con ABB IRB6700, y se requiere coordinación. Hoy esto obliga a programar orquestación manual con PLC y sistemas de visión desacoplados. El modelo ER 2 podría consolidar esta lógica en un único agente de razonamiento.
Dos limitaciones prácticas a vigilar: (1) Los modelos de Google Robotics aún requieren conectividad a servidores Google Cloud para la capa de razonamiento pesado. Plantas en zonas con internet inestable (común en regiones mineras de Perú o zonas rurales de Brasil) sufrirán latencia o desconexiones. (2) Solo ER 2 es accesible públicamente; los VLAs de control corporal y whole-body humanoid siguen cerrados, lo que limita el análisis independiente sobre cómo la compañía maneja datos de entrenamiento y privacidad operacional.
Para ingenieros en plantas existentes: esta noticia significa que los proyectos de «modernización multi-robot» que hoy son financieramente inviables (por integración costosa) podrían replantearse en 18-24 meses cuando estos modelos maduren y compitan con soluciones de Siemens (MindSphere), ABB (Collaborative Robots Cloud), o integradores locales. Se recomienda comenzar pilotos pequeños con Franka o plataformas abiertas para validar flujos antes de comprometer presupuesto grande.
Qué vigilar en los próximos 12 meses
Dos desarrollos críticos merecen atención: primero, cuándo Google abre acceso a los VLAs de humanoides y adaptación on-device. Las restricciones actuales sugieren que aún hay preocupaciones sobre robustez o seguridad en escenarios productivos reales; esperar disclosure técnico detallado o publicación en conferencias como RSS (Robotics: Science and Systems) o ICRA. Segundo, cómo responden competidores. Boston Dynamics (propiedad de Hyundai) opera en un modelo de soluciones verticales y cerradas; OpenAI/Figure AI están explorando modelos VLA abiertos; Meta lanzó recibirá atención sobre arquitecturas de difusión para control robótico. La próxima generación de sistemas de control industrial podría fragmentarse entre soluciones cloud-centric (Google, Azure Robotics) y edge-first (Nvidia Isaac, iniciativas de código abierto).
Este resumen es un análisis original. Para leer la noticia completa visita la fuente original: MarkTechPost →
Sigue leyendo
Inspección 3D e IA para control de calidad en manufactura
Senswork presenta en IMTS 2026 soluciones de visión artificial impulsadas por inteligencia artificial y tecnología 3D de alta resolución para detección automática de defectos superficiales, combinando cámaras Cognex In-Sight con algoritmos de aprendizaje profundo.
Fuente: Manufacturing Tomorrow
Pinza microelectrónica con sensado de fuerza integrado
Gripper de flexión compacta para manufactura de óptica micro con carrera de mordaza de 0,5 mm y sensor de fuerza embebido, habilitando precisión en ensamble de componentes fotónicos.
Fuente: Manufacturing Tomorrow
Meta automatiza centros de datos con brazos robóticos
Meta está desplegando brazos robóticos industriales para automatizar tareas de mantenimiento en sus centros de datos, desde reinicio de servidores hasta recableado de red. Los empleados estiman que esto podría eliminar hasta el 80 % de las labores manuales en estas instalaciones.
Fuente: Xataka - Automatización
Microduck: robot bípedo de código abierto por $399 que aprende con RL
Pollen Robotics presenta Microduck, un robot bípedo de 25 cm que permite entrenar políticas de movimiento mediante aprendizaje por refuerzo. Con sensores (cámara, LiDAR, IMUs) y stack de entrenamiento Apache 2.0, democratiza el acceso a simulación e implementación real de controladores neurales.
Fuente: MarkTechPost
Cámara 3D ToF de IDS Nion entra en producción en serie
IDS lanza la Nion, una cámara de tiempo de vuelo que captura profundidad en alta resolución a 30 fps incluso con movimiento rápido y cambios de iluminación. Apta para logística, automatización y robótica industrial donde se requiere información 3D confiable en tiempo real.
Fuente: Manufacturing Tomorrow
Montacargas autónomos: del despacho manual a la logística sin operador
Los sistemas de transporte autónomo entre áreas de almacén eliminan el despacho manual, reducen congestión de pasillos y mejoran productividad. Una alternativa a los montacargas convencionales que requiere mínima intervención humana.
Fuente: Logicbus