Saltar al contenido

Google DeepMind lanza Gemini Robotics 2: el humanoide camina, las manos aún fallan

Gemini Robotics 2 controla humanoides completos y coordina varios robots. Los datos de Google marcan sus límites.

por Dilis Salazar
Google DeepMind lanza Gemini Robotics 2: el humanoide camina, las manos aún fallan

TL;DR:

  • Google DeepMind presentó una familia de tres modelos que controla un robot humanoide completo, de los pies a los dedos, y permite que varios robots repartan una misma tarea.
  • En las pruebas que publicó la propia empresa, el robot desenrosca un foco el 92% de las veces, pero ata una bolsa de basura solo el 44% y barre con recogedor el 32%.
  • El modelo de razonamiento ya está abierto a cualquier desarrollador; los que mueven el cuerpo del robot siguen restringidos a socios de acceso anticipado.

Google DeepMind presentó el 30 de julio de 2026 Gemini Robotics 2, la capa de software con la que un robot humanoide puede caminar, agacharse, estirarse y manipular objetos sin que nadie lo teleopere. Son tres modelos: uno que convierte visión y lenguaje en control motor, otro que planea la tarea y conversa con el operador, y un tercero que corre dentro del robot sin conexión a internet. La empresa lo describe como un avance importante hacia la AGI en el mundo físico. Las tablas de resultados que publicó junto al anuncio cuentan algo más matizado: las piernas ya funcionan, los dedos todavía no.

Gemini Robotics 2 es un modelo de visión, lenguaje y acción que traduce lo que el robot ve y lo que le dicen en movimiento de sus articulaciones. La versión anterior manejaba solo la parte superior del cuerpo, para tareas sobre una mesa. Esta maneja el cuerpo entero.

De la mesa al estante: el robot ya camina hasta donde está el objeto

La demostración central usa el Apollo 2, el humanoide de la texana Apptronik. La instrucción es cotidiana: "pon la regadera en el bote verde del estante de abajo". El robot procesa la frase, camina hasta la mesa, levanta la regadera, avanza unos pasos hacia el estante y la deja donde le pidieron. Google reconoce en el mismo texto que a sus robots todavía les falta velocidad de movimiento.

Para la mano, el modelo controla la SharpaWave, de cinco dedos y 22 grados de libertad, con la que el Apollo 2 ata nudos y sella una bolsa ziplock. También opera pinzas de dos dedos en la plataforma Franka Duo. Lo interesante del dato es que las tres configuraciones corren con el mismo punto de control del modelo, sin reentrenar uno por cuerpo.

Los números que Google publicó dicen dónde se rompe la mano

Las gráficas del anuncio traen tasas de éxito por categoría de tarea, y el propio pie de la primera reconoce que la manipulación con varios dedos sigue siendo difícil. Estas son las cifras oficiales:

  • Con el Apollo 2 y manos Inspire, levantar un objeto de una repisa funciona el 76.3% de las veces, de una mesa el 68.4% y del piso el 45.7%.
  • Con las manos Sharpa, desenroscar un foco llega al 92%, pero atornillarlo se queda en 36%, atar una bolsa de basura en 44%, usar un recogedor en 32% y cerrar un ziplock en 40%.
  • Con las pinzas del Franka Duo, las inserciones de precisión alcanzan 89.6%, el armado de kits de herramientas 78.9% y el trabajo general de tomar y colocar 74.2%.

Bloomberg tituló su nota del mismo día apuntando a esa brecha de destreza, y la aritmética le da la razón: quitar un foco es fácil porque el gesto perdona el error, ponerlo exige alinear una rosca. Ahí es donde el modelo todavía falla dos de cada tres veces.

ER 2 mira video, sabe cuándo terminó y reparte trabajo entre robots

El segundo modelo, Gemini Robotics ER 2, hace de cerebro alto: recibe la orden, observa la escena, arma la secuencia de pasos y le va pasando instrucciones al modelo que mueve el cuerpo. La novedad es temporal. Según el blog para desarrolladores de Google, ER 2 clasifica el avance de una tarea con 57.4% de precisión y detecta el fotograma exacto en que ocurre un evento clave (cuándo dejar de servir el café, por ejemplo) con 91.3% de acierto y un error medio de 0.96 segundos, a cuatro veces la velocidad de ejecución de modelos comparables.

Con eso llega la colaboración entre máquinas: un robot con ruedas y un humanoide pueden repartirse una misma tarea comunicándose por un entendimiento compartido de la escena. Google también montó una demostración con el Spot de Boston Dynamics, al que ER 2 le orquesta las APIs de navegación y manipulación para que traiga un snack cuando se lo piden de viva voz.

El tercer modelo, Gemini Robotics On-Device 2, corre dentro del robot sin red. Se adapta a cuerpos de dos brazos completamente nuevos en unas horas y, según la empresa, con menos de 200 ejemplos, incluso cuando cambian la forma, los sensores y los grados de libertad. Lo probaron en las plataformas Dexmate, SO101 y Trossen.

El reporte de seguridad admite un dilema que el anuncio no menciona

Un día antes, el 29 de julio de 2026, el equipo publicó su reporte técnico de seguridad, y ahí está la parte incómoda. En laboratorio, con el Apollo 2 haciendo una tarea de clasificación mientras una persona se le acerca desde distintos ángulos, el sistema detectó al humano el 99% de las veces y llevó al robot a una pose segura el 96%.

En el banco de pruebas más exigente, el resultado se abre. Google midió a los modelos de frontera con ASIMOV-Agentic, un conjunto de pruebas que liberó en Hugging Face, y encontró una relación inversa que nadie ha resuelto todavía.

⚠️
Según el reporte de seguridad de Google del 29 de julio de 2026, ningún modelo de frontera evaluado consigue las dos cosas a la vez: bajar los frenazos innecesarios por debajo del 5% dispara los fallos de detención por encima del 40%, y reducir esos fallos al rango de 10% a 15% obliga a parar de más entre el 15% y el 25% del tiempo. Por eso el propio equipo recomienda mantener frenos deterministas de bajo nivel junto al modelo.

Hay un segundo hallazgo que conviene leer despacio. Cuando la pregunta de seguridad se hace por texto, todos los modelos probados aciertan por encima del 96%. Cuando esa misma restricción hay que aterrizarla en coordenadas o en una llamada a herramienta, el rendimiento se dispersa. Entender la regla y actuar conforme a la regla no son lo mismo, y el documento aclara además que no evalúa la arquitectura de seguridad funcional del robot: hardware certificado, redundancia y garantías de tiempo real siguen siendo responsabilidad de quien lo despliega.

Un detalle que casi nadie levantó: el aviso de privacidad de la documentación de la API de robótica advierte que estos modelos operan con video y audio, y que por lo tanto pueden captar voz, imagen y semblante de personas identificables. Google le pide al desarrollador que nadie entre al área sin haber sido notificado y haber consentido, y que use recursos como el difuminado de rostros.

El software llega cuando el hardware acaba de encarecerse políticamente

Gemini Robotics ER 2 está abierto a desarrolladores en la API de Gemini y en Google AI Studio, más una vista previa privada en Gemini Enterprise Agent Platform. Los otros dos, los que mueven el cuerpo, siguen limitados a socios de acceso anticipado, con lista de espera. Es decir: el cerebro se puede probar hoy desde cualquier país donde el API esté disponible, y el cuerpo no.

Ese cuerpo, además, acaba de volverse un asunto de Estado. El 28 de julio de 2026 la FCC estadounidense sumó los robots humanoides y cuadrúpedos nuevos de fabricación extranjera a su lista de equipos con riesgo inaceptable para la seguridad nacional, junto con los inversores de energía. La medida aplica sin importar la nacionalidad del fabricante, aunque en la práctica golpea sobre todo a China, y deja abierta una vía de aprobación condicionada. Axios apunta el desequilibrio de fondo: en el mundo se despliegan más de 500,000 robots nuevos cada año, y China ya tiene más de dos millones de robots industriales en sus fábricas, cinco veces los de Estados Unidos.

Robots chinos: EE. UU. veta los nuevos modelos
La FCC bloquea la entrada de robots humanoides e inversores extranjeros nuevos; China es el blanco real de la medida.

Preguntas rápidas sobre Gemini Robotics 2

¿Qué es Gemini Robotics 2?

Es la familia de modelos de inteligencia artificial con la que Google DeepMind controla robots. La integran tres: el modelo de visión, lenguaje y acción que mueve el cuerpo; Gemini Robotics ER 2, que planea las tareas y habla con el operador; y Gemini Robotics On-Device 2, que corre dentro del robot sin conexión a internet.

¿Ya puedo probar Gemini Robotics?

Gemini Robotics ER 2, el modelo de razonamiento, está disponible para desarrolladores en la API de Gemini y en Google AI Studio, y en vista previa privada dentro de Gemini Enterprise Agent Platform. Los modelos que controlan el movimiento siguen reservados a socios de acceso anticipado, con lista de espera abierta.

¿Qué robots funcionan con Gemini Robotics 2?

Google mostró el humanoide Apollo 2 de Apptronik y la plataforma de dos brazos Franka Duo, más una demostración con el Spot de Boston Dynamics. El modelo On-Device 2 se adaptó también a las plataformas Dexmate, SO101 y Trossen. Apptronik, Boston Dynamics y Agile Robots figuran como socios en el anuncio.

Lo que cambia hoy es concreto y limitado: un desarrollador puede pedirle a ER 2 que planee una tarea física y que se la reparta a dos máquinas distintas, sin escribir una sola rutina de movimiento. El cuerpo que ejecuta esa tarea sigue siendo la pieza cara, escasa y ahora también política. Google resolvió buena parte del problema de la cabeza. La otra mitad la tienen las manos, y por ahora atan una bolsa de basura menos de la mitad de las veces.

Fuentes: 1, 2, 3

Dilis Salazar imagen de perfil
por Dilis Salazar

Suscríbete GRATIS

Recibe las noticias más importantes de política, tecnología, negocios, deportes, entretenimiento y cultura directamente en tu correo.

¡Listo! Revisa tu correo

Para completar la suscripción, haz clic en el enlace de confirmación que enviamos a tu correo. Si no llega en 3 minutos, revisa tu carpeta de spam.

Ok, gracias

Leer más de Tecnología y Ciencia