Saltar al contenido
IA

OpenWAM y AutodidactWAM usan video para mejorar el control de robots

Dos preprints exploran cómo convertir predicciones visuales en movimientos. Las pruebas de OpenWAM y AutodidactWAM muestran avances con alcances distintos según el robot y la tarea.

por Patricia Rodriguez
日本の東京都江東区にある東京ビッグサイトで開催された「Japan Mobility Show 2025」。西1・2ホールの「Tokyo Future Tour 2035」のブース。「Introduction」のコーナーのステージに登場した、左からUnitree Roboticsのヒューマノイドロボット「Unitree
Imagen de archivo (2025) · Foto: RuinDig/Yuki Uchida, CC BY 4.0, vía Wikimedia Commons

OpenWAM y AutodidactWAM reportan mejoras al convertir video en acciones para robots, mediante dos estrategias diferentes. Los trabajos, depositados en arXiv el 6 de octubre de 2026 como preprints, exploran el aprendizaje con grandes volúmenes de grabaciones y la corrección de movimientos a partir de video generado. Sus resultados abarcan simulación y robots físicos, con tasas de éxito que dependen de la tarea y del equipo evaluado.

Ambos estudian los modelos de mundo y acción, conocidos como WAM: sistemas de IA que predicen imágenes futuras y producen instrucciones de movimiento. Una secuencia puede representar cómo un robot recoge un objeto; ejecutar esa recogida exige que las acciones correspondan a su posición, sus articulaciones y el contacto con el objeto.

OpenWAM compara distintas formas de unir predicción y control

El equipo de Stanford construyó OpenWAM sobre Wan2.2-5B. Según la página del proyecto, el preentrenamiento empleó unas 14,640 horas de video, incluidas grabaciones reales, simulaciones e interacciones humanas. Esa fase utiliza video sin etiquetas de acciones. Después incorporó un componente especializado en acciones.

El marco permite generar primero el video y después los movimientos, invertir ese orden o producir ambas salidas con otras configuraciones. Así, los investigadores pueden comparar esas decisiones sobre una base común.

En LIBERO-Long, una prueba de manipulación en simulación, la variante que predice video antes de actuar pasó del 68.4% al 97.8% de éxito al incorporar el preentrenamiento robótico y la adaptación causal. La diferencia es de 29.4 puntos porcentuales. Ambos cambios se introdujeron juntos, por lo que la comparación mide su efecto combinado.

También hubo ensayos físicos. Con dos brazos Franka Research 3, esa variante promedió un 92.1% de éxito al tostar pan, completar la última capa de un cubo de Rubik de 2 × 2 y ordenar vasos por color. El equipo evaluó esas tareas en 50, 50 y 36 intentos, respectivamente.

Otro experimento reutilizó un componente que convierte predicciones visuales en acciones y alcanzó un 84.0% en cuatro tareas nuevas de LIBERO. El predictor de video sí se adaptó con demostraciones de las tareas de destino que incluían etiquetas de acciones.

AutodidactWAM corrige movimientos a partir del video generado

El equipo de Sergei Kurchev adaptó Cosmos 3 a un Unitree G1 con manos BrainCo. Aunque el video representaba ejecuciones plausibles, las acciones originales completaban la tarea de recoger y colocar un objeto en aproximadamente el 7% de los intentos, en promedio.

AutodidactWAM extrae la postura de las manos del video y la convierte en objetivos de movimiento mediante cinemática inversa. Esa extracción alcanzó cerca del 42% de éxito completo, antes de trasladar la corrección al modelo.

El mejor ajuste combinó preferencias, aprendizaje supervisado y ajuste de la trayectoria, bajo la fórmula DPO+SFT+DTW. Su éxito completo fue del 20% con Oreo, el objeto usado para entrenar la corrección; del 30% con un juguete rosa y del 10% con una pelota azul. La tabla I del preprint recoge 20 intentos por objeto y condición:

Éxito al recoger y colocar el objeto en el piloto de AutodidactWAM, 20 intentos por condición
ObjetoAcciones originalesDPO+SFT+DTW
Oreo0%20%
Juguete antiestrés rosa10%30%
Pelota azul10%10%

Los porcentajes de ambos trabajos corresponden a robots, tareas y protocolos distintos. Leídos juntos, los experimentos permiten distinguir dos avances: aprender predicciones visuales útiles y convertirlas en movimientos ejecutables. En el piloto del humanoide, esa corrección mejoró la tarea completa con dos objetos; la pelota azul conservó el resultado inicial.

Fuentes: 1, 2

Patricia Rodriguez imagen de perfil
por Patricia Rodriguez

Patricia Rodriguez es redactora de FomoEra. Cubre tecnología, ciencia, inteligencia artificial, negocios y actualidad digital. También trabaja en escritura y edición de contenido audiovisual.

Leer más de Tecnología y Ciencia