> ## Content Index
> Fetch the complete content index at: https://fomoera.com/llms.txt
> Use this file to discover other available public pages before exploring further.

# OpenWAM y AutodidactWAM usan video para mejorar el control de robots
- URL: https://fomoera.com/openwam-autodidactwam-video-robots/
- Published: 2026-10-07T19:40:00.000Z
- Updated: 2026-10-07T19:40:00.000Z
- Description: Dos preprints exploran cómo convertir predicciones visuales en movimientos. Las pruebas de OpenWAM y AutodidactWAM muestran avances con alcances distintos según el robot y la tarea.
- Author: Patricia Rodriguez
- Tags: Tecnología y Ciencia, IA

OpenWAM y AutodidactWAM reportan mejoras al convertir video en acciones para robots, mediante dos estrategias diferentes. Los trabajos, depositados en arXiv el **6 de octubre de 2026** como preprints, exploran el aprendizaje con grandes volúmenes de grabaciones y la corrección de movimientos a partir de video generado. Sus resultados abarcan simulación y robots físicos, con tasas de éxito que dependen de la tarea y del equipo evaluado.

Ambos estudian los modelos de mundo y acción, conocidos como WAM: sistemas de IA que predicen imágenes futuras y producen instrucciones de movimiento. Una secuencia puede representar cómo un robot recoge un objeto; ejecutar esa recogida exige que las acciones correspondan a su posición, sus articulaciones y el contacto con el objeto.

## OpenWAM compara distintas formas de unir predicción y control

El equipo de Stanford construyó OpenWAM sobre Wan2.2-5B. Según la [página del proyecto](https://openwam.stanford.edu/?ref=fomoera.com), el preentrenamiento empleó unas **14,640 horas de video**, incluidas grabaciones reales, simulaciones e interacciones humanas. Esa fase utiliza video sin etiquetas de acciones. Después incorporó un componente especializado en acciones.

El marco permite generar primero el video y después los movimientos, invertir ese orden o producir ambas salidas con otras configuraciones. Así, los investigadores pueden comparar esas decisiones sobre una base común.

En LIBERO-Long, una prueba de manipulación en simulación, la variante que predice video antes de actuar pasó del **68.4% al 97.8% de éxito** al incorporar el preentrenamiento robótico y la adaptación causal. La diferencia es de 29.4 puntos porcentuales. Ambos cambios se introdujeron juntos, por lo que la comparación mide su efecto combinado.

También hubo ensayos físicos. Con dos brazos Franka Research 3, esa variante promedió un 92.1% de éxito al tostar pan, completar la última capa de un cubo de Rubik de 2 × 2 y ordenar vasos por color. El equipo evaluó esas tareas en 50, 50 y 36 intentos, respectivamente.

Otro experimento reutilizó un componente que convierte predicciones visuales en acciones y alcanzó un 84.0% en cuatro tareas nuevas de LIBERO. El predictor de video sí se adaptó con demostraciones de las tareas de destino que incluían etiquetas de acciones.

## AutodidactWAM corrige movimientos a partir del video generado

El equipo de Sergei Kurchev adaptó Cosmos 3 a un Unitree G1 con manos BrainCo. Aunque el video representaba ejecuciones plausibles, las acciones originales completaban la tarea de recoger y colocar un objeto en aproximadamente el 7% de los intentos, en promedio.

AutodidactWAM extrae la postura de las manos del video y la convierte en objetivos de movimiento mediante cinemática inversa. Esa extracción alcanzó cerca del 42% de éxito completo, antes de trasladar la corrección al modelo.

El mejor ajuste combinó preferencias, aprendizaje supervisado y ajuste de la trayectoria, bajo la fórmula DPO+SFT+DTW. Su éxito completo fue del 20% con Oreo, el objeto usado para entrenar la corrección; del 30% con un juguete rosa y del 10% con una pelota azul. La tabla I del preprint recoge 20 intentos por objeto y condición:

__Éxito al recoger y colocar el objeto en el piloto de AutodidactWAM, 20 intentos por condición__
| Objeto                  | Acciones originales | DPO+SFT+DTW |
| ----------------------- | ------------------- | ----------- |
| Oreo                    | 0%                  | 20%         |
| Juguete antiestrés rosa | 10%                 | 30%         |
| Pelota azul             | 10%                 | 10%         |

Los porcentajes de ambos trabajos corresponden a robots, tareas y protocolos distintos. Leídos juntos, los experimentos permiten distinguir dos avances: aprender predicciones visuales útiles y convertirlas en movimientos ejecutables. En el piloto del humanoide, esa corrección mejoró la tarea completa con dos objetos; la pelota azul conservó el resultado inicial.

*Fuentes:* [1](https://arxiv.org/abs/2610.07922?ref=fomoera.com), [2](https://arxiv.org/abs/2610.08119?ref=fomoera.com)