ByteDance prepara un modelo de inteligencia artificial capaz de generar video espacial en tiempo real y su fundador, Zhang Yiming, supervisa el desarrollo en persona, según reportó Bloomberg el 7 de septiembre de 2026 con base en personas familiarizadas con el asunto. El lanzamiento podría ocurrir en octubre, aunque una de esas fuentes advirtió que la fecha no está cerrada y que los planes pueden cambiar. El sistema se apoya en Seedance, el modelo de video que ya opera la compañía, y permitiría armar mundos virtuales interactivos para transmisiones en vivo, dramas cortos y videojuegos, a unos 20 fotogramas por segundo y con una latencia cercana a 0.05 segundos. La generación ocurre en servidores, no en el aparato del usuario. Un portavoz de ByteDance no respondió a la solicitud de comentarios de Bloomberg.
El detalle que separa este reporte de cualquier otro lanzamiento de modelo es quién aparece coordinando el trabajo. Bloomberg describe a Zhang alineando equipos de distintas unidades de negocio y volcando cómputo y recursos de IA sobre el proyecto, una tarea de gestión que hace años dejó de ser suya.
Ese mismo reporte ubica a ByteDance disputando el terreno con Meta y Alphabet, en un campo cuyas aplicaciones alcanzan la robótica y los sistemas autónomos, y coloca al fundador en la conversación que sostienen investigadores como Fei-Fei Li y Yann LeCun, para quienes los sistemas capaces de actuar en el mundo físico necesitan algo más que lenguaje.
El fundador que se apartó de la operación diaria dirige un frente técnico
Zhang anunció en mayo de 2021 que dejaba la dirección ejecutiva de ByteDance y pasó el puesto a Liang Rubo, cofundador de la empresa. En noviembre de ese año también dejó la presidencia del consejo, que quedó igualmente en manos de Liang, según confirmó a CNBC una persona con conocimiento directo. Al explicar su salida, Zhang dijo en una nota a los empleados que le faltaban algunas de las habilidades propias de un gerente ideal y que prefería concentrarse en estrategia de largo plazo.
Cinco años después, el reporte de Bloomberg lo coloca de vuelta en el detalle operativo de un producto concreto.

El cómputo se muda a la nube y eso mueve el costo del visor
El dato técnico que sostiene la apuesta es la latencia. A 0.05 segundos y 20 fotogramas por segundo, un usuario puede moverse o hablar y ver cómo cambia la escena mientras se genera, en lugar de esperar un clip terminado. ByteDance es dueña de Pico, su brazo de realidad extendida, y el modelo apunta a generar entornos que respondan a la voz y a los movimientos de quienes usan esos visores.
The Next Web, que reseñó el reporte de Bloomberg, señala ahí la estrategia: si el renderizado ocurre en servidores, el visor necesita menos capacidad propia y, por lo tanto, puede costar menos. El mismo argumento aplica del lado de Douyin, donde un creador podría montar una transmisión o un drama corto sin comprar hardware gráfico caro.
Ninguna de esas cifras viene de un anuncio de ByteDance: salen de fuentes anónimas citadas por Bloomberg y describen un sistema que todavía no se ha mostrado en público.
ByteDance llegó tarde a los modelos de mundo, según 36Kr
Un modelo de mundo es un sistema entrenado para entender y simular entornos físicos o digitales, de manera que pueda representarlos y reaccionar de forma coherente a lo que hace quien está dentro. Es el tipo de predicción que necesita un robot para moverse entre objetos o un vehículo autónomo para anticipar el tránsito, y por eso el terreno interesa al mismo tiempo a la robótica, a los videojuegos y al contenido interactivo.
ByteDance llegó a ese terreno con retraso. En junio de 2026, 36Kr documentó, en la adaptación que publicó KrASIA, que la compañía fijó cuatro prioridades de IA para el año y puso los modelos de mundo en primer lugar, por delante de sostener a Seedance en video, reforzar el código y monetizar Doubao. Wu Yonghui, responsable del equipo Seed, dio una meta explícita: publicar al menos un modelo de mundo antes de que termine el año y medirlo contra Genie 3, el modelo de mundos interactivos de Google.
El avance no iba al ritmo esperado. Pruebas internas de principios de 2026 ubicaban el desempeño de ByteDance alrededor de 10% por debajo de las mejores alternativas globales, según un integrante de Seed citado en ese reporte. Los modelos de mundo se llevan el mayor presupuesto de datos de la compañía entre todas sus líneas, una cifra de ocho dígitos en yuanes que un proveedor de datos calculó en tres o cuatro veces lo que gastan otras empresas. El trabajo corre por dos rutas: una de visión, lenguaje y acción orientada a inteligencia encarnada y robótica, y otra de simulación 3D pensada para entretenimiento y videojuegos, encabezada por Fan Haoqi, exinvestigador del laboratorio FAIR de Meta.
El modelo que reporta Bloomberg pertenece a esa segunda ruta. Si llega en octubre, aterrizaría antes del plazo que la propia empresa se había puesto.
El dinero para sostener el intento existe. ByteDance cerró un préstamo sindicado de 29,600 millones de dólares con cerca de 30 bancos, según reportó Reuters el 4 de septiembre de 2026, y Bloomberg publicó que evalúa elevar su gasto de capital hasta 70,000 millones de dólares este año para ampliar centros de datos e infraestructura de IA.
Falta lo esencial: nombre del modelo, fecha oficial, precio y una demostración pública que permita comprobar los 20 fotogramas por segundo fuera de una sala de pruebas. Octubre es un plazo corto, y ByteDance tendrá que confirmarlo o dejarlo pasar en cuestión de semanas.