TL;DR:
- ByteDance preentrena un modelo de hasta 10 billones de parámetros, según el Financial Times; ni la empresa lo ha confirmado ni Reuters pudo verificarlo.
- Sería más del triple que Kimi K3, de Moonshot AI, que con 2.8 billones era hasta ahora el modelo chino más grande liberado.
- La comparación con Mythos 5, de unos 8 billones, sale de estimaciones de la industria: Anthropic nunca ha publicado el tamaño de ninguno de sus modelos.
ByteDance preentrena un modelo de inteligencia artificial de hasta 10 billones de parámetros (10 millones de millones; en inglés se reporta como 10 trillion), publicó el Financial Times este viernes 7 de agosto de 2026, citando a personas con conocimiento del proyecto. Sería el modelo más grande que haya intentado una empresa china: más del triple que Kimi K3, el de Moonshot AI, que con 2.8 billones marcaba el techo del sector. La dueña de TikTok no ha confirmado nada, Reuters dijo que no pudo verificar el reporte y la cifra todavía puede moverse, porque el tamaño definitivo se decide con el entrenamiento ya avanzado.
Conviene aterrizar qué se está midiendo. Los parámetros son los ajustes numéricos que un modelo aprende de los datos para reconocer patrones, generar respuestas y ejecutar tareas. Funcionan como una medida aproximada de tamaño, no de inteligencia: el rendimiento depende también de la calidad de los datos, de la arquitectura y de las técnicas de entrenamiento, y un modelo más chico y mejor cocinado gana en muchas tareas contra uno gigante.
El proyecto está en preentrenamiento, la fase primera y más cara. Suele tomar entre tres y seis meses. Después viene el afinado, después las pruebas, y solo entonces se decide si sale al público. No hay fecha.
10 billones contra 2.8: la escala que China no había tocado
Hasta el mes pasado, el mapa chino de tamaños se veía así:
- Kimi K3, de Moonshot AI: 2.8 billones de parámetros, de pesos abiertos, presentado el 16 de julio en la Conferencia Mundial de Inteligencia Artificial de Shanghái.
- Qwen3.8-Max, de Alibaba: 2.4 billones.
- LongCat-2.0, de Meituan, y V4-Pro, de DeepSeek: 1.6 billones cada uno, que era el récord chino antes de K3.
Fuera de China la carrera va por el mismo carril. Elon Musk publicó que xAI entrena variantes de Grok de 6 y de 10 billones de parámetros en su clúster Colossus 2. Si el reporte del FT se sostiene, ByteDance entraría a ese club, no lo fundaría.
El rasero es Mythos 5, y esa cifra tampoco es oficial
Aquí está la parte que casi toda la cobertura pasó de largo. El FT compara el modelo chino contra Mythos 5, de Anthropic, al que la industria le calcula unos 8 billones de parámetros, y contra su hermano público Fable 5, estimado en unos 5 billones. Ninguna de las dos cifras salió de Anthropic. La compañía no publica el conteo de parámetros de nada de lo que fabrica, y lo mismo aplica a OpenAI con GPT-5.5. Así que la noticia mide un número reportado contra un número que nadie ha confirmado.
Hay un detalle que vuelve la estimación todavía más frágil. Cuando Anthropic presentó los dos modelos el 9 de junio de 2026, describió a Fable 5 y a Mythos 5 como dos configuraciones del mismo modelo base: Fable sale con guardarraíles conservadores para uso general y Mythos los suelta en áreas como ciberseguridad, reservado a un grupo chico de socios bajo el programa Project Glasswing. Si comparten base, una diferencia de 3 billones de parámetros entre ambos no se sigue de la propia descripción de la empresa.

Zhang Yiming promete no destilar en el peor momento para destilar
El reporte del FT llega dos días después de otro que lo enmarca todo. The Information adelantó el 5 de agosto, y el diario estatal chino The Paper confirmó el 6, que Zhang Yiming, fundador de ByteDance, le prohibió al equipo Seed mejorar sus modelos por destilación, la técnica de entrenar un sistema con las salidas de otro más potente.
"largoplacismo y gratificación diferida, en vez de usar la salida de otros"
Así resumió Zhang lo que le pide al área, según The Paper, que además reportó su disposición a resignar resultados de corto plazo con tal de no escalar posiciones en los rankings con material ajeno. La promesa es imposible de verificar desde fuera, y ByteDance no ha explicado cómo la va a auditar internamente.
El calendario explica bastante. El 22 de julio, Michael Kratsios, director de la Oficina de Política Científica y Tecnológica de la Casa Blanca, acusó a Moonshot AI de haber construido Kimi K3 destilando de forma industrial el modelo Fable de Anthropic, y de haber alcanzado servidores con chips Nvidia GB300 en Tailandia. Moonshot lo negó. El secretario del Tesoro, Scott Bessent, puso sobre la mesa sanciones y la Entity List, y el Ministerio de Comercio chino contestó hablando de hegemonismo de la IA. Investigadores externos le vieron una grieta al calendario: Fable 5 volvió a estar disponible el 1 de julio, tras la suspensión que le impuso el Departamento de Comercio en junio, y Kimi K3 salió quince días después.
Del otro lado del tablero, Anthropic ya se blindó. Fable 5 salió en junio con clasificadores que filtran tres áreas de riesgo, y una de ellas es exactamente la destilación por terceros. Encima corre una capa menos visible: los prompts orientados a construir modelos de frontera, como armar pipelines de preentrenamiento, infraestructura de entrenamiento distribuido o diseño de aceleradores, no se bloquean, se degradan. The Information reportó que detrás del veto de Zhang pesa la posición expuesta de ByteDance en Estados Unidos por TikTok. En ese contexto, anunciar que se construye desde cero es también una póliza de seguro.
El límite real no son los parámetros, son los chips
Preentrenar 10 billones de parámetros exige decenas de miles de aceleradores corriendo durante meses, y ahí ByteDance juega con una mano atada. Los controles de exportación estadounidenses le cierran la puerta a los Blackwell de Nvidia dentro de China. La salida, según reportó The Wall Street Journal en marzo de 2026, fue un clúster de unos 36,000 chips B200 instalado en Malasia con el proveedor Aolani Cloud, por más de 2,500 millones de dólares. Nvidia dijo a Tom's Hardware que la operación cumple las reglas vigentes, porque los controles regulan a dónde se envía el hardware, no dónde se usa el cómputo.
Dentro del país el margen es más estrecho. China autorizó en enero de 2026 la importación de más de 400,000 chips H200 para ByteDance, Alibaba y Tencent, una generación por debajo. Y el FT reportó en diciembre de 2025 que la compañía planeaba 160,000 millones de yuanes de inversión de capital para 2026, con unos 85,000 millones destinados a chips.

El músculo humano sí está. El equipo Seed reúne a unas 2,000 personas y lo dirige desde febrero de 2025 Wu Yonghui, ex vicepresidente de investigación de Google DeepMind tras 17 años en Google. Y la distribución también: Doubao, el asistente de la casa, ronda los 324 millones de usuarios activos al mes según las cifras del reporte, lo que lo convierte en la aplicación de IA más usada de China.
En español seguirán pesando más los modelos que se pueden descargar
¿Y de este lado? Para un desarrollador en Ciudad de México, Bogotá o Madrid, lo que cambió la economía de la IA en el último año no fueron los modelos chinos más grandes, sino los abiertos. Kimi K3, DeepSeek y Qwen publican pesos que cualquiera puede bajar, modificar y correr en servidores propios, y esa es la razón por la que empezaron a aparecer en productos hispanohablantes.
ByteDance juega distinto: mantiene cerrada la mayoría de sus modelos, a diferencia de sus rivales chinos. Un sistema de 10 billones de parámetros tampoco es algo que una empresa mediana pueda hospedar por su cuenta, aunque le entregaran los pesos. Si el modelo llega, llegará como servicio, con precio por token y a través de los productos de la compañía.
Preguntas rápidas sobre el modelo de ByteDance
¿Cuántos parámetros tendrá el nuevo modelo de ByteDance?
Hasta 10 billones, según el reporte del Financial Times del 7 de agosto de 2026. La cifra no está cerrada: el modelo sigue en preentrenamiento y el tamaño final se define más adelante. ByteDance no ha confirmado el número y Reuters no pudo verificar el reporte.
¿Es más grande que Mythos 5 de Anthropic?
Con 10 billones sí superaría los 8 billones que la industria estima para Mythos 5, pero esa cifra nunca la publicó Anthropic. La empresa no revela el tamaño de ninguno de sus modelos, así que la comparación se hace entre un dato reportado y una estimación externa.
¿Cuándo saldría el nuevo modelo de ByteDance?
No hay fecha anunciada. El preentrenamiento suele tomar entre tres y seis meses, y después vienen el afinado y las pruebas antes de cualquier lanzamiento público. ByteDance mantiene cerrada la mayoría de sus modelos, a diferencia de Moonshot, DeepSeek y Alibaba, que liberan pesos.
Lo único firme hoy es una cifra que ByteDance no confirma, medida contra otra que Anthropic nunca publicó. Entre el preentrenamiento y el afinado, el primer dato duro (un modelo servible, con precio y con pruebas comparables) no aparece antes de fin de año. Mientras tanto, la carrera que sí afecta a quien programa en español la siguen ganando los modelos que se pueden bajar.