Saltar al contenido

Tencent libera Hy4 de 770B y dice que gana: su propia ficha admite que perdió 4 de cada 10

Tencent abrió Hy4 preview, un modelo de 770,000 millones de parámetros con contexto de más de un millón de tokens y licencia Apache 2.0. Dice superar a GLM-5.3 y a Kimi K3, pero la prueba es suya y su ficha en Hugging Face reconoce que perdió cerca de 40% de las comparaciones.

por Alejandro Castillo Leone
Software developer analyzing code on a tablet in a modern office workspace.
Foto de Jakub Zerdzicki en Pexels

TL;DR:

  • Tencent liberó el 28 de agosto de 2026 Hy4 preview, un modelo abierto de 770,000 millones de parámetros totales, 49,000 millones activos por token y contexto de más de un millón, bajo licencia Apache 2.0.
  • La compañía dice que supera a GLM-5.3 y a Kimi K3 con una prueba a ciegas propia: 2.99 sobre 4 frente a 2.92 y 2.94. Su ficha del modelo añade que perdió 40.4% y 40.9% de esas comparaciones.
  • Llega 53 días después de Hy3 y, al cierre de esta nota, no existe una medición independiente que contraste esos resultados.

Tencent liberó este 28 de agosto de 2026 Hy4 preview, la nueva generación de su modelo de lenguaje, con los pesos abiertos bajo licencia Apache 2.0. Es un Mixture-of-Experts de 770,000 millones de parámetros totales y 49,000 millones activos por token, con una ventana de contexto que supera el millón de tokens. La compañía lo presenta como superior a GLM-5.3, de Z.ai, y a Kimi K3, de Moonshot AI. El sustento de esa afirmación es una prueba a ciegas que organizó Tencent y calificaron 163 de sus propios expertos sobre 203 tareas de ingeniería: Hy4 promedió 2.99 sobre 4.00, contra 2.92 de GLM-5.3 y 2.94 de Kimi K3. La ficha del modelo publicada en Hugging Face agrega lo que el comunicado omite: Hy4 perdió 40.4% de esas comparaciones contra GLM-5.3 y 40.9% contra Kimi K3.

Hy4 perdió 4 de cada 10 comparaciones en la prueba que Tencent usa para decir que gana

El comunicado corporativo se queda en los promedios. La ficha técnica desglosa cada duelo. Contra GLM-5.3, Hy4 preview ganó 46.8% de las comparaciones, empató 12.8% y perdió 40.4%. Contra Kimi K3 ganó 51.2%, empató apenas 7.9% y perdió 40.9%. En los dos casos, cuatro de cada diez veces los evaluadores prefirieron al rival.

Tencent eligió las tareas, puso a los jueces en su nómina y publicó el resultado. Que la calificación fuera a ciegas evita que el evaluador sepa qué salida es de quién, pero no cambia quién armó el examen. Sobre una escala de 4 puntos, la distancia con Kimi K3 es de 0.05 y con GLM-5.3 de 0.07.

No es la primera vez que la compañía apoya su comparación estrella en este formato. Con Hy3, en julio, la comparación central también salió de una prueba a ciegas interna, y ya lo señalamos entonces.

Hy3: el modelo abierto de Tencent que reta a GLM
Tencent liberó Hy3, un modelo MoE de 295B con licencia Apache 2.0 que compite con modelos del doble de tamaño.

Puestas una junto a otra, las dos pruebas muestran cómo se movió la ventaja que Tencent reclama frente a su rival más cercano:

Prueba a ciegas de Tencent Hy3 (6 de julio de 2026) Hy4 preview (28 de agosto de 2026)
Expertos que calificaron 270 163
Volumen evaluado 312 comparaciones válidas 203 tareas de ingeniería
Puntaje del modelo de Tencent 2.67 sobre 4 2.99 sobre 4
Rival y su puntaje GLM-5.1, 2.51 GLM-5.3, 2.92; Kimi K3, 2.94
Ventaja declarada 0.16 puntos 0.07 (GLM-5.3) y 0.05 (Kimi K3)

Los dos ejercicios no son intercambiables: cambian el panel, el tipo de tarea y los rivales, así que la tabla no mide qué modelo mejoró más. Mide cuánta distancia se adjudica Tencent frente a su competidor más próximo, y con un modelo 2.6 veces más grande ese margen quedó por debajo de la mitad del que reclamó en julio.

Un modelo 2.6 veces más grande, 53 días después de Hy3

Hy3 salió el 6 de julio de 2026 con 295,000 millones de parámetros totales, 21,000 millones activos y 256K de contexto. Hy4 preview llegó 53 días después con 770,000 millones, 49,000 millones activos y más de un millón de tokens de ventana. Tencent atribuye el salto a escalar tres frentes al mismo tiempo, tamaño del modelo, longitud de contexto y volumen de datos, sin reclamar un hallazgo algorítmico nuevo.

Caixin sitúa esa aceleración en su contexto competitivo: la empresa acortó su ciclo de lanzamientos en medio de la carrera doméstica china y arrastra la fama de ir detrás de algunos desarrolladores chinos de IA. La ficha técnica apunta en la misma dirección de forma más literal. Tencent describe su módulo de atención como una versión con compuertas de la atención dispersa de DeepSeek, sumada a una técnica de reutilización de índices entre capas, y acredita a DeepSeek y a GLM como inspiración de esa parte de la arquitectura. GLM, uno de los dos rivales contra los que se mide, aparece también en el diseño del modelo.

Detailed image of a server rack with glowing lights in a modern data center.
Imagen ilustrativa: correr Hy4 preview completo exige infraestructura de centro de datos, no una computadora de escritorio · Foto de panumas nikhomkhai en Pexels

Para quien quiera probarlo hoy, el modelo está en Hugging Face junto con una variante cuantizada FP8, y funciona dentro de WorkBuddy, CodeBuddy, Yuanbao e ima. Por API llega vía Tencent Cloud TokenHub y OpenRouter, a 0.834 dólares por millón de tokens de entrada, 2.501 por millón de salida y 0.042 por millón en entradas con caché. WorkBuddy y CodeBuddy lo dan gratis dos semanas, y el acceso libre a Hy3 en esas mismas plataformas se extendió hasta el 30 de septiembre. Autohospedarlo es otra historia: las recetas de despliegue que publica Tencent reparten la variante cuantizada en ocho GPU.

Tencent dice que el modelo ya optimiza su propio sistema de inferencia

Tencent sostiene además que Hy4 preview participó por primera vez en la optimización automatizada de sus propios métodos de entrenamiento, estrategias de datos, marcos de evaluación y operadores de bajo nivel: propuso enfoques, corrió experimentos e iteró con los resultados. La empresa lo llama un ciclo temprano de automejora recursiva.

De ahí sale el número concreto. Según Tencent, el modelo analizó por su cuenta los cuellos de botella de su sistema de inferencia y aplicó varias rondas de optimización en fusión de operadores y comunicación, con un aumento de 31.8% en el rendimiento de extremo a extremo frente a la línea base, sostenido en distintas longitudes de contexto y niveles de concurrencia. Ese porcentaje también lo midió Tencent en su propia infraestructura.

La compañía sí publica sus límites. En la ficha reconoce que esta versión temprana tarda más de lo necesario razonando tareas complejas y tiende a verificar en exceso su propio trabajo, y explica el porqué de sacarla así: prefieren "lanzar temprano y escuchar qué se rompe", escribe el equipo de Tencent Hy. La etiqueta preview es literal, y la empresa anticipa más modelos de la serie Hy4 en camino.

Queda pendiente la verificación de un tercero. GLM-5.3 y Kimi K3 ya quedaron parejos en el índice de Artificial Analysis, una medición ajena a sus fabricantes, como contamos el 19 de agosto.

GLM-5.3 empata a Kimi K3 y alucina más que 5.2
Artificial Analysis midió GLM-5.3 en 60, empatado con Kimi K3, pero su tasa de alucinación subió de 26% a 30%.

Hy4 preview todavía no tiene ese contraste. Para el desarrollador hispanohablante que evalúa mover un flujo de trabajo a pesos abiertos, lo verificable hoy es el precio, la licencia y el hardware que exige; lo que promete la comparación sigue siendo una afirmación del fabricante hasta que alguien más la mida.

Fuentes: 1, 2, 3

Alejandro Castillo Leone imagen de perfil
por Alejandro Castillo Leone

Soy un amante del arte y la cultura. Desde el 2021 dirijo una web dedicada a la historia de mi país y he emprendido la misión de vivir para la cultura, alimentándome principalmente del ámbito Hispanoamericano.

Leer más de Tecnología y Ciencia