> ## Content Index
> Fetch the complete content index at: https://fomoera.com/llms.txt
> Use this file to discover other available public pages before exploring further.

# GLM-5.3 alcanza a Kimi K3 en el índice de Artificial Analysis y alucina más que GLM-5.2
- URL: https://fomoera.com/glm-5-3-alcanza-a-kimi-k3-en-el-indice-de-artificial-analysis-y-alucina-mas-que-glm-5-2/
- Published: 2026-08-19T15:30:45.000Z
- Updated: 2026-08-19T15:30:45.000Z
- Description: Artificial Analysis midió GLM-5.3 en 60 puntos de su Índice de Inteligencia, el mismo nivel de Kimi K3 y tres por debajo de Claude Opus 5. La misma corrida deja dos retrocesos: la tasa de alucinación subió de 26% a 30% y el modelo gasta 20% más tokens de salida por tarea.
- Author: Dilis Salazar
- Tags: Tecnología y Ciencia, IA

**TL;DR:**

- Artificial Analysis evaluó GLM-5.3 en 60 puntos de su Índice de Inteligencia, el mismo puntaje que Kimi K3 y tres menos que Claude Opus 5, que sigue al frente con 63.
- El evaluador reporta 7 puntos de mejora sobre GLM-5.2 y un salto de 1,524 a 1,770 de Elo en su prueba de trabajo agéntico, la mayor ganancia del modelo.
- Resolver cada tarea del índice cuesta 1.5 veces más que con GLM-5.2 pese a que Z.ai no movió su precio por token, y los pesos del modelo siguen sin publicarse.

---

Artificial Analysis evaluó GLM-5.3 y le asignó 60 puntos en su Índice de Inteligencia, el mismo puntaje que Kimi K3 y tres menos que Claude Opus 5, que sigue al frente con 63\. El resultado, difundido el 18 de agosto de 2026 en la cuenta pública del evaluador y en la ficha del modelo en su sitio, mide el sistema que Z.ai lanzó cuatro días antes con una batería que ejecuta la propia firma, no con las tablas del fabricante. La misma corrida trae dos números que el anuncio no puso al frente: la tasa de alucinación de GLM-5.3 subió de 26% a 30% frente a GLM-5.2 y el modelo gasta cerca de 20% más tokens de salida por tarea. Resolver cada tarea del índice pasó de costar US$0.44 a US$0.68, sin que Z.ai tocara su precio por token.

## Qué mide el 60 que le puso Artificial Analysis

El Índice de Inteligencia es un promedio, no una prueba suelta. En su versión 4.1.1 agrupa nueve evaluaciones: GDPval-AA v2, tau3-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience y AA-LCR. El puntaje de GLM-5.3 corresponde a su ajuste de razonamiento máximo, el que Z.ai recomienda para trabajo de código.

Esa versión salió el 6 de agosto de 2026\. Artificial Analysis reemplazó los modelos que califican tres de sus pruebas, Humanity's Last Exam, AA-LCR y AA-Omniscience, y las unificó bajo GPT-5.6 Luna en esfuerzo medio; antes las revisaban tres sistemas distintos. También actualizó tau3-Banking a la versión 1.0.1 de Sierra. La firma señaló que el cambio produjo un alza ligera de los puntajes por una calificación más robusta, que la mayoría de los modelos se movió menos de un punto y que Claude Opus 5 conservó el primer lugar con 63.

Correr esa batería completa contra GLM-5.3 costó US$1,238.50 en la API de Z.ai, según la ficha del modelo. Con 60 puntos, queda muy por encima de la mediana de 35 que registra su misma banda de precio.

Nathan Lambert, autor del boletín Interconnects, publicó el día del lanzamiento una advertencia que conviene tener a la mano al leer cualquiera de estas cifras: puntear alto en el Índice de Inteligencia y en agregadores parecidos tiene un efecto directo en la acción de Z.ai, y en buena medida la empresa necesita esos resultados para seguir levantando capital. Lambert sostiene que Z.ai no llevó esa optimización al punto de estropear el modelo y que los números de los blogs de lanzamiento son reales, pero estima que la compañía cuida los benchmarks públicos algo más que OpenAI o Anthropic.

Las cifras de ciberseguridad que circularon el 14 de agosto salieron de las tablas que publicó Z.ai. Como contamos entonces, ordenadas por profundidad de la tarea esas pruebas mostraban al modelo perdiendo terreno conforme el trabajo se volvía más difícil.

[GLM-5.3 supera a Mythos 5 solo en la prueba fácilGLM-5.3 gana por 0.7 puntos la prueba de ciberseguridad más superficial y pierde las dos profundas.![](https://fomoera.com/content/images/icon/favicon-d9dd8cf1-ccf5-4130-b03f-a8bc770ebc9d.ico)FomoEraPatricia Rodriguez![](https://fomoera.com/content/images/thumbnail/fomoera-pexels-16018144--source-dfb0c76b-648c-473a-a4b8-aa9840ec5c00.jpg)](https://fomoera.com/el-modelo-chino-glm-5-3-le-gana-a-mythos-5-por-0-7-puntos-y-solo-en-la-prueba-mas-superficial/)

![An IT professional operates a computer in a server room, managing network systems and connected devices.](https://fomoera.com/content/images/2026/08/fomoera-pexels-37605911--source.jpg)

Imagen ilustrativa: la evaluación de Artificial Analysis se corrió contra la API pública de Z.ai. · Foto de [panumas nikhomkhai](https://www.pexels.com/@cookiecutter?ref=fomoera.com) en [Pexels](https://www.pexels.com/photo/it-technician-working-in-data-center-server-room-37605911/?ref=fomoera.com)

## El salto grande está en el trabajo agéntico

La ganancia mayor del modelo no aparece en conocimiento ni en ciencia, sino en GDPval-AA v2, la prueba con la que Artificial Analysis mide tareas de trabajo real ejecutadas por agentes. Ahí GLM-5.3 subió de 1,524 a 1,770 puntos de Elo, un avance de 246\. Ese resultado lo deja segundo entre todos los modelos evaluados, atrás solo de Claude Opus 5 con 1,855, y más de cien puntos arriba de Kimi K3, que llevaba el liderato entre los modelos de pesos abiertos en esa prueba con 1,668.

La escala ayuda a leer el número. Artificial Analysis explicó al presentar GDPval-AA v2 que fijó en 1000 el Elo de referencia del desempeño humano, que rota un panel de modelos de frontera como jueces y que subió el límite de turnos de 100 a 250 para dar espacio a trayectorias de agente más largas.

## Dos renglones del mismo informe apuntan al otro lado

Artificial Analysis publicó también el desglose contra GLM-5.2, y ahí el balance deja de ser una línea recta hacia arriba. Estas son las medidas comparables entre las dos versiones, con las cifras del evaluador:

| Medida de Artificial Analysis | GLM-5.2 | GLM-5.3 |
| ----------------------------- | ------- | ------- |
| Índice de Inteligencia        | 53      | 60      |
| Elo en GDPval-AA v2           | 1,524   | 1,770   |
| Índice AA-Omniscience         | 4       | 14      |
| Tasa de alucinación           | 26%     | 30%     |
| Tokens de salida por tarea    | 15,700  | 18,700  |
| Costo por tarea del índice    | US$0.44 | US$0.68 |

En AA-Omniscience, la prueba de conocimiento y fiabilidad, GLM-5.3 pasó de 4 a 14 y quedó como el segundo mejor modelo de pesos abiertos, detrás de Kimi K3 con 20\. El evaluador desmenuzó de dónde viene esa mejora: la tasa de acierto subió de 24% a 34% y la de intento, es decir la frecuencia con la que el modelo responde en vez de abstenerse, pasó de 46% a 55%. La conclusión de la firma es que se trata de una ganancia real de exactitud y no de un modelo que se calla más seguido. En el mismo bloque aparece el retroceso de la tabla: la tasa de alucinación creció cuatro puntos.

El segundo renglón que empeora es el consumo de tokens. GLM-5.3 usa cerca de 18,700 tokens de salida por tarea del índice, alrededor de 20% más que los 15,700 de GLM-5.2 y 27% más que los 14,700 de Kimi K3\. Ese gasto explica en parte por qué el costo por tarea creció un factor de 1.5 pese a que la tarifa por token no se movió: sigue en US$1.40 por millón de entrada y US$4.40 por millón de salida, con US$0.26 por millón de entrada en caché, exactamente los mismos precios con los que Artificial Analysis midió a GLM-5.2 en junio. El propio evaluador apunta que ese consumo tiene consecuencias sobre el costo de despliegue. Aun así, GLM-5.3 sale más barato por tarea que Kimi K3, con US$0.84, y que GPT-5.6 Sol, con US$1.23.

## El título de líder abierto depende de un archivo que todavía no existe

El empate con Kimi K3 llegó con una condición. Artificial Analysis registra la licencia de GLM-5.3 como MIT, pero los pesos siguen sin publicarse, así que el modelo empata en puntaje y no en disponibilidad: Kimi K3 ya tiene su archivo afuera y conserva el liderato entre pesos abiertos. El evaluador señala que el equipo de Z.ai le comunicó que espera liberarlos durante la próxima semana. El 14 de agosto, Lambert escribió que la empresa apuntaba a dos semanas para subirlos a Hugging Face, un calendario que ubicaba la publicación cerca del final de agosto.

Lambert calculó además que GLM-5.3 llega a ese nivel con cerca de un tercio de los parámetros de Kimi K3, sobre la misma base que Z.ai ya había entrenado para GLM-5.2 y sin un preentrenamiento nuevo.

El mismo 14 de agosto, la [licencia con la que Alibaba liberó Qwen3.8-27B](https://fomoera.com/alibaba-libero-qwen3-8-27b-con-apache-2-0-pero-esa-licencia-no-cubre-al-modelo-de-2-4t/) dejó fuera a su modelo insignia, que salió con condiciones comerciales propias. La palabra "abierto" llega con asterisco en los dos lanzamientos.

Por ahora, Artificial Analysis midió GLM-5.3 contra la API de Z.ai, no contra el modelo corriendo en otro lado. Cuando los pesos se publiquen, cualquiera con hardware suficiente podrá repetir la batería completa y comprobar si el 60 aguanta fuera de casa.

*Fuentes:* [1](https://artificialanalysis.ai/articles/artificial-analysis-intelligence-index-v4-1-1?ref=fomoera.com), [2](https://artificialanalysis.ai/articles/glm-5-2-is-the-new-leading-open-weights-model-on-the-artificial-analysis-intelligence-index?ref=fomoera.com), [3](https://www.interconnects.ai/p/glm-53-how-chinese-labs-keep-stride?ref=fomoera.com)