TL;DR:
- SemiAnalysis publicó el 21 de agosto de 2026 un análisis que evalúa por separado tres eras de modelos de lenguaje y concluye que, en cada una, los abiertos tardan la mitad de tiempo en igualar al primer modelo cerrado de esa etapa.
- En la era del razonamiento el cierre tomó 8.5 meses; en la agéntica, Kimi K2.6 superó a Opus 4.5 en 4.8 meses y GLM-5.2 rebasó a GPT-5.2 en 6.
- El modelo que los abiertos alcanzan es el que abrió la era. Mientras tanto, OpenAI y Anthropic lanzaron entre las dos un modelo cada 51 días, contra 213 y 120 días de las eras anteriores.
Con cada generación de modelos, los de pesos abiertos tardan la mitad de tiempo en alcanzar al primer modelo cerrado de esa generación. Es la conclusión de un análisis que SemiAnalysis publicó el viernes 21 de agosto de 2026: la firma que dirige Dylan Patel partió la historia de los modelos de lenguaje en tres eras, escalado temprano, razonamiento y agéntica, corrió una batería de pruebas distinta para cada una y armó un puntaje compuesto. El ejercicio nace de un temor concreto del mercado, que el texto describe antes de presentar cifras: si los abiertos se mantienen suficientemente capaces a una fracción del costo, la capa de modelos se vuelve un producto genérico y los márgenes de los laboratorios de frontera se hunden. Luego el propio análisis matiza su hallazgo.
Cada era estrena sus propias pruebas, y de ahí sale el método
El punto de partida metodológico es que ninguna prueba sirve para medir toda la historia. SemiAnalysis lo explica así: una prueba nace para distinguir capacidades en su momento, los laboratorios la escalan hasta saturarla y a partir de ahí ya no le importa a nadie. Por eso, en lugar de una sola gráfica continua, el equipo evaluó cada era con las pruebas que la definieron.
Para la primera usó GSM8K, HumanEval, TriviaQA y MMLU-Pro. Para la segunda, las pruebas de razonamiento que llegaron con o1, entre ellas AIME y Humanity's Last Exam. Para la tercera eligió Terminal-Bench 2.1, BrowseComp-Plus, τ³-banking y DeepSWE, un conjunto deliberadamente reciente para limitar la memorización.
Los puntajes se normalizan dentro de cada era: el mejor resultado vale 100 y el resto se mide contra él. El compuesto es el promedio simple de las cuatro pruebas. La mayoría de las corridas las hizo SemiAnalysis con el stack de evaluación de Prime Intellect, y el resto viene de Artificial Analysis y del tablero DeepSWE de Datacurve. A los modelos abiertos los sirvieron como habrían estado el día de su lanzamiento, con las versiones de vLLM, el hardware de la época y los ajustes de muestreo de la tarjeta del modelo; a los cerrados los corrieron contra versiones fijadas de su API.
La brecha inicial cayó de 35.8 puntos a 12.1
La tabla resume qué modelo abrió cada era, quién lo alcanzó y cuánto tardó, con los puntajes compuestos que publica el propio análisis.
| Era | Punto de partida | Modelo abierto que lo alcanzó | Tiempo |
|---|---|---|---|
| Escalado (2022-2024) | GPT-3.5 Turbo con 75.7 contra Llama-2-70B con 39.9: 35.8 puntos de brecha | Llama-3.1-405B, 86 puntos, julio de 2024 | No aparece en la parte abierta del texto |
| Razonamiento (2024-2025) | Brecha inicial de 12.1 puntos, estrecha por la salida de DeepSeek R1 | R1-0528, 78 puntos, mayo de 2025 | 8.5 meses |
| Agéntica (2025 a hoy) | Opus 4.5 | Kimi K2.6, 56.3 puntos | 4.8 meses |
| Agéntica (2025 a hoy) | GPT-5.2 | GLM-5.2, 72.4 puntos | 6 meses |
La primera era dejó dos marcas más. DeepSeek V3 igualó a GPT-4o en diciembre de 2024, 94.1 contra 95.5, y Qwen2.5-72B quedó cerca de ese mismo GPT-4o con la sexta parte de los parámetros del modelo de 405,000 millones de Meta. El salto siguiente llegó siete semanas después del lanzamiento de Llama-3.1-405B, cuando OpenAI presentó o1-preview el 12 de septiembre de 2024 y reinició la lista de pruebas relevantes.

El blanco es fijo, y en esta era la frontera lanzó un modelo cada 51 días
La definición que sostiene el titular importa. Lo que los abiertos alcanzan es el primer modelo cerrado de cada era, no el que está arriba el día que lo logran. En la etapa agéntica ese matiz pesa, porque el propio análisis reporta que OpenAI y Anthropic lanzaron entre las dos un modelo cada 51 días en promedio, contra los 213 y 120 días de las dos etapas previas.
Sobre esas dos cifras del propio texto, los 4.8 meses que tardó Kimi K2.6 en superar a Opus 4.5 equivalen a unos tres lanzamientos de la frontera cerrada. Alcanzar cada vez más rápido y conservar la misma distancia son resultados compatibles.
SemiAnalysis pone sus propios límites. Reconoce que Kimi K3 puede puntuar por encima de Fable 5 en su compuesto y que en la firma siguen usando Fable para el trabajo diario, en parte por producto (Claude Code, Claude Tag) y en parte porque una prueba pública no es un sustituto perfecto del trabajo real. Ahí está la grieta que ellos mismos señalan: quien fabrica el modelo puede subir el puntaje montando entornos de aprendizaje por refuerzo que imiten las tareas de esa prueba.
Ese hueco entre el puntaje y la utilidad aparece hasta en su elección del arranque de era. El análisis dice que la mayoría de los expertos considera a Opus 4.5 el inicio oficial de la etapa agéntica por su confiabilidad, aunque GPT-5.2 rindió mejor en la batería de pruebas y esa ventaja no se tradujo en una mejor experiencia de uso. Es el mismo patrón que se vio en agosto, cuando GLM-5.3 le ganó a Mythos 5 por 0.7 puntos y solo en la prueba más superficial.
El texto también se adelanta a una objeción previsible: que el cierre de la tercera era se vea corto porque Anthropic y OpenAI dedican más tiempo a pruebas de seguridad que Moonshot y Zhipu. Su respuesta es que la demora no es nueva. GPT-4 terminó de entrenarse 218 días antes de salir, y aun suponiendo que Mythos hubiera terminado su entrenamiento a mediados de febrero, el retraso hasta el lanzamiento de Fable sería de 114 días.
Epoch AI mide la misma pregunta contra la frontera móvil
Hay otra medición reciente del mismo asunto y su número va en el otro sentido. Epoch AI publicó el 29 de mayo de 2026 un Data Insight, firmado por Jack Edwards y Luke Emberson, que compara día por día el mejor modelo de pesos abiertos disponible contra la frontera cerrada histórica según su Epoch Capabilities Index. Desde enero de 2026, el rezago promedio fue de cuatro meses, unos 8 puntos del índice, una distancia parecida a la que separa a GPT-5 de GPT-5.5. La cifra creció frente a los tres meses que la misma organización había medido para el periodo de enero de 2023 a octubre de 2025.
Las dos mediciones no se contradicen tanto como parece, porque no responden la misma pregunta. SemiAnalysis cronometra cuánto tarda un modelo abierto en igualar una referencia que ya no se mueve; Epoch AI mide la distancia contra un techo que sube todos los días.
Queda una parte que no se puede revisar. El análisis es de suscripción de pago y la sección final, la que proyecta cómo seguirá la brecha en la era siguiente, queda detrás del muro. Lo que sí es público es la advertencia que le sirve de antesala: los autores anticipan que su lectura del futuro resulta menos pesimista para los modelos de frontera de lo que sugiere el resto del texto.
Para quien decide con qué modelo trabajar, lo que vuelve útil al ejercicio es su vara de medir. Un modelo abierto que hoy iguala a Opus 4.5 iguala a Opus 4.5, y no a lo que Anthropic y OpenAI tienen en el mercado esta semana.