Una de las noticias de la semana en el campo de la inteligencia artificial, sobre todo de los modelos de inteligencia artificial de pesos abiertos, es que el modelo DeepSeek V4 Flash fue capaz de obtener una puntuación que supera el umbral de corte en la Olimpiada Internacional de Matemáticas (IMO) 2026.
Datos del logro

No es la primera vez que un modelo de inteligencia artificial, que se supone que fue entrenado exclusivamente para superar estas pruebas de la Olimpiada Internacional de Matemáticas, logra obtener una puntuación aprobatoria.
De hecho, en un informe publicado por Cline, podemos ver cómo al menos 5 modelos de inteligencia artificial lograron alcanzar una buena calificación, pero lo que llama la atención es que DeepSeek V4 Flash lo pudo hacer gastando solo 12 centavos de dólar, siendo un modelo 143 veces más barato de lo que hizo, por ejemplo, Claude Fable 5 para obtener una puntuación aún mayor.

Las pruebas realizadas
Las pruebas que tuvieron que superar los modelos de inteligencia artificial fueron las seis pruebas oficiales de la Olimpiada Internacional de Matemáticas. Las mismas constan de 6 problemas en los que no solo tienen que resolver, sino que tienen que demostrar de manera ordenada cómo lo resolvieron.
Para poder aprobar, el umbral de corte es de 30 puntos con un máximo de 42. Si bien el modelo de pesos abiertos DeepSeek V4 Flash no fue el que mejor puntuación obtuvo, sino que sencillamente le alcanzó para superar el umbral de corte (30/42), no deja de ser llamativo que lo hizo por solo 12 centavos de dólar.

Hitos del razonamiento de frontera
Como bien decía antes, no es la primera vez que un modelo de inteligencia artificial es entrenado para superar las pruebas de la Olimpiada Internacional de Matemáticas. En el pasado reciente, modelos de OpenAI lo habían logrado, aunque claro, con un consumo mucho mayor.
Y eso nos lleva a hablar de cómo los hitos de razonamiento de frontera cada vez se distancian más en cuanto a sus capacidades y cada vez se abaratan más en cuanto al consumo energético, en cuanto a la eficiencia o inferencia de los modelos y, por supuesto, al gasto en tokens.
Uno de los casos más paradigmáticos acerca de cómo el conocimiento humano especializado en un área concreta y una máquina construida y entrenada para superarlo, es el duelo entre la IBM Deep Blue y el campeón mundial de ajedrez Garry Kasparov. En 1997, se gastaron cerca de 9.5 millones de dólares si lo ajustamos a la inflación, crear una supercomputadora que pudiera llevar a cabo movimientos para vencer al campeón mundial de ajedrez.
Hoy en día, en casos como ese, bastaría con un motor de ajedrez especializado y de pesos abiertos (que se puede instalar incluso en un smartphone con suficiente memoria RAM), lo que deja entrever que cada vez las capacidades de la Inteligencia Artificial para resolver problemas complejos son mucho mayores.