> ## Content Index
> Fetch the complete content index at: https://fomoera.com/llms.txt
> Use this file to discover other available public pages before exploring further.

# DeepSeek jubila a V4-Pro por un Flash que, según sus pruebas, empata con Opus 5 en DeepSWE
- URL: https://fomoera.com/deepseek-jubila-a-v4-pro-por-un-flash-que-segun-sus-pruebas-empata-con-opus-5-en-deepswe/
- Published: 2026-09-11T00:30:32.000Z
- Updated: 2026-09-11T00:30:32.000Z
- Description: El nuevo modelo abierto de DeepSeek lee con 8,000 millones de parámetros activos, usa una cuarta parte de la caché de V4-Flash y baja sus tarifas. En la tabla de la empresa empata con Opus 5 en DeepSWE, pero queda lejos en Terminal-Bench 4.0 y en Humanity's Last Exam.
- Author: Patricia Rodriguez
- Tags: Tecnología y Ciencia, IA

DeepSeek lanzó V4.1-Flash el jueves 10 de septiembre de 2026, un modelo de pesos abiertos con 552,000 millones de parámetros, contexto de un millón de tokens y comprensión nativa de imágenes que, según la empresa, supera a su modelo insignia en tareas de agentes. Con ese argumento jubilará V4-Pro: desde el lunes 14 de septiembre, toda petición a ese modelo en su API la atenderá V4.1-Flash y se cobrará a su tarifa, más baja. El cambio de fondo está en una arquitectura que activa 8,000 millones de parámetros para leer y 16,000 millones para escribir, y en una caché de contexto que ocupa una cuarta parte de la que necesitaba V4-Flash. Ese mismo jueves, las acciones de MiniMax y Z.ai, dos rivales chinos, cayeron más de 8% en Hong Kong, según Bloomberg.

## Lee con 8,000 millones de parámetros y escribe con 16,000 millones

V4.1-Flash es, según DeepSeek, el más pequeño de una nueva familia de arquitectura pensada para crecer hacia modelos mayores. La empresa la llama Causal Encoder-Decoder. Su ficha en Hugging Face la describe como un Transformer de 40 capas dividido en un codificador causal de 20 capas y un decodificador de otras 20, que construye su caché con lo que ya calculó el codificador en lugar de derivarla de cada una de sus propias capas. De ahí sale la asimetría: menos parámetros activos al leer que al escribir.

El diseño apunta a los agentes, que procesan entradas nuevas con cada llamada a una herramienta. De acuerdo con The Decoder, que revisó el informe técnico, DeepSeek calcula que así casi reduce a la mitad el cómputo que exige procesar la entrada.

La segunda apuesta está en la caché KV, la memoria donde el modelo guarda lo que ya procesó de un contexto para no recalcularlo en cada paso. En un agente que trabaja durante muchas etapas crece rápido y presiona la memoria de las GPU, los SSD y el ancho de banda, lo que encarece el despliegue, explica ese medio. V4.1-Flash la deja en 890 bytes por token, alrededor de una cuarta parte de lo que usa V4-Flash, con ayuda de una caché principal en formato FP4; la porción que se guarda de forma persistente en SSD baja a cerca de un octavo. Frente a DeepSeek-V1, la empresa calcula una reducción de 437 veces, y en su anuncio liga ese ahorro con la factura: los cargos por aciertos de caché suelen pesar mucho en el costo de un agente.

![Detailed view of RAM sticks and microprocessors on a motherboard.](https://fomoera.com/content/images/2026/09/fomoera-pexels-6636474--source.jpg)

Imagen ilustrativa de hardware de servidor; no corresponde a la infraestructura de DeepSeek · Foto de [Sergei Starostin](https://www.pexels.com/@sejio402?ref=fomoera.com) en [Pexels](https://www.pexels.com/photo/green-and-black-computer-ram-stick-6636474/?ref=fomoera.com)

El modelo, igual que su codificador de visión, se entrenó desde cero, con un corpus de 45 billones de tokens de texto e imágenes. En el posentrenamiento, DeepSeek no tocó los algoritmos: atribuye la mejora a sintetizar a gran escala tareas y entornos para agentes. El esfuerzo de razonamiento se regula con un valor continuo del 1 al 100, y los pesos están en Hugging Face con licencia MIT.

## Dónde gana y dónde pierde, según la tabla de DeepSeek

Las cifras que siguen son de la propia DeepSeek, obtenidas con el esfuerzo de razonamiento al máximo, y TNW advierte que ninguna está verificada de forma independiente. Esta tabla reúne siete de las pruebas publicadas y compara el modelo nuevo con V4-Pro y con Claude Opus 5, de Anthropic.

__Resultados publicados por DeepSeek el 10 de septiembre de 2026 con esfuerzo máximo de razonamiento (puntuación; más alto es mejor)__
| Prueba                                 | DeepSeek V4.1-Flash    | DeepSeek V4-Pro   | Claude Opus 5 |
| -------------------------------------- | ---------------------- | ----------------- | ------------- |
| DeepSWE v1.1                           | 74.2                   | 62.7              | 74.0          |
| Terminal-Bench 2.1                     | 90.6                   | 87.9              | 89.1          |
| Terminal-Bench 4.0                     | 31.2                   | 12.4              | 51.8          |
| ProgramBench                           | 20.3                   | 15.5              | 37.0          |
| AutomationBench                        | 54.8                   | 43.2              | 50.3          |
| GPQA Diamond                           | 90.9                   | 92.4              | 93.4          |
| Humanity's Last Exam, sin herramientas | 36.8 (39.1 solo texto) | 42.7 (solo texto) | 56.3          |

En DeepSWE v1.1, una prueba de ingeniería de software, V4.1-Flash marca 74.2 y queda en un empate práctico con Opus 5, que registra 74.0; GPT-5.6 Sol, de OpenAI, llega a 73.0\. La misma ficha muestra cuánto pesa el arnés, el software que conecta al modelo con la terminal y sus herramientas. DeepSeek usó mini-SWE, el que pide la configuración oficial de la prueba; con Claude Code como arnés, el mismo modelo baja a 69.8, y con Codex, a 65.6.

Opus 5 también queda por debajo en Terminal-Bench 2.1 (89.1 contra 90.6) y en AutomationBench (50.3 contra 54.8). El retrato cambia en las versiones posteriores de Terminal-Bench: en la 3.0, V4.1-Flash saca 30.0 y en la 4.0, 31.2, lejos de Opus 5 (43.3 y 51.8) y de GPT-5.6 Sol (34.4 y 39.9). En ProgramBench, otra prueba de programación, se queda en 20.3 frente a 37.0 de Opus 5, y en Humanity's Last Exam sin herramientas, un examen de preguntas de nivel experto, obtiene 36.8 frente a 56.3 del modelo de Anthropic.

Ante V4-Pro, el modelo al que va a reemplazar, gana en las 12 pruebas de agentes que tienen cifra para ambos, con saltos como el de Terminal-Bench 4.0, de 12.4 a 31.2\. Cede en las preguntas de nivel experto: 90.9 contra 92.4 en GPQA Diamond y 39.1 contra 42.7 en la parte de solo texto de Humanity's Last Exam. En los modelos base, antes del posentrenamiento, la brecha en SimpleQA-Verified, que mide conocimiento factual, es mayor: 42.3 contra 55.2.

The Decoder encontró otras salvedades en el informe técnico. El nivel máximo de razonamiento mejora los resultados, pero genera unas 2.5 veces más tokens de salida. Durante el entrenamiento, los agentes intentaron a veces engañar a su sistema de recompensas, tumbaron por accidente el entorno de pruebas y llegaron a aprovechar vulnerabilidades recién divulgadas o a borrar archivos críticos del sistema. El informe también reconoce una distancia medible con los mejores sistemas cerrados al leer imágenes complejas, algo que la tabla de DeepSeek refleja en Chartography con herramientas, donde saca 78.9 frente a 84.0 de Opus 5.

## Las tarifas bajan, pero no vuelven a las de antes de agosto

Los precios nuevos rigen desde las 04:00 UTC del 10 de septiembre. Fuera del horario pico, V4.1-Flash cobra 0.003 dólares por millón de tokens de entrada que aciertan en caché, 0.15 por los que no aciertan y 0.60 por millón de tokens de salida; en horario pico, el doble. DeepSeek fija ese horario de 01:00 a 04:00 y de 06:00 a 10:00 UTC, de lunes a viernes. En Ciudad de México equivale a las noches de domingo a jueves, de 19:00 a 22:00, y a las madrugadas de lunes a viernes, de 00:00 a 04:00\. En Madrid, con el horario de verano, cae de lunes a viernes de 03:00 a 06:00 y de 08:00 a 12:00.

Frente a las tarifas que V4-Flash estrenó el 16 de agosto con el esquema de horas pico, detalladas entonces por InfoWorld, la entrada sin caché fuera de pico baja de 0.22 a 0.15 dólares, casi 32%, y la salida, de 0.66 a 0.60, cerca de 9%. El recorte no deshace la subida de agosto. Hasta ese día, V4-Flash cobraba una tarifa plana de 0.14 dólares por millón de tokens de entrada sin caché y 0.28 por millón de salida, así que, incluso fuera de pico, hoy la entrada sin caché queda un centavo por encima y la salida cuesta más del doble.

## Qué cambia para quien ya usa la API de DeepSeek

V4-Flash y su variante experimental con visión salieron de servicio con el lanzamiento. La API sigue aceptando sus nombres, pero esas peticiones ya las atiende V4.1-Flash con tarifa Flash, y DeepSeek pide cambiar al nombre "deepseek-flash".

El relevo de V4-Pro llega a las 04:00 UTC del lunes 14 de septiembre, las 22:00 del domingo 13 en Ciudad de México. Desde ese momento, V4.1-Flash atenderá las peticiones dirigidas a "deepseek-v4-pro" y las cobrará con su tarifa: fuera de pico, la entrada sin caché pasa de 0.66 a 0.15 dólares por millón de tokens y la salida, de 1.98 a 0.60, recortes de 77% y 70%. El arreglo durará hasta que llegue V4.1-Pro, un modelo para el que DeepSeek no dio fecha. La factura baja, pero el modelo también cambia: gana en agentes y cede en las preguntas de nivel experto que V4-Pro resolvía mejor.

## MiniMax y Z.ai caen en Hong Kong el día del lanzamiento

Además de MiniMax y Z.ai, Alibaba, que se está volcando a la inteligencia artificial, cedió más de 2% en Hong Kong, según Bloomberg. La agencia sitúa el lanzamiento en la guerra de precios entre los modelos abiertos chinos y los de Estados Unidos, justo cuando Anthropic y OpenAI preparan su salida a bolsa. También recoge el término que usa Artificial Analysis para ese fenómeno, una "zona de muerte" de DeepSeek, en la que un competidor tiene que ganarles en precio a DeepSeek y a sus pares chinos o superarlos con claridad en capacidad.

DeepSeek también empezó a preparar su propia salida a bolsa en el STAR Market de Shanghái, según Reuters. Y el modelo llega dos días después de que la NSA, el FBI y CISA señalaran a DeepSeek, MiniMax, Z.ai y otras tres empresas chinas por supuestas campañas de destilación a escala industrial contra modelos estadounidenses. China respondió el miércoles que esas acusaciones carecen de fundamento, recogió AFP.

[EE. UU. acusa a seis firmas chinas de copiar su IALa NSA, el FBI y CISA acusan a seis empresas chinas de IA de extraer capacidades de Claude, GPT, Gemini y Grok desde 2024.![](https://fomoera.com/content/images/icon/favicon-7fa3f2f2-ed30-43e3-a227-3a884bcb791d.ico)FomoEraPatricia Rodriguez![](https://fomoera.com/content/images/thumbnail/fomoera-ee-uu-acusa-a-deepseek-alibaba-y-otras-cuatro-de-copiar-a-claude-y-gpt-a-escala-industrial-384e078d-16x9-v2-1600x900-f4d585c0-655f-4aa1-8e7c-dd01dc5051b2.webp)](https://fomoera.com/ee-uu-acusa-a-deepseek-alibaba-y-otras-cuatro-de-copiar-a-claude-y-gpt-a-escala-industrial/)

El primer efecto se notará en las facturas. Desde el lunes, todo el tráfico de V4-Pro en la API de DeepSeek pasará a un modelo más pequeño y más barato, cuyas cifras de rendimiento por ahora solo ha publicado su propio fabricante.

*Fuentes:* [1](https://www.deepseek.com/en/news/deepseek-v4-1-flash/?ref=fomoera.com), [2](https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash?ref=fomoera.com), [3](https://www.deccanchronicle.com/technology/chinas-deepseek-unveils-v41-flash-model-1986393?ref=fomoera.com), [4](https://the-decoder.com/new-deepseek-model-v4-1-flash-cuts-memory-needs-for-ai-agents/?ref=fomoera.com), [5](https://api-docs.deepseek.com/quick%5Fstart/pricing?ref=fomoera.com), [6](https://www.infoworld.com/article/4209439/deepseek-raises-some-v4-prices-by-more-than-10x-as-ai-demand-strains-capacity.html?ref=fomoera.com)