Saltar al contenido

DeepSeek abre V4-Flash en beta: supera a V4-Pro Preview en nueve pruebas y cuesta un tercio

La API de DeepSeek V4-Flash ya está en beta pública: gana los nueve benchmarks de la casa y cuesta un tercio.

por Dilis Salazar
Close-up of colorful programming code on a blurred computer monitor.
Foto de Al Nahian en Pexels

TL;DR:

  • DeepSeek liberó el 31 de julio de 2026 la beta pública de la API oficial de V4-Flash, con el build DeepSeek-V4-Flash-0731 y sin cambiar el nombre con el que los desarrolladores ya llamaban al modelo.
  • El modelo declara 82.7 puntos en Terminal Bench 2.1 frente a los 72.1 de V4-Pro Preview, y salta de 7.3 a 54.4 en DeepSWE contra su propia versión de vista previa.
  • V4-Flash trabaja con 13,000 millones de parámetros activos y cobra 0.14 y 0.28 dólares por millón de tokens; V4-Pro usa 49,000 millones y cobra 0.435 y 0.87.

DeepSeek puso en beta pública la API oficial de V4-Flash el viernes 31 de julio de 2026, con un build bautizado DeepSeek-V4-Flash-0731 que la empresa china presenta como un salto en capacidades de agente. Para quien ya programaba contra el modelo no hay trámite: la forma de llamarlo sigue igual y basta con pedir deepseek-v4-flash para recibir la versión nueva. Lo interesante está en la tabla que la propia compañía publicó junto a los pesos. Su modelo pequeño queda por encima de V4-Pro Preview, el grande de la casa, en los nueve benchmarks de agentes y programación que eligió mostrar. Y cuesta la tercera parte. Bloomberg fechó el anuncio a las 6:50 UTC del viernes.

DeepSeek-V4-Flash es un modelo de lenguaje de mezcla de expertos que activa solo una fracción de sus parámetros en cada consulta, admite una ventana de contexto de un millón de tokens y se distribuye con pesos abiertos bajo licencia MIT. El comunicado del registro de cambios de DeepSeek lo resume con una frase corta: "capacidades de agente notablemente mejoradas, con resultados que superan por mucho a V4-Pro-Preview".

La tabla pone al barato arriba del caro, y no por poco

Estos son los números que DeepSeek publicó en la ficha del modelo en Hugging Face, comparando el build nuevo contra su vista previa y contra V4-Pro Preview:

  • Terminal Bench 2.1, la prueba de referencia para tareas de agente en terminal: 82.7 contra 61.8 de la vista previa y 72.1 de Pro. Opus-4.8 aparece en 85.0.
  • DeepSWE, el salto más brutal de toda la tabla: de 7.3 a 54.4. Pro Preview se quedaba en 12.8.
  • Cybergym, ciberseguridad ofensiva: de 38.7 a 76.7, exactamente el doble.
  • Toolathlon-Verified, uso de herramientas: 70.3 contra 55.9 de Pro.
  • DSBench-FullStack, desarrollo completo: de 37.0 a 68.7.
  • Agents' Last Exam: 25.2, a medio punto de los 25.7 que la misma tabla le adjudica a Opus-4.8.

En las filas donde ambos tienen puntaje, V4-Flash queda por encima de GLM-5.2, el modelo abierto chino con el que compite de frente. Contra Opus-4.8 se queda corto en casi todas, pero el margen es de unos pocos puntos en tres de ellas y no de una liga entera. Nada de esto ha sido replicado por un tercero, que es la advertencia obligatoria cuando el vendedor publica su propia boleta. OpenAI hizo lo mismo esta semana con ARC-AGI-3 y quedó igual de expuesto a la misma pregunta.

⚠️
Las nueve cifras las publicó DeepSeek y ningún laboratorio independiente las ha replicado. Dos de las pruebas, DSBench-FullStack y DSBench-Hard, son conjuntos de datos internos de la propia empresa. Y el arnés con el que corrió las tareas de agente de código, DeepSeek Harness, todavía no se libera.

La cuenta que no aparece en los titulares: un tercio del precio y cinco veces más concurrencia

Aquí es donde la historia deja de ser un anuncio técnico. La documentación oficial de DeepSeek publica el precio de los dos modelos en la misma página, así que la comparación no requiere filtraciones ni estimaciones de analistas.

V4-Flash cobra 0.14 dólares por millón de tokens de entrada sin caché y 0.28 por millón de salida. V4-Pro cobra 0.435 y 0.87. Es 3.1 veces más caro, con el mismo factor en las dos puntas. Si la entrada llega en caché, Flash baja a 0.0028 dólares, cincuenta veces menos que sin caché, que es justo el escenario de un agente reenviando el mismo contexto largo una y otra vez.

El detalle que casi nadie levantó está en la última fila de esa tabla: DeepSeek permite 2,500 llamadas concurrentes a Flash y solo 500 a Pro. Cinco veces más capacidad para el modelo barato. Una empresa no reparte así su cómputo por accidente.

Racks de servidores iluminados en el pasillo de un centro de datos
Imagen ilustrativa: la API de V4-Flash admite hasta 2,500 llamadas concurrentes, cinco veces más que la de V4-Pro · Foto de panumas nikhomkhai en Pexels

Los tamaños cierran el argumento. Según las fichas de la propia DeepSeek, V4-Flash suma 284,000 millones de parámetros y activa 13,000 millones; V4-Pro llega a 1.6 billones y activa 49,000 millones. Menos de una quinta parte del total y poco más de una cuarta parte de lo que de verdad se enciende en cada consulta. Con eso gana los nueve benchmarks. La arquitectura de la serie V4 explica de dónde sale el margen: atención híbrida con compresión agresiva, que según la compañía deja al modelo grande operando con el 27% de las operaciones por token y el 10% de la memoria caché que necesitaba V3.2 en un contexto de un millón de tokens.

DeepSeek: la brecha con EE. UU. es de cómputo
Una charla filtrada de casi cuatro horas revela la estrategia de DeepSeek: cómputo, código abierto y AGI.

Solo cambió la API, y ese recorte importa

La actualización no toca la aplicación ni el sitio de DeepSeek, y tampoco la API de V4-Pro: lo confirma TechNode, que publicó a las 07:19 UTC citando la documentación oficial. Solo se movió el modelo detrás del nombre deepseek-v4-flash. Misma arquitectura, mismo tamaño, mismo precio, entrenamiento posterior distinto. Quien tenga una integración en producción cambió de modelo el viernes sin enterarse.

El resto del anuncio se lee como una estrategia de distribución más que como una demostración de músculo. La API de DeepSeek habla formato de OpenAI y formato de Anthropic desde la misma dirección base, y el build de hoy suma soporte nativo para la Responses API y adaptación a Codex. La propia documentación de la empresa dice que herramientas como Claude Code, GitHub Copilot u OpenCode pueden usar DeepSeek como modelo de fondo sin escribir una línea. Un laboratorio chino de pesos abiertos que se enchufa a las herramientas de sus competidores estadounidenses y cobra un tercio.

Hay un dato de calendario que ordena todo esto: los nombres viejos de la API, deepseek-chat y deepseek-reasoner, quedaron retirados el 24 de julio de 2026. Esta beta llega exactamente una semana después de que la compañía cerrara la puerta de atrás. Nikkei Asia enmarcó el lanzamiento dentro de la guerra de precios que atraviesa el sector.

El salto más grande está en el benchmark de ciberseguridad ofensiva

Vale la pena volver a esa fila. Cybergym mide qué tan bien un modelo encuentra y explota fallas de seguridad, y V4-Flash pasó de 38.7 a 76.7 en un solo ciclo de entrenamiento posterior. El doble. En un modelo cuyos pesos cualquiera puede descargar y correr en su propio hardware bajo licencia MIT.

Esa cifra aterrizó el mismo día que un reporte incómodo. BleepingComputer publicó el 31 de julio, a las 13:35, el hallazgo de Unit 42, el equipo de inteligencia de amenazas de Palo Alto Networks: un actor de habla china que opera bajo los alias "knaithe" y "KnYuan" está usando DeepSeek como motor de razonamiento del agente de código abierto Hermes para atacar servidores expuestos con intervención humana mínima. Los investigadores lo descubrieron por un descuido, cuando el propio agente levantó por accidente un servidor web desde su directorio personal y dejó a la vista llaves de API, scripts de exploit, listas de objetivos e historial de sesiones.

En una sesión recuperada de mayo de 2026, el operador dio una instrucción inicial y el agente hizo el resto solo: rastreó instancias vulnerables de Langflow, descartó el objetivo cuando no pudo explotarlo, revisó repositorios públicos de exploits, eligió la plataforma n8n con más de 647,000 instancias expuestas y probó una cadena de dos vulnerabilidades. No comprometió ni un servidor: los formularios que necesitaba pedían autenticación. Aun así, Unit 42 escribe que el flujo de trabajo "confirma una capacidad ofensiva autónoma de punta a punta", porque el sistema comprimió en minutos un trabajo de análisis de objetivos que a una persona le llevaría cientos de horas.

Dos precisiones honestas antes de sacar conclusiones. Unit 42 no especifica qué versión de DeepSeek usaba el atacante, y la sesión documentada es anterior al build que salió este viernes, así que nada conecta directamente ese caso con el 76.7 de hoy. Lo que sí queda es el hecho de que el mismo atacante tenía configurados Qwen, GLM, Kimi, MiniMax, Claude Code y Codex, y los investigadores encontraron que casi no los usaba. Escogió DeepSeek.

Preguntas rápidas sobre DeepSeek V4-Flash

¿Cuánto cuesta usar la API de DeepSeek V4-Flash?

La documentación oficial de DeepSeek fija 0.14 dólares por millón de tokens de entrada sin caché y 0.28 por millón de salida. Si la entrada llega en caché, el precio baja a 0.0028, cincuenta veces menos. La ventana de contexto es de un millón de tokens y la salida máxima, de 384,000.

¿En qué se diferencia V4-Flash de V4-Pro?

V4-Flash suma 284,000 millones de parámetros y activa 13,000 millones; V4-Pro llega a 1.6 billones y activa 49,000 millones. Pro cobra 0.435 y 0.87 dólares por millón de tokens, poco más del triple, y su límite de concurrencia es de 500 llamadas frente a las 2,500 de Flash.

¿Cambió algo en la app o la web de DeepSeek?

No. Según TechNode y la documentación oficial, la actualización del 31 de julio de 2026 alcanza únicamente a la API de V4-Flash. La API de V4-Pro y los modelos que corren en la aplicación y el sitio web de DeepSeek siguen exactamente igual que antes del anuncio.

Para un equipo pequeño en México, España o cualquier país de América Latina, la cuenta que sale de esta beta es concreta: un millón de tokens de salida por 28 centavos de dólar, con pesos descargables si el proyecto exige correr el modelo en casa. Eso cambia qué se puede construir con un presupuesto de arranque. La otra cara de la moneda también está en la misma tabla, con su puntaje y todo, y la publicó la propia empresa.

Fuentes: 1, 2, 3

Dilis Salazar imagen de perfil
por Dilis Salazar

Suscríbete GRATIS

Recibe las noticias más importantes de política, tecnología, negocios, deportes, entretenimiento y cultura directamente en tu correo.

¡Listo! Revisa tu correo

Para completar la suscripción, haz clic en el enlace de confirmación que enviamos a tu correo. Si no llega en 3 minutos, revisa tu carpeta de spam.

Ok, gracias

Leer más de Tecnología y Ciencia