> ## Content Index
> Fetch the complete content index at: https://fomoera.com/llms.txt
> Use this file to discover other available public pages before exploring further.

# DeepSeek ya lee imágenes: gana 3 de 11 pruebas a Opus 4.8 y no se compara con Opus 5
- URL: https://fomoera.com/deepseek-ya-lee-imagenes-gana-3-de-11-pruebas-a-opus-4-8-y-no-se-compara-con-opus-5/
- Published: 2026-08-21T19:00:49.000Z
- Updated: 2026-08-21T19:00:49.000Z
- Description: DeepSeek abrió su primer modelo de visión en la familia V4 y dice que se acerca a Opus 4.8 en tareas de agente. Su propia tabla le da tres victorias en once pruebas, y deja fuera al Opus 5 que Anthropic vende al mismo precio.
- Author: Dilis Salazar
- Tags: Tecnología y Ciencia, IA

**TL;DR:**

- DeepSeek habilitó el viernes 21 de agosto de 2026 el modelo experimental DeepSeek-V4-Flash-Vision-Exp, que suma lectura de imágenes y capturas de pantalla a su modelo barato de agentes.
- En la tabla de once pruebas que publicó la empresa, el modelo supera a Claude Opus 4.8 en tres y queda por debajo en ocho, con 12 puntos de diferencia en NL2Repo.
- La comparación no incluye a Claude Opus 5, que Anthropic presentó el 24 de julio y cobra al mismo precio que Opus 4.8: 5 dólares por millón de tokens de entrada y 25 de salida.

---

DeepSeek abrió el viernes 21 de agosto de 2026 el acceso a DeepSeek-V4-Flash-Vision-Exp, una versión experimental de su modelo económico que ya interpreta imágenes y capturas de pantalla y actúa sobre lo que ve. La empresa de Hangzhou afirmó que su desempeño en pruebas de agente multimodal queda cerca del Opus 4.8 de Anthropic. La tabla que ella misma publicó, con once resultados, matiza bastante ese resumen: el modelo nuevo gana tres pruebas y pierde ocho, y en la más dura la distancia es de doce puntos. Falta además una columna entera. Anthropic presentó Claude Opus 5 el 24 de julio y lo puso a la venta al mismo precio que Opus 4.8, así que la referencia elegida no es la más reciente del catálogo rival ni la más cara. El modelo ya se puede llamar desde la API con el precio de V4-Flash.

## La tabla la publicó DeepSeek y la gana en tres pruebas de once

Las tres victorias son estrechas, según el recuento de The Next Web sobre esa tabla: DeepSWE por 1.3 puntos, Agents' Last Exam por 1.6 y ZeroBench por 1.0\. En las otras ocho el modelo chino queda atrás, y en dos por márgenes que no se explican con el redondeo. NL2Repo, que mide la construcción de repositorios completos a partir de instrucciones en lenguaje natural, deja 57.7 contra 69.7\. DSBench-Hard marca 63.6 contra 71.7.

El resto se juega en decimales. Toolathlon-Verified reparte 75.9 y 76.2\. Chartography, que evalúa la lectura de gráficas profesionales, queda 64.3 contra 65.0\. Terminal Bench 2.1 termina 83.9 contra 85.0\. Ese es el terreno donde la frase "cerca de Opus-4.8" se sostiene sin problema.

Hay un dato de la tabla que no habla de la competencia sino del estado del oficio. En AutomationBench, los tres modelos de la tabla se quedaron entre 25.1 y 27.2 puntos. Ninguno resuelve todavía ese conjunto de tareas.

## El salto multimodal se midió contra un modelo que no podía ver las imágenes

El titular del anuncio es el avance frente a V4-Flash en escenarios que exigen vista. En ApexBench la diferencia es de 36.5 contra 26.2, y en Agents' Last Exam de 27.3 contra 25.2.

La nota al pie de la propia tabla explica de dónde sale parte de esa distancia: en esas dos evaluaciones, el modelo de texto pasa por alto los elementos multimodales de esas pruebas. Es decir, a V4-Flash se le calificó en tareas con imágenes que no podía procesar. El resultado del modelo con visión no queda invalidado por eso, pero sí cambia lo que significa: una porción del salto mide qué gana un sistema que antes respondía sin poder ver las imágenes del examen. DeepSeek lo publicó en la misma tabla en lugar de dejar que alguien lo encontrara.

En sentido contrario, la empresa se quedó corta con otro resultado. Dijo que la variante con visión "iguala" a V4-Flash en texto y sus propias cifras la dejan por encima en seis de las siete pruebas textuales, con mejoras de 5.6 puntos en Toolathlon-Verified, 4.9 en DeepSWE y 4.0 en DSBench-Hard. La excepción es Cybergym, la prueba de seguridad, donde el modelo con visión baja a 75.3 desde los 76.7 del modelo de texto.

![A close-up view of a laptop screen showing a coding and data analysis software interface in an indoor setting.](https://fomoera.com/content/images/2026/08/fomoera-pexels-34804005--source.jpg)

El modelo convierte cada imagen en tokens antes de razonar sobre ella. Imagen ilustrativa, no corresponde a una salida real del sistema · Foto de [Daniil Komov](https://www.pexels.com/@dkomov?ref=fomoera.com) en [Pexels](https://www.pexels.com/photo/laptop-displaying-coding-and-data-analysis-interface-34804005/?ref=fomoera.com)

## El Opus que falta en la comparación cuesta lo mismo que el Opus comparado

DeepSeek no eligió un rival abandonado. Opus 4.8 sigue vigente en el catálogo de Anthropic y The Next Web verificó que la página de retiro de modelos lo mantiene como activo, con soporte pleno y sin fecha de baja anterior a mayo de 2027\. Cinco modelos Opus comparten hoy ese estado.

Lo que no aparece por ningún lado es una columna de Opus 5, y nadie más ha publicado esa medición. Aquí es donde el argumento del precio, que suele explicar por qué un laboratorio se compara con el modelo anterior, deja de funcionar: Anthropic lanzó Opus 5 el 24 de julio de 2026 y lo puso a **5 dólares por millón de tokens de entrada y 25 de salida**, exactamente lo mismo que cobra Opus 4.8, según su propio anuncio. Elegir el modelo viejo no abarata la comparación. Los tres modelos que importan aquí, con su precio de lista y su lugar en la tabla, quedan así:

| Modelo                                              | Precio por millón de tokens                          | ¿Está en la tabla de DeepSeek? |
| --------------------------------------------------- | ---------------------------------------------------- | ------------------------------ |
| DeepSeek-V4-Flash-Vision-Exp (21 de agosto de 2026) | 0.22 de entrada y 0.66 de salida, fuera de hora pico | Sí, en las once pruebas        |
| Claude Opus 4.8                                     | 5 de entrada y 25 de salida                          | Sí, en las once pruebas        |
| Claude Opus 5 (24 de julio de 2026)                 | 5 de entrada y 25 de salida                          | No aparece                     |

Tampoco es la primera vez que la casa se mide contra ese rival. Cuando DeepSeek abrió la beta pública de V4-Flash el 31 de julio, [su tabla ya ponía a Opus 4.8 arriba en casi todas las filas](https://fomoera.com/deepseek-abre-v4-flash-en-beta-supera-a-v4-pro-preview-en-nueve-pruebas-y-cuesta-un-tercio/) y la diferencia se contaba en unos pocos puntos.

Todas las cifras del anuncio salieron del laboratorio que vende el modelo, evaluado con su propio arnés en modo mínimo, con temperatura 1.0 y top\_p 0.95\. Que un fabricante publique sus números es normal y aquí incluso vienen con la configuración declarada. Siguen siendo del fabricante.

## Una imagen cuesta como máximo 384 tokens, sin importar su tamaño

Para quien vaya a integrarlo, la documentación de DeepSeek trae las condiciones que deciden la factura. Antes de razonar, el servicio redimensiona cada imagen hasta dejarla en el equivalente aproximado de 800 por 800 píxeles, de modo que el techo se queda en **384 tokens por imagen**: una foto de 2000 por 2000 y otra de 5000 por 5000 consumen lo mismo. Esos tokens se cobran junto con los de texto, a la tarifa de entrada.

El resto de los límites también está publicado: hasta 600 imágenes por petición, 48 MiB de cuerpo, 8192 píxeles por lado que bajan a 4096 cuando la petición lleva quince imágenes o más, y formatos JPEG, PNG, GIF y WebP detectados por el contenido del archivo y no por su extensión. Las imágenes solo se aceptan en mensajes del usuario. Y a diferencia de los otros dos modelos de la familia, este no admite completado FIM.

Hay un detalle de integración que vale por sí solo: las imágenes pueden enviarse por el endpoint compatible con Anthropic que DeepSeek expone en `api.deepseek.com/anthropic`. El modelo que se anuncia como alternativa a Opus se consume, si el desarrollador quiere, con el mismo formato de mensajes que usa Anthropic.

Conviene mirar el reloj antes de calcular costos. La tarifa de 0.22 y 0.66 dólares corresponde a las horas valle; en las horas pico se duplica, y esas horas son de 01:00 a 04:00 y de 06:00 a 10:00 UTC. En el centro de México, seis horas atrás, eso cae de 19:00 a 22:00 y de 00:00 a 04:00.

## La prueba que cerraría la discusión no se ha corrido

La medición que zanjaría el asunto tiene nombre y no tiene resultados: correr V4-Flash-Vision-Exp contra Opus 5 con el mismo arnés y las mismas condiciones. Nadie la ha publicado, y sin ella no hay forma de saber si la cercanía que muestra la tabla sobrevive frente al modelo que Anthropic vende hoy.

Lo verificable mientras tanto es más estrecho que los titulares: un modelo experimental chino se queda a pocos puntos de un rival estadounidense vigente en la mayor parte de un conjunto de pruebas, gana tres de once, pierde por doce puntos en la tarea que más le importa a quien compra agentes para trabajar sobre repositorios, y cuesta una fracción.

*Fuentes:* [1](https://thenextweb.com/news/deepseek-v4-flash-vision-exp-opus-benchmarks?ref=fomoera.com), [2](https://api-docs.deepseek.com/guides/vision?ref=fomoera.com), [3](https://api-docs.deepseek.com/quick%5Fstart/pricing?ref=fomoera.com), [4](https://www.anthropic.com/news/claude-opus-5?ref=fomoera.com)