> ## Content Index
> Fetch the complete content index at: https://fomoera.com/llms.txt
> Use this file to discover other available public pages before exploring further.

# Vera Rubin NVL72 logra hasta 7.2 veces más tokens por MW que GB300 en DeepSeek
- URL: https://fomoera.com/vera-rubin-72-veces-tokens-mw-gb300-deepseek/
- Published: 2026-09-15T02:30:03.000Z
- Updated: 2026-09-15T02:30:03.000Z
- Description: Las pruebas de SemiAnalysis con AgentX muestran una ventaja máxima de 7.2 veces frente a GB300, pero el resultado cambia según el motor de inferencia, la meta de interactividad y el modelo.
- Author: Gerardo Pavez
- Tags: Tecnología y Ciencia, IA

Las primeras pruebas públicas de la plataforma NVIDIA Vera Rubin NVL72 muestran hasta 7.2 veces más tokens por segundo por megavatio que un sistema GB300 NVL72 de Blackwell en un escenario de inferencia agéntica con DeepSeek V4 Pro de 1.6T parámetros, según un análisis publicado por SemiAnalysis el 14 de septiembre de 2026\. El máximo aparece a 150 tokens por segundo de interactividad y frente a GB300 ejecutando SGLang, por lo que no representa una ventaja fija de Rubin sobre todo Blackwell. A 100 TPS, la diferencia frente a la configuración GB300 SGLang más fuerte es de 2.09 veces. El dato importa porque, en una fábrica de IA con potencia limitada, la métrica determina cuántos tokens puede servir un operador con la misma capacidad eléctrica.

## La ventaja máxima aparece en un punto concreto del benchmark

SemiAnalysis compara curvas de throughput por MW para distintas metas de interactividad. El artículo estudia DeepSeek V4 Pro 0813, un modelo de 1.6T parámetros que la propia publicación utiliza como referencia para modelos de entre 1T y 3T. Sus cifras muestran que la ventaja de Rubin no permanece constante cuando cambia la velocidad objetivo:

- A 100 TPS, Vera Rubin entrega aproximadamente 59.4 millones de tokens por segundo por MW. GB300 con Dynamo SGLang llega a 28.5 millones, una diferencia de 2.09 veces.
- A 150 TPS, Rubin conserva casi 37 millones de tokens por segundo por MW y aventaja aproximadamente 7.2 veces a GB300 con SGLang.
- A 170 TPS, la ventaja es de 5.56 veces frente a GB300 con SGLang. Si la comparación se hace contra GB300 con TensorRT-LLM, sube a 62.9 veces porque esa curva está cerca de su extremo medido.
- A 200 TPS, la diferencia se reduce a 2.72 veces frente a la configuración GB300 más fuerte en ese punto.

SemiAnalysis aclara que las cifras de la comparación se interpolan entre puntos medidos para poner los motores en la misma meta de velocidad. Por eso, el número más llamativo no debe leerse como una proporción universal entre dos arquitecturas. También es importante que el rival directo de estas cifras sea GB300, la plataforma Blackwell Ultra, y no una categoría indistinta llamada simplemente Blackwell.

## AgentX mide la inferencia, no la calidad del modelo

El benchmark AgentX intenta reproducir tráfico de aplicaciones agénticas con conversaciones de muchos turnos, contextos largos, reutilización de prefijos y ráfagas de subagentes. Su metodología parte de sesiones de Claude Code aportadas de forma voluntaria. El sistema elimina prompts, código y argumentos de herramientas, pero conserva longitudes de solicitudes, reutilización de prefijos, ramas de subagentes y tiempos. Después reconstruye las sesiones con tokens sintéticos y deterministas.

La versión 1.0 del conjunto de datos usa 393 sesiones, con una mediana de 142,000 tokens de entrada y 444 tokens de salida por solicitud; 44% de las sesiones incluyen subagentes. InferenceX advierte que mide el rendimiento del sistema de serving y que sus cargas sintéticas no permiten evaluar la calidad de las respuestas del modelo.

Esto cambia la lectura del resultado. Las 7.2 veces más tokens por MW describen la capacidad de una configuración completa para atender un patrón agéntico concreto. No significan que DeepSeek genere respuestas 7.2 veces más rápido en cualquier aplicación ni que Rubin sea igual de superior en entrenamiento u operaciones de inferencia por lotes.

La métrica principal tampoco equivale a la latencia completa de una solicitud. SemiAnalysis define la interactividad P90 como el inverso de la latencia entre tokens de una respuesta completa en el percentil 90\. El tiempo hasta el primer token y la latencia de extremo a extremo se evalúan por separado. En la misma comparación, Rubin alcanza un máximo P90 de 276.24 TPS frente a 171.53 TPS de GB300 con TensorRT-LLM, pero GB300 con SGLang consigue una interactividad similar. El motor de software altera de forma material el resultado.

## Rubin compara una fábrica de IA completa, no solo una GPU

SemiAnalysis atribuye parte de la diferencia al co-diseño de la plataforma. Vera Rubin combina la GPU Rubin con la CPU Vera, el switch NVLink 6, ConnectX-9, BlueField-4 y Spectrum-6, junto con la capa de serving y los mecanismos de gestión de potencia. NVIDIA describe el NVL72 como un sistema con 72 GPUs Rubin, 36 CPUs Vera y una red NVLink 6 que conecta los componentes del rack.

La consecuencia es que la prueba compara sistemas completos. La memoria disponible para la caché KV, el paralelismo, la comunicación entre expertos de un modelo MoE, la red y el perfil de potencia entran en la cifra final. Presentar el resultado como si fuera una medición aislada del silicio de Rubin escondería buena parte del motivo de la ventaja.

NVIDIA también publica cifras más agresivas, pero bajo condiciones diferentes. Su página del producto anuncia hasta 10 veces más tokens por MW que GB200 usando Kimi-K2 Thinking con una configuración de 32K/8K, y hasta 35 veces más throughput por MW para modelos de un billón de parámetros cuando Vera Rubin se combina con racks Groq 3 LPX. La propia página separa las mediciones de las proyecciones y advierte que el rendimiento de inferencia puede cambiar. Esas cifras no validan directamente el 7.2x de SemiAnalysis porque cambian el modelo, el contexto, el rival, el rack y el objetivo de prueba.

## El modelo económico muestra 42% más ganancia, no el doble

El resumen del análisis habla de más de dos veces la ganancia por gigavatio, pero el escenario económico detallado presenta una diferencia menor. Con una meta de 75 TPS, 60% de utilización, sin costo de licencia del modelo y considerando el costo total de un gigavatio de capacidad eléctrica, SemiAnalysis estima para Vera Rubin **159,500 millones de dólares de ingresos anuales** y **149,900 millones de dólares de ganancia modelada**.

La configuración GB300 Dynamo SGLang más fuerte del mismo ejemplo alcanza 114,900 millones de dólares de ingresos y 105,300 millones de dólares de ganancia modelada. La diferencia es de 39% en ingresos y 42% en ganancia, aproximadamente 1.42 veces, no 2 veces. El análisis calcula una brecha de 44,600 millones de dólares anuales por GW, que equivaldría a unos 446 millones de dólares en una instalación de 10 MW si se escala linealmente.

El caso deja una contradicción que debe conservarse: el resumen utiliza la fórmula de más de 2x, mientras que el ejemplo con cifras completas muestra 42% más ganancia. Sin conocer otro conjunto de supuestos que produzca la primera cifra, no es correcto presentar ambas como si describieran el mismo escenario. La rentabilidad final dependerá del precio de los tokens, la utilización, el costo de energía, el financiamiento, el alquiler o propiedad del hardware y la demanda.

El hallazgo más sólido es más estrecho que el eslogan. En el escenario AgentX con DeepSeek V4 Pro de 1.6T parámetros, Vera Rubin NVL72 alcanzó hasta 7.2 veces más throughput por MW que GB300 con SGLang a una meta de 150 TPS, mientras que la ventaja bajó a 2.72 veces a 200 TPS y cambió de forma drástica con el motor de serving. Es una señal fuerte sobre la importancia del co-diseño y de la energía disponible, pero no una cifra transferible a cualquier modelo o despliegue.

*Fuentes:* [1](https://newsletter.semianalysis.com/p/vera-rubin-nvl72-agentic-inference?ref=fomoera.com), [2](https://inferencex.semianalysis.com/agentx?ref=fomoera.com), [3](https://www.nvidia.com/en-us/data-center/vera-rubin-nvl72/?ref=fomoera.com)