> ## Content Index
> Fetch the complete content index at: https://fomoera.com/llms.txt
> Use this file to discover other available public pages before exploring further.

# Cerebras promete hasta 30 veces la velocidad de una GPU con el chip que lanzó hace dos años
- URL: https://fomoera.com/cerebras-promete-hasta-30-veces-la-velocidad-de-una-gpu-con-el-chip-que-lanzo-hace-dos-anos/
- Published: 2026-08-19T16:00:07.000Z
- Updated: 2026-08-19T16:00:07.000Z
- Description: Cerebras presentó el CS-4, un rack con tres obleas WSE-3 Turbo que promete hasta 30 veces más tokens por segundo y por usuario que una GPU. Su propia ficha muestra que el procesador repite transistores, núcleos, SRAM y proceso del WSE-3 de 2024: la ganancia sale del reloj y de los watts.
- Author: Alejandro Castillo Leone
- Tags: Tecnología y Ciencia, Hardware

**TL;DR:**

- Cerebras presentó el CS-4, un rack con tres obleas WSE-3 Turbo y su nueva arquitectura Nexus; los primeros envíos salen este trimestre y no hay precio anunciado.
- El sistema declara 750 PFLOPS, 129.6 PB/s de ancho de banda de memoria y más de 4,400 tokens por segundo y por usuario en GPT-OSS-120B.
- El WSE-3 Turbo conserva transistores, núcleos, SRAM y proceso del WSE-3 de 2024: la mejora viene de duplicar el reloj y la potencia eléctrica.

---

Cerebras presentó el martes 18 de agosto el CS-4, un rack de servidor con tres obleas de silicio del tamaño de un plato que, según la compañía, entrega hasta 30 veces más tokens por segundo y por usuario que las soluciones basadas en GPU. El anuncio se hizo en su evento Supernova, en San Francisco, tres meses después de su salida a bolsa en el Nasdaq. El dato que no está en el titular del comunicado sí está en su cuerpo: el procesador que la empresa llama WSE-3 Turbo tiene los mismos 4 billones de transistores, los mismos 900,000 núcleos, los mismos 44 GB de SRAM y el mismo proceso de 5 nanómetros de TSMC que el WSE-3 de 2024\. Cerebras le confirmó a The Register que no es silicio nuevo, sino la misma oblea empujada con el doble de potencia eléctrica.

## El WSE-3 Turbo repite oblea, núcleos y memoria del chip de 2024

La tabla que Cerebras incluyó en su comunicado enfrenta un CS-3 de una oblea contra un CS-4 de tres, y ahí todo se multiplica. La comparación entre procesadores está en el texto y cuenta otra historia: el WSE-3 Turbo mide los mismos 46,225 milímetros cuadrados de silicio y guarda los mismos 44 GB de SRAM sobre la oblea.

Lo que sí cambió es la energía. La compañía acercó la conversión de potencia de unos 50 milímetros del procesador, la distancia habitual en una tarjeta de GPU, a cerca de 0.5 milímetros. Con eso, dice, elimina casi toda la pérdida eléctrica a nivel de tarjeta y logra entregar el doble de potencia a la oblea, lo que permite subir la frecuencia de operación y generar tokens más rápido.

The Register calcula que el reloj pasó de 1.4 a 2.8 gigahercios y estima que el consumo por oblea sube de 15 a 33 kilovatios. SemiAnalysis llega por su cuenta al mismo diagnóstico: el CS-4 corre sobre la misma oblea de 5 nanómetros y duplica el rendimiento duplicando la frecuencia. Estas son las cifras por procesador que publicó el fabricante:

| Medida                    | WSE-3      | WSE-3 Turbo |
| ------------------------- | ---------- | ----------- |
| Proceso                   | TSMC 5 nm  | TSMC 5 nm   |
| Transistores              | 4 billones | 4 billones  |
| Núcleos                   | 900,000    | 900,000     |
| SRAM en la oblea          | 44 GB      | 44 GB       |
| Cómputo FP16 disperso     | 125 PFLOPS | 250 PFLOPS  |
| Ancho de banda de memoria | 21.6 PB/s  | 43.2 PB/s   |

Sobre esa cifra de cómputo hay un matiz que The Register subraya: los 250 PFLOPS corresponden a operaciones dispersas, un régimen que por regla general no beneficia a la inferencia de modelos de lenguaje. En denso, el medio calcula unos 25 PFLOPS, que siguen quedando por encima de los 4 o 5 PFLOPS de FP16 denso que ofrecen las GPU más recientes de AMD y Nvidia.

![From above contemporary server cable trays without wires located in modern data center](https://fomoera.com/content/images/2026/08/fomoera-pexels-5050305--source-1.jpg)

La entrega de potencia es el cambio central del CS-4\. Imagen ilustrativa. · Foto de [Brett Sayles](https://www.pexels.com/@brett-sayles?ref=fomoera.com) en [Pexels](https://www.pexels.com/photo/high-angle-shot-of-network-switch-5050305/?ref=fomoera.com)

## Los 10 veces de rendimiento por watt chocan con la cuenta de SemiAnalysis

El comunicado abre con dos promesas: hasta el doble de velocidad que el CS-3 y hasta 10 veces más rendimiento por watt. No detalla con qué configuración ni con qué carga se midió la segunda. El argumento que da la empresa es económico antes que físico: como los tokens rápidos valen más que los lentos, sostiene, el CS-4 entrega tokens de mayor valor y más tokens totales dentro de un mismo presupuesto de energía.

SemiAnalysis hace la cuenta de otra manera. Estima que un rack CS-4 completo consume entre 125 y 135 kilovatios, algo cercano al doble por oblea de los 23 kilovatios de un CS-3, y concluye que el rendimiento por watt mejora poco o nada frente a la generación anterior. The Register, con estimaciones propias, ubica el sistema entre 120 y 140 kilovatios y apunta que los racks que AMD y Nvidia lanzan este año rondan los 240 a 250, así que el CS-4 no es la máquina más sedienta del catálogo.

Conviene saber de dónde viene cada voz. Dylan Patel, fundador y director general de SemiAnalysis, aparece citado en el propio comunicado de Cerebras elogiando las mejoras de despliegue, confiabilidad y red del CS-4\. Su firma publicó el reparo sobre la eficiencia de todos modos.

## Cerebras se queda solo con la mitad del trabajo de inferencia

El otro cambio grande no está en la oblea sino en el reparto de tareas. El nuevo módulo de entrada y salida soporta RoCE v2 sobre Ethernet y estrena un modo propio llamado Direct Wafer Links, que conecta obleas dentro y entre racks sin pasar por un switch. Con eso la latencia de oblea a oblea baja de cinco a dos microsegundos y, según la empresa, se abre la puerta a modelos de más de 50 billones de parámetros.

Ese cableado sirve para algo concreto: Cerebras dejó de intentar correr toda la inferencia en su propio hardware. En los esquemas que arma con AMD Helios y con AWS Trainium, la GPU o el acelerador procesan el prompt de entrada, la fase de prefill, y la oblea se queda con el decode, la generación token por token. The Register lo describe sin rodeos: los chips de Cerebras funcionan hoy sobre todo como aceleradores de decodificación, la misma posición que Nvidia le asignó a las LPU de Groq en sus racks LPX. Ese acuerdo, como contamos, dejó a Groq [levantando 350 millones de dólares a una valuación 49% menor](https://fomoera.com/groq-anuncia-350-millones-a-una-valuacion-49-menor-que-antes-del-acuerdo-con-nvidia/) que la que tenía antes de firmarlo.

## Los 44 GB de SRAM siguen fijando el costo de entrada

Lo que no se movió es la memoria. Los 44 GB por oblea son los mismos del WSE-3 y, según The Register, no crecen de forma significativa desde el WSE-2, hace cinco años. SemiAnalysis lo llama el principal inconveniente de reutilizar la misma oblea: la capacidad de memoria es uno de los límites de la arquitectura y no se arregla subiendo la frecuencia.

La consecuencia aparece en la cuenta de entrada. SemiAnalysis calcula que correr un modelo de 1.6 billones de parámetros como DeepSeek V4 Pro con ventana de un millón de tokens pide alrededor de 20 sistemas, y unos 40 si se atiende una concurrencia razonable de 256 peticiones. Son más de 20 millones de dólares de inversión y un megavatio de consumo antes de obtener la primera respuesta del modelo.

El rediseño físico sí resuelve otra parte del problema. Cerebras montó el subsistema de cómputo en una mochila vertical que se enchufa a la parte trasera del rack, con 50% menos componentes y 60% más manufactura automatizada, y calcula que el despliegue pasa de días a horas. Sean Lie, director de tecnología y cofundador, dijo en la sesión con prensa en San Francisco que esa reducción de piezas acelera la construcción de centros de datos.

Los primeros CS-4 se entregan este trimestre y la empresa no anunció precio. Andrew Feldman, director general, dijo que espera tener 600 megavatios de capacidad en línea o contratada para el cierre de 2027, y que para esa fecha sus sistemas serán cuatro veces más rápidos y moverán 20 veces más volumen. La siguiente generación de chip y servidor llega en 2027\. Hasta entonces, la velocidad que promete el CS-4 sale del mismo silicio de 2024 alimentado con el doble de energía.

*Fuentes:* [1](https://www.globenewswire.com/news-release/2026/08/19/3347356/0/en/cerebras-unveils-cs-4-up-to-30-times-faster-than-gpu-based-solutions.html?ref=fomoera.com), [2](https://www.theregister.com/systems/2026/08/19/cerebras-cs-4-rack-systems-juice-chips-for-every-last-drop-of-ai-performance/5289286?ref=fomoera.com), [3](https://newsletter.semianalysis.com/p/cerebrass-next-generation-cs-4-fast?ref=fomoera.com), [4](https://tech.yahoo.com/ai/articles/cerebras-launches-server-chip-system-000126808.html?ref=fomoera.com)