TL;DR:
- AMD y Cerebras Systems anunciaron el 23 de julio de 2026 una alianza técnica que combina los racks AMD Helios con el Wafer-Scale Engine para inferencia de IA de baja latencia.
- Prometen hasta 5 veces más tokens por segundo por vatio, aunque la nota al pie del comunicado aclara que la cifra viene de un modelado propio de julio de 2026 comparado contra una configuración solo de Cerebras.
- Cerebras instalará racks Helios en sus centros de datos y la solución conjunta llegará primero a Cerebras Cloud en el segundo semestre de 2026.
AMD y Cerebras Systems anunciaron el jueves 23 de julio de 2026 una alianza técnica para repartir el trabajo de la inferencia de inteligencia artificial entre dos máquinas distintas. Los racks AMD Helios procesarán el prompt y las ventanas de contexto largas; el Wafer-Scale Engine de Cerebras, ese chip que ocupa una oblea entera de silicio, se encargará de generar los tokens de la respuesta. Las compañías presentaron la solución en Advancing AI 2026, el evento de AMD en San Francisco, y calculan que juntas entregan hasta 5 veces más tokens por segundo por vatio. Cerebras instalará sistemas Helios en sus propios centros de datos y el servicio llegará primero a Cerebras Cloud en el segundo semestre de 2026. Las acciones de Cerebras (CBRS) subieron cerca de 5% en la jornada.
La inferencia desagregada es un enfoque que parte el trabajo de un modelo en sus dos etapas, el procesamiento del prompt y la generación de tokens, y asigna cada una al hardware que la ejecuta mejor. Suena a detalle de ingeniería para pasar de largo. En la práctica decide cuánto tarda en contestarte un agente y cuánta electricidad se quema en el intento.
"La inferencia de IA se está convirtiendo en una de las mayores oportunidades de infraestructura dentro de la IA, y su creciente diversidad exige un enfoque más flexible", dijo Lisa Su, presidenta y directora ejecutiva de AMD. "Junto con Cerebras, estamos extendiendo ese liderazgo hacia las aplicaciones más sensibles a la latencia y creando una plataforma potente para la IA agéntica en tiempo real."
Helios abre el prompt, la oblea de Cerebras suelta los tokens
El reparto es la parte concreta del anuncio y AMD lo describe sin ambigüedad en su comunicado:
- Los racks AMD Helios se quedan con el prefill, es decir, digerir el prompt y las ventanas de contexto largas a gran volumen.
- El Wafer-Scale Engine entra en la segunda etapa, el decode, donde lo que manda es el ancho de banda de memoria y cada milisegundo se nota en la respuesta.
- Cerebras montará racks Helios en sus propios centros de datos, y quien quiera probar el resultado entrará primero por Cerebras Cloud, en el segundo semestre de 2026.
- Según Tom's Hardware, ese rack Helios lleva procesadores EPYC y aceleradores Instinct de la serie MI400.
Andrew Feldman, CEO y cofundador de Cerebras, lo enmarcó como una vía de distribución más que como un rescate técnico.
"La demanda de inferencia ultrarrápida está creciendo a un ritmo sin precedentes", afirmó Feldman. "Asociarnos con AMD nos da una oportunidad increíble de llevar ese rendimiento a muchos más clientes."
Tom's Hardware apunta un detalle que conviene tener a mano: la idea general se parece al concepto CPX de Nvidia, solo que con la especialización invertida, y ninguna de las dos empresas explicó todavía cómo se interconectarán ambos sistemas ni publicó datos adicionales de rendimiento.

El 5x salió de un modelo, no de un banco de pruebas
Aquí está el dato que los titulares repiten y casi nadie lee completo. El comunicado oficial cierra con una nota al pie que define exactamente de dónde sale el 5x: es un modelado hecho por AMD Performance Labs y Cerebras en julio de 2026, mide tokens por segundo por kilovatio en un punto de interactividad comparable, corre sobre un solo modelo, Kimi 2.6 1T, y compara un rack Helios acompañado del WSE contra una configuración compuesta únicamente por hardware de Cerebras.
O sea: la referencia contra la que se mide la mejora es la propia Cerebras sin AMD enfrente. No es una comparación contra Nvidia, ni contra un rack de AMD trabajando solo, ni contra lo que alguien tenga hoy en producción. Y no lo midió un tercero.
Nada de esto invalida el anuncio: la ingeniería de separar prefill y decode lleva un año dando vueltas en la industria y las dos compañías están poniendo fierro real detrás. Pero conviene ordenar qué es hecho y qué es promesa. Confirmado: la alianza, el reparto de tareas, el despliegue en centros de datos de Cerebras y la ventana del segundo semestre de 2026. Sin confirmar: precios, latencias medidas, cómo se conectan los dos mundos y en qué regiones estará disponible.
AMD cierra una semana de anuncios grandes y Cerebras la festeja en bolsa
La alianza aterriza apenas un día después de otro movimiento fuerte. AMD confirmó un acuerdo para suministrar hasta 2 gigavatios de capacidad de cómputo a Anthropic, con el primer gigavatio previsto a partir del primer semestre de 2027, y una inversión de hasta 5,000 millones de dólares en la desarrolladora de Claude. En una charla con reporteros, Su resumió hacia dónde apunta todo esto.
"Creo que vamos a ver más desagregación de cargas de trabajo", dijo Su, según Axios.
La misma ejecutiva calcula que la IA puede llevar el mercado global de cómputo a 2 billones de dólares (millones de millones) hacia 2030, contando servidores de centro de datos, PCs y dispositivos embebidos y de borde.
¿Y por qué se emocionó tanto el mercado con Cerebras y no con AMD? Porque para la empresa de Sunnyvale esto es distribución. CNBC reportó que sus acciones subieron alrededor de 5% el jueves y rondaban los 220 dólares, en un papel que ha sido de todo menos tranquilo: salió a bolsa en mayo a 185 dólares, tocó 386.34 en su debut y cayó por debajo de los 161 a finales de junio. El mismo medio recuerda que Nvidia compró activos de Groq en diciembre por 20,000 millones de dólares para meter tecnología de baja latencia en sus sistemas. Traducción: el nicho de la respuesta instantánea ya tiene dos bandos armados.
Para el lector hispanohablante que desarrolla con estos modelos, el acceso no llegará por comprar hardware sino por nube, y ahí las dos empresas todavía no dicen nada sobre disponibilidad regional ni tarifas. El antecedente más cercano para Europa es la expansión de 200 MW de capacidad de cómputo que Cerebras anunció para finales de 2027, con centros de datos en Francia y los países nórdicos.
La cita real es el segundo semestre de 2026 y el lugar es uno solo al principio: Cerebras Cloud. Hasta que alguien ajeno a las dos compañías mida latencia y consumo con sus propios modelos, ese 5x seguirá siendo lo que dice su nota al pie, un cálculo de laboratorio con dueño.