TL;DR:
- IBM y Together AI firmaron un acuerdo multianual de 240 millones de dólares para desplegar en IBM Cloud un clúster de sistemas Nvidia HGX B300 dedicado a inferencia de modelos abiertos.
- La disponibilidad está prevista para el primer trimestre de 2027: no hay capacidad nueva operando antes de enero.
- Gartner proyecta que 2026 sea el primer año en que el gasto mundial en inferencia, 23,300 millones de dólares, supere al de entrenamiento, 19,000 millones.
IBM y Together AI firmaron un acuerdo multianual de 240 millones de dólares para levantar en IBM Cloud un clúster dedicado a la inferencia de modelos de código abierto, según el comunicado que ambas publicaron el martes 11 de agosto de 2026. El despliegue usará sistemas Nvidia HGX B300 con red Ethernet Spectrum-X, y la disponibilidad está prevista para el primer trimestre de 2027, o sea, no antes de enero. Together AI, fundada en 2022, cerró el 1 de julio una Serie C de 800 millones de dólares con una valuación de 8,300 millones y dice servir 400 billones de tokens al mes. El negocio que cierra IBM aquí no es el que suele contarse en la ola de la IA: no está comprando chips para entrenar un modelo propio, está cobrando renta a la empresa que los explota.
El contrato está firmado; el clúster todavía no existe
El comunicado es específico en lo que promete y en cuándo. IBM lo describe como el primer clúster dedicado y de gran escala construido para inferencia en IBM Cloud con sistemas HGX B300 y red Spectrum-X, y fija la disponibilidad en el primer trimestre de 2027. Together AI usará esa capacidad para servir modelos abiertos a clientes empresariales.
La cifra de rendimiento que acompaña al anuncio tiene dueño. El multiplicador de 30 veces en la salida de una fábrica de IA frente a generaciones previas es una afirmación de Nvidia sobre su propio hardware, no una medición independiente del clúster que todavía no se arma. StorageReview lo apuntó el mismo día: el desempeño real de una carga depende de la arquitectura del modelo, la precisión, el tamaño de lote y la configuración de servicio.
Esa precisión importa por contraste con lo que se anunció el día anterior. El lunes 10 de agosto, Nvidia presentó seis memorandos de entendimiento con gestoras de Wall Street para movilizar más de 500,000 millones de dólares hacia centros de datos, un instrumento que fija intención pero no obliga a ejecutar. El de IBM es un documento de otra naturaleza: mucho menos dinero, con un contrato firmado, un proveedor de hardware definido y un trimestre de entrega.

IBM cobra renta a una empresa que también renta cómputo
Together AI no es un cliente empresarial cualquiera. TechCrunch la describe como una neocloud, es decir, una compañía que alquila clústeres de GPU de Nvidia y otra infraestructura específica para IA. Stocktwits ubicó al acuerdo en esa categoría y sumó los nombres que cotizan en bolsa dentro de ella, CoreWeave y Nebius: empresas que compran cómputo al por mayor y revenden el acceso a través de su propia plataforma.
De ahí sale la lectura menos obvia del martes, y Stocktwits la formuló así: el acuerdo le da a IBM un pie dentro de ese mercado al volver a Together AI un inquilino grande de su nube en vez de un competidor directo. Traducido a caja, es exposición a la demanda de infraestructura de IA sin montar un negocio de tokens propio.
El otro detalle del organigrama financiero es circular. Nvidia participó en la Serie C de 800 millones de dólares que Together AI cerró el 1 de julio de 2026, liderada por Aramco Ventures, según TechCrunch. Un mes y diez días después, esa misma empresa firma capacidad basada en sistemas Nvidia. El fabricante aparece a la vez como inversionista del comprador y como proveedor del equipo.
Para IBM tampoco es un movimiento aislado. StorageReview recuerda que la compañía ya había sumado capacidad Grace Blackwell a través de CoreWeave el año pasado, y el propio comunicado del martes encuadra el clúster dentro de una colaboración más amplia con Nvidia que abarca analítica de datos nativa en GPU, extracción de datos no estructurados, infraestructura en sitio y en la nube, y consultoría.
2026, el año en que la inferencia rebasa al entrenamiento
El calendario del acuerdo coincide con un cruce que Gartner fechó un día antes del anuncio. En su pronóstico del 10 de agosto de 2026, la firma proyecta que el gasto mundial en infraestructura como servicio optimizada para IA crezca 96.4% este año, hasta 42,276 millones de dólares, y llegue a 66,143 millones en 2027.
Dentro de ese total, 2026 marca la inversión de la balanza: la inferencia se lleva 23,300 millones de dólares y el entrenamiento 19,000 millones. El 55% del gasto en IaaS optimizada para IA irá a inferencia este año, y la proyección sube a 59% en 2027.
"exige ejecución continua y en tiempo real, no entrenamiento periódico"
Así resumió Hardeep Singh, analista principal de investigación de Gartner, lo que cambia cuando las empresas pasan del desarrollo de modelos al despliegue en producción [traducción propia].
Puesto contra esa escala, el acuerdo de IBM es pequeño: los 240 millones repartidos en varios años equivalen a menos de medio punto porcentual de lo que Gartner proyecta que el mundo gastará en esa categoría solo en 2027. Su valor para IBM está en la posición que le fija dentro del mercado que más crece.
Los modelos que va a servir vienen sobre todo de China
El argumento comercial lo puso el director ejecutivo de Together AI, Vipul Ved Prakash, en el comunicado.
"Las empresas quieren el rendimiento de los mejores modelos de frontera sin la etiqueta de precio de modelo cerrado"
La frase, en traducción propia, describe el catálogo con el que trabaja la compañía. La plataforma soporta modelos abiertos como DeepSeek, Nemotron, MiniMax, Kimi y GLM, según Network World, bajo la premisa de que personalizarlos y afinarlos cuesta menos que depender de un solo modelo propietario. Cuatro de esos cinco nombres salen de laboratorios chinos: DeepSeek, MiniMax, Kimi de Moonshot y GLM de Zhipu. Nemotron es de la propia Nvidia.
Ahí está la consecuencia práctica para quien desarrolla software en México, España o América Latina. El catálogo de pesos descargables sobre el que se construye buena parte del producto hispanohablante depende de laboratorios chinos y correrá sobre infraestructura estadounidense contratada en dólares. FomoEra revisó el 5 de agosto por qué esos mismos modelos abiertos quedaron fuera del marco federal de revisión de Estados Unidos, incluidos los chinos.
Preguntas rápidas sobre el acuerdo
¿Por qué la inferencia se factura distinto que el entrenamiento?
Entrenar consume muchísimo cómputo durante una ventana acotada y termina. La inferencia es ejecutar el modelo ya entrenado cada vez que alguien lo consulta, así que el gasto no se detiene y crece con el uso. Por eso Gartner proyecta que en 2026 supere por primera vez al entrenamiento.
Lo verificable hoy son 240 millones de dólares firmados, un proveedor de hardware con nombre y un trimestre de entrega. La prueba llega en enero de 2027, cuando toque comprobar si el clúster entra en operación en la fecha prometida y si el precio por token que Together AI ofrezca sobre él sostiene el argumento de que los modelos abiertos salen más baratos que los cerrados.