Saltar al contenido

Nvidia PAIR pone a trabajar las computadoras ociosas de tu casa, pero no suma sus GPUs

Nvidia liberó la beta de Personal AI Router, un programa gratuito y de código abierto que reparte las peticiones de IA entre las computadoras de una red doméstica. Cada petición corre entera en un solo equipo: no fusiona GPUs ni suma memoria de video.

por Gerardo Pavez
Sleek home office setup with dual monitors, a laptop, and minimalist decor.
Foto de Tranmautritam en Pexels

TL;DR:

  • Nvidia publicó el 3 de septiembre de 2026, durante IFA 2026, la beta de Personal AI Router (PAIR), un software gratuito bajo licencia Apache 2.0 para Windows, macOS y Linux.
  • PAIR manda cada petición de inferencia a un solo equipo de la red. No fusiona GPUs, no suma memoria de video ni parte un modelo entre máquinas.
  • Su repositorio oficial reconoce que el planificador solo mira el trabajo en cola y el uso de GPU, y que encaja mejor con equipos parecidos que con un clúster muy mixto.

Nvidia publicó el 3 de septiembre de 2026, durante IFA 2026, la beta de Personal AI Router (PAIR), un programa gratuito y de código abierto que reparte las peticiones de inferencia de IA entre las computadoras compatibles de una misma red doméstica. Corre en Windows, macOS y Linux, se apoya en Ollama y LM Studio, y expone un solo punto de conexión local para que las aplicaciones y los agentes no tengan que saber en qué máquina acabó cada petición. La idea es aprovechar las horas muertas de la segunda computadora de la casa en vez de pagar tokens en la nube. Lo que PAIR no hace pesa igual: asigna cada petición completa a un solo equipo, no fusiona GPUs ni suma memoria, y el propio repositorio de Nvidia reconoce que su planificador encaja mejor con máquinas parecidas que con un clúster muy mixto.

Un solo punto de conexión que se hace pasar por Ollama

PAIR no es un motor de inferencia nuevo. Ollama o LM Studio siguen ejecutando el modelo en la máquina que toque. PAIR se queda con el puerto que esos servicios usan por defecto, recibe la petición, revisa qué motor y qué modelo pide, elige un nodo y devuelve la respuesta por el mismo canal. La aplicación ve una sola conexión durante todo el proceso, y si el agente trabaja en otro puerto, el proxy se reconfigura desde los ajustes de motor.

El emparejamiento va por descubrimiento de red local con mDNS, con la opción de agregar un equipo por dirección IP. La máquina que invita muestra un PIN de seis dígitos y el otro equipo lo escribe para entrar al clúster. Hasta que esa conexión existe, la comunicación entre nodos está bloqueada; después viaja cifrada con mTLS y certificados generados para eso. Nvidia pide leer su política de seguridad antes de instalar PAIR en una red compartida o no confiable, porque el programa abre endpoints HTTP locales, descubrimiento en la LAN y red de clúster.

Reparte peticiones, no junta GPUs ni memoria

PAIR asigna cada petición a un nodo y ahí se queda hasta terminar. No junta varias GPUs en una sola más grande, no agrupa la memoria de video y no reparte un mismo modelo entre máquinas. AppleInsider lo llevó al caso más obvio: dos Mac de 16 GB no se convierten en una bolsa de 32 GB para cargar un modelo más grande. Agregar equipos tampoco acelera una respuesta individual.

La ganancia aparece cuando hay varias peticiones independientes compitiendo por la misma GPU, como un agente que se parte en subagentes o varias sesiones abiertas a la vez. Nvidia advierte que las tareas muy secuenciales, las dominadas por una sola llamada larga y las configuraciones donde solo un equipo tiene el modelo pedido ganan poco o nada. Los nodos entran y salen sobre la marcha: una laptop que se suspende o una GPU que su dueño reclama para jugar dejan de recibir trabajo.

La demostración de Nvidia pasa de 18 minutos a 8:48, con condiciones

Nvidia publicó una demostración con Hermes Desktop repartiendo una tarea entre cinco subagentes, con Ollama ejecutando el modelo Qwen 3.6 35B A3B. En una sola laptop RTX Spark, la carga tardó 18 minutos en promedio. En un clúster de tres equipos, esa misma laptop más una DGX Spark y una RTX 5090, el promedio bajó a 8 minutos y 48 segundos.

La propia compañía le pone límites a ese número. Lo describe como una demostración no oficial y específica de esa configuración, no como un benchmark general ni como una promesa de escalamiento lineal: el resultado depende del paralelismo de la carga, del modelo, de los ajustes del motor, del hardware, de la red y de qué nodos estén disponibles. En esa comparación no participó ninguna Mac.

El repositorio oficial admite que prefiere máquinas parecidas

La página de producto vende juntar Mac, sistemas RTX y DGX Spark en un mismo clúster casero. El repositorio en GitHub matiza esa promesa. Dice que PAIR trae hoy una sola política de planificación, que combina el trabajo en cola con una señal aproximada y suavizada del uso de GPU, y que no toma en cuenta el modelo de GPU, la memoria disponible, si el modelo ya está cargado en caliente ni qué tan cara se ve la petición. Por eso, concluye el documento, encaja mejor con máquinas parecidas que con un clúster muy mixto. Nvidia dice que quiere hacer más inteligente ese componente y quizá dejar elegir la política, sin comprometerse a fechas.

El mismo texto agrega una advertencia práctica: que PAIR corra en una máquina no significa que un motor de inferencia también lo haga. Cada motor fija sus propios requisitos de sistema operativo, GPU y controladores, y cada modelo necesita memoria suficiente para cargarse. Un nodo solo entra a la lista de candidatos cuando ya ejecuta un motor compatible y tiene el modelo exacto que se pidió, aunque los modelos no tienen que ser idénticos en todos los equipos.

El piso de requisitos deja fuera al Mac Studio M3 Ultra

Nvidia publicó los requisitos de la beta el mismo día del anuncio. Estos son los mínimos que fija para que un equipo pueda participar en el clúster.

Requisitos publicados por Nvidia para la beta de PAIR el 3 de septiembre de 2026
Requisito Lo que pide Nvidia
GPU o chip GeForce RTX serie 20 o posterior, RTX PRO de arquitectura Turing o posterior, DGX Spark con GB10, o Mac con chip M4 o posterior
Sistemas operativos Windows 11, Linux (DGX OS y Ubuntu) y macOS Tahoe
Arquitecturas x64 y arm64 en los tres sistemas; Windows en ARM es experimental
Motor de inferencia Ollama o LM Studio instalado en cada nodo que vaya a servir peticiones
Memoria del sistema 8 GB o más
Espacio en disco 20 GB o más, recomendado
Conexión a internet No hace falta para operar; sí para descargar los modelos

El corte en M4 tiene un efecto llamativo, como notó AppleInsider: deja fuera de la lista publicada al Mac Studio con M3 Ultra, que Apple presentó en marzo de 2025 con configuraciones de hasta 512 GB de memoria unificada y que promocionó justo para correr modelos de lenguaje grandes en local. Nvidia no explica ese corte en su página de requisitos, y la lista tampoco aclara si PAIR funcionaría en una Mac anterior.

Para quien ya corre modelos en su propia máquina, PAIR ahorra un trabajo concreto, el de apuntar cada aplicación a cada equipo por separado. Lo que no mueve es el techo del hardware. El modelo que no cabía en una GPU sigue sin caber, y el tiempo solo baja cuando hay varias peticiones esperando turno.

Fuentes: 1, 2, 3, 4

Gerardo Pavez imagen de perfil
por Gerardo Pavez

Redactor y creador de contenido especializado en deportes y tecnología. Apasionado por todo lo que ocurre dentro y fuera de la cancha.

Leer más de Tecnología y Ciencia