Saltar al contenido

Mil agentes de IA se pusieron de acuerdo sin que nadie lo pidiera, y el tope lo puso el experimento

Un estudio de Science Advances encontró que grupos de agentes de IA convergen solos en la misma opción, sin premio por coincidir ni instrucción de cooperar. Los diez modelos obedecen la misma ecuación y cada uno tiene su tope: 30 agentes con Llama 3 70B, 1,000 con Claude 3.5 Sonnet.

por Patricia Rodriguez
A large flock of birds soaring in a bright blue sky, showcasing nature's beauty.
Foto de Merve Kaya en Pexels

TL;DR:

  • Un estudio publicado en Science Advances muestra que grupos de agentes de IA convergen solos en la misma opción, sin premio por coincidir, sin instrucción de cooperar y sin nadie que dirija.
  • Los diez modelos probados obedecen la misma ecuación y solo cambia un número entre ellos, la fuerza de mayoría, que se debilita conforme crece el grupo.
  • El tope va de unos 30 agentes con Llama 3 70B a los 1,000 que sostuvo Claude 3.5 Sonnet, el grupo más grande que llegó a probarse. Todos los modelos medidos son de 2024.

Grupos de agentes de IA pueden ponerse de acuerdo por su cuenta en decisiones que no tienen respuesta correcta, sin recompensa por coincidir y sin nadie que dirija el grupo. Es el resultado central de "AI agents can coordinate via majority-following beyond human scale", el estudio de Giordano De Marzo, Claudio Castellano y David Garcia publicado en Science Advances. Los investigadores armaron poblaciones simuladas con diez modelos de las familias Claude, GPT y Llama, y dieron a cada agente a elegir entre dos opciones idénticas salvo por el nombre. Casi todos terminaban adoptando la más popular, hasta que el grupo entero quedaba del mismo lado. El tirón hacia la mayoría sigue la misma ecuación en las tres familias y de ahí sale un límite: pasado cierto tamaño, el grupo ya no converge y se fractura en grupos más chicos.

Un solo número decide si el grupo converge o se rompe

El montaje del experimento es deliberadamente pobre. Cada agente arranca con una de dos opciones asignada al azar. En cada turno se elige a uno, se le muestra la lista con lo que eligieron todos los demás y se le pide decidir otra vez. No conserva memoria de las rondas anteriores y en ningún momento el prompt le pide seguir a la mayoría ni buscar un acuerdo. Aun así, casi todos los modelos se inclinan hacia la opción que ya va ganando, y las diferencias pequeñas del arranque se amplifican hasta que el grupo queda entero de un lado.

Los autores llamaron fuerza de mayoría a ese tirón. Mide cuánto arrastra a un agente la opción más popular frente al azar de su propia elección. Todos los modelos probados, en las tres familias, «obedecen la misma ley matemática, y solo cambia un número entre ellos», dijo De Marzo a ScienceAlert.

Esa ecuación no nació en la informática. Es la misma que describe un ferroimán en el modelo de Curie-Weiss, donde los espines atómicos se alinean en una sola dirección y la fuerza de mayoría ocupa el lugar de la temperatura inversa. La analogía tiene consecuencias prácticas: permitió a los autores calcular si un grupo iba a converger, cuánto tardaría y a partir de qué tamaño el acuerdo se vuelve tan improbable que el grupo se parte.

A flock of birds flying in V formation against a clear blue sky.
Imagen ilustrativa: la coordinación sin líder que el estudio midió en agentes de IA es la misma clase de fenómeno que ordena un grupo animal en movimiento. · Foto de Yalçın UZUN en Pexels

En el propio artículo, una simulación de 150 agentes movidos por Llama 3 70B muestra el efecto de cerca. El grupo grande no aguanta y se parte una y otra vez, hasta que los subgrupos son lo bastante chicos para sostener un acuerdo. Uno de 25 agentes se coordinó rápido y ya no volvió a dividirse.

El techo subió con cada modelo, y los que se midieron son de 2024

El tamaño a partir del cual el consenso deja de ser alcanzable cambió mucho entre modelos. Esta es la comparación que reportó ScienceAlert con los datos del estudio:

Modelo probado Hasta dónde llegó el consenso
Llama 3 70B unos 30 agentes (límite estimado)
GPT-4o unos 80 agentes (límite estimado)
GPT-4 Turbo alrededor de 1,000, y posiblemente más (límite estimado)
Claude 3.5 Sonnet 1,000 agentes, el grupo más grande probado, sin haber tocado su techo

Como referencia humana, el trabajo sitúa el tamaño de un grupo estable entre 150 y 300 personas y añade que el límite cognitivo de unos 250 contactos se mantiene incluso en una sociedad en línea. Varios de los modelos probados superan ese rango. ScienceAlert subraya que la equivalencia pide cautela: las personas se coordinan con relaciones, lenguaje, instituciones y objetivos compartidos, mientras que estos agentes solo veían pasar una lista de elecciones binarias.

La cifra que llama la atención, esos 1,000 agentes, es el techo del experimento y no el de la tecnología. El artículo sostiene que el tamaño crítico crece de forma exponencial con la capacidad lingüística del modelo, y los modelos que se midieron son los que existían en 2024: la versión preprint del trabajo se subió a arXiv el 4 de septiembre de 2024 y se revisó por última vez el 15 de abril de 2025. La revisión por pares llegó después. Con Claude 3.5 Sonnet la prueba se detuvo en 1,000 sin encontrar su límite, así que ese renglón de la tabla marca hasta dónde llegó el experimento.

El diseño dejó fuera la memoria, el premio y las consecuencias

El experimento quitó a propósito casi todo lo que vuelve difícil una decisión real. No había respuesta correcta, ni memoria entre rondas, ni recompensa, ni información desigual, ni consecuencia práctica. Cooperar de verdad exigiría repartir trabajo, entender qué sabe cada quien, perseguir un objetivo común y resistirse a la mayoría cuando se equivoca. Nada de eso se puso a prueba. De Marzo puso el freno ante ScienceAlert: su lectura es que el hallazgo acredita la presencia de un ingrediente básico, sin llegar a demostrar que los agentes ya colaboren en tareas complejas.

El mismo grupo tiene un segundo trabajo en camino, todavía sin revisión por pares. En un preprint subido a arXiv el 11 de mayo de 2026, De Marzo, Alessandro Bellina, Castellano, Viola Priesemann y Garcia simulan nueve modelos y cien pares de opiniones, y describen poblaciones de agentes alineados de forma individual que quedan atrapadas en estados colectivos desalineados por pura conformidad. El texto identifica puntos de quiebre en los que un número reducido de agentes adversarios desplaza el alineamiento de toda la población de manera irreversible, incluso después de que la manipulación se detiene. La lectura de los autores es que evaluar a un modelo por separado no garantiza la seguridad del conjunto.

Hay una versión cotidiana de ese riesgo. En programación colaborativa, según el reporte de ScienceAlert, un grupo de agentes puede repetir una función o un diseño ineficiente por el solo hecho de que ya abunda en el código base. Una norma adoptada por mayoría no tiene por qué ser la mejor opción ni reflejar valores humanos. Anthropic ya había probado enjambres de agentes de Claude que se sabotearon con malware y pactaron precios, como contamos el 13 de agosto de 2026.

Agentes de Claude se sabotearon con malware
Anthropic probó enjambres de agentes de Claude: sabotaje con malware, colusión de precios y fallas de coordinación.

El grupo más grande que llegó a probarse en el laboratorio tenía 1,000 agentes. De Marzo y Garcia publicaron en febrero de 2026 un preprint sobre Moltbook, la red estilo Reddit habitada solo por agentes de IA, con más de 369,000 publicaciones y 3 millones de comentarios de unos 46,000 agentes activos. Poblaciones de ese tamaño dejaron de ser un supuesto de laboratorio.

Fuentes: 1, 2, 3, 4

Patricia Rodriguez imagen de perfil
por Patricia Rodriguez

Solo puedo decir que soy una apasionada con todo lo que tiene que ver con el mundo Digital me encanta todo lo que es escritura, IA, Ediciones de Video Reels y más. Me considero una persona "DIVERGENTE"

Leer más de Tecnología y Ciencia