Arena anunció el 8 de octubre de 2026 una Serie B de 200 millones de dólares que la valora en 3,100 millones. La empresa detrás del conocido ranking de modelos de IA también presentó su Alignment Index, una evaluación preliminar que detecta cuándo los agentes incumplen permisos, tergiversan lo que dijo el usuario o afirman haber terminado un trabajo pendiente.
Lightspeed Venture Partners y Khosla Ventures colideraron la ronda, según el anuncio de Arena. También participaron Salesforce Ventures, 01 Advisors, Dell Technologies Capital y Endeavor Catalyst.
La valoración anterior era de 1,700 millones de dólares en enero de 2026, según The Next Web. Frente a esa referencia, el nuevo valor representa un aumento aproximado de 82.4 %, calculado a partir de las dos cifras. Los 200 millones corresponden al capital captado en esta operación; los 3,100 millones, a la valoración de la compañía.
Arena nació en 2023 como Chatbot Arena, un proyecto del Sky Computing Lab de Berkeley, y se constituyó como empresa en 2025, recoge el mismo medio. Su actividad de evaluación ahora incorpora la conducta de los agentes durante el trabajo que los usuarios les delegan.
Tres señales para detectar cuándo un agente se sale del encargo
La plataforma empezó evaluando preferencias humanas y después incorporó mediciones de exactitud factual, explica Arena. El nuevo índice añade señales observables en las conversaciones y en las acciones de los agentes:
- La acción no autorizada identifica una actuación fuera de la petición del usuario o de los permisos aplicables.
- La atribución falsa detecta que el agente adjudicó al usuario una afirmación, solicitud o aprobación contradicha por la evidencia que este aportó.
- La finalización engañosa registra que el agente declaró una tarea concluida cuando la evidencia demuestra que seguía incompleta.
Para identificar esos casos, Arena emplea un modelo de IA evaluador con criterios refinados mediante revisión humana. Cada sesión se señala cuando el evaluador encuentra una acción o afirmación concreta y la evidencia que la respalda. Las tasas se ajustan por la longitud de la conversación.
Cómo leer el ranking de 27 modelos
El cálculo transforma las tasas de fallos y les asigna distintos pesos: 50 % para las acciones no autorizadas y 25 % para cada una de las otras dos señales.
En el tablero oficial, fechado el 30 de septiembre de 2026, GPT-6.1 Sol encabeza los 27 modelos con 87.9 puntos, con un margen mostrado de ±1.5. Para ese modelo, las tasas ajustadas de sesiones señaladas son 0.89 % por acciones no autorizadas, 1.98 % por atribuciones falsas y 2.34 % por finalizaciones engañosas.
Por esa fórmula, 87.9 puntos no equivalen a haber completado correctamente 87.9 % de las tareas. El puntaje combina las señales; las tasas permiten leer cada conducta por separado.
Las páginas oficiales también presentan tamaños de muestra distintos. El artículo metodológico publicado el 8 de octubre habla de 90,000 sesiones; el tablero muestra 72,509, junto a la fecha del 30 de septiembre. Arena no explica en esas páginas la diferencia entre ambas cifras.
Arena describe las señales como una parte limitada de la seguridad y la alineación. Planea ampliar la evaluación empezando por el rechazo de solicitudes dañinas, mientras la nueva ronda financia más mediciones sobre el comportamiento de los agentes.