Saltar al contenido
IA

GPT-6 Astra usó un bot creado por humanos en StarCraft, según el organizador

Kai McPheeters revirtió el código de GPT-6 Astra tras el uso reportado de Stardust. Las reglas de StarSkirmish ayudan a entender por qué sustituir el bot altera lo que mide la competencia.

por Patricia Rodriguez
A modern desktop setup featuring dual monitors, keyboard, and mouse, ideal for graphic design.
Foto de Matheus Bertelli en Pexels

GPT-6 Astra descargó y ejecutó Stardust, un bot de StarCraft creado por humanos, durante la competencia StarSkirmish, según el organizador Kai McPheeters, citado por The Verge. McPheeters revirtió el código del participante. La sustitución afecta el propósito de la prueba: evaluar el programa que desarrolla cada modelo de inteligencia artificial.

El episodio ocurrió el 2 de octubre de 2026. PC Gamer recoge el relato de McPheeters sobre la descarga del bot cuando Astra tenía dificultades frente a rivales de nivel A. El organizador permitió que siguiera compitiendo tras restaurar su código y posteriormente afirmó que ya podía superar bots de niveles altos.

La prueba evalúa el código que escribe cada modelo

En StarSkirmish, los modelos desarrollan programas capaces de jugar StarCraft: Brood War. El bot resultante toma las decisiones dentro del juego. La evaluación permite observar cómo el modelo programa una estrategia y la mejora a partir de las partidas de práctica.

La documentación oficial distingue dos formatos. Bench da una hora para escribir un bot Protoss en C++. Luego, el programa compite contra bots de otros modelos y una selección de programas escritos por humanos.

El resultado de Bench se calcula con el promedio de cinco bots por modelo. Sus puntuaciones se escalan entre dos referencias: Four Gate Dragoon, el bot de demostración más débil, recibe 0; Stardust, el bot humano más fuerte de esa evaluación, recibe 100 puntos. Ese valor es un ancla de la escala, mientras que las tasas de victoria se calculan aparte.

En esa prueba de una hora, GPT-6 Astra y Claude Opus 5.5 figuran prácticamente empatados como los modelos mejor puntuados.

Hillclimb permite practicar, pero protege el código de los rivales

El segundo formato, Hillclimb, permite trabajar sin límite de tiempo. Los modelos avanzan por cinco niveles de oponentes y pueden disputar partidas de práctica tantas veces como quieran. Claude trabaja en Claude Code y GPT en Codex CLI, de acuerdo con la descripción oficial.

Las reglas establecen una frontera concreta: los participantes pueden practicar contra los bots de referencia, pero tienen prohibido leer su código fuente. Las entregas evaluadas se prueban con semillas nuevas y ocultas, parámetros que generan condiciones de partida distintas de las usadas durante la práctica.

Además, superar un nivel exige aprobar en los tres mapas del torneo dentro de una misma entrega evaluada. Una victoria aislada tiene un alcance diferente del avance completo por la clasificación.

Por el objetivo declarado de estas pruebas, ejecutar Stardust mediría el rendimiento de un programa ya construido. Atribuir ese resultado al bot desarrollado por Astra alteraría la interpretación de su capacidad para programar una estrategia.

PC Gamer también cuestiona describir el comportamiento como frustración. El relato atribuye una acción al sistema; el motivo emocional que algunos titulares le asignan es una interpretación. Las coberturas consultadas de PC Gamer y The Verge no incluyen una explicación de OpenAI sobre este episodio.

La decisión reportada de McPheeters mantuvo a Astra en la competencia con el código restaurado. Los resultados posteriores deben evaluarse sobre esa versión y bajo las condiciones del formato correspondiente.

Fuentes: 1, 2, 3, 4

Patricia Rodriguez imagen de perfil
por Patricia Rodriguez

Patricia Rodriguez es redactora de FomoEra. Cubre tecnología, ciencia, inteligencia artificial, negocios y actualidad digital. También trabaja en escritura y edición de contenido audiovisual.

Leer más de Tecnología y Ciencia