Saltar al contenido
IA

Google defiende Gemini 4 Argon ante dudas internas sobre su rendimiento

Un reporte atribuye a empleados de Google dificultades de Argon en programación. La empresa rechaza esa descripción, mientras una prueba externa aporta resultados sobre un negocio simulado.

por Gerardo Pavez
Una mujer escribiendo un código en una computadora portátil en un entorno interior moderno, mostrando el trabajo tecnológico.
Foto de Christina Morillo en Pexels

Google defendió el rendimiento de Gemini 4 Argon en programación frente a un reporte de Bloomberg que atribuye dudas a empleados de la compañía. La respuesta, recogida por 9to5Google el 1 de octubre de 2026, llega mientras el nuevo modelo sigue con acceso limitado.

9to5Google resume testimonios de Bloomberg sobre dificultades en ciertas tareas de código pese a las puntuaciones anunciadas. También recoge una visión favorable: un empleado considera que Argon está al nivel de los modelos más avanzados.

En su comunicado del 30 de septiembre, Google afirma que sus ingenieros ya utilizan Argon para corregir errores, migrar bases de código y diseñar algoritmos.

El anuncio y sus condiciones iniciales de acceso quedaron detallados en nuestra cobertura anterior.

Google presenta Gemini 4 Argon: supera a GPT-6 Astra en algunas pruebas, con acceso limitado
Gemini 4 Argon gana en DeepSWE, pierde en FrontierSWE y llega primero a socios de ciberseguridad.

Las pruebas de código y de negocio miden tareas distintas

Google atribuye a Argon un 77.9% en DeepSWE v1.1, una evaluación de tareas prolongadas de ingeniería de software. Esa puntuación corresponde a un conjunto definido de tareas. Para contrastarla con las reservas internas harían falta las tareas concretas y las condiciones en que se observaron las dificultades.

Una evaluación externa aporta otra medida. En la clasificación de Vending-Bench 2, de Andon Labs, consultada el 1 de octubre, Argon aparece tercero con un saldo medio de 13,718.16 dólares simulados. Lo preceden GPT-6 Astra, con 15,514.70 dólares, y GPT-6 Sol, con 14,427.85 dólares. La tabla presenta promedios de varias ejecuciones.

El agente comienza con 500 dólares y administra una máquina expendedora durante un año simulado. Debe comprar mercancía, fijar precios y gestionar inventario. El entorno incluye proveedores que pueden intentar aprovecharse del agente, retrasos de entregas y clientes que solicitan reembolsos. La puntuación se calcula a partir del saldo final.

Vending-Bench 2 mide la gestión de ese negocio simulado. Esa clasificación no permite resolver las dudas sobre programación ni trasladar el saldo a una previsión de ingresos empresariales.

Google mantiene el acceso inicial entre defensores de ciberseguridad y probadores de confianza. Prevé ampliar la distribución empezando por clientes de pago de la API y suscriptores de Google AI Ultra, pero su anuncio no fija una fecha. Esa disponibilidad limitada todavía condiciona quién puede contrastar el rendimiento de Argon en sus propios proyectos.

Fuentes: 1, 2, 3

Gerardo Pavez imagen de perfil
por Gerardo Pavez

Redactor y creador de contenido especializado en deportes y tecnología. Apasionado por todo lo que ocurre dentro y fuera de la cancha.

Leer más de Tecnología y Ciencia