Un millón de tokens para razonar y batalla abierta con GPT-6: Google lanza Gemini 4 Argon para recuperar el terreno perdido
por Edgar OteroGoogle por fin se pone al día. Esa es la lectura más simplista que podemos hacer tras el lanzamiento preliminar de Gemini 4 Argon. Este es el nuevo modelo de IA enfocado en flujos de trabajo avanzados de ingeniería de software, ciberseguridad defensiva y análisis de datos.
Como viene siendo habitual últimamente, la distribución inicial ha arrancado de forma restringida para expertos en ciberdefensa a través del programa Fairwind, con unas tarifas fijadas en 2 dólares por millón de tokens de entrada y 10 dólares por millón de salida. Es más que evidente que Google busca recortar distancias frente a los últimos avances en razonamiento presentados por sus rivales directos, como GPT-6 Astra o Claude Fable 5.1.
Un millón de tokens de salida para pensar sin prisas
El primero punto que debemos reseñar sobre este nuevo modelo es que Google ha ampliado la ventana de generación de tokens de salida hasta alcanzar el millón, superando ampliamente el límite previo de 64.000 tokens.
Este margen permite al sistema encadenar cientos de deducciones intermedias en una única secuencia sin necesidad de partir la consulta en varios pedazos. De hecho, la compañía deja claro lo necesario que es este margen de inferencia, especialmente si quiere que sus modelos sean herramientas competitivas y realmente útiles. Y pone dos ejemplos. Contar con este margen permite abordar migraciones completas de código o modelos de investigación financiera que demandan decenas de operaciones matemáticas encadenadas.
Cara a cara contra GPT-6 Astra y Claude Opus 5.5 en la mesa de pruebas
En las evaluaciones facilitadas por el laboratorio, Gemini 4 Argon lidera en tareas ofimáticas especializadas con un 68,9% en el Vals Index frente al 63,1% de GPT-6 Astra y el 67% de Claude Opus 5.5. Asimismo, en el banco de ingeniería de software DeepSWE v1.1, la propuesta de Google obtiene una marca del 77,9% frente al 74,1% del modelo de OpenAI.

Sin embargo, la comparativa también deja en evidente una pugna muy reñida, ya que GPT-6 Astra mantiene la delantera en FrontierSWE v2 con un 65,5% y en pruebas científicas como Terminal-Bench Science con un 68,1%.
En la interacción autónoma con entornos de escritorio bajo el protocolo OSWorld-2.0, el modelo de OpenAI encabeza la tabla con un 72,6% frente al 69,2% registrado por Google, mientras que Claude Opus 5.5 aventaja al resto en comandos de consola dentro de Terminal-bench con un 66,4%.
No obstante, la arquitectura de Google marca distancias en el procesamiento de contexto ultraextenso entre 256.000 y un millón de tokens, alcanzando un 84,2% en GraphWalks que supera con holgura el 71,8% obtenido por Astra y el 66,8% de Opus 5.5.
De becario en Rust a optimizador de memoria en la infraestructura interna de Google
Antes de abrir el acceso a desarrolladores externos, los ingenieros de Google han utilizado a Argon en su propia infraestructura para comprobar en sus propias carnes las capacidades reales del modelos. ¿Y con qué se han encontrado?
Según la compañía, en tareas de optimización de centros de datos, agentes basados en este modelo analizaron la telemetría del sistema para reorganizar la gestión de memoria, liberando más de 300 TiB de memoria RAM en servidores en producción. El modelo también participó en la reescritura a Rust de librerías críticas de C++ como el decodificador de vídeo libgav1, logrando un rendimiento 2,7 veces superior a la versión previa.
El dilema de la ciberseguridad
En el anuncio, Google también ha hablado de seguridad. La compañía dice que ha distribuido versiones sin salvaguardas a organizaciones de análisis como Wiz dentro de su iniciativa Scan for Good. Este acceso avanzado permitió detectar fallos críticos en historiales clínicos de software hospitalario que habían pasado desapercibidos para generaciones anteriores.
La comparativa refleja un empate técnico en CWE-bench v1, donde tanto Gemini 4 Argon como GPT-6 Astra comparten la primera posición del sector con un 68% de vulnerabilidades mitigadas de manera autónoma. Curiosamente, ese empate es triple, porque Grok 4.7 aparece en la primera posición.

Para mitigar riesgos antes de lanzarlo definitivamente en la suscripción Google AI Ultra, el laboratorio ha reforzado el aislamiento de los entornos de ejecución contra inyecciones indirectas de instrucciones. De este modo, monitoriza las cadenas de pensamiento y las activaciones internas para evitar que los agentes se desvíen del objetivo encomendado.
Finalmente, en pleno debate por la necesidad de ralentizar el desarrollo de la IA, Google ha defendido mantener la transparencia en los procesos lógicos, instando a los competidores de la industria a no recurrir a técnicas opacas que dificulten la trazabilidad de las decisiones del software. Un dardo que, sin duda, apunta directamente a OpenAI.
Fin del Artículo. ¡Cuéntanos algo en los Comentarios!



