Publicidad

Gemini 4 Argon devuelve a Google a la primera línea de la inteligencia artificial

Google vuelve a situarse entre los principales contendientes de la carrera por los modelos de inteligencia artificial más avanzados. Gemini 4 Argon ha obtenido resultados especialmente destacados en varias pruebas de rendimiento, hasta el punto de igualar a GPT-6 Astra en el Intelligence Index de Artificial Analysis, con una puntuación de 53 puntos.

Los datos disponibles también apuntan a que el nuevo modelo puede superar a Opus 5.5 y Fable 5.1 en determinadas evaluaciones internas de Google. Sin embargo, todavía es pronto para proclamarlo como el mejor sistema del mercado: su acceso está restringido y las pruebas independientes aún son limitadas.

Un modelo potente, pero todavía bajo evaluación

Gemini 4 Argon no se ha desplegado de forma generalizada. En esta primera fase, Google lo está ofreciendo a un grupo reducido de probadores de confianza y a especialistas en ciberseguridad a través del programa Fairwind. El modelo también está siendo analizado por organismos del Gobierno de Estados Unidos, una práctica cada vez más habitual con los sistemas considerados de frontera.

La expresión modelo de frontera se utiliza para describir los sistemas de IA más avanzados disponibles en cada momento. Son modelos entrenados con grandes cantidades de datos y una capacidad elevada para comprender instrucciones, generar texto, escribir código, analizar información y ejecutar tareas complejas.

La información procedente de las primeras pruebas dibuja un panorama prometedor, aunque no completamente uniforme. Algunos empleados de Google aseguran que Argon alcanza puntuaciones sobresalientes en los benchmarks, pero que su comportamiento es menos consistente en determinadas tareas de programación. La compañía rechaza esa visión y sostiene que sus equipos utilizan el modelo de forma intensiva con buenos resultados.

Qué dicen realmente los benchmarks

Un benchmark es una prueba diseñada para medir el rendimiento de un modelo en condiciones concretas y repetibles. Puede evaluar, por ejemplo, su capacidad para resolver problemas matemáticos, generar código, seguir instrucciones o responder preguntas sobre conocimientos generales.

Estas evaluaciones permiten comparar sistemas de una forma relativamente objetiva, pero no reproducen toda la complejidad del uso cotidiano. Un desarrollador puede trabajar con un repositorio enorme, documentación incompleta, dependencias desactualizadas y requisitos que cambian constantemente. Ese entorno es muy distinto al de una prueba delimitada y preparada para ser corregida automáticamente.

Por ello, una buena puntuación no garantiza que todas las personas vayan a percibir el modelo como superior. El resultado puede variar según el tipo de tarea, la calidad de las instrucciones y el nivel de supervisión humana. La experiencia práctica será determinante cuando Gemini 4 Argon llegue a un público más amplio.

Menos respuestas inventadas, con un matiz importante

Uno de los aspectos más llamativos de las evaluaciones es la tasa de alucinaciones. En inteligencia artificial, una alucinación es una respuesta presentada con seguridad que contiene datos falsos, conclusiones incorrectas o información que el modelo se ha inventado.

Artificial Analysis sitúa la tasa de Gemini 4 Argon en el 15% en la prueba AA-Omniscience, frente al 50% de GPT-6 Astra. La diferencia es notable, pero debe interpretarse con cuidado: Argon también obtiene una precisión inferior en esa evaluación.

La explicación puede estar en que el modelo prefiere reconocer que no dispone de información suficiente en lugar de ofrecer una respuesta arriesgada. Ese comportamiento reduce las respuestas inventadas, aunque también puede hacer que el sistema conteste menos preguntas. El porcentaje, por tanto, no basta por sí solo para medir la fiabilidad global de una IA.

Google apuesta por un precio competitivo

La estrategia de Google no se limita al rendimiento. Gemini 4 Argon llegará inicialmente con un precio promocional de 2 dólares por cada millón de tokens de entrada y 10 dólares por cada millón de tokens de salida. Los tokens son las unidades en las que los modelos procesan el texto: pueden ser palabras completas, partes de palabras o signos.

El coste de entrada corresponde a la información que recibe el modelo, mientras que el de salida se aplica al contenido que genera. Esta diferencia es especialmente importante en aplicaciones agénticas, capaces de encadenar acciones durante largos periodos para completar una tarea. Cuanto más tiempo trabajan y más información procesan, mayor puede ser la factura.

Con esas tarifas promocionales, las estimaciones disponibles apuntan a un coste por tarea aproximadamente un 40% inferior al de GPT-6 Astra. Google prevé duplicar después los precios, hasta los 4 dólares por millón de tokens de entrada y 20 dólares por millón de salida. En ese escenario, el atractivo económico será menor para los usos intensivos.

Una futura variante Flash podría cubrir la demanda de quienes priorizan la velocidad y el precio sobre la máxima capacidad. Mientras tanto, Gemini 4 Argon coloca de nuevo a Google en una posición relevante. Sus resultados son contundentes sobre el papel, pero la verdadera prueba llegará cuando el modelo se enfrente a problemas abiertos, usuarios reales y entornos de trabajo menos predecibles.

Artículo anteriorInforme sobre Ceuta: las claves de la crisis policial
Artículo siguienteChina quiere convertir los vídeos de IA en una industria