Gadgets

Gemini 4 arrasa en los benchmarks y vuelve a meter a Google en la carrera de la IA

Gemini 4 arrasa en los benchmarks y vuelve a meter a Google en la carrera de la IA

Gemini 4 arrasa en los benchmarks y vuelve a meter a Google en la carrera de la IA

La imagen oficial de Google parece sacada de la nueva película de los 'Cuatro Fantásticos', pero qué va: supone la vuelta a una carrera que parecía haber abandonado. Durante meses la compañía ha estado un poco a la deriva en la lucha de los modelos frontera, pero con Gemini 4 Argon todo apunta, al menos según los benchmarks,  a que Google se posiciona como una de las tres empresas con los modelos más potentes del mundo. Y el problema es es: los benchmarks.

Google vuelve a estar ahí. Gemini 4 Argon llega con unos resultados en benchmarks que la colocan junto a OpenAI y Anthropic en la lucha por los modelos frontera más potentes del mundo. Artificial Analysis le da 53 puntos en su Intelligence Index, los mismos que GPT-6 Astra, pero es que según las pruebas internas de Google, Gemini 4 es una bestia que supera a Opus 5.5 y a Fable 5.1 en diversos tests. ¿Es realmente tan bueno como dice Google?

Captura De Pantalla 2026 10 01 A Las 8 45 18 Las pruebas internas parecen dejar claro que Gemini 4 Argon es hoy por hoy el mejor modelo del mundo. No estamos seguros de que lo sea.

No podemos saber si es el mejor. Aunque los datos tanto de Google como de Artificial Analysis dan muchas pistas sobre el fantástico rendimiento de Gemini 4 Argon, el problema es que el modelo no se ha lanzado de forma masiva. Primero estará disponible para un limitado grupo de "probadores de confianza" y especialistas en ciberseguridad mediante su programa Fairwind. El modelo también está siendo analizado por el Gobierno de EEUU, lo que se está convirtiendo en algo habitual para evitar bloqueos gubernamentales. 

Algunos empleados lo han probado y la historia se complica. Bloomberg ha hablado con empleados y ahí la capacidad del modelo empieza a ser algo más confusa. Ellos aseguran que aunque Argon efectivamente obtiene puntuaciones fantásticas en las pruebas, cuando lo ponen a trabajar en ciertas tareas de programación no va tan fino. Google lo niega, y Sundar Pichai asegura que sus equipos lo usan de forma extensiva y están obteniendo buenos resultados. Parece que a nivel interno hay división en cuanto a la capacidad práctica del modelo, y es imposible saber cómo se comporta para cada persona hasta que no podamos probarlo.

Captura De Pantalla 2026 10 01 A Las 8 43 19 Google vuelve a la carrera, pero sigue estando algo lejos de los modelos de Claude que siguen por delante según Artificial Analysis.

Un benchmark es solo eso, un benchmark. Pruebas como las dedicadas a la programación o automatización intentan servir como casos reales, pero siguen necesitando ser tareas delimitadas, verificables y con condiciones que se puedan reproducir una y otra vez. Como todos sabemos, nuestro día a día es bastante menos "limpio", y quienes usan la IA pueden trabajar con repositorios enormes, dependencias o documentación imperfecta. Aunque un modelo se porte genial en las pruebas, puede no ser tan bueno como parecía en la experiencia real con el usuario. Aquí depende el caso de uso y por supuesto la propia opinión del usuario. Lo que es bueno para unos puede no serlo tanto para otros.

Menos alucinaciones, pero... Artificial Analysis indica que la tasa de alucinaciones de Gemini 4 Argon es del 15% en AA-Omniscience mientras que GPT-6 Astra alucina un 50%, una diferencia enorme. Lo que ocurre es que Astra consigue mayor precisión en esta prueba. Aquí lo que está ocurriendo es que Gemini 4 no alucina tanto porqu es capaz de decir "no lo sé" en lugar de dar una respuesta inentada. Es una forma razonable de actuar, pero también demuestra que ese "15%" necesita contexto.

El debate sobre la IA ya no enfrenta a optimistas y pesimistas. Enfrenta a empresas con miles de millones en juego En Xataka El debate sobre la IA ya no enfrenta a optimistas y pesimistas. Enfrenta a empresas con miles de millones en juego

Google también quiere competir en precio. Gemini 4 tendrá al principio un precio promocional de 2/10 dólares por millón de tokens de entrada/salida, algo importante sobre todo ahora que usar estos modelos en tareas agénticas durtante horas puede salir muy caro. Según Artificial Intelligence, con ese coste rebajado Gemini 4 logra tener un coste por tarea un 40% inferior a GPT-6 Astra. Pero claro, eso no durará siempre, y Google duplicará los precios posteriormente para dejarlos en 4/20 dólares, lo que ya es un coste más difícil de asumir para un uso intensivo. Ahí esperamos que una potencial variante Flash alivie este apartado.

En Xataka | Seguir el ritmo de la IA en 2026 es imposible: el reto de descubrir cuál es el mejor chatbot a día de hoy

- La noticia Gemini 4 arrasa en los benchmarks y vuelve a meter a Google en la carrera de la IA fue publicada originalmente en Xataka por Javier Pastor .

Información compartida por Technology Newz.

Artículos relacionados