Publicidad

China acelera la carrera por los modelos de IA gigantes y apunta a los 10 billones de parámetros

La inteligencia artificial atraviesa una nueva fase de expansión. Mientras empresas de todo el mundo trabajan para crear modelos más pequeños, baratos y capaces de funcionar en móviles u ordenadores modestos, varias tecnológicas chinas están tomando la dirección opuesta: desarrollar sistemas con billones de parámetros y una capacidad de procesamiento muy superior.

Alibaba ya ha confirmado que entrena Qwen 4 y que su hoja de ruta para Qwen 4.5 y Qwen 5 contempla modelos de entre 5 y 10 billones de parámetros. La cifra marca un salto considerable frente a los sistemas actuales y refuerza la apuesta de China por competir en la gama más alta de la inteligencia artificial generativa.

De cientos de miles de millones a varios billones

El crecimiento de los modelos chinos se aprecia al comparar las cifras de sus principales familias. DeepSeek-V3 cuenta con 671.000 millones de parámetros totales, mientras que Kimi K2, desarrollado por Moonshot AI, alcanzó el billón.

La escalada se ha acelerado durante 2026. Kimi K3 ha elevado esa cifra hasta los 2,8 billones y Alibaba ha situado Qwen3.8-Max en 2,4 billones de parámetros. Estas cantidades describen el tamaño total del modelo, pero no indican necesariamente cuánta capacidad se utiliza en cada respuesta.

Un parámetro es, en términos sencillos, uno de los valores internos que una inteligencia artificial ajusta durante su entrenamiento para aprender a relacionar palabras, imágenes, datos o instrucciones. Cuantos más parámetros tiene un modelo, más información puede representar potencialmente, aunque eso no garantiza por sí solo que sea más preciso o inteligente.

La clave está en no activarlo todo a la vez

Los modelos más grandes suelen recurrir a una arquitectura conocida como Mixture of Experts, o mezcla de expertos. En lugar de utilizar todos sus componentes para responder a cada petición, el sistema selecciona solo los módulos más adecuados para cada tarea.

Qwen3.8-Max es un ejemplo de esta estrategia. Aunque reúne alrededor de 2,4 billones de parámetros, emplea aproximadamente 95.000 millones en cada paso de procesamiento. El modelo mantiene una gran capacidad global, pero reduce el coste de cálculo de cada operación al activar únicamente una parte de su estructura.

Esta técnica permite construir sistemas enormes sin que cada consulta requiera poner en marcha todos sus recursos. Aun así, entrenar y alojar un modelo de estas dimensiones exige centros de datos con miles de aceleradores, redes de alta velocidad, grandes cantidades de memoria y un consumo energético considerable.

Más parámetros no garantizan mejores resultados

El tamaño de un modelo no funciona como una clasificación automática de su calidad. El rendimiento también depende de la arquitectura, de los datos utilizados durante el entrenamiento, de la calidad de esos datos y de la capacidad de computación disponible.

Un caso especialmente conocido es el de Chinchilla, presentado por DeepMind en 2022. Con 70.000 millones de parámetros, logró superar en numerosas tareas a Gopher, un sistema de 280.000 millones, cuando ambos se compararon con un presupuesto de entrenamiento similar. La diferencia estuvo, entre otros factores, en que Chinchilla fue entrenado con aproximadamente cuatro veces más datos.

La conclusión es relevante para la nueva carrera por los modelos colosales: aumentar el número de parámetros puede ampliar las capacidades de un sistema, pero solo resulta útil si se acompaña de datos suficientes, una arquitectura eficiente y un entrenamiento bien ajustado.

China quiere cubrir todos los tamaños de la IA

La apuesta china no consiste en abandonar los modelos pequeños. Al contrario, compañías como Alibaba, con Qwen, y otras firmas del país han ganado visibilidad con sistemas diseñados para funcionar con menos memoria y capacidad de cálculo.

Los modelos compactos son especialmente útiles cuando se busca reducir costes, proteger datos o ejecutar la inteligencia artificial directamente en un móvil, un ordenador personal, una cámara o un dispositivo industrial. Al procesar parte de la información localmente, también pueden reducir la dependencia de la nube y mejorar los tiempos de respuesta.

Los modelos gigantes persiguen un objetivo diferente. Están orientados a tareas complejas y variadas, como el razonamiento avanzado, la programación, el análisis de grandes volúmenes de información, la generación multimedia o el uso de herramientas externas. Su precio es una infraestructura mucho más cara y difícil de mantener.

Una competición difícil de medir

La comparación entre los modelos chinos y estadounidenses no resulta sencilla. Algunas compañías publican el número total de parámetros, mientras que otras no revelan este dato en las especificaciones de sus sistemas más recientes.

Por ese motivo, no basta con comparar las cifras anunciadas para determinar qué modelo es más potente. También hay que analizar los resultados en pruebas independientes, el coste por consulta, la velocidad de respuesta, el consumo energético y la capacidad para resolver tareas reales.

Con Qwen 4 y los modelos posteriores en el horizonte, China parece decidida a competir en los dos extremos del mercado: sistemas pequeños y eficientes para acercar la IA al usuario, y modelos colosales para los servicios que requieren la máxima capacidad disponible. La carrera ya no consiste únicamente en construir el modelo más grande, sino en encontrar el tamaño adecuado para cada uso.

Artículo anteriorDía Mundial del Pulmón: señales y enfermedades frecuentes
Artículo siguienteJensen Huang pide cerrar OpenAI si no logra controlar su IA