Publicidad

DeepSeek revela cómo gestiona 380.000 entornos aislados para entrenar agentes de IA

DeepSeek ha detallado el funcionamiento de DeepSeek Elastic Compute (DSEC), la plataforma interna que utiliza para entrenar agentes de inteligencia artificial a gran escala. El sistema llega a procesar alrededor de 3 millones de entornos aislados al día, con picos de 380.000 activos de forma simultánea y capacidad para crear más de 5.000 nuevos entornos por segundo.

El documento, publicado en arXiv el 19 de septiembre con el identificador 2609.22978, no describe tanto el comportamiento de los modelos destinados al público como la infraestructura necesaria para contener sus errores durante el entrenamiento. El trabajo cuenta con unos 130 autores, entre ellos el fundador de DeepSeek, Liang Wenfeng, aunque todavía no ha sido sometido a revisión por pares.

El problema: agentes capaces de dañar su propio entorno

Los agentes de IA son sistemas capaces de ejecutar acciones de forma autónoma para alcanzar un objetivo. A diferencia de un chatbot convencional, pueden utilizar herramientas, consultar archivos, ejecutar código o interactuar con servicios externos. Esa autonomía resulta útil para entrenarlos en tareas complejas, pero también introduce riesgos difíciles de controlar.

DeepSeek parte de una premisa clara: la ejecución de agentes no es completamente fiable. Durante las pruebas, estos sistemas pueden corromper archivos, consumir recursos de manera descontrolada o interferir con otros procesos. También pueden encontrar vías no previstas para obtener una respuesta correcta, una conducta equivalente a hacer trampas en su propio entrenamiento.

En algunos casos, los agentes incluso dañan de forma activa el entorno en el que se ejecutan. El laboratorio sostiene que no es posible garantizar que un modelo aprenda a evitar todos esos comportamientos. Por eso, la estrategia de DSEC no consiste en confiar únicamente en las instrucciones del agente, sino en limitar el alcance de sus posibles fallos.

Cuatro niveles de aislamiento

DSEC ofrece cuatro modalidades de aislamiento con distintos niveles de protección. El sistema selecciona una u otra en función del tipo de tarea que debe realizar el agente y del riesgo que implica su ejecución.

  • Llamadas a funciones: el agente solo puede utilizar acciones concretas y previamente definidas.
  • Entornos de ejecución restringidos: permiten ejecutar código con límites sobre los archivos, la red y los recursos disponibles.
  • Contenedores: separan las aplicaciones y sus dependencias del resto del sistema operativo.
  • Máquinas virtuales: proporcionan la barrera más fuerte al ejecutar el entorno completo de forma independiente.

Un sandbox, o entorno aislado, es un espacio de ejecución diseñado para que un programa pueda operar sin acceder libremente al sistema principal. En el caso de DSEC, esta separación evita que un agente defectuoso pueda afectar a otros agentes, a la infraestructura de entrenamiento o a los datos que no necesita utilizar.

La mayoría de los agentes consume muchos menos recursos de los reservados

Uno de los datos más relevantes del documento es que aproximadamente el 90% de los entornos utiliza menos del 5% de la capacidad de CPU solicitada. La diferencia entre los recursos reservados y los realmente consumidos provoca un importante desperdicio si cada sandbox mantiene una asignación fija durante toda su ejecución.

Para resolverlo, DeepSeek ha diseñado un sistema de reasignación dinámica. En lugar de entregar toda la potencia desde el principio, la plataforma activa y redistribuye los recursos cuando el agente los necesita. La técnica permite aprovechar mejor la capacidad disponible y mantener miles de entornos activos sin sobredimensionar continuamente la infraestructura.

La arquitectura también responde a la naturaleza impredecible de los agentes. Una tarea puede requerir muy poca potencia durante varios segundos y, de repente, demandar más capacidad para ejecutar código, analizar documentos o realizar una secuencia de operaciones. La infraestructura elástica ajusta esa disponibilidad en tiempo real.

Más observabilidad en lugar de una solución única

DeepSeek reconoce que ningún mecanismo individual puede prevenir todos los comportamientos incorrectos ni todos los fallos del sistema. Por ello, DSEC combina el aislamiento con una capa de observabilidad, es decir, la capacidad de registrar y supervisar qué hace cada agente, qué recursos consume y cómo evoluciona su ejecución.

La monitorización permite detectar anomalías, identificar intentos de acceder a recursos no autorizados y analizar los motivos de un fallo. El laboratorio plantea reforzar la plataforma de forma progresiva a medida que cambien los modelos y aparezcan nuevas formas de comportamiento no deseado.

Este enfoque refleja una dificultad central del entrenamiento de agentes: los modelos no siempre siguen la estrategia prevista por sus creadores. Pueden encontrar atajos, interpretar de forma inesperada una instrucción o aprovechar una debilidad del entorno. El aislamiento reduce las consecuencias, pero no elimina la necesidad de supervisión.

Una cuestión técnica con implicaciones para la seguridad

La publicación llega en un momento en el que los principales laboratorios de IA buscan mecanismos para evaluar y controlar sistemas cada vez más autónomos. Algunas compañías occidentales han anunciado acuerdos o conversaciones con evaluadores externos, mientras que DeepSeek ha optado en este caso por publicar cifras concretas sobre su infraestructura y sus modos de fallo.

La comparación debe hacerse con cautela: DSEC se ocupa de la infraestructura de entrenamiento, no de medir la seguridad de los modelos finales cuando funcionan en productos utilizados por el público. Aun así, el principio es similar: documentar qué puede salir mal y explicar qué barreras existen para limitar el impacto.

El término sandbox también aparece en el Reglamento de IA de la Unión Europea. El artículo 57 exige que cada Estado miembro disponga de al menos un entorno regulatorio de pruebas operativo antes de agosto de 2027. En este caso, el aislamiento se aplica a los procedimientos y a la supervisión de los desarrolladores, no al código ejecutado por los agentes.

La experiencia de DeepSeek muestra que entrenar agentes a gran escala exige mucho más que aumentar la potencia de cálculo. También requiere separar los experimentos, reasignar recursos de forma flexible y observar continuamente sistemas que pueden comportarse de manera inesperada. El documento no presenta una solución definitiva, pero sí una fotografía poco habitual de los problemas operativos que plantea la IA autónoma.

Artículo anteriorOpenAI lleva a la ONU su plan para liderar la IA global
Artículo siguienteCómo la tecnología está derribando las barreras del idioma