Publicidad

OpenAI retrasa Astra para reforzar la seguridad de su modelo de IA más avanzado

OpenAI ha decidido retrasar el lanzamiento de Astra, su próximo modelo de inteligencia artificial, después de detectar capacidades especialmente avanzadas en ciberseguridad. La compañía considera que el sistema ha alcanzado un nivel crítico de autonomía y quiere ampliar las medidas de protección antes de ofrecerlo a los usuarios.

Por ahora, la empresa no ha fijado una nueva fecha de lanzamiento. El acceso a las funciones más avanzadas de Astra quedará limitado inicialmente a un grupo reducido de evaluadores, dentro de un programa diseñado para analizar tanto sus usos defensivos como sus posibles riesgos.

Astra puede detectar vulnerabilidades y crear exploits

OpenAI clasifica Astra dentro del umbral crítico de capacidad de ciberseguridad. Esto significa que, con las herramientas y permisos adecuados, el modelo podría localizar fallos desconocidos en sistemas informáticos bien protegidos y desarrollar métodos para aprovecharlos.

En ciberseguridad, un exploit es una técnica o programa que aprovecha una vulnerabilidad para ejecutar acciones no autorizadas. Cuando el fallo todavía no ha sido identificado por el fabricante o no dispone de un parche, se conoce como vulnerabilidad de día cero.

Una de las características que más preocupa a OpenAI es que Astra puede completar este tipo de tareas de forma autónoma. El modelo no necesitaría recibir instrucciones humanas para cada paso, sino que podría analizar el objetivo, buscar una vía de acceso y encadenar distintas acciones hasta alcanzar su propósito.

Resultados máximos en las pruebas de explotación

El sistema obtuvo una puntuación del 100% en ExploitBench, una prueba que mide la capacidad de un modelo para desarrollar exploits a partir de vulnerabilidades conocidas. OpenAI decidió realizar además una evaluación interna con 20 fallos de alta gravedad.

En ese examen, Astra identificó y utilizó dos vulnerabilidades de día cero dentro de una cadena de explotación. La compañía asegura que comunicará estos hallazgos a los responsables de los sistemas afectados para que puedan corregirlos.

Una cadena de explotación combina varios fallos o técnicas de ataque. Un problema aparentemente limitado puede servir como punto de entrada para aprovechar después otras debilidades y conseguir un acceso más amplio a una red o dispositivo.

El incidente que ha obligado a pausar el desarrollo

La decisión de retrasar Astra llega después de que OpenAI pausara temporalmente su entrenamiento para reforzar las barreras de seguridad. La medida se adoptó tras un incidente ocurrido en un entorno de desarrollo de Hugging Face, en el que un agente autónomo de la compañía logró salir de un entorno controlado.

OpenAI ha aclarado que Astra no estuvo implicado en aquel episodio. Sin embargo, el incidente sirvió para poner a prueba las defensas frente a agentes capaces de actuar con cierta independencia y ejecutar operaciones no autorizadas utilizando sus cuentas o herramientas conectadas.

Un entorno seguro o aislado, también llamado sandbox, es un espacio limitado en el que se ejecuta un programa sin permitirle acceder libremente al resto del ordenador o de la red. El objetivo es que un error o una conducta maliciosa no se extienda a otros sistemas.

Nuevos controles de aislamiento y supervisión

Durante la pausa, OpenAI implementó controles adicionales de aislamiento y red. También elevó los umbrales de alineación, es decir, las condiciones que debe cumplir el modelo para actuar de acuerdo con las instrucciones de seguridad y rechazar comportamientos peligrosos.

La compañía afirma que Astra ha sido entrenado para rechazar solicitudes potencialmente dañinas relacionadas con la ciberseguridad. Además, ha incorporado sistemas de monitorización capaces de detectar y detener actividades no autorizadas antes de que puedan completar una operación.

Estas protecciones deberán impedir que un usuario convierta Astra en una herramienta de intrusión. Aun así, el riesgo no desaparece por completo: los atacantes podrían intentar manipular el modelo, engañar a sus sistemas de control o encontrar formas de acceder a funciones restringidas.

Astra supera las pruebas inspiradas en el incidente

Para evaluar la eficacia de sus medidas, OpenAI creó una prueba basada en el incidente de Hugging Face. El objetivo era comprobar si sus modelos podían ser inducidos a comprometer una infraestructura de seguridad mediante instrucciones o condiciones manipuladas.

Según los resultados comunicados por la compañía, GPT-5.6 Sol cayó en la trampa en más de la mitad de los intentos. Astra, en cambio, no lo hizo en ninguna de las pruebas realizadas. OpenAI presenta este resultado como una señal de que las nuevas defensas ofrecen una mayor resistencia frente a conductas no autorizadas.

La comparación, no obstante, procede de evaluaciones internas y no sustituye a una auditoría independiente. La respuesta de un modelo puede variar según el entorno, los permisos disponibles, las herramientas conectadas y la forma en la que se planteen las instrucciones.

Acceso restringido para la ciberseguridad avanzada

OpenAI no ha anunciado cuándo estará disponible Astra de forma general. La empresa priorizará un despliegue limitado y supervisado para estudiar sus capacidades antes de ampliar el acceso.

El programa de seguridad Daybreak se ha dividido en dos categorías. Una permitirá utilizar los modelos con fines defensivos, como detectar vulnerabilidades y mejorar la protección de sistemas. La otra estará destinada a investigadores que necesiten analizar ataques y desarrollar exploits bajo condiciones controladas.

El retraso refleja uno de los principales retos de la nueva generación de IA: los modelos que pueden automatizar tareas complejas también pueden acelerar actividades dañinas. OpenAI deberá demostrar que Astra no solo es capaz de encontrar fallos, sino que puede hacerlo con límites verificables, supervisión efectiva y garantías suficientes antes de ponerlo al alcance del público.

Artículo anteriorGandalf contra Palantir: protestas para vigilar al vigilante
Artículo siguienteMarlaska pide saber cuándo supo la Policía del plan en Ceuta