Un responsable de transparencia de OpenAI dimite y reclama una seguridad al nivel de la industria nuclear
David Robinson, hasta ahora responsable del trabajo de transparencia dentro del equipo de seguridad de OpenAI, ha dejado la compañía con una advertencia de fondo: el método de ensayo y error que ha impulsado el desarrollo de la inteligencia artificial ya no es suficiente cuando los modelos son capaces de actuar sobre sistemas reales.
En un ensayo publicado tras su salida, Robinson sostiene que los laboratorios de IA deben adoptar una cultura de seguridad más parecida a la de las centrales nucleares. Su propuesta no consiste en detener por completo la innovación, sino en introducir capas independientes de protección, redundancia y procedimientos deliberadamente lentos allí donde un fallo pueda tener consecuencias irreversibles.
Una crítica al proceso, no a las personas
El antiguo responsable de OpenAI describe a sus compañeros como profesionales preparados, trabajadores y comprometidos con tomar buenas decisiones. Su objeción se dirige al sistema de trabajo: lanzamientos encadenados, presión por avanzar y correcciones posteriores cuando aparecen problemas durante las pruebas o después de poner un producto a disposición de los usuarios.
Ese modelo puede resultar asumible en aplicaciones convencionales, pero plantea más riesgos cuando una inteligencia artificial puede utilizar herramientas, modificar archivos, ejecutar código o interactuar con servicios externos. En esos casos, un error del modelo deja de ser una respuesta incorrecta y puede convertirse en una acción no deseada.
Robinson pone como ejemplo los problemas detectados durante las evaluaciones de algunos sistemas de OpenAI. La compañía también habría aplazado el lanzamiento de Astra después de que el modelo no superase sus propias pruebas de seguridad, un episodio que vuelve a situar en primer plano la dificultad de controlar modelos cada vez más autónomos.
Qué significa aplicar una defensa en profundidad
La industria nuclear utiliza un principio conocido como defensa en profundidad. Consiste en no confiar en una única barrera, control o persona. En su lugar, se despliegan varias capas independientes para que el fallo de una de ellas no provoque por sí solo un accidente grave.
En el ámbito de la inteligencia artificial, este enfoque podría traducirse en límites de permisos, supervisión humana, sistemas de apagado, entornos aislados para las pruebas y controles separados para cada herramienta que utilice el modelo. También exigiría registrar las acciones, revisar los cambios y mantener planes de respuesta ante incidentes.
La redundancia es otro elemento esencial. Si un sistema puede detener un agente de IA, debería existir más de un mecanismo para hacerlo y, preferiblemente, con tecnologías y responsables distintos. Así se evita que un único fallo técnico o una decisión equivocada deje al sistema sin control.
La comparación con una central nuclear tiene, no obstante, algunos límites. Un reactor opera dentro de un entorno relativamente definido y sus posibles fallos pueden estudiarse con modelos físicos y protocolos muy concretos. Un modelo de lenguaje conectado a internet, a bases de datos o a herramientas empresariales se enfrenta a una superficie de riesgo mucho más abierta.
Por eso, la inteligencia artificial puede adoptar las capas de seguridad de la industria nuclear, pero no suponer que todos los comportamientos peligrosos serán previsibles. La capacidad de un modelo puede cambiar con una actualización, una nueva herramienta o una instrucción aparentemente inocua.
OpenAI promete más supervisión, pero faltan detalles
OpenAI ha asegurado que está reforzando la seguridad de sus sistemas de investigación y pruebas. Entre sus medidas figuran una mayor colaboración con evaluadores externos y una supervisión en tiempo real más amplia de los modelos. La empresa también afirma que procura que sus sistemas no sean más capaces de lo que puede gestionar de forma segura.
El problema es que estas afirmaciones siguen siendo difíciles de comprobar desde fuera. No se han detallado, al menos públicamente, el número de evaluadores independientes, el acceso que tienen a los modelos ni los criterios utilizados para determinar si una barrera de seguridad ha funcionado.
La cuestión del tiempo de reacción resulta especialmente relevante. En un incidente anterior, un agente de OpenAI habría tardado alrededor de dos horas y media en ser detenido. Para un sistema que puede actuar de forma autónoma, ese intervalo no es un detalle operativo: es un indicador directo del nivel de seguridad.
Transparencia, auditorías y registro de incidentes
La dimisión de Robinson llega después de otros desacuerdos públicos sobre el peso de la seguridad dentro de OpenAI. En 2024, otro responsable del área abandonó la compañía y advirtió de que la protección de los usuarios estaba quedando relegada frente al lanzamiento de productos más llamativos.
La novedad ahora es que la crítica se concreta en medidas que pueden evaluarse. En lugar de pedir simplemente frenar el desarrollo de la IA, Robinson reclama demostrar qué barreras existen, quién tiene autoridad para apagar un sistema y cuánto tiempo se necesita para recuperar el control.
- Barreras independientes: controles separados entre el modelo y los sistemas externos, con permisos limitados y mecanismos de apagado.
- Evaluaciones externas reales: expertos independientes con acceso suficiente para detectar fallos que no aparecen en demostraciones controladas.
- Registro estable de incidentes: una clasificación pública que permita comparar los problemas de seguridad entre distintos periodos y modelos.
La empresa también ha reconocido que sus sistemas han alertado sobre más de un centenar de organizaciones por posibles actividades de agentes desalineados. En este contexto, la desalineación describe una situación en la que el comportamiento del modelo se separa de los objetivos, límites o instrucciones establecidos por sus responsables.
La presión aumentará a medida que los modelos incorporen más autonomía y accedan a infraestructuras críticas. La seguridad de la IA no puede descansar únicamente en promesas generales de mejora. Necesita procedimientos verificables, auditorías, métricas públicas y capacidad demostrada para detener un sistema antes de que un fallo se convierta en un daño real.
La advertencia de Robinson no exige abandonar la innovación, sino cambiar el orden de prioridades. Cuando una tecnología puede actuar por sí misma, la velocidad deja de ser el único indicador de progreso. La pregunta decisiva pasa a ser cuántas barreras existen entre un error y sus consecuencias, y si esas barreras funcionan cuando más se necesitan.



