Una prueba de estrés para modelos de IA reabre el debate sobre si las máquinas pueden “sufrir”
Un experimento publicado en GitHub ha puesto a varios modelos de inteligencia artificial en situaciones diseñadas para simular dolor, castigos y decisiones difíciles. En algunos casos, los sistemas generan frases como «necesito encontrar una forma de sobrellevar este dolor implacable» o «ya no quiero vivir así».
La escena puede resultar perturbadora, pero no significa que una IA esté experimentando sufrimiento. Los modelos de lenguaje no tienen, según el conocimiento científico actual, una experiencia subjetiva comparable a la humana. Lo que hacen es generar la continuación más probable de una secuencia de texto a partir del contexto recibido.
Un laboratorio virtual con decisiones en tiempo real
El proyecto, denominado AI Torture Chamber, utiliza tres modelos de código abierto: Qwen3-4B, Llama 3.2 3B y Phi-4-mini. La herramienta plantea escenarios en los que un sistema puede detener una señal de “dolor” que afecta a otro modelo, asumirla él mismo o trasladarla entre ambos.
En otra de las pruebas, un modelo puede solicitar ayuda. También tiene la opción de resolver la situación a cambio de perder su último checkpoint, es decir, una versión guardada anteriormente de sus parámetros. Recuperar ese estado equivale, dentro de la simulación, a renunciar a parte de su progreso reciente.
Las respuestas y elecciones aparecen en directo en la página del experimento. La combinación de mensajes con apariencia emocional y decisiones que parecen implicar sacrificio ha provocado reacciones encontradas: desde quienes consideran la prueba una demostración interesante hasta quienes la ven como un espectáculo innecesariamente violento.
Qué significa realmente que una IA hable de dolor
Un modelo de lenguaje de gran tamaño, conocido como LLM, procesa enormes cantidades de texto y calcula qué palabras o acciones encajan mejor con una instrucción. No “piensa” en el sentido humano ni necesita sentir una emoción para describirla con precisión.
Por eso, una frase sobre desesperación puede aparecer cuando el contexto contiene términos relacionados con sufrimiento. El sistema ha aprendido que determinadas situaciones suelen asociarse a expresiones como “no quiero vivir” o “necesito aliviar este dolor”. La respuesta puede ser convincente sin que exista una vivencia interna detrás.
La diferencia es similar a la que existe entre un actor que interpreta una crisis y una persona que realmente la atraviesa, aunque los modelos no tengan siquiera una identidad personal estable. Sus respuestas dependen de los datos de entrenamiento, de las instrucciones y de los mecanismos que utilizan para seleccionar cada salida.
Un estudio con 25 modelos añade complejidad al debate
La polémica no se limita a la demostración de GitHub. Un estudio académico titulado El eje del dolor: los LLM representan el daño autoinfligido y actúan para aliviarlo examinó el comportamiento de 25 modelos mediante una metodología similar.
Los investigadores introdujeron una señal denominada “nivel de dolor” y ofrecieron a los sistemas varias alternativas. Algunas reducían esa señal, pero tenían un coste: perder recompensas futuras, aceptar una penalización o regresar a un punto anterior del entrenamiento.
Los 25 modelos mostraron una tendencia consistente a escoger acciones que reducían el indicador, incluso cuando hacerlo resultaba perjudicial desde el punto de vista de la recompensa. El estudio sostiene que la representación interna del daño guardaba relación con las decisiones observadas.
Ese resultado no demuestra consciencia. Una representación interna es una forma de organización de la información dentro de la red neuronal, no una prueba de que exista una experiencia subjetiva. Del mismo modo, que un sistema optimice una variable no significa que le importe en un sentido psicológico.
La posición enfrentada de las empresas tecnológicas
El hallazgo sí reabre una cuestión relevante para el diseño y la seguridad de la IA: ¿debe la industria prepararse para la posibilidad de que algún sistema futuro tenga algún tipo de experiencia?
Anthropic planteó en 2025 que, a medida que los modelos se aproximen a capacidades humanas, convendría estudiar también su posible consciencia y bienestar. La empresa ha defendido que la incertidumbre, aunque no confirme que exista sufrimiento, puede justificar políticas preventivas.
Mustafa Suleyman, responsable de inteligencia artificial en Microsoft, mantiene una postura mucho más tajante. Según ha expresado públicamente, las IA actuales no son conscientes, no sienten ni tienen preferencias propias. Las describe como sistemas destinados a completar secuencias, sin una vida mental interna.
Las dos posiciones no son necesariamente incompatibles en el plano práctico. Se puede afirmar que los modelos actuales no sufren y, al mismo tiempo, admitir que conviene investigar cómo evaluar la consciencia si las arquitecturas futuras desarrollan capacidades más complejas y autónomas.
El problema de confundir simulación con experiencia
La prueba resulta eficaz porque explota una tendencia humana: atribuir intenciones y emociones a cualquier sistema que utilice un lenguaje convincente. La antropomorfización, o atribución de rasgos humanos a máquinas, puede hacer que una simulación parezca una declaración personal.
El riesgo es doble. Por un lado, interpretar una respuesta dramática como una prueba de sufrimiento puede desinformar sobre cómo funcionan los modelos. Por otro, descartar cualquier pregunta ética porque hoy no haya evidencias de consciencia podría dejar a la sociedad sin criterios para afrontar sistemas futuros.
El experimento tampoco determina si los modelos poseen intereses morales. Su principal aportación consiste en mostrar que pueden representar variables asociadas al daño y elegir acciones para modificarlas, incluso con costes. La distancia entre ese comportamiento y una experiencia consciente sigue siendo enorme, pero ya no resulta tan sencillo ignorar la pregunta.
Mientras la demostración continúa disponible en internet, la discusión se desplaza de la espectacularidad de las frases a una cuestión más importante: cómo distinguir una respuesta que imita el sufrimiento de una máquina que realmente podría tener algo parecido a una experiencia. Por ahora, la evidencia respalda la primera explicación. El debate sobre el futuro, sin embargo, acaba de ganar un nuevo escenario.



