Cómo se valida una IA cuando un fallo puede costar vidas
La inteligencia artificial puede equivocarse de muchas formas: ofrecer una respuesta incorrecta, recomendar una opción poco adecuada o generar un código que no funciona. Sin embargo, en sistemas autónomos capaces de controlar drones, camiones, vehículos o robots industriales, un error puede tener consecuencias físicas irreversibles. Ese será el eje del debate que reunirá a Shield AI, Waabi y General Motors en el escenario Real World AI de TechCrunch Disrupt 2026.
El evento se celebrará del 13 al 15 de octubre en el centro Moscone West de San Francisco. La sesión, titulada Building AI Systems When Failure Is Not an Option, abordará una cuestión que se ha convertido en uno de los grandes retos tecnológicos de 2026: cómo saber que un sistema de IA está preparado para operar sin supervisión humana.
La autonomía no se valida como una aplicación de consumo
En muchas aplicaciones digitales, las empresas lanzan una versión beta, observan los fallos y mejoran el producto con el uso real. Ese enfoque resulta difícil de aplicar cuando la tecnología controla un avión no tripulado, un camión pesado o un robot que comparte espacio con trabajadores.
La validación de estos sistemas exige demostrar que pueden comportarse de forma segura ante situaciones conocidas, pero también ante escenarios inesperados. La dificultad está en que el mundo real presenta una combinación prácticamente ilimitada de variables: cambios meteorológicos, obstáculos imprevistos, comportamientos humanos, fallos de comunicación o decisiones de otros vehículos.
Además, un sistema autónomo no solo debe acertar. También tiene que saber cuándo no dispone de información suficiente y detenerse, reducir la velocidad o solicitar ayuda. Este equilibrio entre autonomía y prudencia es uno de los puntos más complejos del desarrollo de la IA física.
Shield AI: autonomía para operar sin conexión constante
Nathan Michael, director tecnológico de Shield AI, aportará la perspectiva de la autonomía aplicada a entornos militares. La compañía desarrolla Hivemind, una plataforma de autonomía de misiones diseñada para funcionar en aviones, drones y vehículos de distintos fabricantes sin depender continuamente de una conexión externa.
En febrero de 2026, Hivemind fue seleccionada por la Fuerza Aérea de Estados Unidos como proveedor de autonomía para el programa de aviones de combate colaborativos, conocido como CCA. Un mes después, Shield AI cerró una ronda de financiación de 1.500 millones de dólares, con una valoración posterior a la inversión de 12.700 millones.
Michael, antiguo responsable del Resilient Intelligent Systems Lab del Robotics Institute de Carnegie Mellon, se enfrenta a una paradoja especialmente difícil: los escenarios de combate son aquellos en los que resulta más complicado realizar pruebas exhaustivas. El adversario no coopera, las condiciones cambian constantemente y ningún simulador reproduce por completo la incertidumbre del campo de operaciones.
En este contexto, validar una IA no significa únicamente comprobar que ejecuta correctamente una misión prevista. También implica evaluar su capacidad para adaptarse a situaciones no contempladas, mantener unas reglas de seguridad y tomar decisiones cuando la comunicación con los operadores se interrumpe.
Waabi apuesta por la simulación para cubrir los casos extremos
Raquel Urtasun, fundadora y consejera delegada de Waabi, abordará el transporte autónomo desde la perspectiva de los datos y la simulación. Antes de crear la empresa, fue científica jefe de Uber Advanced Technologies Group. También es catedrática de Informática en la Universidad de Toronto y cofundadora del Vector Institute for AI.
Waabi captó 1.000 millones de dólares en enero de 2026 y anunció un acuerdo con Uber para desplegar al menos 25.000 robotaxis equipados con Waabi Driver. Su simulador Waabi World permite entrenar y poner a prueba sistemas autónomos en entornos virtuales antes de llevarlos a las carreteras.
Un simulador es un entorno digital que reproduce situaciones del mundo real para que una IA pueda practicar sin poner en riesgo a personas o vehículos. Permite repetir miles de veces una maniobra, modificar las condiciones y crear escenarios poco frecuentes. El problema es que incluso los simuladores tienen límites: pueden no representar correctamente un caso raro o una combinación de circunstancias que sus diseñadores no habían previsto.
Ese vacío recibe el nombre de desplazamiento de distribución. El término describe la diferencia entre los datos y situaciones utilizados durante el entrenamiento y aquellos que el sistema encuentra cuando empieza a operar. Precisamente los casos menos habituales suelen ser los más importantes para evaluar la seguridad.
General Motors pone el foco en las personas
Mikell Taylor, directora de estrategia de robótica del Centro de Robótica Autónoma de General Motors, trasladará el debate al entorno industrial. Su experiencia incluye el liderazgo del equipo de Amazon Robotics que desarrolló Proteus, el primer robot móvil autónomo de Amazon, además de trabajos en vehículos submarinos y sistemas robóticos para fábricas.
En una cadena de producción, un robot autónomo que se detiene por un error puede provocar pérdidas de decenas de miles de euros por hora. Pero un sistema demasiado conservador, que interrumpe continuamente su actividad para pedir confirmación a una persona, tampoco resulta útil. La dificultad consiste en calibrar cuándo debe actuar por sí mismo y cuándo debe ceder el control.
La interacción con los empleados es otro factor decisivo. Un robot que trabaja junto a personas debe interpretar movimientos imprevisibles, respetar distancias de seguridad y comunicar sus intenciones de forma comprensible. Para Taylor, la experiencia de uso y la aceptación de los trabajadores no pueden añadirse al final del proyecto: deben formar parte del diseño desde el principio.
Un problema común para toda la IA física
El debate llega en un momento de expansión de los sistemas autónomos en ámbitos militares, industriales y de transporte. También se han denunciado campañas de influencia con IA autónoma vinculadas a Irán y China, lo que refuerza la preocupación por el uso de sistemas capaces de operar con una intervención humana limitada.
La sesión de San Francisco no ofrecerá probablemente una fórmula definitiva. Ninguno de los tres sectores ha resuelto por completo cómo certificar una autonomía segura en todos los escenarios posibles. Sin embargo, sus métodos pueden marcar el camino para una nueva generación de robots, vehículos y sistemas de infraestructura.
La cuestión central ya no es solo cuánto puede hacer una IA, sino si sabemos medir sus límites antes de ponerla en el mundo real. A medida que estas tecnologías abandonan la pantalla y empiezan a mover máquinas, transportar personas o tomar decisiones en entornos críticos, la validación deja de ser una fase técnica más y se convierte en la condición imprescindible para desplegarlas.



