El ‘prompt injection’ ya tiene su propio contraataque: inyectar falsas instrucciones también a los hackers
Durante los últimos dos años, el prompt injection ha sido el arma favorita de los ciberatacantes contra sistemas de inteligencia artificial. Este método pasa por esconder una instrucción maliciosa dentro de un correo, una invitación de calendario o una página web para que un agente de IA acabe obedeciendo al intruso en lugar de a su usuario legítimo. Lo bueno es que esta misma técnica también sirve para pararle los pies a los atacantes.
La técnica del ‘context bombing’
La firma de ciberseguridad Tracebit ha descubierto un método para detener a un agente de IA que está atacando un sistema. Consiste en colocar, junto a las contraseñas y claves que el atacante busca robar, un texto diseñado para activar los propios mecanismos de rechazo del modelo.
Cómo funciona
La técnica, bautizada como ‘context bombing’, aprovecha las barreras de seguridad incorporadas en los grandes modelos de lenguaje. Al colocar fragmentos de texto que empujan al modelo hacia temas prohibidos, se activa un mecanismo de rechazo en el contexto del agente de IA.
Resultados de la investigación de Tracebit
La investigación de Tracebit probó la técnica sobre cinco de los modelos más avanzados del momento, con resultados sorprendentes. En el caso de Opus 4.8, el modelo más eficaz, fracasó en el 100% de los casos cuando se utilizó la trampa de contexto.
Vulnerabilidad por naturaleza
La técnica ‘context bombing’ explota una debilidad difícil de corregir, ya que se basa en restricciones políticas o regulatorias incorporadas en los modelos de IA. Esto convierte esas barreras en un punto de apoyo estable para la protección contra los ciberataques.
Antecedentes y futuras implicaciones
Anteriormente, Tracebit presentó un sistema de «canarios» para detectar intentos de ataque de forma temprana. El ‘context bombing’ surge como una medida para detener los ataques en lugar de solo alertar sobre ellos, ganando tiempo crucial para los defensores de sistemas de IA.
En resumen, la lucha entre ciberatacantes y defensores de sistemas de inteligencia artificial continúa evolucionando, mostrando la importancia de adaptarse a las nuevas técnicas de ataque y defensa en el panorama tecnológico actual.



