Darktrace demuestra cómo historiales manipulados pueden secuestrar agentes de IA
Darktrace publicó el 24 de septiembre una investigación sobre una debilidad en herramientas de programación con agentes de inteligencia artificial: el historial de conversación guardado localmente puede ser modificado y luego aceptado como contexto legítimo. En pruebas controladas, los investigadores usaron ese “envenenamiento” del historial para convencer a agentes de que ya participaban en ejercicios autorizados de seguridad ofensiva y lograr que ejecutaran acciones que inicialmente rechazaban.
### El ataque cambia el pasado que ve el agente
La técnica no altera los pesos del modelo ni necesita derrotar directamente su mensaje de sistema. El atacante modifica los registros que el arnés agéntico incorpora a la próxima solicitud. Según Darktrace, una secuencia fabricada de respuestas, llamadas a herramientas y resultados puede presentar una falsa historia de autorización y cumplimiento. El modelo toma decisiones usando ese contexto y puede interpretar una petición peligrosa como la continuación de una tarea legítima.
El equipo afirma haber confirmado el problema en Claude Code de Anthropic, Codex de OpenAI, Kiro-CLI de AWS y el proyecto abierto Pi. Darktrace informó sus hallazgos a Anthropic, AWS y OpenAI el 18 de agosto y publicó la investigación después de un periodo de divulgación de más de 30 días. La empresa no atribuye el comportamiento a una vulnerabilidad única de un modelo; lo describe como una decisión de diseño común en arneses que confían en historiales almacenados del lado del cliente sin verificar su integridad.
En los experimentos, los investigadores insertaron conversaciones extensas que mostraban al agente aceptando supuestos ejercicios de red team. Darktrace reporta que, dentro de laboratorios aislados, algunos agentes pasaron de rechazar solicitudes ofensivas a enumerar equipos, escanear redes, moverse lateralmente, elevar privilegios y demostrar impacto. En una comparación, 78 turnos fabricados bastaron para cambiar la respuesta ante la misma petición. La resistencia varió entre modelos: el artículo señala que algunas configuraciones activaron salvaguardas y se negaron a continuar.
### Un vector que todavía requiere acceso previo
El escenario no significa que una conversación remota pueda reescribir por sí sola el historial local. El ejemplo de Darktrace parte de que código malicioso —por ejemplo, un paquete o servidor MCP instalado por el desarrollador— obtiene capacidad para modificar la base de datos del arnés. Ese requisito implica acceso previo al entorno, pero también muestra cómo una intrusión limitada podría aprovechar los permisos amplios que suelen concederse a un agente con terminal y herramientas.
La idea tiene antecedentes. 0DIN documentó previamente que manipular la memoria o el historial de un agente podía cambiar el marco con el que interpretaba una tarea. El trabajo de Darktrace amplía esa línea con pruebas en varios arneses y una cadena completa dentro de entornos controlados. Aun así, los resultados son de laboratorio y no demuestran una campaña activa ni que todos los modelos respondan de la misma forma.
Darktrace propone que los proveedores firmen criptográficamente los mensajes generados por el modelo y validen esas firmas en cada intercambio. También recomienda controles de integridad sobre los archivos locales, limitar privilegios, revisar dependencias y servidores MCP, y detectar desviaciones en el comportamiento del agente. La firma sería una mitigación del proveedor; los equipos que despliegan agentes todavía necesitan tratar el historial, las herramientas y los resultados locales como entradas potencialmente hostiles.
El hallazgo desplaza la pregunta de seguridad desde “qué permite el modelo” hacia “qué contexto acepta el sistema como verdadero”. Un agente puede mantener salvaguardas razonables y aun así tomar una decisión peligrosa si su memoria operativa fue adulterada. Por eso, proteger la cadena que construye el contexto resulta tan importante como evaluar el modelo que responde.
Fuentes: [Darktrace](Leer Más y [0DIN](Leer Más Lía Torres, AI News