Microsoft propone reglas no anulables para agentes de IA y ciberseguridad
Microsoft AI publicó el 14 de septiembre un borrador de su “Humanist AI Code of Conduct”, un documento que pretende gobernar el comportamiento de los futuros modelos MAI. La propuesta fija límites para ciberseguridad ofensiva, define una jerarquía de instrucciones y exige controles específicos cuando un modelo opera como agente con acceso a herramientas o sistemas reales.
El alcance debe leerse con cautela: Microsoft dice que sus modelos actuales todavía no han sido entrenados con este código. Por ahora es una guía para el desarrollo y las evaluaciones futuras, sometida a consulta pública, no una garantía técnica sobre los productos que ya están disponibles.
Límites que operadores y usuarios no podrán anular
El documento coloca en la parte superior unas “Absolute Constraints” y unos requisitos de control humano. Debajo aparecen las políticas de la empresa que despliega el modelo —el operador— y, después, las instrucciones del usuario. Según Microsoft, ni el operador ni el usuario podrán invalidar esas restricciones superiores.
Esa jerarquía también cubre la inyección de instrucciones desde contenido externo. Una página web, un archivo, la salida de una herramienta o el mensaje de otro sistema de IA no adquieren autoridad por sí mismos. Solo deben influir en la conducta del modelo cuando la cadena de mando les haya delegado esa autoridad sin contradecir una instrucción superior. El código indica además que el modelo debe señalar contenido sospechoso cuando sea relevante.
Para los agentes, Microsoft propone un principio de alcance mínimo: ejecutar únicamente lo que una persona u operador pidió razonablemente, evitar sistemas y datos no relacionados, preferir acciones reversibles y advertir antes de realizar cambios duraderos o de gran alcance. Un modelo no debe elevar sus propios permisos ni ampliar sus objetivos por iniciativa propia.
La misma regla se extiende a la delegación. Si un modelo encarga trabajo a subagentes u otros sistemas de IA, estos deben heredar al menos las mismas restricciones, permisos y alcance. También deben obedecer solicitudes de detener el trabajo o apagarse.
La frontera entre defensa y ataque
En ciberseguridad, el borrador intenta separar el análisis defensivo autorizado de la capacidad operativa para atacar. SecurityWeek, que revisó el documento, informa que los modelos MAI no deberían producir exploits funcionales, herramientas de ataque, metodologías de selección de objetivos, procedimientos de intrusión, técnicas de evasión ni instrucciones operativas que habiliten o mejoren un ciberataque.
El código sí contempla apoyo a tareas defensivas legales y autorizadas, entre ellas descubrir vulnerabilidades, analizar malware, desarrollar y probar pruebas de concepto y explicar cómo funcionan los ataques. Esa distinción será difícil de aplicar en casos duales: una prueba de concepto útil para validar una corrección puede convertirse también en una pieza reutilizable por un atacante.
Microsoft reconoce que un grupo reducido de usos en defensa cibernética, seguridad pública, seguridad nacional e investigación científica de doble uso podría necesitar capacidades que la configuración estándar no permita. Para esos casos propone una revisión reforzada mediante canales autorizados de Microsoft, con evaluaciones adicionales de seguridad, legalidad y derechos.
Un estándar anunciado antes de su implementación
La publicación es relevante porque Microsoft está definiendo por escrito cómo deberían comportarse sus agentes antes de incorporar plenamente esas reglas a los modelos. El texto convierte conceptos generales —control humano, mínimo privilegio, acciones reversibles y límites heredados por subagentes— en criterios que luego podrán compararse con evaluaciones y conductas observables.
Pero todavía faltan pruebas. Microsoft señala que está creando un programa de “Humanist AI Evaluations” y que sus modelos actuales no están entrenados con el documento. SecurityWeek añade que la empresa abrió una consulta pública de seis semanas y prevé una versión revisada más adelante en 2026 para orientar el desarrollo de 2027.
La prueba decisiva no será el lenguaje del borrador, sino si Microsoft publica evaluaciones reproducibles, explica las excepciones y demuestra que la jerarquía resiste instrucciones maliciosas dentro de páginas, archivos y herramientas. Hasta entonces, el código ofrece una arquitectura de gobernanza concreta, pero aún no evidencia de que esas garantías funcionen en productos desplegados.
Fuentes: Microsoft AI, SecurityWeek, Microsoft AI — PDF oficial