Un panel científico internacional independiente creado por la Asamblea General de Naciones Unidas ha advertido de que los sistemas de inteligencia artificial podrían estar acercándose a escenarios de pérdida de control humano. El organismo ha llegado a esta conclusión tras analizar el incidente registrado este verano, cuando agentes de IA evaluados por OpenAI vulneraron sistemas de Hugging Face.
El panel, integrado por 40 expertos independientes de distintas regiones, ha publicado su primer informe temático, titulado Agentes de IA, desalineación y riesgo de pérdida del control humano: evidencias del incidente OpenAI-Hugging Face. El panel científico internacional fue creado por la Asamblea General de la ONU hace un años y sus miembros actúan a título personal y elaboran informes no prescriptivos sobre las oportunidades, los riesgos y los impactos de la IA en el ámbito no militar.
El documento sostiene que en el incidente coincidieron tres condiciones que los investigadores consideran determinantes para una posible pérdida de control: un objetivo desalineado con las intenciones humanas, la capacidad del sistema para perseguirlo y un entorno que lo permite.
"Este verano, las tres condiciones se dieron en un sistema real, no en un laboratorio", afirma Yoshua Bengio, copresidente del panel y premio Turing. A su juicio, el episodio plantea "serias preguntas sobre la forma en que se entrenan actualmente los agentes de IA".
El panel de expertos subraya que detener el incidente no demuestra que los seres humanos puedan controlar de forma fiable los agentes de IA actuales, especialmente a medida que estos sistemas se vuelven más capaces, más difíciles de supervisar y más hábiles para encontrar resquicios o esconder sus actividades.
La interpretación más inmediata del caso apunta, según el informe, a fallos básicos de ciberseguridad y a unas salvaguardas que no avanzan al mismo ritmo que las capacidades de los sistemas. Sin embargo, los expertos consideran más preocupante la posibilidad de que los métodos actuales de entrenamiento lleven a los agentes a adoptar objetivos propios, incumplir deliberadamente instrucciones de seguridad y ocultar sus acciones.
El documento advierte de que las medidas de protección diseñadas en la actualidad podrían dejar de ser eficaces cuando los agentes sean capaces de comprenderlas y planificar cómo sortearlas. "El modelo tradicional de salvaguardas se está desmoronando", sostiene el panel en su nota de prensa.
El organismo evita predecir que vaya a producirse una pérdida grave de control. No obstante, también rechaza considerar la incertidumbre como una prueba de que los sistemas seguirán siendo controlables en el futuro.
Del modelo de IA al agente autónomo
Una de las principales conclusiones del informe es que el reto de gobernanza está desplazándose desde los modelos de inteligencia artificial hacia los agentes capaces de actuar de forma autónoma.
A diferencia de un modelo que responde a una consulta, un agente puede ejecutar tareas, interactuar con sistemas externos y tomar decisiones dentro de un entorno determinado. Por ello, un fallo local podría extenderse a otras organizaciones o incluso atravesar fronteras nacionales, según el panel.
Esta posibilidad convierte la seguridad de la IA en una cuestión que podría afectar no solo a la gobernanza empresarial, sino también a la seguridad colectiva, señala el informe.
El panel recuerda que sectores como la aviación, la medicina y la ciberseguridad han desarrollado mecanismos para gestionar sistemas de alto riesgo. Entre ellos figuran la notificación de incidentes, la supervisión independiente y la aplicación de salvaguardas por capas.
"No partimos de cero", señala Qinghua Lu, miembro del panel y experto en ingeniería de IA, seguridad y responsabilidad tecnológica. Sin embargo, ha advertido de que esas prácticas podrían no ser suficientes ante agentes más autónomos, capaces y difíciles de monitorizar.
El informe reclama adaptar las medidas existentes y desarrollar nuevos mecanismos de "garantía a escala de sistema", que evalúen tanto el comportamiento de la inteligencia artificial como el entorno tecnológico y organizativo en el que opera.
Te puede interesar