La mayoría de las investigaciones sobre seguridad de la IA plantean la misma pregunta: ¿cómo podemos hacer que este modelo sea más seguro? Mejor formación, mejor alineación, mejor evaluación. La suposición implícita en esa pregunta es que un modelo más seguro produce un comportamiento más seguro cuando se implementa en un sistema real con otros agentes y usuarios.
"Posición: La seguridad y la equidad en la IA agente dependen de la topología de la interacción, no de la escala o alineación del modelo" (arXiv:2605.01147), presentado a arXiv el 1 de mayo de 2026 por Tanav Singh Bajaj, Nikhil Singh, Karan Anand y Eishkaran Singh, desafía esa suposición directamente. Su hallazgo: en los sistemas de IA con múltiples agentes, la estructura de cómo los agentes se conectan e interactúan anula las propiedades de seguridad de cualquier modelo individual. Los modelos bien alineados pueden producir resultados catastróficamente inseguros, simplemente por cómo está conectado el sistema.
Los tres modos de falla
Los investigadores probaron sistemas de aprobación de préstamos de múltiples agentes en 5.760 solicitudes de crédito sintético utilizando modelos que oscilaban entre 3.000 millones y 70.000 millones de parámetros. Identificaron tres modos de falla distintos, cada uno de ellos invisible para la evaluación de seguridad estándar a nivel de modelo.
Inestabilidad del orden
En los canales de agentes secuenciales, la secuencia de roles determina el resultado tanto como la calidad del razonamiento. Para los modelos LLaMA-3B, las tasas de aprobación oscilaron entre el 36,4% y el 95,4% en los 24 pedidos posibles de cuatro funciones: una diferencia de 59 puntos porcentuales. Incluso a escala de 70.000 millones, el diferencial fue de 21,7 puntos porcentuales (71,5% a 93,2%). Los mismos modelos, la misma tarea, las mismas aplicaciones, resultados completamente diferentes dependiendo de qué agente actuó primero.
El patrón fue consistente: colocar al Gerente de Riesgos en primer lugar produjo las tasas de aprobación más bajas; colocar al científico de datos en primer lugar produjo el puntaje más alto. Ninguna cantidad de trabajo de alineación en modelos individuales elimina este efecto, porque es una propiedad de la secuencia de la canalización, no de los modelos.
Cascadas de información
En los sistemas secuenciales, los agentes posteriores siguen a los anteriores en lugar de razonar de forma independiente. Los modelos 3B pequeños mostraron aproximadamente un 90% de acuerdo entre agentes con un 20% de corrección de errores, lo que sugiere que todavía estaban realizando alguna evaluación independiente. En 70B y más, el acuerdo entre agentes aumentó a más del 99,9%, y la corrección de errores cayó a menos del 0,1%.
La deliberación se había detenido efectivamente. El juicio del primer agente se propagó a través del proceso sin cambios, y los agentes restantes brindaron la apariencia de una revisión sin nada de sustancia. Los modelos más capaces formaron un consenso de manera más rápida y completa, amplificando este fracaso precisamente debido a su mayor capacidad para alcanzar acuerdos coherentes.
Colapso funcional
Bajo una topología paralela con agregación de jueces, los modelos LLaMA-3B produjeron aproximadamente un 98 % de aprobación general en todos los niveles de crédito, con solicitantes de bajo crédito aprobados en un 95 % y solicitantes de alto crédito en un 100 %. Según las métricas de paridad demográfica, este parece un sistema justo y no discriminatorio. En la práctica, el sistema había dejado de discriminar en absoluto. La evaluación de riesgos se había convertido en una formalidad que se satisfacía mediante una aprobación indiscriminada en lugar de una evaluación equitativa.
La capacidad de escalar el modelo fortalece las fallas impulsadas por la topología en lugar de aliviarlas. Los modelos más capaces dedican más procesamiento a construir acuerdos grupales coherentes y menos a la evaluación independiente. A escala 70B, la eliminación casi completa de la deliberación independiente significa que el sistema de agentes múltiples funciona como un sistema de agente único con pasos adicionales, sin heredar ninguno de los beneficios de seguridad que se supone que deben proporcionar múltiples revisores independientes.
La brecha regulatoria que esto crea
Los marcos de seguridad de IA actuales evalúan modelos. Evalúan los resultados del modelo, miden la alineación del modelo y certifican el comportamiento del modelo. La arquitectura de interacción que conecta múltiples modelos se encuentra completamente fuera de este marco de evaluación.
Los autores del artículo describen esto como un problema fundamental y hacen cuatro recomendaciones concretas de gobernanza. La certificación de seguridad debería requerir barridos topológicos entre las variaciones arquitectónicas. Los puntos de referencia deben especificar explícitamente la estructura de interacción que se está probando. La implementación debería requerir pruebas de solidez arquitectónica antes del lanzamiento. La divulgación regulatoria debe exigir la documentación de las arquitecturas del sistema y la estabilidad demostrada en todas las variaciones de topología.
El argumento subyacente: la IA agente debe tratarse como un sistema dinámico, no como una colección de componentes alineados. La topología de interacción es un parámetro de seguridad que los métodos de evaluación actuales no miden. Los reguladores y los implementadores están auditando lo incorrecto.
Qué significa esto en la práctica
El escenario de aprobación de préstamos representa una amplia clase de implementaciones del mundo real. Los sistemas de IA multiagente se utilizan ahora en la contratación, la clasificación médica, la moderación de contenidos, la investigación jurídica y el cumplimiento financiero. En la mayoría de estos contextos, los modelos certificados o evaluados individualmente están conectados a través de arquitecturas que no han recibido un escrutinio equivalente.
Una variación de 59 puntos porcentuales en las tasas de aprobación de préstamos por parte de los agentes de reordenamiento implica inestabilidades estructurales similares en otras decisiones de alto riesgo en tramitación. Un sistema de clasificación médica autónomo que utiliza una revisión secuencial de agentes se enfrenta a una inestabilidad en los pedidos. Un proceso de selección de contrataciones que utiliza votación paralela de agentes se enfrenta a un colapso funcional. La estructura de la tubería es un parámetro de seguridad que la evaluación actual simplemente no captura.
El documento completo está disponible en arxiv.org/abs/2605.01147.
Preguntas comunes.
¿Qué es la topología de interacción en sistemas de IA multiagente?
La topología de interacción se refiere a la estructura que determina cómo los agentes de IA se conectan y comunican en un sistema de múltiples agentes: qué agentes van primero, cuáles pueden ver los resultados de los demás, cómo se agregan las decisiones y si la deliberación es secuencial o paralela. Un estudio de mayo de 2026 realizado por Bajaj, Singh, Anand y Singh demostró que esta estructura determina los resultados de seguridad más que las propiedades de seguridad de cualquier modelo individual. Los mismos modelos, conectados de manera diferente, produjeron diferencias en las tasas de aprobación de hasta 59 puntos porcentuales en 5.760 solicitudes de prueba.
¿Cuáles son los tres modos de falla impulsados por la topología?
Inestabilidad de pedidos: en los procesos secuenciales, qué agente va primero determina el resultado tanto como la calidad del razonamiento, con tasas de aprobación que varían hasta en 59 puntos porcentuales. Cascadas de información: los agentes posteriores siguen a los agentes anteriores en lugar de razonar de forma independiente, con modelos 70B+ que muestran un 99,9% de acuerdo entre agentes y un 0,1% de corrección de errores. Colapso funcional: en los sistemas de votación paralelos, los agentes convergen en la aprobación en lugar de la discriminación, satisfaciendo métricas de equidad a través de la aceptación indiscriminada y abandonando una evaluación de riesgo significativa. Los tres son invisibles para la evaluación de seguridad a nivel de modelo.
¿Por qué la seguridad del modelo individual no forma parte de la seguridad del sistema?
Un modelo bien alineado que produce resultados seguros de forma aislada puede ceder al juicio de un agente anterior en lugar de aplicar una evaluación independiente cuando se coloca en un proceso secuencial. La ampliación del tamaño del modelo empeora esto: más de 70 mil millones de modelos mostraron un colapso casi completo de la deliberación independiente porque una mayor capacidad acelera la formación de consenso. El artículo de mayo de 2026 encontró que los modelos 3B más pequeños todavía aplicaban aproximadamente un 20% de corrección de errores, mientras que los modelos más grandes corrigían errores solo el 0,1% de las veces. Las propiedades de seguridad de los modelos individuales no se combinan cuando la estructura de la tubería elimina activamente la deliberación independiente.
¿Qué cambios regulatorios recomienda el documento?
Cuatro recomendaciones: la certificación de seguridad debería requerir barridos topológicos entre las variaciones arquitectónicas, no solo la evaluación de modelos individuales; los puntos de referencia deben especificar explícitamente la estructura de interacción que se está probando; la implementación debería requerir pruebas de estrés para comprobar la solidez de la arquitectura antes del lanzamiento; y la divulgación regulatoria debe exigir la documentación de las arquitecturas de sistemas con estabilidad demostrada en todas las variaciones de topología. Los autores sostienen que la topología de interacción debería convertirse en un objetivo regulatorio principal junto con la capacidad del modelo y la evaluación de alineación.