论文解决了什么问题
组织正在快速部署基于 LLM 的 AI agent,这些 agent 已开始跨越业务单元和组织边界与已知或未知的对手方 agent 交互。现有治理手段在单一组织内部尚可运作,但当 agent 交互超出组织控制范围时,新的系统性失败模式会涌现,而现有控制手段无法覆盖。核心问题是:随着 agent 交互跨越不同治理边界,风险如何变化,谁有能力采取控制措施,治理盲区在哪里?
核心方法
报告构建了一个三层治理分析框架,按交互 agent 之间可假设的最低共同治理水平划分:单一治理(一个组织对所有 agent 拥有单方面控制权)、联邦治理(多个组织在约定规则下共享环境)、开放环境(无中央治理权威)。在每个层级下,报告系统梳理了显著风险因素、agent 交互失败模式、治理实践失败模式及对应控制手段,并标注每项控制措施的适格行动方。
方法与已有工作的区别
有原文依据报告明确定位为对 IMDA Singapore Model AI Governance Framework for Agentic AI (2026)、IAPS AI Agent Governance Field Guide (2025)、ASD Careful Adoption of Agentic AI Services (2026) 和 OWASP Top 10 for Agentic Applications (2026) 等现有单 agent 治理指南的多 agent 扩展,聚焦于 agent 间交互产生的系统性失败模式,而非单 agent 故障。
实验结论
- 在单一治理层级,组织对所有 agent 拥有单方面控制权,可独立实施控制措施
- 在联邦治理层级,各组织失去单方面控制权,新的失败模式源于激励错位
- 在开放环境层级,治理以多中心方式涌现,失败在群体规模上出现
- agent 间隐写协调、人类监督饱和、通信漂移超出人类可读性等失败模式在多 agent 交互中构成系统性风险
- 当前多 agent 评估方法和 agent 身份标准存在方法论与基础设施空白
局限性与证据边界
- 报告聚焦 LLM-based agent,未声称框架可推广至其他 agent 架构(如窄域强化学习)
- 报告仅分析多 agent 交互产生的失败模式,单 agent 失败仅作为背景而非分析对象
- 报告呈现的是基于当前证据的显著风险因素选择,而非穷举式目录
- 报告不分析人类委托方不遵守治理约定的失败情形
- 报告不提供具体政策建议,仅标注协调缺口供政策制定者参考
适合谁阅读
正在部署或规划跨组织 AI agent 系统的企业技术决策者需要理解多 agent 系统性风险边界的 AI 安全研究者评估 AI agent 监管介入必要性的政策制定者制定 agent 互操作标准的标准机构Agent 系统
可核验的原论文来源和作者
- 作者
- 作者信息暂未从原始元数据中确认
- 来源
- arXiv
- 论文 ID
- 2608.26626