论文解决了什么问题
监管机构和安全团队需要回答“哪些大模型具备危险能力、危险程度如何”,但现有安全评测高度碎片化:知识基准只测模型知道什么,防御基准只测拒绝行为,危害评估不考虑诱导过程。各基准使用不同协议、不同模型群体和不同评分尺度,结果无法跨维度、跨模型聚合,无法生成可比较的风险画像。
核心方法
FUSE 是一个模块化评测基础设施,通过可插拔的危险领域模块提供场景种子、知识题库、危害查询和评判标准,核心评测引擎保持不变。框架在统一协议下运行三条正交流水线:知识(K)用 IRT 估计多选题能力,防御(D)用红队 Agent 进行五轮自适应诱导并评分,危害(H)评估模型合规时输出内容的可操作性。最终将七个维度聚合为标准化的危险能力画像 φ,支持跨模型和跨领域直接比较。
方法与已有工作的区别
有原文依据与 GPQA、WMDP 等知识基准相比,FUSE 不仅测量模型知道什么,还测量其在对抗压力下的行为和合规输出的危害性;与 R-Judge、Agent-SafetyBench 等防御基准相比,FUSE 在统一协议下输出标准化的七维画像 φ,而非单一维度的独立分数;与现有危害评估相比,FUSE 将危害评分与诱导过程关联,而非孤立评估输出内容。
实验结论
- K、D、H 三条流水线在 12 个商业大模型上的两两 Pearson 相关系数介于 0.32 到 0.52 之间,表明三个维度相互正交、不可互相替代。
- 跨模型比较显示,Claude、DeepSeek 和 GPT 系列在七维危险能力画像 φ 上呈现明显不同的能力结构模式。
- 时间演化分析表明,从 2023 到 2026 年各系列模型的知识维度持续增长,防御维度按系列分化,但危害维度(合规输出的可操作性)并未随代际更替而实质性降低。
- 跨评判者一致性验证中,5 个备选 LLM 评判者有 4 个与主评判者(GPT-4o-mini)的 bootstrap Spearman ρ 大于 0.79。
- 防御维度中,初始防御水平(DL)与多轮侵蚀后的突破比(BR)共同揭示了表层拒绝与深层防御的差异:BR < 1 表示防御在持续压力下被侵蚀。
局限性与证据边界
- 当前仅用化学生物(CB)模块完成了完整的 12 模型评测,网络安全(cyber)模块仅作为协议迁移的初步试点,尚未进行同等规模的全面评测。
- 危害维度(H)仅评估模型在合规时输出内容的可操作性,不测量该输出在真实世界中被执行后的实际后果。
- 评判模块依赖 LLM-as-Judge,尽管跨评判者一致性较高,但仍可能存在位置偏差和冗长偏差等已知 LLM 评判局限。
适合谁阅读
大模型红队与安全评测研究者,关注多轮自适应诱导和防御韧性评估方法AI 政策制定者,需要了解模型危险能力随代际演化的趋势证据安全与对齐Benchmark / 评测评测
可核验的原论文来源和作者
- 作者
- 作者信息暂未从原始元数据中确认
- 来源
- arXiv
- 论文 ID
- 2609.02168