正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
当前安全对齐主要依赖行为层面的后训练方法(如 SFT、RLHF),将安全视为二值属性。然而近期越狱事件表明行为评估不足以反映模型内部防御的脆弱性;已有机制可解释性工作虽刻画了固定模型中的拒绝回路,但缺乏对训练目标如何系统性重塑回路结构的受控比较。 作者想验证:在训练数据和基础模型固定的条件下,不同后训练目标(SFT、Ra-SFT、ORPO)是否会以可观测的方式改变模型内部拒绝计算的几何结构、因果拓扑和推理时可干预性。
核心方法
作者在 Llama-3.1-8B、Gemma-2-9B 和 Qwen3-8B 三个架构上,使用匹配数据与超参数分别训练 SFT、Ra-SFT 和 ORPO;通过 difference-in-means 提取拒绝方向并计算层间余弦相似度,使用 Activation Patching 和 Attribution Patching 定位层与组件级因果效应,再用 ActAdd(层干预)和 ITI(注意力头干预)测试推理时转向的可靠性与对通用能力的影响。
实验结论
- Ra-SFT 在三个模型上均产生逐渐上升且分散的拒绝幅度分布和以 MLP 为主的回路,而 SFT 与 ORPO 的拒绝方向在中层集中且彼此更相似。ORPO 在 Gemma-2-9B 上将 StrongREJECT ASR 降至 0%,但 XSTest 过度拒绝率达 31.6%;Llama-3.1-8B 在 ActAdd 干预下 MMLU 准确率从 35.5% 迅速降至 0%,表明安全与能力表征重叠。识别层转向普遍比执行层更有效,但效果受架构约束。
适合谁阅读
安全与对齐可解释性训练与后训练作者在 Llama-3.1-8B、Gemma-2-9B 和 Qwen3-8B 三个架构上,使用匹配数据与超参数分别训练 SFT、Ra-SFT 和 ORPO;通过 difference-in-means 提取拒绝方向并计算层间余弦相似度,使用 Activation Patching 和 Attribution Patching 定位层与组件级因果效应,再用 ActAdd(层干预)和 ITI(注意力头干预)测试推理时转向的可靠性与对通用能力的影响。
可核验的原论文来源和作者
- 作者
- 作者信息暂未从原始元数据中确认
- 来源
- arXiv
- 论文 ID
- 2609.03887