正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
大语言模型微调后能快速记住新事实,却常在需要多步推理的下游任务中失败。这种“记住但不会用”的现象缺乏机制层面的解释:知识究竟在何时、为何无法被模型的推理电路调用?论文旨在量化这一差距,并从内部表征流动的角度揭示其成因。
核心方法
作者提出 self-patching 干预方法,在微调后的模型中扫描所有层对,将源层锚点位置的隐藏表征复制到目标层,测量其对推理准确率的因果影响。结合跨领域数据集和 chaining、intersection 两类多跳任务,绘制知识在模型内部随训练演化的空间渗透图,验证知识–电路错位假说。
实验结论
- 实验发现,微调收敛后知识表征已存在于模型特定层,但未被路由到中间计算层,导致泛化失败。手动将这些表征迁移到有效位置可立即恢复 58–75% 的理论泛化上限。该现象在 FFT 与 LoRA、不同模型规模和数据规模下均稳健,且 gains 显著超过 CoT 等提示基线,表明改进源于知识路径的真实修复而非表面解码效应。
适合谁阅读
大语言模型微调机制可解释性知识注入
可核验的原论文来源和作者
- 作者
- Lu Dai, Ziyang Rao, Yili Wang, Hanqing Wang, Hao Liu, Hui Xiong
- 来源
- arXiv
- 论文 ID
- 2607.08393