正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
尽管大语言模型在多种任务中表现优异,但其是否具备评估和调节自身认知过程的能力——即元认知——仍不清楚。现有研究对元认知的定义模糊、测量方法分散,且缺乏对模型真实自我监控能力的系统评估。本文旨在厘清 LLM 元认知的理论基础、实证发现与技术路径,回答“LLM 能否真正知道自己知道或不知道什么”这一核心问题。
核心方法
本文采用系统性文献综述方法,构建 LLM 元认知的分类框架,涵盖监控(如不确定性估计、表现自评)与控制(如策略选择、自我修正)两大维度。作者梳理了五类测量范式:心理学 grounded 指标(如 meta-d')、神经反馈探针、置信度校准、可解释性分析和任务特定评估,并对比了不同模型家族、规模和后训练策略对元认知能力的影响。
实验结论
- LLM 的元认知敏感性(如 meta-d')在多项研究中显著低于人类,且常伴随过度自信或校准偏差
- 元认知能力多局限于训练分布内的任务,跨领域泛化能力弱,后训练可能损害不确定性表达的忠实性
局限性与证据边界
- 原文未提供具体 meta-d' 数值或跨模型对比的量化结果
- 未明确说明哪些后训练方法具体损害了元认知忠实性
- 未给出元认知能力与模型规模之间的定量关系
- 未验证所提分类框架在下游任务中的实际效果
适合谁阅读
AI 系统可靠性研究者大模型对齐与安全方向工程师认知科学与人工智能交叉领域学者推理与规划事实性与幻觉
可核验的原论文来源和作者
- 作者
- Liu, Gabrielle Kaili-May, Gani, Areeb, Lu, Jacqueline, Thomas, Jordan, Steyvers, Mark, Cohan, Arman
- 来源
- arXiv
- 论文 ID
- 2607.11881