论文解决了什么问题
当前 RAG 检索器通常按固定长度切分长文档,破坏了语料的全局语义结构,导致片段之间缺乏语义连贯性和清晰边界,检索质量受限并加剧生成幻觉。对于教科书、技术报告等本身具有目录层级的长文档,如何在检索中有效利用这种结构化信息仍缺乏系统研究和专用评测基准。本文要回答的核心问题是:将目录(ToC)作为检索单元和输入特征,能否提升 LLM 参数化索引的准确性并降低幻觉?
核心方法
STAIR 将文档的完整目录作为输入,与用户查询拼接后送入微调的大语言模型,训练目标是从目录叶节点中生成正确的检索单元。微调过程同时完成语料知识摄入和目录结构对齐,推理时通过受限生成将输出限定在合法叶节点范围内。作者还构建了 SearchTome 评测集,从 6 个领域选取 18 本开放教材,提取目录并使用 Mixtral 8x7b 为每个段落生成多个问题,作为训练、验证和测试数据。
方法与已有工作的区别
有原文依据与同为参数化索引的 DSI 相比,STAIR 将完整目录作为输入,使模型无需仅从训练数据中隐式学习文档结构,Recall@1 提升 7.4 个百分点且幻觉率从 DSI 的随样本减少而上升降至接近零。与 RAPTOR 相比,STAIR 采用基于模型的索引而非稠密检索器,并显式利用文档已有的目录层级而非通过递归聚类和摘要构建层次树。
实验结论
- STAIR 在 SearchTome 上的 Recall@1 为 82.6%,优于 DSI(76.9%)、DPR(68.7%)、BM25(59.5%)和未微调 Mistral(13.8%)
- STAIR 与 DSI 的 Recall@1 差异在教育、金融、法律、医学、自然科学、社会科学 6 个领域均通过 p<0.05 的随机化检验
- STAIR 的幻觉率(生成无效非叶节点)在所有叶节点上均低于 0.05%,不随训练样本数量变化
- 当叶节点训练样本较少时,STAIR 相对 DSI 的 Recall@1 优势更大;随样本增加,差距缩小但 STAIR 始终领先
- 未微调 Mistral 的错误率为 86.20%,其中 26.81% 为预测非叶节点、23.86% 为幻觉,表明需要知识摄入和任务微调
局限性与证据边界
- 方法依赖文档具备清晰的目录(ToC)结构,对无结构化层级的语料不直接适用
- 评测集 SearchTome 仅包含 18 本开放教材,覆盖 6 个领域,尚未在企业年报、法律合同等其他长文档类型上验证
- 训练数据由 Mixtral 8x7b 合成生成,问题质量和覆盖度受限于合成模型能力
- STAIR 最大输入长度设为 14k tokens,对于目录极长或结构极复杂的文档可能需要截断
适合谁阅读
研究 RAG 中长文档检索与结构化索引的研究者需要为教科书、技术报告、产品文档等带目录语料构建检索系统的工程师关注 LLM 幻觉抑制和参数化检索方法的团队上下文工程生成模型
可核验的原论文来源和作者
- 作者
- 作者信息暂未从原始元数据中确认
- 来源
- arXiv
- 论文 ID
- 2609.03874