正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
现有语言模型推理常采用固定流程,如固定长度的链式推理或固定次数的并行采样。但不同问题对计算深度的需求差异很大,有些需要长链推理,有些需要多方案比较。手动设计测试时扩展策略难以灵活适应所有场景,导致计算资源分配效率低下。
核心方法
SPIRAL 将推理过程建模为搜索与聚合的联合学习问题,通过强化学习训练一个策略模型。该模型在推理时动态决定三个关键动作:何时沿当前路径继续扩展推理步、何时采样并行推理路径、以及如何聚合多个推理结果。这种设计使系统能够根据问题特征自适应分配计算资源。
实验结论
- 在相同计算预算下,SPIRAL 超越固定启发式策略
- 能够根据问题特征动态权衡推理深度与广度
适合谁阅读
关注 LLM 推理能力提升的研究者测试时计算扩展与推理优化方向强化学习在推理系统中的应用推理与规划强化学习
可核验的原论文来源和作者
- 作者
- 作者信息暂未从原始元数据中确认
- 来源
- arXiv
- 论文 ID
- 2606.23595