论文解决了什么问题
链式思维推理在离散 token 空间展开,每步必须生成文本,错误会沿自回归过程传播,且高质量推理依赖可模仿的思维轨迹数据。当只有答案监督而没有推理轨迹时(如 Countdown-4、Sudoku),现有方法难以有效引导模型搜索。将推理转移到模型连续表示空间可绕过这些限制,但在解码器保持冻结的条件下,如何生成并迭代优化隐状态仍是开放问题。
核心方法
LRT 由三个组件构成:任务专用双向 Transformer 编码器将输入映射为 K 个基础隐向量;基于 TRM 的循环修正器维护快慢双状态,在多次迭代中反复读取基础隐向量并输出有界残差修正;冻结的 Qwen3-8B 解码器接收修正后的隐向量作为 soft token 并自回归生成答案。训练分两阶段,先训练编码器,再冻结编码器训练修正器,全程仅使用答案监督,梯度穿过解码器激活但不更新其权重。
方法与已有工作的区别
有原文依据SoftCoT 使用冻结通用语言助手生成隐状态且不做修正,EBM-CoT 在此基础上加入基于标量能量场的梯度修正。LRT 将通用提议器替换为任务专用编码器,并用循环网络替代能量场修正,通过多步向量值状态转移实现约束传播与迭代纠错,而非沿固定标量场下降。在 Countdown-4 上,SoftCoT 和 EBM-CoT 分别仅 5.9% 和 8.4%,LRT 达到 56.7%。
实验结论
- 在 Countdown-4 上,LRT 精确求解率达 56.7%,SoftCoT 为 5.9%,EBM-CoT 为 8.4%,零样本 CoT 为 30.0%
- 在 Sudoku 上,LRT 显著优于 SoftCoT(10.4%)、EBM-CoT(17.2%)和零样本 CoT(23.9%)
- 在 HumanEval 上,LRT pass@1 显著优于 EBM-CoT(25.0%)和 SoftCoT(20.7%)
- LRT 总可训练参数约 11.2M(编码器 4.2M + 修正器 7M),仅占 8B 解码器的不到 0.2%
- 在五个基准上的未加权平均得分,LRT 显著优于 EBM-CoT(33.5%)和零样本 CoT(35.0%)
局限性与证据边界
- LRT 的提议器和修正器需按任务族分别训练,不是单一零样本通用模型
- 在 Sudoku 上仍落后于从头训练的专用符号求解器 MGDM 和 TRM
- 思维模式提示在五个基准中有三个超过 LRT,但消耗 5–450 倍推理算力
- Countdown-4 上的 TRM 基线需要作者自行适配,因其原生不支持序列到序列任务
适合谁阅读
需要在不微调大模型的前提下增强特定任务族推理能力的研究者关注连续表示空间推理与隐状态计算的 NLP 研究者探索参数高效适配与冻结解码器架构的系统工程师Agent 系统推理与规划
可核验的原论文来源和作者
- 作者
- 作者信息暂未从原始元数据中确认
- 来源
- arXiv
- 论文 ID
- 2609.01117