正在补充深度解读,当前内容可以先阅读 论文解决了什么问题 论文在相同生成 token 成本下比较七种自改进方法与重复采样,覆盖 1.5B、3B、7B 模型和两个数学基准。36 组比较中没有方法可靠胜过重复采样,18 组模型自检比较全部为负,说明反思、重写或辩论的收益必须先排除纯计算量增加。 可核验的原论文来源和作者 作者作者信息暂未从原始元数据中确认 来源arXiv 论文 ID2607.28576 查看原论文