正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
终端智能体(terminal agent)是当前语言模型最主流的下游应用形态,但学术界对基于强化学习的终端智能体训练研究严重不足。现有终端数据集要么规模过小、要么领域高度集中于软件工程 bug 修复、要么难度呈双峰分布(过于简单或完全无解),无法为 RL 训练提供有效的学习信号。同时,已有的开源 RL 训练方案要么提升微弱(仅约 1 个百分点),要么未公开数据和训练细节,导致缺乏可复现的强基线。
核心方法
作者提出 TMAX,包含数据生成和 RL 训练两个模块。数据生成采用组合式采样框架,从领域、技能、任务复杂度、命令复杂度、用户人格、多模态附件等九个正交轴分层采样,由 Gemini-3-Pro 合成任务并直接构建 Docker 环境,跳过教师验证步骤,依靠 RL 训练中的软过滤剔除零梯度样本,最终产出 TMAX-15K(14,600 个环境)。训练采用 DPPO 算法(GRPO 变体),配合 FP32 语言模型头、大 group size(32)和全异步基础设施,在 65K token 上下文长度下进行 RL 训练。
实验结论
- TMAX-9B 在 Terminal-Bench 2.0 上达到 27% 通过率,在 32B 以下开源模型中占据 Pareto 前沿
- RL 训练效果可泛化至 SWE-Bench Verified(+5 个百分点)和 AIME,且跨 harness 有效
适合谁阅读
Agent 系统研究者强化学习后训练研究者终端/代码智能体开发者合成数据与 Benchmark 构建者Agent 系统
可核验的原论文来源和作者
- 作者
- 作者信息暂未从原始元数据中确认
- 来源
- arXiv
- 论文 ID
- 2606.23321