正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
自博弈强化学习可以用廉价的大规模仿真替代昂贵的人类驾驶数据,但只给“安全到达”这类稀疏奖励时,策略往往会收敛到高效却与人类习惯不兼容的驾驶约定。以往要么依赖繁琐脆弱的手工奖励工程,要么依赖海量人类演示做模仿学习,前者难调、后者难扩。论文要回答的是:能否用极少的人类数据作为行为锚点,让自博弈策略既保留样本效率,又学会与人类兼容的驾驶方式?
核心方法
方法分两步:先用 10 分钟到 30 小时不等的人类驾驶轨迹子集训练一个行为克隆锚点策略并冻结;再在 PufferDrive 2.0 中用 PPO 进行大规模自博弈训练,奖励只保留“到达 +1、碰撞或出界 -1”的稀疏设计,同时通过 KL 散度把当前策略拉向锚点。训练过程控制所有智能体,避免人类日志直接混入环境,从而隔离锚点的正则作用。
实验结论
- 在 Waymo 回放场景下,30 分钟人类数据配合约 200 亿步自博弈经验即可将责任碰撞率降至 0.7%,比使用 52 天数据的 SMART-tiny CLSFT 低约 2.5 倍,也比无正则自博弈低约 3.5 倍;碰撞严重度指标 Δv 均值从 2.09 m/s 降至 1.71 m/s,高速碰撞尾部比例减半。策略在单张消费级 GPU 上 15 小时可完成训练。局限在于分布真实度受锚点质量限制,评测仍依赖日志回放和 IDM 规则模型,未在真车或更复杂混合交通中验证。
适合谁阅读
强化学习自动驾驶Agent 系统安全与对齐
可核验的原论文来源和作者
- 作者
- 作者信息暂未从原始元数据中确认
- 来源
- arXiv
- 论文 ID
- 2606.19370