正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
Pretraining Vision-Language-Action (VLA) policies on internet-scale video is appealing, yet current latent-action objectives often learn the wrong thing: they remain anchored to pixel variation rather than action-relevant state transitions, making th...
可核验的原论文来源和作者
- 作者
- Jingwen Sun, Wenyao Zhang, Zekun Qi, Shaojie Ren, Zezhi Liu, Hanxin Zhu, Guangzhong Sun, Xin Jin, Zhibo Chen
- 来源
- arXiv
- 论文 ID
- 2602.10098