正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
现有的实时音视频交互模型通常将特定应用作为单一训练目标,难以从海量普通视频中学习通用的世界演变知识。此外,智能体的行为表达往往局限于固定的动作词汇或隐式的倾听状态,缺乏在复杂场景中执行开放词汇动作的能力。
核心方法
模型采用“世界 + 事件流”分解框架,将环境、角色等稳定条件作为世界上下文,将行为、语音等变化作为事件流进行自回归预测。在交互任务中,智能体输出交错的语音与行为指令文本,直接条件化同步的音视频生成。
实验结论
- 在 640×368 分辨率和 25 FPS 下,模型端响应延迟约 200 毫秒,总交互延迟约 550 毫秒。
- 支持开放词汇的行为指令生成,智能体动作与语音在音视频流中实现端到端同步。
适合谁阅读
多模态交互系统研究者实时数字人与智能体开发者视频生成与世界模型方向视觉模型多模态
可核验的原论文来源和作者
- 作者
- Lianghua Huang, Zhi-Fan Wu, Yupeng Shi, Wei Wang, Mengyang Feng, Cheng Yu, Chen Liang, Junjie He, Chen-Wei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chongyang Zhong, Jinwei Qi, Kai Zhu, Pandeng Li, Peng Zhang, Wenyuan Zhang, Xinhua Cheng, Yitong Huang, Yun Zheng, Yuxiang Bao, Yuzheng Wang, Zhiwei Lin, Zoubin Bi
- 来源
- arXiv
- 论文 ID
- 2607.15038