正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
当前主流音频表征学习依赖频谱图作为输入,但频谱图计算引入额外延迟,且会丢失相位信息。这些问题在对实时性要求高的场景中尤为突出。本文要回答的核心问题是:能否直接在原始波形上进行自监督学习,构建出性能不逊于频谱图方法的音频基础模型?
核心方法
WavJEPA 直接以原始音频波形为输入,采用联合嵌入预测架构(JEPA)在语义空间进行掩码预测,而非在像素或信号层面重建。模型通过编码器提取波形的语义表征,并在潜在空间中预测被掩码区域的语义内容,从而学习到鲁棒的音频表征。整个流程无需频谱图转换,降低了前端处理延迟。
实验结论
- 在多项音频下游任务中性能持平或优于频谱图基础模型
- 省去频谱图计算环节,端到端推理延迟显著降低
局限性与证据边界
- 具体使用了哪些下游评测任务和基准数据集
- 与哪些频谱图基础模型进行了定量对比及具体数值
- 预训练数据规模和训练配置细节
- 极端噪声或分布外场景下的鲁棒性评估结果
- 作者所属机构的完整信息
适合谁阅读
音频表征学习研究者低延迟音频系统开发者自监督学习与基础模型方向研究者语音与音频多模态
可核验的原论文来源和作者
- 作者
- Goksenin Yuksel, Pierre Guetschel, Michael Tangermann, Marcel van Gerven, Kiki van der Heijden
- 来源
- arXiv
- 论文 ID
- 2509.23238