正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
现有音乐生成模型需要在分钟级尺度上同时建模歌词、旋律、节奏、人声与配器,但语义层面的长程作曲与波形层面的高保真渲染之间存在结构性不匹配。离散 token 语言模型便于全局序列生成,却容易丢失声学细节,而参考音频驱动的翻唱还要求系统在保留旋律的同时改变风格与人声特征。
核心方法
Qwen-Music 将歌曲生成拆分为语义作曲与声学渲染:Tokenizer 把音频压缩为 25 Hz 单码本 Music Semantic Tokens;LLM 在文本、歌词与可选旋律 token 条件下自回归生成语义 token,并通过 Melody-CoT 先规划粗粒度人声旋律再产出全曲 token;Render 以语义条件 DiT 预测声学潜变量,再用谱域 VAE 与频带细化模块合成 48 kHz 立体声波形。
实验结论
- 在 600 条中英文提示下,16 项客观音乐性与音质指标中取得 13 项最优。
- 专业盲测中对 MiniMax 2.6、Mureka V8、Suno V5 胜率 55%–67%,对 Suno V5.5 为 50.3%;翻唱任务在 AI 参考集上旋律保留优于 Suno V5.5、Suno V5 与 MiniMax Cover。
适合谁阅读
音乐生成与歌声合成研究者多模态生成与音频 token 建模研究者关注可控翻唱与旋律条件生成的工程团队语音与音频多模态
可核验的原论文来源和作者
- 作者
- Jin Xu, Kangdi Wang, Ruibin Yuan, Shun Lei, Xiong Wang, Xize Cheng, Xueyao Zhang, Yang Zhang, Yiheng Chen, Yongqi Wang, Yue Wang, Zhifang Guo, Zihan Liu, Zijian...
- 来源
- arXiv
- 论文 ID
- 2607.11699