正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
基于流的生成模型和 flow map 蒸馏方法已在连续与离散状态空间实现快速少步生成,但现有参数化要求状态维度或序列长度在初始化时固定。这与许多实际任务相矛盾——例如可变分辨率图像、任意时长音视频、未知长度文本以及跨模态数据——其输出尺寸本身是需要建模的变量。如何在推理阶段实现自适应维度增长的少步生成,是本文要回答的核心问题。
核心方法
作者提出 Expanding Generative Flows(EFlows),用非递减维度调度 d(t) 替代固定维度,构建从低维到高维分布的 expanding interpolant。每步生成由两个可学习操作组成:扩展算子 E_s,t 通过拼接、位置插入或子节点扩展等方式向状态注入条件噪声以提升维度;传输映射 X_s,t 在增广空间中沿局部时间坐标推进 ODE 或离散去噪。两者复合形成 Expanding Flow Map(EFM),将多步积分蒸馏为单步联合扩展-去噪映射,并通过拉格朗日、欧拉与半群一致性条件进行训练。离散版本将扩展算子实例化为 token 插入,用插入期望头预测各间隙的插入数量。
实验结论
- 在分子构象、离散分子图和语言建模三个任务上验证了跨模态可变维度少步生成的可行性
- 当扩展算子为恒等映射时,EFM 退化为现有固定维度 flow map,保持了向后兼容
局限性与证据边界
- 原文未给出各任务上的具体数值指标(如生成质量、采样效率)
- 原文未提供与现有固定维度 flow map 或其他可变长度生成方法的定量对比
- 正文节选在第 5 节离散实验部分截断,完整实验结果与消融分析不可见
适合谁阅读
生成模型研究者flow matching 与 diffusion 蒸馏方向可变长度序列与图生成应用生成模型模型架构
可核验的原论文来源和作者
- 作者
- Sophia Tang, Pranam Chatterjee
- 来源
- arXiv
- 论文 ID
- 2607.21585