正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
基因组基础模型普遍采用掩码语言建模或下一 token 预测作为预训练目标。这些生成式范式虽然能有效捕获 DNA 序列的局部语法模式,但优化目标聚焦于 token 级重建,可能导致模型过度依赖局部统计规律,难以学到反映长程调控关系和高层生物学功能的表征。如何在预训练阶段引导模型关注全局结构而非逐 token 还原,是提升基因组基础模型能力的关键问题。
核心方法
JEPA-DNA 将联合嵌入预测架构应用于 DNA 序列建模。模型将输入序列分为上下文片段与目标片段,分别通过编码器映射到潜空间,再由预测网络根据上下文表征预测目标片段的潜空间表征。整个训练过程在表征空间完成,不要求模型在原始 token 空间逐位重建被遮蔽或被截断的序列,从而鼓励模型学习更抽象、更具全局性的序列特征。
实验结论
- JEPA-DNA 在多项基因组下游任务上优于 MLM 和 NTP 预训练基线
- 具体任务名称、数据集规模与量化提升幅度在可见正文节选中未给出
局限性与证据边界
- 具体评测的下游基因组任务名称和数据集
- 量化实验结果与提升幅度
- 模型架构细节(编码器结构、序列长度、参数量)
- 与具体基线模型(如 DNABERT、Nucleotide Transformer)的对比数据
- 作者所属机构的完整信息
适合谁阅读
基因组基础模型研究者自监督表征学习方向研究者关注非生成式预训练范式的 NLP 与生物信息学交叉领域从业者模型架构训练与后训练
可核验的原论文来源和作者
- 作者
- Ariel Larey, Elay Dahan, Amit Bleiweiss, Raizy Kellerman, Guy Leib, Omri Nayshool, Dan Ofer, Tal Zinger, Dan Dominissini, Gideon Rechavi, Nicole Bussola, Simon ...
- 来源
- arXiv
- 论文 ID
- 2602.17162