正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
当前开源大模型多停留在 1T 参数级别,随着推理时计算(test-time scaling)和 Agent 强化学习方法快速发展,若预训练基座规模不跟进,开源生态与最强闭源系统的差距可能进一步拉大。如何同时推进预训练规模扩展与百万级上下文的推理时扩展,是本文要回答的核心问题。
核心方法
Kimi K3 采用 2.8T 总参数、104B 激活参数的 MoE 架构:序列维度使用 Kimi Delta Attention 与 Gated MLA 混合注意力,深度维度引入 Attention Residuals 实现跨层选择性信息流,宽度维度通过 Stable LatentMoE 在 896 个路由专家中每 token 激活 16 个。后训练阶段在通用、Agent 和编码领域进行多推理强度强化学习,并通过多教师 on-policy 蒸馏整合为统一模型。
实验结论
- 整体扩展效率较 Kimi K2 提升约 2.5 倍
- 在长程编码、Agent、知识、推理和视觉任务上超越多数开源与闭源模型,但整体仍略逊于 Claude Fable 5 和 GPT-5.6 Sol
局限性与证据边界
- 具体 benchmark 数值和评测套件完整列表未在节选正文中给出
- Moonshot AI 作为机构归属基于 Hugging Face 链接推断,论文正文未明确声明机构名称
- 后训练强化学习的具体奖励设计和训练数据规模未在节选中详述
适合谁阅读
大模型系统研究者Agent 与长程推理方向开发者MoE 架构与训练基础设施工程师模型架构Agent 系统
可核验的原论文来源和作者
- 作者
- 作者信息暂未从原始元数据中确认
- 来源
- Moonshot AI
- 论文 ID
- 2607.24653