正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
Hybrid SWA 架构理论上可将注意力计算和 KVCache 存储压缩至 Full Attention 的约 1/7,但在实际推理系统中,传统 KVCache 管理、前缀缓存匹配规则和分布式调度无法直接利用这一优势。SWA 层的窗口稀疏性与 Full Attention 层的全局存储需求存在冲突,导致缓存命中率下降、前缀复用失效,长上下文与多模态场景下的吞吐和延迟难以达到理论预期。
核心方法
团队重构了 KVCache 系统,采用 Full Attention 与 SWA 双池设计,实现严格的 O(W) 存储约束;引入 SWA 感知前缀缓存树,以“窗口安全长度”作为匹配规则,确保复用 KV 的有效性。同时构建了高性能分布式缓存 GCache,支持 RDMA 优化网络与多级存储,并开发 KVCache 亲和路由器与长度分桶调度策略,协同优化 Prefill/Decode 流水线及多模态输入处理。
实验结论
- 优化后,系统在生产环境实现平均 93% 的 KVCache 命中率,重度用户可达 95% 以上;长请求 TTFT P90 降低约 30.5%,短请求延迟基本不受影响;Prefill 阶段因 EP 减半使端到端性能提升约 更高水平。GCache 单进程 RDMA 读吞吐达 170 GB/s(GDR 场景约 350 GB/s)。该方案适用于长上下文 Agent 会话、多用户共享系统提示和重复工具调用等场景,但依赖 Hybrid SWA 架构,对纯 Full Attention 模型不适用。
局限性与证据边界
- MTP(Multi-Token Prediction)在 Decode 阶段的具体加速效果未在节选正文中给出完整数据
- 多模态优化(如 GPU 图像预处理、并行视频解码)的具体吞吐或延迟提升数字未明确提供
- GCache 在极端故障场景下的实际重算开销或可用性 SLA 未量化
适合谁阅读
系统基础设施Agent 系统模型架构
可核验的原论文来源和作者
- 作者
- Xiaomi MiMo Team, Liu, Anqi, Ma, Aoxin, Chen, Bo, Yang, Bo, Wang, Chen, Zhang, Chen, Tang, Chengda, Wang, Chengwei, Lou, Chiheng, Yan, Depeng, Luo, Fuli, Wang, ...
- 来源
- arXiv
- 论文 ID
- 2607.13095