正在补充深度解读,当前内容可以先阅读
论文解决了什么问题
Agentic AI 开发正陷入“token maxing”——团队用更长推理链、更多轮次、更大上下文换取能力,导致单任务 token 消耗增速超过任务价值。现有优化多聚焦单次模型调用(prompt 压缩、speculative decoding)或模型路由,却默认接受 orchestration 层不变。然而,正是编排层决定了 system prompt 是否重放、history 是否膨胀、tool schema 是否广播、retrieval 是否过量、retry 是否失控——它控制了 token 账单的几乎所有变量,却从未被独立量化。
核心方法
论文设计“controlled harness swap”实验:固定 22 个能力审计的企业任务、6 个基础模型(跨 5 厂商 3 权重级别)、统一 judge 与价格表,仅替换 orchestration 层——传统 production agent loop(2026-06-07 冻结基线)vs. Writer Agent Harness。Harness 通过 6 类机制重写 token 账单:两区 prompt 结构保障 cache 命中率、增量结构化压缩将 history 从 O(k²) 降至 O(k)、context offload 让模型不读冗余 token、zero-token waiting 消除 polling 消耗、failure-spend governance 截断 doom loop、model-agnostic floor 统一工具调用契约。
实验结论
- 混合成本下降 41%($0.21→$0.12),token 用量下降 38%(14.2k→8.8k),wall-clock 下降 44%(48s→27s)
- 效率增益跨所有 6 个模型一致(-33% 至 -61%),但质量增益与模型基线能力高度相关(r=0.99),弱模型在 orchestration-heavy 任务上偶有回退
适合谁阅读
Agent 系统架构师企业 AI 平台工程团队LLM 推理成本优化研究者Agentic workflow 设计者Agent 系统
可核验的原论文来源和作者
- 作者
- 作者信息暂未从原始元数据中确认
- 来源
- arXiv
- 论文 ID
- 2607.06906