按主题分三组归档:Agent 工程纵深(经验治理/循环工程/ Token 成本治理/溯源生成)、最弱环节定律(推理链窃取/ GLM-5.3-Flash 开源)、人机共进(意志稀缺/数字员工化/ 大学之问);每组配 4K 题图与 160x90 缩略图共 3 组, 昇腾 WAIC 纯图片一文无法文本化按先例未收录
6.3 KiB
📊 文章摘要:靠这10个优化点,我们把Multi-Agent工作流成本降了50%以上
原文:2026-08-27_靠这10个优化点_我们把Multi-Agent工作流成本降了50_以上 原文链接:https://mp.weixin.qq.com/s/TIdXNlrcAOUZWVW1oWnnKQ 来源:微信公众平台(腾讯技术工程) 作者:腾讯程序员(lemonye) 发布日期:2026-08-27 摘要日期:2026-08-27 价值评级:⭐⭐⭐ 高
核心命题
Token 成本治理 — Multi-Agent 工作流烧钱不可怕,可怕的是不知道烧在哪;先建度量拆解六类消耗来源,再按"只看需要的、减少无关的、减少重复的"三原则系统性压缩,降本 50%~65% 而不牺牲任何功能。
文章概要
本文是腾讯团队对 tech-leader Harness 工作流(1 个 TL + 6 个子 Agent 驱动前后端全流程开发)的 token 成本优化实录。先以 AgentLens 度量平台把消耗拆解为六类来源(系统提示词、工具返回、文件信息、长期记忆、历史消息、用户提示词),发现大头在滚雪球式增长的历史消息与常驻的 Schema/payload。围绕三原则落地十个优化方向:渐进式披露、CLI 替代 MCP、MCP 数据获取子 Agent 化、长期记忆索引化、多 Agent 拆分、工具白名单+模型分层、代码图谱、稳定前缀、rtk 压缩、并行化。主 Agent 端到端 token 从 70.8 万降至 31.5 万(-55.5%)。价值在于全部优化项有实测数据、踩坑细节(rtk 字段名静默失效、评估方法论陷阱)如实披露;局限是"50%~65% 全流程降幅"是分项反推而非端到端 A/B 实测(作者自认待补)。
关键要点
- 没有度量就没有优化 — 先用 AgentLens 按 TraceId/SessionId 拆解消耗分布,再动手;六类来源中历史消息(append-only 滚雪球)与工具 Schema(40 工具 MCP 每轮 10-15KB)是被忽视的大头。
[分类: 共识] - 渐进式披露:SKILL.md 只留骨架 — 条件性内容与步骤详情外移到 references/ 资源层按需读取;自动化测试 Skill 正文 -35%,即使装 20 个 Skill 初始加载也仅 1000-2000 token。
[分类: 共识] - 能用 CLI 就不用 MCP — 每次 MCP 调用是一次完整 LLM 推理轮次(决策+Schema+结果+处理四重开销);Playwright MCP 换成 CLI 后,大模型只做"用例翻译为 spec",执行交给脚本,可重跑可并行。
[分类: 共识] - MCP 原始 payload 子 Agent 化隔离 — TAPD/Figma 的几千字需求、上万行设计树 JSON 不能进入生命周期最长的 TL context;专属子 Agent 只返回结构化摘要,单轮 input token -38.4%。
[分类: 共识] - Agent 专属配置:工具白名单+模型分层 — frontmatter tools 字段裁剪不可见工具;规则性强、轮次最多的测试/视觉 Agent 换 GLM-5v(成本约 Sonnet 36%),成本 -64%。
[分类: 共识] - 代码图谱替代盲搜 — graphify 用 AST+语义建索引,先锁文件范围再读文件;同任务实测总 token -22.7%,探索轮次减少使收益在修复循环中被放大。
[分类: 共识] - 稳定前缀=缓存命中=省钱 — KV Cache 复用要求前缀完全一致,动态内容后置;进度状态外化到文件(唤醒先 read_file 而非回放历史),顺带获得断点恢复能力。
[分类: 共识] - 最省钱的调用是不调用 + 能并行不串行 — 确定性操作交脚本;无数据依赖的调用合并到同一轮发起,省下的是历史被重复打包的轮次。
[分类: 共识]
批判性分析
假设前提
作者默认:(1) token 成本是 Multi-Agent 工作流的主要矛盾(人力时间成本未纳入 ROI 对比);(2) 分项实测降幅可以线性叠加反推全流程(各优化项之间可能存在收益重叠,如并行化与子 Agent 化均减少历史打包);(3) 单次对比的数值(如 -22.7%、-38.4%)在任务分布变化后仍稳定。
论据与逻辑
单项优化均有改造前后实测数据,可信度高;rtk 评估的方法论反思(大模型执行路径不确定导致 A/B 噪声大于效果,改用 100% 可复现的纯文本对比)体现严谨。但"全流程 50%~65%"确为反推值,端到端 A/B 复核作者自己承认待补齐,引用该数字时应标注。多 Agent 拆分"本身不省钱、收益在打开后续空间"的澄清诚实且重要。
边界与局限
结论基于 CodeBuddy + AgentLens 内网生态,SGLang/Claude Code 等环境的度量工具不同需适配;S/M/L 规模预判的阈值依赖团队任务画像;模型分层引用的 GLM-5v 便宜 64% 的结论绑定了特定任务类型(规则性强的测试/视觉),不可外推到推理密集型角色。
可引用金句
"没有度量就没有优化。"
"最省钱的调用是不调用——确定性操作用 CLI/数据预取解决,把 LLM 留给真正需要语义理解的地方。"
"省 token 不等于功能降级——只是调整'何时加载''怎么表达',没删任何功能,反而让工作流更清晰。"
"上游收集一次,通过文档传递——最贵的冗余是'每个 Agent 各自重新发现同一份信息'。"
总体评价
亮点:三原则十方向全部带实测数据与代码级细节(frontmatter 配置、rtk 字段名踩坑),可复现性强;六类消耗来源的拆解框架本身即是分析工具;落地优先级排序(一个下午见效项→逐步推进项→中长期项)极具操作性。
不足:全流程 50%~65% 降幅是反推而非端到端实测;部分数据为单次对比样本;强绑定 CodeBuddy/AgentLens 生态。
适用场景:任何 Multi-Agent/Harness 工作流上量后的成本治理;Skill 设计规范审查(渐进式披露检查);Agent 架构评审(拆分时机、工具暴露面、模型路由)。
关联建议:与本院 tech 项目 Harness 工作流直接互证——渐进式披露与 skill 正文精简可立即用于 arno 系 skill 体检;与同批《对Loop Engineering的思考》的"预算思维"章节合并阅读(本文是其实测版);与 2026-08-20《Skill 工程方法论》"Thin Harness, Fat Skills"互为表里:Skill 变厚的同时必须靠资源层分层控制常驻成本。