Files
tech/知识/微信公众平台/腾讯程序员/2026-08-27_靠这10个优化点_我们把Multi-Agent工作流成本降了50_以上_摘要.md
T
arno 5f2964bf68 文档(金鹏): 2026-08-28 章节 9 篇文章摘要归档
按主题分三组归档:Agent 工程纵深(经验治理/循环工程/
Token 成本治理/溯源生成)、最弱环节定律(推理链窃取/
GLM-5.3-Flash 开源)、人机共进(意志稀缺/数字员工化/
大学之问);每组配 4K 题图与 160x90 缩略图共 3 组,
昇腾 WAIC 纯图片一文无法文本化按先例未收录
2026-08-27 13:24:04 +08:00

6.3 KiB
Raw Blame History

📊 文章摘要:靠这10个优化点,我们把Multi-Agent工作流成本降了50%以上

原文:2026-08-27_靠这10个优化点_我们把Multi-Agent工作流成本降了50_以上 原文链接:https://mp.weixin.qq.com/s/TIdXNlrcAOUZWVW1oWnnKQ 来源:微信公众平台(腾讯技术工程) 作者:腾讯程序员(lemonye) 发布日期:2026-08-27 摘要日期:2026-08-27 价值评级:⭐⭐⭐ 高


核心命题

Token 成本治理 — Multi-Agent 工作流烧钱不可怕,可怕的是不知道烧在哪;先建度量拆解六类消耗来源,再按"只看需要的、减少无关的、减少重复的"三原则系统性压缩,降本 50%~65% 而不牺牲任何功能。


文章概要

本文是腾讯团队对 tech-leader Harness 工作流(1 个 TL + 6 个子 Agent 驱动前后端全流程开发)的 token 成本优化实录。先以 AgentLens 度量平台把消耗拆解为六类来源(系统提示词、工具返回、文件信息、长期记忆、历史消息、用户提示词),发现大头在滚雪球式增长的历史消息与常驻的 Schema/payload。围绕三原则落地十个优化方向:渐进式披露、CLI 替代 MCP、MCP 数据获取子 Agent 化、长期记忆索引化、多 Agent 拆分、工具白名单+模型分层、代码图谱、稳定前缀、rtk 压缩、并行化。主 Agent 端到端 token 从 70.8 万降至 31.5 万(-55.5%)。价值在于全部优化项有实测数据、踩坑细节(rtk 字段名静默失效、评估方法论陷阱)如实披露;局限是"50%~65% 全流程降幅"是分项反推而非端到端 A/B 实测(作者自认待补)。


关键要点

  1. 没有度量就没有优化 — 先用 AgentLens 按 TraceId/SessionId 拆解消耗分布,再动手;六类来源中历史消息(append-only 滚雪球)与工具 Schema(40 工具 MCP 每轮 10-15KB)是被忽视的大头。 [分类: 共识]
  2. 渐进式披露:SKILL.md 只留骨架 — 条件性内容与步骤详情外移到 references/ 资源层按需读取;自动化测试 Skill 正文 -35%,即使装 20 个 Skill 初始加载也仅 1000-2000 token。 [分类: 共识]
  3. 能用 CLI 就不用 MCP — 每次 MCP 调用是一次完整 LLM 推理轮次(决策+Schema+结果+处理四重开销);Playwright MCP 换成 CLI 后,大模型只做"用例翻译为 spec",执行交给脚本,可重跑可并行。 [分类: 共识]
  4. MCP 原始 payload 子 Agent 化隔离 — TAPD/Figma 的几千字需求、上万行设计树 JSON 不能进入生命周期最长的 TL context;专属子 Agent 只返回结构化摘要,单轮 input token -38.4%。 [分类: 共识]
  5. Agent 专属配置:工具白名单+模型分层 — frontmatter tools 字段裁剪不可见工具;规则性强、轮次最多的测试/视觉 Agent 换 GLM-5v(成本约 Sonnet 36%),成本 -64%。 [分类: 共识]
  6. 代码图谱替代盲搜 — graphify 用 AST+语义建索引,先锁文件范围再读文件;同任务实测总 token -22.7%,探索轮次减少使收益在修复循环中被放大。 [分类: 共识]
  7. 稳定前缀=缓存命中=省钱 — KV Cache 复用要求前缀完全一致,动态内容后置;进度状态外化到文件(唤醒先 read_file 而非回放历史),顺带获得断点恢复能力。 [分类: 共识]
  8. 最省钱的调用是不调用 + 能并行不串行 — 确定性操作交脚本;无数据依赖的调用合并到同一轮发起,省下的是历史被重复打包的轮次。 [分类: 共识]

批判性分析

假设前提

作者默认:(1) token 成本是 Multi-Agent 工作流的主要矛盾(人力时间成本未纳入 ROI 对比);(2) 分项实测降幅可以线性叠加反推全流程(各优化项之间可能存在收益重叠,如并行化与子 Agent 化均减少历史打包);(3) 单次对比的数值(如 -22.7%、-38.4%)在任务分布变化后仍稳定。

论据与逻辑

单项优化均有改造前后实测数据,可信度高;rtk 评估的方法论反思(大模型执行路径不确定导致 A/B 噪声大于效果,改用 100% 可复现的纯文本对比)体现严谨。但"全流程 50%~65%"确为反推值,端到端 A/B 复核作者自己承认待补齐,引用该数字时应标注。多 Agent 拆分"本身不省钱、收益在打开后续空间"的澄清诚实且重要。

边界与局限

结论基于 CodeBuddy + AgentLens 内网生态,SGLang/Claude Code 等环境的度量工具不同需适配;S/M/L 规模预判的阈值依赖团队任务画像;模型分层引用的 GLM-5v 便宜 64% 的结论绑定了特定任务类型(规则性强的测试/视觉),不可外推到推理密集型角色。


可引用金句

"没有度量就没有优化。"

"最省钱的调用是不调用——确定性操作用 CLI/数据预取解决,把 LLM 留给真正需要语义理解的地方。"

"省 token 不等于功能降级——只是调整'何时加载''怎么表达',没删任何功能,反而让工作流更清晰。"

"上游收集一次,通过文档传递——最贵的冗余是'每个 Agent 各自重新发现同一份信息'。"


总体评价

亮点:三原则十方向全部带实测数据与代码级细节(frontmatter 配置、rtk 字段名踩坑),可复现性强;六类消耗来源的拆解框架本身即是分析工具;落地优先级排序(一个下午见效项→逐步推进项→中长期项)极具操作性。

不足:全流程 50%~65% 降幅是反推而非端到端实测;部分数据为单次对比样本;强绑定 CodeBuddy/AgentLens 生态。

适用场景:任何 Multi-Agent/Harness 工作流上量后的成本治理;Skill 设计规范审查(渐进式披露检查);Agent 架构评审(拆分时机、工具暴露面、模型路由)。

关联建议:与本院 tech 项目 Harness 工作流直接互证——渐进式披露与 skill 正文精简可立即用于 arno 系 skill 体检;与同批《对Loop Engineering的思考》的"预算思维"章节合并阅读(本文是其实测版);与 2026-08-20《Skill 工程方法论》"Thin Harness, Fat Skills"互为表里:Skill 变厚的同时必须靠资源层分层控制常驻成本。