文档(金鹏): 2026-08-28 章节 9 篇文章摘要归档
按主题分三组归档:Agent 工程纵深(经验治理/循环工程/ Token 成本治理/溯源生成)、最弱环节定律(推理链窃取/ GLM-5.3-Flash 开源)、人机共进(意志稀缺/数字员工化/ 大学之问);每组配 4K 题图与 160x90 缩略图共 3 组, 昇腾 WAIC 纯图片一文无法文本化按先例未收录
This commit is contained in:
@@ -0,0 +1,74 @@
|
||||
# 📊 文章摘要:靠这10个优化点,我们把Multi-Agent工作流成本降了50%以上
|
||||
|
||||
> **原文**:[2026-08-27_靠这10个优化点_我们把Multi-Agent工作流成本降了50_以上](./2026-08-27_靠这10个优化点_我们把Multi-Agent工作流成本降了50_以上.md)
|
||||
> **原文链接**:https://mp.weixin.qq.com/s/TIdXNlrcAOUZWVW1oWnnKQ
|
||||
> **来源**:微信公众平台(腾讯技术工程)
|
||||
> **作者**:腾讯程序员(lemonye)
|
||||
> **发布日期**:2026-08-27
|
||||
> **摘要日期**:2026-08-27
|
||||
> **价值评级**:⭐⭐⭐ 高
|
||||
|
||||
---
|
||||
|
||||
## 核心命题
|
||||
|
||||
> **Token 成本治理** — Multi-Agent 工作流烧钱不可怕,可怕的是不知道烧在哪;先建度量拆解六类消耗来源,再按"只看需要的、减少无关的、减少重复的"三原则系统性压缩,降本 50%~65% 而不牺牲任何功能。
|
||||
|
||||
---
|
||||
|
||||
## 文章概要
|
||||
|
||||
本文是腾讯团队对 tech-leader Harness 工作流(1 个 TL + 6 个子 Agent 驱动前后端全流程开发)的 token 成本优化实录。先以 AgentLens 度量平台把消耗拆解为六类来源(系统提示词、工具返回、文件信息、长期记忆、历史消息、用户提示词),发现大头在滚雪球式增长的历史消息与常驻的 Schema/payload。围绕三原则落地十个优化方向:渐进式披露、CLI 替代 MCP、MCP 数据获取子 Agent 化、长期记忆索引化、多 Agent 拆分、工具白名单+模型分层、代码图谱、稳定前缀、rtk 压缩、并行化。主 Agent 端到端 token 从 70.8 万降至 31.5 万(-55.5%)。价值在于全部优化项有实测数据、踩坑细节(rtk 字段名静默失效、评估方法论陷阱)如实披露;局限是"50%~65% 全流程降幅"是分项反推而非端到端 A/B 实测(作者自认待补)。
|
||||
|
||||
---
|
||||
|
||||
## 关键要点
|
||||
|
||||
1. **没有度量就没有优化** — 先用 AgentLens 按 TraceId/SessionId 拆解消耗分布,再动手;六类来源中历史消息(append-only 滚雪球)与工具 Schema(40 工具 MCP 每轮 10-15KB)是被忽视的大头。 `[分类: 共识]`
|
||||
2. **渐进式披露:SKILL.md 只留骨架** — 条件性内容与步骤详情外移到 references/ 资源层按需读取;自动化测试 Skill 正文 -35%,即使装 20 个 Skill 初始加载也仅 1000-2000 token。 `[分类: 共识]`
|
||||
3. **能用 CLI 就不用 MCP** — 每次 MCP 调用是一次完整 LLM 推理轮次(决策+Schema+结果+处理四重开销);Playwright MCP 换成 CLI 后,大模型只做"用例翻译为 spec",执行交给脚本,可重跑可并行。 `[分类: 共识]`
|
||||
4. **MCP 原始 payload 子 Agent 化隔离** — TAPD/Figma 的几千字需求、上万行设计树 JSON 不能进入生命周期最长的 TL context;专属子 Agent 只返回结构化摘要,单轮 input token -38.4%。 `[分类: 共识]`
|
||||
5. **Agent 专属配置:工具白名单+模型分层** — frontmatter tools 字段裁剪不可见工具;规则性强、轮次最多的测试/视觉 Agent 换 GLM-5v(成本约 Sonnet 36%),成本 -64%。 `[分类: 共识]`
|
||||
6. **代码图谱替代盲搜** — graphify 用 AST+语义建索引,先锁文件范围再读文件;同任务实测总 token -22.7%,探索轮次减少使收益在修复循环中被放大。 `[分类: 共识]`
|
||||
7. **稳定前缀=缓存命中=省钱** — KV Cache 复用要求前缀完全一致,动态内容后置;进度状态外化到文件(唤醒先 read_file 而非回放历史),顺带获得断点恢复能力。 `[分类: 共识]`
|
||||
8. **最省钱的调用是不调用 + 能并行不串行** — 确定性操作交脚本;无数据依赖的调用合并到同一轮发起,省下的是历史被重复打包的轮次。 `[分类: 共识]`
|
||||
|
||||
---
|
||||
|
||||
## 批判性分析
|
||||
|
||||
### 假设前提
|
||||
|
||||
作者默认:(1) token 成本是 Multi-Agent 工作流的主要矛盾(人力时间成本未纳入 ROI 对比);(2) 分项实测降幅可以线性叠加反推全流程(各优化项之间可能存在收益重叠,如并行化与子 Agent 化均减少历史打包);(3) 单次对比的数值(如 -22.7%、-38.4%)在任务分布变化后仍稳定。
|
||||
|
||||
### 论据与逻辑
|
||||
|
||||
单项优化均有改造前后实测数据,可信度高;rtk 评估的方法论反思(大模型执行路径不确定导致 A/B 噪声大于效果,改用 100% 可复现的纯文本对比)体现严谨。但"全流程 50%~65%"确为反推值,端到端 A/B 复核作者自己承认待补齐,引用该数字时应标注。多 Agent 拆分"本身不省钱、收益在打开后续空间"的澄清诚实且重要。
|
||||
|
||||
### 边界与局限
|
||||
|
||||
结论基于 CodeBuddy + AgentLens 内网生态,SGLang/Claude Code 等环境的度量工具不同需适配;S/M/L 规模预判的阈值依赖团队任务画像;模型分层引用的 GLM-5v 便宜 64% 的结论绑定了特定任务类型(规则性强的测试/视觉),不可外推到推理密集型角色。
|
||||
|
||||
---
|
||||
|
||||
## 可引用金句
|
||||
|
||||
> "没有度量就没有优化。"
|
||||
|
||||
> "最省钱的调用是不调用——确定性操作用 CLI/数据预取解决,把 LLM 留给真正需要语义理解的地方。"
|
||||
|
||||
> "省 token 不等于功能降级——只是调整'何时加载''怎么表达',没删任何功能,反而让工作流更清晰。"
|
||||
|
||||
> "上游收集一次,通过文档传递——最贵的冗余是'每个 Agent 各自重新发现同一份信息'。"
|
||||
|
||||
---
|
||||
|
||||
## 总体评价
|
||||
|
||||
**亮点**:三原则十方向全部带实测数据与代码级细节(frontmatter 配置、rtk 字段名踩坑),可复现性强;六类消耗来源的拆解框架本身即是分析工具;落地优先级排序(一个下午见效项→逐步推进项→中长期项)极具操作性。
|
||||
|
||||
**不足**:全流程 50%~65% 降幅是反推而非端到端实测;部分数据为单次对比样本;强绑定 CodeBuddy/AgentLens 生态。
|
||||
|
||||
**适用场景**:任何 Multi-Agent/Harness 工作流上量后的成本治理;Skill 设计规范审查(渐进式披露检查);Agent 架构评审(拆分时机、工具暴露面、模型路由)。
|
||||
|
||||
**关联建议**:与本院 tech 项目 Harness 工作流直接互证——渐进式披露与 skill 正文精简可立即用于 arno 系 skill 体检;与同批《对Loop Engineering的思考》的"预算思维"章节合并阅读(本文是其实测版);与 2026-08-20《Skill 工程方法论》"Thin Harness, Fat Skills"互为表里:Skill 变厚的同时必须靠资源层分层控制常驻成本。
|
||||
Reference in New Issue
Block a user