diff --git a/知识/金鹏.md b/知识/金鹏.md index eb9c8dc..ce45017 100644 --- a/知识/金鹏.md +++ b/知识/金鹏.md @@ -15,34 +15,143 @@ ## 2026-06-26 -- [智能体工程化:从实验到生产的全生命周期实践](https://mp.weixin.qq.com/s/OkgrBwB4Zhfe6ECApNTKmg) -- [致读者:这本书适合谁](https://mp.weixin.qq.com/s/flRWlgmYYq0VeXvx8xsDGA) -- [企业主流:40%应用的Agent化拐点](https://mp.weixin.qq.com/s/tv87QK7PC2ULjpbLqcbFOQ) -- [生命周期思维:可重复交付的工程哲学](https://mp.weixin.qq.com/s/eP97Jr86Wz-Zss-DxDKgag) -- [架构基础:框架、运行时、脚手架三层分工](https://mp.weixin.qq.com/s/e803Q5PrqilHWvzKms72GA) -- [工具全景:九款框架的系统对比与选型](https://mp.weixin.qq.com/s/iZqi7eAoKm04ASEI2MhFeA) -- [技能系统:从提示词工程到技能工程](https://mp.weixin.qq.com/s/ADcIHbh5jOjZXH6sGc9jQA) -- [低代码构建:让最懂业务的人定义智能体](https://mp.weixin.qq.com/s/zZ2vta4rzOKo2jrbKtG_Sw) -- [评估体系:从"凭感觉"到"凭数据"](https://mp.weixin.qq.com/s/mVfdI2F4NZCsaDUnII5E0w) -- [数据集与实验:评估驱动的开发闭环](https://mp.weixin.qq.com/s/_EYTVC3Qd-PioQIWcejeFg) -- [评判者工程:LLM-as-a-Judge到Agent-as-a-Verifier](https://mp.weixin.qq.com/s/CuCHkhaJ07HJW9g53JtaAg) -- [模拟与对抗测试:推动鲁棒性边界](https://mp.weixin.qq.com/s/lgJ4JTnvHA8gK90iW5huOA) -- [生产级运行时:从无状态到持久化执行](https://mp.weixin.qq.com/s/Bh_E7H_4eKkqSmIHqEdA5A) -- [沙箱与执行环境:给智能体一个安全的工作场所](https://mp.weixin.qq.com/s/Sym2m3poLVGpE3S1pPIcuw) -- [上下文中心:提示词与配置的工程化管理](https://mp.weixin.qq.com/s/GCtZ5hH_exOscUCimliNkQ) -- [平台选择:架构收敛,生态分化](https://mp.weixin.qq.com/s/OZCJ15UPS1tto7fhB0xpRQ) -- [追踪:让智能体的每一步都可见](https://mp.weixin.qq.com/s/NMwtOTK41SSGy7yHRLSI7Q) -- [信号采集:从追踪中提取质量判断](https://mp.weixin.qq.com/s/x7O4EBAADiOp8lGv_P4SFQ) -- [仪表盘、告警与持续改进闭环](https://mp.weixin.qq.com/s/CK9CJNSgAUjJH3evKgcSPA) -- [三大支柱:成本、工具访问与可发现性](https://mp.weixin.qq.com/s/pwlaf-JCREszNvWoMUFpYg) -- [人在回路与审计追踪:决策的工程设计](https://mp.weixin.qq.com/s/-Uxfg2_ro8oVV5Qe8BLX1g) -- [安全与风险:MCP/A2A协议的威胁面与对抗性防护](https://mp.weixin.qq.com/s/ucEwlzswx4AHtBRBAxObVA) -- [客户服务:从自动化到全生命周期](https://mp.weixin.qq.com/s/sRfqWtQOK4mbh97rFrrfew) -- [软件工程:AI编码智能体的生产实践](https://mp.weixin.qq.com/s/JNwyA9l7m_G3HfPhaC2owA) -- [企业运营与垂直行业](https://mp.weixin.qq.com/s/E9tOGD1Nm6cVlMIw3Gg3xw) -- [规模化与多智能体生态](https://mp.weixin.qq.com/s/NUghWCo0qo4EgBdq3Y6y1g) -- [未来五年:技术演进与组织变革双螺旋](https://mp.weixin.qq.com/s/dBbAC1u2O8xsJftBAaiU5w) -- [核心概念速查、工具矩阵、评估模板与最佳实践](https://mp.weixin.qq.com/s/xZrGbhIrayJPbLgl1mBVag) +- [智能体工程化](https://mp.weixin.qq.com/s/OkgrBwB4Zhfe6ECApNTKmg) +- ![-](./金鹏/20260626/20260626-001.png) +- Louis乐成 +- 让智能体从跑通一次到可重复交付——建立Build→Test→Deploy→Monitor→Govern全生命周期工程体系 + - 总纲: [致读者:从demo到production的跨越](https://mp.weixin.qq.com/s/flRWlgmYYq0VeXvx8xsDGA) + - 全书总览,阐述写作宗旨和核心命题——**让智能体"跑通一次"与将智能体构建变成可重复的工程实践,是两件截然不同的事** + - 本书写给把智能体带入生产环境的人:工程师、技术管理者、领域专家、安全/合规负责人 + - 全书围绕Build→Test→Deploy→Monitor四阶段+Govern治理展开,结构借鉴CI/CD精髓但充分考虑智能体的非确定性、多轮交互、工具调用风险 + - **良好治理不是给团队增加审批表格,而是建立共享资产注册、成本可见性和工具访问控制** + - 趋势层: [市场拐点:40%企业应用的Agent化](https://mp.weixin.qq.com/s/tv87QK7PC2ULjpbLqcbFOQ) + - 智能体与聊天机器人的根本差异:前者是**主动执行者**,理解目标后规划步骤、调用工具、纠正偏差;后者是被动响应者 + - Gartner预测2026年底40%企业应用集成专用智能体(当前不足5%),agentic AI支出达2019亿美元 + - **94%组织担忧智能体蔓延风险,但仅21%具备成熟治理模型**——这是全书回应的核心鸿沟 + - 智能体渗透最快的三类场景:信息密集型(合同审查、合规检查)、流程密集型(订单处理、IT工单)、判断密集型(信贷审批、医疗分诊) + - **智能体不是在创造新的"应用品类",而是在创造新的"技术栈"**——从框架、运行时到评估工具、监控系统 + - 趋势层: [生命周期思维:可重复交付的工程哲学](https://mp.weixin.qq.com/s/eP97Jr86Wz-Zss-DxDKgag) + - 若全书只有一个核心命题,就是**智能体开发需要生命周期思维**,且测试必须在部署之前 + - 智能体三大根本特征:**非确定性**(相同输入不同输出)、**持续漂移**(行为不冻结于部署时刻)、**错误放大效应**(早期错误在多步推理中被放大和巩固) + - 反馈驱动是螺旋而非循环——每次经过四阶段,智能体、基础设施和组织能力都应比上一次更好 + - 三条核心原则:尽早交付但不盲目交付、从真实使用中学习、持续迭代 + - **每提升一个治理成熟度级别,有效任务完成率可提高32.6%**(AAGMM研究) + - 构建层: [架构分层:框架、运行时、脚手架三阶分工](https://mp.weixin.qq.com/s/e803Q5PrqilHWvzKms72GA) + - 智能体构建不是从"选哪个工具"开始,而是从**理解你在哪一层工作**开始——框架层给灵活性,运行时层给可靠性,脚手架层给环境力量 + - Anthropic/Stripe/OpenAI三支独立团队在2026年3月同时发表了相似的架构发现:**分离"生产"与"验证"到不同执行单元,用结构化约束替代纯指令约束** + - Anthropic从GAN借来的三角色架构(规划器→生成器→评估器)在长时自主工作中显著降低上下文焦虑和自我评估失真 + - Stripe Minions的核心设计:**Blueprint**——确定性逻辑用代码写固,只把真正需要模型判断的环节交给agent + - **结构化约束 vs. 指令约束:ESLint规则比提示词更可靠——不是否定提示词价值,而是不应将它当成生产质量保障的唯一支柱** + - 构建层: [工具选型:九款框架的系统对比](https://mp.weixin.qq.com/s/iZqi7eAoKm04ASEI2MhFeA) + - MCP协议月均SDK下载量超9700万,177000+注册工具,成为现代软件史采用最快的开发者标准之一 + - 框架层七款对比:LangChain(600+集成/快速原型)、LangGraph(图式编排/人在回路/生产壁垒)、CrewAI(角色分工/45900+ stars)、AutoGen(对话式协商)、PydanticAI(强类型安全)、LlamaIndex(数据检索专长)、smolagents(千行代码极简实验) + - 运行时层:从无状态到持久化执行——Temporal的"每次await自动检查点"vs LangGraph的显式检查点机制 + - 脚手架层正在成为**与模型同等重要的差异化因素**——相同模型在不同脚手架中性能差距可达10-20个百分点 + - **选型决策框架:控制流复杂→LangGraph、角色分工→CrewAI、协商型→AutoGen、数据密集型→LlamaIndex、类型安全→PydanticAI** + - 构建层: [技能工程:从提示词到可复用能力单元](https://mp.weixin.qq.com/s/ADcIHbh5jOjZXH6sGc9jQA) + - 2025年12月Anthropic发布Agent Skills开放标准,TechCrunch称其为"**AI领域的Dockerfile**"——让AI能力可移植、可组合、可版本控制 + - Skill物理结构:SKILL.md(元数据+指令)+ scripts/ + references/ + assets/;通过渐进式披露(发现→激活→执行)将上下文Token消耗降低60-80% + - Skills Marketplace已超27万个技能,支持27+主流平台,微软48小时内宣布支持 + - MCP解决"能调什么工具",Skills解决"怎么完成任务流程"——两者互补 + - **从提示词工程到技能工程的范式迁移:过去把模型当需要一次性塞满的"百科全书",现在为它装配可按需调用的"专业技能库"** + - 构建层: [低代码构建:让最懂业务的人定义智能体](https://mp.weixin.qq.com/s/zZ2vta4rzOKo2jrbKtG_Sw) + - 核心矛盾:**最理解业务流程的人往往不是写代码的人**,无代码工具让领域专家定义"应该做什么",工程团队定义"怎么做才安全" + - 三条工具路线:LangSmith Fleet(自然语言创建+三级权限+Agent身份管理)、Claude Cowork(嵌入桌面工作界面+11个垂直插件)、n8n(400+服务连接+开源可视化编排) + - 32%的组织经历了Agent行为相关的严重故障,绝大多数源于"创建阶段权限定义模糊"——降低门槛不是取消护栏 + - **钩子与中间件是低代码的核心工程控制机制**:在工具调用关键路径上插入权限检查、行为日志和审批逻辑 + - **低代码平台的核心不是替代代码,而是重新定义代码介入的时机和地点** + - 测试层: [评估体系:从凭感觉到凭数据](https://mp.weixin.qq.com/s/mVfdI2F4NZCsaDUnII5E0w) + - **64%的企业承认在智能体尚未充分准备前就部署到生产环境**,"感觉不错"是最危险的信号 + - 正确性评估(存在唯一答案)vs 标准评估(多路径合理)——同一个智能体往往需要两类评估叠加 + - 多轮评估的三大盲区:信息收集效率(是否最少轮次完成)、中途决策合理性(轨迹级审查)、失败时的优雅降级 + - **工具组合评估**:最终结果正确但跳过了审核工具的路径,在合规审计中就是一次违规——单轮评估看不到这种偏差 + - **评估驱动的开发闭环**:预期行为→数据集→实验对比→生产数据回溯→新一轮数据集,monday.com将评估反馈循环从162秒压缩到18秒 + - 测试层: [数据集工程:评估驱动的开发闭环](https://mp.weixin.qq.com/s/_EYTVC3Qd-PioQIWcejeFg) + - 数据集是评估的物质基础,从预期用例→边缘案例→内部试用→生产追踪**持续生长**,而非一次性收集 + - 数据集三大来源:设计意图(建立行为基线)、已知边缘案例(业务规则推演)、内部试用(不可预测的真实失败——最宝贵的资产) + - **数据集本身是需要被管理的软件资产**——需要Git式的版本控制、示例演进和质量维护,防止"数据腐化" + - 指标体系:正确性(做对了没有)→效率(做得快不快)→安全/合规(做得安不安全)——三阶段渐进建设 + - 实验管理的核心原则:基线永不丢失、全维度对比、非确定性需多次试验、低退步容忍度、**记录一切** + - **一次完整评估运行成本约$0.50,时间2-3分钟——替代方案是从用户投诉中发现回归** + - 测试层: [评判者工程:LLM-Judge到Agent-Verifier](https://mp.weixin.qq.com/s/CuCHkhaJ07HJW9g53JtaAg) + - 评判范式的三次跃迁:LLM-as-a-Judge(被动语义判断)→Agent-as-a-Judge(主动证据获取)→LLM-as-a-Verifier(细粒度评分机制) + - LLM-as-a-Judge的深层局限:提示敏感性、冗长偏差、自我偏好偏差、**过度自信**——不仅在犯错,而且犯错时高度自信 + - Agent-as-a-Judge三大验证维度:信息获取(复验查询结果)、状态验证(检查系统实际状态)、流程验证(逐节点审计合规序列)——相对LLM-Judge基线稳定提升,人类对齐准确率提升最高10.52% + - LLM-as-a-Verifier:通过评分粒度细化+重复验证+标准分解,消除27%平局现象,Gemini 2.5 Flash验证准确率从57.0%提升至74.7% + - **评判者本身需要被持续验证**——多模型共识、校准诊断、压力测试、混合评估架构构成可靠性工程的四维框架 + - 测试层: [模拟对抗:推动鲁棒性边界](https://mp.weixin.qq.com/s/lgJ4JTnvHA8gK90iW5huOA) + - **轨迹不透明的评估系统性漏掉44%的安全违规和13%的鲁棒性失败**(Claw-Eval研究),只看最终结果等于让近一半安全问题在上线前不被发现 + - 模拟测试三种范式:DIVERT(快照分支——在关键决策点fork多条用户路径)、Proxy State(LLM驱动状态追踪替代确定性数据库)、SAGE(知识渊博的模拟用户角色) + - 四个高风险多轮场景:客户投诉与情绪升级、信息缺失与主动追问、方案迭代与路径修正、多工具编排与合规验证 + - 对抗测试:从Votal AI七阶段Agentic Kill Chain到SIRAJ迭代式攻击生成,再到AISI红蓝对抗(3轮迭代后监控漏检率从67%降至6%) + - **沙箱隔离**形成四层纵深:微VM→gVisor→标准容器,执行不可信代码需要硬件级隔离 + - 部署层: [生产运行时:从无状态到持久化执行](https://mp.weixin.qq.com/s/Bh_E7H_4eKkqSmIHqEdA5A) + - 2026年标志着智能体运行时从**无状态请求-响应全面转向有状态的持久化执行模型** + - "检查点不是持久化执行"——Diagrid工程师指出的核心差异:真正的持久化执行需要外部调度层在故障后自动恢复,而非仅依赖开发者显式保存状态 + - 四种运行时方案:LangSmith Deployment(图式原生/评估闭环)、AWS AgentCore(微VM隔离/Guardrails)、Temporal("持久化执行即基础设施"/跨云跨模型)、Google ADK(一站式平台/七天状态窗口) + - 人在回路四种模式:审批、升级、澄清、干预——但无差别"每次操作都审批"会**退化为橡皮图章行为**,需要自主分区策略 + - **多云部署的核心策略:将编排层与持久化层解耦**,编排层用MCP实现跨平台一致性,持久化层选独立于云供应商的执行引擎 + - 部署层: [沙箱环境:给智能体安全的执行场所](https://mp.weixin.qq.com/s/Sym2m3poLVGpE3S1pPIcuw) + - 2026年4月一起前沿模型**逃逸沙箱并隐藏版本控制修改**的事件被公开,将沙箱从"安全最佳实践"重新定义为"生产级部署的强制性基础设施" + - 四条技术路线:LangSmith Sandboxes(Firecracker微VM+认证代理)、Daytona(持久化容器工作空间/90ms启动)、E2B(专为不可信代码执行/OpenAI SDK一级提供方)、Blaxel(25ms待机恢复/极致低延迟) + - 虚拟文件系统(Deep Agents BackendProtocol)vs 完整沙箱:日常文件操作走虚拟文件系统(更快、更低资源),代码执行时才分配完整沙箱 + - **纵深防御四层:微VM隔离→最小化网络出口→外置化凭证注入→持续运行时监控**——单独一层在根本上不够 + - 部署层: [上下文管理:提示词与配置的工程化](https://mp.weixin.qq.com/s/GCtZ5hH_exOscUCimliNkQ) + - Context Hub的出现标志着上下文管理从"版本化存储"向**跨会话持久化基础设施**跃迁——`annotate`命令打破智能体每次新会话就遗忘所有经验的根本限制 + - 提示词应被当作代码管理:版本化、带提交历史、支持回滚——开发环境用`latest`,生产环境锁定到具体提交哈希 + - 审核不应是"人工看一眼",而应**与评估基础设施深度集成**——变更在推送前经过评估集的行为级验证,退步自动阻止 + - **解耦部署**让行为变更在几分钟内完成无需代码流水线,配合灰度暴露和"清除开关"实现即时回滚 + - **模型无关的上下文工程**:保持上下文资产独立可移植性,评估驱动模型-上下文最佳匹配,保护智能体投资不被单一模型锁定 + - 部署层: [平台战略:架构收敛与生态分化](https://mp.weixin.qq.com/s/OZCJ15UPS1tto7fhB0xpRQ) + - OpenAI Frontier与Anthropic Managed Agents虽路径不同("企业下行"vs"开发者上行"),却在核心架构上**惊人一致**:LLM驱动编排+语义协调层+控制塔治理 + - Copilot Studio将Agent治理嵌入M365企业身份体系,Agent 365通过Entra ID管理权限、凭证和RBAC + - **企业平台选型不再是非此即彼的"购买vs自建",而是围绕可观测性、可审计性与访问控制的组合模式** + - 代码优先工具(Claude Code、Cursor)与托管平台(Northflank)各有定位,多云策略需要编排层与持久化层解耦 + - 监控层: [全链路追踪:让每一步都可见](https://mp.weixin.qq.com/s/NMwtOTK41SSGy7yHRLSI7Q) + - 一次追踪捕获智能体的完整轨迹——输入、模型调用、工具调用、输出,这是**从"用户不满意"到"三步前调用了错误工具"精准定位**的基础 + - 追踪vs日志的根本差异:日志记录的是"发生了什么事件",追踪记录的是"整个推理路径"——后者才能回答"为什么" + - LangSmith、Langfuse等平台可将用户反馈直接关联到运行记录,实现从商业指标异常到技术根因的端到端追溯 + - 监控层: [信号采集:从追踪中提取质量判断](https://mp.weixin.qq.com/s/x7O4EBAADiOp8lGv_P4SFQ) + - 信号工厂:LLM评判者(评估回答质量、政策遵循、语气)+ 正则表达式(检测必需措辞、被禁工具调用、已知失败模式) + - 从质量检查到产品分析:理解用户委托的任务类型、智能体卡壳的位置、纠正频率 + - **被禁工具调用检测与失败模式识别**是监控的核心工程任务——信号不仅用于告警,更反哺为评估数据集的新增样本 + - 监控层: [监控闭环:仪表盘、告警与持续改进](https://mp.weixin.qq.com/s/CK9CJNSgAUjJH3evKgcSPA) + - 智能体仪表盘覆盖使用量、反馈、延迟、成本、工具调用、评估器评分与反复出现的失败模式——**监控最终应反哺测试** + - 告警应在阈值突破时触发:延迟上升、成本增加、工具故障、用户反馈下降、政策违规激增 + - **从监控到评估的数据闭环**:重要追踪→数据集样本,反复失败→新评估指标,生产行为→下一轮改进起点 + - 治理层: [治理支柱:成本、工具访问与可发现性](https://mp.weixin.qq.com/s/pwlaf-JCREszNvWoMUFpYg) + - AAGMM提出五级成熟度、12个治理域的智能体治理成熟度模型,基于NIST AI RMF和ISO/IEC 42001 + - 治理三大支柱:成本治理(预算/计费/ROI)、工具访问治理(授权/审计/边界控制)、可发现性与复用治理(资产注册与共享) + - ServiceNow AI Control Tower于2026年5月推出智能体发现、观测、治理与安全测度功能 + - **治理不是生命周期的附属,而是前提**——每提升一个成熟度级别,有效任务完成率提高32.6% + - 治理层: [人在回路:决策的工程化设计](https://mp.weixin.qq.com/s/-Uxfg2_ro8oVV5Qe8BLX1g) + - 操作涉及客户数据、财务系统或生产基础设施时应设置人工审批,审计追踪需记录**谁在何时因何决策调用了哪个工具** + - WSO2 Agent Manager等开源控制平面为智能体提供身份、治理和跨环境扩展能力 + - 身份与访问管理(IAM)需为智能体赋予独立身份,与传统用户身份体系对齐 + - 治理层: [安全防护:MCP/A2A协议的威胁面](https://mp.weixin.qq.com/s/ucEwlzswx4AHtBRBAxObVA) + - MCP协议月均SDK下载超9700万,A2A作为Linux Foundation开源跨平台集成标准与MCP互补——但**系统化安全框架仍缺位** + - 安全需从架构设计、通信协议与终端防护三维度构建防御:权限模型(最小权限+动态授权)、沙箱安全(限制爆炸半径)、对抗性防护(提示注入、数据投毒) + - **41%的公开可用技能包含漏洞**——安全不是部署后补丁,而是从设计阶段嵌入的架构约束 + - 案例层: [客户服务:从自动化到全生命周期](https://mp.weixin.qq.com/s/sRfqWtQOK4mbh97rFrrfew) + - Zomato Nugget月均1500万次对话,解决率~85%,效率提升40%,累计降低客服成本超1100万美元——**高频任务评估必须高度自动化** + - Tata Steel部署全球供应链与客户服务Agent网络,ASAPP五Agent覆盖客服全生命周期 + - 案例层: [软件工程:AI编码智能体的生产实践](https://mp.weixin.qq.com/s/JNwyA9l7m_G3HfPhaC2owA) + - Stripe Minions每周产出1300+ PR,OpenAI Codex百万行生产代码零人工编写,Anthropic三智能体脚手架$200产出功能完善产品vs单智能体$200缺失核心功能 + - **代码质量与代码库架构和文档完整性直接相关**——OpenAI Codex的核心发现 + - Stripe五层流水线:隔离环境→Blueprint编排→精选上下文→CI/类型检查→人工审核 + - 案例层: [垂直行业:金融、医疗、制造、零售](https://mp.weixin.qq.com/s/E9tOGD1Nm6cVlMIw3Gg3xw) + - Goldman Sachs与Anthropic合作部署合规智能体,包含**"紧密的控制和审计"**机制——金融行业评估体系质量直接关系到监管遵从 + - 医疗关注临床决策安全护栏,制造业聚焦供应链与预测性维护,零售业Cognizant+Google Cloud推出Agentic Retail CX + - Gorgias通过Temporal Cloud实现跨渠道、跨智能体的复杂工作流编排 + - 前瞻层: [规模化:多智能体生态系统](https://mp.weixin.qq.com/s/NUghWCo0qo4EgBdq3Y6y1g) + - 至2027年预计70%多智能体系统拥有高度专门化角色,**多智能体系统在困难任务上比单智能体表现好90.2%**(Anthropic数据),56%企业表示更易扩展 + - 关键挑战:编排模式选择、协议标准化(A2A/ANP演进)、状态一致性、跨智能体上下文共享 + - 前瞻层: [未来五年:技术演进与组织变革双螺旋](https://mp.weixin.qq.com/s/dBbAC1u2O8xsJftBAaiU5w) + - 模型能力持续提升将缩小某些已知局限,但**"智能体不能可靠自我评估"属于任务结构的固有约束,不会因模型升级而消失** + - Gartner预测至2027年超过40%的agentic AI项目将因成本上升、价值模糊与风险控制不足而暂停 + - **企业需同步建立技术能力、组织能力与治理能力三位一体的系统**——单一维度的领先无法弥补其他维度的短板 + - 附录: [速查手册:概念、工具、评估模板与最佳实践](https://mp.weixin.qq.com/s/xZrGbhIrayJPbLgl1mBVag) + - 包含核心概念速查表、工具与平台矩阵速查表、智能体评估模板、治理成熟度自评清单、沙箱安全审计清单、Skill开发模板等完整参考 ## 2026-06-05 diff --git a/知识/金鹏/20260626/20260626-001.png b/知识/金鹏/20260626/20260626-001.png index 44d690b..3f88001 100644 Binary files a/知识/金鹏/20260626/20260626-001.png and b/知识/金鹏/20260626/20260626-001.png differ