文档(金鹏): 新增 2026-07-31 文章归档
- 汇总 2026-07-31 微信公众号 20 篇文章正文与摘要 - 金鹏.md 新增当日五大主题板块(AI办公、制造业AI、Agent自进化、OCR/TRIZ、AI治理) - 配套 6 张主题配图
This commit is contained in:
@@ -0,0 +1,61 @@
|
||||
# Agent开始"自我进化":会出题、会反思,还会自己长出新技能
|
||||
|
||||
> **来源**:微信公众平台
|
||||
> **作者**:腾讯程序员
|
||||
> **发布日期**:2026-07-31
|
||||
> **原文链接**:https://mp.weixin.qq.com/s/fsVJiorPBN4ylGjUYBcIPw
|
||||
|
||||
---
|
||||
|
||||
作者:horacebao、ashexie
|
||||
|
||||
> 当 Agent 自己会出题、自己会答题、还能把答错的经验沉淀成下一次的"技能包"——一个永远在长大的 Agent,到底能走多远?
|
||||
|
||||
一个完全自主、越用越强的 Agent,有可能实现吗?本文聚合了现有的前沿探索工作,向大家展现这一方向上的最新成果。
|
||||
|
||||
## 01 自进化 Agent 介绍
|
||||
|
||||
自进化 Agent(Self-Evolving Agent)指能够在与环境/用户交互过程中自动积累经验、提炼能力、并在后续任务中复用与提升的智能体。核心诉求:能存、能用、能进化。
|
||||
|
||||
### 三大技术路线
|
||||
|
||||
| 路线 | 是否更新模型权重 | 是否依赖人工数据 | 代表工作 |
|
||||
|------|-----------------|-----------------|---------|
|
||||
| 第一类:经验/Skill 存储型 | ❌ | ❌ | AutoSkill、EvoSkill、MemSkill、CoEvoSkills、SE-Agent |
|
||||
| 第二类:RL 训练型 | ✅ | ❌ | EvolveR、SAGE、SkillRL、SKILL0、SkillOS、AgentEvolver |
|
||||
| 第三类:0 数据自学型 | ✅ | ✅ | Agent0、Tool-R0、Absolute Zero |
|
||||
|
||||
## 02 第一类:经验/Skill 存储型
|
||||
|
||||
- **AutoSkill**:动态增删改查 Skill,防止 Skill 库爆棚
|
||||
- **EvoSkill**:让多个 Agent 分工协作——Executor/Proposer/SkillBuilder,Pareto Frontier 精英池机制
|
||||
- **MemSkill**:针对操作 Memory 的 Skill 做自进化
|
||||
- **CoEvoSkills**:Skill Generator + Verifier 双子星,测试驱动 Skill 进化
|
||||
- **SE-Agent**:多轨迹横向融合,"横向总结"vs传统"纵向总结"
|
||||
|
||||
## 03 第二类:基于 RL 的训练型自进化
|
||||
|
||||
- **EvolveR**:离线提炼策略原则 + 在线检索指导
|
||||
- **SAGE**:Sequential Rollout,序列化跑相似任务
|
||||
- **SkillRL**:强模型(o3)蒸馏Skill → RL训练弱模型学会使用
|
||||
- **SKILL0**:将Skill从"外挂上下文"内化到模型参数,实现零样本执行
|
||||
- **SkillOS**:训练专门的Curator学会管理Skill,训练后8B Curator > 冻结Gemini-2.5-Pro Curator
|
||||
- **AgentEvolver**:完全自主三环自演化框架——自出题、自解题、自总结
|
||||
|
||||
## 04 第三类:0 数据自学型
|
||||
|
||||
- **Agent0**:学习工具使用,Curriculum Agent出题 + Executor Agent解题
|
||||
- **Tool-R0**:类似Agent0,做general tool而非纯数学
|
||||
- **Absolute Zero**:单模型同时扮演出题人和解题人,代码执行器为唯一验证来源
|
||||
|
||||
## 05 核心洞察
|
||||
|
||||
**总结者是被严重低估的关键模块**——几乎所有工作都把Skill总结交给冻结的强模型。SkillOS首次证明训练后的小模型Curator能超过冻结的大模型Curator。
|
||||
|
||||
**右上方空白象限**——既自动生成题目、又训练总结者的工作目前一篇都没有。
|
||||
|
||||
**本质问题**:如何让 Agent 在没有人工干预的情况下,把交互的副产物转化为下一次更强的能力?
|
||||
|
||||
## 附录
|
||||
|
||||
论文索引包含14篇论文(AutoSkill到Absolute Zero),评估数据集涵盖WildChat-1M到HumanEval等。
|
||||
@@ -0,0 +1,79 @@
|
||||
# 📊 文章摘要:Agent开始"自我进化":会出题、会反思,还会自己长出新技能
|
||||
|
||||
> **原文**:[2026-07-31_Agent开始_自我进化_:会出题_会反思_还会自己长出新技能.md](./2026-07-31_Agent开始_自我进化_:会出题_会反思_还会自己长出新技能.md)
|
||||
> **原文链接**:https://mp.weixin.qq.com/s/fsVJiorPBN4ylGjUYBcIPw
|
||||
> **来源**:微信公众平台
|
||||
> **作者**:腾讯程序员
|
||||
> **发布日期**:2026-07-31
|
||||
> **摘要日期**:2026-07-31
|
||||
> **价值评级**:⭐⭐⭐ 高
|
||||
|
||||
---
|
||||
|
||||
## 核心命题
|
||||
|
||||
> **Agent自进化** — 系统综述了Agent自我进化的三大技术路线(经验存储型、RL训练型、0数据自学型),首次揭示"总结者(Skill Curator)"是当前被严重低估的关键瓶颈模块。
|
||||
|
||||
---
|
||||
|
||||
## 文章概要
|
||||
|
||||
本文是腾讯PCG大数据平台部团队对14篇自进化Agent前沿论文的系统性综述。将研究路线按"是否更新模型权重"和"是否依赖人工数据"两个维度划分为三类:经验/Skill存储型(不训练模型,外挂技能库)、RL训练型(通过强化学习把经验写入权重)、0数据自学型(完全不要人工标注数据)。文章最重要的贡献在于横向对比四篇代表工作后,指出了当前研究的核心空白——"总结者本身的训练"和"完全自主+训练总结者"的交叉路径几乎无人涉足。
|
||||
|
||||
---
|
||||
|
||||
## 关键要点
|
||||
|
||||
1. **三大技术路线** — 第一类:存技能(外挂大脑);第二类:训技能(写入权重);第三类:自生成(零人工数据)。`[分类: 共识]`
|
||||
2. **总结者是最大的瓶颈** — 几乎所有工作都把Skill总结交给冻结的强模型(o3/Gemini),SkillOS首次证明"训练后的小模型Curator > 冻结的大模型Curator"。`[分类: 范式突破]`
|
||||
3. **SkillOS的核心结论** — 仅训练Curator、冻结Executor的情况下,整体性能仍能显著提升。这意味着"换Curator"是一条比"换Executor"更轻量的优化路径。`[分类: 范式突破]`
|
||||
4. **横向vs纵向总结的融合是开放问题** — SE-Agent(多轨迹横向融合)与其他工作的纵向总结尚未有效结合,是潜在突破口。`[分类: 未探索方向]`
|
||||
5. **右上方空白象限** — 既自动生成题目、又训练总结者的工作目前一篇都没有。`[分类: 未探索方向]`
|
||||
6. **CoEvoSkills的发现** — Self-evo > Cross-model Transfer:强模型生成的Skill给弱模型用,效果不如弱模型自己self-evo。`[分类: 争议]`
|
||||
|
||||
---
|
||||
|
||||
## 批判性分析
|
||||
|
||||
### 假设前提
|
||||
|
||||
文章假设"自进化Agent"是通往更强AI的正确方向,未充分讨论Agent自我进化可能带来的失控风险。另外,所有分析基于实验室benchmark表现,在真实生产环境中的效果存疑。
|
||||
|
||||
### 论据与逻辑
|
||||
|
||||
文献覆盖面广(14篇论文),分类框架清晰,横向对比表直观。但部分论文的实验设置不统一(不同数据集、不同基座模型),横向对比的可比性有限。
|
||||
|
||||
### 边界与局限
|
||||
|
||||
- 综述时间截止到2026年5月左右(最新论文SkillOS: 2605.06614),后续发展未纳入
|
||||
- 评估数据集混乱,各工作用不同benchmark,可比性差
|
||||
- 对第三类"0数据自学"路线的可靠性讨论不足(sliver answer的隐患)
|
||||
|
||||
---
|
||||
|
||||
## 可引用金句
|
||||
|
||||
> "如何让 Agent 在没有人工干预的情况下,把交互的副产物转化为下一次更强的能力?"
|
||||
|
||||
> "总结这一步,被严重低估——几乎所有工作都默契地把Skill总结这一步交给了冻结的base或独立的LLM。"
|
||||
|
||||
> "右上方那个空白象限——既自动生成题目、又训练总结者——目前没有一篇工作覆盖。"
|
||||
|
||||
---
|
||||
|
||||
## 总体评价
|
||||
|
||||
**亮点**:
|
||||
- 分类框架(三路线×三角色)逻辑清晰,是后续研究的有效导航
|
||||
- "总结者被低估"和"空白象限"两个洞察具有真正的学术贡献
|
||||
- 横向对比表(四篇代表工作的三角色视角)是全文最有价值的部分
|
||||
- 附录的论文索引和数据集索引实用性强
|
||||
|
||||
**不足**:
|
||||
- 文末夹杂腾讯Dola产品推广,略显突兀
|
||||
- 对第一类"经验存储型"工作的技术深度分析不够
|
||||
- "总结者"的概念定义在不同工作中不够统一
|
||||
|
||||
**适用场景**:Agent/AI研究者、LLM应用开发者、关注Agent能力演进的技术决策者
|
||||
|
||||
**关联建议**:可结合阅读百度Unlimited OCR系列(R-SWA注意力机制)理解另一条Agent架构优化的技术路线
|
||||
Reference in New Issue
Block a user