Files
tech/微信公众平台/腾讯程序员/2026-07-31_Agent开始_自我进化_:会出题_会反思_还会自己长出新技能.md
arno 6ef0d3a091 文档(金鹏): 新增 2026-07-31 文章归档
- 汇总 2026-07-31 微信公众号 20 篇文章正文与摘要
- 金鹏.md 新增当日五大主题板块(AI办公、制造业AI、Agent自进化、OCR/TRIZ、AI治理)
- 配套 6 张主题配图
2026-07-31 13:07:41 +08:00

3.1 KiB
Raw Permalink Blame History

Agent开始"自我进化":会出题、会反思,还会自己长出新技能

来源:微信公众平台
作者:腾讯程序员
发布日期2026-07-31
原文链接https://mp.weixin.qq.com/s/fsVJiorPBN4ylGjUYBcIPw


作者:horacebao、ashexie

当 Agent 自己会出题、自己会答题、还能把答错的经验沉淀成下一次的"技能包"——一个永远在长大的 Agent,到底能走多远?

一个完全自主、越用越强的 Agent,有可能实现吗?本文聚合了现有的前沿探索工作,向大家展现这一方向上的最新成果。

01 自进化 Agent 介绍

自进化 AgentSelf-Evolving Agent)指能够在与环境/用户交互过程中自动积累经验、提炼能力、并在后续任务中复用与提升的智能体。核心诉求:能存、能用、能进化。

三大技术路线

路线 是否更新模型权重 是否依赖人工数据 代表工作
第一类:经验/Skill 存储型 AutoSkill、EvoSkill、MemSkill、CoEvoSkills、SE-Agent
第二类:RL 训练型 EvolveR、SAGE、SkillRL、SKILL0、SkillOS、AgentEvolver
第三类:0 数据自学型 Agent0、Tool-R0、Absolute Zero

02 第一类:经验/Skill 存储型

  • AutoSkill:动态增删改查 Skill,防止 Skill 库爆棚
  • EvoSkill:让多个 Agent 分工协作——Executor/Proposer/SkillBuilderPareto Frontier 精英池机制
  • MemSkill:针对操作 Memory 的 Skill 做自进化
  • CoEvoSkillsSkill Generator + Verifier 双子星,测试驱动 Skill 进化
  • SE-Agent:多轨迹横向融合,"横向总结"vs传统"纵向总结"

03 第二类:基于 RL 的训练型自进化

  • EvolveR:离线提炼策略原则 + 在线检索指导
  • SAGESequential Rollout,序列化跑相似任务
  • SkillRL:强模型(o3)蒸馏Skill → RL训练弱模型学会使用
  • SKILL0:将Skill从"外挂上下文"内化到模型参数,实现零样本执行
  • SkillOS:训练专门的Curator学会管理Skill,训练后8B Curator > 冻结Gemini-2.5-Pro Curator
  • AgentEvolver:完全自主三环自演化框架——自出题、自解题、自总结

04 第三类:0 数据自学型

  • Agent0:学习工具使用,Curriculum Agent出题 + Executor Agent解题
  • Tool-R0:类似Agent0,做general tool而非纯数学
  • Absolute Zero:单模型同时扮演出题人和解题人,代码执行器为唯一验证来源

05 核心洞察

总结者是被严重低估的关键模块——几乎所有工作都把Skill总结交给冻结的强模型。SkillOS首次证明训练后的小模型Curator能超过冻结的大模型Curator。

右上方空白象限——既自动生成题目、又训练总结者的工作目前一篇都没有。

本质问题:如何让 Agent 在没有人工干预的情况下,把交互的副产物转化为下一次更强的能力?

附录

论文索引包含14篇论文(AutoSkill到Absolute Zero),评估数据集涵盖WildChat-1M到HumanEval等。