2026年7月31日 · 阅读 —

Agent 自己学技能、自己出题、自己验证——OpenSkill 这篇论文,把"自我进化"推到了新高度

Agent 与 SkillsAI 工程实践

Agent 自己学技能、自己出题、自己验证——OpenSkill 这篇论文,把”自我进化”推到了新高度

现在 Agent 的能力进化,大多数还是靠人在后面推:你写一个 Skill,跑评测,发现问题,修,再跑。或者你给 Agent 喂一些成功轨迹,让它模仿着学。

但问题是,真实的开放环境里,这些”现成的学习信号”可能一个都没有——没有精心整理过的技能库,没有标注好的成功轨迹,甚至连验证器都是空的。

你只能给 Agent 一个任务描述,然后期望它自己想办法。

OpenSkill 这篇论文(Lehigh / UIC / UBC / Vector Institute / Salesforce AI Research / Harvard 联合出品)研究的就是这件事:Agent 如何从零开始,在没有任何目标任务监督信号的情况下,利用开放世界的资源,自己构建技能、自己设计验证、自己迭代进化。

而且它真的做到了——在 11 个领域的 benchmark 上,比最强闭源基线高 8.9 个点,离人类上限只差 1~3 个点。

一句话结论

OpenSkill 是一个开放世界 Agent 自我进化框架——只给 Agent 一个任务描述、一个基础模型和工具访问权限,它就能从互联网文档、代码仓库、论文里自主获取知识,自己写技能,自己出测试题验证,最终进化出可用的 Agent 能力,整个过程不需要任何目标任务的标注数据。 目前代码还没放出,但论文数据和架构已经非常完整,arXiv 可读。


核心亮点

1. 三个核心属性,缺一不可

OpenSkill 定义了一个理想的自进化范式应该具备的三个属性:

  • Scalable(可扩展):技能来源是开放世界,不局限于人类或模型已有的知识
  • Grounded(可落地):知识和验证锚点来自真实的文档、仓库和网页,不是凭空生成
  • Supervision-free(免监督):学习过程中不使用任何黄金答案、奖励信号或验证器输出

现有的自进化方法,无论是人类策划、LLM 生成还是监督式,都至少缺一个。OpenSkill 是第一个同时满足三个的方案。

2. 三阶段流水线,从零开始

只给一个任务描述,OpenSkill 分三步走:

阶段名称做什么
01开放世界知识获取从文档、仓库、论文、网页检索任务相关知识和独立验证锚点,起草结构化技能计划
02无泄漏技能进化在沙箱中编写技能,并基于锚点自建虚拟测试来迭代优化,最多 3 轮
03零样本目标评估冻结技能,部署到目标 Agent。地面真值测试只在最终评估时解锁

关键设计:泄漏屏障(leakage barrier)——目标任务的真实测试数据在技能构建期间完全不可见,只在最终评估时解锁。这保证了评测结果不是”背答案”。

3. 在 SkillsBench 上 11 中 8 领先

11 个领域,OpenSkill 在 8 个上达到最佳或并列最佳(Opus 4.6 作为目标 Agent)。整体通过率:

目标 Agent无 SkillSelf-GenCoTSkill-CreatorAutoSkillMementoOpenSkill人类上限
Opus 4.6 (Claude Code)25.523.923.934.724.730.143.644.5
GPT 5.2 (Codex)25.032.233.329.211.215.642.144.8

比最强闭源基线(Skill-Creator)高 8.9 / 8.8 个点,离人类上限差不到 3 个点。这个差距在 Agent 研究里已经相当小了。

4. 自建验证器覆盖 88.9% 的目标意图

论文里一个很关键的数据:在不接触任何地面真值测试的情况下,OpenSkill 自建的虚拟验证器(verifier)覆盖了 88.9% 的真实测试意图,召回率达到 80.5%。

这意味着 Agent 自己出的题,和人类出的题高度重合——它不是在”自己编题自己考自己”,而是真的找到了任务需要验证的关键维度。

5. 技能可迁移,弱模型也能用

一个有趣的结果:Opus 4.6 生成的技能,不做任何适配,直接迁移到 4 个更弱的模型上,比这些模型自己无技能跑的效果提升 5.5~14.8 个点。

这暗示了一个实用场景:强模型帮弱模型写技能——你不需要每个模型都从头进化,一次生成的技能可以跨模型复用。

6. 三阶段进化,两轮迭代就够了

在 SocialMaze 上的消融实验显示,自建验证器的奖励信号在 3 轮迭代后达到峰值,开放世界查询和虚拟验证器两个组件互为补充,各自贡献独立增益。

论文没说”轮数越多越好”,而是给出了一个可操作的结论:3 轮以内,效果已经收敛。

7. 不止一个 benchmark 有效

除了 SkillsBench,OpenSkill 在 SocialMaze(82.7% / 70.7%)和 ScienceWorld(90.0% / 85.3%)上也达到了自动化方法的最佳水平。不是某个特定场景的巧合。

8. 适用边界(客观)

  • 代码还没放出。GitHub 仓库目前只有项目概览和路线图,核心框架代码和 reproduction scripts 是 Coming Soon。这篇写的不是”你可以用”,而是”你可以关注”。
  • 依赖强模型。论文用的是 Opus 4.6 和 GPT 5.2,弱模型自进化能力未验证——虽然技能迁移到弱模型有效,但弱模型自己跑全套流程能不能跑通是另一回事。
  • 3 轮迭代是上限,不是下限。简单任务可能 1 轮就够了,但复杂任务也需要人工判断是否收敛。
  • 泄漏屏障的可靠性依赖实现。论文在实验设计上严格隔离了监督信号,但实际部署中如果屏障实现有漏洞,评估结果就会失真。

架构速览

flowchart LR
  A[Task Prompt 仅任务描述]
  A --> B[Stage 1 开放世界知识获取]
  B --> C[Stage 2 无泄漏技能进化\n沙箱 + 自建虚拟测试]
  C --> D[Stage 3 零样本目标评估\n冻结技能 + 地面真值]
  D --> E[评估结果]
  
  B --> W[文档/仓库/论文/网页]
  C --> V[自建虚拟验证器3轮迭代]

(名词来源:论文 Figure 2 框架图,已简化。)


写在最后

OpenSkill 最让我感兴趣的点,不是它比基线高了多少分,而是它证明了一件事:Agent 可以在没有任何人类标注信号的情况下,自己从开放世界获取知识、自己构建验证体系、自己迭代进化。

这个能力如果落地,意味着 Agent 的”出厂能力”不再是上限——部署后它还能继续进化,而且不需要人类给它配训练数据。对于长期运行的 Agent 系统来说,这可能是比”跑分高”更重要的价值。

当然,代码还没放出来,论文里的实验环境和实际部署环境也有差距。但方向是对的,数据是扎实的,值得保持关注。


#OpenSkill #Agent #自我进化 #开放世界 #论文解读 #LLM #AIAgent #ClaudeCode #Codex #开源研究