2026年7月31日 · 阅读 —
Agent 自己学技能、自己出题、自己验证——OpenSkill 这篇论文,把"自我进化"推到了新高度
Agent 自己学技能、自己出题、自己验证——OpenSkill 这篇论文,把”自我进化”推到了新高度
现在 Agent 的能力进化,大多数还是靠人在后面推:你写一个 Skill,跑评测,发现问题,修,再跑。或者你给 Agent 喂一些成功轨迹,让它模仿着学。
但问题是,真实的开放环境里,这些”现成的学习信号”可能一个都没有——没有精心整理过的技能库,没有标注好的成功轨迹,甚至连验证器都是空的。
你只能给 Agent 一个任务描述,然后期望它自己想办法。
OpenSkill 这篇论文(Lehigh / UIC / UBC / Vector Institute / Salesforce AI Research / Harvard 联合出品)研究的就是这件事:Agent 如何从零开始,在没有任何目标任务监督信号的情况下,利用开放世界的资源,自己构建技能、自己设计验证、自己迭代进化。
而且它真的做到了——在 11 个领域的 benchmark 上,比最强闭源基线高 8.9 个点,离人类上限只差 1~3 个点。
一句话结论
OpenSkill 是一个开放世界 Agent 自我进化框架——只给 Agent 一个任务描述、一个基础模型和工具访问权限,它就能从互联网文档、代码仓库、论文里自主获取知识,自己写技能,自己出测试题验证,最终进化出可用的 Agent 能力,整个过程不需要任何目标任务的标注数据。 目前代码还没放出,但论文数据和架构已经非常完整,arXiv 可读。
核心亮点
1. 三个核心属性,缺一不可
OpenSkill 定义了一个理想的自进化范式应该具备的三个属性:
- Scalable(可扩展):技能来源是开放世界,不局限于人类或模型已有的知识
- Grounded(可落地):知识和验证锚点来自真实的文档、仓库和网页,不是凭空生成
- Supervision-free(免监督):学习过程中不使用任何黄金答案、奖励信号或验证器输出
现有的自进化方法,无论是人类策划、LLM 生成还是监督式,都至少缺一个。OpenSkill 是第一个同时满足三个的方案。
2. 三阶段流水线,从零开始
只给一个任务描述,OpenSkill 分三步走:
| 阶段 | 名称 | 做什么 |
|---|---|---|
| 01 | 开放世界知识获取 | 从文档、仓库、论文、网页检索任务相关知识和独立验证锚点,起草结构化技能计划 |
| 02 | 无泄漏技能进化 | 在沙箱中编写技能,并基于锚点自建虚拟测试来迭代优化,最多 3 轮 |
| 03 | 零样本目标评估 | 冻结技能,部署到目标 Agent。地面真值测试只在最终评估时解锁 |
关键设计:泄漏屏障(leakage barrier)——目标任务的真实测试数据在技能构建期间完全不可见,只在最终评估时解锁。这保证了评测结果不是”背答案”。
3. 在 SkillsBench 上 11 中 8 领先
11 个领域,OpenSkill 在 8 个上达到最佳或并列最佳(Opus 4.6 作为目标 Agent)。整体通过率:
| 目标 Agent | 无 Skill | Self-Gen | CoT | Skill-Creator | AutoSkill | Memento | OpenSkill | 人类上限 |
|---|---|---|---|---|---|---|---|---|
| Opus 4.6 (Claude Code) | 25.5 | 23.9 | 23.9 | 34.7 | 24.7 | 30.1 | 43.6 | 44.5 |
| GPT 5.2 (Codex) | 25.0 | 32.2 | 33.3 | 29.2 | 11.2 | 15.6 | 42.1 | 44.8 |
比最强闭源基线(Skill-Creator)高 8.9 / 8.8 个点,离人类上限差不到 3 个点。这个差距在 Agent 研究里已经相当小了。
4. 自建验证器覆盖 88.9% 的目标意图
论文里一个很关键的数据:在不接触任何地面真值测试的情况下,OpenSkill 自建的虚拟验证器(verifier)覆盖了 88.9% 的真实测试意图,召回率达到 80.5%。
这意味着 Agent 自己出的题,和人类出的题高度重合——它不是在”自己编题自己考自己”,而是真的找到了任务需要验证的关键维度。
5. 技能可迁移,弱模型也能用
一个有趣的结果:Opus 4.6 生成的技能,不做任何适配,直接迁移到 4 个更弱的模型上,比这些模型自己无技能跑的效果提升 5.5~14.8 个点。
这暗示了一个实用场景:强模型帮弱模型写技能——你不需要每个模型都从头进化,一次生成的技能可以跨模型复用。
6. 三阶段进化,两轮迭代就够了
在 SocialMaze 上的消融实验显示,自建验证器的奖励信号在 3 轮迭代后达到峰值,开放世界查询和虚拟验证器两个组件互为补充,各自贡献独立增益。
论文没说”轮数越多越好”,而是给出了一个可操作的结论:3 轮以内,效果已经收敛。
7. 不止一个 benchmark 有效
除了 SkillsBench,OpenSkill 在 SocialMaze(82.7% / 70.7%)和 ScienceWorld(90.0% / 85.3%)上也达到了自动化方法的最佳水平。不是某个特定场景的巧合。
8. 适用边界(客观)
- 代码还没放出。GitHub 仓库目前只有项目概览和路线图,核心框架代码和 reproduction scripts 是 Coming Soon。这篇写的不是”你可以用”,而是”你可以关注”。
- 依赖强模型。论文用的是 Opus 4.6 和 GPT 5.2,弱模型自进化能力未验证——虽然技能迁移到弱模型有效,但弱模型自己跑全套流程能不能跑通是另一回事。
- 3 轮迭代是上限,不是下限。简单任务可能 1 轮就够了,但复杂任务也需要人工判断是否收敛。
- 泄漏屏障的可靠性依赖实现。论文在实验设计上严格隔离了监督信号,但实际部署中如果屏障实现有漏洞,评估结果就会失真。
架构速览
flowchart LR
A[Task Prompt 仅任务描述]
A --> B[Stage 1 开放世界知识获取]
B --> C[Stage 2 无泄漏技能进化\n沙箱 + 自建虚拟测试]
C --> D[Stage 3 零样本目标评估\n冻结技能 + 地面真值]
D --> E[评估结果]
B --> W[文档/仓库/论文/网页]
C --> V[自建虚拟验证器3轮迭代]
(名词来源:论文 Figure 2 框架图,已简化。)
写在最后
OpenSkill 最让我感兴趣的点,不是它比基线高了多少分,而是它证明了一件事:Agent 可以在没有任何人类标注信号的情况下,自己从开放世界获取知识、自己构建验证体系、自己迭代进化。
这个能力如果落地,意味着 Agent 的”出厂能力”不再是上限——部署后它还能继续进化,而且不需要人类给它配训练数据。对于长期运行的 Agent 系统来说,这可能是比”跑分高”更重要的价值。
当然,代码还没放出来,论文里的实验环境和实际部署环境也有差距。但方向是对的,数据是扎实的,值得保持关注。
#OpenSkill #Agent #自我进化 #开放世界 #论文解读 #LLM #AIAgent #ClaudeCode #Codex #开源研究