2026年9月16日 · 阅读 —
RSI,别名自我进化:从 agent-loop 到 agent-harness 到递归自我改进,AI 工程到底在往哪一层堆能力
RSI,别名自我进化:从 agent-loop 到 agent-harness 到递归自我改进,AI 工程到底在往哪一层堆能力
DeepSeek Harness 开源,把”Harness”这东西推到了讨论中心,一群人吵它到底算不算够格的 Agent 运行系统。
然后是 GitHub、arXiv 上一个叫 RSIAgent 的项目火起来,机器之心直接写”开源模型在计算机操作基准上越级击败 GPT-6”。
三个词——Harness、Agent Loop、RSI(递归自我改进)——经常被混着用,也经常被对立着用。
有人拿 RSI 踩 Harness,说脚手架要过时了。
有人把 RSI 吹成”通向 AGI 的下一站”,好像真能一夜之间越用越强。
我把本地知识库里能翻到的相关长文、论文、仓库 README 看了一遍,想用自己的工程坐标系把这几个概念彻底捋一遍。
结论
Agent 的能力不是底层模型单给的,是一层一层堆出来的。Agent Loop 管一次思考,Agent Harness 管一次任务,RSI 管”任务和任务之间”的时间累积。三者不是竞争,是三个不同的尺度。RSI 是这三层里唯一带”时钟”的那一层——也是被吹得最凶、却被验证得最少的一层。
这三层到底差在哪,一个个拆。
先把三个词摆到一起
我先用个比喻把三个层次钉住。
把 AI Agent 想成一辆车。
发动机是底层模型——出 token、理解路况、决定怎么打方向盘。
Agent Loop 是”打一次方向盘”的循环:看见前方(观察)→ 决定(思考)→ 打方向(行动)→ 再看前方(再观察)。它管的是极短时间尺度上的”思考—行动—观察”遍历,一轮接一轮。
Agent Harness 是这辆车除发动机之外的整套东西:变速箱、底盘、传感器、刹车、导航。它决定这辆车一趟行程里能不能稳当从 A 到 B——上下文怎么组织、记忆怎么存、工具怎么调、出错怎么恢复、该不该让乘客踩刹车。同一台发动机换一套底盘,整车表现可能天差地别。
RSI 是”运输公司的车队调度”:它不管单趟——单趟是车队上路那辆车的事,它管的是今天这趟跑完之后,明天车队怎么更强。今天哪段路翻了车,记下来;哪条路线更快,沉淀成标准流程;明天上线直接复用,而不是又从零摸索。
翻译成工程语言,就是开头那句话:
- Agent Loop 解决”Δ t 内单回合作出的决策”。
- Agent Harness 解决”从接下任务到交付结果”的一次任务周期。
- RSI 解决”跨任务的状态累积”——让下一次的自己站在这一次的经验上。
三个尺度完全不同,但特别容易被搞混。所以下面把这篇文章的重点放在讲清”它们各自管什么、边界在哪”,而不是建议你选哪个。
Agent Loop:最底层的思考—行动—观察循环
Loop 是接触 Agent 时第一个碰到的概念,也最容易被低估。
它本质上就是那个经典的 ReAct 循环:reason → act → observe → 再 reason。
每步,模型看当前状态,决定下一步干什么(可能是调一个工具,也可能直接给答案),把工具返回的结果当新的观察,继续循环,直到任务结束。
它解决的是任何 Agent 都绕不开的问题:模型不能输出一段话就算交差,它得能和真实世界交互、能调工具、能按反馈调整。
但 Loop 有个致命、又经常被忽略的局限:
它”失忆”,而且只管单回合。
Loop 本身没有”跨任务”概念。今天做完一个任务,明天做另一个,它不会记得昨天怎么解的。每次任务,模型都像头一回进这个领域。
更糟的是,即使单次任务内,Context Window 也有限。任务一长,历史塞不下,Loop 就撞墙。
所以光靠 Loop,Agent 只能”会做”,做不到”越做越好”。这也解释了为什么很快有人发现,得在 Loop 外面再套一层东西。
Agent Harness:一次任务的控制系统
如果说 Loop 是”引擎怎么转”,Harness 就是”整台机器怎么组织起来干完一次活”。
我认同唐国梁那篇长文里把 Harness 比作”变速箱、底盘、传感器和整套控制系统”,但还想再补一句——Harness 最核心的职责,是压缩模型行为的不确定性。
模型天生是概率性的。
它可能选错工具、重复执行、忘记中间状态、失败后走错恢复路径、把”局部完成”当成”任务完成”、没确认就执行有副作用的操作。
Harness 要做的,就是用一整套约束,把这些概率性压到可管理范围:模型能看到什么、能调什么、输出保留多少、错误怎么分类、任务怎么验收、哪些操作必须先确认、失败后从哪恢复、什么时候必须停。
围绕这个核心,一套完整 Harness 通常有四大块:
| 组件 | 干什么 |
|---|---|
| 记忆管理 | 决定留哪些历史、怎么组织、怎么给模型——全量上下文,还是分层摘要,还是结构化事实库 |
| 规划策略 | 怎么把复杂任务拆子目标,怎么跟进度,遇意外怎么调 |
| 动作协议 | 模型输出的动作怎么执行,出错怎么办,结果怎么返回 |
| 工具与技能编排 | 从工具库选当前该用哪个,怎么组合,怎么管更复杂的技能 |
这里有个容易被忽略的事实,JIT-Agent 那篇论文讲得最透:同一套模型,换一套 Harness,最终表现可能天差地别。
这也是为什么开源模型经过精心调好的 Harness,有时候能接近甚至超过闭源旗舰——你看到的能力里,其实混进了大量 Harness 的差异,不只是模型的差异。
JIT-Agent 那张表很说明问题:GLM-5.2 搭上它生成的 Harness,平均涨 7.7 分,最高单个任务涨 20.2 分,成本平均还降了 36%。
不过 Harness 有自己的天花板:它往往是”提前设计(AOT)“的静态产物。
开发者凭经验预先把一套固定架构(上下文怎么管、规划怎么拆、工具怎么排)封成运行时。任务分布稳定时它不错,但一碰上异构任务就处处妥协——广度搜索要并行、终端操作要精简循环、深度研究要长时记忆、代码开发要文件系统状态,用一套通用 Harness 硬套所有场景,总有个维度在亏。
而且,Harness 通常不会自己进化。它是个写死的运行框架——你今天手工调好,它不会随使用越变越强,除非你给它套上”会进化”的机制。
而那,正是 RSI 干的事。
RSI:带”时钟”的那一层
现在聊主角。
RSI(Recursive Self-Improvement,递归自我改进),别名自我进化、Self-Evolving、Self-Improving。
定义我直接用”万字长文带你读懂 RSI”里那句,框得比较严谨:
RSI 指:Agent 在与环境交互后,利用任务轨迹与反馈,通过更新机制修改自身状态,并让更新后的状态参与后续任务,以提升未来表现。
注意几个关键词——轨迹、反馈、更新机制、修改自身、参与后续任务。
这跟我前面说的”带时钟”对上了:它不是在一次任务内做优化,而是在任务和任务之间积累和更新。
因为改进对象和实现路径差异太大,RSI 很难用某一种具体方法概括:有人改模型参数,有人积累上下文或记忆,有人演化 Skill,还有人直接去改工具、控制流程和 Harness 代码。
所以读 RSI,重要的不是背个定义,是建立一套分析 RSI 的坐标系。这样以后碰到任何自进化工作,都能立刻判断它在解决什么、和已有工作区别在哪。
下面这套坐标系,整理自”万字长文”,我用自己的话复述一遍。
先记住一个公式:Agent = Model + Harness
所有讨论都从这出发:现代智能体可以抽象成 Agent = Model + Harness。
Model 提供理解、推理、生成。Harness 组织模型怎么收信息、积累经验、调工具、完成任务——具体包括上下文、记忆、Skill、工具和 Harness 代码。
不同的 RSI 方法,区别就在于它们去改 Model 还是改 Harness 的哪一部分。 这是整套坐标系的钥匙。
维度一:RSI 在进化什么?
- 参数进化:把经验写回模型权重。好处是知识直接内化进模型,不用每次检索;代价是更新贵、难定位、难撤销,一次错误训练可能污染一堆无关任务。代表是 SEAL 那类”自修改语言模型”。
- 上下文进化:不碰权重,而是按任务结果重新组织模型下次看到的材料——删无关、压长历史、补失败教训、重写计划。Prime Agent 用一个持久化工作台存历史和中间结果,模型再次运行不从头开始。
- 记忆进化:把经验写进独立的长期存储,后续按需检索。ReasoningBank 把成功和失败轨迹提炼成简短、可复用的经验,新任务来就检索相关策略,做完再提炼写回。它体现一条共性原则:直接存整条轨迹往往不好,冗余太多,要提炼成经验。
- Skill 进化:单条记忆记”某次发生了什么”,Skill 总结”以后这类问题该怎么做”。TRACE 维护一个 Skill Bank,按成功失败轨迹持续改每个 Skill。价值在于:一类任务出问题时只改相关 Skill,不用重写整套 Prompt。
- Harness 代码进化:最深的一层。不只改 Skill 怎么用,还能改上下文构造方式、增删工具、改执行逻辑。SkillSmith 允许同时改 Skill 和工具,理由是”如果任务失败是工具能力不够,光改工具说明文字没用”。它还盯着多个 Skill 一起用时会不会互相干扰。
一句话:从参数到 Skill 再到 Harness 代码,越往下越”结构性”、影响越大,成本、风险和验证难度也越高。
维度二:进化结构——链、树还是图?
这个维度问的是新版本怎么继承历史结果,决定探索范围、评测成本,以及从错误更新里恢复的能力。
- 链(Chain):始终只有一个在用的版本,A0 → A1 → A2 → … 一条路走到底。实现简单,但前一轮的错误会被下一轮直接继承。SkillFlow 是典型,还踩了个坑:表现差的配置容易不断新增相似 Skill,把库越搞越碎,错误 Skill 还会被后续任务沿用。
- 树(Tree):保留多个 Agent 版本,一个版本能生出多个子版本,不同改进方向形成分支。暂时表现差的也能留,某项修改可能是后续改进的基础。代价是分支多了,选父代和评测新版本的算力、时间都涨。Darwin Gödel Machine 用 SWE-bench 一路把编程从 20% 进化到 50%,但一次完整实验约需两周、token 消耗很高。
- 图(Graph):允许一次更新同时参考多个历史来源——同一 Agent 不同任务的轨迹,或另一条分支的执行结果。Mendel Gödel Machine 用”跨任务轨迹对照”和”跨分支轨迹对照”来修 bug:多个任务反复出现相似问题时,能判断多半是 Agent 自身问题而非某道题特殊。它 Polyglot 能到 93.2%,远超只看单条轨迹的树式基线 77.9%。
树和图容错更强、探索更深,代价是钱和时间。链最便宜,但最容易一条道走到黑。
维度三:谁来更新 Agent?
执行任务的叫 Student,分析轨迹、参与修改的叫 Teacher。按谁改,分三类:
- 自身更新:Student 自己总结经验改自己。省传话,但风险是——如果 Student 理解错了反馈,错误也会写进长期产物,继续影响后面任务。
- 教师更新:执行的 Student 不改,由独立 Teacher(另一个 Agent、反思模块或优化器)写持久产物。Recuris 就是固定 Meta-Agent 汇总跨任务失败,验证过后再改 Skill Memory。
- 联合更新:两方都参与,一方诊断一方实现,或一方总结一方写入。Evo-Harness 里 Solver 先总结候选经验,Evolver 再筛选整理写入,内容是二者共同产生的。
这个维度直接关系到可靠性和责任划定——谁来改,谁就得对”改得对不对”负责。
维度四:更新时机——离线、在线还是混合?
按”执行任务”和”更新经验”的时间关系:
- 离线 RSI:在训练任务里先更新到位,进测试阶段后保持不变。训练和测试任务不能完全重叠(否则是背答案),也不能完全不同(否则看不出经验有没有用)。GDPevo 用”规则重组”的方式构造任务,专门检验 Agent 是泛化了、还是见过类似题。
- 在线 RSI:任务排成连续序列,边做边更新,前面任务的经验影响后面。FinEvo-Bench 让 120 个金融任务交错排列,还设了个状态重置的对照组,才把”保留经验”带来的提升单独测出来。
- 混合模式:先离线建一批初始经验,再在实际使用中持续补。Mem²Evolve 先用部分任务建好初始工具和专家 Agent,再边用边补。
离线最可控、最公平,在线最贴近真实但难测干净,混合最务实。
一个能上手的开源实现:RSIAgent
坐标系搭完,看个具体的货。
RSIAgent 最近在 https://github.com/AetherLabsAI/RSIAgent、[arXiv 2609.15364] https://arxiv.org/abs/2609.15364 上火起来,最抓眼球的是那句:开源模型在计算机操作基准上越级击败 GPT-6 Astra——不更新模型权重。
它的关键技术选择是 training-free(免训练)。
通常让 AI 变强 = 更大模型、更多数据、更新权重。但 RSIAgent 不碰权重。它走的是完全不同的路子:用多智能体的”探索—验证—沉淀记忆”循环,让模型在陌生环境里积累可复用经验,模型参数在探索和执行里一动不动。
这正好呼应 RSI 的本质——你改进的不一定是权重,而是”下一次能调用的经验”。
三个智能体,一所分工明确的学校
RSIAgent 不是单个 AI 单打独斗,是三个智能体组成闭环:
- Curriculum Agent(出题老师):根据当前已知信息,决定接下来探索什么、练什么,判断继续练还有没有价值。
- Actor Agent(动手的学生):执行 Python/Bash 与软件交互,观察结果,验证通过后把经验蒸馏、整理进记忆。
- Verifier Agent(批改老师):独立检查任务要求和最终环境状态,给”对/错”反馈。关键——它读不到 Actor 的私有推理和记忆,只能凭最终结果判断,保证批改公平。
这套三角色拆解,是 RSI 工程里很值得抄的一课:
出题、做题、批改的人分开,各守一道信息边界。出题老师不能剧透,批改老师不能偷看草稿。这样学习闭环才干净、才可验证。
它顺带回答了”谁来更新”那个维度里的可靠性质疑——把更新和验证拆开,不让学生自己出题自己评分。
先广后深:刷题式学习
RSIAgent 的探索分两阶段:
- BRS(广度递归探索):像学生拿到新课本先快速通读,并行探索多个互补方向,快速摸清环境的结构、工具、可能的操作流程。
- DRS(深度递归探索):再针对难点、隐藏约束、边界条件、之前没发现的因果依赖,做”刷题式”反复练习,直到真正攻克。
很像聪明的学生整理错题本:广撒网找出薄弱环节,再针对错题反复练,把失败教训一并记进笔记。
这里有个容易被漏掉的重点:失败的教训同样进记忆。 论文强调,经验就是跨任务持续的”学习状态”,每次独立尝试间环境和交互历史会重置,但验证过的成功与失败,都会成为下一轮探索的养料。
经验,比参数更值钱
整个流程分三阶段,像”学习—刷题—考试”:
- Phase 1·BRS:出题老师提多样项目,多个学生并行探索、互相批改,之后把经验逐条沉淀。
- Phase 2·DRS:针对暴露的薄弱点聚焦练习,每条验证过的经验先更新记忆,再进下一轮。
- Phase 3·测试时记忆复用:冻结记忆,学生只凭记忆完成正式任务,模型权重、Agent 框架全程不变。
设计的精妙在于一句话:真正被复用的是记忆,不是参数。
记忆里存的是可检查、可复用的”操作手册”——具体到一段脚本、一条流程、一个被验证过的参数。论文给过实例:REAPER 音频软件里,AI 通过练习修正重采样设置,把 RENDER_RESAMPLE 0 0 0 这样的经验值写进记忆,供后续任务直接调用。
效果数字,和我的一点保留
官方仓库报告了组成绩,README 里写明了统计口径:
| 基准 | 无 RSI | 有 RSI |
|---|---|---|
| OSWorld 2.0 · 0808 离线 · 82 任务 | 71.97 | 78.98 |
| Agents’ Last Exam · Near-term · 67 任务 | 83.75 | 84.82 |
“越级击败 GPT-6”指的就是开源模型靠这套免训练的记忆复用,在计算机操作类任务上反超闭源旗舰。
还有个单点实例挺说明问题——REAPER 里完成一段广播插播,基线 68.00,第一次”冻结记忆”评测直接跳到 94.17。拆开看,“结尾处理”那环从 0.2837 飙到 0.8996,正是练习里”悟”出来的关键修正。
但这里有句要紧的话得说:官方的 reporting notes 写得明白,这些 RSI 列”录入了 41 条 RSI 记录(OSWorld)、19 条(ALE)“,其余保留基线;RSI 列”包含不同预算下的选择性重试和 checkpoint,不是对匹配多次运行的简单平均”。 它自己都没把话说满。
所以——成绩是真的,但”最强”那顶帽子,得先扣个问号。
冷静时刻:RSI 到底进化了什么?
前面把 RSI 讲得挺美。现在泼冷水,因为这篇文章的立场是分清”判断”和”事实”。
本地知识库里有一篇,标题直接戳中要害:《Harness 自进化真的有效吗?提升可能只是”多试了几次”》。
它问了一个任何 RSI / Harness Evolution 工作都躲不开的问题:
如果多跑几遍就能拿到同样甚至更好的结果,那所谓”自进化”究竟进化了什么?
必须和 test-time scaling 做对比
这篇的逻辑很硬:很多 Harness Evolution 工作,是在某个 benchmark 上跑 Agent,按返回值不断改,最后再用改好的 Harness 在同一个 benchmark 上报成绩。
但 Harness Evolution 本身就是一种搜索——它会在过程中消耗大量额外推理算力。
于是公平的问题变成:在相同反馈、相同推理预算下,Harness Evolution 还比不过”把同一道题简单做五遍再挑最好的”(test-time scaling)吗?
作者在 Terminal Bench 2.1 上把那笔预算花成四种方式:Harness 完全不动、独立做五次挑最好(Parallel Sampling);Harness 不动但能看到上次结果继续改(Sequential Refinement);根据一批任务经验改共享 Harness(Harness Evolution);每做一题就改这题自己的 Harness(Harness Scaling)。
结果呢
第一组:没有 Unit Test 时,Harness Evolution 甚至打不过 test-time scaling。
最简单的 Parallel Sampling 反而最好(68.2→72.3,三个模型全涨);传统 Harness Evolution 平均只有 67.4,甚至低于那个什么都没优化的 Harness。
原因不难懂:没有外部 verifier,Agent 只能自己判断自己哪错了,可模型的判断本身可能就是错的。一旦第一轮分析方向偏了,后面的 Harness 修改就把错误放大。而 parallel sampling 什么都不学——既然有随机性,干脆多跑几遍,反而更稳。
第二组:给了 Unit Test,Harness Evolution 还是没赢。
加上正确的 correctness signal 后所有方法都变强,但冠军仍不是 Harness Evolution。Parallel Sampling 平均 pass@1 到 86.0,Sequential Refinement 平均 pass@5 到 91.8,Harness Evolution 平均 pass@1 只有 75.8。
关键观察:如果 Harness Evolution 真学到了一个更好的 Harness,那它第一次执行任务就该更强——提升该明显体现在 pass@1 上。但实验没看到这一点。 大量收益发生在”允许多次 trajectory 后再挑成功结果”上。
这说明:所谓 Harness Evolution 的收益,很大一部分不是”学会了更好的工作方式”,而只是系统获得了更多次尝试机会——而 test-time scaling 用更简单的方式就实现了同样的事。
最扎心的:进化出来的 Harness 能泛化吗?
作者把 Terminal Bench 拆成训练集(45)、验证集(10)、完全隔离的测试集(34),Harness Evolution 只能看训练集,最后在没见过的测试集上测。
结果:Claude Opus 4.6 从 63.3 到 64.5,GPT 5.4 从 72.1 到 72.1,平均只提 0.6 个百分点。这和它在自己训练任务上表现出的提升反差极大。
作者判断:当前 Harness Evolution 学到的东西很可能有很强的 task-specific adaptation——更像在适应 benchmark,而不是发现能迁移到新任务的通用 Harness 设计原则。
不是”Harness Evolution 没用”,而是”高估了它证明的东西”
公允地说,这篇不是否定 Harness Evolution,是提醒别把证据读过头。
一个重要原因可能来自 benchmark 本身:Terminal Bench 上强模型已经挺能打了,剩下解决不了的更多受模型能力限制,不是 Harness 设计限制。如果底层模型压根不会做某道题,再聪明的 Harness 也没法凭空造出这能力。
但论文那条评测原则,是真该死守的:
任何带搜索、反思、Memory、Self-Improvement 或迭代优化的 Agent 系统,都应该和相同预算下简单的 test-time scaling 做对比。
否则容易出现这种尴尬:一套很复杂的 Agent,多个 Agent、有 Memory、有 Reflection、有 Evaluator,最终 benchmark 提了 5 个点,看起来设计很有效;但把同样的 token 和推理预算给一个最简单的 Agent 让它做五遍,也提 5 个点——那真正带来提升的就不是那套复杂架构,只是模型多试了几次。
Agent 系统越复杂,“用了更多计算”和”算法真的更聪明”这两件事,就越难分清。
自我修改 ≠ 自我改进
上面那盆冷水,引出一个我在 DeepSeek Harness 争议里读到、觉得最有分量的辨析。
Agent 能改自己的 Prompt、能生成新插件、能重写工具,这叫自我修改。但改完之后有三种结果:变好、不变、变坏。
要谈”改进”,就必须有一套独立于修改过程的评价系统:
- 独立的 Evaluator
- 没参与优化的留出任务
- 多次重复实验
- 基线对照
- 版本记录
- Promotion Gate(提升门禁)
- 失败回滚
否则就是自己出题、自己答题、自己评分、自己宣布进步。
这大概是判断一个 RSI 项目真伪最重要的一把尺子。它也能解释为什么我前面把 RSIAgent 的三角色设计看得挺重——它把”批改”独立成 Verifier Agent、且读不到学生私有推理,就是把”自我改进必须借由独立验证者”这条原则落到了工程上。
DSH 争议里还有个洞察:软件可组合 ≠ 行为可组合。
两个插件,软件工程层面接口不冲突就能同时加载;但在行为层面,改文件走终端还是走专用编辑工具?提交由 Git 插件完成还是直接 git commit?两条路径日志一致吗?哪条要审批?终端已提交、Git 插件却没察觉,会不会重复提交?
中间多了一个概率性决策者(模型),一切都不一样了。这也是为什么”工具越多,Agent 反而可能越弱”——每多一个模型可见的工具,就多一套名称、Schema、执行路径、错误类型、副作用,职责一重叠,模型就撞上 Tool Selection Problem。
把这条放进 RSI 语境:RSI 如果只是往动作空间里加东西,很容易越进化越乱。真正的进化应该让系统更会收敛,而不是更会扩张。
那 RSI 和 agent-loop、agent-harness,到底怎么分工?
把三层摆在一起,做这张表——也是这篇文章我觉得最值得留的一张图。
| Agent Loop | Agent Harness | RSI | |
|---|---|---|---|
| 管的时间尺度 | Δt,一次思考—行动—观察 | 一次任务周期 | 跨任务的持续累积 |
| 核心问题 | 模型怎么和世界交互 | 怎么从接任务到交付结果 | 怎么让下一次的自己站在这次经验上 |
| 解决什么 | 让模型会”做” | 让模型”稳定地做完” | 让模型”越做越好” |
| 是否带记忆累积 | 否,单回合失忆 | 部分(任务内上下文),但框架本身不随时间变强 | 是,任务间状态可积累和更新 |
| 是否可进化 | 否(天然固定) | 一般固定,除非套上进化机制 | 是,进化的对象可以是 loop、harness 或 model |
| 代表性东西 | ReAct 循环 | 上下文/记忆/工具/规划/沙盒/多Agent | 参数/记忆/Skill/Harness代码进化 |
| 代价与风险 | 简单但受限 | 设计成本高、异构任务适配差 | 算力消耗大、可能只是”多试几次”、难验证 |
一句话总结,也是我的核心判断:
Loop 管”会不会”,Harness 管”稳不稳”,RSI 管”会不会随时间变强”。RSI 不是 Harness 的替代,是 Harness(连同 Loop、连同 Model)之上叠加的一层”演化机制”。 说”Harness 已死、拥抱 RSI”是营销话术;更准的说法是,RSI 让 Harness 从静态脚手架变成能随时间优化的系统。
《Harness已死,Claude Opus 5.2拥抱RSI》那篇,本质是拿对立当标题博眼球。RSI 没让 Harness 过时——RSI 恰恰建立在 Harness 之上。连 RSIAgent 自己都强调”RSI 和测试时执行用同一个 agent 框架”,它没抛弃 loop 和 harness,只是在外面加了一层”先探索、再沉淀、后复用”的时间调度。
工程落地的五道坎
理解完概念,从工程实际操作的角度,把 RSI 真落地时要跨的几道坎列一遍。这五条不是理论担心,是会真撞上的现实问题。
第一道:验证闭环。没有可靠的 Eval,RSI 会失去方向。
这是最关键的一道。《开启 Benchmark 的 Harness 时代》反复强调:当 AI 走向 RSI,评测不再只是模型外的一把尺子,而会成为改进闭环里关键的反馈环节。
评测奖励什么,能力就朝哪长;评测忽略什么,盲点也可能在循环里越放越大。
一个自己出题自己评分自己宣布进步的系统不是 RSI,是自嗨。想形成闭环,Eval 也得进化成系统——能理解上下文、规划评测、组合技能、调度工具、验证证据,甚至审视自身、发现能力缺口、与被测模型一起进化。
这也是 15 家机构联合发 HarnessEval、要把 Evaluation 也”Harness 化”的原因:从 Metric 到 Harness,从固定 rubric 到可执行工作流,从排行榜数字到透明的 evidence tree(证据树)。
第二道:算力账。进化是要花真金白银的。
DGM 一次完整 SWE-bench 自进化约需两周、token 很高;Harness Evolution 那篇也证明,进化烧掉的推理算力,可能只是换来了”多试几次”的效果。所以任何 RSI 都要回答:这比进化算力,投在”搜更多候选”和”学到能泛化的结构”上,哪个更值? 目前证据偏向……前者有时候更值。
第三道:泛化 vs 适应。进化出了真通用能力,还是只过拟合了这套题?
那 0.6 个百分点的隔离测试集结果,是所有 RSI 团队心里的一根刺。你精心设计的进化,可能只是让系统在训练分布里越来越强,一遇到分布外新任务就原形毕露。区分”学会通用原则”和”记住这套题的套路”,是最难测的问题之一。
第四道:链式进化的错误累积。方向一旦错,越进化越糟。
链式进化(A0→A1→A2…)虽简单,但前一轮错误会被下一轮继承。SkillFlow 甚至发现,表现差的配置容易不断新增相似 Skill 把库搞碎,错误 Skill 还被后续任务沿用。这就是典型的错误被合法化写回——AI 把一次错误推理写进记忆,后续所有查询都被污染。
这跟我说知识库时反复提到的”幻觉回写”是一回事:设计上让 AI 把推理写回库很优雅,可如果推理有偏差,这偏差会被”合法化”写入,后续全被污染。
第五道:责任和可逆性。进化出来的东西跑偏了,怎么回滚?
DSH 那句”卸载插件 ≠ 撤销现实”很扎心:删了文件、改了数据库、推了 Git、发了邮件,卸载插件事情不会消失。RSI 同理——一旦”进化出来的坏 Harness”已经对现实产生影响,你没法简单回退。所以 RSI 系统必须把版本记录、Promotion Gate、失败回滚做进地基,否则就是辆没刹车的车。
未来方向,我的感脚
文章不能停在”RSI 有坑”,那没尽到聊未来的义务。基于读到的材料,加上我自己的工程判断,谈几个我认为可能的方向。
一是从”堆更大的模型”转向”更聪明的 Harness + 经验复用”。
JIT-Agent 提出个我认同的概念:Harness 智能(Harness Intelligence)——构建和优化 Agent 运行脚手架的能力,三个属性:适应性(匹配任务和模型)、可靠性(能执行、失败能修)、进化性(从反馈里生成更强 Harness)。
它证明了一件事:Harness 智能独立于基础模型能力之外、且与之正交。模型强弱,都能通过提升 Harness 智能获益;同一套 Harness 智能也能迁到不同模型生效。DeepSeek-V4-Flash 配 JIT Harness 超越 GPT-5.6,就是正交性的实证。
未来 Agent 能力的增长,不再只靠堆模型参数,而是靠”模型 × 更聪明的 Harness”这个组合。 这跟 RSI 天然契合——RSI 的第一步,往往是让系统学会”更好地组织自己怎么干活”,而不是急着改权重。
二是从”改权重”到”改经验”。免训练的 RSI 会成为主流入口。
RSIAgent 选了一条很务实的路子:不碰权重,只动记忆。这在工程上是巨大优势——免训练意味着可回滚、可审计、可单点修正。 改错一段记忆可以删掉那一段;训练坏权重基本只能认栽。对团队来说,“改经验”的可控性远胜”改权重”。
短期内真正能落地的 RSI,会是”记忆/Skill/Harness 代码进化”这条路,而不是”参数进化”。参数进化更接近 AGI 的终极幻想,但记忆/Skill 进化才是今天能上生产环境的。
三是评测本身会成为 RSI 闭环里的一等公民。
15 家机构联合发 HarnessEval,标志行业开始意识到:没有可靠的 Eval,RSI 会失去方向。 未来评测会从”静态尺子”变成”可规划、可验证、可进化的智能体系统”,能对照、能验证、能追溯,甚至能反过来暴露自身能力缺口。
这对测试工程尤其重要——测试人员的角色,正从”写固定用例”转向”设计 Eval 系统”。
四是从 AOT 到 JIT。Harness 从”提前设计”走向”按任务即时生成”。
JIT-Agent 的另一半价值,是把 Harness 从 AOT(先设计好跑所有任务)推向 JIT(看到任务,当场合成专属 Harness)。
不同任务需求原生不同:工件生产要 DAG 流水线,深度研究要递归委托,广度搜索要并行分支。用一套通用 Harness 硬套,处处平庸。JIT 让模型”任务是什么结构,Harness 就长成什么结构”。
未来生产级 Agent 很可能是”稳定的核心骨架 + 按任务动态调整的模块”,在稳定性和灵活性之间取平衡。 这跟 DSH 争议里那个观察一致——好的 Harness 不是把底层操作全摊给模型,而是替模型吸收掉一部分复杂性。
五是最远、也最有意思的:模型可能最终内化 Harness 智能。
JIT-Agent 的长期展望说得很好:长期看,基础模型本身可能内化 Harness 智能,不再需要单独的元模型来生成 Harness。 模型不但学会在给定架构下执行,还学会按任务特点调整自己的运行架构——实现真正的自我组织、自我进化。
如果方向兑现,那 RSI 就走到了 Loop→Harness→RSI 这个追问的终点:连”怎么组织自己”都变成模型能力的一部分。
other
RSI 展示的是另一种可能:让 AI 在每次尝试后都不再是从零开始的”失忆者”,它会把自己走过的弯路、踩过的坑、试对的参数都记下来,写成自己的”操作手册”,下一次任务直接调用。
相比 Harness 脚手架理论,RSI 确实往前走了一步——它把”经验”变成了 AI 真正可继承的资产。
作为工程师,把注意力放在那些”可验证、可回滚、免训练”的 RSI 实现上——记忆复用、Skill 进化、Harness 代码进化——因为这些今天就能落地,且不绑定单一厂商。
至于”参数内化、模型自我组织、通向 AGI 的下一站”——那是真正的远方,值得作为方向押注,但作为承诺还早得很。
想深挖 RSI,建议从这几份材料入手,也是我写这篇的主要来源:
RSIAgent
- [arXiv 论文]https://arxiv.org/abs/2609.15364
- [GitHub 仓库]https://github.com/AetherLabsAI/RSIAgent)
- [项目主页]https://aetherlabsai.github.io/RSIAgent/
- RSI 分类坐标系:Awesome RSI(
github.com/Prism-Shadow/awesome-rsi) - Harness / Harness Evolution 的冷静质疑:《Harness自进化真的有效吗?提升可能只是「多试了几次」》(arXiv 2607.12227)、《DeepSeek Harness 争议背后的真问题》、《开启Benchmark的Harness时代》
- Harness 智能:JIT-Agent(arXiv 2608.25593)
#RSI #自我进化 #Agent-Harness #Agent-Loop #递归自我改进 #AI工程 #开源