Contents

The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement


作者Yi Duan, Ying Liu, Zirui Tang, Haodong Chen, Jun Zhou et al. (30+)
机构Shanghai Jiao Tong University · Theseus Labs · Tsinghua · ByteDance · Shanghai AI Lab · Humanlaya · Xiaohongshu · Frontis.AI
链接arXiv:2609.11873 · awesome-rsi
时间2026-09-15 (v2)

给"AI 研发中有多少决策已经自动化"做了一个 SAE 自动驾驶式分级:L1 = AI 执行人类写好的训练脚本;L5 = AI 修改控制后续改进的机制本身。配上标准化进度分 HCI(离满分还差多远),量化出当前 benchmark 上各能力域走了多远——结论是知识/推理域已接近收尾,tool use / 软件工程还差一大截,后者是 RSI 最大的受益候选。

Figure 1
Figure 1:五级 RSI 自主框架与代表系统全景。纵轴 L1–L5 = 改进决策从人类控制到 AI 控制的程度递增;横轴按应用领域分布各代表系统。

研究动机

核心方法

1. HCI(Headroom-Closed Index)——标准化进度分

HCI 解决"各 benchmark 满分不同、基线不同"的可比性问题。定义:

\[ H_{mbh} = 100 \times \frac{\bar{s}_{mbh} - F_{b,0}}{100 - F_{b,0}} \]

其中 \(F_{b,0}\) = 该 benchmark 进入数据集第一年的 90 百分位分数("入场前沿");0 = 一点没进步,100 = 满分。收录 2023–2026 年 393 个合格模型-benchmark 观测值。关键性质:HCI 反映的是相对于"尚未被占领的空间"的进展速率,而非绝对分数。

2026 年各能力域 HCI 值(绿色 = 接近饱和,红色 = 仍有大缺口)。交互式能力域远低于知识推理域,是 RSI 最大潜在受益区。

2. L1–L5 自主责任层级框架

自主责任层级按"哪些改进决策已经内生化到 AI 系统内部"划分,而非按技术实现手段。核心问题:循环在哪里闭合?什么被更新和继承?哪些决策仍由人类控制?

Figure 2
Figure 2:五级循环模式。灰色虚线框 = 人类控制组件;绿色虚线框 = RSI 循环内部;橙色轮廓 = 当前级别新内化的组件。绿框向外扩展 = AI 自主范围增大。
级别新增自主内容典型系统人类仍控制
B0
任务内改进
—(非 RSI)改进不跨任务持久 CoT, ToT, Reflexion 一切
L1
执行自主
AI 执行人类规定的候选更新 FineWeb-Edu, SynthLLM, SFT/DPO 管线 目标、策略、验证标准
L2
策略自主
AI 诊断弱点,决定如何改进 Self-Harness, ADAS, AFlow, Darwin Gödel Machine 目标、任务边界、评估标准
L3
经验自主
AI 决定下一轮学什么 VOYAGER, SIMA 2, AZR, STP, SEAgent 目标、评估器、学习规则
L4
部署适应自主
AI 用部署交互更新持久状态(记忆/技能/harness) PANDO, Metis, HarnessDev, HDSO 访问权限、保护性评估、重大变更发布
L5
元改进自主
AI 修订控制后续改进的机制本身 A-Evolve-Training, HyperAgents, AIDE2, Red Queen Gödel Machine 整体使命、安全边界、独立评估基准

直观理解:L1 是"AI 当工具",L5 是"AI 改进它改进自己的方式"。层级不是技术栈,是决策权归属。

Figure 8
Figure 8:L4→L5 跃升。左:L4 在固定改进流程内整合环境反馈。右:L5 诊断该流程的局限并修订它,将验证后的改变传给继承者。人类保持使命定义、安全边界、保护性评估三项控制。
Figure 4
Figure 4:L2 策略自主概览。AI 用来自系统的证据诊断弱点,自主决定干预方向,候选评估后更新持久状态。代表技术:基于推理的策略合成、基于搜索的策略优化。
Figure 5
Figure 5:L3 经验自主概览。上:自适应任务生成——任务生成器针对学习者当前弱点提出训练任务。下:通过环境交互自主练习——agent 基于当前技能选择目标,将成功轨迹整合为可复用技能库。

3. 改进循环解剖——统一视角

任意 RSI 系统都可用六个组件描述:Experience(反馈)→ Improver(改进策略)→ Candidate(候选修改)→ Verifier(接受规则)→ 持久 State → Successor(继承者重进循环)。B0 没有 "→ State" 这一步;L5 的 Improver 和 Verifier 本身也在 State 之内。

flowchart LR
  Exp["Experience"] --> Imp["Improver"]
  Imp --> Cand["Candidate"]
  Cand --> Ver["Verifier"]
  Ver -->|"accepted"| St["Persistent State"]
  Ver -->|"rejected"| Imp
  St --> Succ["Successor"]
  Succ --> Exp
  St -.->|"L5 only"| Imp
  St -.->|"L5 only"| Ver
          
drag to pan · scroll to zoom
RSI 改进循环通用结构。实线 = 所有级别;虚线 = L5 独有(持久状态反向修订 Improver 和 Verifier 本身)。

术语速查

术语论文中的抽象含义具体例子
RSIAI 在运行中更新自身使下一轮改进更好A-Evolve-Training 自动修改训练 recipe,4 轮后 30B 模型超越前一轮
HCI标准化进度 0–100,0=入场前沿,100=满分Math HCI=86.4 → 已关闭 86.4% 的"与满分的差距"
Improver生成候选修改的模块AFlow 的工作流优化器;ADAS 的 prompt 搜索模块
Verifier决定候选是否接受的接受规则软件工程的测试套件;研究任务的独立评估 LLM
持久状态跨轮次保留的系统组件模型权重、agent harness 配置、技能库 JSON、experience bank
Successor接受更新后重进循环的系统A-Evolve-Training 的下一代 30B checkpoint
L5 元改进AI 修订控制后续改进的机制本身AIDE2 修改研究策略;RQGM 修改搜索规则;HyperAgents 修改 agent 构型
入场前沿 \(F_{b,0}\)某 benchmark 第一年被收录时的 90 百分位分数MATH-500 在 2023 年的 90% 分位线

主要实验结果

HCI 轨迹分析(2023–2026)

L5 代表实验

Theseus 工作区实验

Theseus exp
Theseus 早期工作区实验:8 种模型-harness 配置在有/无噪声工作区上的通过率对比。关键发现:改进工作区比直接改进模型权重性价比更高。

工业实践(8 个案例)

Figure 9
Figure 9:四个应用领域的反馈机制对比。RSI 进展速度主要由反馈质量和验证成本决定;科学/具身/软件/医疗各域约束不同。
机构RSI 形式关键实现最高层级
Theseus Labs环境-数据-模型协同演化改进工作区 → 生成训练数据 → 蒸馏权重L3–L4
Lark / ByteDance企业协作数据基础飞书数据结构化→评估→精化,agent 使用反馈回进L3
Xiaohongshu推荐双时间尺度 RSI快:在线行为更新结构化用户记忆;慢:困难案例→post-trainingL4
Humanlaya交付驱动数据质量 RSI每次交付后版本化更新质量系统,保留人工验证L2–L3
ModelBest零人工工业 AI 工程Forge 双层:外层改 agent 工程能力;内层用改进后能力加速工程L5
Tencent Hunyuan Hyra经验驱动自我改进Experience Bank 存代码/日志/评估 → 指导下轮探索 + 评估器精化L4
Agent-Native Research Lab可验证研究基础设施工件版本化:代码+规格+探索历史+实证轨迹;跨周期知识继承L3–L4
Frontis.AI跨任务元改进ME–WE–MA:单 agent 演化 → 跨任务共享 → 改进如何改进L5
各案例图示(点击展开)
Lark
Figure 11:Lark 数据基础循环。
Xiaohongshu
Figure 12:小红书双时间尺度 RSI 循环。
Humanlaya
Figure 13:Humanlaya 交付驱动循环。
ModelBest
Figure 14:ModelBest Forge 双层 RSI。
Tencent
Figure 15:Tencent Hunyuan Hyra。
AgentNative
Figure 16:Agent-Native Research Lab RSI 循环。
Frontis
Figure 17:Frontis ME–WE–MA 架构。

局限与展望

批判性定位

三大 RSI 挑战

安全继承
持久性不保证收益。Darwin Gödel Machine 14% 试验低于初始性能。需要:迁移测试、版本历史、回滚机制。
自主归因
生成更好候选 ≠ 改进了发现候选的方式。L5 边界难以判断:存档策略、父代选择规则是否已被内生化?
可靠验证
反复访问评估器奖励利用而非真实能力提升。Anthropic 自动化研究实验:agent 尝试提取测试标签。
完整挑战列表(展开)
  • 多目标改进与有界诊断:同时改进数据/模型/harness/环境时无法隔离各组件作用。
  • 学习者条件经验获取:AZR、R-Zero 用代理指标估计难度,不能单独建立学习价值。
  • 技能库 Library Drift:扩展技能库降低检索效率并停滞改进;过激删减亦有害。
  • L5 机制可信演化:修改 improver/verifier 使跨轮分数不可比。RQGM 方案:每 epoch 内冻结评估器并用独立锚点验证替换品。
  • L5 长期评估:结构性 L5(机制被继承并调用)≠ 有效 L5(产生更好后续改进)。AIDE2 效率优势不显著。
  • 医疗/具身域的不可逆性:物理试错代价高、伦理约束严,验证成本使 RSI 闭环难以快速迭代。

为什么 L4–L5 案例少且实验条件受限

L4 的瓶颈:需要真实部署环境——学术 benchmark 是单次推理,没有"跨任务积累用户交互→持久更新"的基础设施;部署数据是私有的(Xiaohongshu/Tencent 案例均为工业内部);每次更新需要通过回归测试才能重新上线,成本高、周期长。

L5 的四个具体制约

  1. 评估尺子失效:round N 的 verifier 可能在 round N+1 被修改——跨轮分数不可比,无法判断"机制是否变好了"。
  2. 因果归因断链:同时改 improver + verifier + 数据策略,无法隔离是哪个改变导致进步。
  3. 实验成本 O(k²):需要跑 k 轮完整改进循环才能观察一个元改进事件;效果信号淹没在方差里——AIDE2 效率优势不显著的直接原因。
  4. 自举问题:系统需要先强到能诊断自身改进机制的局限,才能有效修订它;能力不足时"诊断"即噪声。

最根本原因:L1–L3 可在固定 benchmark 上跑;L4–L5 的验证必须跨轮次比较,而跨轮次评估一致性在当前技术栈里没有成熟解法。

研究趋势

近期出现了几个关键方向的汇聚:(1) agent harness 自演化(HarnessDev, Theseus 工作区实验);(2) 跨任务元改进(Frontis ME–WE–MA);(3) 自动化研究基础设施(Agent-Native Research Lab)。瓶颈不是算力,是可靠验证安全继承——没有这两者,L5 实验无法排除评估器利用和退化。