给"AI 研发中有多少决策已经自动化"做了一个 SAE 自动驾驶式分级:L1 = AI 执行人类写好的训练脚本;L5 = AI 修改控制后续改进的机制本身。配上标准化进度分 HCI(离满分还差多远),量化出当前 benchmark 上各能力域走了多远——结论是知识/推理域已接近收尾,tool use / 软件工程还差一大截,后者是 RSI 最大的受益候选。
HCI 解决"各 benchmark 满分不同、基线不同"的可比性问题。定义:
\[ H_{mbh} = 100 \times \frac{\bar{s}_{mbh} - F_{b,0}}{100 - F_{b,0}} \]
其中 \(F_{b,0}\) = 该 benchmark 进入数据集第一年的 90 百分位分数("入场前沿");0 = 一点没进步,100 = 满分。收录 2023–2026 年 393 个合格模型-benchmark 观测值。关键性质:HCI 反映的是相对于"尚未被占领的空间"的进展速率,而非绝对分数。
自主责任层级按"哪些改进决策已经内生化到 AI 系统内部"划分,而非按技术实现手段。核心问题:循环在哪里闭合?什么被更新和继承?哪些决策仍由人类控制?
| 级别 | 新增自主内容 | 典型系统 | 人类仍控制 |
|---|---|---|---|
| B0 任务内改进 |
—(非 RSI)改进不跨任务持久 | CoT, ToT, Reflexion | 一切 |
| L1 执行自主 |
AI 执行人类规定的候选更新 | FineWeb-Edu, SynthLLM, SFT/DPO 管线 | 目标、策略、验证标准 |
| L2 策略自主 |
AI 诊断弱点,决定如何改进 | Self-Harness, ADAS, AFlow, Darwin Gödel Machine | 目标、任务边界、评估标准 |
| L3 经验自主 |
AI 决定下一轮学什么 | VOYAGER, SIMA 2, AZR, STP, SEAgent | 目标、评估器、学习规则 |
| L4 部署适应自主 |
AI 用部署交互更新持久状态(记忆/技能/harness) | PANDO, Metis, HarnessDev, HDSO | 访问权限、保护性评估、重大变更发布 |
| L5 元改进自主 |
AI 修订控制后续改进的机制本身 | A-Evolve-Training, HyperAgents, AIDE2, Red Queen Gödel Machine | 整体使命、安全边界、独立评估基准 |
直观理解:L1 是"AI 当工具",L5 是"AI 改进它改进自己的方式"。层级不是技术栈,是决策权归属。
任意 RSI 系统都可用六个组件描述:Experience(反馈)→ Improver(改进策略)→ Candidate(候选修改)→ Verifier(接受规则)→ 持久 State → Successor(继承者重进循环)。B0 没有 "→ State" 这一步;L5 的 Improver 和 Verifier 本身也在 State 之内。
flowchart LR
Exp["Experience"] --> Imp["Improver"]
Imp --> Cand["Candidate"]
Cand --> Ver["Verifier"]
Ver -->|"accepted"| St["Persistent State"]
Ver -->|"rejected"| Imp
St --> Succ["Successor"]
Succ --> Exp
St -.->|"L5 only"| Imp
St -.->|"L5 only"| Ver
| 术语 | 论文中的抽象含义 | 具体例子 |
|---|---|---|
| RSI | AI 在运行中更新自身使下一轮改进更好 | A-Evolve-Training 自动修改训练 recipe,4 轮后 30B 模型超越前一轮 |
| HCI | 标准化进度 0–100,0=入场前沿,100=满分 | Math HCI=86.4 → 已关闭 86.4% 的"与满分的差距" |
| Improver | 生成候选修改的模块 | AFlow 的工作流优化器;ADAS 的 prompt 搜索模块 |
| Verifier | 决定候选是否接受的接受规则 | 软件工程的测试套件;研究任务的独立评估 LLM |
| 持久状态 | 跨轮次保留的系统组件 | 模型权重、agent harness 配置、技能库 JSON、experience bank |
| Successor | 接受更新后重进循环的系统 | A-Evolve-Training 的下一代 30B checkpoint |
| L5 元改进 | AI 修订控制后续改进的机制本身 | AIDE2 修改研究策略;RQGM 修改搜索规则;HyperAgents 修改 agent 构型 |
| 入场前沿 \(F_{b,0}\) | 某 benchmark 第一年被收录时的 90 百分位分数 | MATH-500 在 2023 年的 90% 分位线 |
| 机构 | RSI 形式 | 关键实现 | 最高层级 |
|---|---|---|---|
| Theseus Labs | 环境-数据-模型协同演化 | 改进工作区 → 生成训练数据 → 蒸馏权重 | L3–L4 |
| Lark / ByteDance | 企业协作数据基础 | 飞书数据结构化→评估→精化,agent 使用反馈回进 | L3 |
| Xiaohongshu | 推荐双时间尺度 RSI | 快:在线行为更新结构化用户记忆;慢:困难案例→post-training | L4 |
| Humanlaya | 交付驱动数据质量 RSI | 每次交付后版本化更新质量系统,保留人工验证 | L2–L3 |
| ModelBest | 零人工工业 AI 工程 | Forge 双层:外层改 agent 工程能力;内层用改进后能力加速工程 | L5 |
| Tencent Hunyuan Hyra | 经验驱动自我改进 | Experience Bank 存代码/日志/评估 → 指导下轮探索 + 评估器精化 | L4 |
| Agent-Native Research Lab | 可验证研究基础设施 | 工件版本化:代码+规格+探索历史+实证轨迹;跨周期知识继承 | L3–L4 |
| Frontis.AI | 跨任务元改进 | ME–WE–MA:单 agent 演化 → 跨任务共享 → 改进如何改进 | L5 |
L4 的瓶颈:需要真实部署环境——学术 benchmark 是单次推理,没有"跨任务积累用户交互→持久更新"的基础设施;部署数据是私有的(Xiaohongshu/Tencent 案例均为工业内部);每次更新需要通过回归测试才能重新上线,成本高、周期长。
L5 的四个具体制约:
最根本原因:L1–L3 可在固定 benchmark 上跑;L4–L5 的验证必须跨轮次比较,而跨轮次评估一致性在当前技术栈里没有成熟解法。
近期出现了几个关键方向的汇聚:(1) agent harness 自演化(HarnessDev, Theseus 工作区实验);(2) 跨任务元改进(Frontis ME–WE–MA);(3) 自动化研究基础设施(Agent-Native Research Lab)。瓶颈不是算力,是可靠验证和安全继承——没有这两者,L5 实验无法排除评估器利用和退化。