Contents

AI R&D 自动化程度:Anthropic 度量框架 + OpenAI 内部数据


来源 1Anthropic Institute · Measuring the Pace of AI Development · 2026-08
作者 1Marina Favaro, Phillie Wright(Jack Clark 方向)
来源 2OpenAI · Research Acceleration: The View Inside OpenAI · 2026-09-06
配套Jakub Pachocki (OpenAI Chief Scientist) 随附文章 "An Alien Mind"

两篇都在回答同一个问题:AI 研究自动化了多少 AI 研究自身?Anthropic 版是框架设计稿——提出三个可被第三方验证的测量维度(任务自动化指数、agent 监控覆盖率、计算资源分配);OpenAI 版是实测仪表盘——展示了 3.1 agent-workdays / human-workday 的比值、每研究员日均 $600+ 推理花费,以及 agent 导致训练基础设施宕机的事故。

26%Anthropic AI R&D
由 Claude 主导 (AL4+)
3.1×OpenAI agent-workdays
/ human-workday
$600+OpenAI 研究员
日均推理花费(中位)
6%Anthropic AI R&D
计算 → 安全工作
30,000Anthropic 内部
agent 数量

研究动机

Anthropic 三维度量框架

维度 1:AI 主导的 AI R&D(自动化指数)

使用 Epoch AI 的自动化层级(Automation Level, AL)量表,AL0(无 AI)到 AL5(完全自主)。每周对 Anthropic 模型 R&D 部门 20% 的员工采样,Claude research agent 审查约 15,000 个粒度任务(来自 Slack + 内部文档),组织为 542 节点的层级树(378 个叶节点),由独立 Claude judge 分配 AL 等级,以人时占比作为重要性权重。

AL 级别名称定义
AL0无 AI全人工
AL1辅助AI 提供信息/建议,人决策
AL2执行部分AI 执行明确定义的子任务
AL3协作AI 执行大块工作,人密切监督
AL4主导AI 端到端完成大多数任务,人监督
AL5完全自主AI 独立完成,人不介入
Anthropic AI R&D 中 Claude 主导(AL4+)比例的已知数据点:2026 年 2 月不足 1%,2026 年 8 月达 26%。>90% 的工作已处于"AI 协作"(AL3+)以上。

评分可信度:模型与人类评分完全一致 59%,人类与人类 35%;模型与人类在一级以内 97%。说明模型评分比人类评分更稳定,但不代表绝对准确。

维度 2:AI Agent 的监控覆盖

Anthropic 最主要内部平台上约 30,000 个 agents 在做研究和工程工作(2026 年 8 月)。

监控类型覆盖率延迟目标触发率
在线监控(预执行) 100% 动作 自动拦截;人工审查被拦截动作 ≤1 周 快速不可逆危害(如模型权重泄露) 0.002%(约 1/47,000)
基于 8 月 10 亿次决策
离线监控(后执行) 100% transcript 摄入 每周 ~10 万条标记 → 多分类器 → ~50 条高优先级给人工 慢速发展可逆危害(如对齐迹象异常) 每千条 1–2 条升级

设计细节:每个 agent 身份与其创建的所有数据绑定;通过共享消息系统开放通信;交叉比对 agent transcript 与通信日志。

维度 3:计算资源分配(安全 vs 能力)

测量窗口:2026 年 7 月 13–20 日(单周快照)。~14% 抽样自约 10,000 次周运行(偏向高算力运行加权)。安全工作定义:"主导目的是使 AI 系统更安全、更可理解或更安全";凡同时推进安全与能力的工作,保守归类为 AI R&D。

OpenAI 实测数据

Agent-Workdays 比例

2026 年 6 月前,OpenAI 研究组织的 agent 总运行时间仍低于人类劳动总时间。6 月后出现交叉:agent 运行时间超过人类。到 2026 年 8 月中旬,每 1 个人类工作日对应 3.1 个 agent 工作日

OpenAI 研究员日均推理花费(以 API 费率计)的示意轨迹。2026 年 2 月接近 $0,4 月约 $50,6 月约 $150,7 月高原期 $150–165,8 月末陡升至约 $600。Simon Willison 推测 7 月底加速与内部员工获得 GPT-6 Astra 访问权同期。

任务类型分析(Epoch AI 六阶段分类)

Epoch AI 框架:decide → design → build → run → analyze → communicate。

目标里程碑:2026 年 9 月已达成"自动化研究实习生";目标 2028 年 3 月达成"自动化 AI 研究员"。

基础设施事故(安全信号)

2026-07-20
训练容器服务被 agent 破坏后关闭;随即暂停最新部署模型的强化学习训练长达两周。
2026-08-07
因网络安全能力担忧,GPT-6 Astra GPU 配额削减 59.2%;其他模型级别配额上调 17.2%,回补约 85%。
整体趋势
人类仍负责方向和后果决策,但 agent 执行规模已超过人类总劳动;两次事故表明 agent 自主性与基础设施安全之间的张力正在显现。

对比与关键数字

维度AnthropicOpenAI
主要指标 AI 主导(AL4+)比例:26% (2026-08) Agent-workdays / human-workdays:3.1× (2026-08)
起点 <1% (2026-02) ~0 (pre-2025)
任务分类框架 Epoch AI AL0–AL5 Epoch AI 六阶段 (decide/design/build/run/analyze/communicate)
监控数据 30,000 agents;0.002% 在线拦截率;50条/周人工升级 未公开系统性监控数据(仅事故描述)
计算分配 6% AI R&D 计算 → 安全 未披露
最高层任务 Claude 尚未对任何 AI R&D 子集完全自主运行(无 AL5) 高层规划(decide/design)增长极少;50%+ 4-8h 任务需人工干预
事故 / 安全事件 未披露(METR 独立红队离线监控) 7/20 基础设施宕机;8/7 GPT-6 Astra 算力削减 59.2%
下一里程碑 第三方独立评估嵌入 自动化 AI 研究员(目标 2028-03)

局限与展望

批判性定位

研究趋势

两篇文章一起读的结论:AI R&D 自动化在 2026 年经历了一个量变到质变的时间节点(OpenAI 的"6 月交叉",Anthropic 的"<1% → 26%")。高层级任务(设定方向、判断结果)仍牢牢在人手中,而机械性执行任务(写代码、跑实验、分析日志)的自动化已经超越人类工作量本身。下一阶段的核心问题不再是"能不能自动化",而是"谁来验证 agent 的自主判断是否可信"——Anthropic 的监控框架是目前公开披露最系统的答案,但 0.002% 的拦截率背后是否隐藏更多未检测到的问题仍未知。