Anthropic 首次公开了团队 "内部仪表盘",用三组可量化指标让外界看清:AI 在多大程度上已经在自己研发自己、安全监督是否跟得上、以及算力到底花在了哪里。
核心数据:截至 2026.07,Claude 已经能主导 Anthropic 内部 26% 的 AI 研发工作,超过 90% 的研发工作有 AI 深度参与,但距离完全自主(AL5)仍有明确距离;任一时刻都有 30000 个智能体在同时做研发和工程工作;投入 AI 研发的算力中约 6% 用于安全工作。
https://anthropic.com/institute/measuring-pace-of-ai-development
# 三组指标:各回答一个关键问题
1. 研发自动化指数:“离递归自我改进还有多远?”
方法:2026 年 7 月每周抽取 20% 研发人员的工作,汇总出约 15,000 个具体任务,组织成 542 个节点的任务树,由 Claude 按照 Epoch AI 的 AL0–AL5 标准逐项评级,再按人力时间投入加权。
结果:
· 26% 的研发工作已达到 AL4(AI 主导)——即人类给出高层指令,AI 端到端完成大部分工作,人只做监督;
· 90% 以上达到 AL3 及以上(AI 深度协作或主导);
· 没有任何工作子集达到 AL5(完全自主,无人参与闭环)。
整份报告最核心的数字。它意味着“AI 参与 AI 研发”已经是常态;但“AI 完全自主建造下一代模型”这一递归自我改进的临界点尚未到来。26% 这个基线一旦建立,未来各期数字的变化就是观察加速度的直接窗口。
2. 智能体监督指标:“安全护栏是否跟上了规模?”
Anthropic 内部最常用的平台上,任一时刻约有 30000 个智能体在同时做研发和工程工作。
监督分两道防线:
· 在线监控(事前拦截):100% 的智能体动作在执行前经过在线监控,通常几秒内完成。2026 年 8 月分析了超过 10 亿次决策,拦截率仅 0.002%(约 4.7 万分之一),被拦截的多是快速且不可逆的危害,典型例子是“智能体外传模型权重”。被拦截动作由人工在一周内复核。
· 离线监控(事后审计):每周约 10 万份对话记录被标记(约千分之一到二),绝大多数由分类器处理,最终约 50 份/周升级到人工审查,目标是捕捉缓慢累积、可逆的信号,如模型失准(misalignment)迹象。
拦截率极低可以有两种读法:либо 系统确实良好,либо 监控过于宽松。报告自己点出了关键风险:在数万智能体的规模下,“罕见”事件也会经常发生。这套监督体系只有几个月历史,其有效性仍需时间检验。
3. 算力分配:“资源到底投给了安全还是能力?”
对 2026 年 7 月 13–20 日一周内全部约 1w 次算力任务进行分类:投入 AI 研发的算力中约 6% 用于安全工作;若只看“AI 驱动的 AI 研发”部分,安全占比约 12%(均为保守估计)。
这是三个指标中最“硬核”的一个:算力是最难造假、最可核验的研发投入。6% 这个数字本身见仁见智,但方法论的价值在于:未来可以据此做跨实验室比较、设定安全算力承诺比例,甚至对“用于 AI 研发智能体的算力份额”设限。