Anthropic 在 9 月 17 日公开了内部 AI 研发(R&D)的量化数据,这标志着“递归自我改进”(RSI)从理论概念进入了工程现实。
截至 8 月,Claude 主导的研发工作占比从 2 月份的不到 1% 涨到了 26%。公司内部平台在任何时刻运行着约 30,000 个 Agent,这些代理在 8 月份共同做出了超过 10 亿次决策。
Anthropic 依据 Epoch AI 的六级自动化框架(AL0-AL5)对研发工作进行了分级。目前,26% 的工作处于 AL4 级别(AI 驱动,人类负责目标与验收),超过 90% 的工作处于 AL3 级别(AI 协作,人类主导)。截至 8 月,没有任何研发工作达到 AL5(完全自主)级别。
当夜间数据管道故障时,工程师向 Claude 发送报告并指令“修复”,模型会自动执行查日志、定位原因、写代码、测试、处理新问题、重跑管道、对比结果并生成解释报告的全流程。
安全监控采用“线上 + 离线”双重机制。线上监控要求所有行动必须通过拦截,8 月超 10 亿次决策中,约 0.002% 被系统直接阻断。离线监控每周标记约 10 万条对话记录,经误报过滤和初步审查后,约 50 条最高优先级的记录升级至人工复审。
算力分配上,7 月样本周中,约 6% 的研发算力专门投入安全研究。若仅统计"AI 驱动型研发”(AL4 及以上),该比例上升至约 12%。
Anthropic 将数据置于首位,通过公开研发自动化比率、Agent 规模、算力投入比及安全监控覆盖率,建立行业基准。
其他巨头也在跟进 RSI 概念。智普 AI 的 GLM-5.3-Flash 驱动的基础设施代理在两周内完成了国内加速器的全面部署,但完整的 RSI 尚远,目前处于“模型优化系统”与“服务模型”的循环迭代阶段。
OpenAI 宣布实现了自动化 AI 研究实习生,计划在 2028 年 3 月实现完全自动化的 AI 研究人员。目前最大短板是“决定做什么”,当任务超过 4 小时时,仍需频繁人工干预。
Google DeepMind 采用 AlphaEvolve 的算法进化方法,其电路设计方案已集成至下一代 TPU。Google 前首席科学家 Jeff Dean 称其为“用 TPU 大脑设计下一代 TPU 躯体”。
资本层面,DeepMind 首席战略官 Jagjeet Saini 指出,RSI 正成为 AI 资本支出(CapEx)的核心投资逻辑。尽管当前 AI 产生的收入尚不足以支撑巨额的资本投入,但若不押注 RSI 将被视为不明智之举。
Anthropic 此次公布详实数据,旨在通过透明化倒逼行业进步。未来竞争中,无法提供同样透明数据的企业,可能被指控有意隐瞒信息,从而面临声誉与市场风险。
