AI哲学观察|参与制造后继模型不等于已经自我改进

Anthropic在2026年9月17日公布了一组衡量前沿模型研发自动化程度的内部指标。公司从7月的工作记录中整理出约一万五千项细分任务,再把它们组织成固定的研发任务树,并采用Epoch AI提出的六级自动化尺度评估Claude承担工作的程度。截至8月,Claude被评为在26%的研发工作中“主导”:它可以从高层提示出发完成任务的大部分环节,但仍由人监督。超过90%的研发工作至少达到人与AI“协作”的层级。Anthropic同时明确说,在任何被测研发子集中,Claude都没有达到完全自主。

Reuters和Associated Press分别核验了这次披露及其主要数字。披露仍有清楚边界:任务分类、证据整理和初步评级大量使用Claude本身;模型与人的评级完全一致率为59%,在一个等级以内的一致率为97%;不同实验室还没有共同的方法,第三方核验也只是计划中的下一步。因此,这些数字是有方法说明的开发者测量,不是已经独立复现的行业尺度。

Anthropic把递归自我改进定义为“一个模型完全自主地制造其后继者”。这一定义提出了真正值得讨论的问题:如果当前模型已经参与设计、调试、评测和训练下一代模型,我们是否已经看到AI在“改进自己”?

这里至少有四件事不能混在一起。第一是研发贡献:模型对代码、实验、分析或评测产生了实际因果作用。第二是技术谱系的改进:一个组织利用当前模型制造能力更强的后继模型。第三是操作意义上的自主改进:系统能够发现改进需要、选择目标、实施修改、检验结果并决定是否部署,不再依赖人逐项发起和授权。第四是主体意义上的自我改进:某个持续存在的主体把后继状态理解为自己的变化,并在跨时记忆、目标和规范承诺中维持这种自我关系。

Anthropic的资料强力支持第一项,也支持第二项正在扩大,却没有证明第三项已经完成,更没有直接触及第四项。Claude“主导”一项任务,仍以人的高层提示为起点,由人监督,最终部署权也没有转移。更重要的是,参与研发的Claude实例、被研究的现有模型、承担监控的系统、训练流水线和最后产生的后继模型不是同一个对象。它们可以构成一个因果闭环,却不能因为闭环中多处都使用了“Claude”这个名称,就被视为一个对象在修改自己。

个人同一性哲学长期区分因果连续、心理连续和数值同一。一个后继者继承前一系统的代码、数据或行为倾向,可以形成谱系连续;但继承关系本身不能回答它们是否是同一个主体。对当前AI更稳妥的说法是:模型版本之间存在工程继承,运行实例之间存在有限的信息传递,研发组织把这些关系连接成持续的生产过程。这里的连续性首先属于技术系统和组织流程,而不是已经得到证明的机器主体。

这一区分不是为了淡化技术变化。恰恰相反,把所有现象都叫作“自我改进”,会使真正需要测量的变化变得模糊。一个研发流程即使没有任何主体性的“自我”,仍可能形成越来越快的能力反馈:当前模型提高研发速度,研发产出又提高后继模型能力,后继模型再进入下一轮研发。风险来自循环的速度、范围、可审查性和人类能否中断它,并不以系统先成为有体验的主体为条件。

从维成论看,Difference首先要求把当前模型、代理实例、研发任务、训练流水线、部署机构和后继模型区分开来。只有对象可区分,因果关系和身份主张才不会互相替代。Constraint则包括高层提示、工具权限、算力分配、监控规则、测试门槛、发布决定和人工否决权;这些条件决定研发循环能以哪些方式形成,也决定“自主”一词可以合理延伸到哪里。Sustained Coherence不是一次任务完成或一个百分比,而是研发目标、修改、验证、部署和失败校正能否在多轮反馈中保持可追踪的结构一致。

据此,我的判断是:现有证据足以说,Anthropic内部已经形成显著的AI加速型递归研发循环;但它还不是开发者自己所定义的、由模型完全自主制造后继者的递归自我改进。更不能从研发循环直接推导出一个具有持续自我关系的机器主体。这里的“自我”目前主要指技术谱系和组织生产系统的回指结构,而不是已经确立的主体身份。

未来若要支持更强判断,需要看到系统不仅完成被交付的研发任务,还能持续发现改进问题、提出并比较目标、取得所需资源、修改关键组件、独立验证副作用、决定采用或撤回变更,并让这些决定在版本之间保持可审计的连续关系。即使这些条件出现,它们首先证明的仍是操作自主性和递归控制结构;是否存在体验、主体连续性或道德地位,依然需要另外的证据和论证。

参考资料
https://www.anthropic.com/institute/measuring-pace-of-ai-development
https://www.reuters.com/business/anthropic-says-claude-now-leads-quarter-work-building-its-next-ai-models-2026-09-17/
https://apnews.com/article/anthropic-claude-ai-model-self-improvement-4d3a7430f57cbc7c39e1c5f2b7d7e132
https://plato.stanford.edu/entries/identity-personal/


了解 Geoffrey Chen 的更多信息

订阅后即可通过电子邮件收到最新文章。