2026年9月24日,十位研究者提交预印本《Who Holds the Pen? Let Specifications, Not Agents, Sign Off》。他们研究一个在智能体系统中很容易被忽略的环节:同一个模型既执行任务,又判断自己是否满足要求,并决定何时宣布完成。论文从SkillsBench的任务提示、工作区信息和注入式技能说明中提取509条可追溯要求,在七个模型上报告,实际满足这些要求的比例为79.6%至86.4%;智能体声称完成的比例则比官方评测器确认通过的比例高28.7至37.9个百分点。论文提出SpecHarness,把可验证要求编译为带来源的义务,由外部运行时根据合格证据更新状态并允许最终完成。该研究是尚未同行评审的预印本,数字来自作者实验,目前没有公开的独立复现。
这里真正值得讨论的不是模型会不会犯错。任何行动者都可能误报进度。问题是:当AI智能体说“任务已经完成”时,这句话在系统中究竟是什么?它可以是关于世界状态的报告,可以是请求停止执行的信号,也可以被软件直接当作关闭任务的命令。三者具有不同地位。报告可能为真或为假;停止信号可以产生真实的因果效果;但有因果效果,不等于它有权建立“任务完成”这一被接受的状态。
言语行为理论提供了一个直接区分。有些话主要描述已经存在的事实,例如“文件位于指定目录”;有些话在适当制度条件下能够形成新的社会事实,例如有权者宣布会议结束。后一种话不是因为句式像宣告就自动有效。说话者必须具有相应资格,时间、场所和程序必须合适,所要求的前提也必须成立。一个无权者说“会议结束”,可以让旁听者离场,却不能因此使会议在制度上有效结束。
AI的完成声明也有类似结构。智能体输出“完成”可能使编排器停止、界面显示绿色状态或触发下游流程,这说明系统给予了这段输出操作效力。然而,操作效力只是软件设计产生的因果权限。它没有自动证明文件确已保存、测试已经通过、数据未被截断、引用得到核验,或者用户真正接受结果。把停止流程的能力直接当成确立完成事实的权威,就把行动、证据和制度接受压缩成了一个词。
因此,完成不能只被理解为模型内部的一次判断。它是一种关系状态:要求已经明确;相关行动已经发生;现实或工件状态与要求对应;证据来自能够观察该状态的渠道;验证仍然适用于当前版本;有资格的程序或人员接受这些证据。任何一环断裂,“完成”最多是一项有待检验的主张。即使主张碰巧为真,也不能由碰巧正确反推其拥有权威。
这也说明为什么“让另一个模型检查”并不必然解决问题。第二个模型可能独立于执行模型,却仍然依赖同一份不完整日志、同一错误假设或同一不可见环境。独立性、能力和授权是三项不同条件。合格验证者不一定是人,也不一定必须是模型;它可以是确定性测试、文件系统回读、数据库约束、硬件传感器、专业人员或用户验收。关键不在验证者的物种,而在证据渠道是否适合所要确立的状态,以及失败是否能够阻止状态被提交。
从维成论看,Difference首先要求区分任务要求、智能体行动、智能体自我报告、实际环境状态和被系统接受的完成状态。这些项目可以相互对应,却不能被视为同一件事。Constraint不是一般意义上的限制,而是规定哪些证据可进入判断、谁能更新状态、何时必须重新验证的形成条件。Sustained Coherence则要求规范、行动、证据和接受之间的对应关系在执行、修改、回读和最终提交中持续维持。一次“完成了”的输出没有这种持续结构。
论文提出的外部运行时正是在技术上建立这种差异。不过,外部化也不能被浪漫化。论文明确把难以验证、主观、冲突或缺少合格证据提供者的要求保留为建议性内容;其硬性机制只覆盖有来源、可观察并可验证的要求。一个验证器也可能写错,一个制度也可能把权限授予不合格的角色。把权威移出模型只是建立了可检查的边界,并没有保证边界另一侧永远正确。
我的判断是,AI智能体的完成声明应被默认理解为“请求结案”,而不是“结案已经成立”。在低风险、主观或探索性任务中,用户可以把这种请求直接接受为完成;在涉及文件、交易、医疗、公共决策或其他高后果状态时,接受应取决于与任务相称的证据和权限结构。人的点击也不是天然权威:如果人看不到关键状态、没有能力复核或只能形式化确认,人工接受同样可能只是另一个未经支持的完成声明。
这个判断并不要求每项工作都建立庞大的审计系统,也不否认模型可以准确评价自己的输出。它只限定一个概念边界:自我评价可以是证据,不能仅凭自身成为最终依据;完成声明可以启动验证,不能单独制造完成事实。仍待解决的问题包括如何为开放式和价值判断型任务定义适当证据,如何在验证成本与风险之间取得比例,以及谁有资格为不同类型的任务设定完成条件。现有预印本提供了一个可测试的工程方案,但这些制度性问题不能由一次基准实验决定。
参考资料
Haiqing Li等,《Who Holds the Pen? Let Specifications, Not Agents, Sign Off》,预印本,2026年9月24日。https://arxiv.org/abs/2609.29921
Xiangyi Li等,《SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks》,预印本,2026年2月13日。https://arxiv.org/abs/2602.12670
Stanford Encyclopedia of Philosophy,《Speech Acts》,2020年9月24日修订。https://plato.stanford.edu/entries/speech-acts/
Stanford Encyclopedia of Philosophy,《Social Institutions》,2024年修订版。https://plato.stanford.edu/entries/social-institutions/
了解 Geoffrey Chen 的更多信息
订阅后即可通过电子邮件收到最新文章。