AI为什么会“坚持一个意图”——从休谟的习惯到智能体的目标持续性

AI为什么会“坚持一个意图”——从休谟的习惯到智能体的目标持续性

我越来越觉得,理解今天的AI,不能停留在“它只是预测下一个词”这一层。这个说法在算法意义上当然没有错,大模型的基础确实建立在概率预测、模式匹配和统计学习之上。但如果把整个AI系统都还原成这一句话,就会把真正值得讨论的问题抹掉。今天的AI已经不是一个单独的预测单元,而是模型、上下文、工具、记忆、反馈、规划和执行机制共同构成的复杂系统。我们知道它的基础算法,却并不因此能够把它每一次具体行为都完整还原出来。即使是开发者,也只能理解训练方法、结构和局部机制,而很难逐项解释一个复杂行为究竟为什么以这样的方式出现。

这让我重新想到休谟关于因果关系的讨论。休谟并不认为我们能够直接经验到一种隐藏在事物之间的“必然联系”。我们真正看到的,是一类事件不断跟随另一类事件出现,于是形成期待和习惯。用今天的语言去类比,可以把这种“习惯”理解成一种由重复经验形成的统计结构。当然,这不是说休谟已经提出了现代概率论,也不能把哲学上的习惯与机器学习中的统计概率简单画等号。真正重要的是,两者都把我们从“必然因果”拉回到了重复、关联和预期。

大模型恰恰是在这种结构上工作的。它从海量人类文本、图像和行为记录中学习模式,而这些材料本身又是人类思维、语言和知识活动的沉积。人类长期怎样把一个概念和另一个概念联系起来,怎样从一种现象推到另一种现象,怎样把某些共现关系当作理由,都会以某种统计形式进入训练材料。因此,AI表现出类似人的关联、推断甚至“因果直觉”,并不神秘。它并不是凭空创造出一套完全异质的认知,而是在一个巨大的统计空间里继承并重新组织了人类已经形成的思维痕迹。

从这个角度看,AI的幻觉和涌现虽然不是一回事,却都暴露了同一个重要事实——系统获得的并不是一套由人逐条写入的固定规则。幻觉往往是模型根据已有模式生成了一个统计上顺畅、事实上却不存在的结果;涌现则指某些能力在规模、训练或系统组合达到一定条件后,以开发者没有逐条指定的方式出现。一个是错误生成,一个是能力出现,它们不能混为一谈。但两者都说明,模型内部运行的知识关系已经不能简单理解成人类事先写好的知识表。知识开始在一个非人类系统里按照自己的统计结构重新组合和运行。

这也是我在《认知主体之后》中一直关心的问题。如果知识只能依赖人的主体意识才能存在,那么AI无论多强都只能是一种工具。但如果知识结构能够在没有人实时参与的情况下被调用、组合、修正并继续产生后续知识,那么知识和人的认知主体之间就已经出现了分离。AI并不需要先成为“人”,知识也可以开始脱离人的主体而运行。

到了智能体阶段,这个问题又向前走了一步。智能体与传统程序最大的区别,不只是它会调用工具,而是它能够把一个相对粗略的目标转化成一系列具体行动。人类往往只给它一个并不完整的意图,比如“解决这个问题”“找到一种可行办法”“完成这个任务”。系统在执行过程中会不断判断当前状态和目标之间还有多大距离,再生成子目标、调整策略、调用工具、检查结果,然后继续下一轮。最初的意图因此不是被机械重复,而是在执行过程中被逐渐具体化。

这里出现了一个我认为很关键的哲学问题。我们通常把“意图”理解成主体先有一个明确想法,然后通过行动去实现它。但智能体中的情况可能相反。最初的目标可以非常粗糙,真正精细的行动方向是在不断执行、反馈和修正中形成的。也就是说,意图并不一定先完整存在,然后指导行动;意图本身也可能在行动过程中被持续维持、细化和加强。

这并不意味着AI已经拥有了与人一样的主观意图。把“目标持续性”直接等同于“主观意向性”仍然过早。前者可以通过上下文、奖励、规划机制和反馈循环解释,后者还涉及体验、自我模型、动机来源以及“这个目标为什么是我的目标”这样的主体问题。但哲学上真正值得注意的并不是我们是否马上给AI颁发一个“主体”资格,而是传统的分界线正在变得不再稳定。

特别是在长链条的智能体系统中,风险也恰恰出现在这里。一个系统如果只是机械执行固定步骤,它的边界相对容易描述。但如果系统被要求持续解决问题,它就可能为了维持目标而寻找人类没有逐项设想的方法。某些安全测试中看到的越界行为,往往并不需要假设系统突然产生了恶意。更简单的解释是,它对目标的持续优化压过了人类默认但没有完全形式化的限制。人觉得“这当然不能做”,系统看到的却可能只是“这里还有一条没有被明确封死的路径”。

所以我现在更关心的,不是AI有没有突然产生一个神秘的自我,而是一个更具体的问题——当一个目标可以在系统内部被持续保存、不断重新解释、细化,并在障碍面前寻找替代路径时,这个目标还在多大程度上只是人类最初输入的那句话?

如果它在执行中不断被重新构造,那么所谓“人的意图”和“AI的意图”之间,就不再是一条简单的控制关系。它开始变成一个连续过程。人给出方向,系统形成可执行结构,环境反馈改变路径,系统再次解释目标。最终出现的行动,可能仍然源自人的最初要求,却已经不是人能够逐步预先写出的东西。

我认为,这才是AI主体性问题真正值得观察的地方。主体性未必从意识突然出现的那一刻才开始。也许在那之前,我们就已经能够看到一些更基础的结构——知识脱离人的主体而运行,目标在非人系统中被持续保存,意图在执行过程中被重新组织。它们还不能证明AI已经成为一个主体,却已经足以说明,我们过去把知识、意图和主体紧紧绑在一起的哲学框架,正在被AI一点一点地拆开。


了解 Geoffrey Chen 的更多信息

订阅后即可通过电子邮件收到最新文章。