语言模型并不只是语言

关于人工智能是否真正理解世界,有一种常见的说法是,大语言模型虽然能够写诗、写代码、撰写复杂论文,却并不真正理解现实世界的物理规律。这个说法有一定道理,但如果把它理解为语言模型只是停留在文本表面,而所谓世界模型才真正接触现实,那么这里面可能存在一个重要误解。

语言并不是纯粹封闭的符号系统。文本表面上是词语、句子和语法,但这些文本之所以能够成立,是因为它们长期承载了人类对世界的感知、行动、因果关系、空间结构、时间顺序和社会经验。比如一句“杯子从桌上掉下来摔碎了”,看起来只是文字,但它里面已经包含了物体边界、支撑关系、重力方向、运动过程、材料脆性和事件结果。语言不是世界本身,但它是人类经验经过长期压缩之后留下来的高密度投影。

因此,大语言模型训练的并不是“裸文本”。它训练的是人类世界经验在语言中的沉积物。模型当然没有直接生活在现实世界中,也没有像人一样通过身体行动承担物理后果,但它可以通过大量文本中反复出现的稳定关系,间接推理出产生这些文本的世界结构。换句话说,它不是从世界本身出发形成语言,而是从语言这个投影中反向重建世界。

所谓世界模型也并不比语言模型更直接地拥有现实。无论是图像、视频、三维场景、传感器数据,还是机器人动作反馈,它们都不是真实世界本身,而是现实经过某种采样、编码和格式化之后形成的数据。视觉数据是光学投影,文本数据是经验和概念的投影,动作数据是交互轨迹的投影,三维模拟数据则是几何和物理规则的模型化投影。它们之间有差别,但这种差别不是“一个有世界,一个没有世界”,而是投影通道、约束方式和反馈机制的不同。

所以,真正的问题不应该是语言模型有没有世界模型,而应该是它通过什么方式形成世界模型,它的世界模型受到哪些约束,又在哪些地方缺少校正。语言模型的问题不是它完全不理解世界,而是它主要依赖文本投影来重建世界关系,缺少持续的物理反馈、行动检验和现实后果承担。因此它的理解可能是间接的、不完整的,甚至在某些边界条件下容易漂移,但这不等于它完全没有世界结构。

如果把文本看得太浅,就会误以为语言模型只是在词语之间旋转;如果把空间数据看得太直接,又会误以为只要引入三维世界或物理模拟,模型就真正接触了现实。实际上,人工智能面对的始终不是现实本身,而是现实留下来的各种数据痕迹。不同模型只是从不同的投影通道中重建世界。

因此,语言模型和世界模型之间并不存在一条绝对的分界线。语言模型是在从人类经验的文本投影中反向升维,空间模型是在从视觉和三维数据中重建关系,机器人模型则是在行动反馈中不断校正结构。它们都不是现实本身,却都可能在不同程度上逼近现实中的稳定关系。

真正值得追问的是,一个智能系统能否在这些不同投影之间形成稳定、可调用、可修正、可迁移的结构。如果它能够做到这一点,它就已经不只是停留在表面符号之中。它也许还没有像人一样理解世界,但它已经在用自己的方式重建世界。


了解 Geoffrey Chen 的更多信息

订阅后即可通过电子邮件收到最新文章。