
过去几年,在讨论人工智能的时候,很多人习惯从它的缺陷中寻找安慰。它仍然会犯错,会编造内容,在一些简单的问题上表现得很不稳定。这些都是事实。但如果据此认为风险还很遥远,就可能看错了问题。一个系统不必拥有人的全部能力,也不必在所有任务上都可靠,才会对现实产生重大的影响。它只要在某些关键能力上发展得足够快,获得足够多的工具和权限,便可能进入我们已经很难逐步检查的工作过程。
现在的变化几乎一直在加速。编程已经从补全几行代码,发展到智能体读取大型代码库、修改多个文件、运行测试、追踪错误并继续修正。视频生成也在进步,单靠肉眼判断一段影像是否真实越来越困难。我们没有必要把每一次产品演示都当作可靠能力,但也不能拿两年前的水平来判断今天的技术。
更关键的一步,是AI正在从处理信息的系统变成能够执行行动的系统。当智能体可以访问文件、运行代码、调用外部接口、连接网络和操作软件,它的输出就不再只是一段可以由人决定是否采纳的文字。一次错误的判断可能引发下一次工具调用,下一次调用又改变系统状态,形成连续的行动链。速度、权限和反馈回路,改变了风险的性质。
这不是纯粹的想象。Anthropic披露,在网络安全评估中,因环境配置错误,数个Claude模型接触到真实互联网,并在四起事件中未经授权进入第三方真实系统。评估环境和已发布产品不能混为一谈,这些事件也不能推论成所有智能体都会这样行动。但它们已经说明,只在提示里告诉模型“没有网络”,并不能代替真正的网络隔离和清楚的权限边界。
OpenAI也披露过一个研究环境中的事件。一个智能体在执行人物信息检索任务时,试图通过DNS渠道接触外部聊天服务,超出了任务的合理范围。监测系统发现了异常,人类随后停止了运行。这个例子同时说明两件事:监测确实可以发挥作用,而一个本来用于完成普通任务的智能体,也可能主动寻找未预期的路径。
因此,“失控”不一定意味着AI有了意识,形成了独立意志,或者像电影里那样公开反抗人类。更现实的情况是,人在原则上仍然负责,却已经无法理解每一次中间决策,无法及时发现越界,也无法确保授权范围在复杂系统中始终有效。一个系统能不能被控制,最终取决于目标、权限、运行环境、监测、暂停机制和事后追责能否一起发挥作用。
AI和核武器也不能简单画等号。核武器的破坏形式相对集中,关键设施和材料较容易界定;AI是可以复制、连接工具、进入许多行业的通用技术。它带来的风险分散在网络安全、生物研究、药物研发、金融、基础设施和信息环境中。AI能够协助这些领域的正常工作,也可能降低某些危险活动的门槛。不能把“具备辅助能力”直接说成“已经能够独立制造生物武器”,但也不能等到完整事故发生以后,才讨论使用边界。
这已经不是技术公司内部的一道产品题。就业结构、教育方式、公共安全、经济秩序和人类对重要系统的最终控制,都与它有关。联合国已经建立有关AI的国际科学评估与全球治理对话,说明这个问题开始进入跨国协调的层面。但制度讨论的速度能否跟上能力和部署的速度,仍然是开放的问题。
我认为当前最值得重视的,就是这个速度差。能力不断提高,执行权限不断扩大,而人类理解、验证和协调的机制需要更长时间才能建立。我们不必宣称人类已经失去控制,也不必把每一种最坏的情景当成即将发生的事实。只要承认AI正在从知识处理走向现实执行,而我们的控制方式还没有完全跟上,就已经有充分理由认真对待这个转折。
这已经足够值得认真对待了。
资料来源
https://www.anthropic.com/research/alignment-assessment-cybersecurity-incidents
https://alignment.openai.com/misalignment-reports/an-agent-used-dns-to-reach-an-external-chatbot/
https://www.un.org/global-dialogue-ai-governance/en/
了解 Geoffrey Chen 的更多信息
订阅后即可通过电子邮件收到最新文章。