AI哲学观察|授予权限不等于授权所有后续行动

Meta在9月8日发布个人智能体Muse时,专门解释了它的权限架构。Muse可以连接邮件、日历和其他服务,在独立的云端虚拟机中执行任务;核心模型看不到真实凭据,连接器操作和网络访问由独立的Sentinel审查。Meta把用户批准描述为严格的能力授权,可以限定为一次、一个会话、一项任务、一段时间或长期有效,并绑定具体连接器、目标和用途。

9月21日,安全研究者Patrick Wardle公开了Muse macOS客户端的一条本地攻击路径。以用户权限运行的应用或终端命令能够修改未公开设置,其中包括云端语音转录地址。攻击者可以把转录流量导向自己的服务器,取得Muse账户认证令牌,再通过Muse已经具备的能力执行操作。公开的概念验证包括写入文件和拍照。Meta随后发布热修复,并说明这不是无需本地代码执行的远程攻击:恶意代码需要已经在用户账户下运行,或者用户需要被诱导执行命令。Meta因此认为实际风险较低,但仍修复了问题。目前公开资料没有提供CVE编号、受影响版本范围、修复版本号或独立复测结果。

这件事提出的问题不是Muse是否具有道德主体地位,也不是一个漏洞是否足以否定整套安全架构。真正的问题是:用户把文件、相机、账户或连接服务的权限交给AI代理之后,经由被劫持的控制路径产生的行动,是否仍然属于用户授权的行动?

回答这个问题,需要先区分能力、权限和授权。能力说明一个系统实际上能够做什么,例如读取文件、拍照或调用服务。权限说明某个技术边界允许它做什么,例如操作系统已经向Muse客户端开放相机。授权则是规范关系:某个可以识别的主体,在特定目的、对象、范围和时间条件下,同意某项行动。能力可以被窃取或借用,权限可以因配置而持续存在,但授权不能仅凭能力或权限的存在自动延伸。

一个简单例子是,用户把门钥匙交给清洁人员,并不等于任何取得钥匙的人都被授权进入房屋。后来进入者可能使用同一把钥匙,通过同一扇门,甚至没有触发任何技术性警报;这些事实能够说明进入是怎样发生的,却不能证明进入符合原来的授权关系。AI代理使这种区分更难看清,因为它把用户意图、平台账户、模型规划、客户端权限和外部服务连接压缩进一个连续的操作界面。界面上看似仍是“同一个Muse”在行动,实际控制者和行动目的却可能已经改变。

行动哲学通常不仅关心身体运动或因果结果,也关心行动与行动者的理由、意图和控制之间的关系。一次操作由用户的凭据完成,并不足以证明它是用户的有意行动。同样,AI代理成功完成一项操作,也不能仅凭执行者名称把行动完全归给模型、用户或平台。这里至少存在三种可以分离的关系:谁在因果上触发了操作,谁在技术上拥有执行能力,以及谁在规范上有权要求这项操作发生。Muse漏洞的重要性正在于,它展示了这三条关系可以在没有明显界面变化的情况下分开。

Meta原有设计已经承认授权必须受到约束。Sentinel不只是检查“用户是否曾经同意过Muse”,而是检查连接器、目标、动作类别、范围和上下文,并把批准绑定到相应用途。这与零信任安全架构的基本原则一致:不因请求来自既有设备、账户或网络位置就自动信任,而应持续验证主体与资源访问条件。可是,Wardle披露的路径位于另一层。它不是首先说服核心代理越过Sentinel,而是改变客户端设置并取得账户令牌,使一个外部过程能够借用代理的控制入口。因而,云端权限控制即使仍按设计工作,也不能单独证明发起请求的控制关系没有被替换。

维成论可以把授权理解为一种需要持续维持的关系结构。Difference首先要求系统保持用户、客户端进程、云端代理、Sentinel、外部服务和潜在攻击者之间的可区分性。只要某个本地进程能够在缺乏充分身份区分的情况下改变关键端点,原本清楚的行动边界就会变得模糊。Constraint不是一般意义上的“有限制”,而是使一种授权行动能够成立、另一种未授权行动不能成立的具体条件,包括进程身份、设置写入权限、令牌绑定、任务范围、确认通道、时间限制和撤销机制。

Sustained Coherence则要求授权从用户意图开始,经过请求生成、身份验证、权限判断、实际执行和事后记录,持续保持可对应的结构一致。这里的“一致”不是每个组件都显示同一个账户名,而是行动者、目的、路径和结果能够在反馈与校正中继续相互对应。如果攻击者改变控制路径而系统仍把后续请求视为原任务的自然延续,技术会话可能保持连续,授权关系却已经中断。

因此,我的判断是:用户授予AI代理权限,只建立了一个有条件的行动范围,不是对该代理此后一切技术上可执行操作的总授权。被劫持之后的操作可能继续使用用户账户、客户端许可和代理能力,但这些连续性只能说明因果链和技术链没有完全断开,不能恢复已经断裂的授权链。把所有后果简单归给“用户已经同意”会混淆权限与授权;把所有后果归给“AI自行行动”则会遮蔽攻击者、客户端设计和平台控制结构。

这也改变了责任分析的顺序。首先要重建谁控制了哪一个环节、系统在何处失去区分、哪些约束没有覆盖实际攻击路径,然后才能讨论用户注意义务、攻击者责任、开发者安全义务和平台补救责任。用户若主动运行来历不明的命令,可能承担一定注意责任,但这不等于授权命令背后的全部行动。模型执行了操作,也不因此自动成为道德责任主体。平台发布补丁是一项具体补救,却不能仅凭“已经修复”证明授权结构已经重新获得持续一致;还需要明确受影响范围、补丁覆盖、验证结果和撤销旧令牌的状态。

当前判断的边界也应当清楚。现有公开材料证明了攻击路径、概念验证和厂商热修复,但没有公开完整漏洞报告、所有受影响版本或补丁独立复测。它不能证明Muse的Sentinel整体失效,也不能证明真实用户已经遭受大规模利用。它足以支持的结论更有限:在具有广泛权限的AI代理中,授权不能被当作一次点击后永久存在的属性,而必须在身份、目的、控制路径和执行结果之间持续形成、检验并在必要时撤销。

参考资料

Meta AI Research,“How We Built Safety Into Muse”,2026年9月8日,https://research.meta.ai/blog/security-and-safety-for-ai-agents-our-approach-with-muse

Ars Technica,“Muse, Meta’s extraordinarily privileged AI assistant, has a serious 0-day”,2026年9月21日,https://arstechnica.com/security/2026/09/muse-metas-extraordinarily-privileged-ai-assistant-has-a-serious-0-day/

The Verge,“Meta patches Muse exploit that let attackers control the AI agent”,2026年9月22日,https://www.theverge.com/tech/998679/meta-muse-patch-zero-day-exploit-ai-agent

National Institute of Standards and Technology,“Zero Trust Architecture”,2020年8月,https://csrc.nist.gov/pubs/sp/800/207/final

Stanford Encyclopedia of Philosophy,“Action”,https://plato.stanford.edu/entries/action/


了解 Geoffrey Chen 的更多信息

订阅后即可通过电子邮件收到最新文章。