让AI读取陌生网页、邮件和文件,风险在哪里? / What Can Go Wrong When AI Reads Untrusted Pages, Emails and Files?

AI时代的判断力 · 第38篇

普通软件通常把文档当作数据;连接大模型的系统却可能把文档里的文字误当成指令。攻击者可以在网页、邮件或文件中埋入内容,诱导AI泄露信息、调用工具或忽略原有规则,这就是提示注入的一种形式。

画出四格攻击面

要素 检查问题
不可信输入 系统会读取谁创建的内容?
可用秘密 模型上下文中有哪些账号、文件或个人数据?
行动工具 它能发信、下载、执行、付款或改权限吗?
外传通道 结果能否被写回网页、链接或第三方服务?

防护不是一句“忽略恶意指令”

  • 把不可信内容与系统指令明确隔离;
  • 限制可访问的数据和工具,敏感操作要求确认;
  • 验证工具参数和输出目的地;
  • 记录调用,并对异常批量访问设限;
  • 用模拟攻击定期测试,而不是只测正常任务。

模型无法可靠地仅凭文字判断另一段文字是不是恶意指令。系统设计必须假定诱导会发生,并让一次成功诱导仍无法获得不必要的权限。

参考资料


了解 Geoffrey Chen 的更多信息

订阅后即可通过电子邮件收到最新文章。