AI时代的判断力 · 第38篇
普通软件通常把文档当作数据;连接大模型的系统却可能把文档里的文字误当成指令。攻击者可以在网页、邮件或文件中埋入内容,诱导AI泄露信息、调用工具或忽略原有规则,这就是提示注入的一种形式。
画出四格攻击面
| 要素 | 检查问题 |
|---|---|
| 不可信输入 | 系统会读取谁创建的内容? |
| 可用秘密 | 模型上下文中有哪些账号、文件或个人数据? |
| 行动工具 | 它能发信、下载、执行、付款或改权限吗? |
| 外传通道 | 结果能否被写回网页、链接或第三方服务? |
防护不是一句“忽略恶意指令”
- 把不可信内容与系统指令明确隔离;
- 限制可访问的数据和工具,敏感操作要求确认;
- 验证工具参数和输出目的地;
- 记录调用,并对异常批量访问设限;
- 用模拟攻击定期测试,而不是只测正常任务。
模型无法可靠地仅凭文字判断另一段文字是不是恶意指令。系统设计必须假定诱导会发生,并让一次成功诱导仍无法获得不必要的权限。
参考资料
了解 Geoffrey Chen 的更多信息
订阅后即可通过电子邮件收到最新文章。