《AI进入工作之后》· 第三季“当AI开始代表组织”· 第十篇
上午9点,机构的AI助手在网站上回答:“这项补助的申请截止日期已经延长到月底。”
9点12分,一名用户把答案截图发到社交媒体。9点40分,一个社区组织据此通知成员。11点,工作人员发现AI引用了去年的延期公告,把回答改为正确日期。网页上的错误消失了。
但错误并没有消失。截图仍在传播,用户可能推迟申请,社区组织的通知仍在邮箱里,内部客服也可能已经复制同一答案。系统管理员完成了“内容修正”,机构却还没有完成“制度撤回”。
真正的撤回必须追上错误已经走过的路径。它不只是把当前页面改对,而是停止继续扩散、找到受影响的人、明确替换旧信息、处理已经产生的依赖,并修复产生错误的结构。
一条错误信息有自己的时间线
AI错误的后果取决于它在多长时间内、通过多少渠道、以多大权威传播。组织应在事故发生时建立时间线:
T0 错误首次生成
T+12m 被截图或转发
T+40m 被第三方组织采用
T+2h 内部发现并修改页面
T+3h 搜索缓存仍显示旧内容
T+1d 用户依据旧信息采取行动
修改时间只是其中一个节点。若组织只记录“11点已修复”,就无法判断错误覆盖了多少请求、哪些客户看到、哪些渠道复制,以及哪些人已经错过行动机会。
AI系统应保留足够的版本、时间、会话和来源信息,以便在不无限保存个人资料的前提下确定影响范围。没有传播记录,机构只能等待受影响者自己回来投诉。
删除、更正、撤回和补救是四种不同动作
这四个词经常被混用:
删除使错误不再出现在当前位置。它阻止未来部分暴露,却不能改变已经发生的传播。
更正提供正确内容。它告诉后来访问者事实是什么,但未必告诉早先读者原答案错误。
撤回明确指出哪一项旧表达不应再被依赖,并用可识别的新表达替换。撤回需要面向已经接触旧信息的人。
补救处理错误导致的实际后果,例如恢复申请机会、撤销费用、重新评估决定或补偿合理损失。
一个成熟流程要根据影响决定做到哪一步。低影响的拼写错误可能只需更正;错误截止日期、价格、安全建议或资格判断通常需要主动撤回,并可能需要补救。
撤回的对象不是“所有人”,而是不同受影响群体
错误传播会形成多个群体:直接提问者、看过页面但未登录的人、收到自动邮件者、引用内容的合作机构、根据答案作出内部决定的员工,以及被搜索或归档服务间接触达的人。
组织不一定能识别每个人,但应按可达程度采取分层措施:
| 群体 | 可行行动 |
|---|---|
| 已知直接接收者 | 主动通知并说明新旧差异 |
| 已登录或订阅用户 | 账户消息、邮件或醒目标记 |
| 匿名网页访问者 | 在原位置保留更正说明一段合理时间 |
| 合作方与内部人员 | 专门通知,要求替换下游材料 |
| 可能通过搜索接触者 | 更新结构化内容、缓存和索引,保留公共更正页 |
不能因为无法找到所有匿名读者,就什么都不做。也不能向所有客户发送与他们无关的紧急通知。撤回范围应与错误传播证据、后果和时效相称。
更正必须比原错误更清楚
机构有时使用含糊语言:“此前的信息可能造成误解”“系统短暂显示不准确内容”。这种措辞保护机构语气,却把判断负担再次交给用户。
有效撤回应回答五个问题:
- 原来哪一句或哪项结果错误;
- 正确信息是什么;
- 错误在什么时间和渠道出现;
- 已经依赖的人现在应该怎样做;
- 谁负责提供人工帮助和处理补救。
若原错误以公司名义给出肯定答复,更正也应以同等或更高可见度出现。不能把醒目的错误用一个深藏链接的小字悄悄修正。
澳大利亚AI伦理原则把透明度、可争议性和责任并列,并强调受重大影响者应有及时挑战和补救途径。澳大利亚工业、科学与资源部:《Australia’s AI Ethics Principles》 撤回是这些原则在错误发生后的具体形态:说明发生了什么,让人能够证明自己受影响,并由可识别的机构承担处理。
先停止扩散,再讨论措辞
事故响应的第一步不是写一封完美道歉,而是控制继续传播。组织应能迅速:暂停相关回答、切断错误来源、阻止批量发送、冻结高风险工具动作,并把服务切换到人工或已批准的静态说明。
停止必须足够精细。若只有关闭整个AI系统的选项,团队可能因为业务中断而迟疑;若可以暂停某个知识源、主题、工作流或渠道,就更容易及时行动。
英国国家网络安全中心的安全运行与维护指南强调监控、日志、更新管理和事件响应。英国国家网络安全中心:《Secure operation and maintenance》 对外AI需要把“错误信息事件”纳入与安全事件类似的运行机制,而不是只当作内容团队的一次编辑。
停止之后应保存证据。直接覆盖配置、删除对话或清空日志会妨碍影响分析。修复版本与事故版本都要保留在受控记录中,并限制访问。
找出同一错误的所有下游副本
一项错误可能来自过期文档、错误检索、提示词、模型更新或业务规则。组织要沿着来源向下游查询:同一资料还支持哪些网页、邮件模板、客户建议、员工助手和正式决定?
这需要内容和系统血缘。至少应知道每个回答使用了哪些来源版本、在哪个工作流中生成、是否写入客户记录,以及是否触发其他工具。只按关键词搜索最终文本会漏掉使用不同措辞表达的同一错误。
NIST AI风险管理框架要求持续监测、记录风险、接收反馈并在风险出现时管理和改进系统。NIST AI Resource Center:《AI RMF Core》 对撤回而言,监测的核心不是统计删除了多少答案,而是确认错误来源已停止影响所有相关用例。
已经依赖错误的人需要单独判断
撤回信息不等于恢复处境。有人可能因错误期限错过申请,因错误价格作出购买,因错误安全建议采取行动,或因错误资格说明放弃请求。
组织应建立补救队列,让受影响者说明自己何时看到什么、怎样依赖以及产生什么后果。审核者需要访问当时的系统版本和传播记录,而不能要求用户证明一个已被网站删除的页面曾经存在。
补救应由具有实际权限的人处理。例如恢复期限需要业务或政策所有者批准,退款需要财务权限,正式记录修正需要数据所有者。AI可以收集材料和识别相似案件,但不能自行决定机构是否承认责任或应补偿多少,除非这也属于清楚授权的低风险范围。
“请重新提交”也不总是补救。如果用户必须重新经历全部流程、承担额外证明和等待,机构只是把自己的错误成本转给了受影响者。
建立四本事故账
为了防止撤回只停留在公关层面,可以同时维护四类记录:
事实账:错误内容、正确内容、来源和时间。
传播账:渠道、接收群体、转发和下游使用。
补救账:受影响案件、采取措施、完成时间和未解决后果。
系统账:根本原因、暂停措施、修复、测试和重新上线批准。
四本账由不同团队参与,但需要一个事故负责人统筹。内容团队可以更正网页,客户团队联系用户,法律和政策人员判断补救,技术团队修复系统。若没有共同事件编号和所有者,各团队都可能认为自己已经完成。
重新上线需要证明错误不会以另一种方式回来
把错误文档删除并不一定解决问题。模型可能从缓存、另一份副本或历史对话继续检索;提示词可能在缺少资料时鼓励猜测;界面可能仍把非权威答案写成确定承诺。
重新上线前应测试原问题的不同表达、相邻问题、不同客户状态和没有答案的情况。还要验证系统是否能在不确定时停止、引用正确来源并升级给人。
事故后的改进不应只针对一条答案。如果根因是知识没有到期管理,就修复知识生命周期;如果是权限过宽,就改变对外动作;如果是监测发现太晚,就增加抽样和异常信号。根因属于制度,修复也必须属于制度。
结论:真正的撤回要恢复可依赖的现实
AI错误一旦以机构身份公开,就不再只是数据库里的一段文本。它进入他人的计划、记录和决定。删除当前版本只能改变系统现在说什么,不能自动改变人们此前据此做了什么。
最终原则是:
撤回必须覆盖错误的来源、传播和后果:立即停止继续输出,清楚标明被替换的内容,主动触达可识别的受影响者,为合理依赖提供人工补救,并验证所有下游系统已经停止使用同一错误。
一个机构是否真正承担AI表达,不只看它发布时敢不敢让AI使用自己的名字,也看出错时是否愿意沿着这个名字产生的信赖一路追过去。撤回不是把话收回来,而是尽可能把被错误改变的现实修复回来。
主要资料
- 澳大利亚工业、科学与资源部:Australia’s AI Ethics Principles
- 英国国家网络安全中心:Secure operation and maintenance
- NIST AI Resource Center:AI RMF Core
- ISO:ISO/IEC 42001—Artificial intelligence management systems
继续阅读:浏览《AI进入工作之后》系列文章
了解 Geoffrey Chen 的更多信息
订阅后即可通过电子邮件收到最新文章。