人工审核AI输出,为什么仍然可能漏掉错误? / Why Does Human Review Still Miss AI Errors?

简短答案

因为“有人看过”并不等于完成了独立、充分且有能力的验证。审核者可能被AI流畅的表达锚定,缺少原始资料和专业知识,在时间压力下只检查表面,也可能默认系统通常正确。有效审核必须改变工作设计:先明确要验证的主张,能看到独立证据,有权限拒绝输出,并用抽样、复核和错误记录检验审核本身。

人工审核不是一个控制措施,而是一整套条件

许多流程把“human in the loop”写进风险表,仿佛加一个确认按钮就完成治理。但真正的问题至少包括:谁审核、审核什么、依据什么、花多少时间、是否承担结果责任、能否推翻AI,以及发现错误后会发生什么。

如果审核者只看到模型摘要,看不到合同、病历、数据表或会议录音,他们只能判断文字是否像答案,不能判断答案是否真实。如果他们每天必须处理数百项,绩效又按速度计算,最理性的行为可能就是快速接受。于是人工环节成为系统的责任装饰,而不是独立防线。

NIST在AI风险管理资料中把自动化偏误、过度依赖以及人与系统职责不清列为需要管理的人机交互风险。这意味着审核质量必须被设计和测量,不能由“最终有人点过”来推定。NIST AI RMF: Human-AI Interaction

流畅表达会把“容易阅读”伪装成“容易验证”

生成式AI善于提供结构完整、语气肯定的文字。标题、编号和专业词汇降低阅读阻力,也可能降低警觉。一个错误若夹在大量正确背景中,比明显胡言乱语更难发现;一个不存在的判例若符合常见命名方式,看起来也比陌生事实更可信。

审核者常回答了错误的问题:“这段话是否合理?”而真正需要回答的是:“这里每个影响决定的主张,是否被独立证据支持?”合理性检查只能发现矛盾和荒谬,无法发现看似合理的虚构日期、错位数字或被删去的例外。

因此应把输出拆成可验证对象:事实、计算、引用、推论和建议。先查会改变结论的事实和数字,再检查来源是否真的支持相邻主张,最后评估建议是否适合具体情境。不能用一次从头读到尾代替这些不同测试。

第一个答案会锚定后面的判断

如果人先看到AI结论,再去读证据,搜索往往围绕“证明或微调这个结论”展开。审核者可能只注意支持材料,把冲突信息解释为例外。这不是个人懒惰,而是工作顺序制造的认知锚点。

在重要判断中,可以让审核者先根据原始材料形成简短初步判断,再显示AI建议;或让一个人准备AI辅助草稿,另一个没有看到模型置信语气的人进行关键复核。招聘情境的一项实验研究发现,即使人类参与,错误算法建议仍会影响判断,显示“保留人工”本身不能消除自动化偏误。Automation bias in AI-assisted recruitment study

盲审不必应用于所有内容。它适合高影响结论、争议案件和质量抽样。目标是保留一条不被同一初始答案支配的判断路径。

审核者可能没有模型所缺少的知识

让非专业人员审核专业输出,只是把未知从模型转移给人。普通员工无法可靠确认复杂税务结论,工程师也未必能判断隐私告知是否满足法律要求。AI给出的解释还可能让不熟悉领域的人产生“我已经理解”的错觉。

任务分配应记录最低审核能力。检查格式、拼写和是否包含必需栏目可以由受过流程培训的人完成;判断医学风险、法律义务、安全极限或统计方法,需要相应专业能力。找不到合格审核者时,应缩小AI任务,不应扩大普通审核者的名义责任。

专业人士同样需要工具和时间。专业资格不会自动提供文件的最新版本、完整数据或计算环境。审核设计必须同时提供能力、证据和可操作条件。

原始资料不可见时,审核只能停留在表面

AI摘要经常删除限定语、少数意见、脚注和时间范围。若审核界面只展示摘要,审核者甚至不知道有什么被删去。引用链接若没有精确定位,打开一个很长的PDF也不代表完成核实。

较好的界面把每个关键主张连到原文段落、数据行或时间戳,并显示模型没有读到的附件和解析失败。对于计算,保留输入、公式和单位;对于翻译,显示原句与译文;对于文件比较,显示具体增删,而不是只给变化总结。

证据必须独立于被检查输出。同一个模型生成答案、生成“来源摘要”并判断自己正确,不构成三层验证,只是同一错误经过三种表述。

时间压力会把审核变成接受率指标

假设每项输出需要五分钟认真验证,而系统每小时产生一百项。无论培训多好,单个审核者都不可能履行要求。此时问题不是提醒他们更仔细,而是产量与验证容量不匹配。

应在部署前测量真实审核时间,包括打开来源、处理冲突、记录理由和升级疑难项。若吞吐量超过容量,可以减少自动生成、只自动处理明确的低风险情况、按风险排序、增加复核资源或降低服务速度。不能把无法完成的工作定义成“人工监督”。

还应观察异常高的接受率。接受率高可能说明系统优秀,也可能说明审核者疲劳、没有否决权限或认为否决会受处罚。需要结合盲测错误、修改类型、复核分歧和事后事件判断。

审核AI输出可能让原本正确的人改错

人机组合并不天然优于任一方。如果人正确而AI错误,人可能因为模型的确定语气放弃原判断;如果人和AI共享相同的错误资料,他们会一致地错;如果界面只突出AI推荐,其他选项更难被认真考虑。

一项关于人机决策的研究发现,在某些条件下加入人类并没有提升模型决策,错误AI建议还可能降低总体准确度。这提醒我们,评估单位应该是完整工作流,而不是分别引用“模型准确率”和“有人审核”。When human-in-the-loop can decrease accuracy

测试时应故意放入已知但不显眼的错误,观察审核者能否发现。只用正常输出计算通过率,无法知道监督在关键时刻是否有效。

责任模糊会降低审核深度

当模型供应商、系统团队、业务人员和最终批准者都认为别人负责,审核很容易只剩形式。批准者需要知道自己承担哪部分判断,系统负责人要对数据、版本、权限和监控负责,组织则要提供申诉与补救。不能把所有责任压给最后点击的人,也不能以“AI建议”免除批准者的专业职责。

每类任务应有明确的决策所有者、技术所有者和事件处理人。审核记录应说明接受、修改或拒绝的关键理由,但避免要求大量无用文字,导致人人复制模板。

怎样设计更可靠的审核流程

第一,按风险分层。低风险格式建议可以抽样,高影响事实和不可逆行动必须逐项验证。第二,把验证问题写成清单,例如“金额是否与发票一致”“引用是否直接支持该句”,不要只问“是否正确”。第三,让审核者访问原始资料、适用规则和版本信息。

第四,给拒绝和升级留出真实路径,包括暂停自动化的权限。第五,记录模型版本、输入范围、输出、编辑和最终批准者。第六,定期用带已知错误的样本测试审核能力,并分析漏检原因。第七,监测事后投诉、撤回、返工和损失,因为内部通过不等于外部正确。

澳大利亚政府AI采用实施指引强调按用途进行测试、持续监控、明确责任并建立人工控制。这些要求共同说明,人工审核应是可验证的运行机制,而不是政策文件中的一句话。Australian Government: Guidance for AI Adoption—Implementation Practices

我的判断:应当审核“审核系统”

组织通常统计模型错误,却很少统计人工审核漏掉多少错误。若人工层被当成最后保障,它也需要准确率、覆盖率、容量和失效模式。可以追踪已知错误发现率、关键字段复核率、审核分歧、平均处理时间、升级比例和事后纠正率。

这些指标不能机械地用来惩罚个人,否则人会隐藏不确定性。它们应帮助识别培训不足、界面缺陷、任务过载和不合理自动化边界。最有价值的信号有时不是高通过率,而是审核者能安全地说“资料不足,我不能批准”。

审核检查表

  • 审核者是否具备判断该类内容的能力,而不只是会使用工具?
  • 是否能看到原始资料、完整上下文、适用规则和文件版本?
  • 是否先识别关键主张,再用独立证据逐项核实?
  • 产量是否允许真正的核查、记录和升级?
  • 审核者能否拒绝AI,并且不会因拒绝受到不合理压力?
  • 是否测试过审核者对隐藏错误、遗漏和错误引用的发现能力?
  • 是否记录修改、分歧、事件与补救,而不只记录一次点击?
  • 是否有人定期决定某类任务应降低或取消自动化?

结论

人工审核仍会漏掉AI错误,因为人可能被答案锚定、缺少专业知识和原始证据、承受过量工作,或没有真正否决权。可靠监督需要独立判断路径、明确验证对象、足够能力与时间、可追溯证据以及对审核层本身的测试。关键问题不是“有没有人”,而是这个人是否有条件、有权力并有证据把错误挡在行动之前。

相关问题

继续阅读本系列: 《AI可以相信到什么程度?》全部文章


了解 Geoffrey Chen 的更多信息

订阅后即可通过电子邮件收到最新文章。