AI产出太多无法逐项检查,组织应该怎样审计?

《AI进入工作之后》· 第二季“从个人工具到组织能力”· 第十篇

一个部门每天生成数千份AI摘要、分类和建议。管理者知道不能完全信任,但也不可能逐项阅读。于是他们抽查百分之一。连续几周没有发现严重问题,系统被认为“已经受到人工监督”。

后来,一类少见客户持续被错误分类。因为这类案件只占总量很小,随机抽样很少选中;受到影响的人却几乎每次都遇到同样错误。

审计不能只是从大量输出中随便看几份。它必须根据风险、群体、失败方式和变更来设计,证明组织能够发现重要问题,而不只是发现常见问题。

逐项检查既不可能,也不一定有效

人工阅读所有产物会使AI带来的规模优势消失,而且人在大量重复审核中容易疲劳和机械批准。有效审计不是增加一个无限大的复核队伍,而是把不同控制放在不同位置。

确定性格式、必填字段、数值范围和权限可以自动检查;高后果决定在采用前由合格人员复核;低风险、高容量工作用分层抽样;投诉、异常和系统变化触发专项检查。

审计对象也不是文字本身,而是完整过程:输入来自哪里,使用了哪个配置,调用了什么工具,谁批准,结果产生了什么后果。

风险分层决定审计强度

组织应先把用例按后果、可逆性、错误可见性和影响人数分类。

低风险内部草稿可以主要依靠自动检查和定期抽样。对客户正式沟通、资金、就业或权利有影响的输出,需要更高覆盖率、专业复核和申诉记录。不可逆或安全关键行动不能用事后抽样代替事前控制。

NIST AI RMF要求按组织风险容忍度决定所需风险管理活动,并把治理、测量、监控和反馈贯穿生命周期。NIST AI RMF Core

审计资源有限时,应首先覆盖后果最严重而不是数量最多的任务。

随机抽样必须与定向抽样结合

随机样本能估计整体错误,却容易错过小群体和罕见失败。组织还需要分层样本:按任务类型、语言、地区、用户群、金额、模型置信条件和人工修改程度分别抽取。

还要有“失败导向”样本:投诉、推翻决定、重复生成、工具超时、权限拒绝、异常长输入和模型拒答。每次重大事故都应产生新的审计规则或测试案例。

GAO的AI问责框架围绕治理、数据、绩效和监控组织审计问题,并为管理者与审计者提供检查问题。U.S. GAO:Artificial Intelligence Accountability Framework 其价值在于审计不只看准确率,也检查目标、数据质量、持续监控和责任。

先确保记录足以支持审计

如果系统只保存最终文本,审计者无法知道错误来自源资料、检索、模型、工具还是人工编辑。

高后果用例至少需要保存适当的任务标识、时间、配置版本、来源引用、工具行动、人工批准和最终结果。日志本身可能含有敏感资料,因此应最小化、保护访问并设保留期限。

记录必须能连接到补救:发现一类错误后,组织能查找其他受影响案件、暂停相同配置并重新处理,而不只是修改一个样本。

澳大利亚政府AI政策2.0要求适用机构建立内部用例登记、明确用例责任并进行影响评估,为审计提供了最基本的对象清单。Digital Transformation Agency:Policy for the responsible use of AI in government

如果组织连哪些AI用例正在运行都不知道,输出审计无从开始。

审计独立性要与风险相称

开发系统的人最了解技术,却也可能对自己的假设过于熟悉。业务团队知道流程,却可能把长期习惯当作正确标准。

低风险用例可以由另一名团队成员复核。更高风险系统需要独立的安全、法律、专业或内部审计参与;特别重要的用例可能需要外部评估或受影响群体反馈。

独立不意味着审计者完全脱离系统。它意味着审计标准和结论不由被审计团队单独控制,发现问题后有直接升级路径。

ISO/IEC 42001把绩效评价、内部审计和持续改进纳入AI管理系统结构。ISO:ISO/IEC 42001 审计因此不是上线前的盖章,而是管理系统的循环。

审计要检查人类监督是否真实

系统记录“已人工批准”并不能证明监督有效。审计应比较批准用时、修改比例、人员工作量、是否查看来源,以及不同审核者能否发现预设错误。

如果一个人每分钟批准几十项复杂建议,监督可能只存在于字段中。组织应减少需要逐项判断的产量、改善界面或重新设置自动化边界,而不是继续用人名为系统背书。

还应检查被影响者能否投诉、多久得到回应、错误是否真正撤回。没有补救数据,组织只能审计内部过程,无法知道实际后果。

审计系统本身也需要评测

如果自动检查产生大量无关警报,团队会逐渐忽略;如果抽样规则多年不变,新型错误会持续逃脱。组织应定期测试审计控制能否发现预先植入的问题,并记录从异常出现到发现、升级和修复所需时间。

审计还会产生假阳性。某类正常案件如果频繁被标记,受影响人员可能遭遇额外审查或延迟。审计设计同样需要检查群体差异和比例性,不能以“风险控制”为名制造另一套不公平分类。

监督团队需要自己的绩效指标:严重问题发现率、未处理积压、重复事故、补救完成率,以及审计建议是否真正改变系统。只统计完成了多少次抽查,会使审计重演生成环节的数量错觉。

最后,应定期向用例负责人和领导层报告剩余未知:哪些领域没有足够样本、哪些日志不足、哪些供应商变化无法独立验证。审计的诚实部分,是明确它仍然看不见什么。

审计发现问题之后,还必须有修复容量。若团队只能积累缺陷清单,却没有权力暂停流程、通知受影响者或安排重新处理,更多审计只会制造一份更完整的无力记录。组织应为高风险发现预留响应人员和预算,设定纠正时限,并追踪受影响结果是否真正恢复。可发现而不可补救的失败,仍然没有被治理。

结论:审计不是看更多,而是让重要失败更容易被看见

AI规模扩大以后,全面人工检查不可持续。解决办法不是取消监督,而是建立多层控制和有目的的抽样。

最终原则是:

自动检查可客观验证的部分,在高后果行动前保留专业判断,用随机与分层样本监控总体和少数群体,并让投诉、异常和变更持续更新审计范围。

一套AI系统是否可审计,不取决于保存了多少日志,而取决于组织能否从记录发现系统性问题、找到受影响的人、停止错误并证明修复有效。

主要资料

继续阅读:浏览《AI进入工作之后》系列文章


了解 Geoffrey Chen 的更多信息

订阅后即可通过电子邮件收到最新文章。