当生成变得廉价,验证为什么成为新的瓶颈?

《AI进入工作之后》· 第一季“从回答问题到参与工作”· 第六篇

一个团队过去每周只能形成两份方案。每份方案都需要有人搜集资料、搭建结构、计算成本并写成报告。引入生成式AI以后,同样的人可以在一天内得到十份方案,每份都有标题、预算、风险、实施步骤和演示稿。

表面上,团队的生产能力提高了五倍。

但管理者很快发现,十份方案都需要检查:数字是否来自真实报价,时间表是否忽略依赖,风险清单是否只是通用模板,建议是否与公司战略一致。过去两份报告可以逐页讨论,现在十份报告在会议前已经无人读完。

生成增加了,真正可以批准的决定却没有同比增加。团队的瓶颈从“没有足够草稿”转成“没有足够注意力判断草稿”。

这不是AI能力不足的简单结果。即使AI越来越准确,只要产出速度增长得比验证能力更快,未经审查的候选结果就会堆积。生成成本下降以后,最稀缺的资源不再是文字、代码或方案,而是能够把它们变成可信成果的验证能力。

生成与验证不是对称劳动

生成一段看似合理的答案,只需要找到一种可能表达。验证它却要排除多种错误可能。

一份市场分析写出“需求将在未来三年增长”,验证者需要追问数据来源、预测方法、基准年份、地区范围和不确定性。一段代码实现预期功能,验证者还要考虑异常输入、并发、权限、安全、性能和与旧系统的关系。一封客户邮件语言无误,验证者仍需确认事实、对象和承诺权限。

生成可以利用相似模式迅速补全。验证必须知道结果将在什么现实中使用,以及哪种错误会造成什么后果。

因此,验证至少有四种层次:

  1. 形式验证:格式、字段、语法和结构是否符合要求;
  2. 事实验证:数字、引用、名称和陈述能否回到可靠来源;
  3. 功能验证:代码、流程或方案是否在真实条件下按预期运行;
  4. 规范验证:即使能够运行,它是否符合政策、权利、价值和授权范围。

前两类中的一部分可以自动化。程序可以检查链接、字段和测试结果。但“这个方案是否值得实施”“这项承诺是否应该作出”不能仅靠再生成一段评价解决。

为什么人会高估“看起来完成”的工作

AI产物通常具有很强的完成感。段落完整、语法稳定、语气自信,代码也可能附带注释和测试。这种外观降低了人启动深度检查的意愿。

知识工作中的“锯齿状技术前沿”研究发现,在AI能力覆盖的任务中,参与者可以提高效率和质量;但在超出能力边界的任务中,使用AI的人反而更可能给出错误答案。困难之处在于,这条边界并不平滑,两个看似相似的任务可能落在不同一侧。Harvard Business School:《Navigating the Jagged Technological Frontier》

这意味着,用户不能只凭题目“看起来不难”决定是否省略验证。模型可以在复杂任务上表现出色,也可能在简单细节上出错。能力边界需要通过具体测试了解,而不是从输出语气推断。

自动化偏见进一步放大这个问题。欧盟《人工智能法》关于高风险系统的人类监督条款,特别要求监督者了解系统能力与限制,警惕自动依赖输出,并且能够忽略、推翻或停止系统。EU AI Act:Article 14—Human oversight

法律条款适用范围有限,但它指出了一个普遍原则:如果所谓人工复核者没有能力、时间、信息或权限拒绝AI结果,“有人看过”并不能证明监督有效。

生成速度会制造“验证债务”

软件工程中,人们用“技术债务”描述为了短期速度留下、以后需要偿还的结构问题。AI工作流也会积累一种验证债务。

一份未经充分核查的报告可能暂时通过,但其中的错误数字会进入下一份演示稿;一段未理解的代码会成为后来功能的依赖;一个未经确认的摘要会被保存到知识库,再被其他AI反复引用。

单次错误于是从候选输出变成组织事实。时间越久,后来的人越难知道哪一部分来自原始证据,哪一部分只是早期AI生成的补全。

验证债务常有几个信号:

  • 产出数量持续上升,评审时间却没有增加;
  • “先生成,之后再检查”中的“之后”没有明确负责人;
  • 同一份AI内容被复制到多个文件和系统;
  • 人只检查语言与格式,没有接触原始数据;
  • 组织无法说明某个结论最初来自哪里;
  • 错误被发现后,只改当前文本,没有修正上游来源。

一旦出现这些信号,提高模型生成速度只会使债务增长得更快。

AI可以参与验证,但不能垄断验证

模型能够为验证提供真实帮助。它可以寻找内部矛盾、列出待核查事实、比较两个版本、生成测试、尝试反例,并把每项主张映射到来源。

“验证链”等研究方法把生成和核查分成不同步骤,显示这种结构可以降低部分幻觉:先写草稿,再提出核查问题,独立回答,最后重写。ACL Anthology:《Chain-of-Verification Reduces Hallucination in Large Language Models》

但AI参与验证不等于验证已经独立。一个模型可能重复自己的假设,多个模型也可能共享训练材料和常见偏见。让三个AI都表示同意,不能替代原始文件、数据库查询、实际测试或领域专家判断。

较稳妥的做法,是让验证尽量改变证据通道:

  • 生成文字后,回到原始来源而不是只让模型重读摘要;
  • 生成代码后,运行确定性测试和安全扫描;
  • 生成计算后,用独立公式或程序重新计算;
  • 生成行动建议后,由具有授权和情境知识的人判断;
  • 高后果结果由不同角色复核,而不是由原生成者快速浏览。

验证的价值来自独立性,而不是次数。

验证能力必须按风险分配

如果每个低风险句子都要求专家逐字确认,AI带来的效率会被完全抵消。如果所有内容只抽样检查,高风险错误又可能漏过。

解决办法不是取消验证,而是分级。

低风险、可逆、容易发现错误的任务,可以依靠模板、自动检查和抽样。例如内部头脑风暴、格式转换和不进入正式记录的草稿。

中等风险任务需要明确完成标准和指定复核者。例如对外文章、客户说明、常规代码修改和内部分析。

高风险、不可逆或会影响权利与资金的任务,需要原始证据、权限隔离、强制检查点和可追溯批准。例如付款、合同承诺、生产环境变更、医疗或法律决定。

美国国家标准与技术研究院的AI资源中心把测试、评估、验证和确认(TEVV)视为AI风险管理的重要组成,并强调评估应与实际情境、影响和生命周期连接。NIST AI Resource Center

这里最重要的不是采用某个统一检查清单,而是让验证强度与后果相称。

重新设计工作的吞吐量

组织引入AI时常问:“每个人每周能多生产多少?”更有意义的问题是:“每周能多完成多少经过验证、可以采用的成果?”

这两个指标可能相差很大。

如果AI使初稿增加五倍,而审查能力只增加一成,真正的完成量仍受审查限制。大量候选版本甚至会降低效率,因为人需要选择先检查哪一份,并在相似内容之间切换。

因此,AI工作流需要同时限制进入队列的产物:先定义哪些任务值得生成,要求AI在提交前完成自动检查,淘汰缺少证据或未通过测试的结果,再把有限的人类注意力集中在剩余项目上。

代理评估实践也表明,真实任务不能只用一个总分衡量。系统可能完成用户要求,却破坏已有内容;也可能不破坏内容,却没有真正解决问题。评估需要围绕具体失败方式组合程序检查、任务测试和人类判断。Anthropic:《Demystifying evals for AI agents》

结论:生产率必须计算“通过验证的成果”

生成式AI把许多候选产物的成本降得很低。它可以让一个人尝试更多结构、生成更多代码、覆盖更多资料并迅速提出替代方案。这是真实的能力扩展。

但工作成果不是候选产物的数量。只有当事实可以追溯、功能经过测试、风险得到判断、责任人愿意采用时,生成才转化为完成。

因此,AI时代的生产率不能只计算每小时生成多少文字、代码或方案,而应该计算:

在既定风险范围内,每单位时间能够产生多少经过充分验证、可以正式采用并能够纠错的成果。

当生成变得廉价,验证不会成为需要被绕开的麻烦。它会成为决定AI价值能否兑现的核心生产环节。

真正先进的工作系统,不是让AI不停地产出、让人追在后面检查,而是在生成之前定义标准,在生成过程中保留证据,在提交之前自动淘汰明显失败,并把人的判断留给机器无法独立证明的部分。

瓶颈不会因为我们不统计它就消失。看见验证的成本,才是开始真正使用AI,而不是只消费它的产量。

主要资料

继续阅读:浏览《AI进入工作之后》系列文章


了解 Geoffrey Chen 的更多信息

订阅后即可通过电子邮件收到最新文章。