《AI进入工作之后》· 第一季“从回答问题到参与工作”· 第六篇
一个团队过去每周只能形成两份方案。每份方案都需要有人搜集资料、搭建结构、计算成本并写成报告。引入生成式AI以后,同样的人可以在一天内得到十份方案,每份都有标题、预算、风险、实施步骤和演示稿。
表面上,团队的生产能力提高了五倍。
但管理者很快发现,十份方案都需要检查:数字是否来自真实报价,时间表是否忽略依赖,风险清单是否只是通用模板,建议是否与公司战略一致。过去两份报告可以逐页讨论,现在十份报告在会议前已经无人读完。
生成增加了,真正可以批准的决定却没有同比增加。团队的瓶颈从“没有足够草稿”转成“没有足够注意力判断草稿”。
这不是AI能力不足的简单结果。即使AI越来越准确,只要产出速度增长得比验证能力更快,未经审查的候选结果就会堆积。生成成本下降以后,最稀缺的资源不再是文字、代码或方案,而是能够把它们变成可信成果的验证能力。
生成与验证不是对称劳动
生成一段看似合理的答案,只需要找到一种可能表达。验证它却要排除多种错误可能。
一份市场分析写出“需求将在未来三年增长”,验证者需要追问数据来源、预测方法、基准年份、地区范围和不确定性。一段代码实现预期功能,验证者还要考虑异常输入、并发、权限、安全、性能和与旧系统的关系。一封客户邮件语言无误,验证者仍需确认事实、对象和承诺权限。
生成可以利用相似模式迅速补全。验证必须知道结果将在什么现实中使用,以及哪种错误会造成什么后果。
因此,验证至少有四种层次:
- 形式验证:格式、字段、语法和结构是否符合要求;
- 事实验证:数字、引用、名称和陈述能否回到可靠来源;
- 功能验证:代码、流程或方案是否在真实条件下按预期运行;
- 规范验证:即使能够运行,它是否符合政策、权利、价值和授权范围。
前两类中的一部分可以自动化。程序可以检查链接、字段和测试结果。但“这个方案是否值得实施”“这项承诺是否应该作出”不能仅靠再生成一段评价解决。
为什么人会高估“看起来完成”的工作
AI产物通常具有很强的完成感。段落完整、语法稳定、语气自信,代码也可能附带注释和测试。这种外观降低了人启动深度检查的意愿。
知识工作中的“锯齿状技术前沿”研究发现,在AI能力覆盖的任务中,参与者可以提高效率和质量;但在超出能力边界的任务中,使用AI的人反而更可能给出错误答案。困难之处在于,这条边界并不平滑,两个看似相似的任务可能落在不同一侧。Harvard Business School:《Navigating the Jagged Technological Frontier》
这意味着,用户不能只凭题目“看起来不难”决定是否省略验证。模型可以在复杂任务上表现出色,也可能在简单细节上出错。能力边界需要通过具体测试了解,而不是从输出语气推断。
自动化偏见进一步放大这个问题。欧盟《人工智能法》关于高风险系统的人类监督条款,特别要求监督者了解系统能力与限制,警惕自动依赖输出,并且能够忽略、推翻或停止系统。EU AI Act:Article 14—Human oversight
法律条款适用范围有限,但它指出了一个普遍原则:如果所谓人工复核者没有能力、时间、信息或权限拒绝AI结果,“有人看过”并不能证明监督有效。
生成速度会制造“验证债务”
软件工程中,人们用“技术债务”描述为了短期速度留下、以后需要偿还的结构问题。AI工作流也会积累一种验证债务。
一份未经充分核查的报告可能暂时通过,但其中的错误数字会进入下一份演示稿;一段未理解的代码会成为后来功能的依赖;一个未经确认的摘要会被保存到知识库,再被其他AI反复引用。
单次错误于是从候选输出变成组织事实。时间越久,后来的人越难知道哪一部分来自原始证据,哪一部分只是早期AI生成的补全。
验证债务常有几个信号:
- 产出数量持续上升,评审时间却没有增加;
- “先生成,之后再检查”中的“之后”没有明确负责人;
- 同一份AI内容被复制到多个文件和系统;
- 人只检查语言与格式,没有接触原始数据;
- 组织无法说明某个结论最初来自哪里;
- 错误被发现后,只改当前文本,没有修正上游来源。
一旦出现这些信号,提高模型生成速度只会使债务增长得更快。
AI可以参与验证,但不能垄断验证
模型能够为验证提供真实帮助。它可以寻找内部矛盾、列出待核查事实、比较两个版本、生成测试、尝试反例,并把每项主张映射到来源。
“验证链”等研究方法把生成和核查分成不同步骤,显示这种结构可以降低部分幻觉:先写草稿,再提出核查问题,独立回答,最后重写。ACL Anthology:《Chain-of-Verification Reduces Hallucination in Large Language Models》
但AI参与验证不等于验证已经独立。一个模型可能重复自己的假设,多个模型也可能共享训练材料和常见偏见。让三个AI都表示同意,不能替代原始文件、数据库查询、实际测试或领域专家判断。
较稳妥的做法,是让验证尽量改变证据通道:
- 生成文字后,回到原始来源而不是只让模型重读摘要;
- 生成代码后,运行确定性测试和安全扫描;
- 生成计算后,用独立公式或程序重新计算;
- 生成行动建议后,由具有授权和情境知识的人判断;
- 高后果结果由不同角色复核,而不是由原生成者快速浏览。
验证的价值来自独立性,而不是次数。
验证能力必须按风险分配
如果每个低风险句子都要求专家逐字确认,AI带来的效率会被完全抵消。如果所有内容只抽样检查,高风险错误又可能漏过。
解决办法不是取消验证,而是分级。
低风险、可逆、容易发现错误的任务,可以依靠模板、自动检查和抽样。例如内部头脑风暴、格式转换和不进入正式记录的草稿。
中等风险任务需要明确完成标准和指定复核者。例如对外文章、客户说明、常规代码修改和内部分析。
高风险、不可逆或会影响权利与资金的任务,需要原始证据、权限隔离、强制检查点和可追溯批准。例如付款、合同承诺、生产环境变更、医疗或法律决定。
美国国家标准与技术研究院的AI资源中心把测试、评估、验证和确认(TEVV)视为AI风险管理的重要组成,并强调评估应与实际情境、影响和生命周期连接。NIST AI Resource Center
这里最重要的不是采用某个统一检查清单,而是让验证强度与后果相称。
重新设计工作的吞吐量
组织引入AI时常问:“每个人每周能多生产多少?”更有意义的问题是:“每周能多完成多少经过验证、可以采用的成果?”
这两个指标可能相差很大。
如果AI使初稿增加五倍,而审查能力只增加一成,真正的完成量仍受审查限制。大量候选版本甚至会降低效率,因为人需要选择先检查哪一份,并在相似内容之间切换。
因此,AI工作流需要同时限制进入队列的产物:先定义哪些任务值得生成,要求AI在提交前完成自动检查,淘汰缺少证据或未通过测试的结果,再把有限的人类注意力集中在剩余项目上。
代理评估实践也表明,真实任务不能只用一个总分衡量。系统可能完成用户要求,却破坏已有内容;也可能不破坏内容,却没有真正解决问题。评估需要围绕具体失败方式组合程序检查、任务测试和人类判断。Anthropic:《Demystifying evals for AI agents》
结论:生产率必须计算“通过验证的成果”
生成式AI把许多候选产物的成本降得很低。它可以让一个人尝试更多结构、生成更多代码、覆盖更多资料并迅速提出替代方案。这是真实的能力扩展。
但工作成果不是候选产物的数量。只有当事实可以追溯、功能经过测试、风险得到判断、责任人愿意采用时,生成才转化为完成。
因此,AI时代的生产率不能只计算每小时生成多少文字、代码或方案,而应该计算:
在既定风险范围内,每单位时间能够产生多少经过充分验证、可以正式采用并能够纠错的成果。
当生成变得廉价,验证不会成为需要被绕开的麻烦。它会成为决定AI价值能否兑现的核心生产环节。
真正先进的工作系统,不是让AI不停地产出、让人追在后面检查,而是在生成之前定义标准,在生成过程中保留证据,在提交之前自动淘汰明显失败,并把人的判断留给机器无法独立证明的部分。
瓶颈不会因为我们不统计它就消失。看见验证的成本,才是开始真正使用AI,而不是只消费它的产量。
主要资料
- NIST AI Resource Center
- NIST:Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile
- Harvard Business School:Navigating the Jagged Technological Frontier
- EU AI Act Service Desk:Article 14—Human oversight
- Anthropic:Demystifying evals for AI agents
- Shehzaad Dhuliawala et al.:Chain-of-Verification Reduces Hallucination in Large Language Models
继续阅读:浏览《AI进入工作之后》系列文章
了解 Geoffrey Chen 的更多信息
订阅后即可通过电子邮件收到最新文章。