AI在基准测试中表现很好,为什么到了真实工作仍可能失败?

《AI进入工作之后》· 第二季“从个人工具到组织能力”· 第五篇

一家机构选择了在公开基准中排名很高的模型,用它处理内部技术请求。测试团队准备了五十道标准问题,模型答对率很高。上线后,员工却发现系统经常在真正困难的请求上失败:资料分散、术语含义依部门不同、用户会省略重要背景,正确答案还可能需要调用多个系统。

基准没有作假,模型也没有突然变差。测试回答的是“在规定输入和评分方法下,系统表现怎样”;真实工作问的是“在混乱资料、真实用户、现有权限和后果中,这条工作链能否完成”。两者之间缺少的不是更多分数,而是情境。

基准为什么仍然重要

基准把相同任务交给不同系统,使用统一方法比较。它们适合追踪能力变化、筛选候选模型、发现某类明显弱点,也能让供应商主张接受外部检查。

没有标准化测试,组织只能依赖演示和主观印象。问题不是使用基准,而是把基准成绩当成采用决定。

一个模型在数学、编程或问答测试中领先,不能证明它会读取本机构的资料、遵守权限、识别未说明的例外或产生可审计记录。基准测量的是被设计出来的属性,不是“总体可靠性”。

真实工作增加了四层变化

第一是输入变化。员工的问题含糊、拼写不一,文件过期,关键信息可能缺失。

第二是系统变化。实际产品包含检索、提示、工具、权限、缓存和界面,模型只是其中一层。

第三是人机互动变化。使用者会过度信任、误解提示、反复尝试,也会用AI完成测试者没有预想的任务。

第四是后果变化。基准中的错误失去一分,生产中的错误可能泄露资料、延误服务或进入正式决定。

NIST的ARIA计划明确把评测分为模型测试、红队测试和现场测试,并强调在现实情境中观察人与AI互动和影响。NIST:Assessing Risks and Impacts of AI 其试点评测报告进一步描述了情境、对话标注和测量树等方法。NIST:ARIA Pilot Evaluation Report

测试集容易忽略“工作怎样失败”

如果评测只准备正常输入,它会高估系统在边缘条件下的能力。真实测试应包含旧文件、矛盾规则、缺失资料、无权访问、恶意内容、工具超时和无法完成的请求。

还要检查系统是否知道何时停止。一个在所有问题上都给出答案的模型,可能比能够明确说“证据不足,需要人工确认”的模型得到更高表面完成率,却给组织带来更大风险。

评分也应区分错误类型。客户信件中的标点问题,与错误说明法定权利不能使用同一个平均准确率抵消。高后果失败应被单独设为发布阻断条件。

真实专家任务为何与标准任务不同

METR在2025年研究经验丰富的开源开发者处理自己熟悉的大型代码库,发现当时工具使参与者平均用时增加。研究者特别指出,常见编码基准为了可规模化测试,往往使用自包含任务,而真实任务需要大量既有情境。METR:Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity

到2026年,工具和使用习惯发生变化,METR也调整了后续实验设计,并明确讨论样本选择和参与者不愿在无AI条件下工作带来的偏差。METR:Changing our Developer Productivity Experiment Design

这两份材料共同说明:能力会变化,评测方法也会被使用环境反过来影响。组织不能把一个旧分数永久写入采购理由。

从“选模型”转向“验证用例”

一个可用的组织评测应从真实工作记录中抽取任务,去除不必要个人信息,并保留难度与例外。测试对象不是裸模型,而是完整配置:系统提示、检索库、工具、权限、界面和人工步骤。

评测至少需要四组指标:任务是否正确完成;重要限制是否遵守;需要的证据和记录是否保留;当系统不确定或失败时,是否正确升级。

还应按用户经验、任务类型和受影响群体拆分结果。平均成绩可能掩盖系统对少数复杂案件持续失败。

NIST关于AI测试、评估、验证与确认的工作强调,测量方式会随系统运行情境改变。NIST:AI TEVV 这意味着评测不是模型采购前的一次考试,而是用例运行中的持续功能。

先影子运行,再逐步赋予后果

上线不应从测试环境直接跳到自动决定。系统可以先在“影子模式”中运行:对真实任务生成结果,但不影响现有流程。组织比较AI建议、原人工决定和最终结果,记录差异及原因。

随后可以让AI承担草拟和低风险分类,仍保留明确人工批准。只有当错误率、错误类型、监控和补救达到约定标准时,才考虑扩大权限。

生产以后继续抽样评测,并在模型、提示、资料或用户群变化时重新测试。没有变化记录,就无法知道一次性能下降来自哪里。

评测集本身也必须被治理

真实任务测试比公开基准更贴近工作,但它也会过期。员工会学会测试中的常见案例,政策和客户群会变化,新的失败模式可能从未进入样本。如果团队只反复优化同一组题,系统可能在评测中进步,却没有改善现实。

因此,测试集需要来源、版本、所有者和更新规则。应保留一部分从未用于开发的独立样本,定期从投诉、人工改正和运行异常中加入新案例,并防止测试材料泄露敏感信息。高风险失败不能在加入测试以后就被视为已经解决,还要证明相应的工作流和补救机制已经改变。

评测也要记录谁给出了正确答案以及依据什么。专家之间存在合理分歧时,不应强行生成一个虚假的标准答案,而应测试系统能否发现争议并升级。

真实评测还应预先规定失败预算。不是所有错误都具有同样后果:内部草稿中的措辞问题可以低成本修正,错误拒绝客户资格或泄露资料则不能用平均准确率抵消。组织应为不同错误类型设可接受上限、立即停止条件和恢复步骤。这样,评测结论才会从“整体表现不错”变成一项与具体用途和后果相称的授权。

结论:基准用于比较,工作评测用于授权

基准成绩是选择候选技术的重要证据,但它不能直接授予系统进入真实工作的权力。

组织应坚持:

公共基准回答模型在标准任务上能做什么;组织自己的情境评测回答这套AI系统在特定工作、用户和后果中可以被允许做什么。

只有第二种评测能够支持权限、上线和监督决定。模型越强,组织越不能用通用分数替代对真实工作链的验证,因为更强的生成能力也会使错误更容易进入正式流程。

主要资料

继续阅读:浏览《AI进入工作之后》系列文章


了解 Geoffrey Chen 的更多信息

订阅后即可通过电子邮件收到最新文章。