每项任务都用最强模型,为什么可能是错误的组织设计?

《AI进入工作之后》· 第二季“从个人工具到组织能力”· 第七篇

一个组织建立统一AI平台,把翻译标题、分类邮件、检查表格、起草合同和分析复杂投诉全部交给同一个最强模型。设计看起来简单:一份合同、一个接口、一套培训,也不必争论应该选哪个模型。

几个月后,低风险任务的成本不断增加,简单分类也要等待较长响应;敏感资料经过一个本来不需要接触它的通用路径;系统一旦故障,所有AI工作同时停止。更重要的是,组织仍然要为高风险任务增加人工检查,因此最强模型并没有消除流程差异。

“默认使用最强模型”把模型能力当作唯一目标,忽略了工作还受成本、延迟、数据、可验证性和后果约束。

任务需要的不是最大能力,而是足够且合适的能力

把客户邮件分成三个明确类别,与解释一份含有冲突条款的复杂合同,不需要相同系统。前者可能由规则、普通分类器或较小模型可靠完成;后者需要更强推理、更多上下文和专业复核。

如果简单任务使用通用大模型,组织支付了不需要的能力,也增加了输出变化和验证负担。相反,如果高后果任务为了节省成本使用不足系统,错误可能超过节省。

“足够”必须由用例测试决定,而不是由模型尺寸推断。一个小模型在窄任务上可以稳定胜任,一个大模型在资料错误时仍会失败。

模型选择至少要比较五个维度

第一是质量:在本机构真实样本和失败条件下能否达到标准。

第二是延迟:用户等待时间是否影响流程,批处理是否允许更慢但更全面的运行。

第三是成本:不仅包括调用价格,也包括检索、工具、复核、监控和失败修复。

第四是数据与部署:资料在哪里处理,保留多久,是否需要本地或专用环境。

第五是可控性:输出能否结构化、测试、限制和回退。

Google Cloud关于代理系统设计的官方指导建议根据任务是否开放、延迟与性能、成本和人工参与选择架构,并指出可预测、结构化或单次模型调用即可完成的任务未必需要代理系统。Google Cloud:Choose a design pattern for your agentic AI system

这一原则同样适用于模型:复杂度应来自任务需要,而不是平台偏好。

分层路由比“一刀切”更接近真实工作

组织可以建立任务分层。确定性规则先处理可以明确计算的部分;较小或较快模型承担低风险分类和格式转换;更强模型处理复杂、开放的分析;涉及权利、重大资金或公共承诺的步骤进入专业人员决定。

系统还可以在不确定时升级:如果输入不完整、模型置信条件不满足、规则冲突或任务属于高风险类别,就转向更强模型或人工,而不是在同一路径上强行完成。

OECD对AI模型市场的分析区分了不同能力与价格层级,并强调切换能力对竞争的重要性。OECD:Developments in Artificial Intelligence Markets

这种市场差异只有在组织能根据任务路由时才会成为实际选择;否则,采购一个默认模型就形成新的单点依赖。

多模型也会增加新的复杂性

分层设计不是免费午餐。不同模型的输出格式、限制、更新和数据条款不同。路由器本身可能把任务分错,低风险分类也可能被攻击者操纵,使高风险内容进入较弱路径。

因此,组织不应为了技术时髦而建立十几个模型。每增加一个组件,都需要明确用途、测试、监控、供应商管理和退出办法。

更实用的起点可能只有三层:非生成式工具;一个经过测试的常规模型;一个用于复杂任务的增强路径。随着证据出现再细分。

NIST AI RMF强调按情境与风险决定管理活动,而不是对所有AI使用同一控制强度。NIST AI RMF 1.0 模型分工也应遵循这种比例原则。

最强模型应被视为稀缺专业资源

当最强模型被所有小任务占用,组织可能在真正需要它时面临成本、配额或延迟压力。把它放在升级路径中,可以把较高能力集中到复杂例外、重要综合和难以验证的任务。

这类似组织中的专家:不是每张表格都交给最高级专业人员,但系统需要知道什么情况必须升级。路由的关键不是节省每一次调用,而是保护高能力资源并使例外可见。

英国政府AI Playbook把“使用适合工作的工具”列为原则之一,也要求理解AI限制、生命周期和人工控制。UK Government:AI Playbook

评测应比较“完成任务的总成本”

如果一个便宜模型产生更多错误,需要大量人工返工,它可能并不便宜。如果最强模型把低风险任务准确率从98%提高到98.5%,但成本和延迟增加数倍,收益也可能不合理。

所以,比较单位应是通过验证的工作结果:每个合格结果的模型、基础设施、人工检查和错误成本是多少;发生严重失败的概率和补救时间是多少。

这些数据应按任务层记录。组织才能知道哪些任务值得升级,哪些可以降级,哪些根本不应使用生成模型。

路由决定本身需要可以解释和审计

当系统自动决定把任务交给哪个模型,它已经在分配成本、数据和风险。组织需要知道路由依据是什么、出现误分时怎样发现,以及员工能否要求升级。

任务分类应尽量使用可观察条件,例如资料敏感等级、金额、是否对外发送、是否涉及个人权利,而不要完全依赖另一个不可解释的模型判断。随机抽样各层结果,可以发现复杂任务被错误留在低层、低风险任务被不必要升级等问题。

路由记录还应保存当时使用的规则和模型版本。发生事故时,组织不仅要检查回答,还要检查为什么任务进入了那条路径。没有这层记录,多模型系统只会把单一模型的不透明变成一次不可见的接力。

分流器本身也会犯错,因此不能被当作无形的交通警察。组织应记录任务为何被送往某个模型,测试边缘输入,并允许用户在风险被低估时升级。对高后果任务,宁可使用可解释的保守规则,也不要让另一个不透明模型暗中决定应由谁判断。模型分工只有在路由错误可见、可复核并能迅速纠正时,才真正降低风险。

结论:模型分工应服从工作分工

最强模型可以是组织的重要资源,但把它设为所有任务的默认选择,会增加成本、集中故障并掩盖不同任务需要的控制。

更合理的判断是:

对每类任务使用能够在其风险、质量、延迟、数据和成本条件下稳定达标的最小充分系统,并为不确定和高后果情况建立清楚的升级路径。

这不是追求“小模型优先”,而是拒绝用一个能力排名替代组织设计。真正成熟的AI平台知道什么时候无需AI、什么时候常规模型足够,以及什么时候必须动用更强模型和人的判断。

主要资料

继续阅读:浏览《AI进入工作之后》系列文章


了解 Geoffrey Chen 的更多信息

订阅后即可通过电子邮件收到最新文章。