《AI进入工作之后》· 第二季“从个人工具到组织能力”· 第六篇
一个客服AI系统经常引用过期政策。管理层认为模型能力不足,于是购买更强、价格更高的新版本。更换以后,文字更自然,复杂问题的解释也更完整,但过期政策仍然被引用。原因很简单:检索库没有清理,系统仍把旧文件排在前面。
组织升级了最显眼的部件,却没有修复决定结果的工作链。新模型甚至使错误更有说服力。
模型是AI系统的重要组件,但系统结果同时取决于任务定义、数据、检索、工具、权限、界面、人工复核和运行制度。把购买更强模型等同于建立更好系统,就像认为更强发动机一定会让一辆刹车失灵的车更安全。
模型能力只覆盖系统的一部分
更强模型可能改善语言理解、复杂推理、代码生成或长上下文使用。这些进步是真实的。但工作失败可能发生在模型前后。
输入阶段可能取得错误客户、过期合同或不完整记录;工具阶段可能执行错误操作;界面可能隐藏来源和不确定性;人工阶段可能因工作量过大而机械批准;组织阶段可能根本没有明确完成标准。
因此,系统质量可以近似理解为一条链:任何关键环节低于要求,整体就不能通过。优秀模型无法补偿错误权限,也不能自动赋予一份文件制度权威。
采购演示容易集中在模型最强的地方
供应商演示通常使用干净资料、清楚问题和预先准备的成功场景。采购者容易比较回答风格、速度和一般能力,却较少测试数据冲突、工具失败、异常用户和退出安排。
英国政府AI Playbook要求使用适合任务的工具,并把目标、团队、采购、生命周期、人工控制和保证同时纳入建设过程。UK Government:AI Playbook
这意味着采购对象不应只是API或许可证,而应是一项服务能力:在指定情境中达到什么结果;使用哪些数据;出现变化怎样通知;如何提供日志;如何测试;合同结束后怎样迁移。
第三方模型带来供应链而不是替组织承担责任
购买模型可以减少基础研发,却增加对外部组件的依赖。供应商可能改变模型、价格、限制、数据地点或支持政策。即使API名称不变,输出行为也可能变化。
NCSC安全AI开发指南要求组织评估和监控AI供应链,对模型、数据、软件、外部API等资产进行记录,并为关键系统准备替代方案。NCSC:Secure development
供应商负责其承诺的服务和组件;采用机构仍负责判断该组件是否适合自己的用例、怎样配置、允许哪些数据进入,以及最终结果如何被使用。
“这是市场上最好的模型”不是一份风险接受理由。
锁定通常发生在模型周围
许多组织担心无法更换模型,但真正的切换成本来自整个生态:专有工具调用、提示格式、向量库、评测、监控、身份系统、合同和员工习惯。
OECD对AI市场发展的研究指出,模型切换能力是竞争的重要条件,而技术和其他切换成本可能形成锁定。OECD:Developments in Artificial Intelligence Markets
降低锁定不一定要求同时运行多个供应商。组织至少应把自己的知识、测试样本、业务规则和操作记录保存在可迁移形式中;把模型调用隔离在清楚接口后;在合同中明确数据、日志、通知和退出义务。
真正属于组织的资产,不应只是某个供应商账户里的对话历史。
先定位瓶颈,再决定是否升级模型
遇到质量问题时,可以沿工作链诊断。
先确认输入是否正确、完整、当前;再检查检索是否找到权威资料;然后观察模型是否正确使用资料;再看工具调用是否符合权限;最后检查输出怎样被人理解和采用。
只有当错误确实来自模型能力,并且候选模型在本机构测试集中显著改善,升级才有依据。否则,更换模型可能只是把同一失败重新包装。
NIST AI RMF把情境映射放在测量和管理之前,强调先明确用途、受影响者和风险,再选择控制。NIST AI RMF Core 这比从排行榜反推用例更可靠。
好系统应允许模型成为可替换部件
一个成熟架构会保留模型差异,但不让所有业务逻辑依附于某个模型的偶然行为。
系统应有结构化输入输出、独立权限层、权威知识来源、可重复评测、版本记录和失败降级。模型变化时,组织可以重跑测试、比较成本与质量,并在不满足标准时回退。
某些任务可能适合确定性规则或普通搜索,根本不需要生成模型。另一些任务需要模型提出候选,但最终计算必须由可验证程序完成。把非AI组件保留在合适位置,往往比一味升级模型更可靠。
更强模型还可能改变原有控制的含义
模型升级不只是把同一答案变得更准确。新模型可能更愿意调用工具、能够处理更长资料、采用不同格式,或者对原来有效的限制语句产生不同反应。一个为旧模型设计的长度限制、关键词过滤或人工界面,未必仍然控制新模型的行为。
因此,升级应被当作受控变更:冻结当前配置和基线结果,在隔离环境中比较关键任务与失败案例,检查数据流和工具权限,并决定是否需要修改培训和人工复核。即使平均质量提高,只要出现新的严重失败类型,也不应直接替换生产版本。
更强能力带来的新用途请求也要另行评估。采购了一种更强组件,不等于原用例自动获得扩大目的和权限的授权。
每次升级还应预先确定回退窗口和负责决定回退的人,避免发现异常后无人敢恢复旧版本。
系统设计还必须包含退出能力。模型供应商改变价格、数据条款、功能或服务区域时,组织应知道哪些流程会停、哪些记录能够导出、替代方案需要多久验证。没有可移植的提示词、评测集、接口约定和知识资产,所谓“最佳模型”会变成昂贵的依赖。采购评估因此不只比较当前质量,也要比较迁移成本、合同保障和在供应中断时维持关键工作的办法。
结论:采购的是组件,建立的是能力
购买更强模型可以带来重要进步,但它不会自动整理资料、定义任务、设置权限、建立评测或安排责任。
组织应采用以下判断:
只有当模型升级修复了已经确认的能力瓶颈,并在完整工作流评测中改善了可采用结果,它才构成系统升级;否则,它只是组件更换。
好的AI系统不是永远绑定最强模型,而是在模型、知识、工具和人之间形成可验证、可维护、可替换的结构。供应商提供能力的一部分,组织必须建立其余部分。
主要资料
- UK Government:Artificial Intelligence Playbook
- NCSC:Guidelines for secure AI system development
- OECD:Developments in Artificial Intelligence Markets
- NIST AI Resource Center:AI RMF Core
继续阅读:浏览《AI进入工作之后》系列文章
了解 Geoffrey Chen 的更多信息
订阅后即可通过电子邮件收到最新文章。