排名第一的AI模型,真的更智能吗?

怎样理解基准测评、用户偏好、冲榜压力与市场占有率

一个新模型发布以后,最容易传播的往往不是它怎样训练,也不是它在真实工作中有哪些限制,而是一张表。表格中排列着MMLU、GPQA、SWE-bench、AIME或某个对战平台的成绩,几个粗体数字标出领先者。很快,社交媒体上便出现一个简化结论:这个模型已经超过另一个模型。

用户因此更换订阅并不奇怪。面对十几个不断更新的模型,很少有人有时间亲自做系统测试。分数提供了一种罕见的可比性,也迫使模型开发者把进步说得更具体。问题出在下一步:我们很容易把“在几项测评中领先”理解成“这个模型整体更智能”,随后又把产品流量或市场占有率当成第二次证明。

这些数字都不是没有意义。它们测量的对象不同,却经常被压在同一条名为“谁最好”的轴线上。要判断一个大语言模型或AI工具,首先需要把这条轴重新拆开。

证据 直接说明什么 不能单独证明什么
基准测试 系统在规定任务和条件下的表现 脱离任务的总体智能,以及真实使用中的可靠程度
人类偏好排名 某组投票者更愿意选择哪些输出 专业正确性与高风险任务适用性
市场占有率 产品在特定渠道中的采用情况 基础模型能力领先
用户自己的任务测试 工具是否适合一组具体工作 对其他用户和其他任务的普遍优越性

一个测评成绩究竟包含什么

基准测试并不是把仪器接到模型内部,直接读出它拥有多少智能。测试者准备一组任务,规定模型怎样接收题目、可以使用哪些工具、获得多少推理时间或计算预算,再用某种规则评定输出。一次成绩更接近下面这个关系:

测评结果 = 具体模型 × 测试材料 × 交互方法 × 计算与工具预算 × 评分规则 × 测试时间

这里任何一项改变,结果都可能变化。同一基础模型使用不同的系统提示、推理强度、搜索工具或代理框架,可能得到明显不同的成绩。多次采样以后取最好结果,与只允许一次回答也不是同一个实验。若比较的一方使用完整工具链,另一方只是裸模型,排行榜实际上已经在比较两个系统。2024年ACL发表的排行榜敏感性研究发现,在常见选择题基准中,仅仅改变选项顺序或答案提取方式,模型名次最多就可能移动八位。这不是说所有排行榜都如此不稳定,而是说明测试细节必须成为结果的一部分。

NIST关于AI基准测评统计有效性的报告把这个问题表述得很清楚:基准测试通常试图以一组标准任务预测系统在目标任务上的表现,但分数提高并不必然意味着相近任务或真实场景中的表现同步提高。NIST的AI风险管理框架进一步要求,测量方法应当与部署情境相连,并说明超出原测试条件以后,结果还能推广到什么程度。

因此,一项数学测评可以有力说明模型解决某类数学题的能力;代码测试可以观察它是否修复了测试所覆盖的软件问题。这些都是实在的能力,不应因为题目像考试就被轻视。不过,测评尚未涉及的东西不能从高分中自动推导出来。模型会做选择题,并不说明它能够在一份混乱的真实文件中发现问题;能够生成通过单元测试的补丁,也不保证修改易于维护、安全,或者符合没有写进测试的业务要求。

它更像考试能力吗

把模型测评类比为考试,是一个有用但不完整的说法。

考试从来不只是“测到了”或“什么也没测到”这两种情况。一份设计良好的考试能够有效检查某些知识和推理能力,只是它的结论有范围。数学竞赛成绩可以说明一个人在这类问题上的表现,不能单独概括他的研究判断、协作能力和生活智慧。模型基准也一样。测评题目是对某种能力的操作化:为了让“推理”“知识”“编程”这些宽泛概念可以观察,研究者必须把它们变成有限题目和评分规则。

真正需要追问的是测量有效性。题目是否代表我们关心的能力?评分规则会不会错过正确但形式不同的答案?测试集是否太容易,已经无法区分前沿模型?它是否包含错误标签?模型可能在训练中见过多少相同或相近内容?

这些并非理论上的担忧。有关现代语言模型基准污染的研究已经发现,公开测试材料可能进入庞大的训练语料;在训练数据不透明的情况下,污染又很难排除。2024年NAACL发表的基准污染研究提出了面向黑箱模型的检测方法,并在若干公开测评中发现值得警惕的记忆迹象。另一项ICLR研究说明,即使无法查看模型权重和训练集,也可以用统计方法为某些测试集污染提供证据。Stanford的HELM项目则试图通过统一条件、公开原始输出以及同时观察准确性、稳健性、校准和效率等多种指标,减少单一成绩造成的误导。

“考试能力”因此不是对基准结果的否定。它是一项范围说明:模型在被安排好的条件下完成了哪些任务。若新的、未公开的同类题目仍然表现良好,成绩更可能反映可迁移能力;若换一种表述、增加几步真实操作或离开熟悉题型以后迅速下降,原来的高分就更接近对测试形式的适应。

至于“模型本身的智能水平”,目前并不存在一个得到普遍承认、可以把语言理解、视觉、长期规划、事实可靠性、社会判断和工具操作全部压缩进去的单位。把多项成绩加权成一个总分当然可以,但权重来自评测者对“什么重要”的决定,而不是从模型内部自然生长出来的常数。

当排行榜开始影响训练

公开测评会进入一个反馈回路。分数影响媒体报道和用户选择,用户迁移又影响收入、开发者采用和投资判断。模型公司由此获得强烈动机,去改善排行榜所测量的能力。

这个过程有明显的积极作用。一个受到广泛使用、方法透明而且尚未饱和的基准,可以让研究团队发现弱点,也让外界检验厂商的宽泛宣传。代码执行、事实正确率、特定安全风险和多语言能力如果从口号变成可以重复的测试,竞争就有了技术内容。用户偏好的变化还会惩罚停滞:某家公司即使拥有品牌和分发优势,也不能完全忽略产品实际变差带来的流失。

风险来自测量目标和真实目标逐渐分离。一个公开题库的商业影响越大,围绕它进行后训练、提示优化、工具配置和结果筛选的价值就越高。这里不必假定有人直接把答案塞进训练集。团队只要长期围绕几个著名基准分析失败案例,模型就可能越来越熟悉它们偏好的题型与表达方式。厂商还可以挑选有利测评、采用不同推理预算,或者只公布最好的一组运行结果。这些做法有些属于合理工程优化,有些会越过公平比较的边界,中间存在很大的灰色地带。

“冲榜”是否伤害真正的模型训练,取决于测评与现实任务是否保持联系。如果一个编程基准要求模型进入代码库、定位错误、修改文件并通过可执行测试,围绕它提升能力可能带来广泛收益。若测评已经饱和、题目泄漏,或者评分只奖励一种表面形式,继续追逐分数就会挤占更重要但不容易展示的训练工作。

这也是为什么基准需要更新、保留私有测试集、使用新近产生的任务,并接受独立复现。2026年的Stanford AI Index指出,前沿模型正在以很快速度追上新测评,原本希望多年有效的基准可能几个月便接近饱和。排行榜不是一次建成后永久有效的尺子。被测对象会学习这把尺子,尺子也必须继续演化。

人类偏好排行榜测到了什么

传统题库并非唯一选择。Chatbot Arena一类平台让两个匿名模型回答同一个用户问题,再由用户选择更喜欢的回答。该项目的论文说明,这种成对比较能够从大量真实提示和众包投票中形成相对排名。它比固定选择题更接近日常对话,也能捕捉文风、帮助程度和指令遵循等难以用标准答案评分的差异。

不过,“用户更喜欢”仍然不是“这个回答更正确”的同义词。投票者可能偏爱清楚、友好和完整的表达,这正是产品质量的一部分;他们也可能被自信语气、较长答案或漂亮格式影响。参与投票的人群、提交的问题类型和两种答案出现的位置都会塑造结果。排行榜若给出了置信区间,接近的名次通常不应被解释为稳定的能力等级。

人类偏好数据最适合回答:在这个平台收集到的交互中,用户通常更愿意选择哪个输出。它不能独立证明某个模型更适合医学核查、法律研究、长期软件维护或一个人的双语写作。那些任务需要领域专家、可验证结果和更长的工作过程。

市场占有率衡量的不是模型,而是采用

市场占有率当然是有效指标,前提是先说清它是哪一个市场的占有率。

网站访问份额、手机月活跃用户、付费订阅、API调用量、企业支出和嵌入第三方软件的使用次数,会产生完全不同的图景。Similarweb对自身数据来源的说明显示,流量估计来自直接测量、合作伙伴及匿名设备数据等来源。这类数据适合观察网站和应用的使用趋势,却不能自动覆盖API、办公软件内置功能、企业内部部署或一个品牌背后实际调用的多个模型。企业调查又取决于样本地区、公司规模以及“采用”究竟按合同、支出还是生产调用计算。

市场表现受到模型能力影响,但分发位置也很重要。一项AI功能可能因为预装在搜索、办公套件、操作系统或开发平台中迅速获得使用;另一个模型可能技术能力很强,却没有面向普通人的成熟产品。价格、免费额度、品牌熟悉度、地区可用性、数据政策、企业采购资格和转换成本都会改变占有率。市场份额把这些因素共同造成的结果记录下来,并没有把它们分离。

这并不使市场数据失去价值。持续使用和付费说明产品解决了足够多的真实问题;大规模采用还会带来错误报告、开发生态和改进资金。对于选择长期依赖的工具,服务稳定性、周边整合和组织支持本来就是合理标准。有时,一个能力略弱却可以可靠部署、价格合适并且同现有系统整合的产品,确实比实验室成绩更高的模型有价值。

但市场占有率不能承担“谁更智能”的证明责任。它比较的是产品或供应商在特定渠道中的采用结果,而不是受控条件下的模型能力。早期进入市场和默认分发形成的优势还可能长期保存,使占有率落后于技术变化。用户可以把市场份额视为生态成熟度和采用风险的证据,不能把畅销直接换算成智力。

大众跟随排行榜,会改善模型还是带偏训练

两种作用会同时发生,最终结果取决于用户把什么样的成绩变成市场奖励。

如果用户关注来源清楚、能够独立复现并与实际任务相关的测评,偏好转移会促进真实竞争。开发者会发现,只有发布含糊的“领先”声明已经不够,还要解释模型版本、工具权限、测试预算和代价。真实使用中的留存、投诉和失败案例又能补充实验室没有覆盖的部分。

如果大众只转发一个总分和第一名,市场就会放大排行榜原有的偏差。模型公司得到的信号不是“让系统在复杂世界中更可靠”,而是“确保发布日有几个醒目的粗体数字”。短期用户迁移还可能把很小的分数差异变成过大的商业后果,从而鼓励选择性披露与频繁制造新榜首。

所以,问题不在于大众是否应该看测评,而在于市场能否奖励更好的测评文化。媒体和用户可以要求测试条件完整公开,区别独立结果与厂商自报成绩,关注多次运行的波动,也看成本、速度和失败方式。分数差距很小时,与其急着换工具,不如先验证它是否会改变自己的工作结果。

普通用户可以怎样判断

阅读一个模型测评时,可以先找出五件事,而不是先看名次:

  1. 测试的对象是谁。 是基础模型、带系统提示的聊天模型,还是能够搜索、运行代码和反复尝试的代理系统?具体模型快照是否明确?
  2. 任务与自己的需要有多近。 数学题、知识选择题、盲投偏好和真实代码修复分别说明不同问题。相关性越远,分数越只能作为背景信息。
  3. 比较条件是否一致。 推理预算、采样次数、工具、上下文、提示与时间限制是否相同?如果不同,这种差异是否属于产品本来就提供的能力?
  4. 分数怎样产生。 是程序判定、专家评价、普通用户投票,还是另一个大模型担任裁判?是否报告不确定性、失败案例和无法评分的项目?
  5. 有没有污染、饱和与选择性报告的风险。 测试集何时建立,是否公开,独立团队能否复现,厂商是否只挑选了对自己有利的项目?

真正要长期使用或采购一个工具时,还需要加入自己的小型测评。材料不必很多,十几到几十个经常出现、结果可以核查的任务已经比随机聊天更有价值。测试可以记录一次完成率、人工核查时间、严重错误、成本和延迟。开放式写作可以盲看输出,事实任务应回到原始来源,代码则运行项目自己的测试并审查改动。私有材料还有一个优势:模型较难事先适应这些题目。

OpenAI的评测指导要求先描述任务,再用测试输入运行评测并分析结果。具体平台会更新,这个基本思路不只适用于开发者。普通用户也可以保留一小组自己的“回归题”:当模型或订阅计划改变时重新测试,而不是依靠对某次精彩回答的记忆。

最后要把AI工具和模型再次分开。一款工具是否值得使用,还包括资料能否进入、结果能否导出、上下文能否延续、隐私与权限是否合适,以及错误是否容易纠正。基础模型略强,并不保证承载它的产品完成整个工作闭环时仍然更好。

分数是一种证据,不是一项判决

模型测评最像考试的地方,是它只能在设定题目和规则之后观察表现。这个类比提醒我们限制结论,却不应成为否定成绩的借口。持续在新题、不同表达和真实任务上取得进步,仍然是能力增强的重要证据。

更准确的做法,是拒绝把任何一个代理指标升级成智能本身。基准成绩告诉我们模型在规定条件下能完成什么;人类偏好显示某类用户更喜欢哪些输出;市场占有率记录产品在特定渠道中获得了多少采用。三者可以互相印证,也可能彼此冲突。

当它们冲突时,不必急着寻找一个更大的总分把差异重新抹平。先回到使用目的:任务是什么,错误代价有多大,结果怎样核查,工具是否能够稳定进入工作过程。对一个真实用户来说,最好的模型未必是平均排行榜上的第一名,而是能够在他的任务分布中,以可以接受的成本持续交付可检查结果的那个系统。

主要资料

继续阅读:《AI工具怎样选?》系列目录


了解 Geoffrey Chen 的更多信息

订阅后即可通过电子邮件收到最新文章。