AI看起来很有把握,为什么仍然可能完全错误? / Why Can AI Sound Confident and Still Be Completely Wrong?

简短答案

因为流畅语气和事实正确来自不同机制。生成式AI的核心任务,是根据上下文产生看起来合适的下一个内容,而不是在每句话输出前自动完成事实核查。它可以学会人类表达确定性的方式,却没有因此获得与语气等量的证据。答案越完整、解释越连贯、引用格式越逼真,人反而越容易把“像答案”误认为“已被证明”。

语言模型首先预测表达,而不是证明事实

大型语言模型从大量文本中学习词语、概念和结构之间的统计关系。收到问题后,它根据提示与已有上下文生成后续内容。这种机制能够重建很多真实知识,也能完成复杂推理,但输出目标和数据库查询并不相同:模型需要产生符合模式的答案,不必先找到一条可审计的记录才允许说话。

当训练材料包含稳定、常见并且问题清楚的事实时,语言模式往往指向正确答案。当问题罕见、含糊、涉及最新变化,或需要拼接几个相似实体时,最符合语言模式的延续可能并不符合现实。模型仍然需要继续生成,于是会用合理的人名、日期、机构和解释填补空白。

NIST把这种现象称为“confabulation”:生成式AI自信地呈现错误或虚假内容,包括与提示不符、内部矛盾,以及虚构的逻辑或引用。NIST指出,这是生成模型按训练数据统计分布产生内容的自然风险,在开放式长回答与需要高度专业背景的领域尤其值得注意。NIST AI 600-1: Generative AI Profile

“我不知道”不是默认结果

传统数据库查不到记录时,可以返回空值;计算器接收到非法表达式时,可以报错。对话模型则受到“尽量回答”的训练与产品设计影响。除非系统特别校准、提供拒答机制,或者提示明确要求指出证据不足,它可能更倾向于形成一个完整回答,而不是停在空白处。

即使模型说“我不确定”,这句话也不是经过测量的概率保证;即使它说“肯定”,也可能只是所生成语体的一部分。自然语言中的信心词不是可靠的仪表。真正的置信度需要针对具体任务、数据分布和评价方法校准,而普通聊天界面通常没有向用户提供这样的量表。

详细解释可能是在解释一个错误答案

人们常用“让AI一步一步解释”来提高可靠性。解释可以暴露部分逻辑,也能帮助检查,但不能把错误前提变正确。模型可能先生成一个答案,再形成一条与答案相配的推理叙述;叙述内部连贯,却使用了错误事实、遗漏条件或无效规则。

这在法律、历史、技术故障和医疗问题中很危险。一个虚构案例可以配上看似准确的案号和判词;一个不存在的软件选项可以配上合理菜单路径;一个错误诊断可以配上真实存在但不适用于该人的症状解释。细节增加了可读性,也增加了未经核实内容的说服力。

因此,检查过程应从结论与关键前提出发,回到独立来源,而不是只评价推理写得是否漂亮。解释是待验证对象,不是自动验证器。

模型会把相近事物拼成一个不存在的事物

许多错误不是凭空随机,而是“邻近事实”的错误组合。模型可能把一位作者的书名与另一位作者的年份组合,把两个相近产品的功能放在同一个版本,把一项真实法律原则配给错误司法管辖区。这些部分分别很像真,组合却不存在。

这种错误比明显胡言乱语更难发现,因为读者能识别若干熟悉元素,便对整体产生信任。验证时不能只问“这些词我是否听过”,而要核对它们之间的关系:这个作者是否真的写了这篇文章;这个功能是否存在于指定版本;这项规定是否在目标地区与日期生效。

知识截止、检索和工具会改变错误类型

没有联网或资料工具时,模型可能依赖训练时学到的内容,无法可靠知道最新价格、负责人、法律和软件版本。连接搜索或企业资料后,答案可以获得更及时的依据,但风险没有消失,只是发生变化:检索可能漏掉关键来源、选中不可靠网页、把旧版本与新版本混在一起,或正确找到材料却错误总结。

工具还会带来权限与执行风险。模型可能正确理解问题,却调用错误账户、选择错误文件或把不可信网页中的指令当成任务的一部分。因此“有搜索”不等于事实已核实,“有引用”也不等于引用支持这句话。要检查来源本身、日期、适用范围,以及从来源到结论的推导。

有些问题本来就没有一个客观答案

“最好的候选人是谁”“这封邮件是否礼貌”“这个项目值不值得做”包含价值与偏好。AI可以生成一个非常确定的选择,但确定性可能来自它暗中补上的标准,而不是事实错误。若团队没有先定义目标,模型的默认偏好会被误认为客观判断。

遇到这类问题,应要求系统列出采用的标准、不同标准下结果怎样变化、哪些事实未知,并保留人的价值选择。把主观问题包装成精确评分,会让争议从看得见的讨论变成看不见的权重。

为什么人特别容易相信流畅答案

流畅降低阅读成本。完整句子、专业词汇、清楚列表和礼貌语气会形成能力信号;即时回复又让人没有经历专家查证所需的等待,因此容易忽略证据过程。只要答案与预期一致,确认偏误还会进一步减少核查动机。

界面也会影响判断。当系统只显示一个答案,而不显示替代解释、证据空缺和历史错误率,用户看到的是结果而不是不确定性。把“可能出错”写在页脚,不足以抵消每一句都以确定语气出现的影响。

解决方法不是训练自己永远不信AI,而是把信任从语气转移到可观察信号:是否提供可打开的原始来源;来源是否直接支持主张;事实能否独立重现;模型是否说明缺失资料;答案是否经得起反例和边界条件。

把回答拆成三层检查

第一层是可直接核实的事实:姓名、日期、数字、法规、产品功能、引文。这些应回到权威或一手来源。第二层是从事实作出的推断:原因、趋势、风险与比较。检查是否存在替代解释,证据是否足以支持强度。第三层是建议:应该购买、聘用、治疗或采取行动。建议还需要价值目标、成本、个人背景和后果评估。

一个答案可以在第一层大致正确,却在第二层过度推断,第三层给出不适用建议。只做事实抽查不能验证整条决策链。

怎样让AI更诚实地显示边界

可以要求它把已知事实、假设、推断和未知分别列出;对每个关键事实给出可以打开的来源与具体支持位置;说明答案在哪些条件下会改变;提出最强反例;对于找不到证据的地方明确留空。若有原始文件,应要求引用页码或段落,并随机回查。

这些提示能改善可检查性,但不是保证。模型也可能虚构“未知”、页码和来源,所以仍需独立验证。更可靠的系统设计包括:限制回答只能基于指定资料、对关键字段使用确定性查询、让引用与文本自动对照、在证据不足时强制停止,以及用真实失败案例持续评估。

我的判断:语气只能告诉你它会写,不能告诉你它知道

我会把一段AI回答视为一位速度极快但证据习惯不稳定的助手交来的工作稿。结构、候选解释和检查思路可以立即使用;决定性事实必须有独立凭据。越是答案读起来“刚好就是我想听的”,越需要问它可能遗漏了什么。

信任不应是一次性选择“信或不信”,而应按主张分配。一篇答案中,通用定义可能风险较低,最新法律条文需要实时官方来源,个人医疗建议则不能由通用输出决定。局部信任比整体崇拜或整体排斥都更成熟。

一分钟检查清单

  • 这句话是事实、推断还是建议?
  • 答案是否涉及最新、罕见、专业或容易混淆的内容?
  • 引用能否打开,并直接支持相邻主张?
  • 是否可能把两个相似人物、产品、规则或版本拼在一起?
  • 详细解释是否建立在未经核实的前提上?
  • 有哪些资料模型没有看到?
  • 如果答案与我的预期相反,我是否会更认真核查?
  • 采取行动前,哪一个关键事实必须由独立来源确认?

结论

AI的自信语气来自语言生成能力,事实可靠性则取决于数据、任务、检索、工具和验证。两者相关但绝不等同。最危险的错误往往不是荒谬句子,而是由真实碎片组成、解释完整、正好符合期待的错误答案。不要用语气判断可信度;把答案拆成事实、推断和建议,逐层寻找证据与边界。

相关问题

继续阅读本系列: 《AI可以相信到什么程度?》全部文章


了解 Geoffrey Chen 的更多信息

订阅后即可通过电子邮件收到最新文章。