AI总结长文档时最容易遗漏什么? / What Does AI Most Often Miss When Summarising Long Documents?

简短答案

AI最容易漏掉不显眼但会改变结论的内容:限定条件、例外、否定、时间和适用范围、脚注、少数意见、跨章节关系,以及文档中间位置的证据。摘要通常保留主题,却可能丢失责任和决策所需的精度。可靠做法不是要求“总结得更详细”,而是按结构分段提取事实,建立主张到页码的对应,再单独检查冲突、例外、数字和缺失部分。

摘要是一种有目的的删除

任何摘要都会舍弃内容。问题不是有没有遗漏,而是遗漏是否符合读者目的。给新同事了解背景的摘要,可以省去大量程序细节;用于签合同、批准预算或处理事故的摘要,遗漏一个终止条件、货币单位或反对意见就可能改变行动。

因此在上传文档之前先定义摘要用途:为了快速导航、决定是否阅读全文、比较方案、提取义务,还是形成正式记录。没有用途,模型通常依据文本显著性和常见写作模式选择内容,而不是依据你的损失函数。

最危险的摘要往往不是明显错误,而是大体正确、足够流畅,以至于读者不知道哪些部分没有进入答案。

限定条件和例外最容易被压平

原文可能写“在获得书面同意并完成安全评估后,可以使用”,摘要却变成“可以使用”。“多数受访者支持,但样本不包括偏远地区”可能变成“受访者支持”。一个短小的if、unless、except或subject to,决定了陈述何时成立,却在追求简洁时首先消失。

可以要求模型分别提取:主要规则、每项规则的条件、例外、终止条件和未知事项。然后把每项连接到页码或段落。不要只问“主要结论是什么”,因为主要结论通常会挤掉限制主要结论的内容。

审核时专门搜索否定与条件词,包括“不”“除非”“仅限”“不得”“取决于”“尚未”“可能”和“在……之后”。它们在字数上很少,在决策价值上很大。

数字可能被保留,意义却被改变

模型能复制一个百分比,却可能漏掉分母、基准、时间段、币种、名义或实际值、是否含税、置信区间和样本选择。报告中的“增长20%”可能是从五增加到六,也可能只是某个子群的相对变化。

对数字摘要,要求一个字段化表格:原始数值、单位、期间、比较基准、总体或样本、来源页码和作者限制。任何无法填写的字段标记未知,不让模型用常识补齐。

同一概念在不同章节可能使用不同口径。摘要应列出差异而不是挑一个看起来最完整的数字。对财务、研究和运营文档,数字需要回到表格、注释和方法部分核验。

文档中间的信息可能比开头和结尾更难被利用

长上下文模型可以接收很多文字,但“能够放进上下文”不等于每个位置都被同等使用。Lost in the Middle研究发现,相关信息位于长输入开头或结尾时,模型表现往往较好,位于中间时可能显著下降,即使模型宣称支持很长的上下文窗口。Lost in the Middle: How Language Models Use Long Contexts

这意味着把一份数百页文件一次性提交,并不能证明第143页的关键限制进入摘要。目录、页码和章节边界仍然重要。先按自然结构处理各段,再汇总局部结果,可以减少位置效应,也让缺失更容易发现。

但分段也会制造新问题:跨章节关系可能断裂。因此应在局部摘要之后单独进行一次跨段检查,寻找同一术语、相互引用、定义变化和前后冲突。

脚注、附录和表格往往承载真正限制

执行摘要通常表达主张,方法附录和脚注说明这些主张可以相信到什么程度。研究排除标准、数据清洗、模型假设、法律定义、合同例外和审计保留意见,常藏在主叙事之外。

文件解析还可能失败。扫描PDF没有正确OCR,表格变成错位文字,双栏页面按错误顺序读取,图片中的图例没有提取,附件未被包含。模型无法总结它没有收到的内容,却可能继续以完整语气回答。

处理前应核对页数、目录、附件、表格和可搜索性;处理后要求列出无法读取的页、图、表和附件。将“缺失清单”作为摘要的必要部分,比把它藏在系统日志更有价值。

少数意见和冲突会被合并成虚假共识

会议记录、咨询报告和评审意见可能包含不同立场。摘要为了连贯,容易把“甲支持、乙反对、丙要求更多证据”压缩成“团队讨论了方案并原则同意”。这不仅减少细节,还改变治理事实。

对需要问责的材料,按说话人或角色提取立场、理由、异议和未解决事项。禁止把没有明确决议的讨论写成决定。若多个章节对同一问题给出不同答案,应并列展示并标记冲突,让负责的人解决。

摘要应区分文档作者的结论、被引用人士的观点和模型自己的推断。否则读者可能把AI补出的连接句误认为原文立场。

时间、版本和适用范围经常悄悄消失

一份政策可能只适用于特定地区、员工类别、合同版本或过渡期。报告数据可能截至两年前,随后情况已经变化。摘要若去掉日期和范围,旧结论会看起来像当前普遍规则。

在每份摘要顶部记录文件标题、版本、日期、作者、覆盖期间、适用对象和已知后续文件。引用外部规则时,注明文档引用的是哪个版本,而不是假设链接现在的页面完全相同。

若比较多份文件,先建立版本时间线。不要让模型把新旧条款合并成一个从未存在过的“综合版本”。

跨章节依赖是分段摘要的盲点

一个术语在第一章定义,义务在第四章出现,例外在附录。若每段独立摘要,第四章可能按日常含义解释术语,附录例外也未与义务连接。局部摘要都看似正确,合并后仍然错误。

建立实体与主张索引:关键术语在哪里定义;每项义务由谁承担;日期、金额和条件在哪些页面出现;哪些段落引用其他章节。汇总时按这些实体合并,而不是简单把分段摘要再缩短一次。

还可以让第二次检查只找关系:哪些结论依赖前文定义,哪些例外修改主规则,哪些数字在多个位置不一致。问题越具体,越容易验证覆盖。

摘要可能增加原文没有的因果与确定性

原文说两个变量相关,摘要可能写成一个导致另一个;作者说证据有限,摘要写成“报告证明”;方案被建议试点,摘要写成“将实施”。模型为了让文字顺畅,会补出因果、意图和行动状态。

研究界长期把摘要的事实一致性视为独立问题,因为生成的摘要可能流畅,却包含原文不支持的内容。相关评估研究说明,摘要质量不能只看可读性或主题覆盖,还要比较每个陈述与源文档的一致性。Evaluating Factual Consistency of Summaries

要求摘要对结论使用与证据相称的措辞:观察到、估计、建议、决定、计划和完成不能互换。把每项行动标注为提议、批准、进行中或已完成。

怎样建立可验证的长文档摘要流程

第一步是完整性检查:文件版本、总页数、目录、附件、OCR、表格和图片。第二步按章节切分,但保留页码、标题和上下文重叠。第三步对每段提取固定字段,包括主张、证据、数字、条件、例外、决定、行动和疑问。

第四步建立主张—来源表,每个重要句子至少有一个精确位置。第五步做横向检查:重复术语、冲突数字、跨段引用、不同立场和时间变化。第六步按读者目的生成最终摘要,并附上限制与未读取内容。

最后由人按风险抽查。不要随机挑最容易的段落;优先核验改变决定的结论、所有关键数字、否定和例外、争议意见以及模型声称“没有提到”的内容。证明缺失比证明出现更难。

不要让摘要取代原文件

摘要适合导航和初步理解,不应成为合同、政策、医疗记录、审计证据或正式会议记录的唯一版本。保留原文件及版本,目录和摘要中的链接应能回到确切页面。

如果读者将依据摘要采取重大行动,明确提示需要回看哪些原文。对于法律义务、财务承诺和安全要求,摘要可以列出核验入口,但最终批准应基于原始条款和专业判断。

摘要过期也需要标记。源文件更新后,应使旧摘要失效或重新生成,避免一个准确的旧摘要被用于新的版本。

我的判断:好的摘要应该暴露自己的空白

糟糕摘要只提供一个顺滑故事;可靠摘要告诉你覆盖了什么、没有覆盖什么、哪些结论受条件限制、哪些信息存在冲突以及去哪里核实。它不假装消除复杂性,而是把复杂性压缩成可导航的结构。

衡量摘要不应只问“节省了多少阅读时间”,还应问关键事项召回率:已知例外是否出现,关键数字是否保留完整语境,所有决定和异议是否可追溯。摘要越接近正式决策,覆盖和证据要求越高。

核验检查表

  • 摘要用途和目标读者是否明确?
  • 是否核对版本、总页数、附件、OCR、图表和无法读取部分?
  • 关键主张是否附有精确页码、段落或表格位置?
  • 是否单列条件、例外、否定、时间范围和适用对象?
  • 数字是否保留单位、基准、分母、期间和方法限制?
  • 是否保留异议、冲突和未解决事项,而没有制造共识?
  • 分段结果是否经过跨章节定义、引用和矛盾检查?
  • 重大行动前是否回到原文,而不是只依赖摘要?

结论

AI总结长文档最容易漏掉的,正是字数少却能改变行动的内容:条件、例外、数字语境、脚注、异议、版本和跨章节关系。长上下文并不自动带来均匀理解。把摘要设计成带来源、缺失清单和冲突检查的导航工具,才能在节省阅读时间的同时保留判断所需的证据。

相关问题

继续阅读本系列: 《AI可以相信到什么程度?》全部文章


了解 Geoffrey Chen 的更多信息

订阅后即可通过电子邮件收到最新文章。