AI找到了资料,为什么还不能算完成研究?

《AI进入工作之后》· 第一季“从回答问题到参与工作”· 第五篇

设想一名作者准备研究“生成式AI是否提高程序员的生产率”。他让AI搜索相关研究。几分钟后,系统列出十几篇论文,分别支持“显著提高”“影响有限”和“可能降低效率”三种结论,还生成了一段看似平衡的综述。

资料有了,观点也被分成不同阵营,文章似乎已经完成了一大半。

但他打开论文后发现,有的研究测试的是新手在一个小时内写小程序,有的研究观察的是熟悉大型代码库的资深开发者,有的来自员工自我报告,有的测量完成速度,有的测量代码行数,还有的只是尚未同行评审的预印本。几篇论文使用的AI工具相隔数年,实验环境也完全不同。

这些资料都与问题有关,却不能直接放在同一张“赞成—反对”表里。真正的研究工作从这里才刚刚开始:每个来源究竟测量了什么,它能支持多大的结论,彼此为什么不同,以及哪些差异来自任务、人员、时间或测量方法。

AI可以大幅降低发现资料的成本。但发现资料是检索结果,不是研究结论。

一篇资料存在,不等于它支持眼前的主张

研究中的引用至少要通过三道检查。

第一道是存在检查:这篇论文、报告、法律或数据集是否真的存在,作者、标题、日期和链接是否正确。

第二道是内容检查:来源是否真的说了文章归给它的内容。一个真实链接完全可能被用来支持它没有讨论的主张。

第三道是范围检查:即使来源支持这句话,结论是否被扩大到了不适用的人群、时期、地区或任务。

AI生成引用时,最明显的失败是虚构论文。2026年一项关于参考文献幻觉的研究显示,提示约束能够改变不同模型生成虚假引用的方式,但并不能把问题简单消除;研究者强调,引用失败与任务结构有关,使用者仍需验证。PMLR:《Citation Constraints and Reference Hallucinations in Large Language Models》

不过,不存在的来源反而相对容易发现。更隐蔽的是“真实来源、错误用途”:论文存在,标题也相关,但正文没有支持那项断言;或者研究确实发现某种效果,文章却删掉了样本、条件和限制。

例如,一项写作实验发现AI帮助参与者更快完成特定的中等难度专业写作任务,并提高外部评分。把它准确写成“在这类受控任务中观察到速度和质量收益”是合理的。把它扩展成“AI已经证明可以提高所有知识工作的质量”,就超出了证据范围。Science:《Experimental evidence on the productivity effects of generative artificial intelligence》

研究不是把带链接的句子连接起来,而是控制每个结论可以走多远。

搜索、阅读、判断和综合是四项不同工作

AI搜索工具经常把四个步骤压缩成一个顺滑答案。

搜索寻找可能相关的材料。它优化的是召回和排序:在庞大信息中尽快找到候选来源。

阅读确定材料实际说了什么,包括方法、数据、限制、定义和结论,而不只是标题与摘要。

判断评估来源的质量和适用性。官方文件可能最适合说明现行规则,但不一定能证明政策有效;随机实验可以支持特定因果结论,却未必适用于另一个职业环境;新闻报道可以发现案例,但通常不能替代原始记录。

综合解释多个来源之间的关系。结果不同可能并非互相否定,而是研究了不同任务。真正的综合不是“有研究支持,也有研究反对”,而是说明差异为什么出现,以及在什么条件下应相信哪一种结论。

大语言模型很擅长把不同材料写成连贯叙述。这项能力在搜索初期很有价值,可以帮助建立关键词、发现机构、整理研究地图。但语言连贯会让尚未完成的阅读和判断看起来已经完成。

因此,研究流程需要故意把四项工作重新分开。候选来源清单不能自动进入正文;摘要不能代替方法阅读;同一主题不能代替同一证据问题。

检索增强解决了“从哪里取资料”,没有解决“怎样相信”

检索增强生成(RAG)让模型先从外部文档中寻找内容,再根据检索结果生成答案。这比完全依赖模型训练中形成的一般知识更容易更新,也更有机会显示来源。NeurIPS:《Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks》

但RAG是一种获取信息的架构,不是自动的证据评审制度。

检索系统可能返回错误版本、相似但无关的段落,或者只抓到支持问题预设的一面。文档切分还可能把结论与限制拆开:模型看见“结果显著”,却没有同时看见“样本很小”或“仅适用于某种设置”。

长上下文也不能保证所有材料被同等使用。关于“迷失在中间”的研究显示,相关信息在长输入中的位置可能影响模型能否有效利用它。TACL:《Lost in the Middle》

所以,一套研究系统至少需要检验两个环节:检索到的材料是否正确,生成的主张是否忠实于材料。只检查最终文字通不通顺,会同时放过检索错误与解释错误。

AI自我核查有帮助,但不等于独立验证

一种常见做法是要求模型检查自己的答案、列出可能错误,或者让另一个AI担任评审。研究表明,把生成与核查分成步骤,可以降低部分事实幻觉。例如“验证链”方法先产生草稿,再提出核查问题、独立回答这些问题,最后修订答案。ACL Anthology:《Chain-of-Verification Reduces Hallucination in Large Language Models》

这类方法值得使用,但必须理解其边界。

同一个模型可能在生成和复核时共享相似盲点。两个模型也可能依据同一份错误检索结果,或者都被一个看似权威的错误前提引导。如果核查只是再生成一段“我检查过,没有问题”的文字,验证并没有接触独立证据。

真正独立的验证应尽量回到模型之外:打开原始页面、核对数据库记录、重新计算数字、查看法律正文、运行代码测试,或者由具备领域知识的人判断研究设计。

AI可以帮助提出检查问题,却不能仅凭再次表达信心证明第一次回答正确。

建立一份“主张—证据账本”

对于长文、调查或专业报告,一个简单而有效的方法,是在写作前建立主张与证据的对应表。

每项重要主张至少记录:

  • 准备在正文中表达什么;
  • 哪个来源直接支持它;
  • 来源中的具体页码、段落、表格或数据字段;
  • 来源属于法律、官方方法、原始研究、调查报告还是新闻;
  • 适用的日期、地区、人群与任务;
  • 这是事实、来源作者的解释,还是本文作者的推断;
  • 是否存在反例或相反证据;
  • 当前状态是待核查、已核查还是不能支持。

AI可以协助从文件中提取候选段落,生成比较表并发现论证空缺。但“已核查”不应由AI看到链接后自动填写。至少对文章的核心事实,作者需要打开来源,确认页面真实存在并支持附近的表述。

这种账本还有一个好处:当规则更新或文章修订时,可以迅速找到哪些段落依赖旧资料。研究不再是一篇文字和一串文末链接,而成为可以维护的证据结构。

资料数量不是研究质量

生成式AI让“列出二十个来源”变得容易,这可能使人误以为更多链接代表更充分的研究。

但二十篇互相引用同一份二手报道的文章,证据上可能只有一个来源。十篇观点相似的评论,也不能替代一份原始数据。大量摘要如果没有阅读方法和限制,只会增加验证负担。

更好的研究不一定拥有最多资料,而是来源层级清楚:关键制度事实回到法律与官方文件,关键经验判断回到原始研究和数据,新闻用于时间线与案例发现,评论用于理解争议,但不混淆各自作用。

美国国家标准与技术研究院的生成式AI风险框架把“虚构信息”及信息完整性视为需要测量和管理的风险,并强调测试、评估、验证与确认不能只发生在模型开发阶段,也要进入具体使用环境。NIST:《Generative Artificial Intelligence Profile》

对于研究写作,这意味着不能因为工具带有“研究”名称或提供引用界面,就降低来源审查标准。

结论:AI可以缩短找到资料的路,不能替你决定证据够不够

AI搜索和研究工具可以迅速扩展视野:寻找关键词、发现原始机构、比较多篇论文、整理时间线、提取表格和指出可能反例。这些能力能够节省大量机械劳动,也可能让个人接触过去难以覆盖的资料范围。

但研究完成的标准不是“系统返回了答案”,甚至不是“每段话后面都有链接”。真正的完成需要证明:来源存在,内容支持主张,适用范围没有被扩大,重要反证得到处理,作者自己的推断被明确标出。

因此,最重要的边界是:

AI可以负责发现候选证据、整理材料和提出比较;采用什么作为证据,以及证据允许得出什么结论,仍必须由研究者承担。

当寻找资料变得廉价,研究能力不会因此失去价值。相反,判断来源、控制结论范围和维护证据链会成为更稀缺的工作。

AI找到资料,只是打开了研究的大门。阅读、判断、综合和负责,才决定我们是否真正走了进去。

主要资料

继续阅读:浏览《AI进入工作之后》系列文章


了解 Geoffrey Chen 的更多信息

订阅后即可通过电子邮件收到最新文章。