AI列出的论文、数据和链接怎样判断真假? / How Can You Check Whether AI-Generated Papers, Data and Links Are Real?

简短答案

把每条引用拆成三个问题:这个来源是否真的存在;书目信息和链接是否指向同一个来源;来源是否真的支持AI放在它旁边的主张。打开链接、核对标题作者日期、通过DOI或机构网站查记录,再阅读相关段落。只验证“有这篇论文”不够,因为真实论文也可能被错误描述;只看到一个看似正式的URL更不够,因为路径、页码和统计数字都可能是生成出来的。

为什么虚构引用看起来特别真实

学术引用和网页链接具有强烈格式规律:作者、年份、标题、期刊、卷期、页码和DOI都遵循可学习的模式。模型可以生成形式完美的记录,却把真实作者、相似标题和合理编号组合成一篇不存在的论文。它也可能列出真实论文,但错写年份、作者、研究对象或结论。

一项对GPT-3.5与GPT-4生成的636条书目引用进行核查的研究发现,在该研究设置中,GPT-3.5引用有55%为虚构,GPT-4为18%;即使是真实引用,也仍有相当比例包含实质书目信息错误。这些数字属于特定模型、时间与任务,不能直接当成今天所有系统的错误率,但足以说明“格式正确”绝不是存在证明。Walters and Wilder: Fabrication and errors in bibliographic citations generated by ChatGPT

第一关:来源是否存在

论文最好从DOI开始。将完整DOI放进 https://doi.org/,看它是否解析到出版者页面;也可以在Crossref按标题、作者或DOI搜索。Crossref的公开REST API提供由出版成员和可信来源提交的书目元数据,可核对标题、作者、期刊、发布日期和更新关系。Crossref REST API documentation

没有DOI不代表不存在。书籍、政府报告、法律文件、标准、预印本和机构网页可能使用ISBN、报告编号、法规编号或永久URL。应到相应权威目录查:出版社、图书馆、政府发布机构、法规数据库、标准机构、研究仓库。不要只在普通搜索结果里看到相同标题便结束,因为复制AI文本的页面可能制造循环确认。

网页链接应实际打开,并查看最终跳转域名。一个链接可以使用真实机构域名的外观,却包含不存在的路径;也可能跳到登录页、首页、搜索结果或与主张无关的文档。记录404、重定向和页面标题,不要让链接的蓝色样式替它作证。

第二关:书目信息是否匹配

存在一篇相似论文,不等于AI引用正确。逐项核对标题、全部或主要作者、发表年份、期刊或机构、版本与DOI。尤其注意同一研究可能有预印本、会议论文、期刊版和更正稿;同名作者可能属于不同机构;网页显示的“updated”日期不一定是原始发布日期。

若AI给出直接引语,还应在原文中搜索独特短语。找不到时,不要自动认为只是页码错;它可能是意译被错误放进引号,或完全虚构。即使找到相似句,也要读取前后文,确认否定词、限定范围和说话者。

数据引用还需核对表格或数据集版本。统计机构可能修订历史数值,图表可能使用季调数据,而AI转述成未季调;百分比可能是受访者比例,不是人口比例。把数据名称、变量、时间段、地理范围、单位和下载日期一起记录。

第三关:来源是否支持相邻主张

这是最容易被省略的一关。AI可能引用一篇真实的隐私研究来支持“某产品一定违法”,引用一项特定职业实验来声称“所有员工生产率提高”,或引用法规的一般原则来给出个案法律结论。来源相关,不代表完成了推理。

把AI的句子改写成最小主张,再问原文哪一段支持它。比较主张强度:原文说“相关”,AI是否写成“导致”;原文说“在这组样本中”,AI是否推广到所有人;原文说“可能”,AI是否写成“必然”;原文研究旧版本,AI是否当成当前产品事实。

如果只有摘要可以阅读,就只能验证摘要明确覆盖的范围。不要假装已经检查了方法、限制和附录。付费墙不使论文失效,却会限制你能声称核实到什么程度。

数据要追到分母,而不是停在漂亮数字

“提高40%”“准确率95%”“多数用户”都需要分母。问清楚:与什么基线比较;绝对值是多少;样本多大;是否只报告完成者;时间范围多长;置信区间与不确定性怎样;研究由谁资助;指标是否代表真正想知道的结果。

例如处理速度提高不等于总成本下降,因为可能增加复核与返工;回答正确率上升不等于所有群体都改善,因为平均数会隐藏分布。AI常选择最醒目的数字,却省略决定其意义的测量设计。

自己从表格重新计算一个关键百分比,是高价值检查。若无法重现,可能是四舍五入、不同子样本、单位错误,也可能是AI发明。无论原因,都不应直接发布。

链接不是证据,引用数量也不是质量

十个相互抄写的页面只有一个信息来源。供应商博客可以准确描述自己的功能,却不是评估其社会影响的独立研究。新闻报道适合发现事件,关键事实仍应追到判决、公告、数据或论文。维基百科可以提供路线图,但正式主张最好沿脚注回到原始材料。

建立来源层级:法律与政策用官方文本;产品行为用官方文档并辅以可重现实验;科学结论用原始论文和数据;市场数字用披露方法的统计来源;个人经历只能证明经历者的个案。来源类型要与主张类型匹配。

怎样处理AI给出的论文列表

不要一次让模型生成五十条再逐一救火。先定义检索范围和纳入标准,要求提供较少候选,并为每条给出DOI或稳定标识符、原始摘要和为什么相关。然后在Crossref、PubMed、出版者或学科数据库中独立查询。

确认存在后,制作证据表:研究问题、样本、方法、主要发现、限制、是否直接支持你的主张。把“未取得全文”“尚未复核”“仅背景相关”明确标记。这样AI可以帮助筛选候选,却不能把候选列表伪装成完成的文献综述。

若模型无法提供稳定标识符,仍可用精确标题和作者查找;连续几条查无记录时,应停止整批采用,而不是继续假设剩余项目可信。批量生成往往带来批量相关错误。

网页与官方文件也要检查版本

政府与产品页面会更新。同一个URL可能在今天显示不同内容。对于重要引用,记录访问日期、文件版本、发布日期,并优先保存永久PDF、公告编号或网页存档。法规还要区分通过、开始生效、修订与废止。

产品文档应核对账户层级、地区、平台和版本。AI说“该服务支持某功能”时,可能只适用于企业账户或测试版。链接到产品首页无法支持这些边界,必须引用具体文档段落。

一个五步引用审计法

第一步,打开:链接是否解析,最终域名与标题是什么。第二步,匹配:作者、日期、版本和标识符是否一致。第三步,定位:找到支持主张的页码、表格或段落。第四步,限缩:把AI的表达缩到来源真正支持的强度与范围。第五步,记录:保存验证状态、访问日期和未解决问题。

高后果内容可由第二人复核承重引用。自动化脚本可以检查URL状态与DOI元数据,但不能可靠判断来源是否支持一个复杂结论;语义这一关仍需要理解原文与用途。

我的判断:把AI当作线索生成器,不当作书目数据库

AI非常适合提出搜索词、相关机构、可能的研究方向和候选文献。它把“从哪里开始”变快,却不保证“最后引用什么”。每条进入正式文章、报告或决定的来源,都应经过独立存在检查和支持关系检查。

最值得警惕的是过于合适的引用:标题正好逐字回答你的问题,数字正好支持结论,链接又很长很专业。现实研究往往更窄、更有条件。完美贴合可能是检索成功,也可能是模型为论点定制了一条并不存在的证据。

发布前检查清单

  • 链接是否实际打开并到达正确文档,而非首页或搜索页?
  • DOI、标题、作者、年份、期刊或机构是否相互匹配?
  • 是否区分预印本、最终版、更正与撤稿?
  • 原文哪一段、哪一表格直接支持相邻主张?
  • AI是否把相关写成因果、把局部推广成普遍?
  • 数字的分母、单位、样本、时间与地区是什么?
  • 是否能独立重算至少一个承重数字?
  • 来源是否一手、现行,并与主张类型匹配?
  • 无法取得全文或尚未验证的项目是否清楚标记?

结论

判断AI引用真假需要验证存在、元数据和支持关系三个层次。真实链接可能不支持主张,正确标题可能配错数据,漂亮数字可能没有合适分母。让AI帮助发现线索,但让DOI、官方记录、原始段落和独立计算决定什么可以正式引用。引用的价值不在数量,而在读者能否沿它回到证据。

相关问题

继续阅读本系列: 《AI可以相信到什么程度?》全部文章


了解 Geoffrey Chen 的更多信息

订阅后即可通过电子邮件收到最新文章。