简短答案
PDF首先是一种固定页面描述,不保证内部保存的是语义正确、阅读顺序明确的文字。页面可以用字体字形编号、扫描图像或位置零散的字符画得完全正常,而复制功能需要把这些对象反向还原为Unicode文字。缺少字符映射、错误OCR、特殊字体、复杂排版或安全限制,都会使“看得见”与“复制得对”出现差异。最可靠的处理是先判断PDF属于原生文字、扫描图像还是两者混合,再用正确语言运行OCR、检查输出,并在可能时索取原始文档或可访问版本。
显示页面与提取文字是两项任务
PDF阅读器显示页面时,只需知道在某个坐标用哪个字形绘制。复制时却要回答那个字形代表哪个字符、多个字符按什么顺序组成词句、两栏和表格应先读哪一部分。创建软件若写入正确字体映射和结构,复制通常良好;若只保存绘图指令,视觉仍可完美,但语义信息不足。
这解释了最令人困惑的情况:屏幕上的“合同编号”清楚无误,粘贴后却变成方框、随机拉丁字母或顺序颠倒。渲染器忠实完成了绘图,文本提取器则在猜测缺失关系。
扫描PDF可能根本没有文字
纸张扫描后,PDF页面通常只是一张图。Adobe说明,扫描得到的PDF只包含图像数据,需要OCR才会产生可选择和搜索的文字层。Adobe:识别扫描PDF中的文字
有些文件在图像后面已经放了不可见OCR层。眼睛看到原始扫描,复制的却是机器识别结果,所以低分辨率、污迹、倾斜、竖排、数学公式和相似字符会变成错误。中文中“未/末”“己/已”、数字“0/8”、英文“l/I/1”尤其容易混淆。视觉外观不能证明文字层准确。
字体编码可能没有标准字符映射
PDF可嵌入字体的子集,只包含文件实际使用的字形。字形可能编号为1、2、3,却需要额外映射说明它们对应“你”“好”或“A”。若创建工具没有写入可靠的ToUnicode映射,阅读器知道画第3号形状,却不知道复制时输出哪个Unicode字符。
旧式打印驱动、专业排版、某些财务报表和自制字体常出现这种问题。字体是否在电脑安装主要影响显示替代,而复制乱码更常与PDF内部编码映射有关。Adobe也提醒,复制使用本机没有的字体时会发生字体替换,但字体外观和字符含义仍是不同层面。Adobe:重复使用PDF内容
阅读顺序可能与视觉顺序不同
PDF页面上的每个词都可以按坐标独立放置。两栏文章可能先存第一行左栏、再第一行右栏;表格可能按绘制顺序输出;页眉页脚会插进段落;连字符和换行可能变成额外字符。看起来有清晰结构,不代表文件包含段落、标题、单元格和正确阅读顺序标签。
复制表格时尤其明显。视觉上的行列靠位置表达,粘贴到纯文本后坐标消失。若需要数据,不要把整页一次复制到表格软件;优先使用专门导出表格功能,分区检查,或从发布者取得CSV、Excel和原始数据。
先做三个小测试
第一,尝试搜索页面上一个独特词。如果完全搜不到,文件可能是纯图像;如果搜到错误位置或输入正确文字也找不到,OCR或映射可能有问题。第二,逐字选择一行,看高亮是否贴合字形、是否跳到别栏。第三,把短句粘贴到纯文本编辑器,避免目标软件的格式处理干扰判断。
也可以比较不同阅读器。有时某个程序的提取算法更好,但如果多个独立工具输出同样乱码,问题多半在文件内部。不要在唯一原件上直接覆盖OCR结果;保留原始文件,再制作可搜索副本。
正确OCR需要语言和复核
对纯扫描或坏文字层,重新OCR通常有效。选择正确页面语言、旋转方向和页面范围,必要时先校正倾斜、提高对比度。Adobe建议OCR后检查并纠正不确定文字,工具会把疑似错误标记供人工核对。Adobe:修正扫描文字识别错误
OCR不是证据保真过程。合同金额、银行账号、日期、姓名、药品剂量和引用不能未经比对直接使用。可以抽样复核普通资料;高后果字段应逐项对照页面图像,必要时由第二人复核。生成式AI也可能把不清楚的字“补成”合理内容,不能替代原件验证。
权限限制与乱码不是同一问题
作者可以设置不允许复制的文档限制。Adobe建议在文档属性的安全摘要中检查内容复制是否允许。Adobe:从PDF复制内容 若复制命令是灰色或无法选择,可能是权限设置;若能够复制却得到错误字符,则更像OCR、编码或结构问题。
不要用绕过限制的工具处理没有授权的文件。若出于无障碍、翻译或合法业务需要,联系文件提供者索取可访问PDF、Word或纯文本版本,通常比反复转换更准确。
我的判断:PDF的视觉可信度常被误当成数据可信度
PDF擅长让页面在不同设备上看起来一致,所以人自然把“排版没变”理解为“文字数据完整”。实际上,它可能更接近打印成品,而不是结构化文档。页面照片、绘制字形、隐藏OCR层和真正Unicode文本都能呈现相似外观,却有完全不同的搜索、复制和无障碍质量。
因此我不会从“能打开”推断“能可靠处理”。如果内容要进入搜索、翻译、AI摘要、法律审阅或数据分析,应该先做文本层质量检查,并保留页面坐标或原件作为核对依据。批量处理前抽查几页,能避免把同一种乱码放大到整个资料库。
解决顺序
先在副本上操作,原件始终保留。
- 搜索一个独特词并复制一小句,判断是否存在可靠文字层。
- 检查是否为扫描、混合页面、特殊字体或多栏表格。
- 用另一款可信阅读器比较,排除单一程序问题。
- 对扫描副本按正确语言运行OCR,保留原始PDF。
- 复核OCR疑似字符以及金额、日期、姓名和编号。
- 表格使用专门导出工具,并核对行列和小数点。
- 若大量乱码,向发布者索取原始Word、HTML、CSV或可访问PDF。
- 自动化处理时记录页码和来源,使每段文字能回到页面验证。
结论
PDF能正确显示,只证明绘图信息足以重现页面,不证明文字具有正确Unicode映射、阅读顺序或OCR结果。先辨别文件内部是文字还是图像,再选择提取、OCR或索取源文件。尤其在金额、身份、法律和医疗内容中,复制结果应被视为一次转换输出,而不是原件本身。保留原PDF并抽样核对,是最简单也最重要的质量控制。
相关内容
继续阅读本系列: 《数字生活的隐藏机制》全部文章
了解 Geoffrey Chen 的更多信息
订阅后即可通过电子邮件收到最新文章。