PDF 转成 Word 后,什么留下了,什么消失了
把 PDF 转成 Word,表格歪了。你以为是转换器不行,换一个再试,结果差不多。有些问题不是换工具就能解决的。
弄清楚原因,就知道该挑什么工具、能指望到什么程度。
PDF 是印刷品,不是文档
PDF 里装着的只是一长串指令:在横 72、纵 680 的位置印下这个字。段落在哪里断开、哪两行属于同一个表格的同一行,文件里任何地方都没有记录。
因为文档导出成 PDF 的那一刻这些信息就被丢掉了,就像印在纸上的内容不需要段落信息一样。所以把它还原不是转换,而是重建:靠文字摆放的位置来推测原来的样子。
这一句话就能解释其余的一切。表格之所以歪,不是因为转换器读错了表格,而是因为根本没有表格可读,只能靠位置重新拼一个出来。
能推断的,和压根不存在的
把这两类分开,就知道什么能改进、什么不可能。
- 能推断的。段落划分(靠行距和每行在哪里停住)、表格(靠格子是否上下对齐)、标题(靠字号是否大于正文)。算法变好,准确率就会上升。
- 能直接取出的。文字本身,以及印在页面上的图片和印章。它们是文件里实实在在的对象,不需要猜。
- 压根没记录的。原件用的是 Word 的哪个样式、表格在哪里合并了单元格、段落之间空了几磅。这些没有任何工具能造出来。
当心那些号称完全还原版式的转换器
有些工具宣传输出和原件像素级一致。打开一看确实如此。然后你改一行,文档就散了。
要做到那样,只能把文字塞进几百个钉在固定坐标上的文本框,而不是放进段落。这样搭出来的文档看着像原件,却没法在里面工作。删掉一个字,只有那个框会重排,周围的一切纹丝不动。
| 你要的是什么 | 该选什么 |
|---|---|
| 读懂并修改内容 | 把段落重建出来的转换器 |
| 只是看一看 | 别转换,用 PDF 阅读器 |
| 必须和印刷品一模一样 | 别转换,就用 PDF |
| 要拿数字做计算 | 转成电子表格 |
转换的存在是为了让你能改。改不了的输出就失去了意义。如果目标是看起来一模一样,那一开始就没有转换的理由。
表格出错的真正原因
PDF 里的表格经常压根没有框线。就算有,那些线也画在与文字不同的图层上,任何取文字的程序都看不见。靠找线来识别表格的做法之所以常常失败,原因就在这里。
所以读的是位置:若干行里左边缘站在同一处的格子,就当成一个表格。这个办法最怕空单元格。空单元格在文件里不留任何痕迹,于是那一行看起来就少了一格,后面的内容整体错开一位。
合并单元格也一样。你的眼睛看到两格并成一格,文件里不过是有一段文字比邻居稍微靠左而已。
扫描的 PDF,任何工具都转不了
一体机扫出来的 PDF,每页就是一张照片。你的眼睛看到字,文件里一个也没有。这不是工具的能力问题,而是原件里没有信息。
用文字识别(OCR)可以从图片里造出文字。但那是识别而不是提取,会混进把数字 0 读成字母 O 这类错误。在合同或提交材料里,这种错误代价很高。能向出具方要原始文件的话通常更快。
归结起来
挑转换器该问的不是「像不像」,而是「改不改得了」。而当结果不完美时,能分清这是工具的极限还是格式的极限,就能省下反复换工具的时间。
常见问题
- 为什么不同转换器结果不一样?
- 因为它们推断的规则不同。行距宽到什么程度算段落断开、几行对齐才算表格,每家划线的位置都略有差异。所以不同类型的文档各有更合适的工具。
- 我的表格老是出错,有办法吗?
- 空单元格越多的表格越容易出错,因为空单元格在 PDF 里不留痕迹。如果你要的只是表格,转成电子表格比转成 Word 更合适。表格那条路专门做了把单元格对到列上的处理,即使错位也更容易手工修。
- 图片和印章能带过来吗?
- 能。它们是印在页面上的实体对象,不需要推测,直接取出来。位置按文字顺序排,而不是原来的坐标,因为钉在坐标上会得到一份改不了的文档。
- 字体变了。
- PDF 确实内嵌了字体文件,但不保证它们带着原文档指定的名字,更不保证打开结果的那台机器装了同一款字体。所以字体不搬,直接用默认字体。
- 有不上传文件的转换器吗?
- 有,本站的工具就是。整个转换在浏览器里完成,没有上传这一步。想确认的话,打开开发者工具的网络面板再点转换就能看到。
更新于 2026年9月17日