PDF 转成 Word 后,什么留下了,什么消失了

把 PDF 转成 Word,表格歪了。你以为是转换器不行,换一个再试,结果差不多。有些问题不是换工具就能解决的。

Ashton
格式

弄清楚原因,就知道该挑什么工具、能指望到什么程度。

PDF 是印刷品,不是文档

PDF 里装着的只是一长串指令:在横 72、纵 680 的位置印下这个字。段落在哪里断开、哪两行属于同一个表格的同一行,文件里任何地方都没有记录。

因为文档导出成 PDF 的那一刻这些信息就被丢掉了,就像印在纸上的内容不需要段落信息一样。所以把它还原不是转换,而是重建:靠文字摆放的位置来推测原来的样子。

这一句话就能解释其余的一切。表格之所以歪,不是因为转换器读错了表格,而是因为根本没有表格可读,只能靠位置重新拼一个出来。

能推断的,和压根不存在的

把这两类分开,就知道什么能改进、什么不可能。

  • 能推断的。段落划分(靠行距和每行在哪里停住)、表格(靠格子是否上下对齐)、标题(靠字号是否大于正文)。算法变好,准确率就会上升。
  • 能直接取出的。文字本身,以及印在页面上的图片和印章。它们是文件里实实在在的对象,不需要猜。
  • 压根没记录的。原件用的是 Word 的哪个样式、表格在哪里合并了单元格、段落之间空了几磅。这些没有任何工具能造出来。

当心那些号称完全还原版式的转换器

有些工具宣传输出和原件像素级一致。打开一看确实如此。然后你改一行,文档就散了。

要做到那样,只能把文字塞进几百个钉在固定坐标上的文本框,而不是放进段落。这样搭出来的文档看着像原件,却没法在里面工作。删掉一个字,只有那个框会重排,周围的一切纹丝不动。

你要的是什么该选什么
读懂并修改内容把段落重建出来的转换器
只是看一看别转换,用 PDF 阅读器
必须和印刷品一模一样别转换,就用 PDF
要拿数字做计算转成电子表格

转换的存在是为了让你能改。改不了的输出就失去了意义。如果目标是看起来一模一样,那一开始就没有转换的理由。

表格出错的真正原因

PDF 里的表格经常压根没有框线。就算有,那些线也画在与文字不同的图层上,任何取文字的程序都看不见。靠找线来识别表格的做法之所以常常失败,原因就在这里。

所以读的是位置:若干行里左边缘站在同一处的格子,就当成一个表格。这个办法最怕空单元格。空单元格在文件里不留任何痕迹,于是那一行看起来就少了一格,后面的内容整体错开一位。

合并单元格也一样。你的眼睛看到两格并成一格,文件里不过是有一段文字比邻居稍微靠左而已。

扫描的 PDF,任何工具都转不了

一体机扫出来的 PDF,每页就是一张照片。你的眼睛看到字,文件里一个也没有。这不是工具的能力问题,而是原件里没有信息。

用文字识别(OCR)可以从图片里造出文字。但那是识别而不是提取,会混进把数字 0 读成字母 O 这类错误。在合同或提交材料里,这种错误代价很高。能向出具方要原始文件的话通常更快。

归结起来

挑转换器该问的不是「像不像」,而是「改不改得了」。而当结果不完美时,能分清这是工具的极限还是格式的极限,就能省下反复换工具的时间。

常见问题

为什么不同转换器结果不一样?
因为它们推断的规则不同。行距宽到什么程度算段落断开、几行对齐才算表格,每家划线的位置都略有差异。所以不同类型的文档各有更合适的工具。
我的表格老是出错,有办法吗?
空单元格越多的表格越容易出错,因为空单元格在 PDF 里不留痕迹。如果你要的只是表格,转成电子表格比转成 Word 更合适。表格那条路专门做了把单元格对到列上的处理,即使错位也更容易手工修。
图片和印章能带过来吗?
能。它们是印在页面上的实体对象,不需要推测,直接取出来。位置按文字顺序排,而不是原来的坐标,因为钉在坐标上会得到一份改不了的文档。
字体变了。
PDF 确实内嵌了字体文件,但不保证它们带着原文档指定的名字,更不保证打开结果的那台机器装了同一款字体。所以字体不搬,直接用默认字体。
有不上传文件的转换器吗?
有,本站的工具就是。整个转换在浏览器里完成,没有上传这一步。想确认的话,打开开发者工具的网络面板再点转换就能看到。

更新于 2026年9月17日