把 PDF 里的表格搬进 Excel

报告 PDF 里有张表,你要拿那些数字算账。框选、复制、粘贴到 Excel,结果所有值挤进了 A 列的一个格子里。于是你认命,开始一个个手敲。

Ashton
怎么做

弄清楚为什么会这样,多数情况下就不用重敲了。

为什么复制粘贴会把所有内容塞进一格

因为 PDF 里根本没有「表格」这个东西。文件里装的是「在横 220、纵 540 的位置印上 1,204」这样的指令,而这个值曾经是表格第二列第三行这件事,任何地方都没有记录。文档导出成 PDF 的那一刻,这个结构就被丢掉了。

所以复制功能只是按看到的顺序把字符串起来。格与格之间的间隔不是制表符也不是逗号,只是坐标的差值,粘贴那一端没有任何可以拆分的依据。

这一点就能解释其余的一切。要还原表格,只能看值摆放的位置,而不是看线条或标签,而看位置永远是一种推测。

数字变成文本的问题

就算单元格拆对了,Excel 也常常不把那些值当成数字。PDF 不记录一个值是数字还是标签,所以原样搬过来。大多数情况在 Excel 里几步就能解决。

如果是这样进来的原因与处理
1,204 靠左对齐千位分隔符让 Excel 当成文本。把单元格格式改成数值,或用查找替换删掉逗号
¥18,400,000 算不了前面有货币符号。删掉符号,再在单元格格式里设为货币
(1,204) 不被当作负数这是会计式的括号负数。Excel 不认的话就去掉括号,前面加减号
38% 不等于 0.38这是带百分号的文本。删掉符号,把单元格格式改成百分比
1204 这样偏宽的数字全角数字,常见于东亚文档。用函数转成半角
编号变成了日期相反的情况,Excel 自作主张按日期解释了。粘贴前先把整列格式设为文本

单元格整体错开一列时

空单元格是根源。空单元格在 PDF 里不留任何痕迹,没有字符,也就没有印出来的指令。于是那一行看起来少了一格,后面的值全部往前挪一位。

工具这边会把每个值落到离它最近的列来缓解这个问题,但列间距非常窄的表格仍可能错位。合并单元格也一样:你的眼睛看到两格并成一格,文件里不过是一段文字比邻居稍微靠左而已。

哪些 PDF 效果好

原件是怎么做出来的,决定了结果。

  • 效果好的。在 Excel 或 Word 里做好表格再导出的 PDF。列站得笔直,只看位置就能拆开单元格。
  • 一般的。用排版软件做的报告。居中和缩进混在一起,列的左边缘会晃。
  • 不行的。扫描的 PDF。整页都是照片,压根没有文字可取。这不是工具能力的问题。
  • 要注意的。跨多页的长表格。翻页时表头会重复,搬完之后要把重复的表头行删掉。

搬完之后一定要核对

搬表格这件事掺着推测,所以可能悄无声息地出错。少了一个值或者错开一列,屏幕上看着照样整整齐齐。

如果原件有合计行,那就是最好的对照。在 Excel 里把同一列加起来,和原件的合计比一比。没有合计行的话,至少数一数行数和列数。这一次核对的成本,远低于拿错数字写报告。

常见问题

有办法只精确取出表格吗?
先把 PDF 拆到只含表格的那几页再转换,结果会干净得多。正文段落混在一起,工具要判断的东西就更多。
我的数字全变成文本了。
PDF 不记录一个值是数字还是标签,所以原样搬过来。在 Excel 里选中该列,到数据选项卡执行一次「分列」,通常一下子就全部变成数值。
有合并单元格的表格会怎样?
合并状态搬不过来。合并区域里的值会落进离它最近的那一列。搬完后在 Excel 里重新合并更快。
跨多页的表格呢?
每页会生成一张工作表。要接起来的话,把一张表复制到另一张下面,再删掉重复的表头行。
扫描的 PDF 真的没办法吗?
靠提取文字的办法确实没办法。扫描件整页都是照片,文件里没有文字。向出具方要原始文件通常更快。

更新于 2026年9月17日