PDF 转 Excel

放入 PDF,那些像表格一样站成列的值会被拆进单元格。每页生成一张工作表,所以你不会搞不清数字是从哪一页来的。

不上传

要转换的 PDF

PDF 里必须有真正的文字。扫描的 PDF 每一页都是图片,没有可以取出的文字。文件只在这个浏览器里打开,不会上传。

会搬过去的是阅读顺序、段落和表格,页面上的精确排版不会照搬。PDF 从不记录哪里是段落、哪里是表格,这两样都是根据文字所在的位置重建出来的。

页面上的图片、印章和签名也会一并放进去。浮在单元格上会妨碍计算,所以统一放在每个工作表的数据下方。

扫描的 PDF 里装的是照片而不是文字,所以没有东西可以转换。放进来试试,工具会直接告诉你。

不会把整页当作图片贴进去。下载的文件可以直接在 Word 或 Excel 里编辑。

把 PDF 转成表格的步骤

  1. 1

    放入 PDF

    文档越像表格,效果越好。一次放多个也可以。

  2. 2

    点转换

    由文字所在的位置决定每个表格从哪里开始、到哪里结束。

  3. 3

    下载 XLSX

    用 Excel 或 Google 表格打开就能直接计算。

这个工具做的事

看位置,不看框线

PDF 里的表格经常压根没有框线。就算有,那些线也画在与文字不同的图层上,任何取文字的程序都看不见。靠找线来识别表格的做法之所以常常失败,原因就在这里。

所以读的是位置。一行之内,若字与字之间的空隙远宽于词间距,那里就是单元格的分界;当这些分界在连续几行里都落在同一个水平位置上,这一块就是表格。至少要三行。两行的块通常是标题配一个靠右的日期,把它做成表格只会更难读。

空单元格在文件里不留任何痕迹,因为那里本来就没有字。按顺序拼接会整体错开一位,所以每个单元格都落到离它最近的列,其余留空。

每页一张工作表

表格散落在好几页时,全堆进一张工作表就分不清某个数字来自哪一页。所以每页生成一张工作表,用页码命名。

不属于表格的行也保留,每行一条。丢掉表格上方的标题,或者说明数字单位的那句话,剩下的数字就没法解读了。 页面上的图片和印章也一并收进来。浮在单元格上会妨碍计算,所以放在每张工作表的数据下方。

扫描的 PDF 还原不了

拍纸张或用一体机扫出来的 PDF,整页就是一张照片。人眼看着是字,文件里却一个字也没有。没有东西可取,自然也没有东西可还原。

这个工具不会默默略过,而是明确告诉你。如果只有部分页是扫描件,它会用页码说明哪几页是空的。识别图片里文字的功能尚未加入。

文件不会离开你的设备

整个转换都在这个浏览器里完成。读取 PDF 和写出新文档,都是在你设备上运行的代码做的。根本没有上传这一步。

你可以自己验证。打开开发者工具(F12)的网络面板,然后点转换:有没有一个和文件差不多大的上传请求,当场就看得见。

常见问题

文件会上传到服务器吗+

不会。从读取 PDF 到写出表格文件,全部在这个浏览器里完成。

非表格的文字也会放进去吗+

会,每行一条,放在第一列。丢掉表格上方的标题或单位说明,剩下的数字就没人能解读了。

单元格整体错开了一列+

这是因为空单元格在 PDF 里不留痕迹。把每个单元格落到最近的列已经大大缓解了这个问题,但列间距非常窄的表格仍可能错位。

合并单元格怎么办+

合并单元格不会被还原。合并区域里的值会落进离它最近的那一列。

数字变成了文本+

PDF 不记录一个值是数字还是标签,所以原样保存。带千位分隔符或货币符号时 Excel 会当作文本。在 Excel 里把单元格格式改成数值即可。

扫描的 PDF 可以吗+

不行。扫描件整页都是照片,没有文字可取。