把 PDF 里的表格搬进 Excel
报告 PDF 里有张表,你要拿那些数字算账。框选、复制、粘贴到 Excel,结果所有值挤进了 A 列的一个格子里。于是你认命,开始一个个手敲。
放入 PDF,那些像表格一样站成列的值会被拆进单元格。每页生成一张工作表,所以你不会搞不清数字是从哪一页来的。
不上传
要转换的 PDF
PDF 里必须有真正的文字。扫描的 PDF 每一页都是图片,没有可以取出的文字。文件只在这个浏览器里打开,不会上传。
会搬过去的是阅读顺序、段落和表格,页面上的精确排版不会照搬。PDF 从不记录哪里是段落、哪里是表格,这两样都是根据文字所在的位置重建出来的。
页面上的图片、印章和签名也会一并放进去。浮在单元格上会妨碍计算,所以统一放在每个工作表的数据下方。
扫描的 PDF 里装的是照片而不是文字,所以没有东西可以转换。放进来试试,工具会直接告诉你。
不会把整页当作图片贴进去。下载的文件可以直接在 Word 或 Excel 里编辑。
文档越像表格,效果越好。一次放多个也可以。
由文字所在的位置决定每个表格从哪里开始、到哪里结束。
用 Excel 或 Google 表格打开就能直接计算。
PDF 里的表格经常压根没有框线。就算有,那些线也画在与文字不同的图层上,任何取文字的程序都看不见。靠找线来识别表格的做法之所以常常失败,原因就在这里。
所以读的是位置。一行之内,若字与字之间的空隙远宽于词间距,那里就是单元格的分界;当这些分界在连续几行里都落在同一个水平位置上,这一块就是表格。至少要三行。两行的块通常是标题配一个靠右的日期,把它做成表格只会更难读。
空单元格在文件里不留任何痕迹,因为那里本来就没有字。按顺序拼接会整体错开一位,所以每个单元格都落到离它最近的列,其余留空。
表格散落在好几页时,全堆进一张工作表就分不清某个数字来自哪一页。所以每页生成一张工作表,用页码命名。
不属于表格的行也保留,每行一条。丢掉表格上方的标题,或者说明数字单位的那句话,剩下的数字就没法解读了。 页面上的图片和印章也一并收进来。浮在单元格上会妨碍计算,所以放在每张工作表的数据下方。
拍纸张或用一体机扫出来的 PDF,整页就是一张照片。人眼看着是字,文件里却一个字也没有。没有东西可取,自然也没有东西可还原。
这个工具不会默默略过,而是明确告诉你。如果只有部分页是扫描件,它会用页码说明哪几页是空的。识别图片里文字的功能尚未加入。
整个转换都在这个浏览器里完成。读取 PDF 和写出新文档,都是在你设备上运行的代码做的。根本没有上传这一步。
你可以自己验证。打开开发者工具(F12)的网络面板,然后点转换:有没有一个和文件差不多大的上传请求,当场就看得见。
不会。从读取 PDF 到写出表格文件,全部在这个浏览器里完成。
会,每行一条,放在第一列。丢掉表格上方的标题或单位说明,剩下的数字就没人能解读了。
这是因为空单元格在 PDF 里不留痕迹。把每个单元格落到最近的列已经大大缓解了这个问题,但列间距非常窄的表格仍可能错位。
合并单元格不会被还原。合并区域里的值会落进离它最近的那一列。
PDF 不记录一个值是数字还是标签,所以原样保存。带千位分隔符或货币符号时 Excel 会当作文本。在 Excel 里把单元格格式改成数值即可。
不行。扫描件整页都是照片,没有文字可取。