PDF 转成 Word 后,什么留下了,什么消失了
把 PDF 转成 Word,表格歪了。你以为是转换器不行,换一个再试,结果差不多。有些问题不是换工具就能解决的。
放入 PDF,里面的文字会被还原成段落和表格,生成 Word 文件。不是把页面当成图片贴上去,而是当作真正的段落写进去,所以拿到的文件可以在 Word 里直接改。
不上传
要转换的 PDF
PDF 里必须有真正的文字。扫描的 PDF 每一页都是图片,没有可以取出的文字。文件只在这个浏览器里打开,不会上传。
会搬过去的是阅读顺序、段落和表格,页面上的精确排版不会照搬。PDF 从不记录哪里是段落、哪里是表格,这两样都是根据文字所在的位置重建出来的。
页面上的图片、印章和签名也会取出来放进文档,位置按阅读顺序排列,而不是原来的坐标。
扫描的 PDF 里装的是照片而不是文字,所以没有东西可以转换。放进来试试,工具会直接告诉你。
不会把整页当作图片贴进去。下载的文件可以直接在 Word 或 Excel 里编辑。
需要是带文字的 PDF。一次放多个也可以。
逐页读取文字的位置,归并成段落和表格。进度会按页码显示。
用 Word 打开就能改。原来的 PDF 不受影响。
PDF 不是装文字的格式,而是画页面的格式。文件里存着的只是「在这里印下这个字」这样的指令,段落在哪里断开、哪一块是表格,任何地方都没有记录。文档导出成 PDF 的那一刻,这些信息就被丢掉了。
所以还原不是转换,而是重建。靠文字摆放的位置、行距和字号来推测原来的样子。行距比平时宽,或者上一行没写到右边界就结束了,就认为段落在那里断开。若干行里格子的左边缘站在同一个位置,就认为那是表格。
既然是推测,就可能出错。但它不会编造没找到的值。没有文字的页会明确说没有,做好的文档还会被读回来核对,结果一并告诉你。
文字的顺序和段落、标题、表格都能带过来,分页也照样保留。页面上的图片、印章和签名也会被取出并放进去,只是位置按文字顺序排,而不是原来的坐标。带不过来的是页面内的精确排版、字体和文字颜色。
不去硬凑版式是有原因的。要把位置原样搬过去,就得摆一堆文本框钉在坐标上,这样做出来的文档虽然能打开,但改一行就散架。这个工具的目的是给你一份能改的文档。
| 项目 | 能否带过来 |
|---|---|
| 文字顺序与内容 | 能 |
| 段落划分 | 按位置重建 |
| 标题 | 比正文大的字号视为标题 |
| 表格 | 从对齐的值重建 |
| 分页 | 能 |
| 字体、颜色、精确排版 | 不能 |
| 图片、印章、签名 | 能。位置按文字顺序排 |
拍纸张或用一体机扫出来的 PDF,整页就是一张照片。人眼看着是字,文件里却一个字也没有。没有东西可取,自然也没有东西可还原。
这个工具不会默默略过,而是明确告诉你。如果只有部分页是扫描件,它会用页码说明哪几页是空的。识别图片里文字的功能尚未加入。
整个转换都在这个浏览器里完成。读取 PDF 和写出新文档,都是在你设备上运行的代码做的。根本没有上传这一步。
你可以自己验证。打开开发者工具(F12)的网络面板,然后点转换:有没有一个和文件差不多大的上传请求,当场就看得见。
不会。从读取 PDF 到写出 Word 文件,全部在这个浏览器里完成。不需要注册,也不用安装。
不会。文字内容、顺序、段落和表格都会搬过去,但页面内的排版不会照搬。要照搬就得用文本框钉坐标,那样的文档没法编辑。
PDF 里的表格常常没有线,即使有线也画在与文字不同的图层上,取文字时看不到。所以这里靠格子是否上下对齐来找表格。列间距很窄或有合并单元格时可能出错。
不行。扫描件整页都是照片,文件里没有文字。放进来试一下,工具会立刻告诉你。
知道密码就可以。遇到加密文件时页面上会出现密码框,填进去再点一次即可。
没有设上限。不过所有处理都在你的设备上跑,文档很长就相应地更慢。电脑比手机快。
把 PDF 转成 Word,表格歪了。你以为是转换器不行,换一个再试,结果差不多。有些问题不是换工具就能解决的。
两种情况:手里有个 .docx,却没有 Word;或者 Word 报出「Word found unreadable content」,拒绝打开。下面列出能免费打开它的软件、各自需要什么条件,以及哪个都打不开时,怎么把文字取出来。
合同里只要改一个日期。转成 Word 去改,表格和页边距全乱了;再导回 PDF,字体又变了。为了一行,整份文件都不一样了。