PDF 转 Word

放入 PDF,里面的文字会被还原成段落和表格,生成 Word 文件。不是把页面当成图片贴上去,而是当作真正的段落写进去,所以拿到的文件可以在 Word 里直接改。

不上传

要转换的 PDF

PDF 里必须有真正的文字。扫描的 PDF 每一页都是图片,没有可以取出的文字。文件只在这个浏览器里打开,不会上传。

会搬过去的是阅读顺序、段落和表格,页面上的精确排版不会照搬。PDF 从不记录哪里是段落、哪里是表格,这两样都是根据文字所在的位置重建出来的。

页面上的图片、印章和签名也会取出来放进文档,位置按阅读顺序排列,而不是原来的坐标。

扫描的 PDF 里装的是照片而不是文字,所以没有东西可以转换。放进来试试,工具会直接告诉你。

不会把整页当作图片贴进去。下载的文件可以直接在 Word 或 Excel 里编辑。

把 PDF 转成 Word 的步骤

  1. 1

    放入 PDF

    需要是带文字的 PDF。一次放多个也可以。

  2. 2

    点转换

    逐页读取文字的位置,归并成段落和表格。进度会按页码显示。

  3. 3

    下载 DOCX

    用 Word 打开就能改。原来的 PDF 不受影响。

这个工具做的事

把 PDF 还原回去是什么意思

PDF 不是装文字的格式,而是画页面的格式。文件里存着的只是「在这里印下这个字」这样的指令,段落在哪里断开、哪一块是表格,任何地方都没有记录。文档导出成 PDF 的那一刻,这些信息就被丢掉了。

所以还原不是转换,而是重建。靠文字摆放的位置、行距和字号来推测原来的样子。行距比平时宽,或者上一行没写到右边界就结束了,就认为段落在那里断开。若干行里格子的左边缘站在同一个位置,就认为那是表格。

既然是推测,就可能出错。但它不会编造没找到的值。没有文字的页会明确说没有,做好的文档还会被读回来核对,结果一并告诉你。

什么能带过来,什么带不过来

文字的顺序和段落、标题、表格都能带过来,分页也照样保留。页面上的图片、印章和签名也会被取出并放进去,只是位置按文字顺序排,而不是原来的坐标。带不过来的是页面内的精确排版、字体和文字颜色。

不去硬凑版式是有原因的。要把位置原样搬过去,就得摆一堆文本框钉在坐标上,这样做出来的文档虽然能打开,但改一行就散架。这个工具的目的是给你一份能改的文档。

项目能否带过来
文字顺序与内容能
段落划分按位置重建
标题比正文大的字号视为标题
表格从对齐的值重建
分页能
字体、颜色、精确排版不能
图片、印章、签名能。位置按文字顺序排

扫描的 PDF 还原不了

拍纸张或用一体机扫出来的 PDF,整页就是一张照片。人眼看着是字,文件里却一个字也没有。没有东西可取,自然也没有东西可还原。

这个工具不会默默略过,而是明确告诉你。如果只有部分页是扫描件,它会用页码说明哪几页是空的。识别图片里文字的功能尚未加入。

文件不会离开你的设备

整个转换都在这个浏览器里完成。读取 PDF 和写出新文档,都是在你设备上运行的代码做的。根本没有上传这一步。

你可以自己验证。打开开发者工具(F12)的网络面板,然后点转换:有没有一个和文件差不多大的上传请求,当场就看得见。

常见问题

文件会上传到服务器吗+

不会。从读取 PDF 到写出 Word 文件,全部在这个浏览器里完成。不需要注册,也不用安装。

生成的 Word 会和原件长得一模一样吗+

不会。文字内容、顺序、段落和表格都会搬过去,但页面内的排版不会照搬。要照搬就得用文本框钉坐标,那样的文档没法编辑。

表格出得不对+

PDF 里的表格常常没有线,即使有线也画在与文字不同的图层上,取文字时看不到。所以这里靠格子是否上下对齐来找表格。列间距很窄或有合并单元格时可能出错。

扫描的 PDF 可以吗+

不行。扫描件整页都是照片,文件里没有文字。放进来试一下,工具会立刻告诉你。

加密的 PDF 呢+

知道密码就可以。遇到加密文件时页面上会出现密码框,填进去再点一次即可。

有页数上限吗+

没有设上限。不过所有处理都在你的设备上跑,文档很长就相应地更慢。电脑比手机快。