PDF 轉成 Word 後,什麼留下了,什麼消失了
把 PDF 轉成 Word,表格歪了。你以為是轉換器不行,換一個再試,結果差不多。有些問題不是換工具就能解決的。
弄清楚原因,就知道該挑什麼工具、能指望到什麼程度。
PDF 是印刷品,不是文件
PDF 裡裝著的只是一長串指令:在橫 72、縱 680 的位置印下這個字。段落在哪裡斷開、哪兩行屬於同一個表格的同一列,檔案裡任何地方都沒有紀錄。
因為文件匯出成 PDF 的那一刻這些資訊就被丟掉了,就像印在紙上的內容不需要段落資訊一樣。所以把它還原不是轉換,而是重建:靠文字擺放的位置來推測原本的樣子。
這一句話就能解釋其餘的一切。表格之所以歪,不是因為轉換器讀錯了表格,而是因為根本沒有表格可讀,只能靠位置重新拼一個出來。
能推斷的,和根本不存在的
把這兩類分開,就知道什麼能改進、什麼不可能。
- 能推斷的。段落劃分(靠行距和每行在哪裡停住)、表格(靠格子是否上下對齊)、標題(靠字級是否大於內文)。演算法變好,準確率就會上升。
- 能直接取出的。文字本身,以及印在頁面上的圖片與印章。它們是檔案裡實實在在的物件,不需要猜。
- 根本沒紀錄的。原件用的是 Word 的哪個樣式、表格在哪裡合併了儲存格、段落之間空了幾點。這些沒有任何工具能造出來。
當心那些號稱完全還原版面的轉換器
有些工具宣傳輸出和原件像素級一致。打開一看確實如此。然後你改一行,文件就散了。
要做到那樣,只能把文字塞進幾百個釘在固定座標上的文字方塊,而不是放進段落。這樣搭出來的文件看著像原件,卻沒辦法在裡面工作。刪掉一個字,只有那個方塊會重排,周圍的一切紋風不動。
| 你要的是什麼 | 該選什麼 |
|---|---|
| 讀懂並修改內容 | 把段落重建出來的轉換器 |
| 只是看一看 | 別轉換,用 PDF 閱讀器 |
| 必須和印刷品一模一樣 | 別轉換,就用 PDF |
| 要拿數字做計算 | 轉成試算表 |
轉換的存在是為了讓你能改。改不了的輸出就失去了意義。如果目標是看起來一模一樣,那一開始就沒有轉換的理由。
表格出錯的真正原因
PDF 裡的表格經常根本沒有框線。就算有,那些線也畫在與文字不同的圖層上,任何取文字的程式都看不見。靠找線來辨識表格的做法之所以常常失敗,原因就在這裡。
所以讀的是位置:若干列裡左緣站在同一處的格子,就當成一個表格。這個辦法最怕空儲存格。空儲存格在檔案裡不留任何痕跡,於是那一列看起來就少了一格,後面的內容整體錯開一位。
合併儲存格也一樣。你的眼睛看到兩格併成一格,檔案裡不過是有一段文字比鄰居稍微靠左而已。
掃描的 PDF,任何工具都轉不了
事務機掃出來的 PDF,每頁就是一張照片。你的眼睛看到字,檔案裡一個也沒有。這不是工具的能力問題,而是原件裡沒有資訊。
用文字辨識(OCR)可以從圖片裡造出文字。但那是辨識而不是擷取,會混進把數字 0 讀成字母 O 這類錯誤。在合約或送件資料裡,這種錯誤代價很高。能向核發單位要原始檔案的話通常更快。
歸結起來
挑轉換器該問的不是「像不像」,而是「改不改得了」。而當結果不完美時,能分清這是工具的極限還是格式的極限,就能省下反覆換工具的時間。
常見問題
- 為什麼不同轉換器結果不一樣?
- 因為它們推斷的規則不同。行距寬到什麼程度算段落斷開、幾列對齊才算表格,每家劃線的位置都略有差異。所以不同類型的文件各有更合適的工具。
- 我的表格老是出錯,有辦法嗎?
- 空儲存格越多的表格越容易出錯,因為空儲存格在 PDF 裡不留痕跡。如果你要的只是表格,轉成試算表比轉成 Word 更合適。試算表那條路專門做了把儲存格對到欄上的處理,即使錯位也更容易手工修。
- 圖片和印章能帶過來嗎?
- 能。它們是印在頁面上的實體物件,不需要推測,直接取出來。位置依文字順序排,而不是原本的座標,因為釘在座標上會得到一份改不了的文件。
- 字體變了。
- PDF 確實內嵌了字體檔,但不保證它們帶著原文件指定的名字,更不保證打開結果的那台機器裝了同一款字體。所以字體不搬,直接用預設字體。
- 有不上傳檔案的轉換器嗎?
- 有,本站的工具就是。整個轉換在瀏覽器裡完成,沒有上傳這一步。想確認的話,打開開發者工具的網路面板再按轉換就能看到。
更新於 2026年9月17日