เมื่อ PDF กลายเป็นไฟล์ Word อะไรเหลืออยู่ อะไรหายไป

คุณแปลง PDF เป็น Word แล้วตารางออกมาเบี้ยว คุณคิดว่าตัวแปลงไม่ดี ลองอีกตัวก็ได้ผลใกล้เคียงกัน ปัญหาบางอย่างไม่หายไปด้วยการเปลี่ยนเครื่องมือ

Ashton
รูปแบบไฟล์

เข้าใจว่าทำไม แล้วคุณจะรู้ว่าควรเลือกเครื่องมือไหนและคาดหวังได้แค่ไหน

PDF คือสิ่งพิมพ์ ไม่ใช่เอกสาร

สิ่งที่อยู่ในไฟล์ PDF คือรายการคำสั่งยาว ๆ ที่บอกว่าให้พิมพ์อักขระตัวนี้ที่ตำแหน่ง 72, 680 ไม่มีที่ใดในไฟล์บันทึกว่าย่อหน้าจบตรงไหน หรือสองบรรทัดไหนเคยอยู่ในแถวเดียวกันของตาราง

ข้อมูลนั้นถูกทิ้งไปตั้งแต่ตอนที่เอกสารถูกส่งออกเป็น PDF เหมือนกระดาษที่พิมพ์ออกมาแล้วไม่ต้องการมันอีก การย้อนกลับจึงเป็นการประกอบขึ้นใหม่ ไม่ใช่การแปลง รูปร่างเดิมถูกอนุมานจากตำแหน่งที่ตัวอักษรวางอยู่

ประโยคเดียวนี้อธิบายที่เหลือทั้งหมด ตารางเบี้ยวไม่ใช่เพราะตัวแปลงอ่านตารางผิด แต่เพราะไม่มีตารางให้อ่านตั้งแต่แรก และต้องอนุมานขึ้นมาจากตำแหน่งล้วน ๆ

สิ่งที่อนุมานได้ กับสิ่งที่ไม่เคยมี

แยกสองอย่างนี้ออกจากกัน แล้วจะรู้ว่าอะไรพัฒนาได้และอะไรทำไม่ได้

  • อนุมานได้ การแบ่งย่อหน้า จากระยะห่างบรรทัดและจุดที่บรรทัดหยุด ตาราง จากการที่ช่องเรียงตรงกันลงมาหรือไม่ หัวข้อ จากตัวอักษรที่ใหญ่กว่าเนื้อความ อัลกอริทึมที่ดีขึ้นทำให้แม่นขึ้น
  • ดึงออกมาได้ตรง ๆ ตัวอักษรเอง และรูปภาพหรือตราประทับที่พิมพ์อยู่บนหน้า สิ่งเหล่านี้เป็นวัตถุจริงในไฟล์ จึงไม่ต้องเดา
  • ไม่เคยถูกบันทึก ต้นฉบับใช้สไตล์ไหนของ Word ตารางผสานช่องตรงไหน ระหว่างย่อหน้าเว้นกี่พอยต์ ไม่มีเครื่องมือใดสร้างสิ่งเหล่านี้ขึ้นมาได้

ระวังตัวแปลงที่ลอกการจัดวางมาทั้งดุ้น

บางเครื่องมือโฆษณาว่าผลลัพธ์ตรงกับต้นฉบับทุกพิกเซล เปิดดูก็ตรงจริง ๆ แล้วพอคุณแก้บรรทัดเดียว เอกสารก็พัง

การทำแบบนั้นหมายถึงยัดข้อความลงในกล่องข้อความหลายร้อยกล่องที่ตรึงไว้ที่พิกัดตายตัว แทนที่จะใส่ในย่อหน้า เอกสารที่สร้างแบบนี้ดูเหมือนต้นฉบับแต่ทำงานต่อไม่ได้ ลบอักขระหนึ่งตัว มีแต่กล่องนั้นที่ขยับ ส่วนรอบ ๆ อยู่นิ่งสนิท

คุณต้องการอะไรควรเลือกอะไร
อ่านและแก้ไขเนื้อหาตัวแปลงที่ประกอบย่อหน้าขึ้นใหม่
แค่อ่านอย่างเดียวอย่าแปลง ใช้โปรแกรมอ่าน PDF
ต้องเหมือนสิ่งพิมพ์เป๊ะอย่าแปลง เก็บเป็น PDF ไว้
ต้องคำนวณตัวเลขแปลงเป็นสเปรดชีต

การแปลงมีอยู่เพื่อให้คุณแก้ไขได้ ผลลัพธ์ที่แก้ไม่ได้ก็เสียความหมายไป ถ้าเป้าหมายคือให้ดูเหมือนกันเป๊ะ ตั้งแต่แรกก็ไม่มีเหตุผลที่ต้องแปลง

เหตุผลที่แท้จริงที่ตารางออกมาผิด

ตารางใน PDF บ่อยครั้งไม่มีเส้นล้อมรอบเลย ที่มีเส้นก็ถูกวาดอยู่คนละชั้นกับข้อความ มองไม่เห็นจากฝั่งที่ดึงคำออกมา นี่คือเหตุผลที่วิธีซึ่งอาศัยการหาเส้นล้มเหลวบ่อยเหลือเกิน

สิ่งที่ถูกอ่านจึงเป็นตำแหน่ง ช่องที่ขอบซ้ายยืนตรงที่เดียวกันหลายบรรทัดจะถือเป็นตาราง วิธีนี้อ่อนที่สุดเมื่อเจอเซลล์ว่าง เซลล์ว่างไม่ทิ้งร่องรอยในไฟล์ แถวนั้นจึงดูเหมือนมีช่องน้อยไปหนึ่ง และทุกอย่างหลังจากนั้นเลื่อนไปหนึ่งช่อง

เซลล์ที่ผสานกันก็เช่นกัน ตาคุณเห็นสองช่องรวมเป็นหนึ่ง แต่ในไฟล์มีแค่ข้อความชิ้นหนึ่งที่วางเยื้องไปทางซ้ายกว่าเพื่อนบ้านเล็กน้อย

ไม่มีเครื่องมือใดแปลง PDF ที่สแกนมาได้

PDF ที่ได้จากเครื่องสแกนสำนักงานคือภาพถ่ายหนึ่งภาพต่อหนึ่งหน้า ตาคุณเห็นตัวหนังสือ แต่ไฟล์ไม่มีเลย นี่ไม่ใช่ข้อจำกัดของเครื่องมือ แต่เป็นสิ่งที่ขาดหายในต้นฉบับ

การรู้จำอักขระ (OCR) สร้างข้อความขึ้นมาจากภาพได้ แต่นั่นคือการรู้จำ ไม่ใช่การดึงออกมา และมันปนความผิดพลาดแบบอ่านเลขศูนย์เป็นตัว O ในสัญญาหรือเอกสารที่ต้องยื่น ความผิดพลาดแบบนั้นมีราคาแพง ขอไฟล์ต้นฉบับจากผู้ออกเอกสารมักเร็วกว่า

สรุปแล้ว

คำถามที่ควรถามเครื่องมือแปลงไม่ใช่ว่าเหมือนแค่ไหน แต่คือคุณแก้สิ่งที่ได้ออกมาได้หรือไม่ และเมื่อผลลัพธ์ไม่สมบูรณ์ การแยกออกว่านี่คือข้อจำกัดของเครื่องมือหรือของรูปแบบไฟล์ จะช่วยให้คุณไม่ต้องเสียเวลาเปลี่ยนเครื่องมือไปเรื่อย ๆ

คำถามที่พบบ่อย

ทำไมเครื่องมือแต่ละตัวให้ผลต่างกัน
เพราะกฎการอนุมานต่างกัน ช่องว่างกว้างแค่ไหนถึงนับเป็นการจบย่อหน้า กี่แถวที่เรียงตรงกันถึงนับเป็นตาราง แต่ละตัวขีดเส้นเหล่านี้ไว้ต่างกันเล็กน้อย เครื่องมือหนึ่งจึงเหมาะกับเอกสารบางประเภทมากกว่าอีกตัว
ตารางผิดตลอด พอมีทางไหมครับ
ตารางที่มีเซลล์ว่างมากยิ่งแย่ เพราะเซลล์ว่างไม่ทิ้งร่องรอยใน PDF ถ้าคุณต้องการแค่ตาราง การแปลงเป็นสเปรดชีตดีกว่าแปลงเป็น Word เพราะเส้นทางสเปรดชีตจงใจจับเซลล์ให้เข้าคอลัมน์ และถ้าเบี้ยวก็แก้ด้วยมือได้ง่ายกว่า
รูปภาพกับตราประทับตามมาด้วยไหม
ตามมา มันเป็นวัตถุจริงที่พิมพ์อยู่บนหน้า จึงไม่ต้องเดา ดึงออกมาได้ตามที่เป็น ตำแหน่งที่ไปตกจะเรียงตามลำดับการอ่าน ไม่ใช่พิกัดเดิม เพราะการตรึงไว้ที่พิกัดจะได้เอกสารที่แก้ไขไม่ได้
แบบอักษรเปลี่ยนไป
PDF ฝังไฟล์แบบอักษรไว้จริง แต่ไม่มีอะไรรับประกันว่ามันมีชื่อตรงกับที่เอกสารต้นฉบับกำหนด และยิ่งไม่มีอะไรรับประกันว่าเครื่องที่เปิดผลลัพธ์จะติดตั้งแบบอักษรเดียวกัน จึงปล่อยแบบอักษรไว้และใช้ค่าเริ่มต้นแทน
มีตัวแปลงที่ไม่อัปโหลดไฟล์ไหม
มี เครื่องมือบนเว็บนี้ทำแบบนั้น การแปลงทั้งหมดจบในเบราว์เซอร์ จึงไม่มีขั้นตอนอัปโหลด ถ้าจะตรวจสอบ ให้เปิดแท็บเน็ตเวิร์กในเครื่องมือนักพัฒนาแล้วสั่งแปลง

อัปเดต 17 กันยายน 2569

เครื่องมือที่เกี่ยวข้อง