Chuyển PDF sang Word thì cái gì còn lại, cái gì mất đi
Bạn chuyển một tệp PDF sang Word và cái bảng méo xẹo. Bạn cho rằng công cụ dở, thử cái khác, và kết quả cũng gần như vậy. Có những vấn đề không biến mất khi đổi công cụ.
Thả một tệp PDF và chữ bên trong được dựng lại thành đoạn văn và bảng trong tệp Word. Không có gì bị dán vào dưới dạng ảnh chụp trang, nên thứ bạn tải về là tài liệu sửa được ngay.
Không tải lên
PDF cần chuyển
PDF phải có chữ thật bên trong. PDF scan là ảnh chụp của trang nên không có chữ nào để lấy ra. Tệp chỉ được mở trong trình duyệt này và không bao giờ được tải lên.
Thứ tự đọc, đoạn văn và bảng được chuyển sang. Vị trí chính xác trên trang thì không. PDF không ghi lại đâu là đoạn văn, đâu là bảng, nên cả hai đều được dựng lại từ vị trí của các chữ.
Hình ảnh, con dấu và chữ ký in trên trang cũng được lấy ra và đặt vào tài liệu. Chúng nằm theo thứ tự đọc chứ không theo tọa độ gốc.
PDF scan chứa ảnh chụp chứ không chứa chữ, nên không có gì để chuyển. Cứ thả tệp vào, công cụ sẽ báo ngay.
Không dán cả trang vào dưới dạng ảnh. Tệp bạn tải về mở ra là tài liệu sửa được trong Word hoặc Excel.
Tệp cần có chữ thật bên trong. Thả nhiều tệp cùng lúc cũng được.
Mỗi trang được đọc xem các ký tự nằm ở đâu, rồi gom thành đoạn văn và bảng. Tiến độ hiện theo số trang.
Nó mở trong Word và sửa được ngay. Tệp PDF gốc không bị đụng tới.
PDF không phải định dạng để chứa văn bản mà để vẽ ra trang giấy. Thứ nằm trong tệp chỉ là một danh sách dài các lệnh bảo in ký tự này ở chỗ này, và không nơi nào ghi lại đoạn văn kết thúc ở đâu hay khối số nào từng là một cái bảng. Thông tin ấy bị vứt đi ngay khi tài liệu được xuất ra PDF.
Vì vậy đây là dựng lại chứ không phải chuyển đổi. Vị trí các ký tự, khoảng cách giữa các dòng và cỡ chữ được đọc ngược để đoán ra hình dạng ban đầu. Một khoảng hở rộng hơn thường lệ, hoặc một dòng kết thúc còn xa lề phải, nghĩa là đoạn văn dừng ở đó. Các ô có mép trái đứng cùng một chỗ qua nhiều dòng nghĩa là một cái bảng.
Đã là phỏng đoán thì có thể sai. Điều nó không làm là bịa ra một giá trị không tìm thấy. Trang không có chữ được báo là rỗng, và tài liệu vừa dựng xong còn được đọc lại để kiểm tra trước khi bạn nhận.
Thứ tự đọc, đoạn văn, tiêu đề và bảng đều sang được, ngắt trang cũng vậy. Hình ảnh, con dấu và chữ ký trên trang cũng được lấy ra và đưa vào, chỉ có điều chúng nằm theo thứ tự đọc chứ không theo toạ độ gốc. Thứ không sang được là vị trí chính xác trên trang, phông chữ và màu chữ.
Bố cục cố tình không được bắt chước. Tái hiện vị trí nghĩa là rải hàng loạt hộp văn bản ở toạ độ cố định, và một tài liệu dựng như thế mở ra thì bình thường nhưng vỡ tung ngay khi bạn sửa một dòng. Mục đích của công cụ này là một tài liệu bạn làm việc được.
| Hạng mục | Có sang được không |
|---|---|
| Thứ tự đọc và nội dung chữ | Có |
| Ngắt đoạn văn | Dựng lại từ vị trí |
| Tiêu đề | Cỡ chữ lớn hơn thân bài được coi là tiêu đề |
| Bảng | Dựng lại từ các giá trị xếp thẳng hàng |
| Ngắt trang | Có |
| Phông chữ, màu, bố cục chính xác | Không |
| Hình ảnh, con dấu, chữ ký | Có, đặt theo thứ tự đọc |
Một tệp PDF tạo ra bằng cách chụp giấy hay đưa qua máy quét văn phòng chỉ là một tấm ảnh cho mỗi trang. Mắt bạn thấy chữ, nhưng trong tệp thì không có chữ nào. Không có gì để lấy ra nên cũng không có gì để dựng lại.
Công cụ nói thẳng điều đó thay vì đưa cho bạn một tệp rỗng. Nếu chỉ vài trang là ảnh quét, nó nêu rõ những trang nào trả về rỗng. Đọc chữ ra từ hình ảnh không phải việc công cụ này làm.
Toàn bộ việc chuyển đổi diễn ra bên trong trình duyệt này. Đọc tệp PDF và viết tài liệu mới đều do mã chạy trên thiết bị của bạn thực hiện. Không hề có bước tải lên nào.
Bạn có thể tự kiểm chứng. Mở tab mạng trong công cụ dành cho nhà phát triển (F12) rồi chạy một lần chuyển đổi: hoặc có một yêu cầu tải lên lớn bằng tệp của bạn, hoặc không.
Không. Đọc tệp PDF và viết tệp Word đều diễn ra bên trong trình duyệt này. Không có tài khoản và không phải cài gì.
Không. Câu chữ, thứ tự đọc, đoạn văn và bảng sang được, nhưng vị trí trên trang thì không được tái hiện. Bắt chước nó nghĩa là ghim các hộp văn bản vào toạ độ, và một tài liệu như vậy không sửa được.
Bảng trong PDF thường không có đường kẻ, và chỗ nào có thì những đường ấy nằm ở lớp khác mà việc trích chữ không bao giờ thấy. Nên bảng được tìm bằng cách xem các ô có thẳng hàng dọc trang không. Khoảng cách cột hẹp và ô gộp có thể làm hỏng điều đó.
Không. Bản quét là ảnh chụp trang giấy và không chứa chữ nào. Thả vào thử là công cụ báo ngay.
Được, nếu bạn biết mật khẩu. Khi gặp tệp được mã hoá, một ô nhập mật khẩu hiện ra. Nhập vào rồi chạy lại.
Không đặt giới hạn. Nhưng mọi thứ chạy trên máy bạn, nên tài liệu rất dài sẽ lâu tương ứng. Máy tính xử lý nhanh hơn điện thoại.
Bạn chuyển một tệp PDF sang Word và cái bảng méo xẹo. Bạn cho rằng công cụ dở, thử cái khác, và kết quả cũng gần như vậy. Có những vấn đề không biến mất khi đổi công cụ.
Hai tình huống: bạn có một tệp .docx mà không có Word, hoặc Word từ chối tệp với thông báo “Word found unreadable content” (Word phát hiện nội dung không đọc được). Dưới đây là các chương trình miễn phí mở được nó, mỗi cái đòi hỏi bạn những gì, và cách lấy chữ ra khỏi một tệp mà không cái nào mở được.
Chỉ cần sửa một dòng ngày tháng trong hợp đồng. Chuyển sang Word thì bảng và lề xô lệch, xuất ngược lại PDF thì phông chữ cũng đổi. Một dòng thôi mà cả tài liệu thành ra khác.