Co przetrwa, gdy PDF staje się plikiem Worda
Konwertujesz PDF-a na Worda, a tabela wychodzi krzywo. Zakładasz, że konwerter jest kiepski, próbujesz innego i dostajesz mniej więcej to samo. Są problemy, które nie znikają po zmianie narzędzia.
Upuść PDF-a, a tekst z jego wnętrza zostanie odtworzony jako akapity i tabele w pliku Worda. Nic nie jest wklejane jako obrazek strony, więc to, co pobierasz, jest dokumentem, w którym od razu da się pracować.
Bez wysyłania
PDF do przekształcenia
PDF musi zawierać prawdziwy tekst. Zeskanowany PDF to zdjęcie strony, więc nie ma z czego wyciągnąć tekstu. Pliki otwierają się tylko w tej przeglądarce i nigdy nie są wysyłane.
Przenoszona jest kolejność czytania, akapity i tabele. Dokładne położenie na stronie już nie. PDF nigdy nie zapisuje, co było akapitem, a co tabelą, więc jedno i drugie odtwarza się z położenia znaków.
Obrazy, pieczątki i podpisy wydrukowane na stronie też są wyciągane i umieszczane w dokumencie, w kolejności czytania, a nie w pierwotnym położeniu.
Zeskanowany PDF zawiera zdjęcia, nie tekst, więc nie ma czego przekształcać. Wrzuć plik, a narzędzie od razu to powie.
Strony nie są wklejane w całości jako obrazy. Pobrany plik otwiera się jako edytowalny dokument w Wordzie lub Excelu.
Plik musi zawierać prawdziwy tekst. Kilka naraz nie stanowi problemu.
Każda strona jest czytana pod kątem tego, gdzie siedzą jej znaki, a te są grupowane w akapity i tabele. Postęp pokazywany jest numerem strony.
Otwiera się w Wordzie gotowy do edycji. Twój oryginalny PDF zostaje nietknięty.
PDF nie jest formatem do przechowywania tekstu, tylko do rysowania strony. W pliku leży długa lista poleceń w rodzaju wydrukuj ten znak tutaj, a nigdzie nie zapisano, gdzie kończył się akapit ani który blok liczb był tabelą. Ta informacja jest wyrzucana w chwili, gdy dokument zostaje wyeksportowany do PDF-a.
To jest więc odtwarzanie, a nie konwersja. Miejsce, w którym siedzą znaki, odstęp między wierszami i wielkość pisma są czytane wstecz, żeby wywnioskować pierwotny kształt. Odstęp szerszy niż zwykle albo wiersz, który skończył się daleko przed prawym marginesem, znaczy, że tam kończył się akapit. Komórki, których lewa krawędź stoi w tym samym miejscu przez kilka wierszy, znaczą tabelę.
Skoro to domysł, może chybić. Czego nie zrobi, to nie wymyśli wartości, której nie znalazł. Strony bez tekstu są zgłaszane jako puste, a gotowy dokument jest odczytywany z powrotem i sprawdzany, zanim do ciebie trafi.
Kolejność czytania, akapity, nagłówki i tabele przechodzą, podziały stron również. Obrazy, pieczątki i podpisy też są wyciągane ze strony i wstawiane, tyle że układają się w kolejności czytania, a nie we współrzędnych oryginału. Nie przechodzi dokładne rozmieszczenie na stronie, kroje pisma i kolor tekstu.
Układ celowo nie jest naśladowany. Odtworzenie pozycji oznaczałoby rozsypanie pól tekstowych po stałych współrzędnych, a dokument zbudowany w ten sposób owszem się otwiera, ale rozsypuje się, gdy tylko poprawisz jeden wiersz. Celem tego narzędzia jest dokument, w którym da się pracować.
| Pozycja | Czy przechodzi? |
|---|---|
| Kolejność czytania i treść | Tak |
| Podział na akapity | Odtwarzany z położenia |
| Nagłówki | Pismo większe od tekstu głównego uznaje się za nagłówek |
| Tabele | Odtwarzane z wartości ustawionych w kolumnach |
| Podziały stron | Tak |
| Kroje pisma, kolor, dokładny układ | Nie |
| Obrazy, pieczątki, podpisy | Tak, wstawiane w kolejności czytania |
PDF zrobiony przez sfotografowanie papieru albo przepuszczenie go przez biurowy skaner to jeden obrazek na stronę. Twoje oczy widzą litery, ale plik nie zawiera ani jednej. Nie ma czego wyciągać, więc nie ma czego odtwarzać.
Narzędzie mówi to wprost, zamiast wręczać ci pusty plik. Jeśli tylko część stron to skany, podaje, które numery stron wróciły puste. Odczytywanie tekstu z obrazków nie należy do tego, co to narzędzie robi.
Cała konwersja dzieje się w tej przeglądarce. Odczyt PDF-a i zapis nowego dokumentu wykonuje kod działający na twoim urządzeniu. Kroku wysyłania po prostu nie ma.
Możesz to sprawdzić. Otwórz kartę sieci w narzędziach programisty (F12) i uruchom konwersję: albo pojawi się żądanie wysłania wielkości twojego pliku, albo nie.
Nie. Odczyt PDF-a i zapis pliku Worda odbywają się w tej przeglądarce. Nie ma konta ani niczego do zainstalowania.
Nie. Treść, kolejność czytania, akapity i tabele przechodzą, ale rozmieszczenie na stronie nie jest odtwarzane. Naśladowanie go oznaczałoby przybijanie pól tekstowych do współrzędnych, a takiego dokumentu nie da się edytować.
Tabele w PDF-ach często nie mają linii, a tam gdzie są, narysowano je na innej warstwie, której wyciąganie tekstu nigdy nie widzi. Dlatego tabele znajduje się, sprawdzając, czy komórki układają się w pionie. Bardzo wąskie odstępy kolumn i scalone komórki mogą to popsuć.
Nie. Skan to obrazek strony i nie zawiera ani jednej litery. Upuść taki plik, a narzędzie powie ci to od razu.
Zadziała, jeśli znasz hasło. Gdy narzędzie natrafi na zaszyfrowany plik, pojawi się pole na hasło. Wpisz je i uruchom konwersję ponownie.
Żaden nie jest narzucony. Wszystko działa jednak na twoim urządzeniu, więc bardzo długi dokument zajmie proporcjonalnie więcej czasu. Komputer radzi sobie szybciej niż telefon.
Konwertujesz PDF-a na Worda, a tabela wychodzi krzywo. Zakładasz, że konwerter jest kiepski, próbujesz innego i dostajesz mniej więcej to samo. Są problemy, które nie znikają po zmianie narzędzia.
Dwie sytuacje: masz plik .docx, a nie masz Worda, albo Word odmawia otwarcia pliku z komunikatem „Word found unreadable content” (Word znalazł nieczytelną zawartość). Poniżej darmowe programy, które go otworzą, czego każdy z nich od ciebie wymaga i jak wyciągnąć tekst z pliku, którego nie otworzy żaden z nich.
W umowie trzeba zmienić jedną datę. Zamieniasz na Worda i rozjeżdżają się tabele oraz marginesy, eksportujesz z powrotem do PDF i zmieniają się jeszcze fonty. Przez jeden wiersz cały dokument robi się inny.