Co przetrwa, gdy PDF staje się plikiem Worda

Konwertujesz PDF-a na Worda, a tabela wychodzi krzywo. Zakładasz, że konwerter jest kiepski, próbujesz innego i dostajesz mniej więcej to samo. Są problemy, które nie znikają po zmianie narzędzia.

Ashton
Formaty

Zrozumienie przyczyny podpowiada, które narzędzie wybrać i czego się po nim spodziewać.

PDF to wydruk, nie dokument

W pliku PDF leży długa lista poleceń w rodzaju wydrukuj ten znak w punkcie 72, 680. Nigdzie w pliku nie zapisano, gdzie kończył się akapit ani które dwa wiersze należały do tego samego wiersza tabeli.

Ta informacja jest wyrzucana w chwili eksportu dokumentu do PDF-a, dokładnie tak samo jak wydrukowana kartka jej nie potrzebuje. Przywrócenie go jest więc odtwarzaniem, a nie konwersją: pierwotny kształt wywnioskowuje się z tego, gdzie siedzą znaki.

To jedno zdanie tłumaczy całą resztę. Tabela wychodzi krzywo nie dlatego, że konwerter źle ją odczytał, ale dlatego, że nie było żadnej tabeli do odczytania i trzeba ją było wywnioskować z samego położenia.

To, co da się wywnioskować, i to, czego nigdy nie było

Rozdzielenie tych dwóch rzeczy mówi, co może się poprawić, a co nie.

  • Do wywnioskowania. Podział na akapity, z odstępów między wierszami i z tego, gdzie wiersz się urywa. Tabele, z tego, czy komórki układają się w pionie. Nagłówki, z pisma większego niż tekst główny. Lepsze algorytmy zwiększają tu dokładność.
  • Do bezpośredniego wyciągnięcia. Same znaki oraz wszelkie obrazy i pieczątki wydrukowane na stronie. To realne obiekty w pliku i nie trzeba ich zgadywać.
  • Nigdy niezapisane. Jakiego stylu Worda używał oryginał, gdzie tabela miała scalone komórki, ile punktów odstępu dzieliło akapity. Żadne narzędzie tego nie wytworzy.

Uważaj na konwertery odtwarzające układ co do joty

Niektóre narzędzia reklamują wynik zgodny z oryginałem piksel w piksel. Otwierasz go i faktycznie tak jest. Potem poprawiasz jeden wiersz i dokument się rozsypuje.

Osiągnięcie tego oznacza wrzucenie tekstu do setek pól tekstowych przybitych do stałych współrzędnych zamiast do akapitów. Dokument zbudowany w ten sposób wygląda jak oryginał, ale nie da się w nim pracować. Skasuj jeden znak, a dopasuje się tylko to jedno pole, podczas gdy wszystko wokół stoi w miejscu.

Czego potrzebujeszCo wybrać
Przeczytać i poprawić treśćKonwerter, który odtwarza akapity
Tylko przeczytaćNie konwertuj, użyj czytnika PDF
Ma być jak wydrukNie konwertuj, zostaw PDF-a
Liczyć na liczbachPrzekonwertuj na arkusz

Konwersja istnieje po to, żebyś mógł poprawiać. Wynik, którego nie da się poprawić, stracił sens. Jeśli celem jest wyglądać identycznie, to od początku nie było powodu konwertować.

Prawdziwy powód, dla którego tabele wychodzą źle

Tabele w PDF-ach bardzo często nie mają żadnych linii. Tam gdzie są, narysowano je na innej warstwie niż tekst, niewidocznej dla czegokolwiek, co wyciąga słowa. Dlatego podejścia oparte na znajdowaniu linii zawodzą tak często.

Czytane jest więc położenie: komórki, których lewa krawędź pokrywa się przez kilka wierszy, uznaje się za tabelę. Metoda jest najsłabsza przy pustych komórkach. Pusta komórka nie zostawia w pliku śladu, więc ten wiersz wygląda, jakby miał o komórkę mniej, a wszystko po nim przesuwa się o jedno.

Ze scalonymi komórkami jest tak samo. Twoje oko widzi dwie zlane komórki, a plik zawiera jeden kawałek tekstu stojący odrobinę bardziej na lewo niż sąsiedzi.

Zeskanowanego PDF-a nie przekonwertuje żadne narzędzie

PDF wyprodukowany przez biurowy skaner to jedno zdjęcie na stronę. Twoje oczy widzą litery, plik nie zawiera ani jednej. To nie ograniczenie narzędzia, tylko brak w źródle.

Rozpoznawanie znaków potrafi wytworzyć tekst z obrazka. Ale to rozpoznawanie, a nie wyciąganie, i wmieszają się w to błędy w rodzaju odczytania zera jako litery O. W umowie albo w składanym formularzu taki błąd kosztuje drogo. Poproszenie wystawcy o oryginalny plik zwykle idzie szybciej.

W skrócie

Pytanie do konwertera nie brzmi, jak blisko trafia, tylko czy da się poprawić to, co z niego wychodzi. A gdy wynik nie jest doskonały, umiejętność odróżnienia granicy narzędzia od granicy formatu oszczędza ci bezcelowej wymiany narzędzi.

Najczęstsze pytania

Dlaczego różne konwertery dają różne wyniki?
Bo różnią się ich reguły wnioskowania. Jak szeroka przerwa liczy się jako koniec akapitu, ile wyrównanych wierszy liczy się jako tabela: każde narzędzie stawia te granice nieco inaczej. Dlatego jedno pasuje do pewnych dokumentów lepiej niż drugie.
Moje tabele ciągle wychodzą źle. Da się coś zrobić?
Im więcej pustych komórek ma tabela, tym gorzej, bo pusta komórka nie zostawia w PDF-ie śladu. Jeśli potrzebujesz tylko tabeli, konwersja na arkusz jest lepsza niż na Worda. Ta droga celowo zrzuca komórki do kolumn, a przesunięcie łatwiej poprawić ręcznie.
Czy obrazy i pieczątki przechodzą?
Tak. To realne obiekty wydrukowane na stronie, więc nie trzeba ich zgadywać i są wyciągane w takiej postaci, w jakiej są. O tym, gdzie wylądują, decyduje kolejność czytania, a nie oryginalne współrzędne, bo przybicie ich do współrzędnych dałoby dokument, którego nie da się edytować.
Zmieniły się kroje pisma.
PDF faktycznie osadza pliki krojów, ale nic nie gwarantuje, że noszą nazwę wskazaną przez oryginalny dokument, a tym bardziej że ten sam krój jest zainstalowany na maszynie otwierającej wynik. Dlatego kroje zostawia się w spokoju i używa domyślnego.
Czy jest konwerter, który nie wysyła mojego pliku?
Tak, narzędzia na tej stronie tak właśnie działają. Cała konwersja kończy się w przeglądarce, więc nie ma kroku wysyłania. Żeby sprawdzić, otwórz kartę sieci w narzędziach programisty i uruchom konwersję.

Zaktualizowano 17 września 2026