Przenieść tabelę z PDF-a do Excela
W raporcie w PDF jest tabela i musisz policzyć na tych liczbach. Zaznaczasz, kopiujesz, wklejasz do Excela, a wszystkie wartości lądują w jednej komórce w kolumnie A. Kończy się na przepisywaniu ręcznie.
Upuść PDF-a, a wartości stojące w kolumnach jak tabela zostaną rozbite na komórki. Każda strona staje się osobnym arkuszem, więc nigdy nie tracisz z oczu, skąd wzięła się dana liczba.
Bez wysyłania
PDF do przekształcenia
PDF musi zawierać prawdziwy tekst. Zeskanowany PDF to zdjęcie strony, więc nie ma z czego wyciągnąć tekstu. Pliki otwierają się tylko w tej przeglądarce i nigdy nie są wysyłane.
Przenoszona jest kolejność czytania, akapity i tabele. Dokładne położenie na stronie już nie. PDF nigdy nie zapisuje, co było akapitem, a co tabelą, więc jedno i drugie odtwarza się z położenia znaków.
Obrazy, pieczątki i podpisy wydrukowane na stronie też są przenoszone. Unoszące się nad komórkami przeszkadzałyby w obliczeniach, więc na każdym arkuszu trafiają pod dane.
Zeskanowany PDF zawiera zdjęcia, nie tekst, więc nie ma czego przekształcać. Wrzuć plik, a narzędzie od razu to powie.
Strony nie są wklejane w całości jako obrazy. Pobrany plik otwiera się jako edytowalny dokument w Wordzie lub Excelu.
Im bardziej tabelaryczny dokument, tym lepszy wynik. Kilka naraz nie stanowi problemu.
To, gdzie siedzą znaki, decyduje, gdzie każda tabela się zaczyna i kończy.
Otwiera się w Excelu albo Arkuszach Google gotowy do liczenia.
Tabele w PDF-ach bardzo często nie mają wokół siebie żadnych linii. Tam gdzie są, narysowano je na innej warstwie niż tekst, niewidocznej dla czegokolwiek, co wyciąga słowa. Dlatego podejścia oparte na znajdowaniu linii zawodzą tak często.
Czytane jest więc położenie. W obrębie wiersza odstęp znacznie szerszy niż spacja między wyrazami oznacza granicę komórki, a gdy te odstępy stoją w tym samym miejscu w poziomie przez kilka kolejnych wierszy, ten blok jest tabelą. Trzy wiersze to minimum. Bloki dwuwierszowe to zwykle tytuł z datą zepchniętą na prawo, a zrobienie z tego tabeli utrudnia czytanie, zamiast je ułatwiać.
Pusta komórka nie zostawia w pliku śladu, bo nigdy nie było tam znaków. Sklejanie komórek po kolei przesunęłoby wszystko o jedno pole, dlatego każda komórka spada do najbliższej kolumny, a reszta zostaje pusta.
Gdy tabele są rozrzucone po kilku stronach, zsypanie ich do jednego arkusza gubi informację, z której strony pochodziła dana liczba. Dlatego każda strona staje się własnym arkuszem nazwanym numerem strony.
Wiersze, które nie należą do tabeli, też są zachowywane, po jednym na wiersz. Wyrzucenie nagłówka nad tabelą albo przypisu mówiącego, w jakiej jednostce są liczby, zostawia liczby bez sposobu na ich odczytanie. Obrazy i pieczątki wydrukowane na stronie także przechodzą i są zbierane pod danymi każdego arkusza, żeby nie wisiały nad komórkami i nie przeszkadzały w liczeniu.
PDF zrobiony przez sfotografowanie papieru albo przepuszczenie go przez biurowy skaner to jeden obrazek na stronę. Twoje oczy widzą litery, ale plik nie zawiera ani jednej. Nie ma czego wyciągać, więc nie ma czego odtwarzać.
Narzędzie mówi to wprost, zamiast wręczać ci pusty plik. Jeśli tylko część stron to skany, podaje, które numery stron wróciły puste. Odczytywanie tekstu z obrazków nie należy do tego, co to narzędzie robi.
Cała konwersja dzieje się w tej przeglądarce. Odczyt PDF-a i zapis nowego dokumentu wykonuje kod działający na twoim urządzeniu. Kroku wysyłania po prostu nie ma.
Możesz to sprawdzić. Otwórz kartę sieci w narzędziach programisty (F12) i uruchom konwersję: albo pojawi się żądanie wysłania wielkości twojego pliku, albo nie.
Nie. Odczyt PDF-a i zapis arkusza odbywają się w tej przeglądarce.
Tak, po jednym wierszu w pierwszej kolumnie. Wyrzucenie nagłówka nad tabelą albo jednostki liczb zostawiłoby liczby, których nikt nie zinterpretuje.
Dzieje się tak, bo pusta komórka nie zostawia w PDF-ie śladu. Zrzucanie każdej komórki do najbliższej kolumny mocno to ogranicza, ale tabele o bardzo wąskich odstępach kolumn nadal mogą wyjść przesunięte.
Scalone komórki nie przechodzą. Wartość ze scalonego bloku ląduje w najbliższej pojedynczej kolumnie.
PDF nie zapisuje, czy wartość jest liczbą czy etykietą, więc zostaje zapisana dokładnie tak, jak wygląda. Separatory tysięcy i symbole walut sprawiają, że Excel czyta ją jako tekst. Zmiana formatu komórki w Excelu to naprawia.
Nie. Skan to obrazek strony i nie ma z niego czego wyciągać.
W raporcie w PDF jest tabela i musisz policzyć na tych liczbach. Zaznaczasz, kopiujesz, wklejasz do Excela, a wszystkie wartości lądują w jednej komórce w kolumnie A. Kończy się na przepisywaniu ręcznie.
Konwertujesz PDF-a na Worda, a tabela wychodzi krzywo. Zakładasz, że konwerter jest kiepski, próbujesz innego i dostajesz mniej więcej to samo. Są problemy, które nie znikają po zmianie narzędzia.