PDF zu Excel

Ziehen Sie ein PDF hinein, und die Werte, die wie eine Tabelle in Spalten stehen, werden in Zellen aufgeteilt. Jede Seite wird zu einem eigenen Blatt, damit nie unklar bleibt, woher eine Zahl stammt.

Ohne Upload

PDF zum Umwandeln

Das PDF muss echten Text enthalten. Ein gescanntes PDF ist ein Bild der Seite, daraus lässt sich nichts herausholen. Dateien werden nur in diesem Browser geöffnet und nie hochgeladen.

Lesereihenfolge, Absätze und Tabellen werden übernommen, die genaue Position auf der Seite nicht. Ein PDF hält nie fest, was ein Absatz oder eine Tabelle war. Beides wird aus der Lage der Zeichen rekonstruiert.

Bilder, Stempel und Unterschriften auf der Seite werden ebenfalls übernommen. Über den Zellen schwebend würden sie beim Rechnen stören, deshalb stehen sie auf jedem Blatt unter den Daten.

Ein gescanntes PDF enthält Fotos statt Text, es gibt also nichts umzuwandeln. Legen Sie es ab, das Werkzeug sagt es Ihnen sofort.

Ganze Seiten werden nicht als Bilder eingefügt. Die heruntergeladene Datei öffnet sich als bearbeitbares Dokument in Word oder Excel.

So wird aus einem PDF eine Tabelle

  1. 1

    Ein PDF hineinziehen

    Je tabellarischer das Dokument, desto besser das Ergebnis. Mehrere auf einmal sind kein Problem.

  2. 2

    Auf Umwandeln drücken

    Wo die Zeichen sitzen, entscheidet darüber, wo jede Tabelle beginnt und endet.

  3. 3

    Die XLSX herunterladen

    Sie öffnet in Excel oder Google Tabellen bereit zum Rechnen.

Was dieses Werkzeug tut

Es liest Positionen, keine Linien

Tabellen in PDF haben sehr häufig überhaupt keine Linien um sich herum. Wo es welche gibt, sind sie auf einer anderen Ebene als der Text gezeichnet, unsichtbar für alles, was die Wörter herauszieht. Deshalb scheitern Ansätze, die auf dem Finden der Linien beruhen, so oft.

Gelesen wird also die Position. Innerhalb einer Zeile bedeutet ein Abstand, der deutlich breiter ist als ein Wortzwischenraum, eine Zellgrenze, und wenn diese Abstände über mehrere aufeinanderfolgende Zeilen an derselben waagerechten Stelle stehen, ist dieser Block eine Tabelle. Drei Zeilen sind das Minimum. Zweizeilige Blöcke sind meist eine Überschrift mit einem nach rechts gerückten Datum, und daraus eine Tabelle zu machen erschwert das Lesen, statt es zu erleichtern.

Eine leere Zelle hinterlässt keine Spur in der Datei, weil dort nie Zeichen standen. Die Zellen der Reihe nach aneinanderzuhängen würde alles um eins verschieben, deshalb fällt jede Zelle in die nächstgelegene Spalte und der Rest bleibt leer.

Ein Blatt je Seite

Sind Tabellen über mehrere Seiten verteilt, geht beim Zusammenwerfen auf ein einziges Blatt verloren, von welcher Seite eine Zahl stammte. Jede Seite wird deshalb zu einem eigenen, nach der Seitenzahl benannten Blatt.

Zeilen, die nicht zu einer Tabelle gehören, bleiben ebenfalls erhalten, eine je Zeile. Wirft man die Überschrift über der Tabelle weg oder den Hinweis, in welcher Einheit die Zahlen stehen, bleiben Zahlen ohne jede Lesehilfe. Bilder und Stempel, die auf der Seite gedruckt sind, kommen ebenfalls mit und werden je Blatt unter den Daten gesammelt, damit sie nicht über den Zellen schweben und das Rechnen stören.

Eingescannte PDF lassen sich nicht zurückholen

Ein PDF, das durch Abfotografieren von Papier oder durch einen Bürokopierer entstanden ist, besteht aus einem einzigen Bild pro Seite. Ihre Augen sehen Buchstaben, die Datei enthält keinen einzigen. Es gibt nichts herauszuziehen, also auch nichts zu rekonstruieren.

Das Werkzeug sagt das klar, statt Ihnen eine leere Datei in die Hand zu drücken. Sind nur einzelne Seiten Scans, nennt es die Seitenzahlen, die leer zurückkamen. Text aus Bildern zu lesen gehört nicht zum Leistungsumfang.

Die Datei verlässt Ihr Gerät nie

Die gesamte Umwandlung läuft in diesem Browser ab. Das PDF zu lesen und das neue Dokument zu schreiben erledigt Code, der auf Ihrem Gerät läuft. Einen Upload-Schritt gibt es überhaupt nicht.

Sie können das nachprüfen. Öffnen Sie in den Entwicklerwerkzeugen (F12) den Netzwerk-Tab und starten Sie eine Umwandlung: entweder erscheint eine Anfrage in der Größe Ihrer Datei oder eben nicht.

Häufige Fragen

Wird meine Datei hochgeladen?+

Nein. Das PDF zu lesen und die Tabelle zu schreiben geschieht beides in diesem Browser.

Kommt auch Text mit, der keine Tabelle ist?+

Ja, eine Zeile je Zeile in der ersten Spalte. Die Überschrift über der Tabelle oder die Einheit der Zahlen wegzuwerfen hinterließe Zahlen, die niemand deuten kann.

Meine Zellen sind um eine Spalte verrutscht.+

Das kommt daher, dass eine leere Zelle im PDF keine Spur hinterlässt. Jede Zelle in die nächstgelegene Spalte fallen zu lassen verringert das stark, Tabellen mit sehr engen Spaltenabständen können aber weiterhin verrutschen.

Und verbundene Zellen?+

Verbundene Zellen kommen nicht mit. Der Wert eines verbundenen Blocks landet in der nächstgelegenen einzelnen Spalte.

Meine Zahlen sind als Text angekommen.+

Ein PDF hält nicht fest, ob ein Wert eine Zahl oder eine Beschriftung ist, er wird also genau so gespeichert, wie er erscheint. Tausendertrennzeichen und Währungssymbole lassen Excel ihn als Text lesen. Das Zellformat in Excel zu ändern behebt es.

Funktioniert das bei einem eingescannten PDF?+

Nein. Ein Scan ist ein Bild der Seite und hat keinen Text zum Herausziehen.