PDF zu Word

Ziehen Sie ein PDF hinein, und der Text darin wird als Absätze und Tabellen in einer Word-Datei nachgebaut. Nichts wird als Bild einer Seite eingeklebt, was Sie herunterladen ist ein Dokument, in dem Sie sofort arbeiten können.

Ohne Upload

PDF zum Umwandeln

Das PDF muss echten Text enthalten. Ein gescanntes PDF ist ein Bild der Seite, daraus lässt sich nichts herausholen. Dateien werden nur in diesem Browser geöffnet und nie hochgeladen.

Lesereihenfolge, Absätze und Tabellen werden übernommen, die genaue Position auf der Seite nicht. Ein PDF hält nie fest, was ein Absatz oder eine Tabelle war. Beides wird aus der Lage der Zeichen rekonstruiert.

Bilder, Stempel und Unterschriften auf der Seite werden ebenfalls herausgelöst und ins Dokument gesetzt, und zwar in Lesereihenfolge, nicht an ihren ursprünglichen Koordinaten.

Ein gescanntes PDF enthält Fotos statt Text, es gibt also nichts umzuwandeln. Legen Sie es ab, das Werkzeug sagt es Ihnen sofort.

Ganze Seiten werden nicht als Bilder eingefügt. Die heruntergeladene Datei öffnet sich als bearbeitbares Dokument in Word oder Excel.

So wird aus einem PDF eine Word-Datei

  1. 1

    Ein PDF hineinziehen

    Die Datei muss echten Text enthalten. Mehrere auf einmal sind kein Problem.

  2. 2

    Auf Umwandeln drücken

    Jede Seite wird daraufhin gelesen, wo ihre Zeichen sitzen, und diese werden zu Absätzen und Tabellen gruppiert. Der Fortschritt wird nach Seitenzahl angezeigt.

  3. 3

    Die DOCX herunterladen

    Sie öffnet in Word bereit zur Bearbeitung. Ihr ursprüngliches PDF bleibt unangetastet.

Was dieses Werkzeug tut

Was es heißt, ein PDF zurückzuholen

Ein PDF ist kein Format zum Aufbewahren von Text, sondern zum Zeichnen einer Seite. In der Datei steht eine lange Liste von Anweisungen der Art drucke dieses Zeichen hier, und nirgends ist festgehalten, wo ein Absatz endete oder welcher Block von Zahlen einmal eine Tabelle war. Diese Angaben werden in dem Moment weggeworfen, in dem ein Dokument als PDF exportiert wird.

Es handelt sich also um eine Rekonstruktion und nicht um eine Umwandlung. Wo die Zeichen sitzen, wie weit die Zeilen auseinanderliegen und wie groß die Schrift ist, wird rückwärts gelesen, um die ursprüngliche Form zu erschließen. Ein größerer Abstand als sonst, oder eine Zeile, die weit vor dem rechten Rand endete, bedeutet, dass dort ein Absatz zu Ende war. Zellen, deren linke Kante über mehrere Zeilen an derselben Stelle steht, bedeuten eine Tabelle.

Da es eine Vermutung ist, kann sie danebenliegen. Was sie nicht tut, ist einen Wert zu erfinden, den sie nicht gefunden hat. Seiten ohne Text werden als leer gemeldet, und das fertige Dokument wird zurückgelesen und geprüft, bevor Sie es bekommen.

Was herüberkommt und was nicht

Lesereihenfolge, Absätze, Überschriften und Tabellen kommen herüber, Seitenumbrüche ebenfalls. Bilder, Stempel und Unterschriften werden ebenfalls aus der Seite geholt und eingefügt, sie landen allerdings in der Lesereihenfolge und nicht an ihren ursprünglichen Koordinaten. Nicht herüber kommen die genaue Platzierung auf der Seite, die Schriften und die Schriftfarbe.

Das Layout wird absichtlich nicht nachgeahmt. Positionen nachzubilden hieße, Textfelder an feste Koordinaten zu streuen, und ein so gebautes Dokument öffnet zwar, zerfällt aber, sobald Sie eine Zeile bearbeiten. Ziel dieses Werkzeugs ist ein Dokument, in dem sich arbeiten lässt.

PunktKommt es herüber?
Lesereihenfolge und WortlautJa
AbsatztrennungAus der Position rekonstruiert
ÜberschriftenSchrift größer als der Fließtext gilt als Überschrift
TabellenAus ausgerichteten Werten nachgebaut
SeitenumbrücheJa
Schriften, Farbe, genaues LayoutNein
Bilder, Stempel, UnterschriftenJa, in der Lesereihenfolge platziert

Eingescannte PDF lassen sich nicht zurückholen

Ein PDF, das durch Abfotografieren von Papier oder durch einen Bürokopierer entstanden ist, besteht aus einem einzigen Bild pro Seite. Ihre Augen sehen Buchstaben, die Datei enthält keinen einzigen. Es gibt nichts herauszuziehen, also auch nichts zu rekonstruieren.

Das Werkzeug sagt das klar, statt Ihnen eine leere Datei in die Hand zu drücken. Sind nur einzelne Seiten Scans, nennt es die Seitenzahlen, die leer zurückkamen. Text aus Bildern zu lesen gehört nicht zum Leistungsumfang.

Die Datei verlässt Ihr Gerät nie

Die gesamte Umwandlung läuft in diesem Browser ab. Das PDF zu lesen und das neue Dokument zu schreiben erledigt Code, der auf Ihrem Gerät läuft. Einen Upload-Schritt gibt es überhaupt nicht.

Sie können das nachprüfen. Öffnen Sie in den Entwicklerwerkzeugen (F12) den Netzwerk-Tab und starten Sie eine Umwandlung: entweder erscheint eine Anfrage in der Größe Ihrer Datei oder eben nicht.

Häufige Fragen

Wird meine Datei hochgeladen?+

Nein. Das PDF zu lesen und die Word-Datei zu schreiben geschieht beides in diesem Browser. Es gibt kein Konto und nichts zu installieren.

Sieht die Word-Datei genauso aus wie das PDF?+

Nein. Wortlaut, Lesereihenfolge, Absätze und Tabellen kommen herüber, die Platzierung auf der Seite wird aber nicht nachgebildet. Sie nachzuahmen hieße, Textfelder an Koordinaten zu nageln, und ein solches Dokument lässt sich nicht bearbeiten.

Meine Tabelle ist falsch herausgekommen.+

Tabellen in PDF haben oft gar keine Linien, und wo es welche gibt, sind sie auf einer anderen Ebene gezeichnet, die die Textextraktion nie sieht. Tabellen werden deshalb daran erkannt, ob die Zellen nach unten hin ausgerichtet bleiben. Sehr enge Spaltenabstände und verbundene Zellen können das durcheinanderbringen.

Funktioniert das bei einem eingescannten PDF?+

Nein. Ein Scan ist ein Bild der Seite und enthält keinen einzigen Buchstaben. Ziehen Sie einen hinein, und das Werkzeug sagt es Ihnen sofort.

Und ein passwortgeschütztes PDF?+

Das geht, wenn Sie das Passwort kennen. Trifft das Werkzeug auf eine verschlüsselte Datei, erscheint ein Passwortfeld. Eintragen und die Umwandlung erneut starten.

Gibt es eine Seitengrenze?+

Es ist keine gesetzt. Alles läuft allerdings auf Ihrem Gerät, ein sehr langes Dokument dauert also entsprechend länger. Ein Computer schafft es schneller als ein Telefon.