Ein PDF ist kein Format zum Aufbewahren von Text, sondern zum Zeichnen einer Seite. In der Datei steht eine lange Liste von Anweisungen der Art drucke dieses Zeichen hier, und nirgends ist festgehalten, wo ein Absatz endete oder welcher Block von Zahlen einmal eine Tabelle war. Diese Angaben werden in dem Moment weggeworfen, in dem ein Dokument als PDF exportiert wird.
Es handelt sich also um eine Rekonstruktion und nicht um eine Umwandlung. Wo die Zeichen sitzen, wie weit die Zeilen auseinanderliegen und wie groß die Schrift ist, wird rückwärts gelesen, um die ursprüngliche Form zu erschließen. Ein größerer Abstand als sonst, oder eine Zeile, die weit vor dem rechten Rand endete, bedeutet, dass dort ein Absatz zu Ende war. Zellen, deren linke Kante über mehrere Zeilen an derselben Stelle steht, bedeuten eine Tabelle.
Da es eine Vermutung ist, kann sie danebenliegen. Was sie nicht tut, ist einen Wert zu erfinden, den sie nicht gefunden hat. Seiten ohne Text werden als leer gemeldet, und das fertige Dokument wird zurückgelesen und geprüft, bevor Sie es bekommen.