Les tableaux des PDF n’ont très souvent aucun filet autour d’eux. Là où il y en a, ces filets sont tracés sur une couche différente du texte, invisibles pour tout ce qui en extrait les mots. C’est pourquoi les approches fondées sur la détection des filets échouent si souvent.
C’est donc la position qui est lue. Dans une ligne, un écart bien plus large qu’une espace entre deux mots marque une frontière de cellule, et lorsque ces écarts se tiennent à la même position horizontale sur plusieurs lignes consécutives, ce bloc est un tableau. Trois lignes constituent le minimum. Les blocs de deux lignes sont le plus souvent un titre avec une date repoussée à droite, et en faire un tableau complique la lecture au lieu de la simplifier.
Une cellule vide ne laisse aucune trace dans le fichier, puisqu’il n’y a jamais eu de caractère à cet endroit. Enchaîner les cellules dans l’ordre décalerait tout d’un cran : chaque cellule tombe donc dans la colonne la plus proche et le reste est laissé vide.