Tabelas em PDF muitas e muitas vezes não têm borda nenhuma. Quando têm, essas bordas ficam desenhadas em uma camada diferente da do texto, invisíveis para qualquer coisa que extraia as palavras. É por isso que as abordagens baseadas em encontrar as bordas falham tantas vezes.
Então o que se lê é a posição. Dentro de uma linha, um espaço muito maior do que o espaço entre palavras marca o limite de uma célula, e quando esses espaços coincidem na mesma posição horizontal ao longo de várias linhas seguidas, esse bloco é uma tabela. Três linhas é o mínimo. Blocos de duas linhas geralmente são um título com uma data empurrada para a direita, e transformar isso em tabela deixa tudo mais difícil de ler, não mais fácil.
Uma célula vazia não deixa rastro no arquivo, porque ali nunca houve caracteres. Encaixar as células em sequência deslocaria tudo uma casa, por isso cada célula cai na coluna mais próxima e as outras ficam em branco.