O que sobrevive quando um PDF vira arquivo do Word
Você converte um PDF para Word e a tabela sai torta. Acha que o conversor é ruim, testa outro e o resultado é praticamente o mesmo. Tem problema que não some trocando de ferramenta.
Entender o porquê mostra qual ferramenta escolher e quanto dá para esperar dela.
Um PDF é uma impressão, não um documento
Por dentro, um PDF é uma lista comprida de instruções do tipo "imprima este caractere na posição 72, 680". Em nenhum lugar do arquivo fica registrado onde terminava um parágrafo, nem que duas linhas faziam parte da mesma linha de uma tabela.
Essa informação é jogada fora no momento em que o documento é exportado para PDF, do mesmo jeito que uma folha impressa não precisa dela. Por isso trazê-la de volta é uma reconstrução, não uma conversão: a forma original é deduzida a partir de onde os caracteres estão.
Essa frase explica todo o resto. A tabela sai torta não porque o conversor leu errado, mas porque não havia tabela para ler: ela teve que ser deduzida só pela posição.
O que se deduz e o que nunca esteve lá
Separar essas duas coisas mostra o que pode melhorar e o que não pode.
- Dedutível. A divisão em parágrafos, pelo espaçamento entre as linhas e por onde as linhas terminam. As tabelas, porque as células ficam alinhadas em coluna. Os títulos, pela letra maior que a do corpo do texto. Algoritmos melhores deixam isso mais preciso.
- Extraível diretamente. Os próprios caracteres e quaisquer imagens ou carimbos impressos na página. São objetos reais no arquivo e não precisam ser adivinhados.
- Nunca registrado. Qual estilo do Word o original usava, onde a tabela tinha células mescladas, quantos pontos de espaço havia entre os parágrafos. Nenhuma ferramenta consegue produzir isso.
Desconfie de conversores que prometem manter a formatação exata
Algumas ferramentas anunciam um resultado idêntico ao original, pixel por pixel. Você abre e, de fato, está idêntico. Aí edita uma linha e o documento desmonta.
Para conseguir isso, o texto é jogado em centenas de caixas flutuantes presas a coordenadas fixas, em vez de ficar em parágrafos. Um documento montado assim parece o original, mas não dá para trabalhar nele. Apague um caractere e só aquela caixa se ajusta, enquanto tudo em volta fica parado.
| Do que você precisa | O que escolher |
|---|---|
| Ler e editar o conteúdo | Um conversor que reconstrua os parágrafos |
| Só ler | Não converta; use um leitor de PDF |
| Ficar igual ao impresso | Não converta; fique com o PDF |
| Fazer contas com os números | Converta para planilha |
A conversão existe para você poder editar. Um resultado que não dá para editar perdeu o sentido. Se a meta é ficar idêntico, não havia motivo para converter.
O verdadeiro motivo de a tabela sair desconfigurada
Muitas vezes as tabelas em PDF não têm borda nenhuma. Quando têm, essas bordas são desenhadas numa camada separada do texto, invisível para qualquer coisa que extraia as palavras. É por isso que os métodos que dependem de achar as bordas falham tanto.
Então o que se lê é a posição: células cuja margem esquerda coincide ao longo de várias linhas são tratadas como tabela. O ponto fraco do método são as células vazias. Uma célula vazia não deixa rastro no arquivo, então aquela linha parece ter uma célula a menos e tudo o que vem depois é empurrado uma coluna para o lado.
Com células mescladas acontece a mesma coisa. Seu olho vê duas células juntas; o arquivo só tem um pedaço de texto posicionado um pouco mais à esquerda que os vizinhos.
Nenhuma ferramenta converte um PDF escaneado
Um PDF gerado pelo scanner do escritório é uma única foto por página. Seus olhos veem letras, mas o arquivo não contém nenhuma. Não é limitação da ferramenta, é algo que já falta na origem.
O reconhecimento óptico de caracteres consegue fabricar texto a partir da imagem. Mas isso é reconhecer, não extrair, e vem com erros como ler um zero como a letra O. Num contrato ou num formulário que precisa ser entregue, esse erro sai caro. Pedir o arquivo original a quem o emitiu costuma ser mais rápido.
O que perguntar a um conversor
A pergunta certa sobre um conversor não é o quanto o resultado fica parecido, e sim se dá para editar o que sai. E quando o resultado não é perfeito, saber separar um limite da ferramenta de um limite do formato evita trocar de ferramenta à toa.
Perguntas frequentes
- Por que conversores diferentes dão resultados diferentes?
- Porque as regras de dedução são diferentes. Qual deve ser o tamanho de um espaço para contar como fim de parágrafo, quantas linhas alinhadas contam como tabela: cada ferramenta define esses limites num ponto um pouco diferente. Por isso uma ferramenta se sai melhor que outra em certos documentos.
- Minhas tabelas sempre saem desconfiguradas. Dá para fazer alguma coisa?
- Quanto mais células vazias a tabela tiver, pior fica, porque uma célula vazia não deixa rastro no PDF. Se você só precisa da tabela, converter para planilha é melhor do que para Word. Esse caminho joga as células nas colunas de propósito, e o desalinhamento é mais fácil de corrigir à mão.
- As imagens e os carimbos vão junto?
- Sim. São objetos reais impressos na página, então não precisam ser adivinhados e saem do jeito que estão. Onde eles vão parar é decidido pela ordem de leitura, não pelas coordenadas originais, porque prendê-los a coordenadas daria um documento que você não consegue editar.
- As fontes mudaram.
- Um PDF até incorpora os arquivos de fonte, mas nada garante que eles tragam o nome que o documento original especificava, muito menos que essa mesma fonte esteja instalada no computador que abre o resultado. Por isso as fontes ficam de fora e é usada a fonte padrão.
- Existe algum conversor que não envie meu arquivo?
- Sim, as ferramentas deste site funcionam assim. A conversão acontece inteira dentro do navegador, então não existe etapa de envio. Para conferir, abra a aba Rede nas ferramentas do desenvolvedor e faça uma conversão.
Atualizado em 17 de setembro de 2026