O que sobrevive quando um PDF vira arquivo do Word
Você converte um PDF para Word e a tabela sai torta. Acha que o conversor é ruim, testa outro e o resultado é praticamente o mesmo. Tem problema que não some trocando de ferramenta.
Solte um PDF e o texto dele é reconstruído em parágrafos e tabelas em um arquivo do Word. Nada é colado como imagem da página, então o que você baixa é um documento em que pode trabalhar na hora.
Sem envio
PDF para converter
O PDF precisa ter texto de verdade. Um PDF digitalizado é uma foto da página, então não há nada para extrair. Os arquivos abrem dentro deste navegador e nunca são enviados.
Passam a ordem de leitura, os parágrafos e as tabelas. A posição exata na página, não. Um PDF nunca registra o que era parágrafo ou tabela, então os dois são reconstruídos a partir de onde os caracteres estão.
As imagens, carimbos e assinaturas impressos na página também são extraídos e colocados no documento. Eles ficam na ordem de leitura, e não nas coordenadas originais.
Um PDF digitalizado contém fotos e não texto, então não há nada para converter. Solte o arquivo aqui e a ferramenta avisa.
As páginas não são coladas inteiras como imagens. O que você baixa abre como documento editável no Word ou no Excel.
O arquivo precisa ter texto de verdade. Vários de uma vez não tem problema.
Cada página é lida para saber onde ficam os caracteres, e eles são agrupados em parágrafos e tabelas. O progresso aparece por número de página.
Abre no Word pronto para editar. O seu PDF original fica intacto.
Um PDF não é um formato para guardar texto, e sim para desenhar uma página. O que há dentro do arquivo é uma longa lista de instruções dizendo "imprima este caractere aqui", e em nenhum lugar fica registrado onde terminava um parágrafo nem que bloco de números era uma tabela. Essa informação é descartada no momento em que um documento é exportado para PDF.
Por isso, isso é uma reconstrução, e não uma conversão. Onde os caracteres ficam, que distância há entre as linhas e que tamanho tem a letra são lidos de trás para frente para deduzir a forma original. Um espaço maior que o normal, ou uma linha que parou muito antes da margem direita, significa que ali terminava um parágrafo. Células cuja margem esquerda coincide ao longo de várias linhas significam uma tabela.
Por ser uma dedução, pode errar. O que ela não faz é inventar um valor que não encontrou. Páginas sem texto são informadas como vazias, e o documento pronto é lido de novo e verificado antes de chegar às suas mãos.
A ordem de leitura, os parágrafos, os títulos e as tabelas passam, e as quebras de página também. Imagens, carimbos e assinaturas também são tirados da página e colocados no documento, embora fiquem na ordem de leitura e não nas coordenadas originais. O que não passa é a posição exata na página, as fontes e a cor do texto.
O layout não é imitado de propósito. Reproduzir as posições exigiria espalhar caixas de texto em coordenadas fixas, e um documento montado assim abre bem, mas desmonta quando você edita uma linha. O objetivo desta ferramenta é um documento com que você consiga trabalhar.
| Item | Passa? |
|---|---|
| Ordem de leitura e texto | Sim |
| Separação de parágrafos | Reconstruída pela posição |
| Títulos | Letra maior que a do corpo é tratada como título |
| Tabelas | Reconstruídas a partir de valores alinhados |
| Quebras de página | Sim |
| Fontes, cor, layout exato | Não |
| Imagens, carimbos, assinaturas | Sim, colocadas na ordem de leitura |
Um PDF feito fotografando papel ou passando o papel por um scanner de escritório é uma única imagem por página. Seus olhos veem letras, mas o arquivo não contém nenhuma. Não há nada para extrair, então não há nada para reconstruir.
A ferramenta avisa isso com clareza em vez de entregar um arquivo vazio. Se só algumas páginas forem escaneadas, ela indica quais números de página vieram vazios. Ler texto dentro de imagens não é algo que esta ferramenta faça.
Toda a conversão acontece dentro deste navegador. Ler o PDF e gravar o documento novo é feito por código rodando no seu dispositivo. Não existe nenhuma etapa de upload.
Você pode conferir. Abra a aba Rede nas ferramentas de desenvolvedor (F12) e faça uma conversão: ou aparece uma requisição de upload do tamanho do seu arquivo, ou não aparece.
Não. Ler o PDF e gravar o arquivo do Word acontecem dentro deste navegador. Não tem cadastro nem nada para instalar.
Não. O texto, a ordem de leitura, os parágrafos e as tabelas passam, mas a posição na página não é reproduzida. Imitá-la exigiria fixar caixas de texto em coordenadas, e um documento assim não dá para editar.
Tabelas em PDF muitas vezes não têm linhas, e quando têm, essas linhas ficam desenhadas em outra camada que a extração de texto nunca vê. Por isso as tabelas são encontradas verificando se as células ficam alinhadas de cima para baixo. Colunas muito próximas e células mescladas podem atrapalhar isso.
Não. Um PDF escaneado é uma imagem da página e não contém uma única letra. Se você soltar um aqui, a ferramenta avisa na hora.
Funciona se você souber a senha. Quando a ferramenta encontra um arquivo protegido, aparece uma caixa para a senha. Digite a senha e converta de novo.
Nenhum limite é imposto. Mas tudo roda no seu dispositivo, então um documento muito longo demora proporcionalmente mais. Um computador resolve mais rápido que um celular.
Você converte um PDF para Word e a tabela sai torta. Acha que o conversor é ruim, testa outro e o resultado é praticamente o mesmo. Tem problema que não some trocando de ferramenta.
Duas situações: você tem um .docx e não tem Word, ou o Word recusa o arquivo com "Word found unreadable content" (o Word encontrou conteúdo que não pode ser lido). Veja abaixo os programas gratuitos que abrem o arquivo, o que cada um pede de você e como tirar o texto de um arquivo que nenhum deles abre.
Você só precisa mudar uma data no contrato. Converte para Word e as tabelas e margens saem do lugar; exporta de novo para PDF e as fontes também mudam. Por causa de uma linha, o documento inteiro fica diferente.