Qué sobrevive cuando un PDF se convierte en un archivo de Word
Conviertes un PDF a Word y la tabla sale torcida. Supones que el conversor es malo, pruebas otro y obtienes casi lo mismo. Hay problemas que no se arreglan cambiando de herramienta.
Suelta un PDF y el texto de dentro se reconstruye como párrafos y tablas en un archivo de Word. Nada se pega como una imagen de la página, de modo que lo que descargas es un documento en el que puedes trabajar desde el primer momento.
Sin subida
PDF que quieres convertir
El PDF tiene que contener texto de verdad. Un PDF escaneado es una foto de la página, así que no hay nada que extraer. Los archivos se abren dentro de este navegador y nunca se suben.
Se conservan el orden de lectura, los párrafos y las tablas. La posición exacta en la página, no. Un PDF nunca registra qué era un párrafo o una tabla, así que ambos se reconstruyen a partir de dónde están los caracteres.
Las imágenes, sellos y firmas impresos en la página también se extraen y se colocan en el documento. Siguen el orden de lectura, no sus coordenadas originales.
Un PDF escaneado contiene fotografías, no texto, así que no hay nada que convertir. Suéltalo aquí y la herramienta te lo dirá.
No se pegan páginas enteras como imágenes. Lo que descargas se abre como un documento editable en Word o Excel.
El archivo tiene que llevar texto de verdad. Varios a la vez no es problema.
Cada página se lee para ver dónde se sitúan sus caracteres, y esos se agrupan en párrafos y tablas. El avance se muestra por número de página.
Se abre en Word listo para editar. Tu PDF original queda intacto.
Un PDF no es un formato para guardar texto, sino para dibujar una página. Lo que hay dentro del archivo es una lista larga de instrucciones que dicen imprime este carácter aquí, y en ningún sitio queda registrado dónde terminaba un párrafo ni qué bloque de números era una tabla. Esa información se tira en el momento en que un documento se exporta a PDF.
Por eso esto es una reconstrucción y no una conversión. Dónde se sitúan los caracteres, cuánto se separan las líneas y qué tamaño tiene la letra se leen al revés para deducir la forma original. Un hueco más ancho de lo habitual, o una línea que se detuvo muy lejos del margen derecho, significa que ahí terminaba un párrafo. Celdas cuyo borde izquierdo coincide a lo largo de varias líneas significan una tabla.
Al ser una deducción, puede fallar. Lo que no hará es inventarse un valor que no encontró. Las páginas sin texto se declaran vacías, y el documento terminado se vuelve a leer y se comprueba antes de llegar a ti.
El orden de lectura, los párrafos, los títulos y las tablas pasan, y los saltos de página también. Las imágenes, los sellos y las firmas también se extraen de la página y se colocan, aunque caen en el orden de lectura y no en sus coordenadas originales. Lo que no pasa es la colocación exacta en la página, las tipografías y el color del texto.
La maquetación no se imita a propósito. Reproducir las posiciones significaría sembrar cuadros de texto en coordenadas fijas, y un documento construido así se abre bien pero se desmonta en cuanto editas una línea. El objetivo de esta herramienta es un documento con el que puedas trabajar.
| Elemento | ¿Pasa al otro lado? |
|---|---|
| Orden de lectura y redacción | Sí |
| Separación de párrafos | Se reconstruye por la posición |
| Títulos | La letra mayor que el cuerpo se toma por título |
| Tablas | Se reconstruyen a partir de valores alineados |
| Saltos de página | Sí |
| Tipografías, color, maquetación exacta | No |
| Imágenes, sellos, firmas | Sí, colocados en el orden de lectura |
Un PDF hecho fotografiando papel o pasándolo por un escáner de oficina es una sola imagen por página. Tus ojos ven letras, pero el archivo no contiene ninguna. No hay nada que extraer, así que no hay nada que reconstruir.
La herramienta lo dice claramente en lugar de entregarte un archivo vacío. Si solo algunas páginas son escaneos, indica qué números de página salieron vacíos. Leer texto dentro de imágenes no es algo que haga esta herramienta.
Toda la conversión ocurre dentro de este navegador. Leer el PDF y escribir el documento nuevo los hace código que corre en tu dispositivo. No existe ningún paso de subida.
Puedes comprobarlo. Abre la pestaña de red en las herramientas de desarrollo (F12) y lanza una conversión: o aparece una petición de subida del tamaño de tu archivo, o no aparece.
No. Leer el PDF y escribir el archivo de Word ocurren dentro de este navegador. No hay cuenta ni nada que instalar.
No. La redacción, el orden de lectura, los párrafos y las tablas pasan, pero la colocación en la página no se reproduce. Imitarla significaría clavar cuadros de texto en coordenadas, y un documento así no se puede editar.
Las tablas de los PDF a menudo no llevan líneas, y donde las llevan están dibujadas en otra capa que la extracción de texto nunca ve. Por eso las tablas se buscan comprobando si las celdas quedan alineadas hacia abajo. Las columnas muy juntas y las celdas combinadas pueden desbaratarlo.
No. Un escaneo es una imagen de la página y no contiene ni una letra. Suelta uno y la herramienta te lo dirá enseguida.
Funciona si conoces la contraseña. Cuando la herramienta encuentra un archivo cifrado aparece una casilla de contraseña. Escríbela y vuelve a lanzar la conversión.
No se impone ninguno. Ahora bien, todo corre en tu dispositivo, así que un documento muy largo tarda proporcionalmente más. Un ordenador lo resuelve más rápido que un móvil.
Conviertes un PDF a Word y la tabla sale torcida. Supones que el conversor es malo, pruebas otro y obtienes casi lo mismo. Hay problemas que no se arreglan cambiando de herramienta.
Dos situaciones: tienes un .docx y no tienes Word, o Word rechaza el archivo con "Word found unreadable content" (Word encontró contenido que no se puede leer). Aquí tienes los programas gratuitos que lo abren, lo que te pide cada uno y cómo sacar el texto de un archivo que ninguno consigue abrir.
Solo hay que cambiar una fecha en el contrato. Lo conviertes a Word y se desplazan las tablas y los márgenes; lo exportas de nuevo a PDF y encima cambian las tipografías. Por una línea, el documento entero es otro.