Pasar una tabla de un PDF a Excel
Hay una tabla en un PDF de informe y necesitas calcular con esas cifras. La seleccionas, copias, pegas en Excel, y todos los valores caen en una sola celda de la columna A. Al final la tecleas a mano.
Suelta un PDF y los valores que forman columnas como una tabla se reparten en celdas. Cada página se convierte en su propia hoja, así que nunca pierdes de vista de dónde salió una cifra.
Sin subida
PDF que quieres convertir
El PDF tiene que contener texto de verdad. Un PDF escaneado es una foto de la página, así que no hay nada que extraer. Los archivos se abren dentro de este navegador y nunca se suben.
Se conservan el orden de lectura, los párrafos y las tablas. La posición exacta en la página, no. Un PDF nunca registra qué era un párrafo o una tabla, así que ambos se reconstruyen a partir de dónde están los caracteres.
Las imágenes, sellos y firmas impresos en la página también se incluyen. Flotando sobre las celdas estorbarían los cálculos, así que se reúnen debajo de los datos en cada hoja.
Un PDF escaneado contiene fotografías, no texto, así que no hay nada que convertir. Suéltalo aquí y la herramienta te lo dirá.
No se pegan páginas enteras como imágenes. Lo que descargas se abre como un documento editable en Word o Excel.
Cuanto más tabular sea el documento, mejor el resultado. Varios a la vez no es problema.
Dónde se sitúan los caracteres decide dónde empieza y acaba cada tabla.
Se abre en Excel o en Hojas de cálculo de Google listo para calcular.
Las tablas de los PDF muchísimas veces no llevan ninguna línea alrededor. Donde sí las hay, están dibujadas en una capa distinta del texto, invisibles para cualquier cosa que extraiga las palabras. Por eso fallan tan a menudo los planteamientos basados en encontrar las líneas.
Así que lo que se lee es la posición. Dentro de una línea, un hueco mucho más ancho que un espacio entre palabras marca el borde de una celda, y cuando esos huecos coinciden en la misma posición horizontal a lo largo de varias líneas seguidas, ese bloque es una tabla. Tres líneas es el mínimo. Los bloques de dos líneas suelen ser un título con una fecha empujada al extremo derecho, y convertir eso en tabla lo vuelve más difícil de leer, no más fácil.
Una celda vacía no deja rastro en el archivo, porque allí nunca hubo caracteres. Encadenar las celdas por orden lo correría todo un lugar, así que cada celda cae en la columna más cercana y el resto se deja en blanco.
Cuando las tablas están repartidas por varias páginas, amontonarlas en una sola hoja hace perder de vista de qué página salía cada cifra. Por eso cada página se convierte en su propia hoja, con el número de página por nombre.
Las líneas que no forman parte de una tabla también se conservan, una por fila. Tirar el título que había encima de la tabla, o la nota que dice en qué unidad están las cifras, te deja números sin forma de leerlos. Las imágenes y los sellos impresos en la página también pasan, reunidos debajo de los datos de cada hoja para que no floten sobre las celdas y estorben al calcular.
Un PDF hecho fotografiando papel o pasándolo por un escáner de oficina es una sola imagen por página. Tus ojos ven letras, pero el archivo no contiene ninguna. No hay nada que extraer, así que no hay nada que reconstruir.
La herramienta lo dice claramente en lugar de entregarte un archivo vacío. Si solo algunas páginas son escaneos, indica qué números de página salieron vacíos. Leer texto dentro de imágenes no es algo que haga esta herramienta.
Toda la conversión ocurre dentro de este navegador. Leer el PDF y escribir el documento nuevo los hace código que corre en tu dispositivo. No existe ningún paso de subida.
Puedes comprobarlo. Abre la pestaña de red en las herramientas de desarrollo (F12) y lanza una conversión: o aparece una petición de subida del tamaño de tu archivo, o no aparece.
No. Leer el PDF y escribir la hoja de cálculo ocurren dentro de este navegador.
Sí, una línea por fila en la primera columna. Tirar el título de encima de la tabla, o la unidad en la que están las cifras, dejaría números que nadie puede interpretar.
Ocurre porque una celda vacía no deja rastro en el PDF. Hacer caer cada celda en la columna más cercana lo reduce mucho, pero las tablas con columnas muy juntas todavía pueden salir desalineadas.
Las celdas combinadas no pasan al otro lado. El valor de un bloque combinado cae en la columna suelta que quede más cerca.
Un PDF no registra si un valor es un número o una etiqueta, así que se guarda tal como aparece. Los separadores de miles y los símbolos de moneda hacen que Excel lo lea como texto. Cambiando el formato de la celda en Excel se arregla.
No. Un escaneo es una imagen de la página y no tiene texto que extraer.
Hay una tabla en un PDF de informe y necesitas calcular con esas cifras. La seleccionas, copias, pegas en Excel, y todos los valores caen en una sola celda de la columna A. Al final la tecleas a mano.
Conviertes un PDF a Word y la tabla sale torcida. Supones que el conversor es malo, pruebas otro y obtienes casi lo mismo. Hay problemas que no se arreglan cambiando de herramienta.