Portare una tabella da un PDF a Excel
In un PDF di relazione c’è una tabella e ti servono quei numeri per fare i conti. Selezioni, copi, incolli in Excel, e tutti i valori finiscono in una sola cella della colonna A. Alla fine la ribatti a mano.
Trascina un PDF e i valori che stanno in colonna come una tabella vengono divisi in celle. Ogni pagina diventa un foglio a sé, così non perdi mai di vista da dove arriva un numero.
Senza caricare
PDF da convertire
Il PDF deve contenere testo vero. Un PDF scansionato è una foto della pagina, quindi non c’è niente da estrarre. I file si aprono in questo browser e non vengono mai caricati.
Passano l’ordine di lettura, i paragrafi e le tabelle. La posizione esatta sulla pagina no. Un PDF non registra mai cosa fosse un paragrafo o una tabella, quindi entrambi vengono ricostruiti in base a dove si trovano i caratteri.
Anche immagini, timbri e firme stampati sulla pagina vengono portati. Sospesi sopra le celle ostacolerebbero i calcoli, quindi sono raccolti sotto i dati di ogni foglio.
Un PDF scansionato contiene fotografie, non testo, quindi non c’è niente da convertire. Trascinalo qui e lo strumento te lo dirà.
Le pagine non vengono incollate intere come immagini. Il file scaricato si apre come documento modificabile in Word o Excel.
Più il documento è tabellare, migliore è il risultato. Più file insieme non sono un problema.
Dove poggiano i caratteri decide dove inizia e finisce ogni tabella.
Si apre in Excel o in Fogli Google pronto per i calcoli.
Le tabelle nei PDF molto spesso non hanno alcun filetto intorno. Dove ci sono, quei filetti sono disegnati su un livello diverso dal testo, invisibili a qualunque cosa ne estragga le parole. È per questo che gli approcci basati sul trovare i filetti falliscono così spesso.
Quello che si legge è dunque la posizione. Dentro una riga, uno spazio molto più largo di uno spazio tra parole segna il confine di una cella, e quando quegli spazi stanno nella stessa posizione orizzontale per più righe di fila, quel blocco è una tabella. Tre righe sono il minimo. I blocchi di due righe sono di solito un titolo con una data spinta a destra, e trasformarlo in tabella rende la lettura più difficile, non più facile.
Una cella vuota non lascia traccia nel file, perché lì non ci sono mai stati caratteri. Incatenare le celle in ordine sposterebbe tutto di uno, perciò ogni cella cade nella colonna più vicina e il resto resta in bianco.
Quando le tabelle sono sparse su più pagine, ammucchiarle in un unico foglio fa perdere di vista da quale pagina venisse un numero. Perciò ogni pagina diventa un foglio a sé, intitolato al numero di pagina.
Anche le righe che non fanno parte di una tabella vengono conservate, una per riga. Buttare via il titolo che stava sopra la tabella, o la nota che dice in quale unità sono i numeri, ti lascia con dei numeri e nessun modo di leggerli. Anche le immagini e i timbri stampati sulla pagina passano, raccolti sotto i dati di ogni foglio per non restare sospesi sopra le celle e intralciare i calcoli.
Un PDF ottenuto fotografando della carta o passandola in uno scanner da ufficio è una sola immagine per pagina. I tuoi occhi vedono lettere, ma il file non ne contiene nessuna. Non c’è niente da estrarre, quindi niente da ricostruire.
Lo strumento lo dice chiaramente invece di consegnarti un file vuoto. Se solo alcune pagine sono scansioni, indica quali numeri di pagina sono tornati vuoti. Leggere il testo dentro le immagini non è una cosa che questo strumento faccia.
L’intera conversione avviene dentro questo browser. Leggere il PDF e scrivere il nuovo documento li fa codice che gira sul tuo dispositivo. Non esiste proprio un passaggio di caricamento.
Puoi verificarlo. Apri la scheda rete negli strumenti per sviluppatori (F12) e avvia una conversione: o compare una richiesta di caricamento grande quanto il tuo file, o non compare.
No. Leggere il PDF e scrivere il foglio di calcolo avvengono entrambi dentro questo browser.
Sì, una riga per riga nella prima colonna. Buttare via il titolo sopra la tabella, o l’unità in cui sono espressi i numeri, lascerebbe numeri che nessuno può interpretare.
Succede perché una cella vuota non lascia traccia nel PDF. Far cadere ogni cella nella colonna più vicina riduce molto il problema, ma tabelle con colonne molto ravvicinate possono ancora uscire disallineate.
Le celle unite non passano. Il valore di un blocco unito finisce nella singola colonna più vicina.
Un PDF non registra se un valore è un numero o un’etichetta, quindi viene salvato esattamente come appare. I separatori delle migliaia e i simboli di valuta fanno sì che Excel lo legga come testo. Cambiare il formato della cella in Excel risolve.
No. Una scansione è un’immagine della pagina e non ha testo da estrarre.
In un PDF di relazione c’è una tabella e ti servono quei numeri per fare i conti. Selezioni, copi, incolli in Excel, e tutti i valori finiscono in una sola cella della colonna A. Alla fine la ribatti a mano.
Converti un PDF in Word e la tabella esce storta. Dai la colpa al convertitore, ne provi un altro e ottieni più o meno lo stesso. Ci sono problemi che non si risolvono cambiando strumento.