Estrai testo da PDF
Scegli un PDF e il suo testo incorporato viene estratto in un unico blocco di testo semplice che puoi copiare o scaricare. Nulla di ciò che carichi lascia mai il tuo browser.
Come funziona l'estrazione senza un server
Questo strumento usa pdfjs-dist, il motore PDF.js
open source creato da Mozilla (è ciò che disegna i PDF dentro
Firefox), funzionante interamente nella tua scheda del browser.
Invece di disegnare pixel su un canvas come farebbe un lettore
di PDF, chiede direttamente a ogni pagina il suo contenuto
testuale: PDF.js decodifica gli oggetti nel flusso di contenuto
della pagina che rappresentano testo realmente incorporato —
font, posizione e la stringa stessa — e getTextContent() li restituisce come un elenco
piatto di elementi, ognuno con la propria stringa estratta.
Questo strumento unisce gli elementi di ogni pagina con uno
spazio, separa le pagine con una riga vuota, e colloca il
risultato completo nel campo di testo qui sopra. Poiché legge
oggetti di testo reali invece di un'immagine della pagina, una
pagina scansionata non ha nulla da leggere — lì non c'è alcun
oggetto di testo, solo pixel.
Esempio pratico
Supponi di avere un PDF di 2 pagine. Il flusso di contenuto della pagina 1 ha gli oggetti di testo Q4 Sales Report Prepared by Finance Team (7 parole, 40 caratteri); la pagina 2 dice Total revenue: $128,400 (3 parole, 23 caratteri). Scegliendo questo file si ottiene un unico blocco di testo — quello della pagina 1, una riga vuota, poi quello della pagina 2 — per un totale combinato di 65 caratteri e 10 parole, esattamente ciò che mostrerebbe la riga Pagine / Parole / Caratteri sopra il risultato.
Domande frequenti
Il mio PDF viene caricato da qualche parte?
No. Il file viene letto localmente con la File API del browser, e pdfjs-dist — lo stesso motore PDF.js che Firefox usa per mostrare i PDF — estrae il testo interamente dentro la tua scheda del browser. Nulla viene inviato a un server, così i documenti privati o riservati non lasciano mai il tuo dispositivo.
Perché parte o tutto il testo risulta mancante nel risultato?
Questo strumento estrae oggetti di testo reali e incorporati nel flusso di contenuto del PDF — non esegue OCR. Se una pagina è un'immagine scansionata, la foto di un documento, o comunque non ha un vero livello di testo, non c'è nulla da leggere su quella pagina: dal punto di vista del PDF sono solo pixel, non caratteri. Se hai bisogno di estrarre testo da un documento scansionato, ti serve uno strumento di OCR, che questo deliberatamente non è.
Il testo estratto mantiene il layout originale, come colonne o tabelle?
No — il testo esce nell'ordine in cui pdfjs-dist lo incontra nel flusso di contenuto della pagina, unendo gli elementi di ogni pagina con spazi e separando le pagine con una riga vuota. I layout a più colonne possono mescolarsi, e le tabelle perdono la loro struttura a griglia, trattandosi di un'estrazione di testo semplice, non consapevole del layout.
C'è un limite di dimensione del file o di numero di pagine?
L'unico limite reale è la memoria disponibile del tuo browser, dato che tutto avviene sul tuo dispositivo invece che su un server. I documenti tipici — anche poche centinaia di pagine di testo normale — vengono estratti in ben meno di un secondo; i PDF scansionati molto grandi (centinaia di megabyte) richiederanno più tempo semplicemente per essere letti e decodificati.