L'OCR (Optical Character Recognition) converte le immagini di testo presenti in un PDF scansionato in testo selezionabile e ricercabile. Dopo l'OCR, puoi selezionare, copiare e cercare il testo nel documento come se fosse un PDF nativo con testo.
OnlinePdfEditor usa Tesseract.js, uno dei motori OCR open source più avanzati, per riconoscere il testo in italiano, inglese e numerose altre lingue. Il motore opera su modelli LSTM neurali addestrati su milioni di documenti: riconosce font tipografici, corsivo, testo in grassetto e persino manoscritto leggibile. Il testo riconosciuto viene scritto come layer invisibile sovrapposto all'immagine originale della pagina — così l'aspetto del documento non cambia, ma il testo diventa selezionabile e cercabile.
L'OCR è diverso dalla semplice estrazione di testo (strumento 'Da PDF a testo'): quello strumento funziona solo su PDF già digitali che hanno un layer di testo nativo; l'OCR invece funziona su scansioni, fotografie di documenti, e qualsiasi PDF dove il testo è un'immagine. Dopo l'OCR puoi usare il PDF risultante come input per la conversione in Word o Excel, ottenendo documenti editabili anche da materiale cartaceo scansionato.