Estrarre dati dai PDF aziendali: la parte che blocca i progetti AI sui documenti
Estrarre dati dai PDF aziendali significa trasformare un documento nato per essere stampato in testo che un programma può leggere e riutilizzare. È il primo passaggio di qualunque progetto di intelligenza artificiale sui documenti, ed è quello dove la maggior parte di quei progetti si ferma, molto prima di arrivare al modello. Su GitHub l'organizzazione run-llama, la stessa che sviluppa il servizio a pagamento LlamaParse, pubblica liteparse: uno strumento open source con licenza Apache 2.0 che ha superato le dodicimila stelle, gira interamente sulle macchine di chi lo usa e non richiede nessuna chiave di accesso a un servizio esterno.
liteparse è un programma che converte PDF, documenti Word, fogli Excel, presentazioni e immagini in testo strutturato, cioè in Markdown, JSON o testo semplice, ricostruendo titoli, tabelle, elenchi e collegamenti. Le stelle sono il modo in cui chi sviluppa software segnala su GitHub i progetti che ritiene utili, e dodicimila sono tante. La descrizione ufficiale del progetto è secca: "a standalone OSS PDF parsing tool focused exclusively on fast and light parsing", uno strumento che fa una cosa sola e la fa in fretta. Il motivo per cui dovrebbe interessare a un'azienda che non ha un reparto informatico non è lo strumento in sé, è quello che il suo esistere dice sui preventivi che ricevete.
Perché estrarre dati dai PDF aziendali è la parte difficile
Un PDF non è un testo, è il disegno di una pagina. Dentro il file ci sono istruzioni su dove appoggiare ogni singolo carattere sul foglio, non frasi in ordine, e questo spiega una cosa che avete già visto succedere: quando copiate una tabella da un PDF e la incollate in un foglio di calcolo, i numeri finiscono nelle colonne sbagliate. Il computer non sta leggendo una tabella, sta leggendo una nuvola di caratteri con delle coordinate.
Quando poi il documento è una scansione, il problema cambia di natura. Dentro il file non c'è nessun carattere, c'è una fotografia della pagina, e per ricavarne del testo serve l'OCR, il riconoscimento ottico dei caratteri, cioè un programma che guarda l'immagine e ricostruisce lettere e numeri. liteparse include già il motore Tesseract pronto all'uso e permette di collegarne altri, come EasyOCR o PaddleOCR, senza cambiare il resto. Chi vuole vedere la differenza fra un PDF nato dentro un computer e la scansione di un foglio la trova spiegata con un esempio nel video su come estrarre il testo da un PDF e farlo leggere davvero all'AI.
Qui sta la funzione che vale la pena tradurre in linguaggio aziendale, perché è quella che decide quanto vi costerà il progetto. Fra le caratteristiche dichiarate dal progetto c'è la "Complexity Detection: Cheaply check whether a document needs OCR", cioè un controllo poco costoso che stabilisce in anticipo se un documento ha bisogno del riconoscimento ottico oppure no. Detto in altro modo: le vostre fatture elettroniche in PDF e le scansioni dei documenti di trasporto arrivati via posta non costano la stessa cifra da lavorare, e separarle prima invece che dopo è la differenza fra una bolletta prevedibile e una sorpresa. Il settore in cui questa separazione pesa di più è il trasporto merci, dove le bolle tornano indietro fotografate in cabina e firmate a mano: dove l'intelligenza artificiale recupera ore in un'azienda di trasporti parte proprio da quei fogli.
Cosa cambia adesso che il pezzo costoso è open source
Cambia quello che è ragionevole pagare. Una buona parte di ciò che viene proposto alle piccole aziende come intelligenza artificiale che legge le fatture è, sotto il cofano, lavoro di conversione dei documenti e riconoscimento ottico, e quel lavoro oggi ha un'alternativa gratuita, con licenza Apache 2.0, che gira dentro l'azienda. Non significa che il fornitore stia esagerando: significa che il valore per cui vi fa un preventivo dovrebbe stare da un'altra parte, cioè nell'aggancio al gestionale, nella gestione dei casi anomali e nella revisione umana di quello che il sistema non ha capito.
Va detta anche l'altra metà, perché è scritta nella stessa pagina e chi vende tende a saltarla. La documentazione di liteparse dichiara che la qualità della ricostruzione varia con la complessità del documento e che per i casi più difficili, testualmente "dense tables, multi-column layouts, scans", il servizio a pagamento LlamaParse resta l'opzione più accurata. Quindi non esiste lo strumento gratuito che risolve tutto: esiste una divisione sensata del lavoro, dove i documenti semplici si lavorano in casa a costo zero e solo quelli difficili vengono mandati a un servizio a pagamento.
Questa divisione ha una conseguenza che non è tecnica. Un documento lavorato in casa non esce dall'azienda, un documento mandato a un servizio esterno sì, e sono due situazioni diverse quando si parla di contratti, buste paga, listini riservati o dati dei clienti. Prima di firmare qualunque progetto sui documenti conviene chiarire cosa succede ai documenti aziendali caricati su un'intelligenza artificiale e su quali piani serve un accordo scritto con il fornitore. Sul piano tecnico la stessa domanda ha risposte precise e verificabili, per esempio quanto restano i file e chi può leggerli: le ho raccolte in caricare file sull'API di Claude, limiti e scadenza.
Il blog che state leggendo lo scrive e lo pubblica una routine automatica, e funziona per un motivo banale: gli articoli sono file di testo semplice dentro una cartella, quindi l'input è già pulito. Nessuna di quelle automazioni saprebbe fare lo stesso partendo da venti scansioni storte, ed è esattamente la differenza fra le automazioni che reggono e quelle che si fermano dopo un mese. Su questo blog ho già sostenuto la stessa cosa parlando di come tradurre un PDF mantenendo l'impaginazione: la parte cara non è mai quella che sembra.
Come provarlo su venti documenti veri
La prova si fa su documenti vostri, non su un esempio scelto da chi vende. Servono mezza giornata di una persona che sappia usare il terminale e una regola sola: si parte dai documenti peggiori che avete, non dai migliori.
- Mettete in una cartella venti documenti reali dello stesso tipo, per esempio venti fatture fornitore o venti documenti di trasporto. Scegliete i più brutti: scansioni storte, fogli fotografati con il telefono, timbri sopra il testo, tabelle che continuano sulla pagina dopo.
- Installate lo strumento con
pip install liteparsese lavorate in Python oppure connpm i -g @llamaindex/liteparse, e convertite la cartella in Markdown. Non serve nessun account e non serve collegare una carta di credito. - Contate gli errori su cinque campi soltanto, quelli che poi qualcuno digita a mano nel gestionale: numero del documento, data, imponibile, IVA e totale. Cento valori in tutto, contati uno per uno.
Il criterio pratico per decidere è questo: se su venti documenti dello stesso tipo i cinque campi escono giusti quasi sempre, il vostro problema non è la tecnologia ed è ora di chiedere un preventivo per collegare quel flusso al gestionale. Se invece gli errori sono molti e si concentrano sulle scansioni, avete appena scoperto che il progetto da fare non è di intelligenza artificiale: è cambiare il modo in cui quei documenti entrano in azienda, chiedendo ai fornitori il file originale invece della carta.
C'è poi una domanda da girare a chi vi assiste sul software, ed è quella che smonta le proposte gonfiate: quale programma usate per convertire i documenti, dove finiscono i file mentre li lavorate e cosa succede a quelli che il sistema sbaglia. Le prime due hanno una risposta secca. La terza è quella che distingue un fornitore serio, e vale anche quando la discussione riguarda integrare l'AI nel gestionale invece di comprare l'ennesima applicazione. Se state ancora decidendo da dove partire con l'intelligenza artificiale, la guida pratica all'AI per le PMI copre i passaggi che vengono prima di questo.
Il codice di liteparse è pubblico su GitHub, nel repository run-llama/liteparse. Voi non dovete guardarlo. Dovete solo smettere di pagare come intelligenza artificiale un lavoro che oggi costa zero, e cominciare a pagare per la parte che nessuno vi regala.
Domande frequenti
Che differenza c'è tra OCR ed estrazione dei dati da un documento?
Sono due passaggi diversi e vanno chiesti separatamente a chi vi vende una soluzione. L'OCR, cioè il riconoscimento ottico dei caratteri, guarda l'immagine di una pagina scansionata e ricava le lettere e i numeri che ci sono sopra. L'estrazione dei dati viene dopo e decide quale di quei numeri è il totale, quale la data e quale la partita IVA. Un fornitore che risponde solo sul primo passaggio non vi ha detto niente sul secondo, che è quello dove si concentrano gli errori.
Cos'è liteparse?
liteparse è uno strumento open source con licenza Apache 2.0 pubblicato su GitHub dall'organizzazione run-llama, la stessa che sviluppa il servizio a pagamento LlamaParse. Converte PDF, documenti Word, fogli Excel, presentazioni e immagini in testo strutturato in formato Markdown, JSON o testo semplice, include il motore di riconoscimento ottico Tesseract e gira interamente sul computer di chi lo usa, senza chiavi di accesso a servizi esterni. Il repository ha superato le dodicimila stelle.
Serve l'OCR anche per i PDF generati dal computer?
No. Un PDF creato esportandolo da Word, da un gestionale o da un programma di fatturazione contiene già i caratteri veri, quindi il testo si può leggere senza riconoscimento ottico. L'OCR serve quando il PDF è una scansione o una fotografia, perché in quel caso dentro il file c'è solo un'immagine. Fra le funzioni di liteparse c'è proprio un controllo economico che stabilisce in anticipo quali documenti hanno bisogno dell'OCR e quali no.
Un'intelligenza artificiale può leggere le fatture e inserirle nel gestionale da sola?
I pezzi tecnici per farlo esistono tutti, ma la domanda giusta non è se ci riesce: è cosa succede quando sbaglia. Una soluzione seria prevede una coda di revisione dove finiscono i documenti su cui il sistema non è sicuro, e una persona che li conferma in pochi secondi invece di reinserirli. Senza quella parte l'automazione sposta il lavoro invece di toglierlo, perché qualcuno dovrà comunque ricontrollare tutto.
Quanto costa far leggere i documenti aziendali a un'AI?
La parte di conversione dei documenti può costare zero, perché esistono strumenti open source come liteparse che girano sui computer dell'azienda con licenza Apache 2.0. Quello che si paga è il resto: l'aggancio al gestionale, la gestione degli errori e la revisione. Il modo più onesto di scoprire la cifra è chiedere un preventivo su un solo tipo di documento, quello che ricevete più spesso, invece che su un progetto di digitalizzazione generico.