In breve: AnyDoc è una libreria open source che estrae il testo da un PDF, e da altri tredici formati di documento, e lo converte in markdown pulito in locale e gratis. L'ha pubblicata Firecrawl il 6 agosto 2026 con licenza MIT, autore Eric Ciarla. Nel video la provo su un bilancio da settecento pagine e dico anche il limite che quasi nessuno racconta: sui PDF scansionati non funziona, e il modo per capire in due secondi se il tuo lo è.
Estrarre il testo da un PDF sembra un problema risolto finché non si prova a darlo a un agente AI e a fargli una domanda precisa. Il PDF non è nato per essere letto da una macchina, è nato per essere stampato: dentro non ci sono paragrafi, sezioni e tabelle, ci sono pezzi di testo con delle coordinate su una pagina. Il risultato lo conosce chiunque ci abbia provato davvero: due colonne diventano una frase sola mescolata, una tabella diventa una fila di numeri senza intestazione, il totale di una riga finisce attaccato a un'altra voce. Il rischio non è che l'AI risponda "non lo so", il rischio è che risponda con un numero preciso, sicuro e sbagliato di riga.
Il benchmark pubblicato da Firecrawl misura la conversione in 4,4 millisecondi mediani per documento, contro i 102 di pandoc e i 1.129 di LibreOffice, con una qualità valutata 81 contro 70 della migliore alternativa e quattordici formati coperti su quattordici, mentre l'alternativa più vicina ne copre dodici. Sono numeri che vengono rifatti a ogni nuova esecuzione del benchmark, quindi conviene rileggerli nel repository invece di fidarsi di una sintesi.
Vedi su YouTube →Cosa trovi nel video
- La prova su un bilancio consolidato da settecento pagine: stessa domanda prima e dopo la conversione, e cosa cambia nella risposta
- Il comando unico che installa AnyDoc come skill, e su quali agenti funziona
- Cos'è una skill spiegato in una riga, per chi sente la parola per la prima volta
- I numeri del benchmark di Firecrawl e cosa dicono davvero, al netto del marketing
- La differenza fra un PDF nativo e uno scansionato, che è quella che decide se questa roba ti serve o no
- Cosa fa pdf-inspector, e perché evitare l'OCR dove non serve conta più che avere un OCR migliore
Estrarre il testo da un PDF gratis e senza mandarlo online
Il modo gratuito per estrarre il testo da un PDF, e insieme da un Word o da un Excel, è installare AnyDoc come skill dell'agente con un comando solo:
Da quel momento l'agente sa convertire i documenti da solo, senza che glielo si spieghi ogni volta. Lo stesso comando funziona su Claude Code, Codex, Cursor e OpenCode. Una skill, per chi sente la parola adesso, è un pezzo di istruzioni e codice che si insegna una volta all'agente e che lui riusa da lì in avanti.
La parte che conta per un'azienda non è il prezzo, è dove girano i file. AnyDoc è una libreria che lavora sul computer di chi la usa, senza chiave API e senza limiti, quindi un contratto o un bilancio non lasciano la macchina. Chi deve decidere quanto lasciar toccare a un agente sui documenti riservati trova il ragionamento completo in quali permessi dare all'AI in azienda, e chi parte da zero con lo strumento trova i passaggi in come configurare Claude Code.
Il markdown che esce non è un dettaglio estetico. È il formato in cui titoli, sezioni e tabelle esistono davvero, quindi l'agente non deve più tenersi settecento pagine in testa: apre l'indice, va alla sezione, legge quella e cita da dove l'ha presa. Non si sta rendendo l'AI più intelligente, si sta smettendo di darle il lavoro nel formato peggiore possibile.
Estrarre il testo da un PDF scannerizzato, dove invece serve l'OCR
Su un PDF scannerizzato il testo non si estrae, si indovina, ed è il limite da conoscere prima di installare qualunque cosa. Esistono due tipi di PDF completamente diversi anche se sul computer hanno la stessa icona. Il PDF nativo è nato dentro un computer, il Word esportato o il bilancio pubblicato sul sito, e il testo c'è già scritto dentro. Il PDF scansionato è la fotografia di un foglio: dentro c'è solo un'immagine, e nessuna AI può leggere una cosa che non c'è. Lì serve un OCR, cioè un programma che guarda i pixel e prova a capire quali lettere sono.
Per sapere quale dei due hai in mano bastano due secondi: apri il file e prova a selezionare il testo con il mouse. Se si evidenzia riga per riga sei a posto. Se la selezione ti prende un rettangolo unico, quello è un PDF immagine e AnyDoc da solo non basta. Vale la pena farlo prima di mettere in piedi qualsiasi automazione, perché cambia completamente il pezzo di lavoro che serve.
La buona notizia per un'azienda italiana è che quasi tutto quello che gira davvero in ufficio è nativo: le fatture arrivano in XML dal sistema di interscambio, e capitolati, specifiche, listini, offerte e bilanci nascono dentro un computer. Le scansioni restano una minoranza, qualche contratto firmato a mano e gli archivi vecchi. Quando ci sono, con l'OCR si pagano tre cose: più tempo, spesso dei soldi, e il rischio che un carattere venga letto storto. Su una parola te ne accorgi, su un numero dentro una tabella no. È per questo che Firecrawl ha costruito pdf-inspector, una libreria separata che guarda pagina per pagina e manda all'OCR solo quelle che ne hanno bisogno: il motore che ci sta sopra è dichiarato dalle 3,5 alle 5 volte più veloce del precedente, non perché l'OCR sia migliorato, ma perché viene usato molto meno.
Perché ho fatto questo video
Ho pubblicato la versione corta di questa cosa il 7 agosto 2026, e in un giorno ha fatto 10.800 visualizzazioni su TikTok e circa 30.000 su Instagram. Il numero che mi ha convinto a farne una versione lunga però è un altro: 486 salvataggi. Le notizie non le salva nessuno, si salvano le cose che si pensa di dover rifare. Vuol dire che il documento illeggibile non è un problema da smanettoni, è una cosa che tanti hanno sulla scrivania adesso.
Nel lavoro che faccio con le aziende la lettura di contratti, capitolati e documenti lunghi è una delle richieste che torna più spesso, ed è uno dei servizi elencati in consulenza AI per le aziende. Il collo di bottiglia non è quasi mai il modello: è che le informazioni stanno dentro file che nessuno rilegge mai per intero e che all'agente arrivano nel formato sbagliato. Chi non ha ancora chiaro cosa sia lo strumento con cui si fa questo lavoro può partire da cos'è Claude Code e come funziona.
Il repository di AnyDoc è pubblico con licenza MIT e l'8 agosto 2026 ha superato le undicimila stelle su GitHub. Lo trovi qui sopra, così puoi leggere il benchmark e verificare i numeri da solo invece di fidarti della sintesi di qualcun altro.
Domande frequenti
Come si estrae il contenuto di un PDF?
Il contenuto di un PDF si estrae con una libreria che legge il livello testo del file e lo riscrive in un formato leggibile, di solito markdown. AnyDoc lo fa in locale con un comando solo. Funziona però soltanto sui PDF nativi, cioè quelli nati dentro un computer: se il file è la scansione di un foglio, dentro non c'è nessun testo da estrarre e serve un OCR.
Qual è un programma gratuito per estrarre il testo da un PDF?
AnyDoc è gratuito e open source con licenza MIT, pubblicato da Firecrawl il 6 agosto 2026. Gira sul computer di chi lo usa, non chiede nessuna chiave API e non ha limiti di utilizzo. Oltre ai PDF con testo converte anche Word, Excel, PowerPoint, OpenDocument, rtf, epub e csv, per un totale di quattordici formati.
Come si estrae il testo da un PDF scannerizzato?
Da un PDF scannerizzato il testo non si estrae, si indovina: dentro il file c'è solo un'immagine, quindi serve un OCR che guardi i pixel e riconosca le lettere. È più lento, spesso si paga, e su un numero dentro una tabella un carattere letto male non si nota. Firecrawl ha una libreria dedicata, pdf-inspector, che manda all'OCR solo le pagine che ne hanno bisogno.
Come capisco se un PDF è nativo o una scansione?
Si apre il file e si prova a selezionare il testo con il mouse. Se le righe si evidenziano una per una il PDF è nativo e il testo si estrae senza problemi. Se la selezione prende un rettangolo unico, quel PDF è un'immagine. Il test dura due secondi e non richiede nessun programma.
I documenti convertiti con AnyDoc escono dall'azienda?
No. AnyDoc è una libreria che gira in locale, senza chiamare nessun servizio esterno e senza chiave API, quindi i file non lasciano il computer. Per chi lavora su contratti, bilanci e capitolati è la differenza fra poter usare lo strumento e doverci rinunciare.