ai-tools· 6 min di lettura

Previsioni sui dati aziendali con l'intelligenza artificiale: il modello che non si addestra

Di Marco Masut

Un modello tabellare di fondazione è un modello che fa previsioni su una tabella che non ha mai visto, senza essere addestrato sui dati di quella tabella. Il 29 settembre 2026 NVIDIA ha pubblicato sul blog di Hugging Face Kumo Tabular, un modello di questo tipo rilasciato con i pesi aperti e con licenza OpenMDW-1.1, che permette l'uso commerciale. Le previsioni sui dati aziendali con l'intelligenza artificiale sono il caso d'uso per cui questa famiglia di modelli esiste, ed è la ragione per cui vale la pena guardarla anche se il nome non dice niente a nessuno.

La notizia non è che NVIDIA ha rilasciato un modello. La notizia è che il passaggio più costoso di un progetto di previsione, cioè addestrare un modello sui dati del cliente, in diversi casi si può togliere.

Che cos'è Kumo Tabular e cosa fa su una tabella

Kumo Tabular prende le righe di una tabella che già conosci, con la colonna da prevedere compilata, e assegna il valore mancante alle righe nuove in un singolo passaggio. NVIDIA lo descrive come un modello che predice le etichette delle righe nuove "with no training, no tuning, and no feature engineering". Non c'è una fase di addestramento da far partire e non c'è il lavoro di costruzione delle variabili che di solito occupa la parte più lunga del progetto.

Il modello esce in tre taglie, da 28 a 215 milioni di parametri, ed è disponibile su Hugging Face come nvidia/Kumo-Tabular. Il pre addestramento non è stato fatto su dati aziendali reali ma su tabelle generate artificialmente con modelli causali strutturali, in quantità diverse per ogni taglia.

TagliaTabelle artificiali viste in pre addestramento
Kumo Tabular-Smallcirca 35 milioni
Kumo Tabular-Mediumcirca 71 milioni
Kumo Tabular-Largecirca 137 milioni

Sul benchmark TabArena, secondo i numeri pubblicati da NVIDIA, Kumo Tabular si classifica primo con un ELO di 1950, misurato contro alberi con gradient boosting messi a punto, AutoGluon e gli altri modelli tabellari di fondazione recenti. Su BeyondArena il punteggio dichiarato è 1418.

Perché le previsioni sui dati aziendali non sono il fine tuning

Le previsioni su una tabella e il fine tuning di un modello di linguaggio sono due lavori diversi, e confonderli è l'errore che costa più soldi in questa categoria di progetti. Il fine tuning riguarda il comportamento di un modello che produce testo, mentre un modello tabellare produce un numero o una classe partendo da colonne. Chi chiede un preventivo per "addestrare l'AI sui nostri dati" quasi sempre ha davanti il secondo problema e si ritrova proposto il primo.

In un articolo di agosto ho sostenuto che il fine tuning serve meno di quanto sembra, e che i documenti aziendali vanno recuperati davanti al modello mentre risponde invece di essere consegnati a un addestramento. Kumo Tabular estende quella posizione al lato numerico: anche sulle tabelle, la fase di addestramento che tutti danno per scontata in diversi casi si può semplicemente non fare.

Restano tre strade distinte, e vanno tenute distinte quando si decide.

  1. Per rispondere su documenti e procedure serve il recupero delle informazioni, cioè il RAG, non un addestramento.
  2. Per prevedere un valore su righe e colonne serve un modello tabellare, e oggi può essere uno già pre addestrato.
  3. Per cambiare il modo in cui un modello di linguaggio si comporta serve il fine tuning, che è il caso più raro dei tre.

Quando addestrare da zero resta fuori discussione

Addestrare un modello da zero non è quasi mai la strada giusta per un'azienda, e questa novità non cambia quel giudizio ma lo rafforza. Ho già scritto perché addestrare un modello di intelligenza artificiale sia una decisione che riguarda pochissime organizzazioni al mondo. Un modello pre addestrato che funziona su tabelle mai viste toglie un altro pezzo di terreno a quella scelta.

Come usare l'AI per l'analisi dei dati aziendali senza un progetto di machine learning

L'AI applicata all'analisi dei dati aziendali parte da una tabella che l'azienda ha già, non da un progetto da aprire. Il percorso concreto con un modello come Kumo Tabular è corto: si prende l'estrazione del gestionale, si tiene la colonna che si vuole prevedere, si separano le righe storiche da quelle da indovinare e si guarda cosa esce. La libreria pubblicata da NVIDIA si chiama structured-data-models, abbreviata in sdm, e nell'esempio ufficiale il modello si istanzia in una riga.

from sdm import KumoTabular

modello = KumoTabular(device="cuda")
previsioni = modello.predict(context=righe_storiche, query=righe_da_prevedere)

Prima di arrivare al codice conviene però guardare i vincoli, perché sono loro a dire se la tabella è adatta.

I limiti che decidono se la tua tabella è adatta

I limiti dichiarati da NVIDIA sulla pagina di Kumo Tabular sono precisi e vanno confrontati con la tabella vera prima di scrivere una riga di codice.

VincoloValore dichiarato da NVIDIA
Tipi di colonnasolo numeriche e categoriche
Classi in un singolo passaggiofino a 10
Righe, configurazione estesafino a 60.000
Colonnefino a 100
LicenzaOpenMDW-1.1, uso commerciale permesso

Le colonne di testo libero non rientrano fra i tipi gestiti, quindi un campo note compilato a mano va trasformato in categoria oppure lasciato fuori. NVIDIA dichiara inoltre che l'accuratezza può peggiorare sui dati fuori distribuzione, che tradotto vuol dire che una tabella del 2026 molto diversa da quella del 2024 va trattata con prudenza. Se i dati da cui partire stanno dentro PDF e non dentro una tabella, il problema da risolvere prima è un altro e l'ho affrontato in come estrarre dati dai PDF aziendali.

Cosa cambia per chi costruisce prodotti con l'intelligenza artificiale

Per chi costruisce prodotti, un modello tabellare pre addestrato sposta una voce di costo da fissa a quasi nulla, e questo cambia quali progetti hanno senso. Una previsione su dati di un cliente richiedeva un ciclo di raccolta, pulizia, costruzione delle variabili e addestramento, con settimane di lavoro prima di sapere se il segnale c'era. Con un modello già pre addestrato quella verifica si fa in un pomeriggio, e il risultato negativo costa un pomeriggio invece di un mese.

Nel repository di questo sito tengo le misurazioni SEO in due file JSON che sono esattamente tabelle di questo tipo: 3.589 righe di volumi di ricerca e 138 righe di domande con il loro intento. Ogni volta che ho pensato di costruirci sopra una previsione, per esempio quali domande valga la pena coprire prima, mi sono fermato davanti al costo di tirare su un modello per una tabella da poche migliaia di righe. Quel calcolo, con un modello che non va addestrato, viene diverso.

Il punto da verificare prima di portarlo in produzione

La licenza e la provenienza dei pesi sono il punto da verificare su Kumo Tabular, più delle prestazioni dichiarate. I pesi aperti non sono tutti uguali e le condizioni cambiano fra versioni dello stesso produttore, come ho mostrato parlando dei modelli AI cinesi e delle loro licenze: OpenMDW-1.1 permette l'uso commerciale, ma il documento che fa fede è quello depositato con i pesi. Per chi vuole capire quali dati aziendali abbia senso mettere al lavoro e in che ordine, è il tipo di decisione che affronto nella consulenza sui dati aziendali.

La posizione, detta in breve: Kumo Tabular non è interessante perché vince un benchmark, ma perché toglie l'addestramento dal percorso di un intero tipo di progetto. La fonte primaria con i numeri e il codice è l'annuncio di NVIDIA su Hugging Face, e vale la mezz'ora che serve a leggerlo.

Domande frequenti

Che differenza c'è tra un modello tabellare e un LLM come Claude o ChatGPT?

Un modello tabellare e un modello di linguaggio risolvono problemi diversi e non si sostituiscono. Il modello tabellare prende righe e colonne e restituisce un numero o una classe, quindi serve quando la domanda è quanto o quale. Un modello di linguaggio prende testo e restituisce testo, quindi serve quando la domanda riguarda documenti, email o conversazioni. Chiedere una previsione numerica a un modello di linguaggio funziona male proprio perché non è il formato per cui è costruito.

Serve una GPU per usare l'AI sulle previsioni dei dati aziendali?

Nel caso di Kumo Tabular la libreria è descritta da NVIDIA come GPU-native e l'esempio di codice pubblicato gira su device cuda, quindi la strada normale è una GPU. NVIDIA non dichiara sulla pagina che la GPU sia obbligatoria, perciò vale la prova prima dell'acquisto: una macchina a noleggio per qualche ora costa pochi euro e dice se il modello regge il tuo caso meglio di qualsiasi preventivo.

I dati della mia azienda finiscono a NVIDIA se uso un modello open weight?

Con un modello open weight i pesi vengono scaricati e girano sull'infrastruttura di chi lo usa, quindi le righe della tabella non partono verso il produttore del modello. È la differenza sostanziale rispetto a un servizio via API, dove i dati escono dall'azienda a ogni chiamata. Resta da verificare dove gira la macchina che fa il calcolo, perché una GPU a noleggio è comunque un fornitore esterno con un contratto da leggere.

Cosa vuol dire la licenza OpenMDW-1.1 per un'azienda?

OpenMDW-1.1 è la licenza con cui NVIDIA ha pubblicato Kumo Tabular e permette l'uso commerciale. Per un'azienda vuol dire che il modello si può mettere dentro un prodotto venduto, cosa che diverse licenze di modelli aperti non consentono o consentono solo sotto una soglia di utenti. La licenza va comunque letta nella versione depositata insieme ai pesi, perché è quella che fa fede e non il riassunto di un articolo.

Quanti dati storici servono per avere una previsione utile?

Non esiste una soglia unica e dipende da quanto il fenomeno è regolare, ma il vincolo pratico è la qualità prima della quantità. Una tabella con poche centinaia di righe pulite e coerenti produce previsioni più utili di decine di migliaia di righe con categorie scritte in modo diverso ogni anno. Il lavoro che serve davvero sta quasi sempre nel rendere coerenti le colonne, non nel procurarsi più storico.

Continua a leggere

ai-tools

Differenza tra machine learning e intelligenza artificiale: quando ti serve davvero addestrare qualcosa

La differenza tra machine learning e intelligenza artificiale non è una scelta fra due strumenti, è un livello. E cambia cosa devi costruire.
ai-tools

Confronto strumenti di intelligenza artificiale: cosa misurare davvero

Il confronto fra strumenti di intelligenza artificiale non si fa con una tabella di funzionalità: si fa su un compito tuo, misurando tre numeri.
ai-tools

Isolare un agente di intelligenza artificiale: dove conviene mettere il limite

NVIDIA ha pubblicato un runtime open source per agenti autonomi. Cosa cambia per chi deve isolare un agente di intelligenza artificiale.

Risorse pratiche su questi temi

Video

Estrarre il testo da un PDF e farlo leggere davvero all'AI

Estrarre il testo da un PDF in modo che l'AI lo legga davvero: come si fa gratis e in locale con AnyDoc, e cosa cambia con le scansioni.
Articolo

Le nuove regole del context engineering per i modelli Claude 5

L'articolo di Anthropic sul context engineering per i modelli Claude 5: cosa togliere dal prompt di sistema, dal CLAUDE.md e dalle skill.