claude· 7 min di lettura

Aggiornare il modello di un agente di intelligenza artificiale: il prezzo per token non dice più se conviene

Di Marco Masut

Aggiornare il modello di un agente è la decisione di sostituire il modello che sta sotto un sistema già in produzione, e oggi è una decisione che il listino non aiuta più a prendere. Anthropic ha rilasciato Claude Sonnet 5.5 il 28 settembre 2026 e lo vende a 2 dollari per milione di token in ingresso e 10 in uscita, cioè esattamente quanto Claude Sonnet 5, come si legge nella tabella della pagina prezzi di Anthropic. Nella pagina di annuncio l'azienda scrive che il modello genera output "30%+ faster than Sonnet 5" e che "it costs up to 30% less per task than its predecessor".

Le due frasi di Anthropic sulla velocità e sul costo per task, lette insieme, dicono una cosa precisa. Il risparmio non arriva dal prezzo, arriva dal fatto che il modello consuma meno token per portare a termine lo stesso lavoro. È un cambio di natura del conto, e riguarda chiunque abbia un agente che gira e un budget da difendere: il numero con cui si stimava la spesa ha smesso di contenere l'informazione che serve.

Perché il prezzo per token non dice più quanto costa un task

Il prezzo per token misura quanto costa un'unità di testo, non quanto costa chiudere un lavoro, e sulla linea Sonnet di Anthropic le due cose hanno smesso di muoversi insieme da parecchi mesi. La tabella della pagina prezzi di Anthropic, consultata il 29 settembre 2026, lo mostra bene.

ModelloInput per milioneOutput per milioneLettura dalla cache
Claude Sonnet 4.53 dollari15 dollari0,30 dollari
Claude Sonnet 4.63 dollari15 dollari0,30 dollari
Claude Sonnet 52 dollari10 dollari0,20 dollari
Claude Sonnet 5.52 dollari10 dollari0,20 dollari

Perché il listino di Claude Sonnet è fermo da mesi

Il listino di Claude Sonnet 5 è rimasto a 2 e 10 dollari per una ragione che Anthropic documenta. Quei due importi erano stati annunciati come prezzo introduttivo valido fino al 31 agosto 2026, con un aumento a 3 e 15 dollari programmato per il primo settembre: Anthropic scrive nella stessa pagina che quell'aumento non avverrà e che il prezzo introduttivo è diventato lo standard. Due modelli consecutivi allo stesso prezzo, dopo un aumento annullato, non sono una coincidenza di listino: sono il segnale che la concorrenza si è spostata su un altro terreno.

La trappola del tokenizer, che rende inconfrontabili due listini

Il tokenizer è il pezzo che taglia il testo in token, e Anthropic avverte nella pagina prezzi che i modelli dalla 4.7 in avanti ne usano uno nuovo, che produce circa il 30% di token in più per lo stesso testo. È l'avvertenza che manda in pezzi il confronto più naturale che venga in mente guardando la tabella qui sopra.

Passare da Claude Sonnet 4.6 a Claude Sonnet 5.5 sembra un taglio di un terzo sull'input, da 3 a 2 dollari. Ma lo stesso identico prompt, misurato con il tokenizer nuovo, conta circa il 30% di token in più, e il taglio di listino e l'aumento del conteggio si mangiano quasi a vicenda. Chi ha fatto quel salto e si è visto la bolletta non scendere non ha sbagliato i calcoli: ha confrontato due prezzi espressi in unità diverse.

Quando conviene aggiornare il modello di un agente, e quando no

Conviene aggiornare il modello di un agente quando il sistema chiude gli stessi task in meno turni, e non quando il fornitore pubblica una percentuale. Sulla pagina di annuncio Anthropic riporta per Claude Sonnet 5.5 un 70,6% su Terminal-Bench 4.0 contro il 10,3% di Claude Sonnet 5, ed è da quel salto che discende il conto più basso: un modello che arriva in fondo da solo non chiede altri giri. Ma la percentuale di Anthropic è misurata sui suoi test, con i suoi prompt e i suoi carichi, e il tuo agente non è nessuna di quelle cose. Quello che serve quindi è una misura fatta in casa, e si ottiene in cinque passaggi.

I cinque passaggi per misurare un cambio di modello

La misura di un cambio di modello si fa tenendo fermo tutto il resto, ed è l'unico modo di sapere cosa ha prodotto la differenza.

  1. Misura il prefisso fisso. Conta i token della parte di prompt che non cambia mai, cioè istruzioni di sistema, regole e file di contesto, con l'endpoint di conteggio token dell'API.
  2. Accendi la cache su quel prefisso. Una lettura dalla cache costa 0,1 volte il prezzo di input, cioè 0,20 dollari per milione su Sonnet invece di 2, mentre una scrittura sulla cache a cinque minuti costa 1,25 volte e rientra già dopo una sola rilettura.
  3. Conta i turni, non i token. Tieni fermo lo stesso task, fallo girare prima e dopo il cambio, e misura quante chiamate servono al modello per arrivare in fondo.
  4. Fissa il tetto in dollari. Claude Code, dalla versione del 28 settembre 2026, mostra gli importi in dollari nel limite di spesa del gateway delle app Claude su /usage e nella riga di stato, se anche il gateway gira da quella versione: il changelog ufficiale riporta la forma "$271.40 / $500.00 spent this month".
  5. Non cambiare modello e prompt lo stesso giorno. Se muovi due variabili insieme non saprai quale ha prodotto il risultato.

Il caso in cui non conviene aggiornare niente

Non conviene aggiornare il modello di un agente che non è mai stato misurato, e questo caso è più comune di quanto sembri. Senza un numero di partenza non esiste un confronto possibile, e il modello nuovo diventa una speranza invece di una decisione. La stessa regola vale una scala sopra, quando la domanda riguarda l'intero progetto e non il singolo task: il conto completo l'ho spiegato in quanto costa sviluppare un software con l'intelligenza artificiale. Su come si fissa un tetto prima di accendere qualcosa ho scritto una pagina a parte su quanto costa un agente AI in azienda e chi lo ferma quando spende troppo.

Cosa ho guardato nel mio repository prima di toccare il modello

Gli articoli di attualità di questo sito li scrive una routine automatica, e la prima cosa che ho guardato è quanto pesa la parte del prompt che non cambia mai. Nel repository ci sono tre file di regole in .claude/skills/articolo/, e ogni esecuzione li carica interi prima di scrivere una riga, insieme all'archivio di misure in data/seo/volumi-keyword.json, che ha 3.589 righe ed è fermo al primo agosto 2026. Quella parte è identica a ogni giro, quindi è esattamente il pezzo su cui la cache rende e l'unico che si può misurare una volta sola.

La parte variabile del prompt è quella dove va davvero a finire il conto. Quanti file l'agente apre, quante volte riscrive lo stesso paragrafo, quante verifiche lancia prima di considerarlo finito: sono i turni, e i turni sono la voce che un modello più capace accorcia. Chi vuole vedere la stessa dinamica da un altro lato la trova nel pezzo su come ridurre i token di un agente di coding dandogli una mappa della codebase, dove la leva è il contesto invece del modello.

La cosa concreta da fare se hai già un agente AI in produzione

La misura di partenza si prende sui task che l'agente gira più spesso, e si prende prima di cambiare qualsiasi cosa. Scegline tre, registra il consumo che l'API riporta per ognuno, e conserva quei numeri. Diventano la riga di partenza contro cui misurare il prossimo modello, che a questo ritmo arriva entro un mese. Se l'agente gira senza nessuno davanti, i controlli da mettere prima di lasciarlo solo li ho elencati nel pezzo su far girare Claude Code in automatico. Se invece l'agente è ancora da costruire, la scelta del modello viene per ultima e non per prima, come ho argomentato parlando della famiglia di modelli di Anthropic e delle tre porte per usarla e come vale per chiunque stia valutando di farsi costruire un agente su misura.

Il prezzo per token resterà nei listini e continuerà a essere la prima cosa che si guarda, perché è l'unica scritta in grande. Ma da questo rilascio in avanti è un dato di contorno: quello che decide la bolletta è quanto lavoro il modello riesce a chiudere prima di fermarsi, e quel numero non ce lo scrive nessun fornitore.

Domande frequenti

Quanto costa sviluppare un software con l'AI se i modelli cambiano ogni mese?

La voce che cambia ogni mese è il modello, non il progetto. Su un lavoro di sviluppo la parte grossa della spesa sta nelle ore di chi decide cosa va costruito e nei controlli su quello che esce, e quella parte non si muove quando un fornitore pubblica un listino nuovo. Conviene scrivere i preventivi tenendo separate le due voci: così quando il prezzo dei token scende si sa già quale riga si aggiorna e quale resta ferma.

Il prezzo dell'API di Claude è lo stesso su Amazon Bedrock e su Google Cloud?

No, e la differenza non riguarda solo chi manda la fattura. La pagina prezzi di Anthropic rimanda ai listini ufficiali di Amazon Bedrock e di Google Cloud per i modelli Claude, perché su quelle piattaforme è il fornitore cloud a fatturare. La stessa pagina segnala che a partire da Claude Sonnet 4.5, Claude Haiku 4.5 e Claude Opus 4.5 gli endpoint regionali e multi regione costano il 10% in più di quelli globali. Chi ha bisogno che i dati restino in un'area geografica precisa paga quel sovrapprezzo.

Conviene mettere un modello più piccolo sotto un agente per spendere meno?

Dipende da quanto il compito tollera un errore, non dal listino. Claude Haiku 4.5 costa 1 dollaro per milione di token in ingresso e 5 in uscita, la metà di Claude Sonnet 5.5, e la documentazione di Anthropic consiglia Haiku per i compiti semplici, Sonnet per la maggior parte dei carichi in produzione e Opus per il ragionamento più complesso. Un modello economico che sbaglia e va richiamato tre volte costa più di uno caro che chiude al primo giro.

Il Batch API serve a far costare meno un agente?

Il Batch API di Anthropic sconta del 50% sia i token in ingresso sia quelli in uscita, ma non si applica a un agente interattivo. La documentazione di Anthropic spiega che le sessioni dei Claude Managed Agents sono stateful e interattive e che per questo lo sconto batch non vale, mentre il risparmio della cache resta valido. Il batch conviene sui lavori che possono aspettare, come una rielaborazione notturna di documenti, non su un agente che lavora mentre qualcuno guarda.

Continua a leggere

claude

Cos'è Claude AI: la famiglia di modelli di Anthropic e le tre porte per usarla

Claude AI è la famiglia di modelli di Anthropic: quali sono, quanto costano e da quale delle tre porte conviene entrare per costruirci sopra.
claude

Cos'è il prompt engineering e cosa funziona davvero

Il prompt engineering è scrivere istruzioni che un modello esegue bene ogni volta. Cosa funziona davvero secondo Anthropic, numeri alla mano.
claude

Caricare file sull'API di Claude: limiti, scadenza e la trappola del workspace

Caricare file sull'API di Claude non richiede più l'header beta. I limiti veri, la scadenza dei documenti e la trappola del workspace condiviso.

Risorse pratiche su questi temi

Articolo

Le nuove regole del context engineering per i modelli Claude 5

L'articolo di Anthropic sul context engineering per i modelli Claude 5: cosa togliere dal prompt di sistema, dal CLAUDE.md e dalle skill.
Video

Estrarre il testo da un PDF e farlo leggere davvero all'AI

Estrarre il testo da un PDF in modo che l'AI lo legga davvero: come si fa gratis e in locale con AnyDoc, e cosa cambia con le scansioni.