Aggiornare il modello di un agente di intelligenza artificiale: il prezzo per token non dice più se conviene
Aggiornare il modello di un agente è la decisione di sostituire il modello che sta sotto un sistema già in produzione, e oggi è una decisione che il listino non aiuta più a prendere. Anthropic ha rilasciato Claude Sonnet 5.5 il 28 settembre 2026 e lo vende a 2 dollari per milione di token in ingresso e 10 in uscita, cioè esattamente quanto Claude Sonnet 5, come si legge nella tabella della pagina prezzi di Anthropic. Nella pagina di annuncio l'azienda scrive che il modello genera output "30%+ faster than Sonnet 5" e che "it costs up to 30% less per task than its predecessor".
Le due frasi di Anthropic sulla velocità e sul costo per task, lette insieme, dicono una cosa precisa. Il risparmio non arriva dal prezzo, arriva dal fatto che il modello consuma meno token per portare a termine lo stesso lavoro. È un cambio di natura del conto, e riguarda chiunque abbia un agente che gira e un budget da difendere: il numero con cui si stimava la spesa ha smesso di contenere l'informazione che serve.
Perché il prezzo per token non dice più quanto costa un task
Il prezzo per token misura quanto costa un'unità di testo, non quanto costa chiudere un lavoro, e sulla linea Sonnet di Anthropic le due cose hanno smesso di muoversi insieme da parecchi mesi. La tabella della pagina prezzi di Anthropic, consultata il 29 settembre 2026, lo mostra bene.
| Modello | Input per milione | Output per milione | Lettura dalla cache |
|---|---|---|---|
| Claude Sonnet 4.5 | 3 dollari | 15 dollari | 0,30 dollari |
| Claude Sonnet 4.6 | 3 dollari | 15 dollari | 0,30 dollari |
| Claude Sonnet 5 | 2 dollari | 10 dollari | 0,20 dollari |
| Claude Sonnet 5.5 | 2 dollari | 10 dollari | 0,20 dollari |
Perché il listino di Claude Sonnet è fermo da mesi
Il listino di Claude Sonnet 5 è rimasto a 2 e 10 dollari per una ragione che Anthropic documenta. Quei due importi erano stati annunciati come prezzo introduttivo valido fino al 31 agosto 2026, con un aumento a 3 e 15 dollari programmato per il primo settembre: Anthropic scrive nella stessa pagina che quell'aumento non avverrà e che il prezzo introduttivo è diventato lo standard. Due modelli consecutivi allo stesso prezzo, dopo un aumento annullato, non sono una coincidenza di listino: sono il segnale che la concorrenza si è spostata su un altro terreno.
La trappola del tokenizer, che rende inconfrontabili due listini
Il tokenizer è il pezzo che taglia il testo in token, e Anthropic avverte nella pagina prezzi che i modelli dalla 4.7 in avanti ne usano uno nuovo, che produce circa il 30% di token in più per lo stesso testo. È l'avvertenza che manda in pezzi il confronto più naturale che venga in mente guardando la tabella qui sopra.
Passare da Claude Sonnet 4.6 a Claude Sonnet 5.5 sembra un taglio di un terzo sull'input, da 3 a 2 dollari. Ma lo stesso identico prompt, misurato con il tokenizer nuovo, conta circa il 30% di token in più, e il taglio di listino e l'aumento del conteggio si mangiano quasi a vicenda. Chi ha fatto quel salto e si è visto la bolletta non scendere non ha sbagliato i calcoli: ha confrontato due prezzi espressi in unità diverse.
Quando conviene aggiornare il modello di un agente, e quando no
Conviene aggiornare il modello di un agente quando il sistema chiude gli stessi task in meno turni, e non quando il fornitore pubblica una percentuale. Sulla pagina di annuncio Anthropic riporta per Claude Sonnet 5.5 un 70,6% su Terminal-Bench 4.0 contro il 10,3% di Claude Sonnet 5, ed è da quel salto che discende il conto più basso: un modello che arriva in fondo da solo non chiede altri giri. Ma la percentuale di Anthropic è misurata sui suoi test, con i suoi prompt e i suoi carichi, e il tuo agente non è nessuna di quelle cose. Quello che serve quindi è una misura fatta in casa, e si ottiene in cinque passaggi.
I cinque passaggi per misurare un cambio di modello
La misura di un cambio di modello si fa tenendo fermo tutto il resto, ed è l'unico modo di sapere cosa ha prodotto la differenza.
- Misura il prefisso fisso. Conta i token della parte di prompt che non cambia mai, cioè istruzioni di sistema, regole e file di contesto, con l'endpoint di conteggio token dell'API.
- Accendi la cache su quel prefisso. Una lettura dalla cache costa 0,1 volte il prezzo di input, cioè 0,20 dollari per milione su Sonnet invece di 2, mentre una scrittura sulla cache a cinque minuti costa 1,25 volte e rientra già dopo una sola rilettura.
- Conta i turni, non i token. Tieni fermo lo stesso task, fallo girare prima e dopo il cambio, e misura quante chiamate servono al modello per arrivare in fondo.
- Fissa il tetto in dollari. Claude Code, dalla versione del 28 settembre 2026, mostra gli importi in dollari nel limite di spesa del gateway delle app Claude su
/usagee nella riga di stato, se anche il gateway gira da quella versione: il changelog ufficiale riporta la forma "$271.40 / $500.00 spent this month". - Non cambiare modello e prompt lo stesso giorno. Se muovi due variabili insieme non saprai quale ha prodotto il risultato.
Il caso in cui non conviene aggiornare niente
Non conviene aggiornare il modello di un agente che non è mai stato misurato, e questo caso è più comune di quanto sembri. Senza un numero di partenza non esiste un confronto possibile, e il modello nuovo diventa una speranza invece di una decisione. La stessa regola vale una scala sopra, quando la domanda riguarda l'intero progetto e non il singolo task: il conto completo l'ho spiegato in quanto costa sviluppare un software con l'intelligenza artificiale. Su come si fissa un tetto prima di accendere qualcosa ho scritto una pagina a parte su quanto costa un agente AI in azienda e chi lo ferma quando spende troppo.
Cosa ho guardato nel mio repository prima di toccare il modello
Gli articoli di attualità di questo sito li scrive una routine automatica, e la prima cosa che ho guardato è quanto pesa la parte del prompt che non cambia mai. Nel repository ci sono tre file di regole in .claude/skills/articolo/, e ogni esecuzione li carica interi prima di scrivere una riga, insieme all'archivio di misure in data/seo/volumi-keyword.json, che ha 3.589 righe ed è fermo al primo agosto 2026. Quella parte è identica a ogni giro, quindi è esattamente il pezzo su cui la cache rende e l'unico che si può misurare una volta sola.
La parte variabile del prompt è quella dove va davvero a finire il conto. Quanti file l'agente apre, quante volte riscrive lo stesso paragrafo, quante verifiche lancia prima di considerarlo finito: sono i turni, e i turni sono la voce che un modello più capace accorcia. Chi vuole vedere la stessa dinamica da un altro lato la trova nel pezzo su come ridurre i token di un agente di coding dandogli una mappa della codebase, dove la leva è il contesto invece del modello.
La cosa concreta da fare se hai già un agente AI in produzione
La misura di partenza si prende sui task che l'agente gira più spesso, e si prende prima di cambiare qualsiasi cosa. Scegline tre, registra il consumo che l'API riporta per ognuno, e conserva quei numeri. Diventano la riga di partenza contro cui misurare il prossimo modello, che a questo ritmo arriva entro un mese. Se l'agente gira senza nessuno davanti, i controlli da mettere prima di lasciarlo solo li ho elencati nel pezzo su far girare Claude Code in automatico. Se invece l'agente è ancora da costruire, la scelta del modello viene per ultima e non per prima, come ho argomentato parlando della famiglia di modelli di Anthropic e delle tre porte per usarla e come vale per chiunque stia valutando di farsi costruire un agente su misura.
Il prezzo per token resterà nei listini e continuerà a essere la prima cosa che si guarda, perché è l'unica scritta in grande. Ma da questo rilascio in avanti è un dato di contorno: quello che decide la bolletta è quanto lavoro il modello riesce a chiudere prima di fermarsi, e quel numero non ce lo scrive nessun fornitore.
Domande frequenti
Quanto costa sviluppare un software con l'AI se i modelli cambiano ogni mese?
La voce che cambia ogni mese è il modello, non il progetto. Su un lavoro di sviluppo la parte grossa della spesa sta nelle ore di chi decide cosa va costruito e nei controlli su quello che esce, e quella parte non si muove quando un fornitore pubblica un listino nuovo. Conviene scrivere i preventivi tenendo separate le due voci: così quando il prezzo dei token scende si sa già quale riga si aggiorna e quale resta ferma.
Il prezzo dell'API di Claude è lo stesso su Amazon Bedrock e su Google Cloud?
No, e la differenza non riguarda solo chi manda la fattura. La pagina prezzi di Anthropic rimanda ai listini ufficiali di Amazon Bedrock e di Google Cloud per i modelli Claude, perché su quelle piattaforme è il fornitore cloud a fatturare. La stessa pagina segnala che a partire da Claude Sonnet 4.5, Claude Haiku 4.5 e Claude Opus 4.5 gli endpoint regionali e multi regione costano il 10% in più di quelli globali. Chi ha bisogno che i dati restino in un'area geografica precisa paga quel sovrapprezzo.
Conviene mettere un modello più piccolo sotto un agente per spendere meno?
Dipende da quanto il compito tollera un errore, non dal listino. Claude Haiku 4.5 costa 1 dollaro per milione di token in ingresso e 5 in uscita, la metà di Claude Sonnet 5.5, e la documentazione di Anthropic consiglia Haiku per i compiti semplici, Sonnet per la maggior parte dei carichi in produzione e Opus per il ragionamento più complesso. Un modello economico che sbaglia e va richiamato tre volte costa più di uno caro che chiude al primo giro.
Il Batch API serve a far costare meno un agente?
Il Batch API di Anthropic sconta del 50% sia i token in ingresso sia quelli in uscita, ma non si applica a un agente interattivo. La documentazione di Anthropic spiega che le sessioni dei Claude Managed Agents sono stateful e interattive e che per questo lo sconto batch non vale, mentre il risparmio della cache resta valido. Il batch conviene sui lavori che possono aspettare, come una rielaborazione notturna di documenti, non su un agente che lavora mentre qualcuno guarda.