Controllare il codice scritto dall'intelligenza artificiale: cosa vede davvero il secondo agente
Controllare il codice scritto dall'intelligenza artificiale è verificare due cose diverse: che il codice funzioni, e che faccia quello che avevi chiesto. La prima la verifica una macchina e la verifica bene, perché i test passano o non passano e la build compila o si ferma. La seconda non la verifica nessuno, perché l'istruzione che hai dato quaranta messaggi prima non sta scritta in nessun file che un compilatore sappia leggere. Il 1 ottobre 2026 OpenAI ha pubblicato la versione 0.160.0 stabile di Codex CLI, e dentro c'è il primo tentativo dichiarato di coprire la seconda metà.
Cosa ha aggiunto OpenAI a Codex il 1 ottobre
La funzione si chiama Guardian review ed è opzionale. Le note di rilascio della versione 0.160.0, pubblicate su github.com/openai/codex il 1 ottobre 2026 alle 20:19, la descrivono con una riga sola: "Added opt-in Guardian review capabilities to retrieve earlier user instructions and include context from agent handoffs".
Le due cose che recupera vanno guardate separatamente, perché sono due problemi diversi. Le "earlier user instructions" sono le richieste che hai fatto prima e che la conversazione ha spinto fuori dalla finestra di contesto: esistono, le hai scritte tu, e il modello che sta lavorando adesso non le ha più davanti. Il "context from agent handoffs" è quello che un agente ha passato a un altro quando il lavoro è cambiato di mano, ed è il punto in cui si perde più informazione di quanto sembri, come succede ogni volta che si prova a far lavorare più agenti sullo stesso progetto o a dividere il lavoro fra subagent.
La stessa versione 0.160.0 porta altre cose minori, dalla cronologia dei task più vecchi nel command center al recupero delle sessioni fuori da un progetto. La Guardian review è l'unica che cambia il modo in cui si lavora.
Anthropic ha spedito la stessa idea con un altro nome
Claude Code è arrivato alla versione 2.1.287 con una funzione che risolve lo stesso problema da un'altra direzione. Il CHANGELOG.md del repository anthropics/claude-code apre quella versione con due righe: "Added Claude Mods: plugins may now modify deeper behavior" e "Added You should know, a built-in mod where a side agent watches your back and flags things you or Claude might miss".
Il mod si attiva con un comando, ed è scritto nel changelog insieme al suo vincolo:
La riga del changelog precisa che vale "for first-party sessions with telemetry on", quindi in un'azienda che ha disattivato la telemetria per policy quella funzione resta fuori dalla portata. Vale la pena saperlo prima di metterla in un processo, perché è lo stesso tipo di vincolo ambientale che rende poco trasferibili molte configurazioni di Claude Code lasciato girare in automatico.
Il secondo agente non legge il codice, legge il contesto
Nessuna delle due funzioni uscite questa settimana controlla se il codice è corretto. Guardian review recupera istruzioni e handoff, il mod You should know segnala quello che tu o Claude potreste aver perso: entrambe lavorano sulla memoria della conversazione, non sul comportamento del programma. È una distinzione che conviene tenere ferma, perché decide dove ha senso metterle.
| Dove sta il controllo | Cosa sa dire | Cosa non vede |
|---|---|---|
| Build e test | se il codice si rompe | se è il codice sbagliato a funzionare |
| Lint e controllo dei tipi | se la forma rispetta le regole | l'intenzione di chi ha chiesto |
| Secondo agente | se hai perso un'istruzione o un passaggio | se il risultato è corretto |
| Rilettura umana del diff | entrambe le cose, su poco codice | tutto quello che non si fa in tempo a leggere |
La riga che manca nella tabella
Uno strumento che copra insieme la correttezza del programma e l'intenzione di chi l'ha chiesto non esiste, né fra quelli usciti questa settimana né altrove. Chi vende un revisore automatico come sostituto dei test sta vendendo la terza riga spacciandola per la prima, ed è un errore caro: la verifica e il contenimento restano problemi separati, nello stesso modo in cui lo sono quando si decide dove mettere il limite a un agente che esegue comandi.
Controllare il codice scritto dall'AI: dove mettere i due controlli
Il controllo deterministico va messo prima del punto di non ritorno, il revisore AI va messo prima del controllo deterministico. In questo repository la regola è scritta così: la routine che pubblica gli articoli di attualità, descritta in automazione-blog/cloud-agent/prompt-articolo-notizie.md, esegue npm run build e se la build fallisce non committa e non pubblica niente. Quel comando non capisce niente di editoria, però intercetta l'unico errore che manderebbe offline il sito, e lo intercetta sempre.
Quello che la build non prende, e si vede nei numeri
Il limite di un controllo deterministico si misura, e in questo repository è misurato. Il file .claude/skills/articolo/seo-geo.md riporta che sui ventiquattro articoli generati in automatico ad agosto 2026 la lunghezza mediana di una sezione era di 266 parole, con punte a 592, e che i sottotitoli di terzo livello erano zero. La build è passata verde su tutti e ventiquattro. Nessuna di quelle pagine era rotta, erano semplicemente scritte male rispetto a una regola che qualcuno aveva scritto e che nessuno rileggeva.
Le tre cose da fare questa settimana
Tre cose si possono fare oggi, senza aspettare che gli strumenti maturino. La prima è scrivere le istruzioni che non devono perdersi in un file del repository invece che in chat, perché un CLAUDE.md o un AGENTS.md rientra nel contesto a ogni sessione mentre un messaggio di due ore fa no. La seconda è decidere quale comando deve fallire perché il lavoro si fermi, e verificare che fallisca davvero su un caso rotto costruito apposta. La terza è stabilire quale parte del diff si legge comunque a mano: autenticazione, pagamenti, cancellazioni e permessi sono il minimo sindacale, e sono anche la lista che consegno come punto di partenza quando progetto agenti AI su misura per qualcuno.
Un agente che controlla un altro agente è un miglioramento vero, e va preso per quello che è: recupera l'istruzione che si era persa, non garantisce che il risultato sia giusto. La garanzia resta dove è sempre stata, cioè in un controllo che o passa o si ferma, e in qualcuno che decide quale delle due cose deve succedere.
Domande frequenti
La Guardian review di Codex è attiva di default?
No. Le note di rilascio della versione 0.160.0 di Codex CLI definiscono la Guardian review una capacità opt-in, cioè va abilitata da chi usa lo strumento e non parte da sola dopo l'aggiornamento. Chi aggiorna e non tocca niente continua a lavorare esattamente come prima.
Come si attiva il mod You should know di Claude Code?
Il changelog di Claude Code indica il comando `/plugin enable cc-plugin-you-should-know@builtin`. La stessa riga precisa che il mod vale per le sessioni di prima parte con la telemetria attiva, quindi in un ambiente dove la telemetria è disattivata per policy aziendale non è detto che si possa usare.
L'AI può sostituire la revisione del codice fatta da una persona?
No, e i due controlli cercano cose diverse. Un revisore AI è bravo a notare che un pezzo di codice contraddice un'istruzione data prima o una convenzione scritta nel repository, perché quel confronto è meccanico. Decidere se una funzionalità vale la complessità che aggiunge resta una decisione di prodotto, e nessuno dei due strumenti usciti a ottobre 2026 prova a prenderla.
Serve ancora rileggere il diff riga per riga?
Serve, ma non su tutto il diff. La parte generata che tocca autenticazione, pagamenti, cancellazioni di dati e permessi va letta a mano sempre, perché è il punto in cui un errore non si manifesta come test rosso. Sul resto conviene spendere il tempo a scrivere il controllo automatico che intercetterebbe quell'errore la prossima volta.