ai-tools· 5 min di lettura

Controllare il codice scritto dall'intelligenza artificiale: cosa vede davvero il secondo agente

Di Marco Masut

Controllare il codice scritto dall'intelligenza artificiale è verificare due cose diverse: che il codice funzioni, e che faccia quello che avevi chiesto. La prima la verifica una macchina e la verifica bene, perché i test passano o non passano e la build compila o si ferma. La seconda non la verifica nessuno, perché l'istruzione che hai dato quaranta messaggi prima non sta scritta in nessun file che un compilatore sappia leggere. Il 1 ottobre 2026 OpenAI ha pubblicato la versione 0.160.0 stabile di Codex CLI, e dentro c'è il primo tentativo dichiarato di coprire la seconda metà.

Cosa ha aggiunto OpenAI a Codex il 1 ottobre

La funzione si chiama Guardian review ed è opzionale. Le note di rilascio della versione 0.160.0, pubblicate su github.com/openai/codex il 1 ottobre 2026 alle 20:19, la descrivono con una riga sola: "Added opt-in Guardian review capabilities to retrieve earlier user instructions and include context from agent handoffs".

Le due cose che recupera vanno guardate separatamente, perché sono due problemi diversi. Le "earlier user instructions" sono le richieste che hai fatto prima e che la conversazione ha spinto fuori dalla finestra di contesto: esistono, le hai scritte tu, e il modello che sta lavorando adesso non le ha più davanti. Il "context from agent handoffs" è quello che un agente ha passato a un altro quando il lavoro è cambiato di mano, ed è il punto in cui si perde più informazione di quanto sembri, come succede ogni volta che si prova a far lavorare più agenti sullo stesso progetto o a dividere il lavoro fra subagent.

La stessa versione 0.160.0 porta altre cose minori, dalla cronologia dei task più vecchi nel command center al recupero delle sessioni fuori da un progetto. La Guardian review è l'unica che cambia il modo in cui si lavora.

Anthropic ha spedito la stessa idea con un altro nome

Claude Code è arrivato alla versione 2.1.287 con una funzione che risolve lo stesso problema da un'altra direzione. Il CHANGELOG.md del repository anthropics/claude-code apre quella versione con due righe: "Added Claude Mods: plugins may now modify deeper behavior" e "Added You should know, a built-in mod where a side agent watches your back and flags things you or Claude might miss".

Il mod si attiva con un comando, ed è scritto nel changelog insieme al suo vincolo:

/plugin enable cc-plugin-you-should-know@builtin

La riga del changelog precisa che vale "for first-party sessions with telemetry on", quindi in un'azienda che ha disattivato la telemetria per policy quella funzione resta fuori dalla portata. Vale la pena saperlo prima di metterla in un processo, perché è lo stesso tipo di vincolo ambientale che rende poco trasferibili molte configurazioni di Claude Code lasciato girare in automatico.

Il secondo agente non legge il codice, legge il contesto

Nessuna delle due funzioni uscite questa settimana controlla se il codice è corretto. Guardian review recupera istruzioni e handoff, il mod You should know segnala quello che tu o Claude potreste aver perso: entrambe lavorano sulla memoria della conversazione, non sul comportamento del programma. È una distinzione che conviene tenere ferma, perché decide dove ha senso metterle.

Dove sta il controlloCosa sa direCosa non vede
Build e testse il codice si rompese è il codice sbagliato a funzionare
Lint e controllo dei tipise la forma rispetta le regolel'intenzione di chi ha chiesto
Secondo agentese hai perso un'istruzione o un passaggiose il risultato è corretto
Rilettura umana del diffentrambe le cose, su poco codicetutto quello che non si fa in tempo a leggere

La riga che manca nella tabella

Uno strumento che copra insieme la correttezza del programma e l'intenzione di chi l'ha chiesto non esiste, né fra quelli usciti questa settimana né altrove. Chi vende un revisore automatico come sostituto dei test sta vendendo la terza riga spacciandola per la prima, ed è un errore caro: la verifica e il contenimento restano problemi separati, nello stesso modo in cui lo sono quando si decide dove mettere il limite a un agente che esegue comandi.

Controllare il codice scritto dall'AI: dove mettere i due controlli

Il controllo deterministico va messo prima del punto di non ritorno, il revisore AI va messo prima del controllo deterministico. In questo repository la regola è scritta così: la routine che pubblica gli articoli di attualità, descritta in automazione-blog/cloud-agent/prompt-articolo-notizie.md, esegue npm run build e se la build fallisce non committa e non pubblica niente. Quel comando non capisce niente di editoria, però intercetta l'unico errore che manderebbe offline il sito, e lo intercetta sempre.

Quello che la build non prende, e si vede nei numeri

Il limite di un controllo deterministico si misura, e in questo repository è misurato. Il file .claude/skills/articolo/seo-geo.md riporta che sui ventiquattro articoli generati in automatico ad agosto 2026 la lunghezza mediana di una sezione era di 266 parole, con punte a 592, e che i sottotitoli di terzo livello erano zero. La build è passata verde su tutti e ventiquattro. Nessuna di quelle pagine era rotta, erano semplicemente scritte male rispetto a una regola che qualcuno aveva scritto e che nessuno rileggeva.

Le tre cose da fare questa settimana

Tre cose si possono fare oggi, senza aspettare che gli strumenti maturino. La prima è scrivere le istruzioni che non devono perdersi in un file del repository invece che in chat, perché un CLAUDE.md o un AGENTS.md rientra nel contesto a ogni sessione mentre un messaggio di due ore fa no. La seconda è decidere quale comando deve fallire perché il lavoro si fermi, e verificare che fallisca davvero su un caso rotto costruito apposta. La terza è stabilire quale parte del diff si legge comunque a mano: autenticazione, pagamenti, cancellazioni e permessi sono il minimo sindacale, e sono anche la lista che consegno come punto di partenza quando progetto agenti AI su misura per qualcuno.

Un agente che controlla un altro agente è un miglioramento vero, e va preso per quello che è: recupera l'istruzione che si era persa, non garantisce che il risultato sia giusto. La garanzia resta dove è sempre stata, cioè in un controllo che o passa o si ferma, e in qualcuno che decide quale delle due cose deve succedere.

Domande frequenti

La Guardian review di Codex è attiva di default?

No. Le note di rilascio della versione 0.160.0 di Codex CLI definiscono la Guardian review una capacità opt-in, cioè va abilitata da chi usa lo strumento e non parte da sola dopo l'aggiornamento. Chi aggiorna e non tocca niente continua a lavorare esattamente come prima.

Come si attiva il mod You should know di Claude Code?

Il changelog di Claude Code indica il comando `/plugin enable cc-plugin-you-should-know@builtin`. La stessa riga precisa che il mod vale per le sessioni di prima parte con la telemetria attiva, quindi in un ambiente dove la telemetria è disattivata per policy aziendale non è detto che si possa usare.

L'AI può sostituire la revisione del codice fatta da una persona?

No, e i due controlli cercano cose diverse. Un revisore AI è bravo a notare che un pezzo di codice contraddice un'istruzione data prima o una convenzione scritta nel repository, perché quel confronto è meccanico. Decidere se una funzionalità vale la complessità che aggiunge resta una decisione di prodotto, e nessuno dei due strumenti usciti a ottobre 2026 prova a prenderla.

Serve ancora rileggere il diff riga per riga?

Serve, ma non su tutto il diff. La parte generata che tocca autenticazione, pagamenti, cancellazioni di dati e permessi va letta a mano sempre, perché è il punto in cui un errore non si manifesta come test rosso. Sul resto conviene spendere il tempo a scrivere il controllo automatico che intercetterebbe quell'errore la prossima volta.

Continua a leggere

ai-tools

Isolare un agente di intelligenza artificiale: dove conviene mettere il limite

NVIDIA ha pubblicato un runtime open source per agenti autonomi. Cosa cambia per chi deve isolare un agente di intelligenza artificiale.
ai-tools

Cos'è MCP, il protocollo con cui l'intelligenza artificiale parla con i vostri strumenti

MCP è lo standard aperto che collega l'intelligenza artificiale ai sistemi esterni. Cosa espone davvero un server MCP e quando non conviene.
ai-tools

Far costruire l'infrastruttura cloud a un agente AI: cosa gli stai dando in mano

Costruire infrastruttura cloud con un agente AI adesso lo configura il fornitore. Cosa installa il setup di AWS e con quali credenziali lavora.

Risorse pratiche su questi temi

Video

Estrarre il testo da un PDF e farlo leggere davvero all'AI

Estrarre il testo da un PDF in modo che l'AI lo legga davvero: come si fa gratis e in locale con AnyDoc, e cosa cambia con le scansioni.
Articolo

Le nuove regole del context engineering per i modelli Claude 5

L'articolo di Anthropic sul context engineering per i modelli Claude 5: cosa togliere dal prompt di sistema, dal CLAUDE.md e dalle skill.