Un agente AI in produzione si rompe quasi mai sul modello. Si rompe attorno: negli errori che si sommano passo dopo passo, nei costi che nessuno aveva previsto e nei controlli che mancano nel punto in cui l’agente agisce sul mondo. Quasi tutto ciò che segue vale per qualunque azienda che metta un agente a lavorare davvero, non solo in una demo.
Che cosa significa «in produzione»
Un agente è in produzione quando agisce senza che qualcuno guardi ogni passo: legge, decide, scrive, chiama altri strumenti. In quel momento ogni errore smette di essere una risposta sbagliata in una chat e diventa un effetto: un messaggio partito, un dato cambiato, una spesa fatta.
Cosa dicono i numeri: 40% di progetti cancellati, 130 fornitori veri
Gartner prevede che più del 40% dei progetti di agentic AI sarà cancellato entro la fine del 2027, per costi crescenti, valore di business poco chiaro e controlli del rischio inadeguati. Nessuna delle tre cause è un limite del modello.
La stessa analisi stima che, fra le migliaia di fornitori che dicono di vendere soluzioni agentiche, solo circa 130 offrano davvero funzioni agentiche: il resto è un chatbot o un’automazione rinominata. Prima di chiedersi cosa si rompe, conviene chiedersi se quello che si è comprato è un agente.
1. Gli errori si sommano
Anthropic, nella guida Building effective agents, lo scrive in una riga: la natura autonoma degli agenti significa «higher costs, and the potential for compounding errors», cioè costi più alti e la possibilità che gli errori si sommino. Un workflow fisso sbaglia in un punto preciso. Un agente che decide da solo il passo successivo può costruire il secondo errore sopra il primo.
Cosa fare: mettere un limite alle iterazioni. La stessa guida indica condizioni di arresto, come un numero massimo di iterazioni, «to maintain control».
2. Gli strumenti sono usati male prima che il modello sbagli
Sempre Anthropic racconta un caso istruttivo: un agente sbagliava i percorsi dei file quando usava uno strumento. Invece di correggere il prompt, hanno cambiato lo strumento perché richiedesse sempre percorsi assoluti, e il modello ha usato quel metodo, nelle loro parole, «flawlessly». La lezione: un errore ripetuto è spesso un difetto dello strumento, non dell’intelligenza dell’agente. Si cura cambiando lo strumento, non scrivendo più avvertenze.
3. Un divieto scritto in un prompt non ferma niente
Un agente che legge pagine web, email o documenti legge anche istruzioni che qualcun altro ha messo lì. Per questo il limite non va nel testo che l’agente legge, ma nei permessi che l’agente ha. Se non possiede lo strumento per inviare un’email a nome tuo, nessuna istruzione nascosta può fargliela inviare. Un approfondimento sul tema: il caso del modello che decide e non parla.
4. Ciò che non si misura, si rompe in silenzio
Un agente che non avvisa quando fallisce sembra funzionare. Per questo i controlli contano quanto l’agente. Io lavoro con 32 agenti specializzati e 95 procedure scritte; attorno a loro, al 5 ottobre 2026, ci sono 126 organi automatici a orario, 17 controlli automatici (hook) e 231 file di test automatici. Le lezioni scritte in memoria dopo gli errori sono oggi 2.786.
Sono numeri miei, misurati oggi: non provano che il sistema sia perfetto, dicono quanto lavoro di guardia sta attorno agli agenti. Il rapporto è chiaro: gli agenti sono 32, i meccanismi che li sorvegliano sono molte volte di più. Come tengo la memoria che sta sotto tutto questo l’ho raccontato nel second brain con Obsidian e Claude Code.
Checklist prima di mettere un agente in produzione
- Un tetto alle iterazioni e un punto in cui l’agente si ferma e chiede a una persona.
- Prove in ambiente isolato prima del mondo reale: Anthropic raccomanda test estesi in sandbox, con le protezioni adeguate.
- Permessi minimi: ciò che l’agente non deve fare non deve poterlo fare.
- Strumenti con regole chiare: parametri a prova di errore, messaggi d’errore leggibili.
- Un conto dei costi prima di partire, e un indicatore di valore che dica se serve.
- Allarmi che scattano da soli: un controllo sempre verde senza prova di aver misurato non protegge.
Domande frequenti
Un agente AI è più rischioso di un’automazione classica?
Sì, nel senso che decide da solo i passi, e quindi i suoi errori possono sommarsi. Per compiti con percorso fisso un workflow resta spesso la scelta più sicura, e ne ho scritto per i casi pratici in AI agent per lead generation con n8n e Claude.
Quanti progetti di agenti falliscono?
Gartner prevede la cancellazione di oltre il 40% dei progetti agentici entro fine 2027. È una previsione di analisti, non una misura sui miei progetti.
Da dove si comincia?
Da un compito piccolo, reversibile e misurabile, con un punto di controllo umano. Il resto si aggiunge quando i controlli reggono. Per chi vuole partire dall’automazione di base c’è il confronto n8n, Make e Zapier per PMI italiane.
Fonti: Anthropic, Building effective agents; Gartner, previsioni sull’agentic AI, riprese da RCR Wireless. I numeri sul mio sistema sono misurati il 5 ottobre 2026.














