
Tutte le IA hanno sbagliato la stessa domanda fiscale — e nessuno se n'è accorto prima di controllare la legge
Era un martedì sera e stavo fissando tre schede del browser — ChatGPT, Claude, Gemini — che mi dicevano tutte la stessa cosa. Tutte e tre avevano torto.
La domanda era abbastanza semplice: in base al nuovo Omnibus Budget Reconciliation Act, un contribuente può detrarre gli interessi su un prestito auto personale? Tutti i modelli hanno risposto di sì. Ciascun modello ha spiegato la disposizione correttamente — le date, i requisiti del veicolo, persino i limiti di reddito. E ogni modello ha collocato la detrazione nella sezione sbagliata del codice tributario, il che significava che la consulenza finanziaria a valle era del tutto errata.
Non leggermente impreciso. Non «beh, dipende dall'interpretazione». Semplicemente sbagliato. Il tipo di errore che, se seguito da un commercialista, innescherebbe un accertamento fiscale dell'IRS. Il tipo di errore che potrebbe costare a un pensionato migliaia di dollari in sovrapprezzi imprevisti sui premi Medicare. E la parte terrificante? Se non conoscevi già la risposta, non te ne saresti mai accorto. L'IA sembrava perfetta.
Quel momento ha cambiato il mio modo di considerare l'IA nella conformità. Non perché fossi sorpreso che un modello linguistico allucinasse — sappiamo tutti che accade. Ciò che mi ha scosso è stato il fatto che tutti e tre hanno allucinato esattamente nello stesso modo, per la stessa identica ragione. Avevano appreso la risposta sbagliata da Internet, e Internet era così uniformemente errato che non rimaneva alcun segnale affinché i modelli potessero autocorregersi.
Abbiamo iniziato a chiamare questo fenomeno l'errore di consenso. E una volta compreso, non potevamo più ignorarlo.
Cos'è l'errore di consenso e perché dovrebbe interessarvi?
La maggior parte di chi lavora con l'IA ha familiarità con le allucinazioni — momenti in cui un modello inventa una citazione, fabbrica una statistica o afferma con sicurezza qualcosa che non è vero. Sono allarmanti, ma anche alquanto casuali. Spesso è possibile individuarle perché stonano, o perché una rapida ricerca su Google rivela la falsificazione.
L'errore di consenso è diverso. È ciò che accade quando un'IA fornisce una risposta errata non perché manchi di dati, ma perché i dati su cui è stata addestrata sono massicciamente e fiduciosamente errati. Il modello non sta tirando a indovinare nel buio. Vi sta riflettendo l'opinione maggioritaria di Internet — e l'opinione maggioritaria si dà il caso sia giuridicamente falsa.
Quando è Internet stesso a sbagliare, ogni IA addestrata su di esso eredita la stessa illusione. L'errore di consenso non è un bug — è una caratteristica intrinseca di come apprendono i modelli linguistici.
Pensate per un momento alla logica matematica. Se il 90% degli articoli sul web relativi a una determinata disposizione fiscale la descrive in modo errato — usando un linguaggio semplificato, fondendo due diverse sezioni del codice o semplicemente copiando gli errori altrui —, i pesi interni del modello convergono sulla risposta errata con un livello elevato di sicurezza. Anche se la legge effettiva è presente nei dati di addestramento, essa compare una o due volte in un linguaggio giuridico denso, mentre l'interpretazione errata compare migliaia di volte in una prosa accessibile e ottimizzata per la SEO.
Il modello fa ciò per cui è stato progettato: predire il prossimo token più probabile. E il token più probabile è quello sbagliato.
La detrazione per il prestito auto che ha mandato in tilt tre IA

Permettetemi di guidarvi attraverso il caso specifico, perché i dettagli contano.
L'OBBBA ha creato una nuova categoria denominata «Qualified Passenger Vehicle Loan Interest» — una detrazione temporanea per gli interessi pagati sui prestiti per veicoli passeggeri nuovi assemblati negli Stati Uniti, disponibile per gli anni fiscali dal 2025 al 2028. Fin qui, tutto bene. Ogni IA ha azzeccato questa parte.
Ecco dove tutto crolla. La detrazione è stata aggiunta alla IRC Section 63, che disciplina il reddito imponibile. Non è stata aggiunta alla IRC Section 62, che disciplina il reddito lordo rettificato (AGI). In ambito fiscale, questa distinzione è fondamentale.
Una deduzione della Section 62 — «above the line» — riduce l'AGI. L'AGI determina l'idoneità a decine di altri benefici: piani di rimborso dei prestiti studenteschi, soglie minime per la detrazione delle spese mediche, tassazione delle prestazioni di sicurezza sociale, sovrapprezzi sui premi Medicare. Abbassare l'AGI sblocca una cascata di risparmi a valle.
Una detrazione della Section 63 — «below the line» — riduce il reddito imponibile. Fa comunque risparmiare sull'imposta federale, ma non ha alcun effetto sull'AGI. Nessuno di questi benefici a valle ne viene influenzato.
Tutti i principali LLM hanno detto agli utenti che questa detrazione avrebbe ridotto il loro AGI. Tutti quanti. Perché questo è ciò che diceva l'ecosistema dei contenuti finanziari. Guide ampiamente condivise e articoli ottimizzati per la SEO titolavano «Gli interessi sui prestiti auto sono ora deducibili!» senza specificare dove si applicasse nel calcolo delle imposte. La distinzione tra Section 62 e Section 63 è apparentemente troppo noiosa per i creatori di contenuti che ottimizzano per i clic.
Ma per il contribuente che segue questo consiglio? Le conseguenze sono concrete.
Un pensionato che dichiara erroneamente un AGI inferiore potrebbe subire sovrapprezzi IRMAA imprevisti su Medicare. Un mutuatario con un piano di rimborso del prestito studentesco basato sul reddito potrebbe perdere l'idoneità a rate più basse. Un contribuente in uno Stato come l'Arizona, che collega l'imposta sul reddito all'AGI federale, potrebbe affrontare un accertamento statale. Ho descritto l'intera cascata di conseguenze finanziarie nella versione interattiva della nostra ricerca — gli effetti a catena sono peggiori di quanto la maggior parte delle persone immagini.
Perché la RAG non ha risolto questo problema?
Posso già sentire l'obiezione: «Basta usare la RAG. Recupera la legge effettiva. Problema risolto.»
Ci abbiamo provato. Non l'ha risolto.
La Retrieval-Augmented Generation (RAG) — la tecnica con cui si inseriscono documenti pertinenti nella finestra di contesto del modello insieme alla domanda dell'utente — è l'attuale risposta del settore alle allucinazioni. E per molti casi d'uso aiuta. Ma per il ragionamento giuridico presenta tre debolezze strutturali che sono emerse immediatamente nei nostri test.
In primo luogo, la legislazione fiscale non si legge come una narrazione. L'OBBBA non dice «questa è una detrazione below-the-line». Dice «la Section 163(h) è modificata inserendo dopo il paragrafo (3) il seguente nuovo paragrafo...». Il modello deve ricostruire lo stato logico del codice fiscale da una serie di emendamenti. Quando il frammento recuperato dice «detrazione consentita» ma non indica esplicitamente la sua posizione nel flusso di calcolo, il modello colma il vuoto con il proprio bias di addestramento — gli articoli dei blog.
In secondo luogo, la ricerca vettoriale trova ciò che è simile, non ciò che è rilevante per omissione. Una query sulle detrazioni per prestiti auto recupera paragrafi sulle detrazioni per prestiti auto. Non recupera il paragrafo della Section 62 che definisce l'AGI — perché quel paragrafo non menziona i prestiti auto. Semplicemente li esclude non inserendoli nell'elenco. Nel diritto, l'assenza di qualcosa da un elenco ha valore normativo. Nella ricerca per similarità vettoriale, l'assenza è invisibile.
In terzo luogo — e questo è il punto che non mi fa dormire la notte —, la RAG risolve il recupero, non il ragionamento. Si può mettere la legge corretta davanti al modello, e questo continuerà a interpretarla male se i suoi pesi interni sono deviati da milioni di esempi di addestramento errati. Diventa un lettore prevenuto, che vede ciò che si aspetta di vedere anziché ciò che il testo dice realmente.
La RAG mette il documento giusto davanti all'IA. Ma un lettore prevenuto con il libro giusto giunge comunque alla conclusione sbagliata.
Dopo settimane passate a testare diverse strategie di recupero, dimensioni dei frammenti e configurazioni di prompt, il mio team ha avuto una discussione che ha chiarito tutto. Uno dei nostri ingegneri voleva continuare a perfezionare la pipeline RAG — embeddings migliori, suddivisione in blocchi più precisa, istruzioni esplicite di «usare solo il testo recuperato». La nostra consulente legale lo ha guardato e ha detto: «Stai cercando di fare un paio di occhiali migliori per qualcuno che non sa fare la matematica.» Aveva ragione. Il problema non era ciò che il modello poteva vedere. Era ciò su cui il modello poteva ragionare.
Cosa succede quando l'IA interpreta male la legge?
Il caso dell'OBBBA include anche regole di riduzione progressiva (phase-out) che aggravano il problema. La detrazione ha un tetto massimo di 10.000 dollari all'anno ed è ridotta di 200 dollari per ogni 1.000 dollari con cui il reddito del contribuente supera i 100.000 dollari (dichiaranti singoli) o i 200.000 dollari (dichiarazioni congiunte). Rispettivamente a 150.000 o 250.000 dollari, la detrazione svanisce del tutto.
Quando abbiamo testato questo scenario con un contribuente ipotetico che guadagna 125.000 dollari, i modelli hanno faticato. Alcuni hanno ignorato completamente il phase-out. Altri hanno applicato una curva di riduzione presa in prestito dal Child Tax Credit — una disposizione del tutto diversa con calcoli differenti. I modelli eseguivano un pattern matching su strutture familiari anziché calcolare la regola effettiva.
Questo è il problema dell'«allucinazione aritmetica» sovrapposto all'errore di consenso. Il modello non sbaglia solo l'inquadramento giuridico — sbaglia anche i calcoli. E quando si comprimono questi modelli per una distribuzione efficiente tramite quantizzazione, le capacità di ragionamento si degradano più velocemente di quelle linguistiche. Il modello appare più sicuro di sé diventando al contempo meno accurato. Questa è una combinazione pericolosa in qualsiasi ambito. Nella conformità fiscale, è un grave rischio.
C'è un'altra dimensione che la maggior parte delle persone trascura del tutto. L'OBBBA ha anche creato la Section 6050AA, che impone nuovi obblighi di rendicontazione ai finanziatori. Qualsiasi azienda che riceva 600 dollari o più di interessi su un prestito per veicoli qualificati deve presentare una dichiarazione informativa all'IRS. Quando abbiamo chiesto ai modelli cosa debbano fare banche e cooperative di credito in merito alla nuova legge, si sono concentrati quasi esclusivamente sulla detrazione del mutuatario — perché è di questo che scriveva l'ecosistema dei contenuti. L'obbligo di conformità del finanziatore è stato a malapena recepito. Per un'azienda fintech che utilizza l'IA per riassumere i cambiamenti normativi, tale omissione potrebbe tradursi in una non conformità sistematica e in sanzioni ai sensi delle sezioni 6721 e 6722 dell'IRC.
L'architettura che funziona davvero

Dopo la débâcle del prestito auto, ho trascorso un mese convinto che l'intero approccio basato sull'uso dei modelli linguistici per la conformità fosse fondamentalmente errato. Poi abbiamo costruito qualcosa che mi ha fatto cambiare idea — non sui LLM, ma su come dovrebbero essere utilizzati.
L'intuizione è stata semplice, una volta compresa: smettere di chiedere all'IA di ragionare sulla legge. Lasciarle fare ciò in cui è brava — comprendere il linguaggio — e affidare il ragionamento a qualcosa che sappia davvero applicare la logica.
Questa è l'idea fondamentale alla base dell'IA neuro-simbolica: un'architettura ibrida che combina la fluidità linguistica delle reti neurali con il rigore deterministico dei sistemi di logica simbolica. Abbiamo sviluppato quello che chiamiamo un Deterministic Tax Engine, e funziona in tre stadi.
Il primo stadio è l'Intent Parser. È qui che opera il LLM, facendo ciò che i LLM sanno fare meglio. Un utente carica una fattura, scrive una domanda o collega un flusso bancario. Il livello neurale estrae entità strutturate: tipo di veicolo, data di acquisto, importo del prestito, luogo di assemblaggio, reddito del contribuente. Non decide nulla sul trattamento fiscale. Si limita a tradurre la disordinata realtà umana in dati puliti.
Il secondo stadio è il Truth Anchor. È qui che subentra il livello simbolico. Codifichiamo il codice fiscale — non come testo da «leggere», ma come logica eseguibile utilizzando linguaggi specializzati come Catala (sviluppato da INRIA per l'amministrazione fiscale del governo francese) e PROLEG (un sistema di ragionamento giuridico basato su Prolog). La legge diventa un programma. Il Truth Anchor interroga un Knowledge Graph, applica le regole codificate, verifica i fatti mancanti e calcola il risultato deterministico. Se il veicolo è stato assemblato in Messico, la detrazione viene negata. Se il reddito supera la soglia di phase-out, la riduzione viene calcolata al centesimo. Nessuna probabilità. Nessuna supposizione.
Il terzo stadio è il Response Generator. Un altro livello neurale, ma vincolato. Riceve l'output del risolutore logico — «Detrazione: NEGATA. Motivo: Phase-out superato al livello di reddito di $135.000» — e lo traduce in un linguaggio chiaro e leggibile per l'uomo. Il LLM rende la risposta leggibile. Ha zero libertà di rendere la risposta diversa.
Non chiediamo all'IA di indovinare la legge. Le insegniamo a calcolare la legge. Il livello neurale gestisce il linguaggio. Il livello simbolico gestisce la verità. Nessuno dei due cerca di fare il lavoro dell'altro.
Questo disaccoppiamento è ciò che elimina l'errore di consenso. Il livello neurale potrebbe «sapere» dal suo addestramento che i siti finanziari popolari affermano che gli interessi sui prestiti auto riducono l'AGI. Ma non gli viene mai chiesto di prendere tale decisione. Gli viene solo chiesto di estrarre i dettagli del veicolo. La decisione risiede nel livello simbolico, che non ha accesso a Reddit — solo alla legge codificata.
Per l'architettura tecnica completa e l'analisi formale, compreso il modo in cui Catala gestisce la logica di eccezione predefinita e come Answer Set Programming verifica la coerenza nell'intera dichiarazione dei redditi, abbiamo pubblicato un documento di ricerca dettagliato.
Perché questo conta al di là di una singola detrazione fiscale?
Sarò onesto su una cosa. Quando ho iniziato a spiegare l'errore di consenso alle persone, la risposta più comune è stata: «Va bene, ma questo è un caso limite. La maggior parte delle volte l'IA fa le cose per bene.»
Tale risposta fraintende la natura del problema. La detrazione per il prestito auto dell'OBBBA non è speciale. È tipica. Ogni volta che il Congresso approva una nuova disposizione, l'ecosistema dei contenuti genera migliaia di interpretazioni semplificate, a volte errate, prima ancora che l'IRS pubblichi le proprie linee guida. Ogni volta che uno Stato si dissocia dal trattamento fiscale federale, Internet resta indietro. Ogni volta che una sentenza modifica l'interpretazione di una legge esistente, la vecchia interpretazione persiste nei dati di addestramento per anni.
L'errore di consenso non è un caso limite. È lo stato predefinito per qualsiasi area del diritto che sia complessa, recentemente modificata o scarsamente compresa da redattori generalisti. Vale a dire: la maggior parte del diritto tributario.
L'implicazione più ampia riguarda ciò che ci aspettiamo dall'IA in settori ad alto rischio. Il paradigma attuale — dare al LLM più contesto, prompt migliori, finestre più ampie — è un miglioramento incrementale su un'architettura fondamentalmente inadeguata. Si chiede a un motore di pattern matching di fare ragionamento formale. A volte è fortunato. Nella conformità fiscale, «a volte» non è abbastanza.
Da scatola nera a scatola trasparente
C'è un'altra cosa che conta enormemente per chiunque si sia mai seduto di fronte a un revisore dei conti: la tracciabilità.
Quando un LLM standard dice a un contribuente «sì, puoi detrarlo», e l'IRS in seguito dissente, qual è la traccia di audit? Il modello ha previsto che «sì» fosse il prossimo token più probabile dato il contesto. Questa non è una risposta che si può presentare a un funzionario del fisco.
Nel nostro motore neuro-simbolico, ogni determinazione produce un percorso nel grafo:
Deduction_Allowed = True perché Loan_Date rientra nell'intervallo 2025–2028 (verificato), Vehicle_Type è Passenger (verificato), Assembly_Location è US (verificato), Income è al di sotto della soglia di phase-out (verificato), Rule_Reference è IRC § 163(h)(4).
Ogni nodo di tale catena è controllabile. Ogni fatto può essere ricondotto a un documento di origine. Ogni regola può essere ricondotta a una specifica sezione del codice. Se qualcosa cambia — una nuova risoluzione dell'IRS, una disposizione modificata —, si aggiornano il Knowledge Graph e il risolutore logico, e ogni decisione interessata viene automaticamente contrassegnata per la revisione.
Questo trasforma l'IA da qualcosa in cui dover credere per fede in qualcosa che si può verificare su richiesta. Le persone mi chiedono sempre se questo approccio sia più lento o più costoso rispetto al semplice utilizzo di un LLM. La risposta onesta: la codifica iniziale della legge richiede un lavoro reale. Ma una volta codificata, l'esecuzione di una determinazione è quasi istantanea e il costo del controllo del 100% delle transazioni si avvicina al costo del controllo dell'1%. Non si tratta di un miglioramento marginale rispetto ai tradizionali audit basati su campionamento. È una categoria di garanzia completamente diversa.
La domanda che nessuno sta ancora ponendo
Ecco cosa mi preoccupa di più. Il settore dei servizi finanziari fa a gara per implementare assistenti IA, preparatori fiscali IA, monitor di conformità IA. Il marketing dice «basato sull'IA». I caratteri minuscoli dicono «non costituisce consulenza fiscale». E nel mezzo, milioni di persone ricevono risposte che sembrano autorevoli, citano normative reali, fanno riferimento a date e importi precisi in dollari — e collocano la detrazione nella sezione sbagliata del codice tributario.
Non siamo in un mondo in cui l'IA sbaglia in modo palese e gli esseri umani possono accorgersene. Siamo in un mondo in cui l'IA sbaglia in modo sottile, con modalità la cui individuazione richiede una profonda competenza di settore. Questo è più pericoloso di un fallimento evidente, perché erode l'istinto di effettuare un doppio controllo.
La questione non è se l'IA debba essere utilizzata nella conformità fiscale. Deve esserlo assolutamente — la complessità del codice ha superato la capacità umana di applicarlo in modo coerente. La questione è se siamo disposti a costruire sistemi di IA che rispettino la natura del settore in cui operano. Il diritto tributario è deterministico. Ha risposte giuste e risposte sbagliate, definite dalla legge e non dall'opinione comune. Un'architettura che tratta la verità giuridica come una distribuzione di probabilità sarà sempre vulnerabile all'errore di consenso, per quanto grande sia il modello o brillante il prompt.
Nel diritto tributario, la popolarità non è indice di verità. Una risposta ripetuta diecimila volte su Internet non è più corretta della legge che la contraddice una sola volta.
Abbiamo fondato Veriprajna perché credo che l'era del «fidati, ma verifica» sia già finita per l'IA nella conformità. I sistemi che conquisteranno la fiducia delle aziende saranno quelli che prima verificano e poi parlano — quelli in cui la logica è verificabile, la matematica è deterministica e la sicurezza dell'IA è supportata da qualcosa di più duraturo della probabilità dei token.
La legge non si cura di ciò che pensa Internet. Neanche la vostra IA dovrebbe farlo.


