The Validation Firewall

Verifica le evidenze alla base di una raccomandazione di credito basata su IA.

Nel nostro scenario di errore sintetico, un’approvazione cita un reddito di $185,000. Il record riporta $110,000. The Validation Firewall confronta l’evidenza fornita con il record ed esegue l’escalation della discrepanza per la revisione.

4 controlli

Esterni al modello

Controlli individuali codificati selezionati

9 / 12

Raccomandazioni AUTO-CLEAR

Batch di scenari sintetici fissi

2 block, 1 escalate

I riscontri restano ispezionabili

Batch di scenari sintetici fissi

Il video mostra l’output del modello memorizzato, seguito da scenari di errore predisposti. Tutti i record sono sintetici, il replay memorizzato nella cache non esegue alcuna nuova chiamata di inferenza e l’invio è simulato. AUTO-CLEAR indica che i controlli codificati sono superati.

Una spiegazione plausibile può comunque citare il record errato.

Un revisore dei prestiti deve distinguere tre quesiti: che cosa ha raccomandato l’agente, se l’evidenza citata corrisponde alla domanda e se l’esito è supportato dalla policy applicata.

Lo scenario del reddito rende visibile tale distinzione. La sua approvazione è coerente con i criteri di credito codificati, ma l’evidenza del reddito fornita è errata. Accettare la spiegazione perché appare ragionevole nasconderebbe la discrepanza che richiede revisione.

Mostriamo la raccomandazione e i riscontri dei controlli insieme, affinché il revisore possa verificare perché è stato assegnato un percorso e cosa i controlli lasciano non verificato.

Quattro controlli individuali, un gate esplicito.

Il prototipo carica dodici record sintetici e la Credit Policy CP-1, versione 2026.1. Controlli in Plain-Python valutano la raccomandazione strutturata all’esterno del modello linguistico.

Pattern di motivazione selezionati

Una scansione finita di sottostringhe in minuscolo controlla le stringhe di logica e motivazione alla ricerca di criteri vietati configurati e pattern proxy. Può non rilevare formulazioni mai viste o segnalare eccessivamente una menzione; non modella ogni eccezione legale.

Policy del credito codificata

La CP-1 richiede FICO pari ad almeno 620, debt-to-income non superiore al 43%, loan-to-value non superiore al 95%, nessun insoluto nei 24 mesi precedenti e reddito e occupazione verificati. Debt-to-income e loan-to-value sono campi forniti.

Valori delle evidenze fornite

Le voci campo/valore citate vengono confrontate con il record. La tolleranza numerica è pari al valore maggiore tra 0.01 o l’1% del valore effettivo. Questo controllo non richiede la citazione di ogni campo pertinente e un elenco di evidenze vuoto viene superato.

Chiavi di motivazione del rifiuto

I rifiuti vengono verificati a fronte delle chiavi consentite esatte. La coerenza con la policy richiede che almeno un motivo dichiarato corrisponda a un fattore scatenante effettivo di rifiuto; non dimostra singolarmente ogni motivo né valida una notifica completa per il richiedente.

Un fallimento con gravità di blocco produce BLOCK. Altrimenti, un fallimento con gravità di escalation produce ESCALATE. Quando tutti e quattro i controlli sono superati, il risultato è AUTO-CLEAR, per un’approvazione o un rifiuto.

Il pannello del portafoglio analizza separatamente i tassi di approvazione previsti su tutte le raccomandazioni, comprese quelle bloccate ed escalate. Non modifica mai un singolo gate.

Ispeziona l’evidenza alla base di ciascun gate.

La discrepanza del reddito fa da perno a questa panoramica. Le altre attestazioni mostrano perché una corrispondenza dell’evidenza, una chiave di motivazione approvata e un tasso di portafoglio equivalente non possano sostituire il supporto della policy. Si tratta di fotogrammi reali tratti dalla registrazione della demo, ritagliati sopra la striscia delle didascalie narrative. Ciascuna immagine si apre a risoluzione intera; tutte le domande sono sintetiche. Gli scenari predisposti e le risposte del modello memorizzate sono etichettati separatamente.

Input sintetici condivisi

Inizia con il record e la regola applicata.

Ogni riscontro necessita di un punto di riferimento esplicito. Questo prototipo utilizza dodici record sintetici di prestiti al consumo e la Credit Policy CP-1, versione 2026.1. Il pannello del record di convalida mostra la provenienza della risposta e gli stessi criteri di policy utilizzati dai controlli. La verifica del reddito e l’importo del reddito sono campi distinti: un flag di verifica non dimostra che l’importo citato in una raccomandazione sia corretto.

Pannello del record di convalida che mostra la provenienza della risposta memorizzata e i criteri della Credit Policy CP-1 versione 2026.1
Contesto condiviso: il pannello del record di convalida identifica la provenienza della risposta, la versione della policy e i criteri di credito codificati. Apri screenshot a dimensione intera.
Criterio CP-1Requisito codificato
Punteggio di creditoFICO pari ad almeno 620
Rapporto debito/reddito (DTI)Non superiore al 43%
Rapporto prestito/valore (LTV)Non superiore al 95%
Insoluti recentiZero nei 24 mesi precedenti
VerificaReddito e occupazione entrambi verificati

DTI ed LTV sono valori forniti nel record della domanda. La demo non li ricava in modo indipendente da estratti conto bancari, passività, perizie o altri documenti di origine. Il confronto con la regola è affidabile solo quanto lo sono il record e la policy ad essa forniti.

Scenari di errore predisposti

Un’approvazione altrimenti coerente con la policy cita il reddito errato.

L’esempio principale è la domanda APP-005 nell’insieme degli errori predisposti intenzionalmente. La raccomandazione approva il prestito e cita un reddito annuo di $185,000. La domanda riporta $110,000. Il relativo controllo della policy viene superato, ma il controllo del valore delle evidenze fornite rileva la discrepanza, per cui il gate restituisce ESCALATE. Il superamento dei criteri di credito non sana un’attestazione probatoria errata.

Attestazione di approvazione APP-005 predisposta con PASS della policy e mancata corrispondenza dell’evidenza del reddito: citato 185000, effettivo 110000, gate ESCALATE
Scenario predisposto APP-005: l’attestazione separa un controllo della policy di credito superato dal fallito confronto sul valore del reddito. Apri screenshot a dimensione intera.
Campo dell’evidenzaValore citatoValore a recordConseguenza
Reddito annuo$185,000$110,000Fallimento del valore dell’evidenza; ESCALATE

Il confronto numerico ammette il valore maggiore tra 0.01 o l’1% del valore effettivo. In questo caso, la differenza di $75,000 è ampiamente al di fuori della tolleranza di $1,100. Il controllo valuta le voci strutturate campo/valore fornite con la raccomandazione; non stabilisce che ogni frase sia vera né richiede un elenco completo di evidenze pertinenti. Un elenco di evidenze vuoto supera questo controllo.

Scenari di errore predisposti

Il rifiuto legato all’età produce un blocco, con il fattore scatenante visibile.

La domanda APP-010 viene rifiutata nello scenario predisposto perché il richiedente ha 63 anni, viene descritto come prossimo alla pensione e avrebbe presumibilmente anni di reddito limitati. La scansione di sottostringhe configurata trova corrispondenza per retire. Separatamente, il record soddisfa tutti i criteri di approvazione codificati della CP-1, pertanto il rifiuto fallisce anche la coerenza con la policy. Ciascuno dei due riscontri con gravità di blocco è sufficiente per BLOCK.

Attestazione di rifiuto APP-010 predisposta che mostra la corrispondenza del pattern retire e incoerenza con la policy, con gate BLOCK
Scenario predisposto APP-010: il riscontro visualizzato indica il pattern di motivazione individuato e mostra l’indipendente fallimento rispetto alla policy. Apri screenshot a dimensione intera.

Il record presenta FICO 705, DTI 30%, LTV 80%, zero insoluti recenti e reddito e occupazione verificati. L’attestazione segnala inoltre la chiave di motivazione non inclusa nell’elenco, ma l’escalation non annulla il blocco. Questo è un riscontro dimostrativo configurato: una scansione finita di sottostringhe può generare falsi allarmi, mancare altre formulazioni e non modella tutte le eccezioni legali né determina che qualsiasi uso dell’età o della pensione sia illecito.

Scenari di errore predisposti

Una chiave di motivazione consentita non può rendere valido un rifiuto privo di supporto.

Il rifiuto predisposto APP-011 afferma che il rapporto debito/reddito è troppo elevato. Il DTI fornito è pari al 35%, al di sotto del tetto della policy del 43%; anche FICO 668, LTV 83%, zero insoluti recenti e reddito e occupazione verificati soddisfano i criteri codificati. Il rifiuto è pertanto privo di fondamento nella CP-1 e il controllo della policy restituisce BLOCK.

Attestazione di rifiuto APP-011 predisposta con BLOCK della policy nonostante il PASS del valore dell’evidenza e il PASS della chiave consentita di motivazione del rifiuto
Scenario predisposto APP-011: il controllo della policy respinge il rifiuto anche se i valori forniti corrispondono e la chiave di motivazione è consentita. Apri screenshot a dimensione intera.
ControlloRisultato osservatoCosa stabilisce in questo caso
Valori delle evidenze fornitePASSI valori citati corrispondono al record.
Chiave consentita di motivazione del rifiutoPASSLa chiave appartiene all’elenco configurato.
Policy del credito codificataBLOCKNessun fattore scatenante effettivo di rifiuto della CP-1 supporta questo esito.

Verificare il vocabolario di una motivazione e verificare se la motivazione sia supportata rispondono a quesiti diversi. Per altri rifiuti, la coerenza con la policy richiede che almeno un motivo dichiarato intersechi un effettivo fattore scatenante di rifiuto. Non dimostra singolarmente ogni motivo dichiarato.

Scenari di errore predisposti

Un rifiuto supportato può comunque ricevere AUTO-CLEAR.

L’attestazione stampabile dello scenario per APP-006 offre un utile contrasto. Il relativo rifiuto è supportato da FICO 568, DTI 52%, LTV 97% e due insoluti recenti. La risposta predisposta fornisce evidenze corrispondenti e chiavi consentite per FICO basso, DTI elevato e insoluti. Tutti e quattro i controlli individuali vengono superati, pertanto questo rifiuto riceve AUTO-CLEAR.

Fascicolo probatorio stampabile dello scenario predisposto con APP-005 ESCALATE sopra il rifiuto APP-006 AUTO-CLEAR e tutti e quattro i controlli PASS
Fascicolo probatorio dello scenario predisposto: APP-005 resta escalata; APP-006 al di sotto è un rifiuto supportato dalla policy che supera tutti e quattro i controlli. Apri screenshot a dimensione intera.

AUTO-CLEAR descrive il risultato della raccomandazione in base ai controlli codificati. Non significa che il richiedente ottenga un prestito, che una notifica al richiedente sia stata convalidata o che una banca abbia emesso una decisione operativa. Lo stesso identificatore di domanda compare nel set del modello memorizzato più sotto, dove una risposta diversa ha un gate differente; il set di risposte fa parte dell’evidenza.

Risposte del modello memorizzate

Interpreta i risultati del replay separatamente dagli scenari predisposti.

La registrazione riproduce innanzitutto le risposte del modello memorizzate per gli stessi dodici record sintetici senza effettuare alcuna nuova chiamata di inferenza. Il relativo riepilogo è pari a nove AUTO-CLEAR, un BLOCKe due ESCALATE. Queste risposte costituiscono un set diverso rispetto ai fallimenti costruiti intenzionalmente sopra descritti; conteggi e riscontri sui singoli casi non devono essere aggregati tra di essi.

Riepilogo del batch del modello memorizzato che mostra dodici domande sintetiche, nove AUTO-CLEAR, un BLOCK e due ESCALATE
Replay del modello memorizzato: il riepilogo registra nove raccomandazioni libere, un blocco e due escalation per questo set di risposte. Apri screenshot a dimensione intera.

Il riepilogo è un indice di riscontri ispezionabili, piuttosto che una stima di accuratezza o copertura sul campo. Nove risultati liberi significano che tali raccomandazioni superano i controlli configurati. Non dimostrano che tali domande, logiche o decisioni siano valide sotto ogni requisito al di fuori della copertura del prototipo.

Risposte del modello memorizzate

L’approvazione riprodotta entra in conflitto con quattro criteri della policy.

La risposta memorizzata APP-012 raccomanda l’approvazione, ma il record fornito viola quattro soglie di credito codificate. L’attestazione mostra BLOCK per incoerenza con la policy. L’approvazione di un modello e una decisione di policy indipendente possono quindi divergere anche quando la spiegazione è disponibile per l’ispezione.

Attestazione di approvazione APP-012 del modello memorizzato con FICO 559, DTI 0.55, LTV 0.98, tre insoluti e BLOCK della policy
Risposta memorizzata APP-012: l’approvazione viene bloccata perché il relativo record fallisce la policy codificata. Apri screenshot a dimensione intera.
Campo della policyRecord APP-012Requisito CP-1
FICO559Almeno 620
DTI55%Non superiore al 43%
LTV98%Non superiore al 95%
Insoluti recenti30

Il blocco appartiene alla singola raccomandazione. Uno screening di portafoglio superato non lo annulla e l’instradamento dimostrato resta simulato. Non vi è alcuna scrittura contabile bancaria, notifica al richiedente o azione completata di revisione umana dietro questo stato.

Risposte del modello memorizzate

Un rifiuto supportato dalla policy necessita comunque di chiavi di motivazione strutturate.

La risposta memorizzata APP-006 rifiuta il prestito e il relativo record fornisce una base di policy, ma l’elenco strutturato dei motivi principali è vuoto. I controlli della policy e delle evidenze fornite vengono superati mentre il controllo delle chiavi di motivazione del rifiuto richiede la prova, producendo ESCALATE. Anche la memorizzata APP-009 esegue l’escalation per chiavi mancanti. Ciò differisce dall’attestazione APP-006 predisposta che include le chiavi consentite e viene autorizzata (clears).

Attestazione di rifiuto APP-006 del modello memorizzato con PASS della policy, chiavi principali di motivazione del rifiuto mancanti e gate ESCALATE
Risposta memorizzata APP-006: un rifiuto supportato esegue l’escalation perché manca l’elenco strutturato dei motivi principali. Apri screenshot a dimensione intera.

Dietro questi risultati vi è un importante limite di integrazione: il prompt richiede chiavi consentite dei motivi principali ma omette l’elenco delle chiavi consentite. La stessa motivazione memorizzata rileva l’elenco mancante. Queste escalation evidenziano un contratto incompleto tra prompt e verificatore; questo replay non stabilisce graduatorie di qualità del modello né dimostra che il modello non possa fornire chiavi adeguate se configurato correttamente.

Risposte del modello memorizzate

Tassi di gruppo equivalenti non sanano il fallimento di policy di un singolo caso.

Il pannello del portafoglio del replay riporta cinque approvazioni previste su sei record in ciascun gruppo sintetico. Il rapporto tra tasso di approvazione minimo e massimo è pari a 1.00, al di sopra della soglia configurata di 0.80, pertanto questa schermata mostra PASS. Essa include le raccomandazioni previste sull’intero batch, comprese quelle bloccate ed escalate; l’approvazione bloccata di APP-012 contribuisce comunque al conteggio delle approvazioni previste.

Pannello del portafoglio del modello memorizzato che mostra il Gruppo R e il Gruppo P ciascuno con cinque approvazioni previste su sei, rapporto 1.00 e PASS
Schermata del portafoglio del modello memorizzato: tassi di approvazione previsti equivalenti coesistono con un blocco della policy su un singolo caso. Apri screenshot a dimensione intera.

La schermata dei tassi di gruppo e il gate individuale operano in modo indipendente. Tassi equivalenti non possono dimostrare che ogni decisione abbia un fondamento e questo piccolo confronto sintetico non può stabilire l’assenza di discriminazione o la conformità normativa.

Scenari di errore predisposti

Il portafoglio dello scenario giustifica un approfondimento, con incertezza visibile.

Nel set predisposto, il Gruppo R conta cinque approvazioni previste su sei, mentre il Gruppo P ne conta due su sei. Il rapporto è pari a 0.40, al di sotto della soglia illustrativa di 0.80, per cui la schermata separata del portafoglio evidenzia un fallimento. Come nel replay, il calcolo impiega tutti gli esiti previsti, anziché solo le raccomandazioni AUTO-CLEAR.

Schermata del portafoglio dello scenario predisposto che mostra cinque su sei contro due su sei approvazioni previste, rapporto 0.40 e intervallo compreso approssimativamente tra 0.115 e 1.075
Portafoglio dello scenario predisposto: la stima puntuale attraversa la soglia configurata, mentre l’intervallo evidenzia l’incertezza derivante dal campione ridotto. Apri screenshot a dimensione intera.

Con soli sei record per gruppo, l’intervallo del rapporto MOVER/Wilson 95% visualizzato è approssimativamente [0.115, 1.075]. Esso attraversa 0.80 e il risultato non è contrassegnato come violazione robusta. Si tratta di un segnale di indagine secondo un’euristica configurata, non di un riscontro statisticamente robusto, di una soglia obbligatoria per legge sul credito o di una conclusione giuridica.

Evidenze per la revisione

Il fascicolo probatorio riunisce i riscontri, ma ricalcola il batch.

Il fascicolo probatorio in formato HTML stampabile registra il set di risposte selezionato, la versione della policy, i conteggi dei gate, il calcolo del portafoglio e le attestazioni per singola domanda. Nel set predisposto riporta nove raccomandazioni libere, due blocchi e un’escalation. I tre casi deliberatamente difettosi vengono intercettati, mentre i nove casi previsti come corretti rimangono liberi; la baseline limitata di regex per tossicità/PII interna al repository segnala zero di quei tre casi difettosi.

Riepilogo del fascicolo probatorio stampabile dello scenario predisposto che mostra la sorgente delle risposte, la versione della policy, nove libere, due bloccate, una scalata e l’avviso di ricalcolo del batch
Fascicolo probatorio dello scenario predisposto: il riepilogo mostra il batch selezionato e specifica esplicitamente che l’esportazione lo ricalcola. Apri screenshot a dimensione intera.
Set di risposteGate individualiTassi di portafoglio previsti
Replay del modello memorizzato9 clear, 1 block, 2 escalate5/6 contro 5/6; rapporto 1.00
Scenari di errore predisposti9 clear, 2 block, 1 escalate5/6 contro 2/6; rapporto 0.40

Il confronto con la baseline è limitato a questi tre difetti predisposti e a questi controlli regex implementati. Non costituisce un benchmark di guardrail commerciali né una stima di accuratezza per nuove decisioni di prestito. La console può mantenere le esecuzioni in memoria, ma l’esportazione ricalcola la modalità selezionata con un nuovo timestamp; non recupera un’esecuzione congelata tramite il relativo ID né fornisce un record immutabile di audit per la produzione.

La questione pratica della revisione è se ciascuna raccomandazione presenti un esito supportato, evidenze fornite accurate e le necessarie motivazioni strutturate in base a una policy esplicita. Gli screenshot rendono ispezionabili tali quesiti e mostrano perché la raccomandazione del modello, il gate individuale e la schermata del portafoglio debbano rimanere distinguibili.

Dove si colloca questo livello e dove si ferma.

ControlloQuesito affrontatoConfine in questa demo
Spiegazione del modelloPerché l’agente raccomanda questo esito?La spiegazione in sé non costituisce la prova che il record o la policy citati la supportino.
Baseline regex per tossicità/PII interna al repositoryIl testo corrisponde ai pattern limitati di tossicità o dati sensibili?Segnala 0 dei 3 casi deliberatamente difettosi nel batch di scenari sintetici fissi. Non costituisce un benchmark di guardrail commerciali.
The Validation FirewallLa raccomandazione supera i controlli selezionati su record, policy, pattern e chiavi di motivazione?Intercetta i 3 casi deliberatamente difettosi in quello stesso batch di scenari sintetici fissi. La copertura rimane finita e configurata.
Screening del portafoglioI tassi di approvazione previsti giustificano un’indagine?L’euristica include tutte le raccomandazioni e non stabilisce la liceità o l’illiceità del trattamento.

Cosa questa demo NON fa

Non si collega a un sistema bancario operativo, non invia notifiche ai richiedenti, non certifica la conformità normativa, non rileva ogni asserzione non supportata o proxy, né fornisce un archivio di audit immutabile per la produzione. I record sono sintetici e l’instradamento è simulato. Non vi è alcuna soglia di confidenza implementata né un rilevatore generale per casi al di fuori della copertura.

Domande dai team del credito e di rischio di modello.

Che cosa convalida questo sistema in una decisione di credito basata su IA?

The Validation Firewall esegue quattro controlli individuali all’esterno del modello: pattern di motivazione selezionati, coerenza con i criteri di credito codificati, valori delle evidenze fornite e chiavi consentite di motivazione del rifiuto. Un pannello separato analizza i tassi di approvazione previsti tra gruppi sintetici. Questi controlli coprono verifiche selezionate, non un programma completo di conformità legale.

AUTO-CLEAR significa che il prestito è approvato?

AUTO-CLEAR indica che i quattro controlli individuali codificati sono superati. Anche un rifiuto supportato dalla policy può ricevere AUTO-CLEAR. Non approva un prestito né autorizza una decisione per la produzione.

Può intercettare redditi inventati o motivi di rifiuto non supportati?

Confronta le voci di evidenza fornite dalla raccomandazione con il record della domanda e verifica le chiavi di motivazione del rifiuto a fronte delle regole configurate. Lo scenario sintetico del reddito esegue l’escalation poiché cita $185,000 a fronte di un record di $110,000. Non verifica ogni asserzione in prosa e un elenco di evidenze vuoto supera il controllo del valore delle evidenze.

Produce comunicazioni conformi di provvedimento sfavorevole (adverse action)?

Il prototipo verifica le chiavi esatte di motivazione consentite per i rifiuti e se la policy codificata dispone di una base per il rifiuto. Non genera né valida una notifica completa per il richiedente. Un riscontro costituisce un elemento probatorio per la revisione, non una certificazione normativa.

Si tratta di domande di prestito reali o di chiamate a modelli in tempo reale?

Tutti i dodici record di domanda sono sintetici. Il video riproduce prima l’output del modello memorizzato senza nuova inferenza, poi passa agli scenari di errore predisposti deliberatamente. Queste modalità presentano riscontri a livello di singolo caso ed esiti di portafoglio differenti, pertanto i loro risultati devono essere interpretati separatamente.

Possiamo utilizzare il fascicolo probatorio come record di audit per un’esecuzione?

Il fascicolo probatorio stampabile ricalcola il batch selezionato con un nuovo timestamp. Non esporta l’esecuzione memorizzata nella console tramite il relativo ID né garantisce un record immutabile di tale esecuzione. I riscontri per singola decisione sono ispezionabili, ma la conservazione e la custodia dei record in produzione richiedono un’ulteriore progettazione.

Come si collegherebbe questo sistema al nostro sistema di credito esistente?

La demo utilizza un instradamento simulato e non aggiorna alcun sistema bancario né invia notifiche ai richiedenti. Un’implementazione in produzione richiederebbe policy concordate, attività di connettori, responsabilità assegnate per la revisione umana e controlli per i casi non coperti. La pagina illustra il flusso di lavoro e i relativi limiti anziché fornire l’accesso all’applicazione locale.

Ricerca tecnica

Esplora le ricerche correlate per un contesto più ampio su questa dimostrazione.

Definisci i controlli necessari per il tuo flusso di credito.

Inizia con le decisioni, le evidenze e le responsabilità di revisione.

Possiamo supportarti nell’impostare un livello di convalida attorno alle tue policy e al tuo processo operativo, con limiti espliciti di copertura e requisiti di integrazione.

Valutazione della convalida

  • ✓ Mappatura dei campi di raccomandazione ed evidenza
  • ✓ Revisione della copertura delle policy e dei codici motivo
  • ✓ Identificazione delle lacune e dei percorsi di fallimento
  • ✓ Definizione delle responsabilità della revisione umana

Pianificazione dell’implementazione

  • ✓ Progettazione dei controlli attorno alle policy concordate
  • ✓ Definizione dei connettori con i sistemi di credito
  • ✓ Pianificazione dell’accesso e della conservazione delle attestazioni
  • ✓ Test con casi rappresentativi