Sottoscrizione del rischio alluvionale basata sull'IA
FloodProof prende un portafoglio reale di sinistri alluvionali NFIP e dimostra che un composito di attributi edilizi reali classifica le perdite meglio della zona alluvionale FEMA, sottopone a audit ogni variabile tariffata per impatto disparato rispetto a demografia censuaria reale, e assembla il pacchetto di istanza al DOI pronto per l'esaminatore. Quando una variabile fallisce la regola dell'80%, un cancello di policy deterministico rifiuta di marcare l'istanza come pronta e instrada il peggior trasgressore a una giustificazione attuariale umana.
1.69x
Lift out-of-sample sulla zona FEMA nella cattura delle perdite del decile superiore
40,615 sinistri NFIP reali held-out, Gini 0.31 vs 0.08
$3.1B
Dollari reali pagati su sinistri edilizi al di fuori delle zone FEMA ad alto rischio (45.9%)
Questo portafoglio Harris County, TX, non modellato
NOT FILING-READY
Il cancello ha bloccato la propria istanza quando 5 variabili tariffate hanno fallito la regola dell'80%
Il punteggio composito stesso supera il test con AIR 0.938
Ogni cifra viene ricalcolata in tempo reale da dati pubblici reali a ogni esecuzione. Attribuiscile a questo portafoglio Harris County e a questa suddivisione held-out, non come garanzia a mondo aperto.
Una tariffazione alluvionale che si ancora alla Zona AE vs Zona X è una domanda a livello di proprietà a cui si risponde con una mappa.
Ancorare una tariffa alluvionale alla zona alluvionale FEMA sovraccarica la casa rialzata all'interno della zona e sottostima la casa con fondazione a platea al di fuori di essa. L'esposizione reale del carrier è una domanda a livello di proprietà a cui la mappa delle zone non può rispondere. In questo portafoglio reale Harris County, $3.1B (45.9%) dei dollari di sinistri edilizi sono stati pagati su proprietà che la FEMA aveva classificato al di fuori delle sue zone Special Flood Hazard Area ad alto rischio. È un risultato che emerge direttamente dai dati, senza alcun modello coinvolto.
La risposta di mercato è stata comprare un modello migliore. Ma un fattore di tariffazione più intelligente è solo metà del lavoro. Qualsiasi tariffa potenziata dall'IA deve ora superare una revisione di equità del Department of Insurance, perché un fattore che classifica bene le perdite può anche portare segnale demografico e fallire la regola dell'80% dell'EEOC, spedendo una tariffa discriminatoria che l'esaminatore respingerà. La Circolare DFS di New York 2024-7 richiede test di discriminazione per proxy, il Colorado richiede una giustificazione per variabile per le tariffe assicurative guidate dall'IA, e il NAIC AI Model Bulletin è stato adottato da 24 o più stati. Un modello migliore che si auto-valuta non è evidenza, e un modello migliore che porta segnale demografico è un'istanza che viene rimandata indietro.
L'ingegneria duratura è l'infrastruttura intorno al modello: un backtest non circolare, un audit di equità su ogni variabile tariffata, e un cancello che produce il pacchetto di istanza dell'esaminatore oppure rifiuta di farlo. Questo è ciò che abbiamo costruito e ciò che la demo dimostra su dati pubblici reali.
Nove stadi misurati, dai sinistri OpenFEMA reali a un verdetto di istanza deterministico. Nulla è hardcoded.
Un composito ridge di attributi edilizi OpenFEMA reali (età dell'edificio, numero di piani, indicatore di rialzo, codice post-FIRM, occupazione, ostruzione) è addestrato su una suddivisione di train al 70% e valutato sulla suddivisione di test held-out al 30%. La copertura assicurata è deliberatamente esclusa dal punteggio perché il pagamento è meccanicamente limitato da essa, il che renderebbe circolare il backtest. La baseline è il reale ratedFloodZone e l'etichetta è il reale amountPaidOnBuildingClaim, entrambi indipendenti dal modello.
I sinistri held-out sono classificati per composito e per zona FEMA, e il motore riporta la cattura delle perdite in dollari del decile superiore e il Gini per ciascuno, insieme a un'attribuzione Shapley lineare esatta di ciò che guida il punteggio. Un seed fisso (SEED=9) rende la suddivisione riproducibile, così la stessa esecuzione produce gli stessi numeri.
Lo screening di impatto disparato viene eseguito su ogni variabile tariffata, sul punteggio composito stesso, sulla copertura edilizia assicurata e su ciascun attributo edilizio, rispetto alla quota reale di minoranza a livello di tract da CDC/ATSDR SVI. Per ogni variabile calcola il rapporto di impatto avverso e se si colloca all'interno della banda della regola dell'80% dell'EEOC [0.80, 1.25].
L'istanza è marcata come pronta solo se il campione held-out è abbastanza grande, il lift del composito sulla zona FEMA supera il minimo richiesto (1.10x o superiore), e il rapporto di impatto avverso si colloca all'interno della banda, più una checklist di istanza per stato. Se una qualsiasi variabile fallisce, il cancello emette NOT FILING-READY, nomina il peggior trasgressore e lo instrada a una giustificazione attuariale umana. Rifiuto per default: filing_ready se e solo se zero rilievi bloccanti.
Un crew Pydantic-AI composto da un factor-explainer, un giustificatore di equità accoppiato a un challenger avversariale, e un redattore di memo di istanza può consigliare, ma è il cancello a decidere. Non è richiesta alcuna chiave API. Gli agenti si astengono quando non è presente e la demo deterministica non ne è influenzata. Ogni numero critico per la fiducia vive in numpy semplice al di fuori del framework di agenti.
Harris County, TX. Sinistri NFIP OpenFEMA reali. Ogni numero sotto è calcolato in tempo reale.
Sui 40,615 sinistri reali held-out, il composito cattura 1.69x i dollari di perdita del decile superiore della baseline della zona FEMA, con Gini 0.31 contro lo 0.08 della zona. Poiché il punteggio è addestrato sul train e letto sulla suddivisione held-out, e la baseline e l'etichetta sono entrambe indipendenti dal modello, questo è un risultato out-of-sample genuino piuttosto che auto-valutato.
Il lift resta robusto all'incirca nell'intervallo da 1.69x a 1.85x tra seed casuali, quindi non è una suddivisione fortunata. L'ambito è un portafoglio di una contea e una suddivisione held-out al 30%, e lo dichiariamo.
L'audit non pretende che l'IA sia il problema. Il punteggio composito stesso supera la regola dell'80% con AIR 0.938, sottoposto a screening rispetto a tract CDC/ATSDR SVI reali. Ma lo screening viene eseguito su ogni variabile tariffata, e 5 falliscono: la peggiore è il numero di piani con AIR 0.363, seguita dal valore assicurato a 0.526 e, in modo sorprendente, dalla fascia di zona della FEMA stessa a 1.467.
Cogliere un rischio di conformità nei dati prima che lo faccia l'esaminatore è il valore. Il cancello allora rifiuta di marcare l'istanza come pronta e instrada il peggior trasgressore, i piani, a una giustificazione attuariale umana.
Questa è una demo del meccanismo, non una pipeline in produzione. Ecco esattamente cosa è reale e cosa è uno stub.
| Componente | In questa demo | Stato |
|---|---|---|
| Sinistri, demografia, geografia | OpenFEMA FimaNfipClaims (170,803 record, 135,381 valutati), CDC/ATSDR SVI 2022, Census Gazetteer 2023 | Reale, pubblico, nessuna chiave API |
| Scoring, backtest, audit di equità, cancello | Composito ridge, lift e Gini out-of-sample, screening di impatto disparato, cancello di policy deterministico | Reale, numpy e Python semplici |
| Feed di segnale dei vendor (ZestyAI Z-FLOOD, ICEYE SAR-depth) | Adapter dietro uno schema reale, dichiarati a schermo come stub | Stub, swap di produzione documentato |
| Connettore Guidewire / Duck Creek | Lookup in cache calda a /api/score che risponde in meno di 50 ms | Stub, non un'integrazione live |
| Crew Pydantic-AI (factor-explainer, giustificatore di equità, redattore di memo) | Solo narrativa consultiva; si astiene senza chiave API | Opzionale, consultivo, non decide mai |
No. FloodProof non è un altro modello alluvionale in concorrenza con ZestyAI o ICEYE. È il livello di integrazione e di prova che sta intorno a qualunque modello usiate: un backtest out-of-sample non circolare contro la baseline reale della zona FEMA, un audit di impatto disparato su ogni variabile tariffata, e un cancello deterministico che produce il pacchetto di istanza al DOI pronto per l'esaminatore oppure lo blocca. Quel valore vale a qualsiasi qualità del modello, perché un modello migliore che si auto-valuta non è evidenza e un modello migliore che porta segnale demografico è un'istanza che il vostro esaminatore respinge.
Il backtest è non circolare per costruzione. Il composito è addestrato su una suddivisione di train al 70% e valutato sul 30% held-out che non ha mai visto, la baseline è la zona reale classificata dalla FEMA, e l'etichetta sono i dollari di sinistro realmente pagati. Sia la baseline sia l'etichetta sono indipendenti dal modello, e la copertura assicurata è deliberatamente esclusa così il punteggio non può barare sul vincolo di pagamento. Su 40,615 sinistri NFIP reali held-out il composito cattura 1.69x i dollari di perdita del decile superiore della baseline della zona FEMA (Gini 0.31 vs 0.08), e il risultato resta all'incirca nell'intervallo da 1.69x a 1.85x tra seed casuali.
Rifiuta di marcare l'istanza come pronta. Il cancello di policy è Python deterministico con un invariante: filing_ready se e solo se ci sono zero rilievi bloccanti. Su questo portafoglio Harris County il punteggio composito stesso supera la regola dell'80% con AIR 0.938, ma l'audit segnala 5 variabili tariffate che falliscono, la peggiore essendo il numero di piani con AIR 0.363. Il cancello emette NOT FILING-READY, nomina il peggior trasgressore e lo instrada a una giustificazione attuariale umana invece di spedire una tariffa discriminatoria. Gli agenti consigliano, il codice decide.
Reale. La demo gira su 170,803 record grezzi di sinistri NFIP OpenFEMA per Harris County, Texas, di cui 135,381 con un sinistro edilizio pagato vengono valutati, più demografia reale dei tract CDC/ATSDR SVI 2022 e il Census Gazetteer 2023. Sono dati pubblici senza chiave API, messi in cache alla prima esecuzione. Un caveat onesto che la demo dichiara a schermo: la FEMA censura le geocoordinate dei sinistri all'incirca al centroide del tract, quindi il backtest gira alla risoluzione che i dati pubblici consentono.
No, e la demo lo dice a schermo. I feed ZestyAI Z-FLOOD e ICEYE SAR-depth e il connettore Guidewire Integration Data Manager sono stub dietro uno schema reale. L'endpoint del connettore è un lookup in cache calda che risponde in meno di 50 ms per rendere concreta l'integrazione quote-bind in linea. Il percorso di produzione è lo swap di config documentato, non una riscrittura, e la rivendicazione onesta è uno stub, non un'integrazione live.
No. Il pacchetto di istanza al DOI è un artefatto di evidenza, un memorandum attuariale, il backtest out-of-sample, l'attribuzione delle feature e una checklist per stato, non una certificazione o una consulenza legale. «L'esaminatore può approvare» è l'obiettivo di progettazione, non una garanzia che un esaminatore abbia approvato nulla. Nessun assicuratore lo ha usato in produzione, e non ci sono deployment, clienti o case study. Man mano che 24 o più stati adottano il NAIC AI Model Bulletin, il punto è che il cancello produce la prova che un esaminatore chiede e fallisce con onestà quando i dati non supportano un'istanza.
La ricerca dietro questa demo — l'architettura, il design di verifica e il blueprint enterprise.
Soluzione completa
Esplora la soluzione Sottoscrizione del rischio alluvionale basata sull'IA →La zona FEMA lascia miliardi fuori dalle sue linee, e la revisione di equità è ora parte dell'istanza.
Se il vostro team sta cercando di capire come mettere un fattore di tariffazione IA di fronte a un esaminatore del DOI senza spedire una variabile che fallisce la regola dell'80%, ci farebbe davvero piacere sentire come ci state pensando. Il problema è di settore e lo saranno anche le risposte.