Souscription du risque d'inondation par l'IA

Un facteur de tarification de l'inondation qui bat la zone FEMA, et se bloque avant l'examinateur du DOI.

FloodProof s'appuie sur un véritable portefeuille de sinistres d'inondation NFIP et démontre qu'un composite d'attributs réels des bâtiments classe les pertes mieux que la zone d'inondation FEMA, audite chaque variable tarifée pour un impact disparate par rapport aux données démographiques réelles du recensement, et assemble le dossier de dépôt DOI prêt pour l'examinateur. Lorsqu'une variable échoue à la règle des 80%, une barrière de politique déterministe refuse de marquer le dépôt comme prêt et oriente le pire contrevenant vers une justification actuarielle humaine.

1.69x

Lift hors échantillon par rapport à la zone FEMA sur la capture des pertes du décile supérieur

40,615 sinistres NFIP réels tenus à l'écart, Gini 0.31 vs 0.08

$3.1B

Dollars réels de sinistres bâtiment versés hors des zones FEMA à haut risque (45.9%)

Ce portefeuille du comté de Harris, TX, non modélisé

NOT FILING-READY

La barrière a bloqué son propre dépôt lorsque 5 variables tarifées ont échoué à la règle des 80%

Le score composite lui-même passe à AIR 0.938

Chaque chiffre est recalculé en direct à partir de données publiques réelles à chaque exécution. Attribuez-les à ce portefeuille du comté de Harris et à ce split tenu à l'écart, pas comme une garantie en monde ouvert.

La zone FEMA tarife mal les deux côtés, et un modèle plus intelligent peut faire échouer le dépôt

Une tarification de l'inondation ancrée à la Zone AE vs la Zone X est une question au niveau de la propriété à laquelle on répond avec une carte.

Ancrer un tarif d'inondation à la zone d'inondation FEMA surfacture la maison surélevée à l'intérieur de la zone et sous-facture la maison sur dalle à l'extérieur. L'exposition réelle de l'assureur est une question au niveau de la propriété à laquelle la carte des zones ne peut pas répondre. Dans ce véritable portefeuille du comté de Harris, $3.1B (45.9%) des dollars de sinistres bâtiment ont été versés sur des propriétés que la FEMA classait hors de ses zones Special Flood Hazard Area à haut risque. Cela vient directement des données, sans aucun modèle.

La réponse du marché a été d'acheter un meilleur modèle. Mais un facteur de tarification plus intelligent n'est que la moitié du travail. Tout tarif augmenté par l'IA doit désormais survivre à un examen d'équité du Department of Insurance, car un facteur qui classe bien les pertes peut aussi porter un signal démographique et échouer à la règle des 80% de l'EEOC, livrant un tarif discriminatoire que l'examinateur rejettera. La New York DFS Circular Letter 2024-7 exige des tests de discrimination par proxy, le Colorado exige une justification par variable pour les tarifs d'assurance pilotés par l'IA, et le NAIC AI Model Bulletin a été adopté par 24 États ou plus. Un meilleur modèle qui s'auto-évalue n'est pas une preuve, et un meilleur modèle qui porte un signal démographique est un dépôt renvoyé.

L'ingénierie durable est l'infrastructure autour du modèle : un backtest non circulaire, un audit d'équité sur chaque variable tarifée, et une barrière qui produit le dossier de dépôt de l'examinateur ou refuse de le faire. C'est ce que nous avons construit et ce que la démonstration prouve sur des données publiques réelles.

Comment fonctionne FloodProof

Neuf étapes mesurées, des sinistres OpenFEMA réels jusqu'à un verdict de dépôt déterministe. Rien n'est codé en dur.

Panneau du pipeline live de FloodProof montrant 9 étapes achevées sur 135,381 sinistres réels : lecture des enregistrements OpenFEMA en cache, conservation des sinistres bâtiment payés, ingénierie des caractéristiques réelles des bâtiments, chargement des données démographiques CDC-SVI et des centroïdes de tracts, split 70/30 sur la graine 9 et ajustement du composite ridge, backtest contre la zone FEMA à 1.694x, comptabilisation de $3.1B versés hors des zones à haut risque, criblage de chaque variable pour un impact disparate, et une barrière de politique déterministe renvoyant NOT FILING-READY avec les étages orientés vers un humain.
Le pipeline en neuf étapes s'exécute en direct à chaque exécution. Les chiffres critiques pour la confiance sont du numpy brut, calculés en dehors de tout cadre d'agents.

Le moteur de notation

Un composite ridge d'attributs réels des bâtiments OpenFEMA (âge du bâtiment, nombre d'étages, indicateur de surélévation, code post-FIRM, occupation, obstruction) est ajusté sur un split d'entraînement de 70% et noté sur le split de test de 30% tenue à l'écart. La couverture assurée est délibérément exclue du score parce que le paiement est mécaniquement borné par elle, ce qui rendrait le backtest circulaire. La baseline est le véritable ratedFloodZone et le label est le véritable amountPaidOnBuildingClaim, tous deux indépendants du modèle.

Le backtest et l'attribution

Les sinistres tenus à l'écart sont classés par composite et par zone FEMA, et le moteur rapporte la capture des dollars de pertes du décile supérieur et le Gini pour chacun, ainsi qu'une attribution Shapley linéaire exacte de ce qui pilote le score. Une graine fixe (SEED=9) rend le split reproductible, de sorte que la même exécution produit les mêmes chiffres.

L'audit d'équité

Le criblage d'impact disparate s'exécute sur chaque variable tarifée, le score composite lui-même, la couverture bâtiment assurée et chaque attribut du bâtiment, par rapport à la part réelle de minorités au niveau du tract issue du CDC/ATSDR SVI. Pour chaque variable, il calcule le ratio d'impact défavorable et s'il se situe dans la bande de la règle des 80% de l'EEOC [0.80, 1.25].

La barrière de politique déterministe

Le dépôt n'est marqué prêt que si l'échantillon tenu à l'écart est assez grand, si le lift du composite par rapport à la zone FEMA dépasse le minimum requis (1.10x ou plus), et si le ratio d'impact défavorable se situe dans la bande, plus une checklist de dépôt par État. Si une variable échoue, la barrière émet NOT FILING-READY, nomme le pire contrevenant et l'oriente vers une justification actuarielle humaine. Refus par défaut : filing_ready si et seulement s'il n'y a aucun constat bloquant.

Le crew LLM optionnel

Un crew Pydantic-AI composé d'un explicateur de facteurs, d'un justificateur d'équité apparié à un challenger contradictoire, et d'un rédacteur de mémo de dépôt peut conseiller, mais c'est la barrière qui décide. Aucune clé API n'est requise. Les agents s'abstiennent lorsqu'aucune n'est présente et la démonstration déterministe n'est pas affectée. Chaque chiffre critique pour la confiance vit dans du numpy brut, en dehors du cadre d'agents.

Ce que la démonstration prouve sur des données réelles

Comté de Harris, TX. Véritables sinistres NFIP OpenFEMA. Chaque chiffre ci-dessous est calculé en direct.

Cartes FloodProof côte à côte du même portefeuille du comté de Harris. À gauche, les sinistres colorés par palier de zone d'inondation FEMA, la taille des points étant égale aux dollars réellement versés. À droite, les mêmes sinistres colorés par le risque composite IA, avec des anneaux dorés marquant les ratés FEMA : des propriétés que la FEMA classait comme sûres et que le composite note à haut risque. Un badge rouge dans le coin indique Certificat de conformité NOT FILING-READY.
Même portefeuille, deux cartes. La vue par zone FEMA et la vue par composite IA des mêmes sinistres du comté de Harris, les anneaux dorés marquant les propriétés que la FEMA classait comme sûres et que le composite signale comme à haut risque.
Graphique de lift hors échantillon de FloodProof avec des cartes de statistiques en tête : $3125.0M de sinistres bâtiment réels versés hors des zones FEMA à haut risque, lift de capture du décile supérieur de 1.694x du composite vs la zone FEMA, 45.9% de part de tous les dollars de sinistres réels hors des zones à haut risque, et 40,615 sinistres réels tenus à l'écart dans le backtest. Un graphique en barres compare le composite IA à la zone FEMA seule sur la capture des dollars de sinistres du décile supérieur et le Gini.
Le résultat hors échantillon : lift de capture du décile supérieur de 1.694x sur 40,615 sinistres tenus à l'écart, Gini 0.31 vs 0.08.

Sur les 40,615 sinistres réels tenus à l'écart, le composite capture 1.69x les dollars de pertes du décile supérieur de la baseline de zone FEMA, avec un Gini de 0.31 contre 0.08 pour la zone. Parce que le score est ajusté sur l'entraînement et lu sur le split tenu à l'écart, et que la baseline et le label sont tous deux indépendants du modèle, il s'agit d'un véritable résultat hors échantillon plutôt que d'une auto-évaluation.

Le lift reste robuste dans une fourchette d'environ 1.69x à 1.85x selon les graines aléatoires, ce n'est donc pas un split chanceux. Le périmètre est un portefeuille de comté et un split de 30% tenue à l'écart, et nous le disons.

L'audit ne prétend pas que l'IA est le problème. Le score composite lui-même passe la règle des 80% à AIR 0.938, criblé contre de véritables tracts CDC/ATSDR SVI. Mais le criblage s'exécute sur chaque variable tarifée, et 5 échouent : le pire est le nombre d'étages à AIR 0.363, suivi de la valeur assurée à 0.526, et, de façon frappante, le palier de zone de la FEMA elle-même à 1.467.

Détecter un risque de conformité dans les données avant l'examinateur, c'est là la valeur. La barrière refuse alors de marquer le dépôt comme prêt et oriente le pire contrevenant, les étages, vers une justification actuarielle humaine.

Modale de certificat de conformité FloodProof marquée NOT FILING-READY. Un tableau d'impact disparate crible chaque variable de tarification par rapport aux tracts CDC/ATSDR SVI 2022 réels : le score composite passe à AIR 0.938, tandis que 5 des variables tarifées échouent à la règle des 80%, le pire étant les étages à 0.363, puis la couverture bâtiment assurée à 0.526, et le palier de zone de la FEMA elle-même à 1.467. Une ligne rouge note que le pire contrevenant, les étages, est orienté vers une justification actuarielle humaine et que le tarif n'est pas auto-approuvé, avec une checklist de dépôt DOI par État en dessous.
L'audit d'impact disparate crible chaque variable tarifée. Le composite passe à 0.938 ; 5 variables échouent, y compris le palier de zone de la FEMA elle-même.
Document de dépôt DOI d'État FloodProof intitulé AI-Augmented Flood Rating Factor pour le portefeuille d'assureur du comté de Harris, TX, tamponné NOT FILING-READY. Il contient un mémorandum actuariel, un tableau de backtest hors échantillon montrant que le composite capture 1.694x les dollars de pertes du décile supérieur de la zone FEMA avec un Gini de 0.31 vs 0.08 sur 40,615 sinistres réels, et un tableau d'importance des caractéristiques des contributions Shapley linéaires exactes.
Le dossier de dépôt DOI prêt pour l'examinateur : mémorandum actuariel, le backtest hors échantillon et l'attribution des caractéristiques, produit ou bloqué par la barrière.

Où se situe FloodProof, honnêtement

Ceci est une démonstration du mécanisme, pas un pipeline déployé. Voici exactement ce qui est réel et ce qui est un stub.

Composant Dans cette démonstration Statut
Sinistres, démographie, géographie OpenFEMA FimaNfipClaims (170,803 enregistrements, 135,381 notés), CDC/ATSDR SVI 2022, Census Gazetteer 2023 Réel, public, aucune clé API
Notation, backtest, audit d'équité, barrière Composite ridge, lift hors échantillon et Gini, criblage d'impact disparate, barrière de politique déterministe Réel, numpy et Python bruts
Flux de signaux fournisseurs (ZestyAI Z-FLOOD, ICEYE SAR-depth) Adaptateurs derrière un schéma réel, divulgués à l'écran comme stubs Stub, substitution de production documentée
Connecteur Guidewire / Duck Creek Recherche en cache chaud à /api/score renvoyant en moins de 50 ms Stub, pas une intégration live
Crew Pydantic-AI (explicateur de facteurs, justificateur d'équité, rédacteur de mémo) Narratif consultatif uniquement ; s'abstient sans clé API Optionnel, consultatif, ne décide jamais
Feuille de calcul du facteur de tarification FloodProof pour un tract du comté de Harris, avec un contrôle Fetch rating factor via Guidewire connector déplié. Le journal de console l'étiquette stub guidewire-integration-data-manager et renvoie un facteur de tarification composite depuis une recherche en cache chaud, divulgué dans l'UI comme un stub plutôt qu'une intégration live.
L'histoire inline de devis-souscription est concrète mais honnête : le connecteur Guidewire est une recherche en cache factice, étiquetée comme telle dans l'UI.

Ce que cette démonstration ne fait pas

  • Elle n'exécute pas de flux live ZestyAI, ICEYE, First Street, Guidewire ou Duck Creek. Ce sont des stubs.
  • Elle ne revendique ni conformité DOI ni certification. Le dossier de dépôt est un artefact de preuves, pas un avis juridique, et aucun examinateur n'a approuvé quoi que ce soit.
  • Elle ne présente pas de chiffre modélisé de fuite annuelle en dollars. L'accroche honnête est les $3.1B réels, non modélisés, versés hors des zones FEMA à haut risque, plus le lift hors échantillon.
  • Elle n'utilise pas de rasters externes (surface imperméable, DEM, NOAA Atlas-14). Le composite utilise les propres attributs réels des bâtiments d'OpenFEMA ; les rasters sont un enrichissement futur documenté.
  • Elle n'a ni clients, ni assureurs, ni déploiements, ni témoignages, ni ROI. Aucun assureur nommé n'a utilisé ceci. C'est une démonstration du mécanisme sur un portefeuille d'un comté.
  • Elle ne prétend pas que son propre modèle est biaisé. Le composite passe la règle des 80% à AIR 0.938 ; le point est que l'audit et la barrière attrapent les variables qui échouent.

Questions que posent les souscripteurs et les équipes de conformité

Est-ce que cela remplace les modèles d'inondation que nous achetons déjà, comme ZestyAI ou ICEYE ?

Non. FloodProof n'est pas un autre modèle d'inondation en concurrence avec ZestyAI ou ICEYE. C'est la couche d'intégration et de preuve qui s'articule autour du modèle que vous utilisez : un backtest hors échantillon non circulaire contre la véritable baseline de zone FEMA, un audit d'impact disparate sur chaque variable tarifée, et une barrière déterministe qui produit le dossier de dépôt DOI prêt pour l'examinateur ou le bloque. Cette valeur tient quelle que soit la qualité du modèle, parce qu'un meilleur modèle qui s'auto-évalue n'est pas une preuve et qu'un meilleur modèle qui porte un signal démographique est un dépôt que votre examinateur rejette.

Comment savez-vous que le lift du composite par rapport à la zone FEMA n'est pas simplement du surapprentissage ?

Le backtest est non circulaire par construction. Le composite est ajusté sur un split d'entraînement de 70% et noté sur les 30% tenus à l'écart qu'il n'a jamais vus, la baseline est la véritable zone notée FEMA, et le label est les véritables dollars de sinistres versés. La baseline et le label sont tous deux indépendants du modèle, et la couverture assurée est délibérément exclue pour que le score ne puisse pas tricher avec la borne de paiement. Sur 40,615 sinistres NFIP réels tenus à l'écart, le composite capture 1.69x les dollars de pertes du décile supérieur de la baseline de zone FEMA (Gini 0.31 vs 0.08), et le résultat reste dans une fourchette d'environ 1.69x à 1.85x selon les graines aléatoires.

Que fait réellement la barrière lorsqu'une variable de tarification échoue à la règle des 80% ?

Elle refuse de marquer le dépôt comme prêt. La barrière de politique est du Python déterministe avec un invariant : filing_ready si et seulement s'il n'y a aucun constat bloquant. Sur ce portefeuille du comté de Harris, le score composite lui-même passe la règle des 80% à AIR 0.938, mais l'audit signale 5 variables tarifées qui échouent, le pire étant le nombre d'étages à AIR 0.363. La barrière émet NOT FILING-READY, nomme le pire contrevenant, et l'oriente vers une justification actuarielle humaine au lieu de livrer un tarif discriminatoire. Les agents conseillent, le code décide.

Cela s'exécute-t-il sur des données de sinistres réelles ou sur un échantillon synthétique ?

Réel. La démonstration s'exécute sur 170,803 enregistrements bruts de sinistres NFIP OpenFEMA pour le comté de Harris, Texas, dont 135,381 avec un sinistre bâtiment payé sont notés, plus les données démographiques réelles des tracts CDC/ATSDR SVI 2022 et le Census Gazetteer 2023. Ce sont des données publiques sans clé API, mises en cache à la première exécution. Une réserve honnête que la démonstration divulgue à l'écran : la FEMA censure les géocoordonnées des sinistres approximativement au centroïde du tract, de sorte que le backtest s'exécute à la résolution que les données publiques permettent.

Les flux des fournisseurs et le connecteur Guidewire sont-ils live dans cette démonstration ?

Non, et la démonstration le dit à l'écran. Les flux ZestyAI Z-FLOOD et ICEYE SAR-depth et le connecteur Guidewire Integration Data Manager sont des stubs derrière un schéma réel. Le point de terminaison du connecteur est une recherche en cache chaud qui renvoie en moins de 50 ms pour rendre concrète l'intégration inline de devis-souscription. Le chemin de production est la substitution de configuration documentée, pas une réécriture, et l'affirmation honnête est un stub, pas une intégration live.

Est-ce que « un facteur de tarification que votre examinateur du DOI peut approuver » signifie qu'il est certifié conforme ?

Non. Le dossier de dépôt DOI est un artefact de preuves, un mémorandum actuariel, le backtest hors échantillon, l'attribution des caractéristiques et une checklist par État, pas une certification ni un avis juridique. « L'examinateur peut approuver » est l'objectif de conception, pas une garantie qu'un examinateur a approuvé quoi que ce soit. Aucun assureur n'a utilisé ceci en production, et il n'y a ni déploiements, ni clients, ni études de cas. Alors que 24 États ou plus adoptent le NAIC AI Model Bulletin, le point est que la barrière produit la preuve qu'un examinateur demande et échoue honnêtement lorsque les données ne soutiennent pas un dépôt.

Recherche technique

La recherche derrière cette démonstration — l'architecture, la conception de la vérification et le plan d'entreprise.

Si vous tarifez le risque d'inondation, nous aimerions comparer nos notes

La zone FEMA laisse des milliards hors de ses lignes, et l'examen d'équité fait désormais partie du dépôt.

Si votre équipe cherche comment présenter un facteur de tarification IA à un examinateur du DOI sans livrer une variable qui échoue à la règle des 80%, nous aimerions sincèrement entendre comment vous y réfléchissez. Le problème est à l'échelle de l'industrie et les réponses le seront aussi.

Tarification de portefeuille et évaluation de l'équité

  • ✓ Backtest hors échantillon non circulaire contre votre baseline de zone FEMA
  • ✓ Audit d'impact disparate sur chaque variable tarifée
  • ✓ Là où la carte des zones tarife mal votre portefeuille, en dollars de sinistres
  • ✓ Une lecture des variables qui feraient échouer un examen du DOI

Construction du moteur de tarification et de dépôt

  • ✓ Facteur de tarification composite sur vos attributs réels et flux fournisseurs
  • ✓ Barrière de politique déterministe : filing_ready si aucun constat bloquant
  • ✓ Dossier de dépôt DOI prêt pour l'examinateur avec checklists par État
  • ✓ Connecteur Guidewire ou Duck Creek, substitution de configuration pas une réécriture
Réseaux sociaux

Également publié sur