Souscription du risque d'inondation par l'IA
FloodProof s'appuie sur un véritable portefeuille de sinistres d'inondation NFIP et démontre qu'un composite d'attributs réels des bâtiments classe les pertes mieux que la zone d'inondation FEMA, audite chaque variable tarifée pour un impact disparate par rapport aux données démographiques réelles du recensement, et assemble le dossier de dépôt DOI prêt pour l'examinateur. Lorsqu'une variable échoue à la règle des 80%, une barrière de politique déterministe refuse de marquer le dépôt comme prêt et oriente le pire contrevenant vers une justification actuarielle humaine.
1.69x
Lift hors échantillon par rapport à la zone FEMA sur la capture des pertes du décile supérieur
40,615 sinistres NFIP réels tenus à l'écart, Gini 0.31 vs 0.08
$3.1B
Dollars réels de sinistres bâtiment versés hors des zones FEMA à haut risque (45.9%)
Ce portefeuille du comté de Harris, TX, non modélisé
NOT FILING-READY
La barrière a bloqué son propre dépôt lorsque 5 variables tarifées ont échoué à la règle des 80%
Le score composite lui-même passe à AIR 0.938
Chaque chiffre est recalculé en direct à partir de données publiques réelles à chaque exécution. Attribuez-les à ce portefeuille du comté de Harris et à ce split tenu à l'écart, pas comme une garantie en monde ouvert.
Une tarification de l'inondation ancrée à la Zone AE vs la Zone X est une question au niveau de la propriété à laquelle on répond avec une carte.
Ancrer un tarif d'inondation à la zone d'inondation FEMA surfacture la maison surélevée à l'intérieur de la zone et sous-facture la maison sur dalle à l'extérieur. L'exposition réelle de l'assureur est une question au niveau de la propriété à laquelle la carte des zones ne peut pas répondre. Dans ce véritable portefeuille du comté de Harris, $3.1B (45.9%) des dollars de sinistres bâtiment ont été versés sur des propriétés que la FEMA classait hors de ses zones Special Flood Hazard Area à haut risque. Cela vient directement des données, sans aucun modèle.
La réponse du marché a été d'acheter un meilleur modèle. Mais un facteur de tarification plus intelligent n'est que la moitié du travail. Tout tarif augmenté par l'IA doit désormais survivre à un examen d'équité du Department of Insurance, car un facteur qui classe bien les pertes peut aussi porter un signal démographique et échouer à la règle des 80% de l'EEOC, livrant un tarif discriminatoire que l'examinateur rejettera. La New York DFS Circular Letter 2024-7 exige des tests de discrimination par proxy, le Colorado exige une justification par variable pour les tarifs d'assurance pilotés par l'IA, et le NAIC AI Model Bulletin a été adopté par 24 États ou plus. Un meilleur modèle qui s'auto-évalue n'est pas une preuve, et un meilleur modèle qui porte un signal démographique est un dépôt renvoyé.
L'ingénierie durable est l'infrastructure autour du modèle : un backtest non circulaire, un audit d'équité sur chaque variable tarifée, et une barrière qui produit le dossier de dépôt de l'examinateur ou refuse de le faire. C'est ce que nous avons construit et ce que la démonstration prouve sur des données publiques réelles.
Neuf étapes mesurées, des sinistres OpenFEMA réels jusqu'à un verdict de dépôt déterministe. Rien n'est codé en dur.
Un composite ridge d'attributs réels des bâtiments OpenFEMA (âge du bâtiment, nombre d'étages, indicateur de surélévation, code post-FIRM, occupation, obstruction) est ajusté sur un split d'entraînement de 70% et noté sur le split de test de 30% tenue à l'écart. La couverture assurée est délibérément exclue du score parce que le paiement est mécaniquement borné par elle, ce qui rendrait le backtest circulaire. La baseline est le véritable ratedFloodZone et le label est le véritable amountPaidOnBuildingClaim, tous deux indépendants du modèle.
Les sinistres tenus à l'écart sont classés par composite et par zone FEMA, et le moteur rapporte la capture des dollars de pertes du décile supérieur et le Gini pour chacun, ainsi qu'une attribution Shapley linéaire exacte de ce qui pilote le score. Une graine fixe (SEED=9) rend le split reproductible, de sorte que la même exécution produit les mêmes chiffres.
Le criblage d'impact disparate s'exécute sur chaque variable tarifée, le score composite lui-même, la couverture bâtiment assurée et chaque attribut du bâtiment, par rapport à la part réelle de minorités au niveau du tract issue du CDC/ATSDR SVI. Pour chaque variable, il calcule le ratio d'impact défavorable et s'il se situe dans la bande de la règle des 80% de l'EEOC [0.80, 1.25].
Le dépôt n'est marqué prêt que si l'échantillon tenu à l'écart est assez grand, si le lift du composite par rapport à la zone FEMA dépasse le minimum requis (1.10x ou plus), et si le ratio d'impact défavorable se situe dans la bande, plus une checklist de dépôt par État. Si une variable échoue, la barrière émet NOT FILING-READY, nomme le pire contrevenant et l'oriente vers une justification actuarielle humaine. Refus par défaut : filing_ready si et seulement s'il n'y a aucun constat bloquant.
Un crew Pydantic-AI composé d'un explicateur de facteurs, d'un justificateur d'équité apparié à un challenger contradictoire, et d'un rédacteur de mémo de dépôt peut conseiller, mais c'est la barrière qui décide. Aucune clé API n'est requise. Les agents s'abstiennent lorsqu'aucune n'est présente et la démonstration déterministe n'est pas affectée. Chaque chiffre critique pour la confiance vit dans du numpy brut, en dehors du cadre d'agents.
Comté de Harris, TX. Véritables sinistres NFIP OpenFEMA. Chaque chiffre ci-dessous est calculé en direct.
Sur les 40,615 sinistres réels tenus à l'écart, le composite capture 1.69x les dollars de pertes du décile supérieur de la baseline de zone FEMA, avec un Gini de 0.31 contre 0.08 pour la zone. Parce que le score est ajusté sur l'entraînement et lu sur le split tenu à l'écart, et que la baseline et le label sont tous deux indépendants du modèle, il s'agit d'un véritable résultat hors échantillon plutôt que d'une auto-évaluation.
Le lift reste robuste dans une fourchette d'environ 1.69x à 1.85x selon les graines aléatoires, ce n'est donc pas un split chanceux. Le périmètre est un portefeuille de comté et un split de 30% tenue à l'écart, et nous le disons.
L'audit ne prétend pas que l'IA est le problème. Le score composite lui-même passe la règle des 80% à AIR 0.938, criblé contre de véritables tracts CDC/ATSDR SVI. Mais le criblage s'exécute sur chaque variable tarifée, et 5 échouent : le pire est le nombre d'étages à AIR 0.363, suivi de la valeur assurée à 0.526, et, de façon frappante, le palier de zone de la FEMA elle-même à 1.467.
Détecter un risque de conformité dans les données avant l'examinateur, c'est là la valeur. La barrière refuse alors de marquer le dépôt comme prêt et oriente le pire contrevenant, les étages, vers une justification actuarielle humaine.
Ceci est une démonstration du mécanisme, pas un pipeline déployé. Voici exactement ce qui est réel et ce qui est un stub.
| Composant | Dans cette démonstration | Statut |
|---|---|---|
| Sinistres, démographie, géographie | OpenFEMA FimaNfipClaims (170,803 enregistrements, 135,381 notés), CDC/ATSDR SVI 2022, Census Gazetteer 2023 | Réel, public, aucune clé API |
| Notation, backtest, audit d'équité, barrière | Composite ridge, lift hors échantillon et Gini, criblage d'impact disparate, barrière de politique déterministe | Réel, numpy et Python bruts |
| Flux de signaux fournisseurs (ZestyAI Z-FLOOD, ICEYE SAR-depth) | Adaptateurs derrière un schéma réel, divulgués à l'écran comme stubs | Stub, substitution de production documentée |
| Connecteur Guidewire / Duck Creek | Recherche en cache chaud à /api/score renvoyant en moins de 50 ms | Stub, pas une intégration live |
| Crew Pydantic-AI (explicateur de facteurs, justificateur d'équité, rédacteur de mémo) | Narratif consultatif uniquement ; s'abstient sans clé API | Optionnel, consultatif, ne décide jamais |
Non. FloodProof n'est pas un autre modèle d'inondation en concurrence avec ZestyAI ou ICEYE. C'est la couche d'intégration et de preuve qui s'articule autour du modèle que vous utilisez : un backtest hors échantillon non circulaire contre la véritable baseline de zone FEMA, un audit d'impact disparate sur chaque variable tarifée, et une barrière déterministe qui produit le dossier de dépôt DOI prêt pour l'examinateur ou le bloque. Cette valeur tient quelle que soit la qualité du modèle, parce qu'un meilleur modèle qui s'auto-évalue n'est pas une preuve et qu'un meilleur modèle qui porte un signal démographique est un dépôt que votre examinateur rejette.
Le backtest est non circulaire par construction. Le composite est ajusté sur un split d'entraînement de 70% et noté sur les 30% tenus à l'écart qu'il n'a jamais vus, la baseline est la véritable zone notée FEMA, et le label est les véritables dollars de sinistres versés. La baseline et le label sont tous deux indépendants du modèle, et la couverture assurée est délibérément exclue pour que le score ne puisse pas tricher avec la borne de paiement. Sur 40,615 sinistres NFIP réels tenus à l'écart, le composite capture 1.69x les dollars de pertes du décile supérieur de la baseline de zone FEMA (Gini 0.31 vs 0.08), et le résultat reste dans une fourchette d'environ 1.69x à 1.85x selon les graines aléatoires.
Elle refuse de marquer le dépôt comme prêt. La barrière de politique est du Python déterministe avec un invariant : filing_ready si et seulement s'il n'y a aucun constat bloquant. Sur ce portefeuille du comté de Harris, le score composite lui-même passe la règle des 80% à AIR 0.938, mais l'audit signale 5 variables tarifées qui échouent, le pire étant le nombre d'étages à AIR 0.363. La barrière émet NOT FILING-READY, nomme le pire contrevenant, et l'oriente vers une justification actuarielle humaine au lieu de livrer un tarif discriminatoire. Les agents conseillent, le code décide.
Réel. La démonstration s'exécute sur 170,803 enregistrements bruts de sinistres NFIP OpenFEMA pour le comté de Harris, Texas, dont 135,381 avec un sinistre bâtiment payé sont notés, plus les données démographiques réelles des tracts CDC/ATSDR SVI 2022 et le Census Gazetteer 2023. Ce sont des données publiques sans clé API, mises en cache à la première exécution. Une réserve honnête que la démonstration divulgue à l'écran : la FEMA censure les géocoordonnées des sinistres approximativement au centroïde du tract, de sorte que le backtest s'exécute à la résolution que les données publiques permettent.
Non, et la démonstration le dit à l'écran. Les flux ZestyAI Z-FLOOD et ICEYE SAR-depth et le connecteur Guidewire Integration Data Manager sont des stubs derrière un schéma réel. Le point de terminaison du connecteur est une recherche en cache chaud qui renvoie en moins de 50 ms pour rendre concrète l'intégration inline de devis-souscription. Le chemin de production est la substitution de configuration documentée, pas une réécriture, et l'affirmation honnête est un stub, pas une intégration live.
Non. Le dossier de dépôt DOI est un artefact de preuves, un mémorandum actuariel, le backtest hors échantillon, l'attribution des caractéristiques et une checklist par État, pas une certification ni un avis juridique. « L'examinateur peut approuver » est l'objectif de conception, pas une garantie qu'un examinateur a approuvé quoi que ce soit. Aucun assureur n'a utilisé ceci en production, et il n'y a ni déploiements, ni clients, ni études de cas. Alors que 24 États ou plus adoptent le NAIC AI Model Bulletin, le point est que la barrière produit la preuve qu'un examinateur demande et échoue honnêtement lorsque les données ne soutiennent pas un dépôt.
La recherche derrière cette démonstration — l'architecture, la conception de la vérification et le plan d'entreprise.
Solution complète
Explorer la solution Souscription du risque d'inondation par l'IA →La zone FEMA laisse des milliards hors de ses lignes, et l'examen d'équité fait désormais partie du dépôt.
Si votre équipe cherche comment présenter un facteur de tarification IA à un examinateur du DOI sans livrer une variable qui échoue à la règle des 80%, nous aimerions sincèrement entendre comment vous y réfléchissez. Le problème est à l'échelle de l'industrie et les réponses le seront aussi.