KI-gestütztes Hochwasserrisiko-Underwriting
FloodProof nimmt ein reales Portfolio von NFIP-Hochwasserschäden in den Blick und belegt, dass ein Komposit aus echten Gebäudeattributen Schäden besser rangiert als die FEMA-Hochwasserzone, prüft jede bepreiste Variable auf Disparate Impact gegenüber realer Census-Demografie und stellt das prüferfertige DOI-Einreichungspaket zusammen. Wenn eine Variable die 80%-Regel nicht erfüllt, verweigert ein deterministisches Policy-Tor die Markierung als einreichungsbereit und leitet den schlimmsten Verstoß zur menschlichen versicherungsmathematischen Begründung weiter.
1.69x
Out-of-Sample-Lift gegenüber der FEMA-Zone bei der Schadenerfassung im obersten Dezil
40,615 zurückgehaltene echte NFIP-Schäden, Gini 0.31 vs 0.08
$3.1B
Echte ausgezahlte Gebäude-Schadendollars außerhalb von FEMA-Hochrisikozonen (45.9%)
Dieses Portfolio in Harris County, TX, unmodelliert
NOT FILING-READY
Das Tor hat die eigene Einreichung blockiert, als 5 bepreiste Variablen die 80%-Regel nicht erfüllt haben
Der Kompositscore selbst besteht bei AIR 0.938
Jede Kennzahl wird bei jedem Lauf live aus echten öffentlichen Daten neu berechnet. Ordnen Sie sie diesem Harris-County-Portfolio und diesem Hold-out-Split zu, nicht als Garantie für die offene Welt.
Hochwasserbepreisung, die an Zone AE vs. Zone X ankert, ist eine grundstücksbezogene Frage, die mit einer Karte beantwortet wird.
Eine Hochwasserprämie an der FEMA-Hochwasserzone zu verankern, berechnet dem aufgeständerten Haus innerhalb der Zone zu viel und dem Slab-on-Grade-Haus außerhalb zu wenig. Die tatsächliche Exposure des Versicherers ist eine grundstücksbezogene Frage, die die Zonenkarte nicht beantworten kann. In diesem realen Harris-County-Portfolio wurden $3.1B (45.9%) der Gebäude-Schadendollars auf Immobilien ausgezahlt, die FEMA außerhalb ihrer Special-Flood-Hazard-Area-Zonen mit hohem Risiko eingestuft hat. Das kommt direkt aus den Daten, ohne dass ein Modell im Spiel ist.
Die Marktantwort war, ein besseres Modell zu kaufen. Aber ein smarterer Ratingfaktor ist nur die halbe Arbeit. Jeder KI-gestützte Tarif muss jetzt eine Fairness-Prüfung des Department of Insurance überstehen, weil ein Faktor, der Schäden gut rangiert, auch demografisches Signal tragen und die EEOC-80%-Regel nicht erfüllen kann — und damit einen diskriminierenden Tarif ausliefert, den der Prüfer ablehnt. New York DFS Circular Letter 2024-7 verlangt Tests auf Proxy-Diskriminierung, Colorado verlangt eine Begründung je Variable für KI-gesteuerte Versicherungstarife, und das NAIC AI Model Bulletin ist in 24 oder mehr Bundesstaaten übernommen worden. Ein besseres Modell, das sich selbst benotet, ist kein Nachweis, und ein besseres Modell, das demografisches Signal trägt, ist eine Einreichung, die zurückgeschickt wird.
Die tragfähige Engineering-Leistung ist die Infrastruktur um das Modell: ein nicht-zirkulärer Backtest, ein Fairness-Audit auf jeder bepreisten Variable und ein Tor, das entweder das Einreichungspaket des Prüfers erzeugt oder es verweigert. Das haben wir gebaut, und das belegt die Demo auf echten öffentlichen Daten.
Neun gemessene Stufen, von echten OpenFEMA-Schäden bis zu einem deterministischen Einreichungsurteil. Nichts ist fest verdrahtet.
Ein Ridge-Komposit aus echten OpenFEMA-Gebäudeattributen (Gebäudealter, Geschosszahl, Elevated-Indikator, post-FIRM-Code, Nutzungsart, Hindernis) wird auf einem 70%-Train-Split gefittet und auf dem zurückgehaltenen 30%-Test-Split bewertet. Die versicherte Deckung ist bewusst vom Score ausgeschlossen, weil die Zahlung mechanisch dadurch begrenzt ist, was den Backtest zirkulär machen würde. Die Baseline ist die echte ratedFloodZone und das Label ist der echte amountPaidOnBuildingClaim, beide unabhängig vom Modell.
Die zurückgehaltenen Schäden werden nach Komposit und nach FEMA-Zone rangiert, und die Engine berichtet die Erfassung von Schadendollars im obersten Dezil und Gini für jedes, zusammen mit einer exakten linearen Shapley-Attribution dessen, was den Score treibt. Ein fester Seed (SEED=9) macht den Split reproduzierbar, sodass derselbe Lauf dieselben Zahlen liefert.
Der Disparate-Impact-Screen läuft über jede bepreiste Variable, den Kompositscore selbst, die versicherte Gebäudedeckung und jedes Gebäudeattribut, gegen den realen Minderheitenanteil auf Tract-Ebene aus CDC/ATSDR SVI. Für jede Variable berechnet er das Adverse-Impact-Ratio und ob es innerhalb des EEOC-80%-Regel-Bands [0.80, 1.25] liegt.
Die Einreichung wird nur als bereit markiert, wenn die Hold-out-Stichprobe groß genug ist, der Komposit-Lift gegenüber der FEMA-Zone das erforderliche Minimum (1.10x oder höher) überschreitet und das Adverse-Impact-Ratio innerhalb des Bands liegt, plus einer Einreichungs-Checkliste je Bundesstaat. Wenn eine Variable durchfällt, gibt das Tor NOT FILING-READY aus, benennt den schlimmsten Verstoß und leitet ihn zur menschlichen versicherungsmathematischen Begründung weiter. Ablehnung als Default: filing_ready genau dann, wenn null blockierende Befunde.
Eine Pydantic-AI-Crew aus einem Faktor-Erklärer, einem Fairness-Justifier gepaart mit einem adversariellen Challenger und einem Verfasser des Einreichungs-Memos kann beraten, aber das Tor entscheidet. Kein API-Schlüssel ist erforderlich. Die Agenten enthalten sich, wenn keiner vorliegt, und die deterministische Demo bleibt unberührt. Jede vertrauenskritische Zahl lebt in schlichtem numpy außerhalb des Agenten-Frameworks.
Harris County, TX. Echte OpenFEMA-NFIP-Schäden. Jede Zahl unten wird live berechnet.
Auf den 40,615 zurückgehaltenen echten Schäden erfasst das Komposit 1.69x der Schadendollars im obersten Dezil der FEMA-Zonen-Baseline, mit Gini 0.31 gegen 0.08 der Zone. Weil der Score auf Train gefittet und auf dem Hold-out-Split gelesen wird und Baseline und Label beide unabhängig vom Modell sind, ist dies ein echtes Out-of-Sample-Ergebnis und kein selbstbenotetes.
Der Lift bleibt über Zufalls-Seeds hinweg robust etwa im Bereich 1.69x bis 1.85x, es ist also kein Glücks-Split. Der Geltungsbereich ist ein County-Portfolio und ein zurückgehaltener 30%-Split, und das sagen wir so.
Das Audit tut nicht so, als sei die KI das Problem. Der Kompositscore selbst besteht die 80%-Regel bei AIR 0.938, geprüft gegen reale CDC/ATSDR-SVI-Tracts. Aber der Screen läuft auf jeder bepreisten Variable, und 5 fallen durch: der schlimmste ist die Geschosszahl bei AIR 0.363, gefolgt von der Versicherungssumme bei 0.526 und, auffällig, FEMAs eigener Zonenstufe bei 1.467.
Ein Compliance-Risiko in den Daten zu erkennen, bevor der Prüfer es tut, ist der Wert. Das Tor verweigert dann die Markierung als einreichungsbereit und leitet den schlimmsten Verstoß, die Geschosszahl, zur menschlichen versicherungsmathematischen Begründung weiter.
Dies ist eine Demo des Mechanismus, keine eingesetzte Pipeline. Hier ist genau, was real ist und was ein Stub.
| Komponente | In dieser Demo | Status |
|---|---|---|
| Schäden, Demografie, Geografie | OpenFEMA FimaNfipClaims (170,803 Datensätze, 135,381 bewertet), CDC/ATSDR SVI 2022, Census Gazetteer 2023 | Echt, öffentlich, kein API-Schlüssel |
| Scoring, Backtest, Fairness-Audit, Tor | Ridge-Komposit, Out-of-Sample-Lift und Gini, Disparate-Impact-Screen, deterministisches Policy-Tor | Echt, schlichtes numpy und Python |
| Vendor-Signal-Feeds (ZestyAI Z-FLOOD, ICEYE SAR-depth) | Adapter hinter einem echten Schema, auf dem Bildschirm als Stubs ausgewiesen | Stub, dokumentierter Produktionsaustausch |
| Guidewire- / Duck-Creek-Connector | Warmes Cached-Lookup an /api/score, Rückgabe in unter 50 ms | Stub, keine Live-Integration |
| Pydantic-AI-Crew (Faktor-Erklärer, Fairness-Justifier, Memo-Verfasser) | Nur beratende Narrative; enthält sich ohne API-Schlüssel | Optional, beratend, entscheidet nie |
Nein. FloodProof ist kein weiteres Hochwassermodell, das mit ZestyAI oder ICEYE konkurriert. Es ist die Integrations- und Nachweisschicht, die um jedes Modell sitzt, das Sie nutzen: ein nicht-zirkulärer Out-of-Sample-Backtest gegen die echte FEMA-Zonen-Baseline, ein Disparate-Impact-Audit auf jeder bepreisten Variable und ein deterministisches Tor, das das prüferfertige DOI-Einreichungspaket erzeugt oder es blockiert. Dieser Wert gilt bei jeder Modellqualität, weil ein besseres Modell, das sich selbst benotet, kein Nachweis ist und ein besseres Modell, das demografisches Signal trägt, eine Einreichung ist, die Ihr Prüfer ablehnt.
Der Backtest ist konstruktionsbedingt nicht-zirkulär. Das Komposit wird auf einem 70%-Train-Split gefittet und auf den zurückgehaltenen 30% bewertet, die es nie gesehen hat, die Baseline ist die echte von FEMA eingestufte Zone, und das Label sind die real ausgezahlten Schadendollars. Baseline und Label sind beide unabhängig vom Modell, und die versicherte Deckung ist bewusst ausgeschlossen, damit der Score nicht über die Zahlungsgrenze mogeln kann. Auf 40,615 zurückgehaltenen echten NFIP-Schäden erfasst das Komposit 1.69x der Schadendollars im obersten Dezil der FEMA-Zonen-Baseline (Gini 0.31 vs 0.08), und das Ergebnis bleibt über Zufalls-Seeds hinweg grob im Bereich 1.69x bis 1.85x.
Es verweigert die Markierung als einreichungsbereit. Das Policy-Tor ist deterministisches Python mit einer Invariante: filing_ready genau dann, wenn es null blockierende Befunde gibt. Auf diesem Harris-County-Portfolio besteht der Kompositscore selbst die 80%-Regel bei AIR 0.938, aber das Audit kennzeichnet 5 bepreiste Variablen, die durchfallen, schlimmste ist die Geschosszahl bei AIR 0.363. Das Tor gibt NOT FILING-READY aus, benennt den schlimmsten Verstoß und leitet ihn zur menschlichen versicherungsmathematischen Begründung weiter, statt einen diskriminierenden Tarif auszuliefern. Agenten beraten, Code entscheidet.
Echt. Die Demo läuft auf 170,803 rohen OpenFEMA-NFIP-Schadendatensätzen für Harris County, Texas, von denen 135,381 mit einem ausgezahlten Gebäudeschaden bewertet werden, plus echter CDC/ATSDR-SVI-2022-Tract-Demografie und dem Census Gazetteer 2023. Es sind öffentliche Daten ohne API-Schlüssel, beim ersten Lauf gecacht. Ein ehrlicher Vorbehalt, den die Demo auf dem Bildschirm ausweist: FEMA zensiert Schadens-Geokoordinaten grob auf den Tract-Zentroid, sodass der Backtest in der Auflösung läuft, die öffentliche Daten erlauben.
Nein, und die Demo sagt das auf dem Bildschirm. Die ZestyAI-Z-FLOOD- und ICEYE-SAR-depth-Feeds und der Guidewire Integration Data Manager Connector sind Stubs hinter einem echten Schema. Der Connector-Endpunkt ist ein warmes Cached-Lookup, das in unter 50 ms zurückkehrt, um die Inline-Quote-Bind-Integration konkret zu machen. Der Produktionsweg ist der dokumentierte Config-Tausch, kein Rewrite, und die ehrliche Aussage ist ein Stub, keine Live-Integration.
Nein. Das DOI-Einreichungspaket ist ein Evidenzartefakt, ein versicherungsmathematisches Memorandum, der Out-of-Sample-Backtest, Merkmalsattribution und eine Checkliste je Bundesstaat, keine Zertifizierung und keine Rechtsberatung. ‚Prüfer kann genehmigen‘ ist das Designziel, keine Garantie, dass irgendein Prüfer irgendetwas genehmigt hat. Kein Versicherer hat dies in Produktion genutzt, und es gibt keine Deployments, Kunden oder Fallstudien. Da 24 oder mehr Bundesstaaten das NAIC AI Model Bulletin übernehmen, ist der Punkt, dass das Tor den Nachweis erzeugt, den ein Prüfer verlangt, und ehrlich scheitert, wenn die Daten eine Einreichung nicht tragen.
Die Forschung hinter dieser Demo — die Architektur, das Verifikationsdesign und der Enterprise-Blueprint.
Die FEMA-Zone lässt Milliarden außerhalb ihrer Linien, und die Fairness-Prüfung ist jetzt Teil der Einreichung.
Wenn Ihr Team herausarbeitet, wie ein KI-Ratingfaktor vor einen DOI-Prüfer gebracht werden kann, ohne eine Variable auszuliefern, die die 80%-Regel nicht erfüllt, würden wir wirklich gern hören, wie Sie darüber denken. Das Problem ist branchenweit, und die Antworten werden es auch sein.