Der Bau von FloodProof zeigte: Der Flutfaktor war leicht. Der Out-of-Sample-Beweis und das Gate gegen einen diskriminierenden Tarif waren der schwere Teil.
InsurtechMachine LearningAI Governance

Ich baute ein Flutmodell, das die FEMA-Karte schlug. Dann weigerte es sich, mich einreichen zu lassen.

Ashutosh SinghalAshutosh Singhal26. Juni 202611 min

Ich hatte nicht erwartet, dass der interessanteste Moment beim Bau dieser Demo der Moment sein würde, in dem die Software mir Nein sagt.

Ich hatte einen Composite-Ratingfaktor, der echte Flutschäden besser rangierte als die FEMA-Überschwemmungszone auf Daten, die er nie gesehen hatte. Nach jedem Instinkt, den ich als Builder habe, ist das der Sieg. Man liefert ihn aus. Stattdessen leuchtete die letzte Stufe der Pipeline rot auf und druckte NICHT EINREICHUNGSBEREIT, benannte die einzelne schlechteste Variable und leitete sie an einen menschlichen Aktuar. Mein eigener Code hatte entschieden, dass der Tarif, auf den ich stolz war, nicht sicher einzureichen war. Ich saß eine Minute da und überlegte, ob das ein Bug war oder der ganze Punkt.

Es war der ganze Punkt. Dieser Text handelt davon, warum ich inzwischen denke, dass das Gate, das sich weigert einzureichen, mehr wert ist als das Modell dahinter.

Die Demo heißt FloodProof. Sie läuft auf einem echten öffentlichen Bestand von Schadensmeldungen des National Flood Insurance Program für Harris County, Texas, von OpenFEMA. Wenn ich auf Re-run Diagnostic klicke, führen neun Stufen live auf den echten Datensätzen aus und sind in unter einer Sekunde fertig. Nichts ist hardcodiert. Ein fester Seed macht den Split reproduzierbar, sodass die Zahlen, die ich gleich zitiere, bei jedem Lauf neu berechnet werden.

FloodProof führt seine neunstufige Pipeline live auf 170.803 echten NFIP-Datensätzen für Harris County aus und endet am deterministischen Policy-Gate mit der Markierung NICHT EINREICHUNGSBEREIT, wobei Stockwerke an einen Menschen weitergeleitet werden.
Die Live-Pipeline: 170.803 echte OpenFEMA-Schadensdatensätze hinein, 135.381 mit einem bezahlten Gebäudeschaden bewertet, und die letzte Stufe ist ein deterministisches Gate, das NICHT EINREICHUNGSBEREIT zurückgibt und Stockwerke an einen menschlichen Aktuar weiterleitet.

Die erste Zahl, die mich stoppte, hat kein Modell erzeugt

Ich komme immer wieder auf diese Zahl zurück, weil ich sie nicht berechnet habe — die Claims haben es getan. Von den tatsächlich ausgezahlten Gebäudeschaden-Dollars in diesem Harris-County-Bestand entfielen 3,1 Milliarden $, das sind 45,9 %, auf Objekte, die die FEMA außerhalb ihrer Hochrisikozonen eingestuft hatte (der Special Flood Hazard Area). Kein Modell. Kein Score. Nur eine Summe über das echte Hauptbuch. Die Zonenkarte, das, woran Versicherer ihre Fluttarife immer noch verankern, war bei fast der Hälfte des Geldes stumm, das tatsächlich hinausging.

Das passte zu dem, was ich vorher gelesen hatte. Mehr als zwei Drittel der US-Flutschäden entstehen außerhalb der Hochrisikozonen der FEMA, und nach Hurrikan Harvey stammten rund 70 % der Flutschadensmeldungen in Harris County von außerhalb dieser Zonen (Veriprajna-Solution-Page-Research, 2026). Als Statistik glaubte ich es. Es trifft anders, wenn man es Trakt für Trakt als echte Dollars auf dem eigenen Bildschirm anwachsen sieht.

Die FloodProof-Karte umgeschaltet auf die KI-Composite-Ansicht, goldene Ringe markieren Objekte, die die FEMA als sicher einstufte und die dennoch echte Hochrisikoschäden trugen, mit $3125.0M und 45,9 % der Schadensdollar außerhalb der FEMA-Hochrisikozonen.
Schalten Sie die Karte von der FEMA-Zone auf den KI-Composite um, und die goldenen Ringe erscheinen: echte Claims, die die FEMA außerhalb ihrer Hochrisikolinien einstufte und die der Composite als hochriskant bewertet. Die unmodellierte Schlagzeile sitzt in der Ecke, $3125.0M, 45,9 % der ausgezahlten Dollars, außerhalb der Zonen.
Die Zonenkarte war nicht leicht daneben. Sie schwieg zu 3,1 Milliarden $ echter Verluste in einem einzigen County-Bestand.

Die Karte ist also ein stumpfes Instrument. Jeder in der Flutpreisgestaltung weiß das bereits. Die Antwort des Marktes war, ein besseres Modell von einem Anbieter zu kaufen. Ich wollte wissen, ob das bessere Modell tatsächlich der schwere Teil war — oder ob der schwere Teil irgendwo lag, wo ich nicht hinsah.

Könnten sechs schlichte Gebäudeattribute die Zonenkarte schlagen?

Ich dachte nicht, dass gewöhnliche Ridge-Regression die Nadel viel bewegen würde. Der Scoring-Kern ist bewusst unspektakulär: ein Ridge-Composite aus echten OpenFEMA-Gebäudeattributen — Gebäudealter, Anzahl der Stockwerke, ein Elevated-Flag, post-FIRM-Codekonformität, Nutzungsart und Obstruction. Sechs ehrliche Features. Mein erster Impuls war, auch die versicherte Gebäudedeckung einzuspeisen, weil Deckung mit der Auszahlung korreliert. Ich erwischte mich. Die Zahlung ist mechanisch durch die Deckung begrenzt, also würde ihre Aufnahme dem Score erlauben, von der Antwort abzuschreiben und den Backtest zirkulär machen. Ich strich sie. Diese eine Streichung ist der Unterschied zwischen einer Demo und einem Zaubertrick.

Der Backtest ist so gebaut, dass er nicht zirkulär ist. Fit des Composite auf einem 70%-Trainings-Split. Scoring auf den zurückgehaltenen 30 %, die er nie gesehen hat, das sind 40.615 echte Claims. Vergleich mit der echten ratedFloodZone als Baseline und der echten amountPaidOnBuildingClaim als Label. Sowohl die Baseline als auch das Label sind unabhängig vom Modell, sodass ein Sieg ein echter Out-of-Sample-Sieg ist, kein selbst bewerteter.

Das Out-of-Sample-Lift-Chart in FloodProof: Der KI-Composite erfasst das 1,694-Fache der Top-Dezil-Schadensdollar der FEMA-Zone über 40.615 zurückgehaltene Claims, wobei der Composite-Balken weit über dem nur-FEMA-Zone-Balken liegt.
Das Hold-out-Ergebnis: Bei 40.615 echten Claims erfasst der Composite das 1,694-Fache der Top-Dezil-Schadensdollar der FEMA-Zonen-Baseline, Gini 0,31 gegenüber 0,08 der Zone. Gefittet auf 70 % der echten Claims, gescored auf den 30 %, die er nie gesehen hat.

Er gewann stärker, als ich erwartet hatte. Der Composite erfasste das 1,694-Fache der Top-Dezil-Schadensdollar der FEMA-Zone bei den Hold-out-Claims, mit einem Gini von 0,31 gegenüber 0,08 der Zone. Ich ließ ihn über Zufalls-Seeds erneut laufen, um sicherzustellen, dass ich keinen Glücks-Split gezogen hatte. Der Lift hielt, grob 1,69 bis 1,85 über die Seeds. Sechs schlichte Attribute, ehrlich gefittet, schlugen die bundesweite Flutkarte bei Geld, das sie nie gesehen hatte.

Und genau dort hätte ich beinahe denselben Fehler gemacht, den der ganze Markt macht.

Die Einsicht, die den gesamten Build neu ausrichtete

Ich erinnere mich, damals zu denken, die Demo sei im Grunde fertig — und damit falsch zu liegen. Ein besseres Modell, das sich selbst benotet, ist kein Beleg. Wenn ich einem Chief Actuary einen Faktor reiche und sage „vertrau mir, er schlägt die Zone“, habe ich ihm meine Hausaufgabe mit meiner eigenen Note oben drauf gereicht. Der Wert würde nie das Modell sein. Anbieter wie ZestyAI und ICEYE und First Street verkaufen bereits starke Flutmodelle. Das Dauerhafte ist die langweilige Infrastruktur um jedes Modell herum: ein Backtest, den ein Skeptiker nicht abtun kann, ein Fairness-Audit, an dem das Modell sich nicht vorbeireden kann, und ein Gate, das die Einreichung erzeugt oder verweigert. Das gilt bei jeder Modellqualität, weshalb es nicht veraltet, wenn die Modelle besser werden. Den Mechanismus und die ehrlichen Offenlegungen können Sie selbst sehen unter veriprajna.com/de/demos/ki-gestutztes-hochwasserrisiko-underwriting.

Ein besseres Modell, das sich selbst benotet, ist kein Beleg. Es ist Ihre Hausaufgabe mit Ihrer eigenen Note oben drauf.

Es gibt einen zweiten, härteren Grund, warum das Modell nicht die ganze Geschichte sein kann. Ein Faktor, der Schaden gut rangiert, kann auch demografisches Signal tragen, und ein Tarif, der einen Disparate-Impact-Test nicht besteht, ist eine Einreichung, die der Prüfer des Department of Insurance ablehnt. Gut rangieren und einreichungsfähig sein sind zwei verschiedene Fragen. Die erste hatte ich beantwortet. Die zweite wartete.

Ich richtete das Fairness-Audit auf mein eigenes Modell und erwartete, dass es der Bösewicht wäre

Ich stellte mich wirklich darauf ein, dass mein Composite das Problem sein würde. Das Audit prüft jede bepreiste Variable gegen den realen Minderheitenanteil auf Trakt-Ebene aus dem CDC/ATSDR Social Vulnerability Index (Release 2022), berechnet für jede ein Adverse-Impact-Ratio und prüft es gegen die EEOC-Vier-Fünftel-Regel, die Bandbreite von 0,80 bis 1,25 (29 CFR 1607.4(D)). Ich nahm an, der auffällige KI-Score wäre der, der den demografischen Proxy trägt.

Er war es nicht. Der Composite-Score selbst besteht mit einem Adverse-Impact-Ratio von 0,938. Ich habe die Demo nicht gebaut, um so zu tun, als wäre mein eigenes Modell der Bösewicht — und das ist es nicht. Aber das Audit prüft alles, und 5 der bepreisten Variablen scheitern an der 80%-Regel. Die schlechteste ist die Anzahl der Stockwerke mit 0,363. Der Versicherungswert scheitert mit 0,526. Und die, die mich wirklich überraschte: Die eigene Zonenstufe der FEMA scheitert mit 1,467, auf der hohen Seite schlechter als mein Composite auf irgendeiner Seite. Die Baseline, die alle als den sicheren, neutralen, regulatorisch gesegneten Anker behandeln, trägt mehr demografische Schiefe als der KI-Faktor, vor dem die Leute nervös sind.

Das FloodProof-Compliance-Zertifikat: Composite-Score besteht die 80%-Regel bei AIR 0,938, fünf bepreiste Variablen scheitern einschließlich Stockwerke bei 0,363, versicherte Deckung bei 0,526 und FEMA-Zonenstufe bei 1,467, mit dem Urteil NICHT EINREICHUNGSBEREIT.
Jede bepreiste Variable geprüft gegen echte CDC-SVI-Trakte. Der Composite besteht mit 0,938. Fünf scheitern: Stockwerke 0,363, versicherte Deckung 0,526, die eigene Zonenstufe der FEMA 1,467. Das Gate markiert die Einreichung daraufhin als NICHT EINREICHUNGSBEREIT und leitet Stockwerke zur menschlichen aktuariellen Begründung weiter.
Mein KI-Faktor bestand den Fairness-Test mit 0,938. Die Zonenstufe der FEMA scheiterte mit 1,467.

Diese Umkehrung ist das, womit ein Aktuar am meisten sitzen sollte. Der Instinkt, dem Modell zu misstrauen und der Karte zu vertrauen, hat es bei diesem Bestand genau falsch herum.

Es blockierte sich selbst, bevor ich es einreichen konnte

Ich will präzise sein, was als Nächstes geschah, denn es ist der Teil, auf den ich am stolzesten bin, und es ist völlig undramatischer Code. Das Policy-Gate ist reines Python mit einer Regel: Die Einreichung ist nur bereit, wenn die Hold-out-Stichprobe groß genug ist, der Lift über der FEMA-Zone ein gefordertes Minimum übertrifft und jede geprüfte Variable innerhalb der Fairness-Bandbreite liegt. Ablehnen als Default. filing_ready genau dann, wenn es null blockierende Befunde gibt. Bei diesem Bestand scheiterte eine Variable, also gab das Gate NICHT EINREICHUNGSBEREIT zurück, benannte Stockwerke als den schlimmsten Übeltäter und leitete sie zur menschlichen aktuariellen Begründung weiter, statt den Tarif auszuliefern. Es lief auch eine Checkliste pro Bundesstaat, und Colorados Anforderung einer Begründung pro Variable erschien als unvollständig.

Der optionale Teil des Stacks ist eine kleine Crew von Pydantic-AI-Agenten: ein Factor-Explainer, ein Fairness-Justifier gepaart mit einem adversariellen Challenger und ein Filing-Memo-Drafter. Sie beraten. Sie entwerfen die Narrative. Sie können das Gate nicht überstimmen, und ohne API-Key enthalten sie sich einfach, und das deterministische Ergebnis bleibt unverändert. Jede vertrauenskritische Zahl ist schlichtes numpy außerhalb des Agenten-Frameworks. Agenten beraten, Code entscheidet. Die Anbieter-Feeds (ZestyAI Z-FLOOD, ICEYE SAR-depth) und der Guidewire-Konnektor in diesem Build sind Stubs hinter einem echten Schema — der dokumentierte Produktions-Swap, keine Live-Integration. Das sage ich lieber klar, als eine Leitung zu implizieren, die nicht da ist. Das vollständige Paket, Einreichungsartefakt und alles, liegt unter veriprajna.com/de/demos/ki-gestutztes-hochwasserrisiko-underwriting.

Was das Gate erzeugt, wenn es sich weigert, ist keine Sackgasse. Es ist ein prüferfertiges DOI-Einreichungspaket: das aktuarielle Memorandum, die Out-of-Sample-Backtest-Tabelle, die Feature-Attribution, der Fairness-Screen und die ausdrückliche Aussage, was an einen Menschen weitergeleitet wurde und warum. Es ist ein Evidenzartefakt, keine Zertifizierung und kein Versprechen, dass irgendein Examiner irgendetwas genehmigt hat. Es ist die Papierakte, die ein Examiner verlangt — zusammengestellt, bevor er fragt.

Ich nenne das immer wieder, das Compliance-Risiko zu fangen, bevor der Examiner es tut. Das ist der Käufernutzen in einer Zeile. Die Alternative ist, herauszufinden, dass Ihr Tarif diskriminierend ist, nachdem Sie ihn eingereicht haben — in einem Brief, öffentlich.

Womit ich weiterhin sitze

Ich kam in diesen Build mit der Annahme, ich baue ein besseres Flutmodell, und ich ging überzeugt, dass das Modell der Teil war, der am wenigsten zählte. Die ehrlichen Offenlegungen zählen mehr als die Genauigkeit. Die FEMA zensiert die Claim-Geokoordinaten grob auf den Trakt-Zentroid, also läuft dies in der Auflösung, die öffentliche Daten ehrlich zulassen, und die Demo sagt das auf dem Bildschirm. Der Lift ist ein Harris-County-Bestand und ein Hold-out-Split, keine Open-World-Garantie. Diese Grenzen zu benennen ist keine Schwäche im Pitch. Es ist der Pitch.

Während mehr als 24 Bundesstaaten das NAIC AI Model Bulletin übernehmen und New York DFS Circular Letter 2024-7 Proxy-Diskriminierungstests zu einer Erwartung statt einer Höflichkeit macht, hört der Code, der sich weigert einzureichen, auf, Papierkram zu sein, und beginnt, das Produkt zu sein. Der Ratingfaktor war nie der schwere Teil. Ihn zu beweisen und zu steuern war es.

Und wenn Sie lieber zusehen möchten, wie es entscheidet, statt mir das Wort abzunehmen: Hier läuft das Ganze von Ende zu Ende.

Hier also die Frage, die ich für mich selbst noch nicht vollständig beantwortet habe, und ich würde wirklich gerne die Einschätzung eines Aktuars hören. Wenn Ihr eigenes Audit Ihnen sagte, dass die FEMA-Zonenstufe, an der Sie jahrelang Tarife verankert haben, denselben Fairness-Test nicht besteht, den Sie gleich auf einen neuen KI-Faktor anwenden wollen — welcher von beiden verlieren Sie zuerst das Vertrauen?

Verwandte Forschung

Auch veröffentlicht auf

Entwickeln Sie Ihre KI mit Zuversicht.

Arbeiten Sie mit einem Team zusammen, das über umfassende Erfahrung im Aufbau der nächsten Generation von Unternehmens-KI verfügt. Wir helfen Ihnen, eine KI-Strategie zu entwerfen, zu entwickeln und einzuführen, der Sie vertrauen können.

Veriprajna Deep-Tech-Beratung ist auf die Entwicklung sicherheitskritischer KI-Systeme für die Bereiche Gesundheitswesen, Finanzen und Regulierung spezialisiert. Unsere Architekturen werden anhand etablierter Protokolle validiert und mit umfassender Compliance-Dokumentation belegt.