
בניתי מודל שיטפון שניצח את מפת FEMA. ואז הוא סירב לתת לי להגיש אותו.
לא ציפיתי שהרגע המעניין ביותר בבניית ההדגמה הזו יהיה כשהתוכנה אומרת לי לא.
היה לי פקטור דירוג קומפוזיט שדירג הפסדי שיטפון אמיתיים טוב יותר מאזור השיטפון של FEMA על נתונים שמעולם לא ראה. לפי כל אינסטינקט שיש לי כבונה, זה הניצחון. משגרים אותו. במקום זאת השלב האחרון בצינור האיר באדום והדפיס NOT FILING-READY, ציין בשמו את המשתנה הגרוע ביותר, וניתב אותו לאקטואר אנושי. הקוד שלי עצמו החליט שהתעריף שעליו התגאיתי אינו בטוח להגשה. ישבתי שם דקה והחלטתי אם זה באג או כל הנקודה.
זו הייתה כל הנקודה. החיבור הזה עוסק בסיבה שבגללה אני חושב כעת שהשער שמסרב להגיש שווה יותר מהמודל שעומד מאחוריו.
ההדגמה נקראת FloodProof. היא רצה על ספר ציבורי אמיתי של תביעות National Flood Insurance Program עבור מחוז האריס, טקסס, מ-OpenFEMA. כשאני לוחץ Re-run Diagnostic, תשעה שלבים רצים בזמן אמת על הרשומות האמיתיות ומסתיימים בפחות משנייה. שום דבר אינו מקודד קשיח. זרע קבוע הופך את הפיצול לניתן לשחזור, כך שהמספרים שאני עומד לצטט מחושבים מחדש בכל ריצה.

המספר הראשון שעצר אותי היה מספר שאף מודל לא ייצר
אני חוזר שוב ושוב לדמות הזו כי לא חישבתי אותה, התביעות חישבו. מתוך דולרי תביעות-המבנה האמיתיים ששולמו בספר מחוז האריס הזה, 3.1 מיליארד דולר, שהם 45.9%, שולמו על נכסים ש-FEMA דירגה מחוץ לאזורי הסיכון הגבוה שלה (אזור הסיכון המיוחד לשיטפון, Special Flood Hazard Area). אין מודל. אין ציון. רק סכום על פני הפנקס האמיתי. מפת האזורים, הדבר שעדיין מבטחים מעגנים אליו תעריפי שיטפון, הייתה שקטה לגבי כמעט מחצית הכסף שבאמת יצא מהדלת.
זה תאם את מה שקראתי לפני שהתחלתי. יותר משני שלישים מנזקי השיטפון בארה״ב מתרחשים מחוץ לאזורי הסיכון הגבוה של FEMA, ואחרי הוריקן הארווי בערך 70% מתביעות השיטפון במחוז האריס הגיעו מחוץ לאזורים האלה (מחקר מעמוד הפתרון של Veriprajna, 2026). האמנתי לזה כסטטיסטיקה. זה נוחת אחרת כשצופים בזה מצטבר על המסך שלך, tract אחר tract, כדולרים אמיתיים.

מפת האזורים לא הייתה מעט שגויה. היא הייתה שקטה לגבי 3.1 מיליארד דולר של הפסדים אמיתיים בספר מחוז בודד.
אז המפה היא כלי גס. כל מי שמתעסק בתמחור שיטפון כבר יודע את זה. התשובה של השוק הייתה לקנות מודל טוב יותר מספק. רציתי לדעת האם המודל הטוב יותר הוא באמת החלק הקשה, או האם החלק הקשה נמצא במקום שלא הסתכלתי בו.
האם שישה מאפייני מבנה פשוטים יכולים לנצח את מפת האזורים?
לא חשבתי שרגרסיית ridge רגילה תזיז את המחט הרבה. ליבת הדירוג היא במכוון לא מבריקה: קומפוזיט ridge של מאפייני מבנה אמיתיים מ-OpenFEMA, גיל המבנה, מספר הקומות, דגל הגבהה, עמידה בקוד post-FIRM, תפוסה, ומכשול. שישה מאפיינים כנים. האינסטינקט הראשון שלי היה גם להזין את כיסוי המבנה המבוטח, כי כיסוי מתואם עם תשלום. תפסתי את עצמי. התשלום מוגבל מכנית על ידי הכיסוי, אז הכללתו הייתה מאפשרת לציון לרמות ולשאוב מהתשובה ולהפוך את הבדיקה החוזרת למעגלית. חתכתי אותו. המחיקה הבודדת הזו היא ההבדל בין הדגמה לתעלול קסמים.
הבדיקה החוזרת בנויה להיות לא-מעגלית. מתאימים את הקומפוזיט על פיצול אימון של 70%. מדרגים אותו על ה-30% המוחזקים שמעולם לא ראה, שהם 40,615 תביעות אמיתיות. משווים אותו מול ה-ratedFloodZone האמיתי כקו הבסיס ומול ה-amountPaidOnBuildingClaim האמיתי כתווית. גם קו הבסיס וגם התווית בלתי תלויים במודל, כך שניצחון הוא ניצחון אמיתי מחוץ למדגם, לא ניצחון שמדורג עצמית.

זה ניצח ביותר ממה שציפיתי. הקומפוזיט תפס פי 1.694 מדולרי ההפסד בעשירון העליון של אזור FEMA על התביעות המוחזקות, עם Gini של 0.31 מול 0.08 של האזור. הרצתי שוב על פני זרעים אקראיים כדי לוודא שלא קיבלתי פיצול בר-מזל. העלייה החזיקה, בערך 1.69 עד 1.85 על פני זרעים. שישה מאפיינים פשוטים, מותאמים בכנות, ניצחו את מפת השיטפון הפדרלית על כסף שמעולם לא ראו.
וזה בדיוק המקום שבו כמעט עשיתי את הטעות שכל השוק עושה.
ההבנה שמיסגרה מחדש את כל הבנייה
אני זוכר שחשבתי שההדגמה בעצם הסתיימה בנקודה הזו, והייתי טועה בכך. מודל טוב יותר שמדרג את עצמו אינו ראיה. אם אני מוסר לאקטואר ראשי פקטור ואומר "תסמוך עליי, הוא מנצח את האזור," מסרתי להם את שיעורי הבית עם הציון שלי עצמי כתוב מעליו. הערך לעולם לא היה המודל. ספקים כמו ZestyAI ו-ICEYE ו-First Street כבר מוכרים מודלי שיטפון חזקים. הדבר העמיד הוא התשתית המשעממת סביב כל מודל: בדיקה חוזרת שספקן לא יכול לדחות, ביקורת הוגנות שהמודל לא יכול לדבר את דרכו מעבר לה, ושער שמפיק את ההגשה או מסרב. זה מחזיק בכל איכות מודל, וזו הסיבה שזה לא מתיישן כשהמודלים משתפרים. אפשר לראות את המנגנון ואת הגילויים הכנים בעצמכם ב-veriprajna.com/he/demos/flood-risk-underwriting.
מודל טוב יותר שמדרג את עצמו אינו ראיה. זה שיעורי הבית שלכם עם הציון שלכם עצמכם מעליהם.
יש סיבה שנייה, קשה יותר, שבגללה המודל לא יכול להיות כל הסיפור. פקטור שמדרג הפסד היטב יכול גם לשאת אות דמוגרפי, ותעריף שנכשל במבחן השפעה מפלה הוא הגשה שבוחן מחלקת הביטוח דוחה. לדרג היטב ולהיות בר-הגשה הן שתי שאלות שונות. עניתי על הראשונה. השנייה חיכתה.
כיוונתי את ביקורת ההוגנות אל המודל שלי עצמי וציפיתי שהוא יהיה הנבל
באמת התכוננתי לכך שהקומפוזיט שלי יהיה הבעיה. הביקורת בודקת כל משתנה מתומחר מול חלק המיעוטים ברמת ה-tract האמיתי ממדד הפגיעות החברתית של CDC/ATSDR (מהדורת 2022), מחשבת יחס השפעה שלילית לכל אחד, ובודקת אותו מול כלל ארבע-חמישיות של ה-EEOC, הטווח מ-0.80 עד 1.25 (29 CFR 1607.4(D)). הנחתי שציון הבינה המלאכותית הנוצץ יהיה זה שנושא את הפרוקסי הדמוגרפי.
זה לא היה. ציון הקומפוזיט עצמו עובר ביחס השפעה שלילית של 0.938. לא בניתי את ההדגמה כדי להעמיד פנים שהמודל שלי הוא הרע, והוא אינו. אבל הביקורת בודקת הכול, ו-5 מתוך המשתנים המתומחרים נכשלים בכלל ה-80%. הגרוע ביותר הוא מספר הקומות ב-0.363. ערך מבוטח נכשל ב-0.526. והאחד שבאמת הפתיע אותי: דרגת האזור של FEMA עצמה נכשלת ב-1.467, גרוע יותר בצד הגבוה מאשר הקומפוזיט שלי בכל צד. קו הבסיס שכולם מתייחסים אליו כעוגן הבטוח, הנייטרלי, המבורך על ידי הרגולטור נושא יותר הטיה דמוגרפית מפקטור הבינה המלאכותית שאנשים עצבניים לגביו.

פקטור הבינה המלאכותית שלי עבר את מבחן ההוגנות ב-0.938. דרגת האזור של FEMA נכשלה בו ב-1.467.
ההיפוך הזה הוא הדבר שאני הכי רוצה שאקטואר יישב איתו. האינסטינקט לא לסמוך על המודל ולסמוך על המפה הוא הפוך בספר הזה.
הוא חסם את עצמו לפני שיכולתי להגיש אותו
אני רוצה להיות מדויק לגבי מה שקרה אחר כך, כי זה החלק שאני הכי גאה בו והוא קוד לא דרמטי לחלוטין. שער המדיניות הוא Python טהור עם כלל אחד: ההגשה מוכנה רק אם המדגם המוחזק גדול מספיק, העלייה על אזור FEMA עוברת מינימום נדרש, וכל משתנה שנבדק יושב בתוך פס ההוגנות. דחייה כברירת מחדל. filing_ready אם ורק אם יש אפס ממצאים חוסמים. בספר הזה משתנה נכשל, אז השער החזיר NOT FILING-READY, ציין את מספר הקומות כעבריין הגרוע ביותר, וניתב אותו להצדקה אקטוארית אנושית במקום לשגר את התעריף. הוא גם הריץ רשימת בדיקה לפי מדינה, ודרישת ההצדקה לפי משתנה של קולורדו הופיעה כלא שלמה.
החלק האופציונלי בערימה הוא צוות קטן של סוכני Pydantic-AI, מסביר פקטורים, מצדיק הוגנות מזווג עם מתחרה אדברסרי, ומנסח מזכר הגשה. הם מייעצים. הם מנסחים את הנרטיב. הם לא יכולים לעקוף את השער, ובלעדי מפתח API הם פשוט נמנעים והתוצאה הדטרמיניסטית נשארת ללא שינוי. כל מספר קריטי לאמון הוא numpy פשוט שיושב מחוץ למסגרת הסוכנים. סוכנים מייעצים, הקוד מחליט. הזנות הספקים (ZestyAI Z-FLOOD, ICEYE SAR-depth) ומחבר ה-Guidewire בבנייה הזו הם stubs מאחורי סכמה אמיתית, החלפת הייצור המתועדת, לא אינטגרציה חיה. אני מעדיף לומר זאת בבירור מאשר לרמוז על צינור שאינו שם. החבילה המלאה, כולל ארטיפקט ההגשה, נמצאת ב-veriprajna.com/he/demos/flood-risk-underwriting.
מה שהשער מפיק כשהוא כן מסרב אינו מבוי סתום. זהו חבילת הגשה ל-DOI מוכנה לבוחן: המזכר האקטוארי, טבלת הבדיקה החוזרת מחוץ למדגם, ייחוס המאפיינים, בדיקת ההוגנות, וההצהרה המפורשת על מה שנותב לבן אדם ולמה. זהו ארטיפקט ראיה, לא הסמכה, ולא הבטחה שכל בוחן אישר משהו. זהו שובל הנייר שבוחן מבקש, מורכב לפני שהוא מבקש.
אני ממשיך לקרוא לזה תפיסת סיכון הציות לפני שהבוחן עושה זאת. זה ערך הקונה בשורה אחת. החלופה היא לגלות שהתעריף שלכם מפלה אחרי שהגשתם אותו, במכתב, בפומבי.
מה שאני ממשיך לשבת איתו
נכנסתי לבנייה הזו בהנחה שאני בונה מודל שיטפון טוב יותר, ויצאתי משוכנע שהמודל היה החלק שפחות חשוב מכולם. הגילויים הכנים חשובים יותר מהדיוק. FEMA מצנזרת את הקואורדינטות הגיאוגרפיות של התביעות בערך למרכז ה-tract, אז זה רץ ברזולוציה שנתונים ציבוריים מאפשרים בכנות, וההדגמה אומרת זאת על המסך. העלייה היא ספר מחוז האריס אחד ופיצול מוחזק אחד, לא ערבות לעולם פתוח. לנקוב בשם המגבלות האלה אינו חולשה במסר. זה המסר.
כשיותר מ-24 מדינות מאמצות את בולטין מודל ה-AI של NAIC, ו-Circular Letter 2024-7 של ה-DFS של ניו יורק הופך בדיקת אפליה-באמצעות-פרוקסי לציפייה ולא לנימוס, הקוד שמסרב להגיש מפסיק להיות ניירת ומתחיל להיות המוצר. פקטור הדירוג מעולם לא היה החלק הקשה. להוכיח אותו ולמשול בו היה.
ואם תעדיפו לראות אותו מחליט מאשר להאמין לי על המילה, הנה הכול רץ מקצה לקצה.
אז הנה השאלה שעדיין לא עניתי לעצמי במלואה, ואשמח באמת לשמוע את נקודת המבט של אקטואר. אם הביקורת שלכם עצמכם אמרה לכם שדרגת אזור FEMA שעגנתם אליה תעריפים במשך שנים נכשלת באותו מבחן הוגנות שאתם עומדים להחיל על פקטור בינה מלאכותית חדש, באיזה מהם תפסיקו לסמוך קודם?


