בבניית TriggerProof, שכבת פסיקה לטריגרים פרמטריים של שיטפונות, גיליתי שהכשל האמיתי הוא תוצאה חיובית שגויה, ו-verifier פיזיקלי דטרמיניסטי תופס אותה.
Parametric InsuranceRemote SensingFlood Risk

לוויין קבע שמסוף היה מתחת למים. זה היה צל של ענן, והטריגר הפרמטרי היה במרחק לחיצה אחת מתשלום אוטומטי של 1.2 מיליון דולר.

Ashutosh SinghalAshutosh Singhal12 ביולי 202612 min

לוויין הביט במסוף Mesa Junction Depot, ראה כתם כהה במקום שבו הייתה אמורה להיות קרקע יבשה, וסימן את המיקום כמוצף. פוליסת שיטפונות פרמטרית קראה את הטריגר הזה כעובדה ודרכה תשלום פיצויים של 1.2 מיליון דולר שיופעל אוטומטית – ללא שמאי, ללא שיחת טלפון, ללא בדיקה חוזרת. הכתם הכהה היה צילו של ענן. כעבור שישה ימים הוא נעלם מן הדימות, והקרקע שמתחתיו מעולם לא הייתה רטובה.

בניתי את המקרה המדויק הזה בכוונה, מכיוון שזהו המקרה שפריים לוויין יחיד לעולם אינו יכול לתפוס. אני אשוטוש (Ashutosh), ואני מנהל את Veriprajna. ‏TriggerProof היא הדגמה שבניתי כדי להוכיח טענה ספציפית: הרגע המסוכן בביטוח שיטפונות פרמטרי אינו הגילוי, אלא ההחלטה לשלם. כל מיקום, אריח (tile), מד מפלס נהר ודוח שטח בה הם תחליפים סינתטיים הנאמנים לחוקי הפיזיקה, שכתבתי כדי שאוכל להמחיש את מצבי הכשל באופן נקי. אתם יכולים לפתוח אותה ולהתנסות בה בעצמכם בכתובת veriprajna.com/he/demos/satellite-flood-intelligence. מסוף Mesa Junction Depot הוא המקום שבו אני רוצה להתחיל, מפני שזהו המקרה שלימד אותי מה בעצם בניתי.

ארבעה דברים שונים מחשיכים את אותם הפיקסלים

לא הבנתי את מלוא חומרת הבעיה עד שהתיישבתי ליצור את הדימות הסינתטי ונאלצתי לגרום לארבעה דברים שונים להיראות זהים בפריים אחד. ביטוח שיטפונות פרמטרי החליף את שמאי הנזקים בטריגר: לוויין קובע שמיקום מסוים נמצא מתחת למים, וכסף מועבר. הבעיה היא שבתמונה אופטית בודדת או במעבר מכ"ם יחיד, מי שיטפון אמיתיים, צל ענן, צל מכ"ם או צל טופוגרפי ומאגר מים קבוע – כולם מתכהים בדיוק באותו האופן. פריים יחיד אינו יכול להבדיל ביניהם, מפני שהמידע שמבדיל ביניהם אינו מתקיים בפריים בודד.

זה שינה לחלוטין את מסגור ההדגמה מבחינתי. השגיאה הקטסטרופלית בתחום הזה אינה השיטפון שהטריגר מחמיץ. זהו השיטפון שהטריגר ממציא, תשלום בטוח בעצמו של 2 מיליון דולר על צל, ללא שום נתיב ראיות להגנה על ההחלטה כאשר מבטח-משנה מבקש הסבר שנה לאחר מכן. TriggerProof אינה מזהה שיטפונות ואינה מייצרת נתוני לוויין. היא מקבלת טריגר שכבר הופעל ופוסקת האם הוא אכן צריך לשלם.

פריים אחד אמר שיטפון; הפריים הבא אמר שהקרקע מעולם לא הייתה רטובה

אני עדיין זוכר את המעבר שלב אחר שלב על רצועת הפריימים (filmstrip) של Mesa Junction בפעם הראשונה שבה היא רונדרה כראוי. הממשק מאפשר לפתוח מיקום שסומן ולעבור על פריימי הרכישה בזה אחר זה, תמונה אופטית למעלה ומכ"ם למטה. בפריים הטריגר, הכתם הכהה נמצא בדיוק שם, ירוק המעיד על אות מים, בדיוק מה שהפעיל את האזעקה. עוברים לרכישה הבאה והוא נעלם. חוזרים לאחור ופיזור המכ"ם החוזר תחת אותו כתם נקרא תקין בכל פריים, מפני שהמכ"ם ראה קרקע יבשה ישר דרך הענן לאורך כל הזמן.

רצועת הפריימים הזמנית של AOI-B עבור מסוף Mesa Junction Depot: הכתם הכהה האופטי מופיע רק בפריים הטריגר t+0 ונעדר ב-t-6d וב-t+6d, בעוד ששורת ה-SAR נותרת אחידה בכל שלושת הפריימים, מסווג כצל ענן ברמת ביטחון 1.00.
מסוף Mesa Junction Depot, מקרה ה-1.2 מיליון דולר. הכתם הכהה האופטי מופיע רק בפריים הטריגר (התמדה בזמן של 33%) ופיזור המכ"ם החוזר נשאר תקין לכל אורך הדרך. כלל R1 נכשל, כלל R2 נכשל, ופסק הדין הוא צל ענן, לא מים.
הצל זז; המים היו נשארים. את זה רואים רק לאורך זמן וברוחב חיישנים שונים, לעולם לא בפריים הבודד שהפעיל את הטריגר.

הפיזיקה אינה מורכבת ברגע שמניחים את הפריימים זה לצד זה. צל ענן הוא חולף והוא נע במהירות הענן, כך שהוא כהה ברכישה אחת ונעלם ברכישה הבאה. מי שיטפון אמיתיים מתמידים לאורך רכישות, ונקראים כהים באופטי ונמוכים במכ"ם בו-זמנית. שני כללים מקודדים בדיוק את זה: התמדה בזמן (temporal persistence) והתאמה בין מכ"ם לאופטי (radar-optical agreement). במקרה של Mesa Junction שניהם מחזירים FAIL, והמסווג נוחת על צל ענן ברמת ביטחון 1.00. סכום ה-1.2 מיליון דולר מעולם לא היה צריך להיכנס לתור לתשלום.

חמשת הכללים מחליטים, לא מודל השפה

ניסיתי, בשלב מוקדם, לתת למודל השפה לקבל את ההחלטה הזו, ואני שמח שעשיתי זאת כי הוא נכשל באופן המאלף ביותר שניתן להעלות על הדעת. הפעלתי סוכן שקרא את אותן הראיות ושאלתי אותו, למעשה, האם המיקום אכן מוצף. במקרה מעורפל הוא כתב לי פסקה רהוטה ומלאת ביטחון שטענה לקיומו של שיטפון, והוא טעה, ושום דבר בטון שלו לא רמז על כך שהוא טועה. אותו אחר צהריים חתם החלטה ארכיטקטונית שלא פתחתי מחדש מאז.

לכן ההחלטה מתקיימת ב-Python פשוט, בחמישה מסווגים מבחינים הניתנים לבדיקה, ללא שום מודל בשום שלב בנתיב שמעביר כסף. התמדה בזמן (R1) מפרידה בין שיטפון לבין צל ענן חולף. התאמה בין מכ"ם לאופטי (R2) מפרידה בין שיטפון לבין צל ענן וצל מכ"ם כאחד. שיפוע DEM ‏(R3) פוסל מים שיידרשו להצטבר בתוואי שטח תלול. מסכת מים קבועים (R4) מחריגה מאגרי מים מוכרים. קישוריות הידרולוגית (R5) בודקת שהאזור הרטוב אכן מתחבר לרשת הניקוז. ה-verifier מחליט; מודל השפה רק מייעץ. סוכן הייעוץ בנוי על גבי Pydantic AI, בעל מודל הניתן להחלפה, עם ברירת מחדל של claude-opus-4-8, והוא בודק את פסק הדין הפיזיקלי מול אותות קרקע עצמאיים ומחזיר corroborates (מאשש), contradicts (סותר) או inconclusive (בלתי חד-משמעי). ניתן לעקוף אותו, וכאשר אני מסיר את מפתח ה-API ההדגמה פועלת באופן לא מקוון לחלוטין על מנגנון גיבוי דטרמיניסטי, מפני שהחלק שאני מפקיד בידיו תשלום אינו יכול להיות החלק שמדבר בפסקאות בטוחות בעצמן.

כאשר הפיזיקה עצמה אינה בטוחה, המערכת מסלימה במקום לנחש

אכפת לי מהמקרה שבו המערכת אומרת "אינני יודעת" יותר מאשר מכל אחת מן התפיסות הנקיות. מרכז Canal Street Hub הוא מקרה כזה. החתימות האופטיות וחתימות המכ"ם הן גבוליות, אות השיטפון מתמיד בשניים מתוך שלושה פריימים, ומד מפלס הנהר העצמאי מעולם לא חצה את גובה גדות הנהר (bankfull). הראיות סותרות זו את זו באופן ממשי. רמת הביטחון חוזרת כ-0.151, הרבה מתחת לרף האוטומציה של 0.65 שכיילתי על מערך הנתונים המתויג, וסוכן הקרקע סותר את סיווג הלוויין באופן מוחלט.

פירוט AOI-F של Canal Street Hub: סווג כשיטפון ברמת ביטחון של 0.15, חתימה אופטית וחתימת SAR גבוליות, מד מפלס הנהר מתחת לגדות הנהר (bankfull), ופסק דין המנותב לגורם פוסק אנושי כ-ESCALATE במקום תשלום אוטומטי.
מרכז Canal Street Hub, ‏0.8 מיליון דולר על כף המאזניים. האות גבולי ומד מפלס הנהר מעולם לא חצה את גובה הגדות (bankfull), כך שראיות הקרקע מתנגשות עם נתוני הלוויין. רמת ביטחון 0.151 נמצאת מתחת לרף של 0.65, והמקרה מסלים לגורם אנושי עם מלוא הראיות המצורפות במקום שיוכרע אוטומטית.

שער המדיניות שולח את אותם 0.8 מיליון דולר לגורם אנושי עם כל הראיות מצורפות, מסומן בתווית "דורש הוכחה" (needs proof), במקום להטיל מטבע ולקרוא לזה אוטומציה. טריגר שיטפונות שמסלים את המקרה המעורפל באמת נתפס בעיני רוכשים מסוימים כמוצר חלש יותר. אני רואה זאת בדיוק להפך. זוהי הגרסה היחידה שהייתי מאפשר לה לרוץ ללא השגחה, מפני שהחלופה להסלמה כאן היא ניחוש מהיר על כסף אמיתי, המחופש להחלטה.

מספר התיק שאני חוזר אליו שוב ושוב

אני ממשיך להעלות את ספר שמונת המיקומים, מפני שהוא ממחיש את גודל הסיכון באופן שאף מקרה בודד אינו מסוגל לעשות. סערה חולפת על פני תיק של שמונה אזורים. טריגר הפריים-הבודד המיושן (legacy) מופעל בשישה מהם ומעמיד בתור תשלומים אוטומטיים של 8.0 מיליון דולר. ‏TriggerProof פוסקת לגבי התיק: שני שיטפונות אמיתיים מאושרים ומשולמים בסך 4.0 מיליון דולר, שלוש תוצאות חיוביות שגויות מדוכאות ונמנעות (צל ענן של 1.2 מיליון דולר, צל מכ"ם של 1.0 מיליון דולר ומאגר מים קבוע של 1.0 מיליון דולר) בסך 3.2 מיליון דולר שנמנעו, והמקרה המעורפל היחיד מסלים בסך 0.8 מיליון דולר.

תיק ה-TriggerProof לאחר פסיקה: המערכת המיושנת העמידה בתור 8.0 מיליון דולר, אושר לתשלום סך של 4.0 מיליון דולר על פני שני שיטפונות אמיתיים, 4.0 מיליון דולר נמנעו או הוחזקו על פני שלוש דחיות והסלמה אחת, עם 100% כיסוי ראייתי, ופסקי דין של PAY,‏ DENY ו-ESCALATE בכל שורה מול עמודת ה-PAY של המערכת המיושנת.
ספר שמונת המיקומים לאחר פסיקה. מתוך 8.0 מיליון הדולר שטריגר הפריים-הבודד היה משלם אוטומטית, 4.0 מיליון דולר מאושרים בשני שיטפונות אמיתיים ו-4.0 מיליון דולר נעצרים או מוחזקים: 3.2 מיליון דולר של תוצאות חיוביות שגויות שנבלמו ו-0.8 מיליון דולר שהוסלמו לצורך הוכחה. כל שורה נושאת תיק ראיות פורנזי משלה.

מחצית ממה שטריגר המערכת המיושנת היה משלם, 4.0 מיליון מתוך 8.0 מיליון דולר, נעצרת או מוחזקת לצורך הוכחה. זהו המספר, ואני רוצה לדייק לגבי היקפו: זהו התיק הסינתטי של ההדגמה, שמונה מקרים שחיברתי כך שיהיו נאמנים לחוקי הפיזיקה, ולא ספר תביעות אמיתיות. המנגנון אמיתי וניתן לבדיקה. התביעות מומחזות כדי שתוכלו לצפות במנגנון פועל.

אפס החלטות בלתי בטוחות, וההסתייגות שאני מסרב להשמיט

הרצתי מבחן ביצועים (benchmark) מוסדר מפני שתיק של שמונה מקרים הוא סיפור, לא ראיה. סביבת הבדיקה מנקדת 60 מקרים מתויגים, החל מחתימות ברורות ועד לרעש קרוב-לסף. הכותרת אינה ציון דיוק, היא ספירת בטיחות: אפס החלטות אוטומטיות בלתי בטוחות, לעומת 48 בקו בסיס של פריים בודד שמשלם על כל מקרה שמסומן. שמונים אחוז מהמקרים נפתרים אוטומטית, ו-20% הלא-ודאיים מסלימים. מבין המקרים שנפתרו אוטומטית, דיכוי התוצאות החיוביות השגויות עומד על 36 מתוך 36 ושחזור (recall) השיטפונות עומד על 12 מתוך 12, וכל אחד מ-12 המקרים המעורפלים באמת מסלים במקום שיוכרע אוטומטית.

לוח מבחן הביצועים של TriggerProof על פני 60 מקרים מתויגים: אפס החלטות אוטומטיות בלתי בטוחות לעומת 48 עבור קו הבסיס של פריים יחיד, 80% פתרון אוטומטי, 100% דיכוי תוצאות חיוביות שגויות עם 36 מתוך 36 צללים שנדחו, ו-100% שחזור שיטפונות ב-12 מתוך 12.
מבחן הביצועים המתויג בן 60 המקרים. המספר שקובע הוא השמאלי ביותר: אפס החלטות אוטומטיות בלתי בטוחות לעומת 48 עבור קו הבסיס של פריים בודד, כאשר 80% נפתרו אוטומטית והחמישית הלא-ודאית הוסלמה לצורך הוכחה.
המטרה מעולם לא הייתה להשיג ציון מושלם על מערך המבחן של עצמי. המטרה היא שהמערכת לעולם אינה מקבלת החלטה אוטומטית בלתי בטוחה. כאשר היא אינה בטוחה, היא מסלימה.

ההסתייגות מתלווה לכל אחד מן המספרים הללו, ולא אתן להישמט ממנה. הם נמדדים על גבי מערך קבוע ומתויג של 60 מקרים סינתטיים הנאמנים לחוקי הפיזיקה, ולא כערובה לעולם הפתוח או כתוצאת שטח. הצעד הכן הבא אינו טענה גרנדיוזית יותר, אלא אימות מול ארכיונים אמיתיים כמו Sen1Floods11 וסצנות Sentinel חיות, וזהו הדבר הראשון שפעילות עסקית אמיתית הייתה מספקת, ולא משהו שהדגמה זו עשתה. אמירת הדברים בצורה ברורה היא מה שמאפשר לי לעמוד מאחורי שאר המספרים.

תשלום פיצויים שאינך יכול להגן עליו בדיעבד הוא נטל, אפילו כשהוא היה נכון

לא התכוונתי להפוך את נתיב הראיות למרכז העניינים, אך בסופו של דבר זה היה החלק שהייתי הכי בטוח שמבטח יוכל באמת לעמוד מאחוריו. תשלום פיצויים נכון שאינך יכול לשחזר בדיעבד הוא עדיין נטל, מפני ש"הלוויין אמר כך" אינה טענת הגנה שמבטח-משנה או רואה חשבון מבקר יקבלו. לכן כל החלטה, תשלום ודחייה כאחד, מפיקה תיק ראיות פורנזי: שושלת הנתונים (data lineage) של כל פריים, הראיות לפי כלל עם הערך שנמדד בכל מסווג מבחין, יומן ביטול התוצאות החיוביות השגויות, הצלבת נתוני הקרקע העצמאיים, ו-hash מקור מסוג SHA-256 של ההחלטה.

תיק הראיות הפורנזי של טריגר השיטפון עבור מסוף Mesa Junction Depot: פסק דין DENY, טבלת ראיות חמשת הכללים המציגה את R1,‏ R2 ו-R5 כ-FAIL עם הערכים שנמדדו בהם, יומן ביטול תוצאות חיוביות שגויות, הצלבת הנתונים ההקשרית, וטבלת שושלת נתונים (data lineage) של Sentinel-1 ו-Sentinel-2.
תיק הראיות שמאחורי דחיית Mesa Junction. כל כלל מציג את הערך שנמדד בו ואת התוצאה שלו, יומן ביטול התוצאות החיוביות השגויות מפרט מדוע לא היה זה שיטפון, והרשומה כולה נושאת hash מסוג SHA-256. זהו התוצר שמגישים למבטח-משנה, לא צילום מסך של לוח בקרה.

אני רוצה להיזהר ולהבהיר מה ה-hash הזה כן ומה הוא לא. זהו hash של תוכן ההופך את הרשומה לבעלת עדות לחבלה (tamper-evident), כך שכל אדם יכול לחשב אותו מחדש ולוודא שההחלטה לא שונתה בדיעבד. זו אינה חתימה דיגיטלית של PKI, ואחזור נתוני הלוויין, הקצאת משימות ה-SAR, הזנות נתוני הקרקע והאינטגרציה עם פלטפורמת התביעות מומשו כולן כרכיבי דמה (stubs) בהדגמה זו, מסומלצים כך שהכול ירוץ על המחשב הנייד שלי. מה שאמיתי הוא מבנה הרשומה: עבור כל החלטת תשלום אוטומטית, בדיוק איזו פיזיקה אמרה מה, באיזו רמת ביטחון, ונבדקה מול איזה אות עצמאי.

הביטוח הפרמטרי ביצע פשרה אמיתית, כשויתר על שמאי הנזקים כדי להפוך את התשלומים למיידיים ולנטולי מחלוקת. מה שהוא ירש במקום זאת הייתה בעיה פיזיקלית שאינו יכול לראות מעבר לה בפריים בודד, והכשל שאליו הפשרה הזו חושפת אותך הוא תשלום מהיר ובטוח בעצמו על צל. התיקון בר-הקיימא מתקיים מחוץ למודל: כללים דטרמיניסטיים שמפרידים בין המראות הדומים לאורך זמן ובאמצעות חיישנים שונים, שער שמסלים את המקרה המעורפל לאדם, ורשומה שהופכת כל החלטה לניתנת להגנה. לוויין חד יותר אינו פותר בעיית פסיקה (adjudication), וזוהי בעיית פסיקה.

ואם אתם מעדיפים לצפות בכך במקום לקרוא את התיאור שלי, הנה הכול פועל מקצה לקצה.

‏Mesa Junction הוא המקרה שאני חוזר אליו שוב ושוב. רק הרכישה השנייה ידעה אי פעם להבדיל בין הצל לשיטפון, והטריגר הופעל עוד לפני שהיא הגיעה. תוכלו לעבור על רצועת הפריימים הזו בעצמכם, ולבטל את התשלום שחשבתם שהיה צריך לפעול, בכתובת veriprajna.com/he/demos/satellite-flood-intelligence. השאלה שהייתי מפנה לכל מי שמנהל ספר שיטפונות אוטומטי היא צרה וניתנת למענה: מתוך הטריגרים ששילמתם אוטומטית בעונה שעברה, לגבי כמה מהם עדיין תוכלו להוכיח שהיו מים ולא צל?

מחקר קשור

פורסם גם ב

בנו את ה-AI שלכם בביטחון.

שותפו עם צוות בעל ניסיון עמוק בבניית הדור הבא של AI ארגוני. אנו נסייע לכם לתכנן, לבנות ולהטמיע אסטרטגיית AI שתוכלו לסמוך עליה.

Veriprajna ייעוץ דיפ-טק מתמחה בבניית מערכות AI קריטיות לבטיחות עבור תחומי הבריאות, הפיננסים והרגולציה. הארכיטקטורות שלנו מאומתות מול פרוטוקולים מבוססים ומלוות בתיעוד ציות מקיף.