بناء FloodProof علّمني أن عامل الفيضان كان سهلًا. الإثبات خارج العيّنة والبوابة التي تحجب معدلًا تمييزيًا كانا الجزء الصعب.
InsurtechMachine LearningAI Governance

بنيتُ نموذج فيضان هزم خريطة FEMA. ثم رفض أن يدعني أقدّمه.

Ashutosh SinghalAshutosh Singhal26 يونيو 202611 min

لم أتوقع أن تكون اللحظة الأكثر إثارة أثناء بناء هذا العرض التوضيحي هي أن يقول لي البرنامج لا.

كان لديّ عامل تصنيف مركّب يرتّب خسائر الفيضانات الحقيقية أفضل من منطقة فيضان FEMA على بيانات لم يرها من قبل. وبكل غريزة لديّ كبانٍ، هذا هو الفوز. تُشحنه. بدلًا من ذلك أضاءت المرحلة الأخيرة من خط الأنابيب بالأحمر وطَبَعت NOT FILING-READY، وسمّت المتغير الأسوأ الوحيد، ووجّهته إلى خبير اكتواري بشري. كان كودي الخاص قد قرر أن المعدل الذي كنت فخورًا به غير آمن للتقديم في ملف تنظيمي. جلست دقيقة أقرر ما إذا كان ذلك خطأً برمجيًا أم جوهر الأمر كله.

كان جوهر الأمر كله. هذا المقال عن سبب اعتقادي الآن أن البوابة التي ترفض التقديم تستحق أكثر من النموذج الذي يقف خلفها.

يُدعى العرض التوضيحي FloodProof. يعمل على دفتر عام حقيقي لمطالبات البرنامج الوطني لتأمين الفيضانات (NFIP) لمقاطعة هاريس، تكساس، من OpenFEMA. عندما أنقر «إعادة تشغيل التشخيص»، تُنفَّذ تسع مراحل مباشرة على السجلات الحقيقية وتنتهي في أقل من ثانية. لا شيء مكتوب مسبقًا. بذرة عشوائية ثابتة تجعل التقسيم قابلًا لإعادة الإنتاج، لذا تُعاد حساب الأرقام التي سأقتبسها في كل تشغيل.

FloodProof يُشغّل خط أنابيبه المكوّن من تسع مراحل مباشرة على 170,803 سجل NFIP حقيقي لمقاطعة هاريس، وينتهي عند بوابة السياسة الحتمية المعلّمة NOT FILING-READY مع توجيه الطوابق إلى إنسان.
خط الأنابيب الحي: 170,803 سجل مطالبة حقيقي من OpenFEMA دخلًا، و135,381 بسجل خسارة مبانٍ مدفوعة مُقيَّمة، والمرحلة الأخيرة بوابة حتمية تُعيد NOT FILING-READY وتوجّه الطوابق إلى خبير اكتواري بشري.

الرقم الأول الذي أوقفني لم يُنتجه أي نموذج

أظل أعود إلى هذا الرقم لأنني لم أحسبه، بل حسبته المطالبات. من دولارات مطالبات المباني الحقيقية المدفوعة في دفتر مقاطعة هاريس هذا، 3.1 مليار دولار، أي 45.9%، دُفعت على عقارات صنّفتها FEMA خارج مناطقها عالية الخطورة (منطقة الفيضانات الخاصة عالية الخطورة / Special Flood Hazard Area). لا نموذج. لا درجة. مجرد مجموع على دفتر الأستاذ الحقيقي. خريطة المناطق، الشيء الذي ما زالت شركات التأمين ترتكز إليه في أسعار الفيضانات، كانت صامتة عن نحو نصف المال الذي خرج فعليًا من الباب.

ذلك طابق ما كنت قد قرأته قبل البدء. أكثر من ثلثي أضرار الفيضانات في الولايات المتحدة تقع خارج مناطق FEMA عالية الخطورة، وبعد إعصار هارفي جاءت نحو 70% من مطالبات فيضان مقاطعة هاريس من خارج تلك المناطق (بحث صفحة حلول Veriprajna، 2026). صدقته كإحصائية. يختلف الشعور حين تراه يتراكم على شاشتك، حيًّا حيًّا، كدولارات حقيقية.

خريطة FloodProof مُحوَّلة إلى عرض المركّب بالذكاء الاصطناعي، حلقات ذهبية تُميّز عقارات صنّفتها FEMA آمنة وحملت خسائر عالية الخطورة حقيقية، مع 3125.0 مليون دولار و45.9% من دولارات المطالبات المدفوعة خارج مناطق FEMA عالية الخطورة.
بدّل الخريطة من منطقة FEMA إلى المركّب بالذكاء الاصطناعي فتظهر الحلقات الذهبية: مطالبات حقيقية صنّفتها FEMA خارج خطوطها عالية الخطورة ويسجّلها المركّب كعالية الخطورة. العنوان غير المنمذج في الزاوية: 3125.0 مليون دولار، 45.9% من الدولارات المدفوعة، خارج المناطق.
لم تكن خريطة المناطق خاطئة قليلًا. كانت صامتة عن 3.1 مليار دولار من الخسائر الحقيقية في دفتر مقاطعة واحدة.

إذن الخريطة أداة فظة. الجميع في تسعير الفيضانات يعرف ذلك أصلًا. جواب السوق كان شراء نموذج أفضل من مزوّد. أردت أن أعرف ما إذا كان النموذج الأفضل هو الجزء الصعب فعلًا، أم أن الجزء الصعب كان في مكان لم أكن أنظر إليه.

هل يمكن لستة سمات بناء عادية أن تهزم خريطة المناطق؟

لم أظن أن انحدار ريدج العادي سيحرّك الإبرة كثيرًا. نواة التقييم متعمّدة البساطة: مركّب ريدج من سمات بناء OpenFEMA الحقيقية — عمر المبنى، وعدد الطوابق، ومؤشر الارتفاع، والامتثال لكود ما بعد FIRM، ونوع الإشغال، والعوائق. ست سمات صادقة. كان حدسي الأول أن أطعمها أيضًا تغطية المبنى المؤمَّنة، لأن التغطية ترتبط بالدفع. أمسكت بنفسي. الدفع محدود ميكانيكيًا بالتغطية، فإدخالها كان سيسمح للدرجة بالغش من الجواب وجعل الاختبار الخلفي دائريًا. قطعتها. ذلك الحذف الواحد هو الفرق بين عرض توضيحي وخدعة سحرية.

الاختبار الخلفي مبني ليكون غير دائري. ملاءمة المركّب على تقسيم تدريب 70%. تقييمه على الـ30% المحجوزة التي لم يرها قط، وهي 40,615 مطالبة حقيقية. قارنه مقابل ratedFloodZone الحقيقي كخط أساس وamountPaidOnBuildingClaim الحقيقي كالتسمية. كلٌّ من خط الأساس والتسمية مستقل عن النموذج، لذا فالفوز فوز حقيقي خارج العيّنة، لا تقييم ذاتي.

مخطط الرفع خارج العيّنة في FloodProof: المركّب بالذكاء الاصطناعي يلتقط 1.694 ضعف دولارات الخسارة في العُشر الأعلى لمنطقة FEMA عبر 40,615 مطالبة محجوزة، وعمود المركّب أعلى بكثير من عمود منطقة FEMA وحدها.
نتيجة المحجوز: على 40,615 مطالبة حقيقية يلتقط المركّب 1.694 ضعف دولارات الخسارة في العُشر الأعلى لخط أساس منطقة FEMA، بمعامل جيني 0.31 مقابل 0.08 للمنطقة. مُلاءَم على 70% من المطالبات الحقيقية، ومُقيَّم على الـ30% التي لم يرها قط.

فاز بأكثر مما توقعت. التقط المركّب 1.694 ضعف دولارات الخسارة في العُشر الأعلى لمنطقة FEMA على المطالبات المحجوزة، بمعامل جيني 0.31 مقابل 0.08 للمنطقة. أعدت التشغيل عبر بذور عشوائية للتأكد من أنني لم أحظَ بتقسيم محظوظ. ثبت الرفع، نحو 1.69 إلى 1.85 عبر البذور. ست سمات عادية، مُلاءَمة بصدق، هزمت خريطة الفيضانات الفيدرالية على مال لم تره من قبل.

وهنا بالضبط كدتُ أرتكب الخطأ الذي يرتكبه السوق كله.

الإدراك الذي أعاد صياغة البناء كله

أتذكر أنني ظننت أن العرض التوضيحي قد انتهى أساسًا عند تلك النقطة، وكنت مخطئًا. نموذج أفضل يقيّم نفسه ليس دليلًا. إذا سلّمتُ رئيس خبراء اكتواريين عاملًا وقلت «ثق بي، يهزم المنطقة»، فقد سلّمته واجبي المنزلي ودرجتي مكتوبة فوقه. لم تكن القيمة يومًا في النموذج. مزوّدون مثل ZestyAI وICEYE وFirst Street يبيعون أصلًا نماذج فيضان قوية. الشيء الدائم هو البنية التحتية المملة حول أي نموذج: اختبار خلفي لا يستطيع المتشكك رفضه، وتدقيق عدالة لا يستطيع النموذج التملص منه، وبوابة تُنتج ملف التقديم أو ترفضه. ذلك يصح بأي جودة للنموذج، ولهذا لا يشيخ مع تحسّن النماذج. يمكنك أن ترى الآلية والإفصاحات الصادقة بنفسك على veriprajna.com/ar/demos/flood-risk-underwriting.

نموذج أفضل يقيّم نفسه ليس دليلًا. إنه واجبك المنزلي ودرجتك مكتوبة فوقه.

هناك سبب ثانٍ أصعب يجعل النموذج لا يمكن أن يكون القصة كلها. عامل يرتّب الخسارة جيدًا يمكن أن يحمل أيضًا إشارة ديموغرافية، ومعدل يفشل في اختبار الأثر المتفاوت هو ملف تقديم يرفضه مُدقّق إدارة التأمين. الترتيب الجيد وقابلية التقديم سؤالان مختلفان. أجبت عن الأول. والثاني كان ينتظر.

وجّهت تدقيق العدالة إلى نموذجي الخاص وتوقعت أن يكون الشرير

تأهبت حقًا لأن يكون مركّبي هو المشكلة. يفحص التدقيق كل متغير مُسعَّر مقابل الحصة الحقيقية للأقليات على مستوى الحي من مؤشر الضعف الاجتماعي لـ CDC/ATSDR (إصدار 2022)، ويحسب نسبة الأثر السلبي لكل منها، ويتحقق منها مقابل قاعدة الأخماس الأربعة لدى EEOC، النطاق من 0.80 إلى 1.25 (29 CFR 1607.4(D)). افترضت أن درجة الذكاء الاصطناعي اللامعة ستكون هي الحاملة للوكيل الديموغرافي.

لم تكن. درجة المركّب نفسها تمر بنسبة أثر سلبي قدرها 0.938. لم أبنِ العرض التوضيحي لأُظهر كأن نموذجي هو الشرير، وهو ليس كذلك. لكن التدقيق يفحص كل شيء، و5 من المتغيرات المُسعَّرة تفشل قاعدة الـ80%. الأسوأ هو عدد الطوابق عند 0.363. تفشل القيمة المؤمَّنة عند 0.526. والذي فاجأني حقًا: طبقة منطقة FEMA نفسها تفشل عند 1.467، أسوأ في الجانب المرتفع مما يفعله مركّبي في أي جانب. خط الأساس الذي يعامله الجميع كمرساة آمنة ومحايدة ومباركة من المنظّم يحمل انحرافًا ديموغرافيًا أكثر من عامل الذكاء الاصطناعي الذي يقلق منه الناس.

شهادة امتثال FloodProof: درجة المركّب تمر قاعدة الـ80% عند AIR 0.938، وخمسة متغيرات مُسعَّرة تفشل بما فيها الطوابق عند 0.363، والتغطية المؤمَّنة عند 0.526، وطبقة منطقة FEMA عند 1.467، مع الحكم NOT FILING-READY.
كل متغير مُسعَّر فُحص مقابل أحياء CDC SVI الحقيقية. المركّب يمر عند 0.938. خمسة تفشل: الطوابق 0.363، التغطية المؤمَّنة 0.526، طبقة منطقة FEMA نفسها 1.467. ثم توسِم البوابة الملف بـ NOT FILING-READY وتوجّه الطوابق إلى تبرير اكتواري بشري.
عامل الذكاء الاصطناعي لديّ اجتاز اختبار العدالة عند 0.938. طبقة منطقة FEMA فشلت فيه عند 1.467.

ذلك الانقلاب هو ما أريد أكثر أن يجلس معه خبير اكتواري. غريزة عدم الثقة بالنموذج والثقة بالخريطة معكوسة على هذا الدفتر.

حجب نفسه قبل أن أستطيع تقديمه

أريد أن أكون دقيقًا بشأن ما حدث بعد ذلك، لأنه الجزء الذي أفخر به أكثر وهو كود غير درامي تمامًا. بوابة السياسة Python خالصة بقاعدة واحدة: التقديم جاهز فقط إذا كانت عيّنة المحجوز كبيرة بما يكفي، والرفع فوق منطقة FEMA يتجاوز حدًا أدنى مطلوبًا، وكل متغير مفحوص يقع داخل نطاق العدالة. الرفض افتراضيًا. filing_ready إذا وفقط إذا لم توجد أي نتائج حاجبة. على هذا الدفتر فشل متغير، فأعادت البوابة NOT FILING-READY، وسمّت الطوابق أسوأ المخالفين، ووجّهتها إلى تبرير اكتواري بشري بدل شحن المعدل. شغّلت أيضًا قائمة تحقق لكل ولاية، وظهر متطلب كولورادو لتبرير كل متغير كغير مكتمل.

الجزء الاختياري من المكدس هو طاقم صغير من وكلاء Pydantic-AI: شارح للعامل، ومبرّر للعدالة مقترن بتحدٍّ خصومي، وصائغ لمذكرة التقديم. ينصحون. يصوغون السرد. لا يستطيعون تجاوز البوابة، ودون مفتاح API يمتنعون ببساطة وتبقى النتيجة الحتمية دون تغيير. كل رقم حرج للثقة هو numpy عادي خارج إطار الوكلاء. الوكلاء يسدون المشورة، والكود يقرر. تغذيات المزوّدين (ZestyAI Z-FLOOD، ICEYE SAR-depth) وموصّل Guidewire في هذا البناء بدائل وهمية خلف مخطط حقيقي، الاستبدال الإنتاجي الموثَّق، لا تكامل حي. أفضل أن أقول ذلك بصراحة من أن أوحي بأنبوب غير موجود. الحزمة الكاملة، وأثر التقديم وكل شيء، على veriprajna.com/ar/demos/flood-risk-underwriting.

ما تنتجه البوابة حين ترفض ليس طريقًا مسدودًا. إنه حزمة تقديم DOI جاهزة للمُدقّق: المذكرة الاكتوارية، وجدول الاختبار الخلفي خارج العيّنة، وإسناد السمات، وفحص العدالة، والبيان الصريح بما وُجِّه إلى إنسان ولماذا. إنه أثر أدلة، لا شهادة، ولا وعد بأن أي مُدقّق قد وافق على شيء. إنه مسار الورق الذي يطلبه المُدقّق، مُجمَّع قبل أن يطلبه.

أظل أسمّي هذا الإمساك بمخاطر الامتثال قبل أن يفعل المُدقّق. تلك قيمة المشتري في سطر واحد. البديل أن تكتشف أن معدلك تمييزي بعد أن قدّمته، في رسالة، علنًا.

ما أظل أجلس معه

دخلت هذا البناء مفترضًا أنني أبني نموذج فيضان أفضل، وخرجت مقتنعًا أن النموذج كان الجزء الأقل أهمية. الإفصاحات الصادقة أهم من الدقة. تحجب FEMA إحداثيات المطالبات الجغرافية تقريبًا إلى مركز الحي، لذا يعمل هذا عند الدقة التي تسمح بها البيانات العامة بصدق، والعرض التوضيحي يقول ذلك على الشاشة. الرفع دفتر مقاطعة هاريس واحد وتقسيم محجوز واحد، لا ضمانًا للعالم المفتوح. تسمية تلك الحدود ليست ضعفًا في العرض. إنها العرض.

ومع تبنّي أكثر من 24 ولاية لنشرة NAIC بشأن نماذج الذكاء الاصطناعي، وتحويل نشرة نيويورك DFS الدائرية 2024-7 اختبار التمييز عبر الوكيل من مجاملة إلى توقع، يتوقف الكود الذي يرفض التقديم عن كونه أوراقًا ويبدأ أن يكون المنتج. عامل التصنيف لم يكن يومًا الجزء الصعب. إثباته وحوكمة استخدامه كانا.

وإن كنت تفضّل أن تراه يقرر بدل أن تأخذ كلامي، فها هو الشيء كله يعمل من الطرف إلى الطرف.

إذن هذا السؤال الذي لم أُجِب عنه تمامًا لنفسي، وأود حقًا أن أسمع رأي خبير اكتواري. إذا أخبرك تدقيقك الخاص أن طبقة منطقة FEMA التي ارتكزت إليها الأسعار لسنوات تفشل في اختبار العدالة نفسه الذي أنت على وشك تطبيقه على عامل ذكاء اصطناعي جديد، أيهما تتوقف عن الوثوق به أولًا؟

أبحاث ذات صلة

منشور أيضًا على

ابنِ ذكاءك الاصطناعي بثقة.

تعاون مع فريق يمتلك خبرة عميقة في بناء الجيل القادم من الذكاء الاصطناعي للمؤسسات. دعنا نساعدك على تصميم استراتيجية ذكاء اصطناعي جديرة بثقتك وبنائها وتطبيقها.

Veriprajna استشارات التقنيات العميقة متخصصة في بناء أنظمة الذكاء الاصطناعي الحرجة للسلامة في مجالات الرعاية الصحية والتمويل والقطاعات التنظيمية. تُقيَّم بنياتنا المعمارية وفق البروتوكولات المعتمدة مع توثيق شامل للامتثال.