שני מדי מים מנותקים על שולחן עבודה הנדסי לצד שרטוט נייר המשווה סיכון ממודל לגבול קבלה קבוע.
בינה מלאכותיתהנדסת תוכנהRisk Management

הערכת סיכון נמוכה יותר לקושחה אינה מהווה אישור הפצה

Ashutosh SinghalAshutosh Singhal7 באוגוסט 20268 min

תיקון חם לקושחה יכול לשפר באופן דרמטי את הערכת הסיכון, ועדיין להותיר את הגרסה כבלתי מקובלת על פי המדיניות המוצהרת. עבור צוות הנדסי שמחליט האם לעדכן צי מדים, מדובר בהחלטות שונות לחלוטין. השיפור מעיד על טיבה של הגרסה המועמדת; מתן האישור תלוי בסיכון הנותר, באוכלוסייה המוערכת ובראיות העומדות מאחורי ההערכה.

בניתי את MeterGuard במטרה להשאיר את השיפוטים הללו גלויים. זוהי הדגמה של בדיקת טרום-הפצה לעדכוני קושחה באמצעות אוכלוסיות מדים סינתטיות ומפרטי קושחה סינתטיים. המערכת מעריכה התנהגות מתוך יומן שינויים, ממדלת התנהגות זו ביחס לבריאות הצי, ומפיקה המלצה מקומית. היא אינה שולחת קושחה למדים ואינה חוסמת עדכון בפועל. השאלה המועילה היא מה הפרדה זו מאפשרת למוביל גרסה לבדוק, ומה היא עדיין אינה מסוגלת לבסס.

שיפור וקבילות עונים על שאלות שונות

קחו לדוגמה את האוכלוסייה הסינתטית המסומנת כ-Plano Water. גרסה מועמדת ראשונית מניבה שיעור כשל ממוצע ממודל של 74.22% מנקודות הקצה שדורגו. תיקון חם מניב 2.85%. שתי התוצאות משתמשות בפרופילי התנהגות מבוססי מודל ומאוחסנים במטמון, ולא בהתנהגות שנמדדה ישירות מקובצי קושחה בינאריים. תחת הנחות אלו, התיקון החם מהווה שיפור מהותי. השוואה זו ראויה לשימור גם כאשר ההמלצה הסופית נותרת NO-GO.

שער ההפצה בודק תחילה את הקצה העליון של מרווח ה-90% הממודל. בשיעור של 3.0% ומעלה מנקודות הקצה שדורגו, הוא מחזיר NO-GO. עבור התיקון החם, הממוצע הוא 2,449 כשלים ממודלים מתוך 86,078 נקודות קצה שדורגו, עם מרווח שנע בין 1,536 ל-3,531. השיעור העליון עומד על 4.10%, ולכן חל כלל החסימה הקשיחה. 1,922 נקודות קצה נוספות חסרות טלמטריה מספקת ומוחרגות מתחזית זו, תוך המלצה על סקירה ידנית.

החלטת התיקון החם ב-MeterGuard המציגה NO-GO, שיעור כשל ממוצע ממודל של 2.85% ושיעור מרווח עליון של 4.1% מול סף של 3.0%
התיקון החם הסינתטי של Plano נותר במצב NO-GO: הסיכון הממודל העליון שלו חוצה את הסף המוגדר. התחזית מכסה 86,078 נקודות קצה שדורגו; 1,922 נקודות קצה שהוחרגו ממתינות לראיות נפרדות.

קריאה המבוססת על הממוצע בלבד תחמיץ את הסיבה לכך שמדובר בחסימה קשיחה. היא גם לא הייתה הופכת את המועמד לזכאי ל-GO על פי שאר המדיניות: קבלת GO דורשת ממוצע של 0.5% ומטה, לאחר מעבר בדיקות החסם העליון ובדיקות המהימנות. סיכון מספרי בינוני מוביל ל-STAGED-CANARY. ההבחנה הזו מהותית מכיוון שאסור ש'טוב יותר', 'זכאי לשלב מוגבל של איסוף ראיות' ו'במסגרת כלל GO' יתמזגו לכדי תווית מרגיעה אחת.

אני מעדיף להשאיר את השיפור גלוי מבלי לאפשר לו לנהל משא ומתן מחדש על הסף. אם צוות מגיב להמלצה מאכזבת על ידי הקלת הסף, הוא למעשה שינה את מדיניות הקבלה שלו. זו עשויה להיות החלטה מוצדקת בהקשר מסוים, אך זוהי החלטה נפרדת הדורשת נימוקים משל עצמה. הראיה לכך שגרסה מועמדת אחת טובה מאחרת אינה מספקת את הנימוקים הללו בפני עצמה.

ישנו מחיר לעמדה זו. סף שמרני עלול לעכב גרסה מועמדת שהייתה עשויה להצליח. הקצה העליון של מרווח ממודל אינו תוצאה שנצפתה בשטח, וכינוי המרווח כ-'90%' אינו מוכיח את הכיסוי שלו בצי מדים של חברת תשתית. הדגמה זו אינה יכולה לקבוע באיזה סף על חברת תשתית אמיתית לבחור. מה שהיא כן יכולה להראות הוא האם ההמלצה פועלת לפי הסף שהוצהר, ולא לפי סף שהותאם בחשאי כדי להתאים לתוצאה.

אישור שייך לגרסה מועמדת ולאוכלוסייה יחד

אותה הערכת התנהגות של התיקון החם מניבה תוצאה שונה לחלוטין מול האוכלוסייה שנוצרה והמסומנת כ-Hill Country Electric Co-op. שיעור הכשל הממוצע הממודל שלה הוא 0.02%, עם שיעור מרווח עליון של 0.03%, והשער מחזיר GO עבור 118,222 נקודות קצה שדורגו. לאוכלוסייה זו יש פילוג סוללות בריא יותר ופחות אותות רדיו חלשים בהשוואה לאוכלוסיית Plano הסינתטית. 1,778 נקודות הקצה שהוחרגו נותרות מחוץ להמלצה זו.

זוהי השוואה של התנהגות כתיבה מוערכת על פני פילוחי בריאות שנוצרו. היא אינה אומרת דבר על התקנת אימג' של יצרן אחד על חומרה של יצרן אחר. תאימות ואימות הנגזר מקבצים בינאריים הם תהליכי עבודה נפרדים שההדגמה אינה מבצעת.

ההשוואה משנה את האופן שבו הייתי רוצה שהמלצת הפצה תנוסח. האמירה 'קושחה זו היא בעלת סיכון נמוך' משאירה את ההיקף בלתי מוגדר. האמירה 'התנהגות מוערכת זו עומדת במדיניות זו באוכלוסייה זו שדורגה' משמרת את התנאים שבהם התוצאה תקפה. מצב הסוללה והתאוששות הרדיו הם קלטים לתוצאה הממודלת, ולכן לא ניתן לנתק מהם תוצאה חיובית ולהעבירה לצי מדים אחר.

עבור מוביל גרסה, הדבר יוצר שתי דרכים שונות להגיב להמלצה בלתי נוחה. האחת היא לשפר את התנהגות הגרסה המועמדת או את הראיות המשמשות להערכתה. השנייה היא לבחון אוכלוסייה מצומצמת יותר שתנאיה תומכים בהערכה שונה. גישות אלו עונות על בעיות שונות. הערכה מצומצמת יותר עשויה להפחית את החשיפה הממודלת, אך היא מותירה את שאר האוכלוסייה ללא מענה. ראיות טובות יותר על המועמד עשויות לשפר את ההערכה, אך אינן יכולות לייצר יש מאין נתוני טלמטריה חסרים של הצי.

חלופות אלו הן בחירות הנדסיות עתידיות, ולא פעולות שהדגמה זו מבצעת. ערכן טמון בכך שהן מכוונות את העבודה לעבר מקור אי-הוודאות. פסק הדין לבדו אינו יכול לומר לצוות האם הוא זקוק למועמד טוב יותר, לפרופיל טוב יותר או למידע טוב יותר על היעדים המיועדים. הקלטים וההחרגות שלצידו דווקא יכולים.

שער קוד אינו יכול לאמת את מה שהמודל מאמין בו

‏MeterGuard שומר את המדיניות בקוד פשוט. תזכיר הממשל הנתמך במודל מגיע לאחר פסק הדין ואין לו סמכות ישירה לעקוף אותו. אני מעוניין בהפרדה זו משום שהסבר רהוט אינו צריך להפוך בחשאי לכלל הפצה חדש.

למודל עדיין יש השפעה מכרעת בשלב מוקדם יותר של תהליך העבודה. פרופיל הקושחה שלו מעריך צריכת זרם, התאוששות לאחר איפוס והתנהגות כתיבה לזיכרון הבזק מתוך טקסט יומן שינויים סינתטי. הערכות אלו מזינות את הסימולטור. פרופיל שונה יכול לשנות את הכשלים הממודלים ובכך לשנות את פסק הדין, גם אם קוד השער אינו משתנה לעולם. מדיניות הניתנת לבדיקה קובעת כיצד נשפטו הקלטים; היא אינה קובעת שהקלטים היו נכונים.

מקרה יומן השינויים הדל ממחיש הבחנה זו. מול אותה אוכלוסיית Co-op שנוצרה, הממוצע הממודל שלה הוא 0.05% בלבד והשיעור העליון הוא 0.06%. מספרים אלו עומדים בספים המספריים. עם זאת, הפרופיל נושא מהימנות נמוכה, ולכן השער ממליץ על STAGED-CANARY במקום GO. ראיות קושחה דלילות מקבלות יחס של סיבה עצמאית למניעת ההמלצה הרחבה יותר.

זוהי הגנה מועילה, אך בעלת מגבלה משלה. תווית מהימנות של מודל אינה ודאות אמפירית מכוילת. דרישה לתווית שאינה 'נמוכה' יכולה למנוע התעלמות מפער ראיות מוכר; היא אינה יכולה לאשר שתווית 'גבוהה' היא אכן מדויקת. לשם הסתמכות בסביבת ייצור, הפרופיל יידרש לעבור אימות מול התנהגות קושחה ותוצאות בפועל. משימה זו נותרה מעבר להדגמה הסינתטית.

המדגם הבטוח ביותר מותיר שאלה קשה יותר

המסלול המדורג המוצע משתמש ב-500 נקודות קצה מקבוצת הסיכון הממודל הנמוך ביותר, עם תקופת השהיה של 72 שעות והערכה מחדש באמצעות טלמטריה שנצפתה לפני הרחבת הפריסה. ההדגמה ממליצה על תוכנית זו; היא לא ביצעה פריסת קנרית בפועל ולא אספה את תצפיותיה. קריטריון ההרחבה שהוגדר הוא שיעור כשל שנצפה של פחות מ-0.1%.

אני רואה פשרה אמיתית בבחירת הקבוצה הבטוחה ביותר תחילה. הדבר מפחית את החשיפה המוצעת לשלב הראשוני. אך אותו היגיון שהפך את מצב צי המדים לחשוב, מגביל גם את מה ששלב זה יכול לבסס לגבי נקודות קצה במצב גרוע יותר. במסע עדכון היפותטי, צפייה בעדכון מוצלח על סוללות תקינות וחיבורי רדיו טובים תתמוך בטענה לגבי אותו מדגם שנבדק. היא תותיר פתוחה את שאלת התנהגות הגרסה המועמדת על סוללות מיושנות או חיבורי רדיו חלשים.

ישנן לפחות שתי תגובות שניתן להגן עליהן ביחס לפער זה. צוות יכול להמשיך להגביל את ההרחבה לאוכלוסיות הדומות במידה מספקת למדגם שנצפה, תוך קבלת כיסוי איטי יותר והשארת נקודות קצה פגועות בהמתנה. לחלופין, הוא יכול לחפש ראיות הממוקדות בתנאים הפגועים, כגון אימות מבוקר של התנהגות הסוללה וההתאוששות הרלוונטית, לפני שישקול את נקודות הקצה הללו. הנתיב השני דורש עבודה רבה יותר; הראשון מקבל מסקנה צרה יותר. אף אחד מהם אינו הופך מדגם בטוח למייצג מעצם ההכרזה עליו ככזה.

זו הסיבה שאני מתייחס ל-STAGED-CANARY כאל בקשה לראיות מוגדרות, ולא כמילה נרדפת מרוככת ל-GO. תוכנית מדורגת צריכה לפרט מה תצפיותיה יצדיקו והיכן הן נעצרות. ללא הגדרת היקף זו, תהליך הנראה זהיר עדיין עלול להניב מסקנה גורפת מדי.

הנה סקירת המייסד של החלטות שחרור אלו עבור מדים חכמים ב-MeterGuard.

ה-מדריך ההסבר של MeterGuard מציג את תהליך העבודה של בדיקת הטרום-הפצה ואת רשומות ההחלטה שלו. עמדתי התכנונית היא לשמור את ההתנהגות המוערכת, אוכלוסיית המדים שדורגה, ההחרגות והכלל המוצהר לצד ההמלצה. עבור מוביל גרסה, המבחן הוא האם הצעד הבא המוצע מיישב את אי-הוודאות שגרמה להשהיה. אם הוא בוחן רק את התנאים הקלים ביותר בעוד שההחלטה נוגעת לתנאים קשים יותר, הגבול עדיין ממתין לראיות.

מחקר קשור

פורסם גם ב

בנו את ה-AI שלכם בביטחון.

שותפו עם צוות בעל ניסיון עמוק בבניית הדור הבא של AI ארגוני. אנו נסייע לכם לתכנן, לבנות ולהטמיע אסטרטגיית AI שתוכלו לסמוך עליה.

Veriprajna ייעוץ דיפ-טק מתמחה בבניית מערכות AI קריטיות לבטיחות עבור תחומי הבריאות, הפיננסים והרגולציה. הארכיטקטורות שלנו מאומתות מול פרוטוקולים מבוססים ומלוות בתיעוד ציות מקיף.