דוגמת תיק סינתטית מראה מדוע בדיקת טענות בינה מלאכותית דורשת ראיות לשימוש תפעולי, ניסוח זהיר ומקום לשאלות פתוחות.
בינה מלאכותיתניהול מוצרRisk Management

מה שעצם קיומו של מודל בינה מלאכותית מותיר ללא הוכחה

Ashutosh SinghalAshutosh Singhal29 ביולי 20266 min

צוות יכול להפיק כרטיס מודל ועדיין להשאיר את הטענה השיווקית שלו ללא מענה. הכרטיס עשוי לתעד כי מודל אכן קיים. אך משפט הקובע כי העסק 'מונע בבינה מלאכותית' מבטא התחייבות נוספת באשר לתפקידו של המודל בעבודה המעשית. אני רוצה שהבדיקה של אותו משפט תגיע לתיעוד התפעולי לפני שמישהו יתייחס לעצם קיומה של הטכנולוגיה כתימוכין מספקים.

גילוי נאות: מאמר זה נוסח בסיוע בינה מלאכותית יוצרת.

עמדת תכנון זו עומדת בבסיס ClaimLens, ההדגמה המקומית שלנו לקישור טענות בינה מלאכותית לרשומות טכניות שסופקו. הדוגמה כאן היא Nimbus Capital AI, חברה סינתטית בעלת גילויים ויומני פעילות סינתטיים. היא ממחישה בעיית ביקורת; היא אינה קובעת כיצד פועלת חברת השקעות בפועל ואינה פוסקת אם גילוי מסוים תואם את החוק.

המרחק בין מודל שנפרס לבין מודל שמוביל

חברת Nimbus טוענת: 'אנו משתמשים באופטימיזציית תיקים מונעת בינה מלאכותית בכל החשבונות המנוהלים לפי שיקול דעת'. רשומת המודל שסופקה מטעמה קובעת כי מודל אופטימיזציה אכן נפרס. לעומת זאת, יומן הפעילות התפעולי מציין כי פלט המודל השפיע על 1.5% בלבד מהחלטות ההקצאה. מערכת ClaimLens מקצה לטענה זו את ההחלטה 'Needs proof' בהתאם לכלל שהוגדר בה להשפעה תפעולית נמוכה.

מרשם ClaimLens המציג את טענת אופטימיזציית התיקים הסינתטית מסומנת כ-Needs proof לצד פסיקות אחרות
טענת התיק הסינתטית נותרת גלויה יחד עם החלטת ה-'Needs proof' שלה. שורות אחרות שומרות על תוצאותיהן; תוויות אלו הן הכרעות הדגמה מוגדרות, ולא אישור משפטי.

רשומת הקיום עונה על שאלה מועילה: יש מודל שניתן לבחון. יומן הפעילות עונה על שאלה אחרת: באיזו תדירות השפיע הפלט שלו על החלטות ההקצאה שנרשמו. אף אחת משתי העובדות אינה צריכה להיעלם רק משום שהאחרת אינה נוחה.

המשפט מרחיק לכת מעבר לרשומות הללו. הביטוי 'מונע בבינה מלאכותית' מרמז על תפקיד מכריע בקביעת העבודה. הביטוי 'בכל החשבונות' מציג היקף נרחב. מודל שנפרס, כשלעצמו, אינו מסביר אף אחת משתי ההתחייבויות. הנתון של 1.5% מעניק לבודק סיבה מוחשית לשאול כיצד המודל משתתף בתהליך וכיצד השתתפות זו מתפלגת בין החשבונות.

אני מעדיף בדיקה ששומרת על פער זה גלוי ומפורש. אישור הניסוח הרחב רק משום שהמודל נוכח יטיל על פיסת ראיה צרה הבטחה גדולה בהרבה. הכרזה כי לא נעשה כל שימוש בבינה מלאכותית תתעלם מהראיה שהמודל קיים ולעיתים משפיע על החלטות. הקביעה 'Needs proof' שומרת על השאלה שהרשומות שסופקו הותירו פתוחה.

אחוז נמוך עדיין דורש פרשנות

החלק המורכב יותר הוא להחליט מה לדרוש בהמשך. שיעור קטן מתוך ההחלטות אינו מסביר, כשלעצמו, את חשיבותן של אותן החלטות.

חשבו על תהליך עבודה היפותטי שבו מודל מטפל במספר קטן של הקצאות בעלות השלכות מרחיקות לכת במיוחד. ספירה פשוטה של החלטות עלולה להמעיט בערכו של תפקידו הכלכלי. בתהליך עבודה היפותטי אחר, המודל מייצר המלצה עבור כל חשבון, אך בני אדם דוחים אותה בדרך כלל. יומן הסופר רק המלצות שהתקבלו יתאר פעילות שונה לחלוטין מיומן הסופר את כל ההמלצות שנשקלו. אף אחת משתי האפשרויות אינה מוכחת עבור Nimbus. הן מראות מדוע משמעות המונח 'השפיע' קריטית לפני שמשתמשים באחוז שלו כדי לקבע את הניסוח.

בודק יכול לשאול איזה אירוע גורם ליומן לספור החלטה, אילו חשבונות ואיזו תקופה הוא מכסה, והאם התפקיד הנטען נוגע להמלצות, לשינויים שהתקבלו או לסמכות ההכרעה הסופית. אם הגדרות אלו חסרות, איסוף כרטיס מודל נוסף לא יגשר על הפער. התימוכין החסרים נוגעים לשימוש התפעולי בפועל.

כאן אני מציב גבול סביב החלטת ההדגמה. מערכת ClaimLens מחילה כללים נבחרים על רשומות שסופקו. היא אינה מאמתת את מקוריות הרשומות הללו ואינה קובעת ששיטת הרישום ביומן לוכדת את התפקיד שקורא היה מסיק מהמשפט. תוצאת 'Needs proof' מוגדרת יכולה לארגן את מסלול החקירה. עם זאת, המדידה הבסיסית עדיין דורשת בדיקה מדוקדקת.

אותה זהירות חלה כאשר כלל מחזיר תוצאה תומכת. התאמה בין משפט לרשומה שסופקה היא סיבה לבדוק את מידת התאמתם. אין בה כדי להוכיח שהרשומה מלאה, מייצגת או אומתה באופן עצמאי. מערכת ביקורת צריכה לאפשר שימור קל של הבחנה זו כאשר תוצריה עוברים לדיון לקראת פרסום.

שלוש תגובות לפער

עבור צוות הניצב בפני פער דומה, הניסוח והראיות כאחד יכולים להשתנות. הבחירה תלויה בשאלה על איזה חלק מהטענה הצוות מסוגל להגן.

תגובה אחת היא לצמצם את המשפט לפעילות שכבר תועדה. קביעה שלפיה מודל נפרס היא התחייבות קטנה יותר מאשר הטענה שהוא מניע אופטימיזציית תיקים בכל החשבונות. זה יכול להיות תיקון מועיל אם עצם הפריסה הוא העובדה שראוי לתקשר. עם זאת, הדבר מוותר על הטענה הרחבה יותר לגבי תפקידו התפעולי של המודל. החלפת 'מונע בבינה מלאכותית' בתואר מעורפל אחר תשאיר את השאלה המקורית ללא פתרון.

תגובה שנייה היא לבסס את התפקיד התפעולי בצורה מדויקת יותר. הדבר עשוי לדרוש רשומות המבחינות בין המלצות שנוצרו, המלצות שנשקלו והחלטות ששונו, לצד היקף הכיסוי וההגדרות שלהן. הדבר כרוך בעבודה רבה יותר מאשר מציאת ראיה לכך שמודל קיים. הוא מוצדק כאשר תפקיד המודל מרכזי למה שהצוות מעוניין שהקוראים יבינו. הוא עשוי גם לחשוף כי הניסוח המקורי דורש שכתוב אף לאחר שהראיות שופרו.

תגובה שלישית היא להשהות את הטענה הרחבה יותר כל עוד השאלה נותרה פתוחה. הדבר מקריב מסר שיווקי שהצוות עשוי לרצות להשתמש בו. אני תומך במחיר זה כאשר ההבטחה המרכזית של המשפט תלויה בתפקיד תפעולי שאיש עדיין אינו יכול לתאר עם תימוכין נאותים. תווית בלתי פתורה מועילה פנימית רק אם מישהו לוקח אחריות על המשך המעקב; אין היא תחליף להכרעה לגבי המשפט הפומבי.

אלו הן בחירות של עריכה ובדיקה, ולא ניסוחים ש-ClaimLens ממליצה עליהם אוטומטית או מאשרת מבחינה משפטית. ערכן טמון בכך שהן מחברות את הראיות הבלתי פתורות לפעולה קונקרטית הבאה. הצוות יכול לשנות את ההבטחה, לשפר את ביסוסה או להשהות את פרסומה.

שימור אי-ההסכמה מבלי לאבד את ההכרעה

דוגמת התיק כוללת גם אי-הסכמה. בהדגמה המוקלטת, שופט ה-AI השמור במטמון מגדיר את הטענה כסותרת, בעוד ששער הבדיקה המוגדר שומר על 'Needs proof'. חוות הדעת היא שחזור מוקלט מראש, ולא הערכת מודל חדשה. השופט אינו משנה את החלטת השער.

אני רוצה ששתי התוצאות יהיו זמינות לבודק מכיוון שאי-ההסכמה חושפת שיקול דעת: עד כמה רשומה תפעולית זו מקדמת אותנו? הגדרת הטענה כסותרת מבטאת מסקנה נחרצת יותר מאשר קביעה שהתימוכין אינם מספקים. האדם שבוחן את המשפט צריך להבחין בהבדל זה ולבדוק את הסיבה לכך. הסתרת העמדה המייעצת תסלק השגה שראוי לשקול אותה. החלפת ההחלטה שנרשמה בדעה הנשמעת התקיפה ביותר תטשטש את האופן שבו הושגה התוצאה.

המדריך ההסבר של ClaimLens מציג את תהליך העבודה הזה של קישור טענה לרשומה. היחידה השימושית שלו היא המשפט יחד עם הסימוכין שסופקו, ההחלטה שנרשמה והנימוק. שילוב זה מעניק לשיווק, להנדסה ולבודק נושא משותף לדיון.

הנה סקירת המייסד של תהליך בדיקת ClaimLens הסינתטי.

המדד שלי לדיון הוא מוגדר וברור: זהו את העובדה התפעולית שתהפוך את הניסוח לבר-הגנה. אם הצוות מסוגל לבסס רק שמודל קיים, זהו גבול הטענה שבה הוא תמך. הבטחה רחבה יותר מרוויחה את מקומה רק כאשר הראיות מסבירות את התפקיד הרחב יותר.

מחקר קשור

פורסם גם ב

בנו את ה-AI שלכם בביטחון.

שותפו עם צוות בעל ניסיון עמוק בבניית הדור הבא של AI ארגוני. אנו נסייע לכם לתכנן, לבנות ולהטמיע אסטרטגיית AI שתוכלו לסמוך עליה.

Veriprajna ייעוץ דיפ-טק מתמחה בבניית מערכות AI קריטיות לבטיחות עבור תחומי הבריאות, הפיננסים והרגולציה. הארכיטקטורות שלנו מאומתות מול פרוטוקולים מבוססים ומלוות בתיעוד ציות מקיף.