שכבת האמון בריצה בין מודל הראייה למפעיל
מודל מעבדה בדיוק 97% יכול להגיע לשיעור דחייה שגויה של 14% בייצור, לא כי המודל הורע אלא כי בוהק, תבניות קרות וחילופי משמרת הוציאו את הקלטים מההתפלגות שעליה אומת. ה-Inspection Trust Gate בודק כל תמונה מול המעטפת המאומתת של המודל, מחיל שערי קוד דטרמיניסטיים שהמודל אינו יכול לעקוף, מחזיק כל דבר שמחוץ למעטפת לסקירה אנושית, וכותב רשומת שושלת ביקורת לכל חלק. סוכנים מייעצים, קוד מחליט.
0
חלקים תקינים עם סחיפה שנגרסו אוטומטית על ידי השער
קו בסיס תמים דוחה בשגיאה 95.5 עד 100% (פיצול מוחזק-החוצה של MVTec metal_nut)
93/93
חלקים פגומים תחת סחיפה עדיין נתפסים או מועברים להסלמה
מעולם לא עברו אוטומטית (אותו פיצול מוחזק-החוצה)
1.00
AUROC מעטפת על משפחת סחיפה מוחזקת-החוצה
מעולם לא כוון נגדה, כך שהבדיקה אינה מעגלית (פיצול מוחזק-החוצה של MVTec metal_nut)
זו הדגמה ניתנת-להרצה. מפעיל ה-PLC וכיור ה-MES הם מתאמים מדומים שרושמים מה שהיו עושים, תמונות החלקים הן תצלומי MVTec AD metal_nut אמיתיים, והסחיפה היא השחתת תמונה כנה שהוחלה על תצלומים תקינים אמיתיים.
מצב הכשל שעוצר פריסות בדיקה בקצה הוא כשל קלט, לא כשל מודל.
המקרה הקנוני מהמחקר שלנו הוא מכבש תבניות מתקדם של 200 טון שרץ ב-40 פעימות לדקה: מודל ראייה שפגע בדיוק 97% באימות מתמוטט לשיעור דחייה שגויה של 14% בייצור. המודל לא הורע. בוהק מתאורת המפרץ העליונה משתנה לפי זווית הפעימה, חומר הסיכה מצטבר אחרת על תבניות חמות וקרות, ו-50 החלקים הראשונים של משמרת מגיעים לפני שיווי משקל תרמי. הקלטים עזבו את ההתפלגות שעליה אומת המודל, ואין מודל, בשום דיוק, שניתן לסמוך עליו שם.
התבנית בענף אומרת שהמודל מעולם לא היה הפרויקט. מערכות AOI מהקופסה דוחות בשגיאה 5 עד 15% מהחלקים התקינים, בעוד שמערכות מכוונות היטב יורדות מתחת ל-2%: בעיית כיול ונתונים, לא בעיית ארכיטקטורת מודל. האינטגרציה היא 60% מלוח הזמנים של פריסה ואימון המודל 15%, ו-84% מפרויקטי אינטגרציית מערכות נכשלים או נכשלים חלקית.
הרגולציה מעלה את הסיכון. חובות הסיכון הגבוה של ה-EU AI Act, שמכסות החלטות איכות קריטיות לבטיחות לפי Annex III, ישימות במלואן מ-2 באוגוסט 2026, עם קנסות מרביים של 35 מיליון אירו או 7% מהמחזור העולמי להפרות הפרקטיקה האסורה החמורות ביותר. מפעיל דחייה שנורה על פסק דין מודל לא מאומת, בלי רשומה של הסיבה, הוא בדיוק מה שהמשטר הזה נועד לחשוף.
התיקון אינו מודל טוב יותר. גם מודל מושלם תקף רק על קלטים בתוך המעטפת המאומתת שלו. מה שהקו צריך הוא שכבת ריצה שמכירה את המעטפת הזו, מסרבת להפעיל מחוץ לה, ויכולה להוכיח, חלק אחר חלק, מה החליטה ולמה.
שער דטרמיניסטי מחליט מה מופעל, לא מודל ולא LLM.
כל חלק רץ באותו צינור:
תמונה → מאפיינים פיזיקליים + מרקם → בדיקת מעטפת (OOD) → פסק דין פגם → שער דטרמיניסטי → הפעלה / החזקה → רשומת ביקורת
EnvelopeDetector מחשב מרחק מהלנוביס במרחב אותות פיזיקליים (חשיפה, ניגודיות, טווח דינמי, פוקוס, פרט בתדר גבוה, גוון צבע תרמי, רוויה, שבר בוהק), מותאם על 220 תמונות train-good. הוא עונה על שאלה אחת: האם התמונה הזו בתוך תנאי הלכידה שעליהם אומת המודל? מחוץ-למעטפת פירושו שאף פלט מודל אינו נאמן.
קוד פשוט, מחוץ לכל LLM, שהמודל אינו יכול לעקוף: ספי ביטחון מכוילים שהותאמו מנתוני ההדגמה עצמה (מעבר אוטומטי מתחת ל-0.948, דחייה אוטומטית מעל 1.30) ותקציב השהיה קשיח של 750 ms לחלון פעימה. כל חלק מנותב ל-AUTO_PASS, AUTO_REJECT או HOLD, ששולח אותו לתור הסלמה אנושי.
כל החלטה כותבת רשומת JSONL: מזהה חלק, תחנה, מזהה מודל וגרסה, hash מערך נתונים, ביטחון פגם, ציון OOD, אותות פיזיקליים, כללי השער שהופעלו, השהיה מול תקציב, לוגים של הפעלה ו-MES, ותג הסיכון high-risk:quality-gate (EU AI Act Annex III, בתוקף 2026-08-02). לחיצה אחת מייצאת את המשמרת.
ה-DefectDetector של ההדגמה הוא מרחק kNN לחלקי train-good במרחב מרקם (PatchCore-lite), שעומד במקום NVIDIA Metropolis, Cognex או מודל מותאם שלכם מאחורי ממשק קבוע. זה תחליף עובד אמיתי (AUROC 0.845 על תקין נקי מול פגם), מדווח בכנות, וטענת המוצר מעולם אינה נשענת עליו. הערך העמיד הוא השכבה סביבו: שערי סחיפה, מקוריות והפעלה נשלטת מחזיקים בכל דיוק מודל, כך שהשכבה שורדת כל שדרוג מודל.
כשחלקים מצטברים בתור ה-HOLD, זוג סוכני Drift Triage מסביר למה: סוכן אבחון קורא את סטיות האות הפיזיקלי המדורגות של החלקים המוחזקים ומציע השערת שורש-סיבה עם פעולה מומלצת, וסוכן מבקר מאמת את ההשערה מול הראיות המספריות, ומוריד אותה לחקירה ידנית אם האות המצוטט אינו באמת הסטייה הדומיננטית. הסוכנים בנויים על Pydantic AI וניתנים להחלפת ספק; בלי מפתח API מוגדר, הטריאז' יורד לתבנית דטרמיניסטית כך שכל ההדגמה רצה אופליין. כך או כך, הסוכנים רק מייעצים. השער כבר החליט.
משמרת מתוסרטת בתחנה Line 3, משוחזרת על חלקי בדיקה מוחזקים-החוצה אמיתיים של MVTec AD metal_nut. כל תמונה למטה היא צילום מסך של האפליקציה הפועלת.
לפני הסחיפה, חלקים תקינים נקיים עוברים אוטומטית עם זמן עודף: לוג הביקורת שנשלח מראה את החלק test-good-288 ב-37.7 ms ואת test-good-289 ב-24.4 ms מול תקציב חלון הפעימה של 750 ms, כל אחד עם רשומת שושלת מלאה. לוח הבקרה מציג את צינור ההחלטה החי לכל חלק, עם שעון הקיר שנמדד לכל שלב והראיות מאחורי הפלט שלו.
אז הסמן המתוסרט נורה: SHIFT CHANGE 06:00, תבניות קרות, אורות מפרץ דולקים. שניים-עשר חלקים תקינים מוחזקים-החוצה מגיעים מושחתים בבוהק, חוסר פוקוס וגוון תרמי (השחתת תמונה כנה שהוחלה על תצלומים תקינים אמיתיים, מסומנת ככזו באפליקציה). מוניטור המעטפת הופך לאדום. השער מחזיק כל אחד מהם לסקירה אנושית במקום לתת למפעיל לירות על פסק דין שהמודל מעולם לא אומת לתת.
פאנל ההשוואה מריץ את אותם החלקים דרך קו הבסיס התמים ללא מעטפת ודרך ה-Trust Gate. קו הבסיס דוחה בשגיאה את החלקים התקינים עם הסחיפה; השער גורס אוטומטית 0 ומחזיק אותם, ומוריד את מדד הדחייה השגויה מ-57.1% ל-0% במשמרת המתוסרטת הזו. פאנל השלכה מקרין את שיעור הדחייה השגויה הנמדד של התמים למשמרת מלאה (40 פעימות לדקה במשך 8 שעות הן 19,200 חלקים) ב-$2.42 לכל חלק, עלות גרוטאות בסדר גודל ממקור (תיק יצרן עוגיות: חיסכון שנתי של $94K מהפחתת פסולת גרוטאות של 8.7%). נתון הדולרים הוא תמיד השלכה מסומנת, לעולם לא חיסכון נמדד.
שערי סחיפה היו חסרי ערך אם פגמים היו מסתתרים תחתיהם. פגם מבני גס אמיתי (מחלקת flip של MVTec, חלק test-flip-264) נדחה אוטומטית, ומפעיל מדומה רושם REJECT actuated ב-25 ms מול תקציב 750 ms. קידוח הגיאומטריה קובע ששום דבר לא ממוקם בחלק הזה: הדחייה נשענת על ביטחון מרקם בלבד, וכלל האזור נפל חזרה לברירת המחדל של המרכז. הצגת הטקסט הזה מכוונת. ההדגמה מציגה את הכלל נמנע במקום להעמיד פנים. בכל הפיצול המוחזק-החוצה, חלקים פגומים שהוזרקו במהלך סחיפה עדיין נתפסים או מועברים להסלמה, 93 מתוך 93, מעולם לא עברו אוטומטית.
לחיצה על כל חלק פותחת את מגירת הביקורת עם רשומת השושלת המלאה: מזהה מודל metalnut-defect-knn גרסה v7, hash מערך נתונים ae95b5b533c8, ציון OOD, אותות פיזיקליים, הכללים שהופעלו, השהיה מול תקציב, לוגים של הפעלה ו-MES, ותג הסיכון high-risk:quality-gate (EU AI Act Annex III, בתוקף 2026-08-02). Export Audit מוריד את המשמרת כ-inspection_audit.jsonl; שלמות הביקורת היא 100% מהחלקים שהוכרעו בפיצול המוחזק-החוצה. הרצת Drift Triage גורמת לסוכן האבחון להציע שורש סיבה לחלקים המוחזקים בעוד סוכן המבקר מאמת אותו מול הראיות המספריות לפני שהוא זוכה בתג verified.
כל המדידות מגיעות מסקריפט הבנצ'מרק של ההדגמה על פיצול הבדיקה הרשמי המוחזק-החוצה של MVTec AD metal_nut (220 תמונות התאמת train-good; 22 חלקים תקינים ו-93 פגומים לבדיקה), בהשוואת קו הבסיס התמים ללא מעטפת מול ה-Trust Gate על אותן תמונות. קו הבסיס דוחה בשגיאה 95.5 עד 100% מהחלקים התקינים עם סחיפה לכל משפחת סחיפה (ממוצע 98.9%); השער גורס אוטומטית 0.0% ומחזיק 100% מהם. גלאי המעטפת מקבל AUROC 1.00 על משפחת סחיפה מוחזקת-החוצה (תת-חשיפה) שמעולם לא כוון נגדה. ההשחתות הן בעוצמה מלאה, כך שהתמוטטות הבסיס כמעט מוחלטת מעצם הבנייה: הטענה הכנה היא הכיוון, שמודל מאומת בנקיון מתמוטט ברגע שהקלטים עוזבים את המעטפת, לא האחוז המדויק. אלה מדידות הדגמה על בנצ'מרק מחקרי, לעולם לא ערבויות עולם פתוח.
אותה השוואה שההדגמה מריצה חיה, על אותם חלקים.
| ממד | AOI תמים (בלי בדיקת מעטפת) | Inspection Trust Gate |
|---|---|---|
| קלטים מחוץ למעטפת | פסק דין המודל נאמן בכל זאת | אף פלט מודל אינו נאמן; החלק מוחזק (HELD) לסקירה |
| חלקים תקינים עם סחיפה (בוהק, חוסר פוקוס, גוון תרמי) | 95.5 עד 100% נדחו בשגיאה לכל משפחת סחיפה | 0 נגרסו אוטומטית; 100% הוחזקו (פיצול מוחזק-החוצה של MVTec metal_nut) |
| מי יורה את המפעיל | פסק הדין של המודל, ישירות | שער דטרמיניסטי שהמודל אינו יכול לעקוף |
| אחריות השהיה | אין | תקציב חלון פעימה קשיח של 750 ms, נמדד לכל חלק |
| מסלול ביקורת | אין | רשומת שושלת JSONL לכל חלק, ניתנת לייצוא לכל משמרת |
| כשהקו נסחף | גרוטאות מצטברות עד שמישהו שם לב | תור הסלמה בתוספת Drift Triage ייעוצי (סוכן אבחון, סוכן מבקר) |
בדרך כלל כי הקלטים נסחפו, לא כי המודל הורע. בוהק מתאורת מפרץ, תבניות קרות, והחלקים הראשונים של משמרת לפני שיווי משקל תרמי מוציאים תמונות מחוץ להתפלגות שעליה אומת המודל, ואין מודל שניתן לסמוך עליו על קלטים מחוץ למעטפת המאומתת שלו. מודל מעבדה של 97% שמגיע לשיעור דחייה שגויה של 14% בייצור על מכבש הטבעה הוא הדוגמה הקנונית. התיקון העמיד הוא שער שמזהה קלטים מחוץ למעטפת ומחזיק את החלקים האלה לסקירה במקום להפעיל.
לא. ה-Inspection Trust Gate עוטף את המודל שלכם מאחורי ממשק קבוע; בהדגמה גלאי הפגמים הוא תחליף מכוון למנוע NVIDIA Metropolis, Cognex או מנוע מותאם. המוצר הוא השכבה סביב המודל: בדיקת המעטפת, השער הדטרמיניסטי, תור ההסלמה ושושלת הביקורת. השכבה הזו ממשיכה להרוויח את מקומה בכל שדרוג מודל, כי הכשל שהיא מונעת הוא כשל קלט, לא כשל מודל.
השער הוא קוד פשוט עם תקציב השהיה קשיח: החלטת הדחייה חייבת לנחות בתוך חלון הפעימה של 750 ms של מכבש שרץ ב-40 פעימות לדקה. בלוג הביקורת שנשלח של ההדגמה, החלטות נוחתות בעשרות מילישניות, למשל 24.4 ms ו-37.7 ms מול תקציב 750 ms, ולוח הבקרה מדווח את ה-p99 החי. אלה מדידות הדגמה, לא ערבות ייצור, אבל התקציב נאכף לכל חלק.
החלטות איכות קריטיות לבטיחות נכנסות תחת חובות הסיכון הגבוה של החוק (Annex III), ישימות במלואן מ-2 באוגוסט 2026, עם קנסות מרביים של 35 מיליון אירו או 7% מהמחזור העולמי להפרות הפרקטיקה האסורה החמורות ביותר. ההדגמה כותבת רשומת שושלת לכל חלק: מזהה מודל וגרסה, hash מערך נתונים, ציון OOD, הכללים שהופעלו, השהיה מול תקציב, לוג הפעלה, ותג הסיכון, ניתנת לייצוא כ-JSONL. הרשומה מעוצבת כראיה שניתן להגיש לתיק התאמה בסיכון גבוה; היא אינה הסמכה.
לא. ההפעלה מוכרעת על ידי שער דטרמיניסטי: ספי ביטחון מותאמים ותקציב השהיה בקוד פשוט שאף פלט מודל ואף LLM אינו יכול לעקוף. החלק הסוכני, Drift Triage, הוא סוכן אבחון בתוספת סוכן מבקר שמסבירים למה הקו נסחף; הם מייעצים ולעולם אינם מפעילים. בלי מפתח API מוגדר, הטריאז' יורד לנסיגה דטרמיניסטית וכל ההדגמה רצה אופליין.
זו בדיקת העצמאות שהרצנו: גלאי המעטפת קיבל AUROC 1.00 על משפחת סחיפה מוחזקת-החוצה (תת-חשיפה) שמעולם לא כוון נגדה, נמדד על הפיצול המוחזק-החוצה של MVTec metal_nut. הוא מותאם על 220 תמונות ידועות-כתקינות במרחב אותות פיזיקליים, כך שהוא מסמן סחיפת לכידה שמזיזה את האותות האלה, לא רק את משפחות הסחיפה שבנינו. ההשחתות הן בעוצמה מלאה, כך שההפרדה חדה מעצם הבנייה; הטענה הכנה היא הכיוון, לא האחוז המדויק.
הדגמה ניתנת-להרצה שמוכיחה את המנגנון. נתיב ה-EtherNet/IP למפעיל דחייה Allen-Bradley ControlLogix וכיור ה-MES הם מתאמים מדומים שרושמים מה שהיו עושים, והמצלמה היא זרם מוקלט של תצלומי MVTec AD metal_nut אמיתיים; הסחיפה היא השחתת תמונה כנה שהוחלה על תצלומים תקינים אמיתיים. בדיקת המעטפת, השער הדטרמיניסטי, תור ההסלמה וייצוא הביקורת אמיתיים ורצים בדיוק כפי שמוצג, וכל מספר כותרת נמדד על פיצול הבדיקה המוחזק-החוצה של MVTec metal_nut.
המחקר מאחורי ההדגמה הזו — הארכיטקטורה, עיצוב האימות, ותוכנית האב הארגונית.
שכבת האמון בין המודל למפעיל היא החלק הקשה. אנחנו בונים אותה.
אם הצוות שלכם מתמודד עם דחיות שגויות אחרי כל חילוף משמרת, או עם מה שחובות הסיכון הגבוה של ה-EU AI Act אומרות לקו שמחליט ב-40 פעימות לדקה, נשמח באמת לשמוע איך אתם חושבים על זה. הבעיה היא כלל-ענפית וגם התשובות יהיו.