ניטור רציף ונתיבי ביקורת
תשתיות ניטור AI מותאמות אישית ומערכות נתיבי ביקורת חסינות שיבוש המזהות כשלי מודלים לפני הגעתם לייצור ועומדות בדרישות שמירת רשומות רגולטוריות.
מרבית מערכות ה-AI פועלות באופן עיוור בייצור: לוחות מחוונים של זמינות מוכיחים שהשירות פעיל, אך לא שהחלטותיו נכונות. הגישה שלנו היא לבנות את השכבה החסרה — תשתית ניטור העוקבת אחר איכות המודל, מקור ההחלטות (provenance) ותאימות רגולטורית בייצור, המחוברת לנתיבי ביקורת חסיני שיבוש המסוגלים לשחזר כל החלטת AI חודשים לאחר שהתקבלה.
מרבית מערכות ה-AI פועלות באופן עיוור בייצור
הנה נקודת המוצא הלא-נוחה: 91% ממודלי ה-ML מתנוונים לאורך זמן. מודלים שנותרו ללא שינוי במשך שישה חודשים רואים זינוק של 35% בשיעורי השגיאות על נתונים חדשים. בשנת 2025 לבדה תועדו 362 תקריות AI ברחבי העולם, לעומת 233 בשנה שקדמה לה, וספירת התקריות החודשית הגיעה ל-435 בתחילת 2026. חמישים ואחד אחוזים מהארגונים המשתמשים ב-AI חוו השלכות שליליות מאי-דיוק של AI בשנה שעברה. אלו אינם מקרי קצה — זה מה שקורה כשצוותים משחררים מודלים ללא תשתית ניטור שבאמת עובדת.
התגובה הארגונית הטיפוסית היא לוח מחוונים של Grafana המציג מאיוני שיהוי ושיעורי שגיאות. זה אומר לכם שהמערכת פעילה. זה לא אומר לכם שהמערכת נכונה. אנו מתכננים את השכבה שעושה בדיוק את זה: תשתית ניטור העוקבת אחר איכות המודל, מקור ההחלטות (provenance) ותאימות רגולטורית בייצור, המחוברת למערכות נתיבי ביקורת המסוגלות לשחזר כל החלטת AI חודשים לאחר שהתרחשה.
מדוע כלי ניטור וצפייה (Observability) סטנדרטיים מפספסים כשלים ייחודיים ל-AI
כלי APM מסורתיים — Datadog, New Relic, Splunk — מנטרים תשתית: CPU, זיכרון, שיהוי, שיעורי שגיאות. מערכות AI כושלות בדרכים שמדדי תשתית אינם מסוגלים לזהות. מודל הלוואות שמתחיל לאשר לווים מסוכנים יותר יציג זמינות מושלמת ושיהוי נמוך מ-100 מילי-שניות, בעודו צובר בחשאי חשיפה רגולטורית. מודל ניטור תוכן שנסחף לעבר תוצאות שליליות שגויות (false negatives) ישמור על נתוני התפוקה שלו בעוד שתוכן מזיק יחמוק דרכו.
הכשלים החשובים במערכות AI הם סטטיסטיים, לא תפעוליים:
- התפלגויות של מאפייני קלט משתנות.
- כיול רמת הביטחון של תחזיות מתנוון.
- מדדי הוגנות מתבדרים בין קבוצות מוגנות.
אלו דורשים זיהוי ייעודי: מבחני Kolmogorov-Smirnov עבור שינויי התפלגות, Population Stability Index למעקב אחר מאפייני קלט, ניטור שגיאות כיול, ויעדי SLO של מדדי הוגנות (המפורטים ב- מחקר שלנו על שלמות אלגוריתמית בקבלת החלטות בסיכון גבוה) לצד יעדי SLO מסורתיים של זמינות. הגישה שלנו מטמיעה אותם כאותות ייצור מדרגה ראשונה. כאשר מדד הוגנות מפר את ה-SLO שלו, ההתראה נושאת את אותה חומרה כמו הפרת שיהוי P99. כאשר מזוהה סחיפת קלט, המערכת מתחקה אחריה בחזרה למקורות נתונים וצינורות תכונות ספציפיים — ולא רק קו גרף שעולה בלוח המחוונים.
מפת ספקי ניטור ה-AI אינה יציבה — תכננו בהתאם
שלושה מתוך שבעה ספקי ניטור AI ייעודיים נעלמו בתוך שנים-עשר חודשים, והשורדים מבצעים תפנית חדה. ספריות הקוד הפתוח שלהם נותרו, אך ללא תמיכה מסחרית או מפות דרכים לפיתוח.
| ספק | מה קרה |
|---|---|
| WhyLabs | נרכשה על ידי Apple; הפסיקה את הפעילות המסחרית. |
| NannyML | נטמעה בתוך Soda. |
| Aporia | נרכשה על ידי Coralogix. |
| Fiddler AI | גייסה 30 מיליון דולר בינואר 2026; מיצבה את עצמה מחדש כ-"AI Control Plane" עבור מערכות סוכניות (agentic). |
| Arthur AI | פתחה בקוד פתוח את מנוע ההערכה שלה; השיקה את Agent Discovery למיפוי ומלאי סוכני AI ארגוניים. |
| Arize AI | פלטפורמת Phoenix שלה הפכה ל-OpenTelemetry-native מלאה עם ניהול גרסאות מעריכים. |
| Evidently AI | העבירה תכונות שהיו סגורות בעבר לקוד פתוח. |
המשמעות עבור רוכשים: הימור על ספק יחיד הוא סיכון הגירה. הגישה שלנו היא לבנות ארכיטקטורות ניטור על בסיס תקנים פתוחים — OpenTelemetry למעקב (tracing), Prometheus למדדים, וספריות הערכה בקוד פתוח — כשמעליהן מולבשות יכולות ספציפיות לספק רק במקום שבו הן מעניקות ערך אמיתי. כאשר ספק נרכש או משנה כיוון, התשתית מחזיקה מעמד.
נתיבי ביקורת העומדים בבדיקה רגולטורית
נתיב ביקורת להחלטות AI אינו קובץ יומן. זוהי מערכת שחזור פורנזית. כאשר מבקר, רגולטור או צד בהתדיינות משפטית שואל "מדוע מערכת זו קיבלה החלטה זו בתאריך זה", התשובה חייבת לכלול:
- איזו גרסת מודל פעלה,
- באילו מאפייני קלט נעשה שימוש,
- איזה עיבוד מקדים הוחל,
- מה היו ציוני הביטחון, וכן
- אילו מדיניויות ממשל היו בתוקף באותו רגע.
אנו מתכננים מערכות אלו על גבי אחסון להוספה בלבד (append-only) עם אימות קריפטוגרפי. לאחר ש-Amazon QLDB הוצא משימוש ביולי 2025, הגישה שלנו מעדיפה את immudb עבור צוותים הזקוקים לחסינות מפני שיבוש ברמת ספר חשבונות (ledger-grade), ואת PostgreSQL עם שכבות אימות מותאמות אישית של עצי מרקל (Merkle-tree) עבור צוותים המעוניינים בשלמות ביקורת ללא מסד נתונים ייעודי. כל רשומה ממוענת לפי תוכן (content-addressed) ומקושרת בשרשרת גיבוב (hash-chained), כך ששיבוש בכל רשומה פוסל את המשך השרשרת.
עבור צינורות מרובי מודלים ומערכות AI סוכניות (agentic AI), האתגר מתעצם. כאשר מודל אחד מזין מודל אחר, או כאשר סוכן משרשר קריאות לכלים על פני ממשקי API חיצוניים, נתיב הביקורת חייב ללכוד את גרף התיאום (orchestration) המלא (אתגר שאנו בוחנים ב- מחקר שלנו על אבטחת שלמות שרשרת האספקה של AI לאורך מחזור החיים של ML). אנו מנטרים כל שלב כ-span במעקב OpenTelemetry, ומקשרים בין הסקות מודל, קריאות לכלים ופלטים סופיים ברצף יחיד שניתן לשחזור. זהו המקום שבו 63% מהארגונים נכשלים: Deloitte מצאה כי שיעור זה אינו מסוגל לאכוף מגבלות ייעוד על סוכני AI, בעיקר משום שאין להם שום נראות לגבי מה שסוכנים אלה עושים בפועל.
סעיף 12 ב-EU AI Act הוא כעת בעיה טכנית, לא משפטית
דרישות התיעוד ביומן של ה-EU AI Act עבור מערכות AI בסיכון גבוה נכנסות לתוקף מלא ב- 2 באוגוסט 2026. סעיף 12 מחייב יכולות תיעוד אוטומטיות המובנות בתוך המערכת עצמה. היומנים חייבים ללכוד אירועים לצורך זיהוי סיכונים, ניטור שלאחר השיווק ומעקב תפעולי. גורמים פורסים חייבים לשמור יומנים למשך שישה חודשים לפחות לכל רשומה. הקנס בגין אי-ציות: עד 15 מיליון אירו או 3% מהמחזור השנתי העולמי.
הבעיה המעשית היא שטרם קיים תקן טכני מותאם:
- גופי התקינה CEN/CENELEC החמיצו את מועד היעד שלהם מאוגוסט 2025; התקנים הראשונים (כולל prEN 18229-1 עבור תיעוד יומנים) צפויים לכל המוקדם ברבעון הרביעי של 2026.
- רק כ-30 ארגונים ברחבי העולם מחזיקים בהסמכת ISO 42001.
- רק 8 מתוך 27 המדינות החברות באיחוד האירופי אף מינו את הרשויות הלאומיות המוסמכות שלהן.
ואקום תקינה זה הוא למעשה התקופה המסוכנת ביותר. ארגונים חייבים לבנות תיעוד יומנים תואם כעת, לפני שהתקנים המגדירים "תואם" מגובשים סופית. הגישה שלנו ממפה את לשון סעיף 12 ישירות לבקרות טכניות: אילו אירועים ללכוד, באיזו ארכיטקטורת שימור להשתמש, אילו מטא-נתונים לצרף לכל הסקה, וכיצד לבנות יומנים כך שיישארו תואמים כאשר התקנים יפורסמו סוף סוף — אותה הנדסה נוירו-סימבולית העומדת מאחורי הדגמת ה-AI הפועלת לתאימות מס. החלופה היא המתנה לבהירות שעשויה לא להגיע לפני מועד האכיפה.
מה נבנה במהלך התקשרות
כל התקשרות מתחילה בסקר ארכיטקטורה של מערכי הניטור והתיעוד הקיימים שלכם. למרבית הצוותים כבר יש חלקים: יומני יישומים, זיהוי סחיפה מסוים, אולי כלי מעקב ניסויים. הבעיה היא בדרך כלל שחלקים אלה אינם מחוברים — מרשם המודלים אינו מתקשר עם מאגר התכונות (feature store) שאינו מתקשר עם יומן הביקורת. שחזור החלטה דורש הצלבה ידנית של חותמות זמן על פני שלוש מערכות. התקשרות בונה את הרקמה המחברת. תוצרים טיפוסיים כוללים:
- זיהוי סחיפה עם התחקות אחר סיבת שורש. לא רק "תכונה X נסחפה" אלא "תכונה X נסחפה משום שמקור נתונים Y שינה את הסכמה שלו ב-3 במרץ, מה שהשפיע על צינור Z." אנו מיישמים התרעות מדורגות: שינויים אינפורמטיביים ללוחות מחוונים, אזהרות לסקירה שבועית, והפרות קריטיות המזעיקות כונן תורן. כך פותרים עייפות התראות (alert fatigue) — התלונה המובילה של אנשי מקצוע ב-ML בסקר שנערך ב-2025 בקרב 91 צוותי ייצור.
- יעדי רמת שירות (SLO) לאיכות מודלים. SLO של זמינות ושיהוי הם דרישת סף בסיסית. אנו מגדירים ומטמיעים SLO עבור שגיאות כיול, יציבות מדדי הוגנות, עקביות הסברים, וגבולות ביטחון של תחזיות. הפרה של SLO איכות מפעילה את אותו נתיב הסלמה כמו השבתת תשתית.
- אחסון ביקורת חסין שיבוש. מאגר רשומות להוספה בלבד (append-only) עם שרשראות גיבוב קריפטוגרפיות, המאחסן הקשר הסקה מלא לכל החלטה, בהתבסס על מחקר שלנו על שלמות תוכנה במערכות עמידות. ניתן לתשאול לפי מזהה החלטה, טווח זמנים, גרסת מודל או מחלקת תוצאה. מתוכנן לענות על שאלת המבקר בתוך דקות, לא שבועות.
- מכשור וניטור מערכות סוכניות (Agentic). עבור ארכיטקטורות מרובות סוכנים, אנו עוקבים אחר גרף התיאום המלא: הפעלות סוכנים, קריאות לכלים, הסקת מסקנות ביניים ופלטים סופיים. כל שלב הוא span במעקב מבוזר, המקושר באמצעות מזהי מתאם (correlation IDs).
- מיפוי תאימות רגולטורית. מסמך חי הממפה את תשתית הניטור והביקורת שלכם לדרישות ספציפיות: חובות סעיף 12, בקרות NIST AI RMF (ממשל, מיפוי, מדידה, ניהול - Govern, Map, Measure, Manage), קריטריונים של SOC 2 Type II, וכל דרישה ספציפית למגזר. מסמך זה הוא מה שתגישו למבקר שלכם.
מתי זו ההשקעה הנכונה (ומתי לא)
אתם זקוקים לתשתית ניטור וביקורת מותאמת אישית כאשר מערכות ה-AI שלכם מקבלות החלטות בעלות השלכות רגולטוריות, פיננסיות או בטיחותיות ועליכם להוכיח שהחלטות אלו התקבלו כראוי — שירותים פיננסיים, בריאות, ביטוח, ממשל, וכל תחום שבו התשובה "המודל פעל כשורה" אינה מספקת את הרגולטור.
אינכם זקוקים לכך אם ה-AI שלכם הוא מנוע המלצות, מערכת להצעת תוכן, או כל יישום שבו פלט שגוי מהווה בעיית חוויית משתמש מינורית בלבד. אם צורכי הניטור שלכם נענים על ידי השכבה החינמית של Arize Phoenix ומופע Prometheus, השתמשו בהם — נאמר לכם זאת כבר בשיחה הראשונה.
באשר לעלות: ארגונים מוציאים 2–5 מיליון דולר בשנה על תשתית ניטור AI בזמן אמת. תאימות ל-EU AI Act דורשת עלות ראשונית של מעל 50,000 אירו לכל מערכת בסיכון גבוה בתוספת 10,000–25,000 אירו בשנה עבור ניטור שוטף. ארגונים בעלי מסגרות ממשל AI רשמיות משיגים שיעור הצלחה של פי 2.1 בפרויקטי AI ומפחיתים את הסיכון הרגולטורי ב-73%. טיעון החזר ההשקעה (ROI) אינו עוסק בניטור כשלעצמו — אלא בתקריות, בקנסות ובפרויקטים הכושלים שהניטור מונע. חברות ללא מסגרות ממשל איבדו בממוצע 4.4 מיליון דולר לכל תקרית בשנת 2025.
עיקרי הדברים
- זמינות תשתית אינה נכונות המודל — 91% ממודלי ה-ML מתנוונים, וכשלים ייחודיים ל-AI (שינוי התפלגות, התנוונות כיול, התבדרות הוגנות) אינם נראים ל-Datadog, New Relic או Splunk.
- זיהוי ייעודי (מבחני Kolmogorov-Smirnov, מדד יציבות אוכלוסייה Population Stability Index, יעדי SLO לכיול והוגנות) מתייחס להפרת הוגנות באותה חומרה כמו להפרת שיהוי P99.
- שוק הספקים הייעודיים עובר קונסולידציה — WhyLabs, NannyML ו-Aporia כבר אינן — ולכן הארכיטקטורות שלנו נבנות על גבי תקנים פתוחים (OpenTelemetry, Prometheus) השורדים את הרכישה הבאה.
- נתיבי ביקורת חסיני שיבוש על גבי immudb או שכבות עצי מרקל (Merkle-tree) ב-PostgreSQL (לאחר סגירת Amazon QLDB ביולי 2025) משחזרים כל החלטה בתוך דקות, לא שבועות.
- סעיף 12 ב-EU AI Act נכנס לתוקף ב-2 באוגוסט 2026 ללא תקן טכני מגובש סופית — בניית תיעוד יומנים תואם כעת, הממופה ישירות ללשון הסעיף, עדיפה על פני המתנה להנחיות שעלולות להחמיץ את מועד היעד.
ניטור רציף ונתיבי ביקורת
אבטחת שרשרת אספקה של AI ושלמות מודלים | Veriprajna
ייעוץ אבטחת שרשרת אספקה של AI. אנו בונים צינורות בדיקת מודלים, ארכיטקטורת ML-BOM וממשל AI צללים עבור מנהלי אבטחת מידע (CISO) בארגונים מפוקחים. תואם NIST AI 100-2 ו-EU AI Act.
בינה מלאכותית להשבת חומרים ולמיון פלסטיק שחור | Veriprajna
פיגמנט הפחם השחור בולע אור קרוב-אינפרא-אדום. כל מגש PP שחור, מיכל PE ומארז ABS שמסדק האופטי שלכם מפספס הולך לפסולת שיורית, ואז להטמנה. אנו בונים את שכבת החישה ב-MWIR ובינת הקצה שמשיבה אותו.
ציות AI בתחום הדיור: הוגנות בסינון דיירים ותמחור אלגוריתמי | Veriprajna
חברות לניהול נכסים ניצבות בפני חשיפה משפטית סימולטנית בשתי חזיתות: סינון דיירים המפלה תחת חוק הדיור ההוגן (Fair Housing Act), וניהול הכנסות המתאם תמחור תחת חוק שרמן (Sherman Act). אנו מבקרים את שניהם, מהנדסים ארכיטקטורות תואמות ציות, וממפים את המערכות שלכם מול כל תחום שיפוט שמשמעותי.
Smart Meter AI: תחזוקה חזויה ל-AMI ואימות קושחה | Veriprajna
דחיפת קושחה אחת שגויה עלתה לפלאנו, טקסס 765,000$ והשביתה 73,000 מונים. ממפיס מוציאה 9 מיליון דולר על תיקונים. מערכת ה-head-end של ה-AMI שלכם עוקבת אחר אילו מונים הפסיקו לתקשר.
שלמות פריסת עדכוני תוכנה וחוסן IT | Veriprajna
ב-19 ביולי 2024, קובץ תצורה בודד הקריס 8.5 מיליון מכונות Windows בפחות מ-90 דקות. לא תוכנה זדונית.
אימות AI לציות מס | Veriprajna
Thomson Reuters "Ready to Review" מכין אוטומטית טפסי 1040. CCH Axcess Expert AI מנסח תובנות ייעוץ בקרב 10,000 משרדים. Blue J עונה על שאלות מחקר מס עם שיעור אי-הסכמה של פחות מ-1 ל-700.
שאלות נפוצות
כמה עולה תשתית ארגונית לניטור AI ונתיבי ביקורת?
ארגונים מוציאים בדרך כלל 2–5 מיליון דולר בשנה על תשתית ניטור AI בזמן אמת. תאימות ל-EU AI Act מוסיפה מעל 50,000 אירו בעלות ראשונית לכל מערכת בסיכון גבוה בתוספת 10,000–25,000 אירו בשנה עבור ניטור וביקורות שוטפים. ניטור, ביקורת ודיווח צורכים כ-40% מתקציבי התאימות השנתיים. העלות של היעדר ניטור תלולה בהרבה: ארגונים ללא מסגרות ממשל איבדו בממוצע 4.4 מיליון דולר לכל תקרית בשנת 2025, וקנסות אי-ציות במסגרת ה-EU AI Act מגיעים ל-15 מיליון אירו או 3% מהמחזור השנתי העולמי. אנו מגדירים את היקף ההתקשרות על בסיס מספר המערכות שלכם, החשיפה הרגולטורית והתשתית הקיימת, ולא כדמי מנוי לפלטפורמה.
כיצד מיישמים תיעוד יומנים לפי סעיף 12 ב-EU AI Act כאשר טרם קיים תקן טכני?
סעיף 12 דורש יכולות תיעוד אוטומטיות המובנות בתוך מערכת ה-AI עצמה, הלוכדות אירועים לצורך זיהוי סיכונים, ניטור שלאחר השיווק ומעקב תפעולי. גורמים פורסים מחויבים לשמור יומנים למשך שישה חודשים לפחות לכל רשומה. האתגר הוא שגופי התקינה CEN/CENELEC החמיצו את מועד היעד שלהם מאוגוסט 2025 לתקנים מותאמים (harmonized standards); תקן התיעוד הראשון (prEN 18229-1) צפוי ברבעון הרביעי של 2026 לכל המוקדם. אנו ממפים את לשון סעיף 12 ישירות לבקרות טכניות: מפרטי לכידת אירועים, ארכיטקטורת שימור, סכמות מטא-נתונים לכל הסקה, ומבני יומנים המתוכננים להישאר תואמים כאשר התקנים יפורסמו סוף סוף. המשמעות היא בנייה כעת על בסיס בחירות ארכיטקטוניות בנות-הגנה במקום להמתין להנחיות שאולי לא יגיעו לפני מועד האכיפה באוגוסט 2026.
כיצד מגדירים זיהוי סחיפה שאינו מציף את צוות הכוננות באזעקות שווא (false positives)?
עייפות התראות (alert fatigue) היא התלונה המובילה בניטור ML בייצור. סיבת השורש היא בדרך כלל ניטור שווה של כל מאפיין קלט עם ספים סטטיסטיים רגישים יתר על המידה. במערכות עתירות תעבורה, שינויי התפלגות זעירים שהינם מובהקים סטטיסטית הם חסרי כל השפעה עסקית. אנו מיישמים התרעות מדורגות: ניטור של המאפיינים המובילים בלבד לפי חשיבות המודל, הפרדה בין שינויים אינפורמטיביים (לוח מחוונים בלבד), אזהרות (סקירה שבועית) והפרות קריטיות (הזעקת כונן תורן). אנו משתמשים בזיהוי נקודות שינוי (change-point detection) לשינויים פתאומיים ובשיטות סכום מצטבר (cumulative-sum) לסחיפה הדרגתית, המכוילים לגבולות ההחלטה האמיתיים שלכם. דגימה סטטיסטית של 5–10% מהתעבורה מספקת רמת ביטחון של 95% ללא צורך בעיבוד כל הסקה. המטרה היא פחות התראות, בעלות אות חזק יותר, המצביעות באמת על ירידה באיכות.
מה קרה ל-WhyLabs, NannyML ו-Aporia, ולאן כדאי להגר?
שלושה ספקי ניטור AI ייעודיים נעלמו בתוך שנים-עשר חודשים. WhyLabs נרכשה על ידי Apple והפסיקה את הפעילות המסחרית (ספריות הקוד הפתוח whylogs ו-langkit נותרו, אך ללא תמיכה). NannyML נרכשה על ידי Soda ביוני 2025, שהטמיעה את טכנולוגיית הערכת הביצועים ללא תוויות שלה לתוך פלטפורמת איכות נתונים. Aporia נרכשה על ידי Coralogix בדצמבר 2024, ושילבה את ניטור ה-ML בכלי צפייה וניטור כללי. כיעדי הגירה: Arize Phoenix (מבוסס OpenTelemetry-native, קוד פתוח חזק) הוא התחליף הכללי המוביל. Evidently AI מכסה הערכה וזיהוי סחיפה עם שילוב מעולה ב-CI/CD. מנוע הקוד הפתוח של Arthur AI מטפל בהערכה בזמן אמת. אנו ממליצים לבנות על בסיס תקנים פתוחים עם שכבות ייעודיות לספק מעליהם, כך שהרכישה הבאה לא תכפה הגירה נוספת.
האם כדאי לבנות או לקנות תשתית ניטור AI?
התשובה הפרגמטית לשנת 2026 היא שילוב. קנו יכולות פלטפורמה עבור לוחות מחוונים לממשל, התרעות וזיהוי סחיפה בסיסי. בנו את המייל האחרון: מערכי נתוני הערכה ספציפיים לתחום, גלאי הוגנות מותאמים אישית ושכבת האינטגרציה המחברת את מרשם המודלים למאגר התכונות (feature store) וליומן הביקורת שלכם. כלי קוד פתוח (Evidently, Arize Phoenix, OpenTelemetry, Prometheus) מונעים נעילת ספק (vendor lock-in) אך דורשים צוות הנדסה ייעודי. פלטפורמות מנוהלות מביאות אתכם לפעילות בתוך ימים אך טומנות בחובן סיכון הגירה בהינתן גל קונסולידציית הספקים. אנו מסייעים לארגונים לתכנן את הארכיטקטורה המשתמשת בכלי הנכון לכל שכבה, עם ממשקים פתוחים ביניהם כך ששום כשל של ספק יחיד לא ישבית את המערכת.
כיצד מנטרים מערכות AI סוכניות שבהן סוכנים משרשרים קריאות מרובות לכלים?
ניטור ML סטנדרטי עוקב אחר הסקת מסקנות של מודל יחיד. מערכות סוכניות מורכבות יותר מכיוון שסוכן עשוי לשרשר קריאות מרובות ל-LLM, שאילתות ל-API חיצוניים, חיפושים במסדי נתונים והאצלת סמכויות לתת-סוכנים בבקשת משתמש יחידה. 63% מהארגונים אינם מסוגלים לאכוף מגבלות ייעוד על סוכני ה-AI שלהם, ו-60% אינם יכולים לסיים פעילות של סוכן שאינו מתנהג כשורה, בעיקר משום שאין להם שום נראות לגבי מה שהסוכנים עושים בפועל. אנו מנטרים כל שלב כ-span במעקב מבוזר של OpenTelemetry, ומקשרים בין הפעלות סוכן, קריאות לכלים, שלבי הסקת מסקנות ביניים ופלטים סופיים באמצעות מזהי מתאם (correlation IDs). הדבר מעניק לכם רצף הניתן לשחזור עבור כל הרצת סוכן, עם נקודות ניטור (hooks) בכל נקודת מעבר לאכיפת מדיניות, מעקב עלויות ובדיקות איכות.
כיצד בונים נתיב ביקורת המסוגל לשחזר החלטת AI ספציפית מלפני שישה חודשים?
שחזור החלטה דורש לכידה של מלוא הקשר ההסקה ברגע קבלת ההחלטה: גיבוב (hash) גרסת המודל, וקטור מאפייני הקלט, מצב צינור העיבוד המקדים, ציוני הביטחון, תוצרי הסבר ומדיניות הממשל שהייתה בתוקף. אנו מאחסנים זאת במערכות להוספה בלבד (append-only) עם שרשראות גיבוב קריפטוגרפיות כך שכל רשומה חסינה מפני שיבוש. לאחר סגירת Amazon QLDB ביולי 2025, אנו משתמשים ב-immudb עבור צוותים הזקוקים להוכחה קריפטוגרפית ברמת ספר חשבונות (ledger-grade), או ב-PostgreSQL עם אימות עצי מרקל (Merkle-tree) מותאם אישית עבור צוותים המעוניינים בשלמות ביקורת ללא מסד נתונים ייעודי. כל רשומה ממוענת לפי תוכן (content-addressed) וניתנת לתשאול לפי מזהה החלטה, טווח זמנים, גרסת מודל או מחלקת תוצאה. המערכת מתוכננת כך שניתן לענות על שאלת המבקר בתוך דקות, ולא לאחר שבועות של ארכיאולוגיית יומנים.
אילו יעדי SLO לאיכות מודל כדאי להגדיר מעבר לשיהוי וזמינות?
שיהוי וזמינות אומרים לכם שהמערכת פועלת. הם אינם אומרים לכם שהמערכת נכונה. אנו מגדירים ומטמיעים SLO עבור ארבעה ממדים נוספים: שגיאת כיול (האם 80% ביטחון אכן צודק ב-80% מהמקרים?), יציבות מדדי הוגנות (האם תוצאות של קבוצות מוגנות מתבדרות?), עקביות הסברים (האם קלטים דומים מייצרים הסברים דומים?), וגבולות ביטחון של תחזיות (האם המודל מגלה חוסר ודאות גובר והולך?). לכל SLO יש סף המכויל להקשר העסקי שלכם, ולא חיתוכים סטטיסטיים שרירותיים. הפרה של SLO איכות מפעילה את אותו נתיב הסלמה כמו השבתת תשתית. כך תופסים את מודל ההלוואות שמציג זמינות מושלמת בעודו מאשר בחשאי לווים מסוכנים יותר.
מה מחפשת ביקורת SOC 2 Type II בתיעוד יומני החלטות AI?
מבקרי SOC 2 Type II מעריכים בקרות לאורך זמן, ולא רק תצורות נקודתיות בזמן מסוים. עבור מערכות AI, הם בוחנים: האם שינויים במודל מתועדים ביומן ומורשים (ניהול שינויים), האם הניטור מזהה ומתריע על התנהגות מודל אנומלית (זיהוי תקריות), האם גישה לנתוני אימון ותוצרי מודל מבוקרת ומתועדת ביומן (בקרות גישה), והאם קיים תהליך מתועד לתגובה לכשלי מודלים (תגובה לתקריות). נתיב הביקורת חייב להוכיח שבקרות אלו פעלו ביעילות לאורך כל תקופת הסקירה. אנו בונים תשתית תיעוד יומנים הלוכדת נקודות בקרה אלו באופן אוטומטי, מאחסנת אותן במערכות חסינות שיבוש ומפיקה את דוחות הראיות שמבקרים דורשים, ובכך הופכת את ההכנה לביקורת מבהלה רבעונית לתוצר לוואי שוטף ורציף של הפעילות התפעולית.
בנו את ה-AI שלכם בביטחון.
שותפו עם צוות בעל ניסיון עמוק בבניית הדור הבא של AI ארגוני. אנו נסייע לכם לתכנן, לבנות ולהטמיע אסטרטגיית AI שתוכלו לסמוך עליה.
Veriprajna ייעוץ דיפ-טק מתמחה בבניית מערכות AI קריטיות לבטיחות עבור תחומי הבריאות, הפיננסים והרגולציה. הארכיטקטורות שלנו מאומתות מול פרוטוקולים מבוססים ומלוות בתיעוד ציות מקיף.