אבטחת מחזור החיים של למידת מכונה מפני מודלים זדוניים ופריסות צל (Shadow AI)
הגילוי של יותר מ-100 מודלים עם דלתות אחוריות ב-Hugging Face חשף את מה שמהנדסי Deep AI כבר ידעו: שרשרת האספקה של ML היא הרכיב הפגיע ביותר והכי פחות מנוהל בתשתית הארגונית. נייר עמדה זה מציג את התוכנית ההנדסית לחוסן AI מאומת קריפטוגרפית ומגובה בחומרה.
בזמן שהשוק רודף אחר שירותי עטיפה (wrappers) ל-LLM, פגיעות מערכתית מחמירה ביסודות. משקלי מודלי AI הם גושים בינאריים אטומים (blobs) שבהם התנהגות זדונית מסתתרת בתוך מיליוני פרמטרים – בלתי נראית לבדיקות קוד מסורתיות.
מודלים במאגרים ציבוריים אינם רק פגומים – הם משמשים כנשק. סריאליזציית Pickle מאפשרת הרצת קוד שרירותי ברגע שמפתח מריץ torch.load(), ומקימה reverse shells לתשתית שבשליטת התוקף.
90% משימוש ה-AI בארגונים מתרחש מחוץ לפיקוח של ה-IT. מפתחים מושכים מודלים שלא עברו בדיקה ממאגרים ציבוריים, מדביקים קוד קנייני בכלים פומביים ועוקפים ניתוח הרכב תוכנה (SCA) – מה שיוצר דלתות אחוריות מתמשכות ובלתי נראות.
למרות הנחיות NIST AI 100-2, רק ל-17% מהארגונים יש בקרות אבטחת AI אוטומטיות. הפער בין מסמכי מדיניות לאבטחה תפעולית הוא המקום שבו תוקפים משגשגים – תוך ניצול תחושת המוכנות הכוזבת של התעשייה.
לא כל פורמטי הסריאליזציה נוצרו שווים. ההסתמכות של התעשייה על Pickle יצרה פגיעות של מכונה וירטואלית מבוססת מחסנית. פורמטים חדשים יותר מפחיתים את הסיכון – אך אף אחד אינו חסין לחלוטין. לחץ על כל פורמט כדי ללמוד עוד.
פורמט Pickle מיישם מכונה וירטואלית מבוססת מחסנית שיכולה להריץ פונקציות Python שרירותיות במהלך דה-סריאליזציה. פונקציות כמו os.system() או subprocess.run() ניתנות להזרקה ישירה לתוך תהליך ה-unpickling.
זהו הפורמט הנפוץ ביותר עבור מודלים מדור קודם של PyTorch ו-scikit-learn. הגמישות שהפכה את Pickle לפופולרי היא בדיוק מה שהופך אותו לפגם אבטחה קריטי.
מסגרת בת חמישה שלבים למידול האופן שבו תוקפים מכוונים למערכות למידת מכונה. לחץ על כל שלב כדי להבין את מכניקת האיום ואת אמצעי הנגד ההנדסיים הנדרשים.
תוקפים סורקים מאגרי מודלים ציבוריים, תצורות CI/CD ועצי תלויות כדי לזהות נקודות כניסה. הם מנתחים באילו סביבות עבודה ארגונים משתמשים, אילו מודלים הם מורידים ואילו פורמטי סריאליזציה הצינורות שלהם מצפים לקבל.
זיהוי ארגונים שמורידים סוגי מודלים ספציפיים כדי ליצור מטענים ייעודיים עבור סביבות העבודה והפורמטים שלהם.
ניתוח קובצי requirements.txt ותמונות Docker שפורסמו כדי לאתר גרסאות תוכנה פגיעות הניתנות לניצול.
מרשם נכסי AI מרכזי עם מאגר מודלים פרטי. כל הורדות המודלים החיצוניים מתועדות, מנוהלות בגרסאות ומנותבות דרך צינור בדיקה אוטומטי.
הרעלת נתונים משתילה דלתות אחוריות רדומות שהן בלתי נראות למבחני ביצועים (Benchmarks) ו עמידות בפני דילול על ידי נתונים נקיים. מספיקים 250 מסמכים מורעלים בלבד כדי לפגוע לצמיתות במודל של 13 מיליארד פרמטרים. 'סוכנים רדומים' אלה מופעלים רק כאשר הם נתקלים בטוקן טריגר ספציפי.
ברגע שמופיעות 50-100 הופעות של הטריגר במהלך האימון, הדלת האחורית מקודדת לצמיתות במרחב המשקלים. הוספת מיליוני דגימות נקיות לאחר מכן אינה דורסת את הקשר שנלמד בין הטריגר לתגובה.
המחשת יחסי הגומלין בין גודל קורפוס האימון ליחס ההרעלה
שיעור הצלחה מדומה של דלת אחורית לפי מספר דגימות מורעלות (מבוסס על ספי מחקר שפורסמו)
משילות נכסי ה-AI נמצאת במשבר. הפער בין מדיניות לאבטחה תפעולית מייצג שילוב מסוכן של פגיעות, כשל ברגולציה וסיכון תחרותי.
שיעורי יישום בקרות NIST AI 100-2 בארגונים, 2025
הערך את החשיפה של הארגון שלך כתוצאה משימוש בלתי מנוהל ב-AI
"ארגונים רבים משווים החזקה של מסמך מדיניות לקיומה של אבטחה תפעולית בפועל. עם זאת, ללא אכיפה אוטומטית ומחסומים טכנולוגיים, עובדים ימשיכו להעדיף נוחות על פני בטיחות. מדיניות אינה הגנה."
— נייר עמדה לאבטחת AI של Veriprajna, 2025
התייחסות למודלי AI כאל קוד בר-ביצוע שעלול להיות זדוני. ארכיטקטורת "מאובטח מעצם התכנון" (Secure by Design) לכל אורך שרשרת האספקה של למידת מכונה.
רשימות SBOM מסורתיות עוקבות אחר ספריות קוד. AI דורש ML-BOM המתעד את מקור המודל, יוחסין מערך הנתונים ומתודולוגיית האימון – מופעל על ידי פרופילי AI של CycloneDX ו-SPDX 3.0.
משקלי מודל הם הן קניין רוחני והן ארטיפקטים בינאריים בסיכון גבוה. תשתית מפתח ציבורי (PKI) עבור מודלי ML אינה עוד רשות – חתימות מבוססות HSM מבטיחות שרק מודלים מאושרים יגיעו לסביבת הייצור.
ניתוח סטטי הוא קו ההגנה הראשון. ניתוח קוד מעמיק (DCA) בונה גרף תוכנה הממפה את זרימת הקלט מ-API Gateway דרך מריצי LLM ועד למעטפת המערכת (Shell). ניטור בזמן ריצה מזהה הפעלות של הרעלה בסביבת הייצור.
עבור מגזרי הפיננסים, הבריאות והביטחון: סביבות ביצוע מהימנות (TEEs) מבוססות חומרה מגנות על נתונים בשימוש (Data-in-Use). משקלי מודלים והנחיות מפוענחים רק בתוך מובלעות מבודדות – ואינם גלויים אפילו למנהלי ענן בעלי הרשאות root.
אימות הדדי: ספק המודל מאמת TEE אותנטי, משתמש הקצה מאמת תוכנה מאושרת. תשתית Zero Trust.
מקליטת המודל ועד להסקה בייצור, כל שלב מנוהל על ידי אימות קריפטוגרפי, ניטור התנהגותי ובידוד מבוסס Zero Trust.
כל המודלים החיצוניים מנותבים לאזור הסגר מבודד. אין נתיב ישיר ממאגרים ציבוריים לייצור.
סריקת Bytecode מעמיקה. אימות פורמט. ניתוח Opcodes של Pickle. המרה ל-SafeTensors.
בדיקות דינמיות בקונטיינרים מבודדים. ניטור תעבורה יוצאת, קריאות מערכת ופלטים חריגים.
חתימה מגובת HSM. יצירת ML-BOM. רישום במרשם נכסי ה-AI הארגוני.
בקר קבלה + TEE + שכבת Guardrails + אימות פלט רציף.
מערכות AI נבנות ונפרסות דרך אותם צינורות CI/CD המהווים מטרה להתקפות שרשרת אספקה בקוד פתוח. אם מודל מאובטח אך סביבת ה-Python שלו פגועה, המערכת נפרצה. אם תמונת קונטיינר האימון הוכתמה, המשקלים אינם מהימנים.
כל הפרדה מלאכותית בין "נכסי תוכנה" ל"נכסי AI" היא פער מסוכן שתוקפים ינצלו.
פורמט הסריאליזציה Pickle של Python – המשמש ב-PyTorch וב-scikit-learn – מיישם מכונה וירטואלית מבוססת מחסנית שיכולה להריץ קוד שרירותי במהלך דה-סריאליזציה. על ידי מניפולציה של מתודת __reduce__, תוקפים מזריקים reverse shells שמופעלים ברגע שמפתח מריץ torch.load(). חוקרי JFrog גילו למעלה מ-100 מודלים חמושים כאלה ב-Hugging Face. לסורקים סטטיים כמו PickleScan יש שיעור תוצאות חיוביות שגויות של 96% עם 3 מעקפי zero-day ידועים, מה שהופך את הזיהוי ללא אמין.
מספיקים 250 מסמכים מורעלים בלבד – המהווים 0.00016% בלבד מקורפוס האימון – כדי לפגוע לצמיתות במודל של 13 מיליארד פרמטרים. ברגע שמופיעות כ-50 מופעים של הטריגר במהלך האימון, הדלת האחורית מקודדת לצמיתות במרחב המשקלים. הוספת מיליוני דגימות נקיות לאחר מכן אינה דורסת את הקשר שנלמד בין הטריגר לתגובה. 'סוכנים רדומים' אלה עוברים את כל מבחני הביצועים הסטנדרטיים ומופעלים רק כאשר הם נתקלים בטוקן טריגר ספציפי.
ML-BOM מרחיב רשימות SBOM מסורתיות כדי לתעד את מקור המודל, יוחסין הנתונים, מתודולוגיית האימון, תלויות סביבת העבודה ואישורים קריפטוגרפיים – מופעל על ידי פרופילי AI של CycloneDX ו-SPDX 3.0. הוא מאפשר תיקון פגיעויות מהיר כאשר מתגלות CVEs ב-PyTorch או בתלויות אחרות. בשילוב עם חתימה קריפטוגרפית על מודלים בגיבוי HSM, הוא מבטיח שרק מודלים מורשים בעלי חתימות תקפות יגיעו לייצור, בעוד שמנוע ההסקה מסרב לטעון כל מודל עם חתימה לא חוקית.
ההבדל בין "הסתמכות על מזל" לבין חוסן שניתן לאימות מסתכם בהחלטה ארכיטקטונית אחת.
Veriprajna מתכננת את המעבר מ-Shadow AI שברירי למערך Deep AI מאובטח קריפטוגרפית ומגובה בחומרה – מה שהופך פריסות AI לצפויות, ניתנות לביקורת ומאובטחות לחלוטין.
דוח הנדסי מלא: טקסונומיית התקפות סריאליזציה, הגנות שרשרת ההריגה של AI, מפרט ML-BOM, ארכיטקטורת חתימה קריפטוגרפית, דפוסי פריסת מחשוב חסוי, מדריך יישום NIST AI 100-2.