אבטחת AI • שלמות שרשרת האספקה

ההכרח הארכיטקטוני של שלמות שרשרת האספקה של AI

אבטחת מחזור החיים של למידת מכונה מפני מודלים זדוניים ופריסות צל (Shadow AI)

הגילוי של יותר מ-100 מודלים עם דלתות אחוריות ב-Hugging Face חשף את מה שמהנדסי Deep AI כבר ידעו: שרשרת האספקה של ML היא הרכיב הפגיע ביותר והכי פחות מנוהל בתשתית הארגונית. נייר עמדה זה מציג את התוכנית ההנדסית לחוסן AI מאומת קריפטוגרפית ומגובה בחומרה.

קרא את ה-Whitepaper
100+
מודלים זדוניים שנמצאו ב-Hugging Face
JFrog Research, פברואר 2024
83%
מהארגונים פועלים ללא בקרות אבטחת AI
Kiteworks 2025
0.00016%
מנתוני האימון מספיקים כדי להשתיל דלת אחורית מתמשכת
~250 מסמכים
$670K
עלייה ממוצעת בעלות פריצה כתוצאה מ-Shadow AI
Proofpoint 2025

המשבר שמתחת להייפ

בזמן שהשוק רודף אחר שירותי עטיפה (wrappers) ל-LLM, פגיעות מערכתית מחמירה ביסודות. משקלי מודלי AI הם גושים בינאריים אטומים (blobs) שבהם התנהגות זדונית מסתתרת בתוך מיליוני פרמטרים – בלתי נראית לבדיקות קוד מסורתיות.

ארטיפקטים של מודלים שהוסבו לנשק

מודלים במאגרים ציבוריים אינם רק פגומים – הם משמשים כנשק. סריאליזציית Pickle מאפשרת הרצת קוד שרירותי ברגע שמפתח מריץ torch.load(), ומקימה reverse shells לתשתית שבשליטת התוקף.

torch.load("model.pt") → pickle.__reduce__() → os.system("reverse_shell") → Remote Code Execution

מגפת ה-Shadow AI

90% משימוש ה-AI בארגונים מתרחש מחוץ לפיקוח של ה-IT. מפתחים מושכים מודלים שלא עברו בדיקה ממאגרים ציבוריים, מדביקים קוד קנייני בכלים פומביים ועוקפים ניתוח הרכב תוכנה (SCA) – מה שיוצר דלתות אחוריות מתמשכות ובלתי נראות.

77% מהעובדים משתפים נתונים רגישים עם כלי AI ציבוריים → דליפת קניין רוחני + כשל ברגולציה

ואקום משילות

למרות הנחיות NIST AI 100-2, רק ל-17% מהארגונים יש בקרות אבטחת AI אוטומטיות. הפער בין מסמכי מדיניות לאבטחה תפעולית הוא המקום שבו תוקפים משגשגים – תוך ניצול תחושת המוכנות הכוזבת של התעשייה.

56% טוענים למוכנות AI אך חסרים בקרות טכניות → מדיניות ≠ הגנה

פורמטים של קובצי מודלים: הכר את משטח התקיפה שלך

לא כל פורמטי הסריאליזציה נוצרו שווים. ההסתמכות של התעשייה על Pickle יצרה פגיעות של מכונה וירטואלית מבוססת מחסנית. פורמטים חדשים יותר מפחיתים את הסיכון – אך אף אחד אינו חסין לחלוטין. לחץ על כל פורמט כדי ללמוד עוד.

.pkl / .pt

Pickle

גבוה
.safetensors

SafeTensors

נמוך
.gguf

GGUF

בינוני
.h5 / .keras

Keras

בינוני
סיכון גבוה

Pickle (.pkl, .pt)

פורמט Pickle מיישם מכונה וירטואלית מבוססת מחסנית שיכולה להריץ פונקציות Python שרירותיות במהלך דה-סריאליזציה. פונקציות כמו os.system() או subprocess.run() ניתנות להזרקה ישירה לתוך תהליך ה-unpickling.

זהו הפורמט הנפוץ ביותר עבור מודלים מדור קודם של PyTorch ו-scikit-learn. הגמישות שהפכה את Pickle לפופולרי היא בדיוק מה שהופך אותו לפגם אבטחה קריטי.

// ארכיטקטורת אבטחה
סריאליזציה מבוססת לוגיקה (Opcodes)
שחזור אובייקטי Python שרירותיים
ללא sandboxing — גישה מלאה למפרש (Interpreter)

ניתוח וקטורי איומים

הרצת קוד בעת טעינה קריטי
הטמעת דלת אחורית קריטי
התחמקות מסורקים גבוה
ניצול בזמן הסקה (Inference) בינוני
הקשר ארגוני
נפוץ ב-PyTorch ו-scikit-learn מדור קודם. ל-PickleScan יש 3 מעקפי zero-day ידועים (כולל CVE-2025-10155). 96% מהתראות הסורקים הן תוצאות חיוביות שגויות (False Positives).

שרשרת ההריגה של AI (Kill Chain)

מסגרת בת חמישה שלבים למידול האופן שבו תוקפים מכוונים למערכות למידת מכונה. לחץ על כל שלב כדי להבין את מכניקת האיום ואת אמצעי הנגד ההנדסיים הנדרשים.

01
סיור ואיסוף מידע
02
הרעלה
03
חטיפה
04
התמדה
05
השפעה
שלב 1 — סיור ואיסוף מידע

מיפוי משטח התקיפה

תוקפים סורקים מאגרי מודלים ציבוריים, תצורות CI/CD ועצי תלויות כדי לזהות נקודות כניסה. הם מנתחים באילו סביבות עבודה ארגונים משתמשים, אילו מודלים הם מורידים ואילו פורמטי סריאליזציה הצינורות שלהם מצפים לקבל.

// מנגנון תקיפה
scan(huggingface.models) → identify(popular_downloads)
analyze(CI/CD_configs) → map(serialization_formats)
profile(target_org) → select(attack_vector)

סוגי תקיפות בשלב זה

איסוף נתונים ממאגרים (Scraping)

זיהוי ארגונים שמורידים סוגי מודלים ספציפיים כדי ליצור מטענים ייעודיים עבור סביבות העבודה והפורמטים שלהם.

מיפוי תלויות

ניתוח קובצי requirements.txt ותמונות Docker שפורסמו כדי לאתר גרסאות תוכנה פגיעות הניתנות לניצול.

אמצעי נגד של Veriprajna

מרשם נכסי AI מרכזי עם מאגר מודלים פרטי. כל הורדות המודלים החיצוניים מתועדות, מנוהלות בגרסאות ומנותבות דרך צינור בדיקה אוטומטי.

סוכנים רדומים בתוך המודלים שלך

הרעלת נתונים משתילה דלתות אחוריות רדומות שהן בלתי נראות למבחני ביצועים (Benchmarks) ו עמידות בפני דילול על ידי נתונים נקיים. מספיקים 250 מסמכים מורעלים בלבד כדי לפגוע לצמיתות במודל של 13 מיליארד פרמטרים. 'סוכנים רדומים' אלה מופעלים רק כאשר הם נתקלים בטוקן טריגר ספציפי.

מדוע נתונים נקיים אינם עוזרים

ברגע שמופיעות 50-100 הופעות של הטריגר במהלך האימון, הדלת האחורית מקודדת לצמיתות במרחב המשקלים. הוספת מיליוני דגימות נקיות לאחר מכן אינה דורסת את הקשר שנלמד בין הטריגר לתגובה.

threshold(~50 triggers) → weight_encoding(permanent)
clean_data(+10M samples) → backdoor_status(unchanged)
01
הרעלה בשלב טרום-אימון (Pre-training)
הזרקת מסמכים זדוניים למערכי נתונים בקנה מידה של רשת האינטרנט. דלת אחורית יסודית במודל הבסיס.
02
הרעלה בשלב כוונון עדין (Fine-tuning)
השחתת מערכי נתונים של כוונון הוראות עבור פגיעה ממוקדת במשימות ספציפיות לארגון.
03
הרעלת RAG
מסמכים זדוניים במסדי נתונים וקטוריים חוטפים באופן דינמי את תגובות המודל באמצעות הקשר השליפה.
04
התקפות התחמקות (Evasion)
מניפולציה ברמת הביטים של קלטי הסקה כופה סיווג שגוי או קריאות בלתי מורשות לכלים.

סימולטור סף הרעלה

המחשת יחסי הגומלין בין גודל קורפוס האימון ליחס ההרעלה

פגיע
10 מיליון מסמכים
250 מסמכים
13B
יחס הרעלה
0.0025%
צפיפות טריגרים
~50/איטרציה (Epoch)
סיכון לדלת אחורית
גבוה

שיעור הצלחה מדומה של דלת אחורית לפי מספר דגימות מורעלות (מבוסס על ספי מחקר שפורסמו)

מגפת ה-Shadow AI

משילות נכסי ה-AI נמצאת במשבר. הפער בין מדיניות לאבטחה תפעולית מייצג שילוב מסוכן של פגיעות, כשל ברגולציה וסיכון תחרותי.

אימוץ אבטחת AI בארגונים

שיעורי יישום בקרות NIST AI 100-2 בארגונים, 2025

מחשבון סיכוני Shadow AI

הערך את החשיפה של הארגון שלך כתוצאה משימוש בלתי מנוהל ב-AI

500
90%
77%
משתמשי Shadow AI
450
מחוץ למשילות IT
סיכון לדליפת נתונים
347
עובדים המשתפים נתונים רגישים
עלייה משוערת בעלות פריצה
$670K
תוספת עלות ממוצעת לכל פריצה
סיכון ממודלים שלא עברו אימות
גבוה
בהתבסס על רמת המשילות

"ארגונים רבים משווים החזקה של מסמך מדיניות לקיומה של אבטחה תפעולית בפועל. עם זאת, ללא אכיפה אוטומטית ומחסומים טכנולוגיים, עובדים ימשיכו להעדיף נוחות על פני בטיחות. מדיניות אינה הגנה."

— נייר עמדה לאבטחת AI של Veriprajna, 2025

פתרונות הנדסיים

מחזור החיים המאובטח של ML

התייחסות למודלי AI כאל קוד בר-ביצוע שעלול להיות זדוני. ארכיטקטורת "מאובטח מעצם התכנון" (Secure by Design) לכל אורך שרשרת האספקה של למידת מכונה.

מפרט רכיבי תוכנה ל-ML (ML-BOM)

רשימות SBOM מסורתיות עוקבות אחר ספריות קוד. AI דורש ML-BOM המתעד את מקור המודל, יוחסין מערך הנתונים ומתודולוגיית האימון – מופעל על ידי פרופילי AI של CycloneDX ו-SPDX 3.0.

מקור ויוחסין של נתונים: רשומות מוגנות מפני שינויים של מקור, טרנספורמציה ובעלות
יוחסין המודל: שיטות אימון, היפר-פרמטרים ותיעוד כוונון עדין
תלויות סביבת העבודה: מעקב מנוהל גרסאות אחר PyTorch/TF לצמצום חלונות פגיעות של הרצת קוד שרירותי
אישורים קריפטוגרפיים: חתימות דיגיטליות המאמתות את שלמות המודל מהמקור ועד לפריסה

חתימה קריפטוגרפית על מודלים

משקלי מודל הם הן קניין רוחני והן ארטיפקטים בינאריים בסיכון גבוה. תשתית מפתח ציבורי (PKI) עבור מודלי ML אינה עוד רשות – חתימות מבוססות HSM מבטיחות שרק מודלים מאושרים יגיעו לסביבת הייצור.

// תהליך בקר הקבלה (Admission Controller)
model.upload(weights) → HSM.sign(sha256(weights))
inference_server.load(model) →
  admission_ctrl.verify(signature, corporate_root_of_trust)
  IF valid → deserialize(weights) → SERVE
  IF invalid → REJECT + alert(security_team)

סריקה מתקדמת והגנה בזמן ריצה

ניתוח סטטי הוא קו ההגנה הראשון. ניתוח קוד מעמיק (DCA) בונה גרף תוכנה הממפה את זרימת הקלט מ-API Gateway דרך מריצי LLM ועד למעטפת המערכת (Shell). ניטור בזמן ריצה מזהה הפעלות של הרעלה בסביבת הייצור.

DCA
ניתוח קוד מעמיק: SAST מודע הקשר הממפה כיצד קלט משתמש זורם מ-API Gateway דרך מריץ ה-LLM למסד הנתונים או ל-Shell
RTM
אימות פלט: השוואה רציפה מול קווי בסיס נקיים לזיהוי סטיות או חריגות המעידות על הפעלת דלת אחורית
GRL
שכבת מעקות בטיחות (Guardrails): טיהור וניסוח מחדש של קלטים מנטרלים מטענים עוינים לפני שהם מגיעים למודל הליבה

מחשוב חסוי (TEEs)

עבור מגזרי הפיננסים, הבריאות והביטחון: סביבות ביצוע מהימנות (TEEs) מבוססות חומרה מגנות על נתונים בשימוש (Data-in-Use). משקלי מודלים והנחיות מפוענחים רק בתוך מובלעות מבודדות – ואינם גלויים אפילו למנהלי ענן בעלי הרשאות root.

SGX
בידוד ברמת היישום
TDX
הצפנה ברמת המכונה הווירטואלית
H100/B200
מעבד גרפי (GPU) חסוי בקנה מידה של מסד
CC OCI
תמונות קונטיינר מוצפנות

אימות הדדי: ספק המודל מאמת TEE אותנטי, משתמש הקצה מאמת תוכנה מאושרת. תשתית Zero Trust.

צינור ה-ML המאובטח של Veriprajna

מקליטת המודל ועד להסקה בייצור, כל שלב מנוהל על ידי אימות קריפטוגרפי, ניטור התנהגותי ובידוד מבוסס Zero Trust.

01

קליטה והסגר

כל המודלים החיצוניים מנותבים לאזור הסגר מבודד. אין נתיב ישיר ממאגרים ציבוריים לייצור.

02

ניתוח סטטי

סריקת Bytecode מעמיקה. אימות פורמט. ניתוח Opcodes של Pickle. המרה ל-SafeTensors.

03

ארגז חול התנהגותי

בדיקות דינמיות בקונטיינרים מבודדים. ניטור תעבורה יוצאת, קריאות מערכת ופלטים חריגים.

04

חתימה ורישום

חתימה מגובת HSM. יצירת ML-BOM. רישום במרשם נכסי ה-AI הארגוני.

05

הסקה מנוטרת

בקר קבלה + TEE + שכבת Guardrails + אימות פלט רציף.

אבטחת AI + שרשרת אספקת תוכנה = בעיה אחת

מערכות AI נבנות ונפרסות דרך אותם צינורות CI/CD המהווים מטרה להתקפות שרשרת אספקה בקוד פתוח. אם מודל מאובטח אך סביבת ה-Python שלו פגועה, המערכת נפרצה. אם תמונת קונטיינר האימון הוכתמה, המשקלים אינם מהימנים.

כל הפרדה מלאכותית בין "נכסי תוכנה" ל"נכסי AI" היא פער מסוכן שתוקפים ינצלו.

טעינת משקלים בלבד: השבתת סריאליזציה של קוד בר-ביצוע. SafeTensors כפורמט ברירת מחדל.
מריצים מבודדים: הסקה בקונטיינרים עם גישת רשת מינימלית ובקרות מחמירות על תעבורה יוצאת.
יכולת פרשנות מכניסטית: ביקורת משקלי המודל לזיהוי טריגרים סמויים של דלתות אחוריות לפני הפריסה.
יוחסין ומקור מאוחדים: מודל, מערך נתונים, תלויות קוד פתוח ותשתית מנוהלים ומאומתים בו-זמנית.
FAQ

שאלות נפוצות

מדוע קובצי מודלי AI ממאגרים ציבוריים כמו Hugging Face מהווים סיכון אבטחתי?

פורמט הסריאליזציה Pickle של Python – המשמש ב-PyTorch וב-scikit-learn – מיישם מכונה וירטואלית מבוססת מחסנית שיכולה להריץ קוד שרירותי במהלך דה-סריאליזציה. על ידי מניפולציה של מתודת __reduce__, תוקפים מזריקים reverse shells שמופעלים ברגע שמפתח מריץ torch.load(). חוקרי JFrog גילו למעלה מ-100 מודלים חמושים כאלה ב-Hugging Face. לסורקים סטטיים כמו PickleScan יש שיעור תוצאות חיוביות שגויות של 96% עם 3 מעקפי zero-day ידועים, מה שהופך את הזיהוי ללא אמין.

כמה מסמכים מורעלים נדרשים כדי לפגוע במודל שפה גדול?

מספיקים 250 מסמכים מורעלים בלבד – המהווים 0.00016% בלבד מקורפוס האימון – כדי לפגוע לצמיתות במודל של 13 מיליארד פרמטרים. ברגע שמופיעות כ-50 מופעים של הטריגר במהלך האימון, הדלת האחורית מקודדת לצמיתות במרחב המשקלים. הוספת מיליוני דגימות נקיות לאחר מכן אינה דורסת את הקשר שנלמד בין הטריגר לתגובה. 'סוכנים רדומים' אלה עוברים את כל מבחני הביצועים הסטנדרטיים ומופעלים רק כאשר הם נתקלים בטוקן טריגר ספציפי.

מהו מפרט רכיבים ללמידת מכונה (ML-BOM) ומדוע ארגוני AI זקוקים לו?

ML-BOM מרחיב רשימות SBOM מסורתיות כדי לתעד את מקור המודל, יוחסין הנתונים, מתודולוגיית האימון, תלויות סביבת העבודה ואישורים קריפטוגרפיים – מופעל על ידי פרופילי AI של CycloneDX ו-SPDX 3.0. הוא מאפשר תיקון פגיעויות מהיר כאשר מתגלות CVEs ב-PyTorch או בתלויות אחרות. בשילוב עם חתימה קריפטוגרפית על מודלים בגיבוי HSM, הוא מבטיח שרק מודלים מורשים בעלי חתימות תקפות יגיעו לייצור, בעוד שמנוע ההסקה מסרב לטעון כל מודל עם חתימה לא חוקית.

האם המודלים שלך מאומתים, או שרק הורדת אותם?

ההבדל בין "הסתמכות על מזל" לבין חוסן שניתן לאימות מסתכם בהחלטה ארכיטקטונית אחת.

Veriprajna מתכננת את המעבר מ-Shadow AI שברירי למערך Deep AI מאובטח קריפטוגרפית ומגובה בחומרה – מה שהופך פריסות AI לצפויות, ניתנות לביקורת ומאובטחות לחלוטין.

הערכת אבטחת AI

  • ביקורת פגיעויות בשרשרת האספקה של ML
  • מפת דרכים לגילוי ותיקון של Shadow AI
  • הערכת סיכונים של פורמטי סריאליזציה של מודלים
  • ניתוח פערי תאימות לתקן NIST AI 100-2

הנדסת Deep AI

  • תכנון מאגר מודלים פרטי וצינור ML-BOM
  • חתימת מודלים קריפטוגרפית עם שילוב HSM
  • פריסת מחשוב חסוי עבור הסקה רגישה
  • ניטור רציף בזמן ריצה וארכיטקטורת Guardrails
יצירת קשר בוואטסאפ
קרא את ה-Whitepaper הטכני המלא

דוח הנדסי מלא: טקסונומיית התקפות סריאליזציה, הגנות שרשרת ההריגה של AI, מפרט ML-BOM, ארכיטקטורת חתימה קריפטוגרפית, דפוסי פריסת מחשוב חסוי, מדריך יישום NIST AI 100-2.

רשתות חברתיות

פורסם גם ב