הערכת אבטחה והקשחה של מערכות AI

אנו פורצים למערכות AI כפי שתוקפים אמיתיים עושים, ולאחר מכן מקשיחים אותן מפני נתיבי התקיפה שההערכה מוצאת — מחילוץ מודלים ועד לפגיעה בשרשרת האספקה.

הגישה שלנו היא לפרוץ למערכות AI כפי שתוקפים אמיתיים עושים, ולאחר מכן להקשיח אותן מפני נתיבי התקיפה שההערכה חושפת — מחילוץ מודלים ועד לפגיעה בשרשרת האספקה. בדיקות חדירה מסורתיות מכסות את ה-APIs, התשתית ותהליכי האימות שלכם, אך הן לעולם אינן בודקות האם תוקף יכול לגנוב את המודל המותאם אישית (fine-tuned) שלכם, להחדיר דלת אחורית לשרשרת התלויות שלכם, או לחטוף את צינור ה-RAG שלכם. מתודולוגיית הערכה זו חייבת להיבנות במיוחד עבור אופני הכשל של מערכות AI.

משטחי תקיפה שצוות האבטחה שלכם מעולם לא בדק

בדיקות חדירה מסורתיות מכסות את ה-APIs, התשתית ותהליכי האימות שלכם. הן אינן בודקות האם תוקף יכול לחלץ את המודל המותאם אישית (fine-tuned) שלכם באמצעות 50,000 שאילתות בעלות מבנה מוקפד. הן אינן מזהות האם מתאם LoRA מורעל בשרשרת התלויות שלכם ב-HuggingFace החדיר דלת אחורית לפני שלושה חודשים. הן אינן בודקות האם צינור ה-RAG שלכם יבצע הוראות המוטמעות במסמך שאוחזר. אלו הם נתיבי התקיפה שלמעשה פוגעים במערכות AI בסביבת ייצור.

אלו אינם סיכונים תאורטיים מהרצאות בכנסים. Protect AI מצאה 352,000 קבצים חשודים ב-51,700 מודלים ב-HuggingFace באפריל 2025. מתקפות מבוססות AI עלו ב- 89% משנה לשנה, כאשר 97% מהארגונים שנפרצו היו חסרי בקרות גישה בסיסיות במערכות ה-AI שלהם. מתקפת שרשרת האספקה של Mercor בתחילת 2026 פגעה באלפי חברות דרך תלות קוד פתוח יחידה.

מה שאנו בודקים בפועל — ומה שרוב ההערכות מפספסות

אנו מבנים הערכות סביב מסגרת ה- MITRE ATLAS , המקטלגת כעת 84 טכניקות ב-16 טקטיקות המכוונות ספציפית למערכות AI. אך מסגרת היא מפה, לא בדיקה. המתודולוגיה שלנו בנויה להריץ בפועל את המתקפות שהיא מקטלגת, ולא רק לסמן עליהן 'וי'.

פריסות LLM והזרקת פרומפטים (Prompt Injection)

אנו בודקים הזרקת פרומפטים עקיפה דרך כל נתיב קליטה: אחזור RAG, פלטי כלים, מסמכים שהועלו על ידי משתמשים ותוכן דוא"ל המוזן לסוכנים. הזרקה ישירה תופסת את הכותרות, אך Anthropic הסירה לחלוטין את מדד ההזרקה הישירה שלה בפברואר 2026 מכיוון שהזרקה עקיפה דרך הקשר אחזור היא מה שלמעשה שובר מערכות ייצור. אנו בודקים גם מניפולציה רב-סבבית (multi-turn), חילוץ פרומפט מערכת (system prompt), ואת אופני הכשל הייחודיים של כל מערך מעקות בטיחות (guardrails) שקיים אצלכם.

אבטחה ברמת המודל

אנו מעריכים את סיכון החילוץ על ידי הרצת קמפיינים של שאילתות מובנות מול ה-API שלכם ומדידת היקף התנהגות המודל שתוקף יכול לשכפל. אנו מעריכים חוסן יריבי הן בשיטות מבוססות גרדיאנט (כאשר יש לנו גישה למודל) והן במתקפות קופסה שחורה מבוססות העברה (כיצד שתוקפים אמיתיים פועלים). אנו מבצעים ביקורת על צינור האימון שלכם לאיתור פגיעויות הרעלת נתונים (data poisoning), תוך בדיקת נתוני האימון הישירים שלכם והתלויות במעלה הזרם המזינות אותם (מפורט ב- מחקר שלנו על הגנה על ארגונים מפני הרעלת מודלים).

שלמות שרשרת האספקה

אנו מתחקים אחר כל ארטיפקט של המודל חזרה למקורו: משקולות שאומנו מראש, מערכי נתוני כוונון עדין, שכבות מתאמים וגרסאות של סביבות הגשה (serving frameworks). אנו בודקים את תשתית ה-ML שלכם לאיתור פגיעויות ידועות — ל-PyTorch, vLLM ו-Triton Inference Server לכולם היו CVEs בשנים 2025–2026 — ומוודאים שסידוק המודל (serialization) שלכם משתמש בפורמטים בטוחים. ה- $12 billion בהפסדים ממודלי ML שנפרצו ב-2025 נבעו ברובם המכריע ממתקפות שרשרת אספקה, ולא מניצול ישיר של מודלים (ראו המחקר שלנו על אבטחת מחזור החיים של שרשרת האספקה ב-ML).

מערכות סוכנים (Agentic Systems)

אנו בודקים את משטח התקיפה ש- OWASP's Agentic AI Top 10 מגדיר: חטיפת יעדים, שימוש לרעה בכלים, ניצול לרעה של זהות, הרעלת זיכרון וכשלים מדורגים לאורך תהליכי עבודה רב-סוכניים. משבר ה- OpenClaw ב-2026 — שבו 21,000+ מופעים של סוכן AI בעל 135,000 כוכבים נחשפו לפגיעויות קריטיות — המחיש מה קורה כאשר סוכנים משוחררים ללא בדיקות כאלה (מפורט ב- מחקר שלנו על אבטחת ממשק האדם-AI).

הקשחה המשנה את אופן הפעולה של המערכת שלכם

הערכה ללא תיקון היא רק PDF יקר. הגישה שלנו בונה את בקרות ההקשחה ישירות לתוך המערכת שלכם.

  • הגנה ברמת ההיסק (Inference-layer defense): זיהוי חריגות שאילתות המזהה תעבורה בדפוסי חילוץ — כיסוי קלט שיטתי, בדיקת גבולות וסריקות פרפרזה תכנותיות — ומבדיל בינה לבין שימוש לגיטימי. צינורות אימות קלט מכווננים למודל האיומים הספציפי שלכם, במקום מסנני regex גנריים שמפספסים מתקפות סמנטיות וחוסמים שאילתות לגיטימיות.
  • הקשחת שרשרת האספקה: צינורות אימות מודלים הבודקים מקוריות ארטיפקטים (provenance), מאמתים פורמטים של סידוק (serialization), סורקים לאיתור דפוסים זדוניים מוכרים ואוכפים דרישות חתימה לפני שארטיפקט מודל כלשהו נכנס לצינור הפריסה שלכם — בתוספת ניטור תלויות הלוכד חבילות שנפרצו במעלה הזרם לפני שהן מגיעות לייצור.
  • הקשחת מערכות סוכנים: גבולות הרשאות סביב גישה לכלים, אימות פלט בין שלבי הסוכן וניטור התנהגותי המזהה מתי דפוס הביצוע של הסוכן סוטה מתהליך העבודה הצפוי שלו.

ה-SIEM שלכם נבנה כדי לזהות חריגות בהתנהגות אנושית. סוכן שמבצע 10,000 שאילתות ברצף נראה נורמלי למערכות אלו, אפילו כאשר הוא פועל תחת שליטת תוקף.

מתי אינכם זקוקים לכך

אם אתם קוראים ל-API מנוהל (OpenAI, Anthropic, Google) ללא fine-tuning, ללא RAG, ללא שימוש בכלים וללא נתונים רגישים בפרומפטים, סיכון האבטחה שלכם מוגבל לניהול מפתחות API וטיפול בנתונים. סקירת אבטחת יישומים סטנדרטית מכסה זאת — אינכם זקוקים להערכה ייעודית ל-AI.

אם המודל שלכם הוא מסווג פשוט הפועל פנימית ללא API הפונה החוצה וללא צינור אימון מחדש, משטח התקיפה שלכם מוגבל וסקירת מודל איומים תמציתית היא מידתית. בדיקת חוסן יריבי מלאה על מסווג סנטימנט פנימי מאחורי חומת אש משמעה הוצאת $30,000 כדי להגן על סיכון של $500.

אנו אומרים זאת בבירור מכיוון שאמינות חשובה לנו יותר מהכנסות. הארגונים הזקוקים לעבודה זו יודעים היטב מי הם: כל מי שמחזיק במודלים מותאמים אישית (fine-tuned), צינורות RAG המעבדים תוכן חיצוני, מערכות סוכנים עם גישה לכלים, מודלים בתעשיות מוסדרות, או מערכות AI המקבלות החלטות בעלות השלכות כספיות או בטיחותיות.

הלחץ הרגולטורי אמיתי ובעל מועדים ברורים

אכיפת ה-EU AI Act מתחילה באוגוסט 2026. מערכות AI בסיכון גבוה דורשות ניהול סיכונים מתועד, בדיקות חוסן טכני ובקרות ממשל נתונים. אי-ציות גורר קנסות של עד 7% מהמחזור השנתי העולמי או EUR 35 million. NIST פרסם את פרופיל ה-Cybersecurity Framework עבור AI בדצמבר 2025, הממפה סיכונים ייחודיים ל-AI לבקרות CSF 2.0. מסגרות אלו מופיעות כעת בדרישות רכש ובסקירות סיכונים ברמת הדירקטוריון.

האתגר הוא שאף מסגרת בודדת אינה מכסה את הכל. אנו ממפים את ממצאי ההערכה שלכם לכל המסגרות שהרגולטורים, המבקרים והלקוחות שלכם דורשים — ומייצרים ראיות העונות על דרישות התאימות מכיוון שהן נובעות מבדיקות בפועל, ולא מתרגילי סימון 'וי'.

מסגרתמה היא מספקת
MITRE ATLASממפה טכניקות תקיפה
OWASP LLM Top 10מסווגת מחלקות פגיעות
NIST AI RMFמספקת מבנה ממשל
ISO 42001מטפלת במערכות ניהול
EU AI Actמטיל חובות משפטיות

כלי פלטפורמה לעומת הערכה מותאמת אישית

פלטפורמות אבטחת AI אוטומטיות (HiddenLayer, Mindgard, Giskard) מריצות דפוסי תקיפה ידועים בהיקף רחב. הן שימושיות לבדיקות רגרסיה רציפות לאחר הערכה ראשונית, אך הן אינן תחליף להערכה הראשונית עצמה. סורק אינו מבין את הלוגיקה העסקית שלכם, אינו יודע לאילו פלטי מודל יש השלכות קריטיות לבטיחות, ואינו יכול להעריך האם מודל האיומים שלכם תואם את ארכיטקטורת הפריסה האמיתית שלכם.

אנו משתמשים בכלים אלה היכן שהם מוסיפים ערך. Red Teaming אוטומטי ורציף שייך לצינור ה-CI/CD שלכם ברגע שהגדרנו מה יש לבדוק. אך נתיבי התקיפה החשובים ביותר במערכת הספציפית שלכם דורשים מישהו שמבין הן את אופני הכשל של ה-AI והן את ההקשר התפעולי שלכם כדי לאתר אותם.

עבור ארגונים המפעילים מודלים ממספר ספקי AI (כגון OpenAI, Anthropic, Google ומודלי קוד פתוח), אנו מעריכים את גבולות האבטחה של כל ספק באופן עצמאי ובודקים את נקודות האינטגרציה שבהן נתונים זורמים ביניהם. משטח התקיפה של מערך רב-ספקים אינו פשוט סכום הסיכונים של כל ספק בנפרד — הוא טמון בשכבת האינטראקציה, שבה הנחות לגבי ערבויות האבטחה של ספק אחד קורסות בעת העברת המידע לספק אחר.

נקודות מפתח עיקריות

  • מערכות AI נכשלות בדרכים שבדיקות חדירה סטנדרטיות לעולם אינן נוגעות בהן — חילוץ מודלים, מתאמי LoRA מורעלים, הזרקת פרומפטים עקיפה וחטיפת יעדים סוכנית.
  • אנו בודקים על פני ארבעה משטחי תקיפה — פריסות LLM, אבטחה ברמת המודל, שרשרת אספקה ומערכות סוכנים — הבנויים לפי MITRE ATLAS (עם 84 טכניקות ו-16 טקטיקות), אך מונעים ממתקפות אמיתיות ולא מרשימות תיוג.
  • ההערכה כוללת תיקון: הקשחה ברמת ההיסק, בשרשרת האספקה ובמערכות סוכנים הבנויה ישירות לתוך המערכת שלכם, ולא נמסרת רק כקובץ PDF.
  • אנו ממפים ממצאים ל-MITRE ATLAS, ל-OWASP LLM Top 10, ל-NIST AI RMF, ל-ISO 42001 ול-EU AI Act — שאכיפתו מתחילה באוגוסט 2026 עם קנסות של עד 7% מהמחזור או EUR 35 million.
  • לא כל פריסה זקוקה לכך. שימוש ב-API מנוהל ומסווגים פנימיים פשוטים אינם זקוקים לכך; מודלים מותאמים אישית (fine-tuned), RAG עם תוכן חיצוני, סוכנים המשתמשים בכלים ו-AI מוסדר או קריטי לבטיחות — בהחלט זקוקים לכך.

הערכת אבטחה והקשחה של מערכות AI

שאלות נפוצות

שאלות נפוצות

כמה עולה הערכת אבטחה ייעודית ל-AI?

הערכות אבטחת AI נעות בדרך כלל בין $15,000 עבור סקירה מוגדרת של יישום LLM לבין $80,000+ עבור התקשרות Red Team מלאה המכסה מתקפות ברמת המודל, ביקורת שרשרת אספקה ובדיקות של מערכות סוכנים. תעריפי ייעוץ בשוק הביניים נעים בין $1,500 ל-$3,500 ליום יועץ, בעוד שחברות בוטיק מובילות גובות $4,000-$7,000 ליום. ההיקף המתאים תלוי בארכיטקטורת הפריסה שלכם: קריאת API מנוהלת ללא fine-tuning דורשת הרבה פחות בדיקות בהשוואה למודל מותאם אישית המשרת תהליכי עבודה סוכניים עם גישה לכלים.

מה בודקת הערכת אבטחת AI שבדיקת חדירה רגילה אינה מכסה?

בדיקות חדירה מסורתיות מכסות נקודות קצה של API, אימות, תשתית ולוגיקה אפליקטיבית. הערכות אבטחת AI מוסיפות וקטורי תקיפה ייחודיים למודלים: יצירת קלטים יריביים, חילוץ מודל באמצעות קמפיינים של שאילתות מובנות, זיהוי הרעלת נתוני אימון, הזרקת פרומפטים (הן ישירה והן עקיפה דרך אחזור RAG), שלמות שרשרת האספקה עבור ארטיפקטים של מודלים, ועבור מערכות סוכנים — חטיפת יעדים, שימוש לרעה בכלים והסלמת הרשאות לאורך תהליכי עבודה רב-שלביים. נתיבי תקיפה אלה דורשים מתודולוגיה ייעודית ל-ML שמסגרות בדיקות חדירה רגילות אינן מתייחסות אליהן.

האם מישהו באמת יכול לגנוב את המודל המותאם אישית (fine-tuned) שלנו דרך ה-API?

כן. מתקפות חילוץ מודל משכפלות את התנהגות המודל באמצעות שאילתות שיטתיות. עבור מסווגים שעברו fine-tuning, כמה אלפי שאילתות יכולות להפיק עותק שווה-ערך מבחינה פונקציונלית. עבור מודלי שפה גדולים, חילוץ מלא קשה יותר אך חילוץ חלקי של התנהגות ה-fine-tuning הוא בר-ביצוע בהחלט. תעבורת שאילתות ברמת scraping הגיעה לחציון של 20% מתעבורת ה-API העולמית בשנים 2025-2026. קווי ההגנה כוללים ניתוח דפוסי שאילתות החורג מהגבלת קצב פשוטה, טביעת אצבע התנהגותית של דפוסי חילוץ וסימון מים (watermarking), אם כי שיטות סימון מים נוכחיות ניתנות להסרה באמצעות ניסוח מחדש של הפלטים.

האם אנו זקוקים לבדיקות אבטחת AI לצורך תאימות ל-EU AI Act?

אם מערכת ה-AI שלכם מוגדרת כבעלת סיכון גבוה תחת ה-EU AI Act, התשובה היא כן. סעיף 15 דורש חוסן טכני ואמצעי אבטחת סייבר, כאשר האכיפה מתחילה באוגוסט 2026 עם קנסות של עד 7% מהמחזור השנתי העולמי או EUR 35 million. ארגון NIST פרסם את פרופיל ה-Cybersecurity Framework עבור AI בדצמבר 2025, הממפה סיכונים ייחודיים ל-AI לבקרות CSF 2.0 וזוכה להתייחסות גוברת בדרישות רכש. בדיקות אבטחה בפועל מפיקות ראיות תאימות שביקורות סימון 'וי' אינן יכולות לספק, מכיוון שרגולטורים ובתי משפט בוחנים האם הבקרות נבדקו באמת, ולא רק תועדו.

כיצד נאבטח את צינור ה-RAG שלנו מפני הזרקת פרומפטים עקיפה?

הזרקת פרומפטים עקיפה (indirect prompt injection) דרך תוכן שאוחזר היא וקטור התקיפה הדומיננטי נגד LLM בסביבות ייצור. חברת Anthropic הסירה לחלוטין את מדד ההזרקה הישירה שלה בפברואר 2026 מכיוון שהזרקה עקיפה היא האיום הרלוונטי יותר מבחינה תפעולית. ההגנה דורשת בקרות רב-שכבתיות: הפרדת תוכן מאוחזר מהוראות מערכת בחלון ההקשר, שימוש במודל משני להערכת תוכן מאוחזר לפני שהוא מגיע למודל הראשי, אימות פלט המזהה התנהגות של מילוי הוראות המופעלת על ידי אחזור, וניטור רציף של דפוסי תגובה חריגים. שום הגנה בודדת אינה שלמה. שיעורי ההצלחה של הזרקת פרומפטים נעים בין 50-84% בהתאם לתצורת המערכת, וזו הסיבה שהגנה לעומק (defense-in-depth) היא הגישה הישימה היחידה.

באיזו מסגרת אבטחת AI עלינו לפעול: MITRE ATLAS, OWASP או NIST AI RMF?

הן משרתות מטרות שונות ורוב הארגונים זקוקים לרכיבים מכל השלוש. MITRE ATLAS (עם 84 טכניקות ו-16 טקטיקות נכון לפברואר 2026) ממפה שיטות תקיפה ספציפיות ומהווה את המסגרת הנכונה להבניית הערכות טכניות. OWASP LLM Top 10 מסווגת מחלקות פגיעות ומנחה מה יש לבדוק. NIST AI RMF מספקת מבנה ממשל באמצעות עמודי התווך שלה Govern, Map, Measure, Manage ומשמשת יותר ויותר כקריטריון רכש. תקן ISO 42001 מטפל בהסמכת מערכות ניהול. ה-EU AI Act מטיל חובות משפטיות עם מועדים קבועים. אנו ממפים את ממצאי ההערכה לכל המסגרות שהרגולטורים, המבקרים והלקוחות שלכם דורשים.

מה צריכה הערכת אבטחת ה-AI שלנו לכסות עבור AI סוכני עם שימוש בכלים?

AI סוכני מציג משטח תקיפה שבדיקות LLM סטטיות מפספסות לחלוטין. ארגון OWASP פרסם את ה-Top 10 ליישומים סוכניים בדצמבר 2025, המכסה חטיפת יעדים, שימוש לרעה בכלים, ניצול לרעה של זהות, הרעלת זיכרון וכשלים מדורגים. ההערכה צריכה לבדוק האם תוקף יכול להטות את יעדי הסוכן באמצעות קלטים מתוחכמים, להסלים הרשאות כלים מעבר להיקף המיועד, להרעיל זיכרון מתמיד כדי להשפיע על פעולות עתידיות, ולשרשר כשלים לאורך תהליכי עבודה רב-סוכניים. כלי ה-SIEM וה-EDR הקיימים שלכם נבנו לזיהוי חריגות בהתנהגות אנושית. סוכן המריץ 10,000 שאילתות ברצף נראה נורמלי למערכות אלו גם כאשר הוא תחת שליטת תוקף.

כיצד נוודא שמודלים מ-HuggingFace אינם מכילים דלתות אחוריות?

ארגון Protect AI זיהה 352,000 קבצים חשודים ב-51,700 מודלים ב-HuggingFace באפריל 2025. אימות דורש בדיקה של פורמט הסידוק (Safetensors לעומת pickle, המאפשר הרצת קוד שרירותי), סריקה לאיתור דפוסים זדוניים מוכרים במשקולות המודל ובקובצי התצורה, אימות מקוריות (provenance) באמצעות חתימות ואימות גיבוב (hash), ובדיקת התנהגות המודל מול דפוסי הפעלה (trigger patterns) הקשורים להפעלת דלת אחורית. מתאמי LoRA זדוניים מהווים וקטור הולך וגדל מכיוון שהם קטנים וקלים להפצה. אימות שרשרת האספקה צריך להיות אוטומטי בצינור פריסת המודלים שלכם, ולא להתבצע ידנית בעת ההורדה.

מה ההבדל בין רכישת פלטפורמת אבטחת AI לבין שכירת יועצים?

פלטפורמות אבטחת AI כגון HiddenLayer, Mindgard ו-Giskard מבצעות אוטומציה של דפוסי תקיפה ידועים בקנה מידה רחב. הן בעלות ערך רב לבדיקות רגרסיה רציפות בצינור ה-CI/CD שלכם. עם זאת, הן אינן מחליפות הערכה ראשונית מכיוון שאינן יכולות להבין את ההקשר העסקי שלכם, להעריך אילו פלטי מודל נושאים השלכות קריטיות לבטיחות, או לגלות נתיבי תקיפה חדשים הייחודיים לארכיטקטורה שלכם. הגישה הנכונה משלבת את שתיהן: יועצים כדי לזהות את משטח האיומים האמיתי שלכם, לקבוע מה באמת חשוב ולבנות בקרות הקשחה, ולאחר מכן כלי פלטפורמה לבדיקות אוטומטיות שוטפות מול קו הבסיס שההערכה ביססה.

בנו את ה-AI שלכם בביטחון.

שותפו עם צוות בעל ניסיון עמוק בבניית הדור הבא של AI ארגוני. אנו נסייע לכם לתכנן, לבנות ולהטמיע אסטרטגיית AI שתוכלו לסמוך עליה.

Veriprajna ייעוץ דיפ-טק מתמחה בבניית מערכות AI קריטיות לבטיחות עבור תחומי הבריאות, הפיננסים והרגולציה. הארכיטקטורות שלנו מאומתות מול פרוטוקולים מבוססים ומלוות בתיעוד ציות מקיף.