הבעיה
בפברואר 2024, עובד בחברת ההנדסה הגלובלית Arup הצטרף לשיחת וידאו עם סמנכ"ל הכספים (CFO) של החברה ומספר מנהלים בכירים. כל פנים נראו אמיתיים. כל קול נשמע מוכר. סמנכ"ל הכספים הורה לבצע 15 העברות בנקאיות לחמישה חשבונות בנק שונים. העובד פעל לפי ההוראות. סך כל ההפסד: 25.6 מיליון דולר.
הנה החלק המבעית: אף אחד מהאנשים הללו לא היה אמיתי. כל מנהל בשיחה הזו היה דיפ-פייק שנוצר באמצעות בינה מלאכותית — העתק סינתטי שנבנה מתוך סרטוני YouTube וצילומי ועידות שהיו זמינים לציבור. התוקפים השקיעו חודשים באיסוף וידאו ואודיו של מנהלי Arup האמיתיים. הם אימנו מודלי בינה מלאכותית לשכפל לא רק פנים, אלא גם דפוסי דיבור ייחודיים והבעות מיקרו. התוצאה הייתה צוות של "תאומים סינתטיים בנאמנות גבוהה", משכנעים דיים כדי להטעות איש מקצוע פיננסי מיומן במהלך פגישה חיה.
לא נעשה שימוש בנוזקות. שום סיסמה לא נגנבה. שום מסד נתונים לא נפרץ. התשתית הדיגיטלית של Arup נותרה שלמה לחלוטין לאורך כל האירוע. התוקפים לא פרצו למערכות החברה — הם פרצו לאמון של העובד במה שראה ושמע. ההונאה התגלתה רק כאשר העובד יצר קשר מאוחר יותר עם לשכתו של סמנכ"ל הכספים האמיתי בלונדון. פגישה כזו מעולם לא התקיימה.
זה לא היה כשל בחומות האש (firewalls) שלכם. זה היה כשל של ההנחה ש"מראה עיניים הוא הוכחה".
מדוע זה חשוב לעסק שלכם
ההפסד של 25.6 מיליון דולר ב-Arup הוא דרמטי, אך האיום האמיתי הוא מבני. סביר להניח שהארגון שלכם מסתמך על שיחות וידאו כדי לאמת זהויות ולאשר החלטות בעלות ערך גבוה מדי יום. הנחה זו התנפצה כעת.
המספרים מספרים את סיפורו של איום שמסלים במהירות:
- התקפות הזרקה (Injection attacks) — שבהן תוקפים מזינים וידאו מזויף ישירות לתוכנת שיחות ועידה כמו Zoom או Teams — זינקו ב-255% בשנת 2023.
- התקפות החלפת פנים (Face-swap) — שבהן שידור מצלמת הרשת החי של התוקף מוחלף פריים-אחר-פריים בדיפ-פייק — עלו ב-704% באותה תקופה.
- העלות ליצירת דיפ-פייק משכנע צנחה לכ-$15 ו-45 דקות של מאמץ.
מעבר לפגיעה הפיננסית הישירה, ההנהלה שלכם ניצבת בפני חשיפה אישית הולכת וגוברת. מנהלי מערכות מידע (CIOs) ומנהלי טכנולוגיות ראשיים (CTOs) נדרשים כעת לרף גבוה יותר של חובת זהירות ונאמנות (fiduciary care) בכל הנוגע לבקרות מודעות לדיפ-פייק. אי-יישום של נהלי אבטחה סבירים עלול להוביל לאחריות אישית אם בעלי מניות או לקוחות יתבעו בגין רשלנות. בתי המשפט פועלים יותר ויותר לפי "כלל המתחזה" (Impostor Rule), המטיל את ההפסדים על הצד שהיה בעמדה הטובה ביותר למנוע את ההונאה.
גם חובות הציות שלכם מתרחבות. חוק הבינה המלאכותית של האיחוד האירופי (EU AI Act), מסגרת ניהול סיכוני הבינה המלאכותית של NIST (NIST AI Risk Management Framework), ותקנים כמו ISO/IEC 30107-3 לזיהוי התקפות ביומטריות מצפים כיום מארגונים להתגונן מפני איומי מדיה סינתטית. אם תהליכי האימות שלכם עדיין מתייחסים לשיחת וידאו כהוכחת זהות, יש לכם פער שרגולטורים ועורכי דין של תובעים ימצאו במהרה.
זו אינה בעיה טכנולוגית עבור צוות ה-IT שלכם. זוהי בעיית בקרות פיננסיות עבור הדירקטוריון שלכם.
מה באמת קורה מתחת למכסה המנוע
כדי להבין מדוע התקפה זו הצליחה, חשבו עליה כמו על שטר כסף מזויף מושלם. זייפן אינו צריך לשדוד את המטבעה — הוא רק צריך לייצר שטר טוב מספיק כדי שהקופאי יקבל אותו. תוקפי Arup עשו בדיוק את אותו הדבר עם פנים וקולות אנושיים.
הם השתמשו בשני סוגים של מודלי בינה מלאכותית שפעלו יחד. רשתות אדברסריות יוצרות (GANs) — מערכות שבהן שני מודלי AI מתחרים ביניהם כדי ליצור ולזהות זיופים — ביצעו החלפת פנים בזמן אמת. מודל אחד מייצר פנים מזויפות; המודל השני מנסה לאתר את הזיוף. לאחר מיליוני סבבים, המודל היוצר מפיק פנים שאפילו המודל המזהה אינו מסוגל להבדיל ביניהן לבין פנים אמיתיות. מודלי דיפוזיה (Diffusion models) — בינה מלאכותית הלומדת לבנות תמונות ברורות מתוך רעש אקראי — הבטיחו שפני הדיפ-פייק לא יהבהבו או יתעוותו במהלך תנועה. "עקביות זמנית" (temporal consistency) זו היא קריטית, משום שהעין שלכם רגישה במיוחד לפגמים חזותיים.
הפרט הטכני החשוב ביותר הוא האופן שבו הווידאו המזויף הגיע לשיחה. התוקפים לא החזיקו מסך מול מצלמה. הם השתמשו ב"התקפת הזרקת וידאו" (video injection attack), כשהם מזינים חבילות וידאו סינתטיות ישירות לזרם הנתונים של תוכנת שיחות הוועידה. היישום התייחס להזנה דיגיטלית זו כאילו הגיעה ממצלמה אמיתית. בדיקות חיוּת סטנדרטיות — מסוג הבדיקות שמחפשות עומק ושוליים פיזיים — אינן יכולות לזהות שיטה זו משום שאין כל תוצר לוואי פיזי לניתוח.
זהו מצב הכשל הספציפי: כלי שיחות הוועידה שלכם סומכים על כל זרם וידאו שהם מקבלים. אין להם שום דרך לאמת האם זרם זה מגיע ממצלמה אמיתית המכוונת לאדם אמיתי.
מה עובד (ומה לא)
נתחיל בשלוש גישות שאינן פותרות את הבעיה:
אימות רב-שלבי סטנדרטי (MFA). תוקפי Arup עקפו לחלוטין את ה-MFA משום שההתקפה לא כוונה נגד פרטי התחברות. הם כיוונו נגד שיקול הדעת האנושי בשיחה חיה. ה-MFA שלכם מגן על החשבונות שלכם, לא על העיניים שלכם.
צ'אטבוטים גנריים של AI הבנויים על ממשקי API ציבוריים. כלי "מעטפת LLM" אלה — שכבות תוכנה דקות השולחות את הנתונים שלכם לענן של צד שלישי לצורך עיבוד — הם הסתברותיים לחלוטין. הם חוזים את המילה הבאה בעלת הסבירות הגבוהה ביותר במקום לאמת עובדות מול הרשומות האמיתיות שלכם. הם אינם מסוגלים לזהות דיפ-פייק, והם יוצרים סיכונים חדשים על ידי שליחת נתונים פיננסיים רגישים אל מחוץ לרשת שלכם.
הדרכות פישינג מסורתיות. רוב תוכניות ההדרכה מכינות עובדים להודעות דוא"ל חשודות, ולא לשיחות וידאו חיות הכוללות העתקים משכנעים של המנהל שלהם ושל חמישה מעמיתיהם. עובד Arup גילה ספקנות ראשונית כלפי הודעת הפישינג בדוא"ל. שיחת הווידאו תוכננה במיוחד כדי להתגבר על אותה ספקנות.
הנה מה שבאמת עובד — הגנה רב-שכבתית המאמתת זהות באמצעות אותות שבינה מלאכותית עדיין אינה מסוגלת לזייף:
1. אימות קלט — ביומטריה התנהגותית כשומר שקט. לפני כל עסקה בעלת ערך גבוה, המערכת שלכם צריכה לנתח באופן רציף כיצד האדם מקיים אינטראקציה עם הטכנולוגיה שלו. מהירות הקלדה, דפוסי תנועת עכבר ולחץ על מסך המגע יוצרים פרופיל התנהגותי ייחודי עבור כל מנהל. דפוסים נוירוביולוגיים אלה כמעט בלתי ניתנים לזיוף. אם "סמנכ"ל הכספים" בשיחה שלכם מבקש העברה של 25 מיליון דולר בעוד שהתנהגות ההקלדה שלו חורגת מהפרופיל ההיסטורי שלו, המערכת שלכם צריכה לסמן את האינטראקציה באופן אוטומטי.
2. עיבוד — אישור מחוץ לערוץ (Out-of-band) דרך ערוץ נפרד. שיחות וידאו אינן יכולות עוד לשמש כמילה האחרונה באימות זהות עבור עסקאות פיננסיות. כל הוראה להעברה בעלת ערך גבוה צריכה לחייב אימות עצמאי באמצעות מספר טלפון שאומת מראש, פלטפורמת הודעות מוצפנת כמו Signal, או קוד אימות שהוסכם מראש ונמסר בערוץ שאינו דיגיטלי. יש לדרוש מאשר שני שלא נכח בשיחת הווידאו המקורית.
3. פלט — מקוריות קריפטוגרפית (Cryptographic provenance) ואימות פיזיולוגי. תקן C2PA מטמיע מטא-דאטה קריפטוגרפי ברגע לכידת הווידאו, ויוצר שרשרת משמורת עמידה בפני חבלה (tamper-evident) עבור כל פריים. אם הזנת וידאו בשיחת Teams או Zoom חסרה אישורים אלה, התייחסו אליה באותו חשד שהייתם מגלים כלפי חוזה לא חתום. שלבו זאת עם ניתוח אותות פיזיולוגיים — טכנולוגיה המנטרת שינויים בצבע הפנים הנגרמים מפעימות הלב, הבלתי נראים לעין האנושית. וידאו סינתטי נעדר אותות ביולוגיים אלה.
היתרון המכריע עבור צוותי הציות והביקורת שלכם: ארכיטקטורה רב-שכבתית זו יוצרת שובל בר-אימות בכל שלב. פרקטיקת הערכת האבטחה וההקשחה שלכם יכולה למפות בקרות אלו ישירות לתהליך בן ארבעת השלבים של מסגרת ניהול סיכוני הבינה המלאכותית של NIST — Govern, Map, Measure, Manage (משילות, מיפוי, מדידה, ניהול) — ולדרישות ההסמכה של תקן ISO/IEC 30107-3 לזיהוי התקפות ביומטריות.
עבור ארגונים בתחום השירותים הפיננסיים, ארכיטקטורה זו מתחברת ישירות גם לחובות ניהול הסיכונים הרגולטוריים והמוכנות להתדיינות משפטית הקיימות שלכם. כל אירוע אימות נרשם ביומן. כל דריסה מתועדת. כאשר מבקרים או רגולטורים שואלים כיצד אתם מתגוננים מפני הונאות מדיה סינתטית, אתם יכולים להציג להם את השובל הלוגי במקום להצביע על מצגת הדרכה.
אתם יכולים לקרוא את הניתוח הטכני המלא עבור המפרט הארכיטקטוני המלא, או לחקור את הגרסה האינטראקטיבית לסיור חזותי במערך ההגנה.
נקודות מפתח
- התקפת הדיפ-פייק על Arup גנבה 25.6 מיליון דולר באמצעות שיחת וידאו מזויפת — ללא נוזקות, ללא גניבת סיסמאות וללא פריצה למערכות.
- התקפות החלפת פנים (Face-swap) עלו ב-704% בשנת 2023, ויצירת דיפ-פייק משכנע עולה כיום כ-15 דולר ($15) ו-45 דקות עבודה.
- שיחות וידאו אינן יכולות עוד לשמש כאימות זהות עבור עסקאות פיננסיות בעלות שווי גבוה — כל העברה משמעותית דורשת אישור מחוץ לערוץ (out-of-band) דרך ערוץ נפרד.
- ביומטריה התנהגותית — ניתוח האופן שבו אדם מקליד ומזיז את העכבר — יכולה לזהות מתחזים שטכנולוגיית דיפ-פייק עדיין אינה מסוגלת לחקות.
- מנהלי מערכות מידע (CIOs) ומנהלי טכנולוגיות ראשיים (CTOs) ניצבים בפני אחריות אישית גוברת אם לא יישמו בקרות מודעות לדיפ-פייק לפני התרחשות פריצה.
שורה תחתונה
הפריצה ל-Arup הוכיחה כי וידאו שנוצר בבינה מלאכותית טוב כיום מספיק כדי להטעות אנשי מקצוע מיומנים בשיחות חיות. מערך ההגנה שלכם חייב להתקדם מעבר למה שאנשים יכולים לראות ולשמוע אל מה שהטכנולוגיה יכולה למדוד — דפוסים התנהגותיים, אותות פיזיולוגיים והוכחת מקוריות קריפטוגרפית. שאלו את ספק הבינה המלאכותית שלכם: אם מנהל מזויף בדיפ-פייק יופיע בשיחת וידאו ויבקש העברה בנקאית, איזו שכבה ספציפית במערכת שלכם תתפוס זאת, והאם תוכלו להציג לי את יומן הביקורת (audit log)?