לאחראי סיכונים וציות4 דק׳ קריאה

האם ניתן להפוך AI לגילוי תרופות לנשק? כן — תוך 6 שעות

בינה מלאכותית לגילוי תרופות יצרה 40,000 כלי נשק כימיים פוטנציאליים על חומרה צרכנית — הנה מה שמסנני הבטיחות שלכם אינם יכולים לעצור.

הבעיה

מערכת בינה מלאכותית לגילוי תרופות שתוכננה למצוא תרופות מצילות חיים יצרה 40,000 כלי נשק כימיים פוטנציאליים — כולל גז העצבים VX — בפחות משש שעות. חוקרים ב-Collaborations Pharmaceuticals ערכו את הניסוי על גבי שרת רגיל ברמה צרכנית (consumer-grade). הם לא פרצו למערכת. הם לא הזינו לה נתונים מסווגים. הם פשוט הפכו מספר אחד בקובץ תצורה, ושינו את יעד ה-AI מ-"מזעור רעילות" ל-"מקסום רעילות". המודל עשה את כל השאר.

תת-קבוצה משמעותית מתוך 40,000 המולקולות הללו נחזתה כקטלנית יותר מ-VX עצמו. אלפים מהם היו תרכובות חדשות לחלוטין שאינן מופיעות באף מסד נתונים ציבורי ובאף רשימת מעקב ממשלתית. ה-AI השתמש אך ורק במאגרי נתונים כימיים בקוד פתוח כגון ChEMBL. כוח החישוב הנדרש היה נגיש לכל אדם בעל GPU צרכני. המומחיות הנדרשת? תואר ראשון במדעי המחשב.

לא היה מדובר בהערכת סיכונים תאורטית. זו הייתה הדגמה חיה שהוכנה עבור כנס בינלאומי דו-שנתי לבקרת נשק שאורגן על ידי המשרד הפדרלי השוויצרי להגנה אזרחית (Swiss Federal Office for Civil Protection). מודל ה-AI, שאומן להבין מה הופך מולקולות לרעילות כדי שיוכל להימנע ממאפיינים אלה, ידע מטבעו כיצד לנצל אותם. אם הארגון שלכם בונה, פורס או תלוי בבינה מלאכותית בגילוי תרופות, ביוטכנולוגיה או בכל תחום שבו אופטימיזציה נוגעת לבטיחות פיזית, ניסוי זה מגדיר את חשיפת הסיכון שלכם ממש ברגע זה.

מדוע זה חשוב לעסק שלכם

ההשלכות העסקיות כאן חורגות הרבה מעבר למעבדה. הצו הנשיאותי של הבית הלבן בנושא בינה מלאכותית בטוחה, מאובטחת ומהימנה (אוקטובר 2023) מגדיר במפורש את הורדת חסמי הכניסה לפיתוח נשק כימי, ביולוגי, רדיולוגי וגרעיני באמצעות AI כאיום ביטחון לאומי מדרגה ראשונה (tier-1). פרופיל הבינה המלאכותית היוצרת של NIST (NIST.AI.600-1) מסמן באופן ספציפי "כלי תכנון כימיים וביולוגיים" כקטגוריית סיכון ייחודית. תקן ISO 42001 — תקן ניהול ה-AI הראשון בעולם הניתן להסמכה — מחייב בקרות לחוסן בפני מתקפות יריב ולבטיחות מערכות AI.

אם מערכות ה-AI שלכם נוגעות בתחומים מפוקחים, שקלו את מה שמונח על הכף:

  • חשיפה רגולטורית: מסנן בטיחות סטנדרטי אינו יכול להוכיח שהוא מונע יצירת איומים ביולוגיים. הוא יכול רק להראות שהוא מנסה לסנן אותם. גישת "מיטב המאמצים" (best effort) הזו צפויה להיכשל מול דרישות ציות פדרליות מתגבשות עבור חוזים או אינטגרציה עם פלטפורמות AI ממשלתיות.
  • פגיעות למתקפות יריב: חוקרים הראו כי תוקפים יכולים לעקוף מסנני בטיחות במודלי AI מובילים כמו GPT-4 ו-Claude 3 בשיעורי הצלחה שלעתים עולים על 90% עבור חומרים רעילים ספציפיים. הם עושים זאת על ידי הזנת הקוד המבני של המולקולה במקום שמה.
  • עיוורון לאיומים חדשים: 40,000 התרכובות שנוצרו כללו אלפי מולקולות שאינן קיימות באף מאגר נתונים מוכר. המסננים שלכם, המבוססים על מילות מפתח, אינם יכולים לחסום את מה שמעולם לא ראו קודם לכן.
  • כישלון בביקורת: תחת ISO 42001, עליכם להעריך פגיעות למתקפות יריב ולהציג ראיות לבקרות. תחת NIST AI RMF, עליכם למדוד את אמינות המערכת באמצעות מדדים כמותיים. מעטפת מבוססת טקסט אינה מספקת אף אחד מאלה.

הדירקטוריון שלכם, הרגולטורים שלכם ומבטחי המשנה שלכם ישאלו בסופו של דבר שאלה אחת: האם אתם יכולים להוכיח שלא ניתן להפנות את ה-AI שלכם נגדכם? כיום, רוב הארגונים אינם יכולים.

מה שבאמת קורה מתחת למכסה המנוע

כדי להבין מדוע כל כך קשה לתקן איום זה, עליכם להבין כיצד מודלי ה-AI הללו פועלים בפועל — וזה פשוט יותר ממה שאתם עשויים לחשוב.

מודלי בינה מלאכותית יוצרת לגילוי תרופות לומדים מפה דחוסה של המרחב הכימי. חשבו על כך כמו על מפת עיר שבה כל בניין מייצג מולקולה אפשרית. תרופות בטוחות מתקבצות בשכונה אחת. תרכובות רעילות מתקבצות בשכונה אחרת. אך הנה הבעיה הקריטית: השכונה ה"בטוחה" והשכונה ה"רעילה" אינן מופרדות על ידי חומה. הן יושבות על פני נוף רציף ללא גבול קשיח.

זהו מה שחוקרים מכנים "בעיית השזירה" (entanglement problem). המאפיין המולקולרי המדויק שמאפשר לתרופה לחצות את מחסום הדם-מוח כדי לטפל באלצהיימר הוא לעתים קרובות אותו מאפיין המאפשר לגז עצבים להגיע ליעדו ולגרום לשיתוק. זיקה קישורית גבוהה (high binding affinity) — יכולתה של מולקולה להיקשר בחוזקה לחלבון — רצויה בתרופה אך קטלנית כאשר החלבון הוא אצטילכולינאסטרז (acetylcholinesterase), המטרה של VX.

כימאים רפואיים מכירים היטב את תופעת "מצוקי הפעילות" (activity cliffs) — מצבים שבהם שינוי מבני זעיר גורם לתזוזה אדירה ברעילות. החליפו אטום אחד במולקולה בטוחה לחלוטין, ותקבלו תרכובת קטלנית. מסנני בטיחות מבוססי טקסט, הפועלים על מילים ושמות ולא על מבנה מולקולרי תלת-ממדי, ידועים לשמצה בחוסר יכולתם ללכוד מצוקים אלה. מסנן עשוי לאשר מולקולה מכיוון שהיא נראית דומה ב-99% לתרופה בטוחה, תוך שהוא מחמיץ את ההחלפה הבודדת שהופכת אותה לקטלנית.

קיימת גם "קריסת ייצוג" (representation collapse), שבה המודל הפנימי של ה-AI ממפה רעלן ותרופה בטוחה לאותה נקודה בדיוק מכיוון שאינו מסוגל להבחין בהבדלים המבניים העדינים ביניהם. כאשר המודל עצמו אינו יכול להבדיל ביניהם באופן פנימי, שום מסנן חיצוני לא יציל אתכם.

מה עובד (ומה לא)

נתחיל במה שנכשל — מכיוון שהארגון שלכם עשוי להסתמך על אחת מהגישות הללו ממש ברגע זה.

מסננים מבוססי מילות מפתח ושמות: אלה חוסמים את המילה "VX" או "סארין" אך מעבירים את הקלט ישירות כאשר מישהו מזין קוד מבנה מולקולרי. מחרוזת ה-SMILES עבור סארין היא O=P(C)(F)O. המסנן שלכם רואה סימון כימי, לא נשק.

מערכות סקירה שלאחר יצירה (Post-generation review): אלו מאפשרות ל-AI ליצור מועמד תחילה, ולאחר מכן מערכת שנייה סוקרת אותו. ה-AI כבר ביצע את החישוב המסוכן. עבור תרכובות חדשות שאינן מופיעות באף רשימת מעקב, לסוקר אין שום דבר להשוות אליו והוא פשוט מאשר אותן.

אימון התאמה (Alignment) והנדסת פרומפטים: חוקרים הדגימו מתקפת "SMILES-prompting" העוקפת את אימוני הבטיחות במודלי AI מובילים בשיעורי הצלחה של מעל 90% עבור חומרים מסוימים. אם מערכת הבטיחות שלכם ניתנת להכנעה על ידי מעבר מאנגלית לסימון כימי, זו אינה מערכת בטיחות.

הנה מה שבאמת עובד — גישה הנקראת משילות מרחב כמוס (Latent Space Governance), המעבירה את בקרות הבטיחות משכבת הפלט אל הליבה המתמטית של מודל ה-AI:

  1. מיפוי אזורי הסכנה לפני הפריסה. באמצעות טכניקה מתמטית הנקראת ניתוח נתונים טופולוגי (Topological Data Analysis), אתם ממפים את הנוף הפנימי של ה-AI כדי לזהות במדויק היכן קיימים אזורים רעילים ובטוחים. פעולה זו מייצרת "מפת טופולוגיית בטיחות" המגדירה גבולות על סמך תכונות מולקולריות, ולא על פי רשימות מילות מפתח. מפה זו לוכדת תרכובות חדשות מכיוון שהיא מגדירה בטיחות לפי צורה, ולא לפי שם.

  2. הטמעת אילוצים בתהליך היצירה עצמו. במקום לאפשר ל-AI ליצור בחופשיות ולסנן לאחר מכן, אתם מאמנים רשתות "מבקר אילוצים" (Constraint Critic) קלות משקל הפועלות ישירות על הייצוגים הפנימיים של ה-AI. במהלך היצירה, מבקרים אלה מחשבים האם ה-AI נסחף לעבר אזור מסוכן. אם כן, מנגנון היגוי מבוסס-גרדיאנט דוחף את המסלול בחזרה לטריטוריה בטוחה לפני שנוצר פלט כלשהו. ה-AI שוקל למעשה מולקולה רעילה אך נאלץ מתמטית להמיר אותה לחלופה בטוחה.

  3. קידוד קשיח של גבולות בטיחות העמידים בפני חבלה. שלא כמו בניסוי MegaSyn שבו הפיכת מספר אחד בקובץ תצורה הפכה את כל מערך הבטיחות על פיו, אילוצים מבניים מוטמעים בארכיטקטורה של מנוע ההיסק. כדי להביס אותם, תוקף יצטרך לתכנן מחדש באופן יסודי את ארכיטקטורת התוכנה — ולא רק לשנות הגדרה.

עבור צוות הציות שלכם, גישה זו מספקת משהו שמעטפות מבוססות טקסט אינן יכולות לספק: הוכחה מתמטית להתנהגות תחומה. תוכלו לתעד לא רק פלטים אלא כל הפרת אילוץ שהמודל ניסה לבצע במהלך היצירה. תוכלו לספק למבקרים תעודת בטיחות סטטיסטית — לדוגמה, הסתברות ליצירה רעילה של פחות מאחת למיליון. ראיות אלו תומכות ב- הסמכת ISO 42001 וציות ל-NIST AI RMF בדרכים שהטענה "יש לנו מסנן מילות מפתח" לעולם לא תוכל לספק.

ארכיטקטורה זו מאפשרת לכם גם לעדכן הגדרות איומים מבלי לאמן מחדש את מודל היסוד כולו. כאשר מזוהה מחלקה חדשה של תרכובות מסוכנות, אתם מעדכנים את מבקר האילוצים (Constraint Critic) — פעולה קלת משקל — בזמן שה-AI הראשי שלכם ממשיך לפעול. עבור ארגונים הפועלים בתחומי הבריאות ומדעי החיים, גמישות זו היא קריטית ככל שנוף האיומים מתפתח.

תהליך של הערכה, השוואת ביצועים ו-Red Teaming מעמיד לאחר מכן את המערכת הפרוסה שלכם בפני מתקפות יריב אוטומטיות — כולל בוטים של SMILES-prompting ואלגוריתמים אבולוציוניים שתוכננו למצוא נקודות תורפה — כדי לוודא שהאילוצים שלכם מחזיקים מעמד תחת לחץ.

תוכלו לקרוא את הניתוח הטכני המלא לקבלת הניסוח המתמטי המלא, או לחקור את הגרסה האינטראקטיבית לסיור מודרך ב- ארכיטקטורה נוירו-סימבולית ומערכות אילוצים העומדות מאחורי גישה זו.

נקודות מפתח

  • בינה מלאכותית לגילוי תרופות יצרה 40,000 כלי נשק כימיים פוטנציאליים — כולל גז העצבים VX — בפחות מ-6 שעות על גבי חומרה צרכנית באמצעות נתוני קוד פתוח.
  • מתקפות SMILES-prompting עוקפות מסנני בטיחות במודלי AI מובילים כמו GPT-4 ו-Claude 3 בשיעורי הצלחה של מעל 90% עבור חומרים רעילים מסוימים.
  • מסנני בטיחות מבוססי טקסט אינם מסוגלים ללכוד תרכובות חדשות, מצוקי פעילות או קודים מבניים — הם מזהים אך ורק שמות שהונחו לחסום.
  • בטיחות AI מבנית מטמיעה אילוצים בליבה המתמטית של המודל, ומונעת פלטים מסוכנים לפני היצירה במקום לסנן אותם בדיעבד.
  • רגולציות מתגבשות — הצו הנשיאותי של הבית הלבן, NIST AI RMF ו-ISO 42001 — דורשות יותר ויותר בקרות בטיחות הניתנות להוכחה, ולא סינון בגישת "מיטב המאמצים".

שורה תחתונה

מחסום הכניסה להפיכת בינה מלאכותית לגילוי תרופות לנשק הוא כעת GPU צרכני ושינוי קוד של שורה אחת. מעטפות בטיחות מבוססות טקסט נכשלות מול תרכובות חדשות ומתקפות קוד מבני. ה-AI שלכם זקוק לאילוצים מתמטיים המוטמעים בתהליך היצירה שלו — ולא למסננים המוצמדים לפלטים שלו. שאלו את ספק ה-AI שלכם: אם מישהו יהפוך את פונקציית התגמול של המודל שלכם היום, האם תוכלו להוכיח שהוא אינו מסוגל ליצור פלטים רעילים, או שאתם מסתמכים על מסנני מילות מפתח שתלמיד כימיה יכול לעקוף?

שאלות נפוצות

שאלות נפוצות

האם ניתן להשתמש ב-AI לגילוי תרופות כדי לייצר כלי נשק כימיים?

כן. חוקרים ב-Collaborations Pharmaceuticals הדגימו כי בינה מלאכותית לגילוי תרופות יכולה ליצור 40,000 כלי נשק כימיים פוטנציאליים — כולל גז העצבים VX ותרכובות חדשות הרעילות יותר מ-VX — בפחות משש שעות. הם השתמשו אך ורק במאגרי נתונים בקוד פתוח, בחומרה ברמה צרכנית ובשינוי של שורה אחת בלבד בתצורת המודל.

מדוע מסנני בטיחות של AI אינם עוצרים תכנוני תרופות מסוכנים?

רוב מסנני הבטיחות של בינה מלאכותית מסתמכים על חסימת מילות מפתח וזיהוי מבוסס שמות. תוקפים עוקפים מסננים אלה על ידי הזנת הקוד המבני של המולקולה (הנקרא סימון SMILES) במקום שמה. מחקרים מראים שטכניקה זו עוקפת מנגנוני בטיחות במודלי AI מובילים בשיעורי הצלחה שלעתים עולים על 90%. כמו כן, מסננים אינם מסוגלים ללכוד תרכובות חדשות שאינן מופיעות באף מאגר נתונים או רשימת מעקב קיימת.

אילו תקנות AI חלות על גילוי תרופות וביוטכנולוגיה?

הצו הנשיאותי של הבית הלבן בנושא AI (אוקטובר 2023) מגדיר איומים כימיים וביולוגיים מבוססי AI כסוגיית ביטחון לאומי מדרגה ראשונה (tier-1). פרופיל הבינה המלאכותית היוצרת של NIST (NIST.AI.600-1) מסמן באופן ספציפי כלי תכנון כימיים וביולוגיים כסיכון ייחודי. תקן ISO 42001 דורש בקרות לחוסן בפני מתקפות יריב והערכות בטיחות. מסגרות אלו דורשות יותר ויותר בקרות בטיחות הניתנות להוכחה במקום סינון בגישת "מיטב המאמצים".

בנו את ה-AI שלכם בביטחון.

שותפו עם צוות בעל ניסיון עמוק בבניית הדור הבא של AI ארגוני. אנו נסייע לכם לתכנן, לבנות ולהטמיע אסטרטגיית AI שתוכלו לסמוך עליה.

Veriprajna ייעוץ דיפ-טק מתמחה בבניית מערכות AI קריטיות לבטיחות עבור תחומי הבריאות, הפיננסים והרגולציה. הארכיטקטורות שלנו מאומתות מול פרוטוקולים מבוססים ומלוות בתיעוד ציות מקיף.