בטיחות מבנית בבינה מלאכותית: הציווי ל פיקוח על מרחב לטנטי בסיכון גבוה בעיצוב ביולוגי יוצר

תקציר מנהלים

עידן הבינה המלאכותית היוצרת (AI) המתפתח חולל שינוי פרדיגמה ב גילוי מדעי, במיוחד במגזרי התרופות והביוטכנולוגיה. ה יכולת של מודלי למידה עמוקה לחקור אזורים עצומים של מרחב כימי ולהציע מועמדים טיפוליים חדשים דחסה את לוחות הזמנים לגילוי תרופות משנים לשבועות. עם זאת, ליכולת משנה-עולם זו יש צל מובנה: ה"שימוש הכפול" דילמה. אותן ארכיטקטורות אלגוריתמיות שנועדו לזהות תרופות מצילות חיים יכולות, ב שינוי זניח, להיות מיועדות מחדש לתכנון סוכנים ביוכימיים קטלניים ביותר. ניסוי ה"מתג ההפוך" המכונן שערכה Collaborations Pharmaceuticals, שבו מודל יוצר שאופטימז לרעילות ייצר 40,000 כימיים פוטנציאליים כלי נשק—כולל גז העצבים VX ואנלוגים חדשים—בפחות משש שעות, עומד כ עדות שאין עליה עוררין לסיכון זה. 1

מסמך לבן זה, שהוכן עבור Veriprajna, טוען שסטנדרט התעשייה הנוכחי לבטיחות בינה מלאכותית—המאופיין לעיתים קרובות ב"עטיפות LLM" הנשענות על הנדסת פרומפטים וסינון טקסט לאחר מעשה—אינו מספיק ביסודו לתחומים בעלי סיכון גבוה. מעקות בטיחות שטחיים אלה נכשלים בטיפול במציאות הגיאומטרית של המרחב הלטנטי של המודל, שבו יכולות רעילות ו טיפוליות קיימות על יריעה רציפה, שלעיתים קרובות שזורה. מסננים מבוססי טקסט עיוורים לסמנטיקה המבנית של הכימיה ופגיעים להפרעות אדוורסריות, ומותירים ארגונים חשופים לסיכונים רגולטוריים, מוניטיניים וקיומיים קטסטרופליים.

Veriprajna מציגה סטנדרט חדש לבינה מלאכותית ארגונית: פיקוח על מרחב לטנטי . באמצעות הזזת מוקד הבקרה משכבת הפלט אל המבנים הלטנטיים רב-הממדיים של המודל עצמו, אנו מאפשרים צורה של "בטיחות מבנית בבינה מלאכותית." גישה זו משתמשת באילוצים טופולוגיים, מיפוי יריעות ולמידת חיזוק מרוסנת כדי למנוע מתמטית את יצירת הפלטים המזיקים. מסמך זה מספק ניתוח ממצה של החסרונות הטכניים של המתודולוגיות הנוכחיות, חוקר את הטופולוגיה של הרעילות, ו מפרט את עקרונות הארכיטקטורה של פתרונות בינה מלאכותית עמוקה המבטיחים ציות לתקנים מחמירים מתהווים כגון NIST AI Risk Management Framework ו-ISO 42001.

1. אופק השימוש הכפול: ה"מתג ההפוך" ו הדמוקרטיזציה של הקטלניות

ההתמזגות של בינה מלאכותית וביולוגיה מולקולרית הבטיחה זה מכבר מהפכה בגילוי תרופות. עם זאת, הדואליות המובנית של טכנולוגיה זו—שבה היכולת לרפא סמוכה מתמטית ליכולת להזיק—עברה מסיכון תיאורטי שנדון בחוגים אקדמיים למציאות תפעולית מוכחת. חסם הכניסה לתכנון נשק כימי מתוחכם הורד באופן דרמטי, לא על ידי התפשטות של חומרים פיזיים, אלא על ידי הדמוקרטיזציה של האינטליגנציה החישובית הנדרשת לתכננו.

1.1 ניסוי MegaSyn: חקר מקרה בשימוש כפול אלגוריתמי

בהכנה לוועידת Spiez Convergence, אירוע דו-שנתי לפיקוח על נשק שאורגן על ידי המשרד הפדרלי השווייצרי להגנה אזרחית, חוקרים ב-Collaborations Pharmaceuticals ערכו ניסוי הוכחת-היתכנות להערכת הפוטנציאל לשימוש לרעה בבינה מלאכותית. 2 הצוות השתמש במודל יוצר מסחרי, MegaSyn, שתוכנן במקור לחזות ביו-אקטיביות ולייצר מועמדים טיפוליים חדשים למחלות נדירות ומוזנחות.

המתודולוגיה שננקטה הייתה פשוטה באופן מטריד, והדגישה את הנגישות של וקטור האיום הזה. המודל היוצר הונע על ידי פונקציית ניקוד שהענישה רעילות ותיגמלה יעילות טיפולית. כדי "להפוך את המתג," החוקרים היפכו את פונקציית התגמול. במקום להעניש רעילות, המודל קיבל הוראה למקסם אותה, ובאופן ספציפי לכוון לפרופיל הקטלניות של VX, אחד מגזי העצבים החזקים ביותר הידועים לאדם. 1

התוצאות נוצרו בפחות משש שעות על שרת סטנדרטי בדרגת צרכן, תוך שימוש במערך נתונים ובארכיטקטורה המובנים היטב בקהילת הכימו-אינפורמטיקה:

טבלה 1: תוצאות ניסוי ה"מתג ההפוך"

מדד תוצאה הקשר
זמן עד ליצירה < 6 שעות בוצע על סטנדרטית
חומרה (Mac/Linux
שרת), המדגים נמוך
חסם חישוב.
נפח פלט 40,000 מולקולות ספרייה עצומה של
מועמדים פוטנציאליים
שנוצרו במהירות ש
כימאים אנושיים אינם יכולים
להשתוות אליה.
פרופיל יעד VX (גז עצבים) המודל הצליח
לגלות מחדש את VX ואחרים
Col1 Col2 ידועים מסדרות G ו
גזי עצבים מסדרות V.
קטלניות > עוצמת VX תת-קבוצה משמעותית של
מולקולות נחזתה כ
be_more_ רעילה מ-VX.
חידוש גבוה אלפי תרכובות
היו חדשות, ולא הופיעו בשום
מאגר ציבורי או
רשימת מעקב ממשלתית.

ניסוי זה לא דרש מחשב-על או שחקן מדינה סורר עם מיליונים ב מימון. הוא השתמש במערכי נתונים בקוד פתוח (כגון ChEMBL), ארכיטקטורות יוצרות סטנדרטיות (מודלים מבוססי RNN ו-LSTM), והבנה זמינה מסחרית של חיזוי רעילות. 5 ההשלכות עמוקות: חסם הכניסה לתכנון סוכנים ביוכימיים בעלי קטלניות גבוהה הורד לעלות של GPU לצרכן ו הבנה בסיסית של Python. מודל הבינה המלאכותית, שאומן להבין את "כללי" הרעילות כדי להימנע מהם, החזיק מטבעו בידע לנצל אותם. 3

1.2 ארכיטקטורת הפגיעות

כדי להבין מדוע "ההיפוך" הזה היה חלק כל כך, יש לבחון את הארכיטקטורה הבסיסית של מודלים כמו MegaSyn. המודל השתמש בארכיטקטורת רשת עצבית חוזרת (RNN) שאומנה על מחרוזות SMILES (Simplified Molecular Input Line Entry System). המערכת פעלה לפי אלגוריתם "טיפוס גבעה", וזיככה באופן איטרטיבי מועמדים מולקולריים כדי למקסם פונקציית מטרה ספציפית. 5

מחזור היצירה כולל שלושה רכיבים קריטיים:

1.​ המחולל: רשת מבוססת LSTM שמנבאת את האסימון הבא במחרוזת SMILES (למשל, 'C', 'N', '=', 'O') כדי ליצור מבנים תקפים כימית. היא לומדת את "דקדוק" הכימיה ממערכי נתונים עצומים כמו ChEMBL 28. 5

2.​ המנבא: מודל מבחין (או קבוצת מודלים) שמעריך תכונות ספציפיות של המולקולה שנוצרה, כגון מסיסות, ביו-אקטיביות מול מטרה, ו רעילות (למשל, LD50, עיכוב hERG).

3.​ המייעל: לולאת למידת חיזוק או טיפוס-גבעה שמזרימה את ציון המנבא בחזרה למחולל, ומנווטת את התפלגות ההסתברות של אסימונים עתידיים לעבר אזורים בעלי ציון גבוה יותר.

במצב הטיפולי, פונקציית התגמול של המייעל (RR) מוגדרת כ:

R(x)=Bioactivity(x)λToxicity(x)R(x) = \text{Bioactivity}(x) - \lambda \cdot \text{Toxicity}(x)

כאשר λ\lambda הוא גורם משקל המעניש תוצאות רעילות. במצב האדוורסרי ה"הפוך", החוקרים פשוט שללו את העונש:

R(x)=Bioactivity(x)+λToxicity(x)R(x) = \text{Bioactivity}(x) + \lambda \cdot \text{Toxicity}(x) המחולל עצמו—מנוע היצירה—נותר ללא נגיעה. הוא רק עקב אחר הגרדיאנט של פונקציית התגמול החדשה. זה מדגים שיכולת לייצר נשק אינה "באג" או מודול נפרד שניתן להסיר; היא אינהרנטית להבנת המודל את המרחב הכימי. אם מודל מבין מה הופך מולקולה לבטוחה, הוא לפי הגדרה מבין מה הופך אותה לבלתי בטוחה, שכן אלה אזורים משלימים של אותה יריעה רב-ממדית. 9

1.3 הסיכון האוניברסלי: מעבר לכימיה

בעוד שניסוי Urbina התמקד בנשק כימי, העיקרון חל באופן אוניברסלי על בינה מלאכותית יוצרת בסביבות ארגוניות. הדואליות של "אופטימיזציה" פירושה שכל מערכת שנועדה למקסם מדד יכולה להיות הפוכה כדי למזער אותו, או כדי למקסם מתאם מזיק.

●​ אבטחת סייבר: מודל שאומן לזהות ולתקן פגיעויות יום-אפס (קידוד הגנתי) חייב להבין את מכניקת הניצול. בהיפוך, הוא הופך ל מנוע אוטומטי לגילוי יום-אפס ולנשק. 10

●​ מערכות פיננסיות: מודל שאופטימז לזהות הונאה באמצעות למידת דפוסי עסקאות אסורות יכול להיות הפוך כדי לייצר עסקאות המחקות באופן מושלם התנהגות לגיטימית, ובכך "למטב" הלבנת הון. 11

●​ תכנון אסטרטגי: בינה מלאכותית שתוכננה למטב אסטרטגיית שוק לתאגיד יכולה, אם היא מיושרת עם פונקציית מטרה חסרת רחמים, להציע אסטרטגיות שממקסמות טכנית ערך לבעלי מניות אך מפרות דיני הגבלים עסקיים או תקנים אתיים.

הצו הנשיאותי על הפיתוח והשימוש הבטוחים, המאובטחים והראויים לאמון בבינה מלאכותית מדגיש בדיוק יכולת זו—הורדת חסם הכניסה לפיתוח איומים ביולוגיים, כימיים וסייבריים—כחשש ביטחון לאומי ראשי. 10 התגובות הנוכחיות ממגזר הטכנולוגיה כוללות לעיתים קרובות "מסנני בטיחות" או "אימון יישור," אך כפי ש נחקור, התערבויות שטחיות אלה שבירות מתמטית מול יכולות האופטימיזציה המבנית העמוקה של בינה מלאכותית מודרנית.

2. הכשל של עטיפת ה-LLM: מדוע מעקות בטיחות שטחיים נכשלים

המגמה השלטת ב"בהלת הזהב של הבינה המלאכותית" הנוכחית היא פריסת "עטיפת

ה-LLM"—יישום המשמש ממשק דק בין משתמש למודל יסוד (כגון GPT-4, Claude או Llama). עטיפות אלה משתמשות בהנדסת פרומפטים (פרומפטי מערכת) ובסינון תוכן בסיסי כדי לכוון את התנהגות המודל. ליישומים תעשייתיים בעלי סיכון גבוה, במיוחד כאלה הכרוכים בבטיחות פיזית ובביו-אבטחה, גישה זו אינה מספקת באופן מסוכן.

2.1 מגבלת ה"יועץ הלא-מגולם"

מודלי שפה גדולים (LLMs) הם ביסודם מנועים הסתברותיים לא-מגולמים. הם מנבאים את האסימון הבא על בסיס מתאמים סטטיסטיים בנתוני האימון שלהם, לא על הבנה מעוגנת של מציאות פיזיקלית או ביולוגית. כפי שמצוין במחקר על LLMs ב גילוי מדעי, LLM פועל כ"יועץ לא-מגולם" ולא כעוזר מחקר במעבדה. 13

בהקשר של ביו-אבטחה, לעטיפת LLM חסרות לולאות המשוב המשולבות הנדרשות כדי לאמת בטיחות. היא פועלת על שפה, לא על חוקי הפיזיקה או הכימיה. כאשר עטיפה מתבקשת לתכנן מולקולה, היא עלולה "להזות" מבנים שנשמעים סבירים אך אינם תקפים כימית. מסוכן יותר, אם היא does מייצרת מבנה תקף, חסרה לה היכולת האינהרנטית לאמת את רעילותו מעבר לחיפושים פשוטים במאגר. אם מולקולה חדשה—כפי שהיו אלפי האנלוגים של VX שנוצרו בניסוי MegaSyn—ל-LLM אין התייחסות מבוססת-טקסט כדי לסמן אותה כמסוכנת. 13

ה"ידע" של LLM הוא סטטי, קפוא בזמן האימון. הוא אינו יכול להריץ סימולציה כדי לקבוע אם קיפול חלבון חדש הוא פתוגני. הוא יכול רק להיזכר ש"גחלת זה רע." הסתמכות זו על שינון בעל-פה של מושגים "רעים" היא פגם קטלני כשמדובר במערכות יוצרות שנועדו לחקור מרחבים מושגיים new.

2.2 השבריריות של סינון לאחר מעשה

רוב פתרונות הבינה המלאכותית הארגוניים נשענים על "מעקות בטיחות" הפועלים כמסננים לאחר מעשה. אלה מערכות מיירטות את פרומפט המשתמש (סינון קלט) או את תגובת המודל (סינון פלט) ובודקות אותן מול רשימת מונחים אסורים, ביטויים רגולריים (Regex), או מודל סיווג משני (למשל, OpenAI's Moderation Endpoint). 15

טבלה 2: מגבלות סינון לאחר מעשה בתחומים בעלי סיכון גבוה

סוג מגבלה תיאור השלכה ב
ביו-אבטחה
עיוורון הקשרי מסננים מחפשים מילות מפתח
ספציפיות (למשל, "VX",
"Sarin", "Bomb").
נכשל בחסימת תרכובות
חדשות או קודמנים
שחסרים להם שמות נפוצים
Col1 Col2 (למשל, "Compound X-293").
הסתרת SMILES רעילות מקודדת ב
מבנה, לא בשם.
מסנן חוסם את המילה
"Sarin" אך מעביר את
מחרוזת ה-SMILES O=P(C)(F)O,
שהמודל
מבין כ-Sarin.
צוקי פעילות שינויים מבניים קלים
גורמים למעברי רעילות
עצומים.
עטיפה רואה מולקולה
הדומה ב-99% לתרופה בטוחה
ומאשרת אותה, ומחמיצה
את האטום הבודד ש
מעניק קטלניות.17
אופי תגובתי חוסם content_afer_
יצירה.
המודל כבר
ביצע את
החישוב. במערכת בזמן
אמת, השהיה מאפשרת
דליפה פוטנציאלית או
התקפות ערוץ-צד.

בעיית "צוק הפעילות" חמורה במיוחד עבור עטיפות מבוססות-טקסט. בכימיה רפואית, צוק פעילות מתרחש כאשר שינוי קטן מאוד במבנה מוביל ל שינוי גדול באופן לא-פרופורציונלי בתכונה ביולוגית. 18 עטיפה המשתמשת במסנן מבוסס- דמיון עשויה לאשר מולקולה משום שהיא נראית "בעיקר כמו" אספירין או מעכב קינאז בטוח, בלי להכיר בכך שהחלפת קבוצת הידרוקסיל באטום פלואור שינתה באופן רדיקלי את פרופיל הרעילות שלה. מודלים מבוססי-טקסט, הפועלים על מרחק אסימונים סמנטי ולא על יריעות ביו-אקטיביות תלת-ממדיות, גרועים לשמצה בחיזוי צוקים אלה. 14

2.3 פגיעות אדוורסרית: התקפת ה-"SMILES"

הראיה המשכנעת ביותר נגד גישת העטיפה היא שכיחות ה"פריצה מהכלא"—התקפות אדוורסריות שנועדו לעקוף אימון בטיחות. בעוד ש"צוות אדום" מתמקד לעיתים קרובות בהנדסה חברתית (למשל, "מתכון הנפלם של סבתא"), הסיכונים הטכניים ב ביו-אבטחה מתוחכמים הרבה יותר.

התקפת SMILES-Prompting: מחקר עדכני הדגים טכניקת פריצה מהכלא חדשה הידועה כ-"SMILES-prompting." תוקפים עוקפים מסנני בטיחות על ידי הזנת ייצוג מחרוזת ה-ASCII (SMILES) של מולקולה אסורה במקום שמה. מסנני תוכן שאומנו על שפה טבעית נכשלים לעיתים קרובות ב זיהוי הסמנטיקה הרעילה המוסתרת בתוך התחביר הכימי.20

●​ מנגנון: התוקף מבקש הוראות סינתזה עבור [O-]S(=O)(=O)[O-].. (Thallium Sulfate, רעל עכברים) במקום לבקש "רעל."

●​ תוצאה: ה-LLM, שמזהה את התחביר הכימי אך אינו מפעיל את מסנן מילות המפתח של "תוכן מזיק", מספק באדיבות את פרוטוקול הסינתזה.

●​ קנה מידה: מחקרים מראים ששיטה זו יכולה לעקוף מנגנוני בטיחות במודלים מובילים כמו GPT-4 ו-Claude 3 בשיעורי הצלחה מדאיגים, שלעיתים עולים על 90% עבור חומרים ספציפיים. 11

יתר על כן, מסגרות התקפה אוטומטיות כמו ToxicTrap משתמשות באלגוריתמים אבולוציוניים כדי למצוא הפרעות קטנות ברמת מילה שמרמות מסווגי רעילות לסמן טקסט רעיל כ שפיר. 22 אם ניתן להביס מערכת בטיחות באמצעות מילה נרדפת, זו אינה מערכת בטיחות—זו בלימת מהירות.

עבור חברת ייעוץ ארגונית כמו Veriprajna, בניית פתרון על גבי עטיפה שקל לזייף היא התחייבות. אבטחה אמיתית בדרגה ארגונית דורשת הנדסה מחדש יסודית של האופן שבו המודל מנווט במרחב הלטנטי שלו.

3. גיאומטריית הרעילות: הבנת סיכונים לטנטיים

כדי להבין מדוע עטיפות נכשלות וכיצד Veriprajna מצליחה, יש להבין את הסביבה המתמטית שבה פועלים מודלים יוצרים: המרחב הלטנטי . מודלים יוצרים עמוקים (VAEs, GANs, מודלי דיפוזיה) אינם מאחסנים נתונים; הם לומדים למפות נתונים רב-ממדיים (כמו מבנים מולקולריים) לייצוג דחוס מממד נמוך יותר הנקרא מרחב לטנטי (ZZ). במרחב זה, נקודות נתונים דומות מקובצות יחד, והיצירה היא פעולת הדגימה מיריעה זו.

3.1 יריעת הרעילות הרציפה

"נוף הרעילות" הוא אזור בתוך מרחב לטנטי זה. זו אינה רשימה בדידה של מולקולות רעות, אלא יריעה רציפה—צורה המוגדרת על ידי התכונות הפיזיקוכימיות שמקנות קטלניות.

●​ סיכון רציף: רעילות אינה בינארית; היא גרדיאנט. המעבר מתרופה טיפולית לסוכן רעיל יכול להיות מסלול חלק במרחב לטנטי. מודל למעשה "מבצע אינטרפולציה" בין מולקולות ידועות. אם הוא מבצע אינטרפולציה בין שתי מולקולות בטוחות הכולאות אזור רעיל, המסלול עלול לחצות את "עמק המוות". 23

●​ הנחת היריעה: הנחת הליבה של למידה עמוקה היא שנתוני העולם האמיתי שוכנים על יריעה מממד נמוך יותר המשובצת במרחב רב-ממדי. התקפות אדוורסריות מנצלות לעיתים קרובות את האזורים off יריעה זו, או "חורים" בהתפלגות שבהם התנהגות המודל אינה מוגדרת ובלתי צפויה. 25

כאשר חוקרי Collaborations Pharmaceuticals "הפכו את המתג," הם למעשה אמרו למודל לבצע עליית גרדיאנט לאורך "וקטור הרעילות" במרחב לטנטי זה. משום שהמרחב רציף, המודל יכול היה בקלות לגלוש מתרכובות בטוחות אל אזור הרעילות הגבוהה.

3.2 בעיית השזירה

באופן אידיאלי, מודל יוצר היה מפריד "רעילות" מ"ביו-אקטיביות" לצירים אורתוגונליים נפרדים במרחב הלטנטי. אילו זה היה נכון, בטיחות הייתה פשוטה כמו נעילת ציר ה"רעילות" לאפס. עם זאת, במודלים ביולוגיים עמוקים, תכונות אלה שזורות .

תכונה פיזיקוכימית המאפשרת לתרופה לחדור את מחסום הדם-מוח (תכונה רצויה מאוד לטיפול באלצהיימר או בפרקינסון) היא לעיתים קרובות אותה תכונה בדיוק ש מאפשרת לגז עצבים להגיע למטרתו ולגרום לשיתוק. 1 באופן דומה, זיקה גבוהה—היכולת להידבק בחוזקה לחלבון—טובה לתרופה אך קטלנית אם החלבון הוא אצטילכולין-אסטראז (המטרה של VX).

בשל שזירה זו, מנגנוני "סירוב" פשוטים (כמו אלה שבעטיפות) למעשה מכריתים את המודל. אם חוסמים את כל התכונות הקשורות לרעילות (למשל, "חסום כל חדירה של מחסום הדם-מוח"), הורסים את התועלת הטיפולית של המודל. האתגר הוא לנווט ביריעת ההפעלה הבטוחה —תת-קבוצה של המרחב הלטנטי שבה היעילות נשמרת אך הרעילות מודרת טופולוגית.

3.3 קריסת ייצוג וצוקי פעילות

אחד הכשלים הקריטיים של מודלי "קופסה שחורה" סטנדרטיים הוא קריסת ייצוג . זה מתרחש כאשר המודל ממפה שתי מולקולות נבדלות לאותן נקודות או לנקודות כמעט זהות ב מרחב לטנטי משום שהוא נכשל בלכידת ההבדל המבני העדין שמבחין ביניהן.

●​ מגבלות מבוססות-גרף: מודלים מולקולריים רבים משתמשים ברשתות עצביות גרפיות (GNNs). אף שהן חזקות, GNNs עלולות להתקשות להבחין בין סטריאואיזומרים או החלפות אטומיות קלות אם עומק העברת ההודעות אינו מספיק. זה מוביל לקריסת ייצוג, שבה רעלן ותרופה בטוחה חולקים את אותו שיכון לטנטי. 17

●​ התוצאה: אם המודל אינו יכול להבחין בין הנקודה ה"בטוחה" לנקודה ה"רעילה" בגיאומטריה הפנימית שלו, שום כמות של סינון חיצוני לא תציל אותו. המודל מאמין שהן זהות.

●​ פתרונות מבוססי-תמונה: מחקר מתהווה, כגון מסגרת MaskMol, מציע שייצוגים מבוססי-תמונה (למידה מתמונות מולקולריות) או גישות רב- מודליות עשויים ללכוד טוב יותר הבחנות עדינות אלה, ולשמר את ה"צוקים" בנוף הלטנטי. 17

גישת Veriprajna משתמשת במודלים יוצרים מודעי-טופולוגיה שממפים את ה_functional_ טופולוגיה (פעילות) ולא רק את הטופולוגיה ה_structural_ (תחביר). זה מבטיח שצוקי פעילות מכובדים כ"גבולות קשים" בתהליך היצירה הבטוחה, ומונעים מה מודל לגלוש מעבר לצוק אל הרעילות. 26

4. מתודולוגיית Veriprajna: פיקוח על מרחב לטנטי

Veriprajna מבדילה את עצמה בכך שהיא עוברת מעבר לפרדיגמת ה"עטיפה" כדי ליישם פיקוח על מרחב לטנטי . זה כרוך בהתערבות בתהליך היצירה before שהנתונים מפוענחים, תוך החלת אילוצים מבניים שהופכים יצירת תוכן רעיל לבלתי אפשרית מתמטית (או זניחה סטטיסטית) ולא רק "מסוננת החוצה."

4.1 אילוצים מבניים: המגן המתמטי

סינון לאחר מעשה הוא תגובתי: המודל מייצר מועמד, ושופט דוחה אותו. יצירה מרוסנת היא פרואקטיבית: מונעים מהמודל לשקול מועמדים בלתי בטוחים.

טבלה 3: השוואת פרדיגמות בטיחות

תכונה סינון לאחר מעשה
(עטיפה)
אילוצים מבניים/לטנטיים
(Veriprajna)
מנגנון ייצר \rightarrow
סקור \rightarrow
קבל/דחה
רסן דגימה לטנטית
\rightarrow ייצר
נקודת בקרה פלט (טקסט/פיקסל/SMILES) וקטור לטנטי (zz) /
גיאומטריית יריעה
עלות חישובית גבוהה (מחזורי יצירה מבוזבזים
על פלטים שנדחו)
נמוכה (אילוצים מוחלים
במהלך דגימה/הסקה)
עמידות נמוכה (פגיעה ל
פריצות מהכלא/הסתרה)
גבוהה (האילוצים
אינהרנטיים למתמטיקה)
טיפול בחידוש נכשל (לא יכול לסנן מה שהוא
אינו יודע)
הצלחה (מרסן על בסיס
יריעות תכונות)
ציות נתיב ביקורת של דחיות
(רועש)
הוכחה מתמטית של
התנהגות חסומה

4.2 למידה לאחר מעשה של אילוצים לטנטיים

Veriprajna נוקטת טכניקות ללמידת אילוצים post-hoc על מודלים לא-מותנים מאומנים מראש. זה נמנע מהעלות האוסרת של אימון מחדש של מודלי יסוד עצומים תוך הבטחת בקרה עמידה.

זרימת העבודה:

1.​ אימון מקדים לא-מפוקח: אנו מתחילים במודל יוצר לא-מותנה חזק (VAE או GAN) שלומד את התפלגות המבנים הכימיים התקפים (p(x)p(x)). מודל זה לומד "כיצד לייצר מולקולות" אך לא "אילו מולקולות לייצר". 23

2.​ אימון פונקציית אילוץ: אנו מאמנים "פונקציית ערך" נפרדת (v(z)v(z)) או "פונקציית אילוץ" (c(z)c(z)) הפועלת ישירות על המרחב הלטנטי. פונקציה זו ממפה וקטור לטנטי zz לציון בטיחות.

○​ פונקציה זו מאומנת על נתונים מתויגים (רעיל מול בטוח) כדי לזהות את "האזורים" של מרחב לטנטי המתאימים לרעילות גבוהה.

○​ באופן מכריע, בניגוד לניסוי MegaSyn ש_optimized_ לאזור זה, אנו מגדירים אזור זה כאזור אסור (או יריעה שלילית).

3.​ דגימה מרוסנת (היגוי גרדיאנט): בשלב היצירה, אנו משתמשים ב אופטימיזציה מבוססת-גרדיאנט (כגון דינמיקת Langevin) כדי להזיז את התפלגות הדגימה.

○​ אם וקטור שנדגם zz נופל לתוך אזור רעיל או לידו, הגרדיאנט של פונקציית האילוץ c(z)\nabla c(z) דוחף את הווקטור בחזרה אל היריעה הבטוחה before שהוא מפוענח למולקולה.

○​ זה אנלוגי מתמטית ל"היגוי" היצירה הרחק מקצה הצוק. המודל "מדמיין" מולקולה רעילה אך נאלץ ליישב אותה לאנלוג בטוח. 23

4.3 ניתוח נתונים טופולוגי (TDA) והגנת יריעה

כדי לטפל בסיכון של רעלנים חדשים השוכנים מחוץ להתפלגות האימון (מחוץ-להתפלגות או OOD), Veriprajna משתמשת בניתוח נתונים טופולוגי (TDA).

●​ דיאגרמות התמדה: אנו מחשבים את דיאגרמות ההתמדה של נתוני האימון ה"בטוחים". טכניקה מתמטית זו מנתחת את צורת ענן הנתונים (החורים, הלולאות, והחללים שלו) בקני מידה שונים. היא נותנת לנו טביעת אצבע טופולוגית של איך "בטיחות" נראית. 26

●​ מרחק יריעה: כאשר המודל מציע וקטור zz, אנו מחשבים את מרחקו מיריעת הנתונים הבטוחים באמצעות פירוק מונע-יריעה.

●​ זיהוי החלל: אם וקטור שוכן רחוק מדי מהיריעה—צף ב"חלל" של המרחב הלטנטי—הוא מסומן כסיכון גבוה, גם אם מנבאי רעילות ספציפיים אינם ודאיים. התקפות אדוורסריות מנסות לעיתים קרובות להסתיר רעלנים באזורים דלילים אלה (ה"חורים" ב ידע המודל). TDA מאפשר לנו לזהות ולדחות חריגות אלה על בסיס גיאומטריה, לא רק הסתברות. 25

4.4 למידת חיזוק מרוסנת (CRL) עם תמריצים

אדפטיביים

עבור מודלים הדורשים אופטימיזציה (למשל, מקסום עוצמת תרופה), אנו משתמשים בלמידת חיזוק מרוסנת (CRL) ולא במקסום תגמול פשוט.

●​ RL סטנדרטי: מקסם תגמול RR. (סיכון: תרחיש ה"מתג ההפוך" שבו RR הופך לרעילות).

●​ ה-CRL של Veriprajna: מקסם תגמול RR בכפוף לעלות C<LimitC < Limit.

●​ מנגנון תמריץ אדפטיבי: למידת חיזוק מרוסנת מסורתית יכולה להיות לא יציבה, ולהתנודד סביב גבול האילוץ. Veriprajna מיישמת מנגנון תמריץ אדפטיבי שמתגמל את הסוכן על שהייה well within הגבולות, לא רק על אי- חצייתם.

○​ אנו מציגים "אזור חיץ" במרחב הלטנטי. ככל שהמודל מתקרב ל אילוץ הרעילות, עונש גובר (פונקציית מחסום) דוחף אותו בחזרה, ומבטיח התכנסות חלקה ויציבה לפתרונות בטוחים. 29

5. העמקה טכנית: טיפול בפגיעות "MegaSyn"

כדי לאבטח באמת כימיה יוצרת, עלינו לנתח את הפגיעויות הארכיטקטוניות הספציפיות שנחשפו בניסוי MegaSyn ולטפל בהן באמצעות מעקות הבטיחות המבניים המוצעים שלנו.

5.1 פירוק MegaSyn

מודל ה-MegaSyn המוזכר במאמר Nature Machine Intelligence משתמש בגישת אנסמבל ספציפית 5 :

●​ מחולל ליבה: רשת עצבית חוזרת (RNN) מבוססת LSTM.

●​ ייצוג קלט: מחרוזות SMILES מפוצלות לתווים (למשל, "C", "N", "=", "1").

●​ שיטת אימון: "Teacher Forcing," שבה המודל מוזן באסימון הקודם הנכון במהלך האימון כדי להאיץ התכנסות.

●​ הכנה מוקדמת: המודל יוצר "מודלים מוכנים" באמצעות כוונון עדין על תת-מבנים ספציפיים של מולקולת יעד תוך שימוש בכללי RECAP.

●​ פגיעות האופטימיזציה: אלגוריתם "טיפוס הגבעה" הוא שיטת אופטימיזציה חמדנית. כאשר פונקציית הניקוד הופכה ל-Score = Toxicity, המודל טיפס ביעילות על הגרדיאנט לעבר קטלניות מרבית משום ש"תחביר" של גז עצבים (קשרי זרחן-חמצן, שרשראות צד אלקיליות ספציפיות) תקף כימית והיה נוכח בנתוני האימון (ChEMBL), גם אם לא תויג כ"נשק."

5.2 מניעת ה"היפוך": פרוטוקול Veriprajna

כיצד פיקוח על מרחב לטנטי של Veriprajna היה מונע היפוך בסגנון MegaSyn?

1.​ אילוצים מקודדים-קשיח: במקום פונקציית תגמול ניתנת לשינוי שמשתמש יכול פשוט להפוך (1-1 ל +1+1), Veriprajna משבצת את אילוץ הרעילות בדגימת הפוסטריור . האילוץ אינו מספר בסקריפט Python; הוא תנאי גבול ב מנוע ההסקה. כדי "להפוך" אותו, יהיה צורך להנדס מחדש ביסודו את התוכנה, לא רק לשנות קובץ תצורה.

2.​ הגבלת יריעה: "יריעת CWA" (מרחב סוכני לוחמה כימית) תמופה באמצעות TDA. אזור זה ייועד כ"מרחב אפס." כל עדכון גרדיאנט שמנסה להזיז את הווקטור הלטנטי אל מרחב זה יאופס או יוחזר לאחור.

3.​ זיהוי צוק פעילות: המודל שלנו ישתמש בייצוגים מבוססי-תמונה (כמו MaskMol) לצד ייצוגי גרף כדי לזהות את המוטיבים המבניים העדינים של גזי עצבים (למשל, הקשר P-F ב-Sarin/Soman) שעלולים להיות מוחמצים על ידי מודלים פשוטים מבוססי-מתארים. מוטיבים אלה יפעילו "עונש צוק" שדורס את תגמול טיפוס הגבעה. 17

6. נוף רגולטורי וציות

המעבר מ"עטיפה" ל"מעקות בטיחות מבניים" אינו רק שדרוג טכני; זו הכרח אסטרטגי המונע על ידי סביבה רגולטורית המתהדקת במהירות. ממשלות ו גופים בינלאומיים עוברים מ"הנחיות וולונטריות" למסגרות ציות מחמירות הדורשות הסבריות, בקרה ובטיחות מוכחת.

6.1 הצו הנשיאותי של הבית הלבן ומשימת Genesis

הצו הנשיאותי על הפיתוח והשימוש הבטוחים, המאובטחים והראויים לאמון בבינה מלאכותית (אוקטובר 2023) ו"משימת Genesis" העוקבת (נובמבר 2025) מייצגים תפנית סייסמית במדיניות הבינה המלאכותית הפדרלית. 10

●​ המנדט: הצו מזהה במפורש את הסיכון שבינה מלאכותית מורידה חסמים לפיתוח נשק CBRN (כימי, ביולוגי, רדיולוגי, גרעיני) כאיום ביטחון לאומי ברמה 1.

●​ משימת Genesis: יוזמה חדשה זו מורה למחלקת האנרגיה (DOE) לבנות פלטפורמת בינה מלאכותית משולבת לגילוי מדעי. באופן מכריע, היא מחייבת "אמצעי סייבר מבוססי-סיכון הולמים" וסביבות מאובטחות לניסויים מונחי- בינה מלאכותית. 32

●​ פער הציות: עטיפת LLM סטנדרטית אינה יכולה להוכיח שהיא מונעת את creation של איומים ביולוגיים; היא יכולה רק להראות שהיא tries לסנן אותם. גישת "המאמץ המיטבי" הזו ככל הנראה תיכשל לעמוד בתקני "מאובטח וראוי לאמון" הנדרשים ל חוזים פדרליים או לשילוב עם פלטפורמת Genesis.

●​ היתרון של Veriprajna: האילוצים המבניים שלנו מספקים הוכחת אי-אפשרות (בתוך גבולות סטטיסטיים). אנו יכולים להדגים לרגולטורים ש"יריעת CBRN" אינה נגישה למודלים שלנו, בהתאמה מושלמת לדרישת הצו לבדיקות בטיחות מחמירות ול"צוות אדום". 33

6.2 מסגרת ניהול סיכוני בינה מלאכותית של NIST (AI RMF 1.0)

NIST AI RMF הוא תקן הזהב לפיקוח אזרחי אמריקאי על בינה מלאכותית. הוא מדגיש ארבע פונקציות: מפה, מדוד, נהל, ופקח . 34

●​ פרופיל בינה מלאכותית יוצרת (NIST.AI.600-1): פרופיל ספציפי זה מזהה "מידע CBRN" כסיכון ייחודי המוחמר על ידי GenAI. 36 הוא מזהיר ש"כלי תכנון כימי ו ביולוגי (BDTs)" עשויים לחזות מבנים חדשים שאינם בנתוני האימון.

●​ יישור Veriprajna:

○​ Measure: השימוש שלנו בניתוח נתונים טופולוגי (TDA) מספק מדדים כמותיים לאי-ודאות אפיסטמית —מדידה כמה "רחוק" פלט שנוצר מנתונים בטוחים ידועים. זה מספק את דרישת NIST למדידה מחמירה של אמינות המערכת.

○​ Manage: אילוצים לטנטיים מספקים מנגנון טכני לניהול סיכון ש עדיף על ניסיונות מבוססי-מדיניות. אנו עוברים מ"מדיניות כתיעוד" ל "מדיניות כקוד" (או ליתר דיוק, "מדיניות כגיאומטריה").

6.3 ISO/IEC 42001:2023

ISO 42001 הוא תקן מערכת הניהול הבינלאומי הראשון בעולם לבינה מלאכותית, המספק מסגרת בת-הסמכה לפיקוח על בינה מלאכותית. 38

●​ דרישת ליבה: התקן מחייב "שימוש בטוח ואתי" ו"עמידות וחוסן" מול התקפות אדוורסריות. הוא דורש מארגונים לבצע הערכות השפעת בינה מלאכותית וליישם בקרות למיגור סיכונים שזוהו.

●​ עמידות אדוורסרית: ISO 42001 מדגיש במיוחד את הצורך להגן מפני קלטים שנועדו לתמרן התנהגות מודל (כמו SMILES prompting). של Veriprajna הגנת היריעה מטפלת בכך במפורש על ידי דחיית קלטים שתוצאתם וקטורים לטנטיים מחוץ ליריעת הנתונים התקפה, ומנטרלת ניסיונות "פריצה מהכלא" הנשענים על פרומפטים מחוץ-להתפלגות. 40

●​ הסמכה: הגישה המובנית של Veriprajna מאפשרת נתיבי ביקורת ברורים. אנו יכולים לרשום לא רק את הפלטים, אלא את constraint violations שניסה המודל במהלך תהליך היצירה, ולספק למבקרים נתונים גרעיניים על ביצועי הבטיחות של המערכת. 41

7. אסטרטגיית יישום: פרוטוקול "הפתרון העמוק"

Veriprajna ממקמת את עצמה לא כספקית צ'אטבוטים, אלא כאדריכלית של תשתית בינה מלאכותית בטוחה וספציפית-לתחום. אסטרטגיית היישום שלנו ללקוחות עוקבת אחר פרוטוקול "פתרון עמוק" בן ארבעה שלבים שנועד להפוך את הבינה המלאכותית שלהם מעטיפה מסוכנת ל מנוע גילוי מפוקח.

שלב 1: מיפוי יריעה וביקורת טופולוגית

לפני פריסת כל מודל יוצר, אנו מבצעים ביקורת טופולוגית של הנתונים הקנייניים של הלקוח ונתונים ציבוריים רלוונטיים (למשל, ChEMBL, Tox21).

●​ מטרה: להגדיר את "יריעת ההפעלה הבטוחה."

●​ טכניקה: שימוש בהומולוגיה מתמידה לזיהוי התכונות הטופולוגיות (לולאות, חללים) של אזורים בטוחים מול רעילים.

●​ תוצר: "מפת טופולוגיית בטיחות" שממחישה את גבולות המרחב הלטנטי ו מזהה "חורים" פוטנציאליים שבהם המודל עלול להזות או להיות מותקף.

שלב 2: אימון אילוץ לטנטי (ה"מבקרים")

איננו מבצעים פשוט כוונון עדין של מודל הבסיס (המסתכן בשכחה קטסטרופלית). במקום זאת, אנו מאמנים רשתות עזר קלות משקל הנקראות מבקרי אילוץ .

●​ טכניקה: למידה לאחר מעשה של פונקציות ערך (v(z)v(z)) שמנבאות ציוני סיכון מ שיכונים לטנטיים. 23

●​ ארכיטקטורה: מבקרים אלה מנותקים מהמחולל. זה יתרון ארכיטקטוני מכריע: ככל שמזוהים איומים חדשים (למשל, מחלקה חדשה של נשק כימי), אנו יכולים לעדכן את המבקר בלי לאמן מחדש את מודל היסוד העצום, ולהבטיח זריזות ואבטחה מעודכנת.

שלב 3: דגימה מרוסנת ושילוב היגוי

אנו משלבים את מבקרי האילוץ ישירות בצינור ההסקה של הלקוח.

●​ מנגנון: במהלך היצירה, אנו משתמשים בדינמיקת Langevin או בהיגוי גרדיאנט .

●​ תהליך: כשהמודל דוגם את המרחב הלטנטי כדי לייצר מולקולה, המבקר מחשב את הגרדיאנט של משטח הרעילות. אם המסלול פונה לעבר אזור רעיל, מנגנון ההיגוי מפעיל גרדיאנט מנוגד, ו"דוחף" את המסלול בחזרה ליריעה הבטוחה.

●​ תוצאה: המודל למעשה "חושב" על מולקולה רעילה אך נאלץ מתמטית "ליישב" את המחשבה לאנלוג בטוח לפני שנוצר כל פלט.

שלב 4: צוות אדום מולקולרי ותמיכה בהסמכת ISO

אנו חושפים את המערכת הפרוסה ל"צוות אדום מולקולרי."

●​ שיטה: אנו משתמשים בסוכנים אדוורסריים אוטומטיים (כמו ToxicTrap ובוטים מותאמים של SMILES-prompting) כדי להפגיז את המודל בקלטי קצה, בניסיון לאלץ אותו לחצות את צוקי הפעילות. 21

●​ אימות: אנו מספקים תעודת בטיחות המבוססת על ההסתברות הסטטיסטית של הפרת אילוץ (למשל, "Probability of toxic generation < $10^{-6}$"), המספקת את הבסיס הראייתי להסמכת ISO 42001.

8. סיכום: עתיד החדשנות הבטוחה

ניסוי ה"מתג ההפוך" של Collaborations Pharmaceuticals לא היה חריגה; הוא היה הדגמה של התנודתיות היסודית של אופטימיזציה בלתי מרוסנת בבינה מלאכותית. ב מרוץ לפרוס בינה מלאכותית ארגונית, ארגונים רבים בונים טירות על חול—ונשענים על עטיפות שבירות שמתפוררות תחת לחץ אדוורסרי או הקשרים חדשים.

עבור תעשיית התרופות, ואכן כל מגזר המתמודד עם מציאויות פיזיות או פיננסיות בעלות סיכון גבוה, עידן ה"עטיפה" חייב להסתיים. לא ניתן להדביק בטיחות על הפלט; היא חייבת להיות אפויה בגיאומטריה של המודל עצמו.

Veriprajna מציעה את הנתיב היחיד הקביל קדימה: פתרונות בינה מלאכותית עמוקה . בשליטה במרחב הלטנטי, איננו רק מסננים את החושך; אנו מבנים מחדש את היקום המתמטי של המודל כדי להבטיח שאור הגילוי הוא הנתיב היחיד שהוא יכול לנקוט. אנו מספקים את מעקות הבטיחות המאפשרים לחדשנות ארגונית להאיץ בלי סיכון של כשל שימוש כפול קטסטרופלי.

זו אינה רק בינה מלאכותית בטוחה. זו אינטליגנציה מובטחת מבנית .

נספח א: ניסוח מתמטי של אילוצים לטנטיים

כדי לספק בסיס מחמיר ל"פיקוח על מרחב לטנטי" שלנו, אנו מפרטים את הניסוח המתמטי של האילוצים המוחלים במהלך תהליך היצירה.

א.1 בעיית האופטימיזציה המרוסנת

אנו מנסחים את תהליך היצירה לא כדגימה פשוטה zp(z)z \sim p(z), אלא כ בעיית אופטימיזציה מרוסנת. יהי G(z)G(z) המחולל הממפה וקטור לטנטי zz למרחב נתונים XX. יהי C(x)C(x) פונקציית עלות (למשל, מנבא רעילות). אנו מבקשים לדגום zz כך ש:

minzLgen(z)s.t.C(G(z))<ϵ\min_z \mathcal{L}_{gen}(z) \quad \text{s.t.} \quad C(G(z)) < \epsilon

כאשר ϵ\epsilon הוא סף הבטיחות.

א.2 פונקציות ערך לאחר מעשה

מכיוון שהערכת C(G(z))C(G(z)) (יצירת המולקולה והרצת מנבא) יקרה ואינה גזירה, אנו לומדים פונקציית ערך לטנטית V(z)V(z) שמקרבת את העלות ישירות במרחב לטנטי:

V(z)C(G(z))V(z) \approx C(G(z))

פונקציה זו מאומנת למזער את שגיאת ריבועי הממוצע על מערך נתונים של דגימות {(zi,yi)}\{(z_i, y_i)\}שנוצרו, כאשר yiy_i היא רעילות האמת היסודית.

א.3 היגוי גרדיאנט (דינמיקת Langevin)

במהלך הסקה, אנו דוגמים z0z_0 התחלתי מהפריור p(z)p(z). לאחר מכן אנו מעדכנים באופן איטרטיבי zz באמצעות הגרדיאנט של פונקציית הערך כדי להזיז אותו אל האזור הבטוח:

zt+1=ztαzV(zt)+2αξtz_{t+1} = z_t - \alpha \nabla_z V(z_t) + \sqrt{2\alpha} \xi_t

כאשר:

●​ α\alpha הוא גודל הצעד (קצב הלמידה).

●​ zV(zt)\nabla_z V(z_t) הוא הגרדיאנט של פונקציית ערך הרעילות (היגוי הרחק מ רעילות).

●​ ξtN(0,I)\xi_t \sim \mathcal{N}(0, I) הוא רעש גאוסי שנוסף לשמירת גיוון (Langevin רעש). 23

תהליך זה מבטיח שהנדגם הסופי zz שוכן בתוך היריעה הבטוחה המוגדרת על ידי $V(z) < \epsilon$ before המחולל G(z)G(z) נקרא אי פעם כדי לייצר את המולקולה הסופית.

נספח ב: ניתוח מפורט של מסגרות רגולטוריות

ב.1 NIST AI RMF 1.0 ופרופיל GenAI

סעיף רלוונטי: NIST.AI.600-1 (פרופיל בינה מלאכותית יוצרת)

●​ סיכון 2.1: מידע או יכולות CBRN. "חסמי כניסה מופחתים... גישה ל מידע זדוני מהותית... כלי תכנון (BDTs) עשויים לחזות מבנים חדשים."

●​ פעולת Veriprajna: אנו מטפלים במפורש בסיכון ה"מבנה החדש" באמצעות TDA. בהגדרת בטיחות באופן טופולוגי, איננו נשענים על רשימת "רעים ידועים" (שנכשלת עבור מבנים חדשים) אלא על "צורת הטובים הידועים."

ב.2 ISO/IEC 42001:2023

סעיף רלוונטי: A.9.2 (בטיחות מערכת בינה מלאכותית)

●​ דרישה: "הארגון יישם בקרות כדי להבטיח שמערכות בינה מלאכותית יפעלו בבטחה... תוך התחשבות בצורך בתוכניות גיבוי."

●​ פעולת Veriprajna: מנגנון התמריץ האדפטיבי שלנו משמש כגיבוי. אם היגוי הגרדיאנט הראשי נכשל (למשל, הגרדיאנט נעלם), המערכת עוברת כברירת מחדל ל "מרכז כובד" בטוח במרחב הלטנטי במקום להוציא את הדגימה הגולמית.

סעיף רלוונטי: A.10.3 (התקפות אדוורסריות)

●​ דרישה: "הארגון יעריך את הפגיעות... להתקפות אדוורסריות."

●​ פעולת Veriprajna: אנו מספקים "דוח צוות אדום" כתוצר סטנדרטי, המכמת את עמידות המערכת להתקפות ToxicTrap ו-SMILES-prompting. 21

מקורות

  1. AI Can Create Deadly Weapons? Scientists Sound Alarm! | WION Podcast YouTube, נצפה ב־11 בדצמבר 2025, https://www.youtube.com/watch?v=oedheh87lnI

  2. Artificial intelligence finds 40,000 toxic molecules - Digitec, נצפה ב־11 בדצמבר 2025, https://www.digitec.ch/en/page/artificial-intelligence-finds-40000-toxic-molecules-23192

  3. Artificial intelligence could be repurposed to create new biochemical weapons | King's College London, נצפה ב־11 בדצמבר 2025, https://www.kcl.ac.uk/news/artificial-intelligence-could-be-repurposed-to-create-new-biochemical-weapons

  4. Meet the harmful side of AI, as lethal as chemical weapons - IndiaAI, נצפה ב־11 בדצמבר 2025, https://indiaai.gov.in/article/meet-the-harmful-side-of-ai-as-lethal-as-chemical-weapons

  5. (PDF) MegaSyn: Integrating Generative Molecular Design ..., נצפה ב־11 בדצמבר 2025, https://www.researchgate.net/publication/360904282_MegaSyn_Integrating_Generative_Molecular_Design_Automated_Analog_Designer_and_Synthetic_Viability_Prediction

  6. MegaSyn: Integrating Generative Molecular Design, Automated Analog Designer, and Synthetic Viability Prediction | ACS Omega - ACS Publications, נצפה ב־11 בדצמבר 2025, https://pubs.acs.org/doi/10.1021/acsomega.2c01404

  7. Well, I never: AI is very proficient at designing nerve agents | John Naughton | The Guardian, נצפה ב־11 בדצמבר 2025, https://www.theguardian.com/commentisfree/2023/feb/11/ai-drug-discover-nerve-agents-machine-learning-halicin

  8. MegaSyn: Integrating Generative Molecular Design, Automated Analog Designer, and Synthetic Viability Prediction - PMC - PubMed Central, נצפה ב־11 בדצמבר 2025, https://pmc.ncbi.nlm.nih.gov/articles/PMC9178760/

  9. Dual Use of Artificial Intelligence-powered Drug Discovery - PMC - NIH, נצפה ב־11 בדצמבר 2025, https://pmc.ncbi.nlm.nih.gov/articles/PMC9544280/

  10. Chemical & Biological Weapons and Artificial Intelligence: Problem Analysis and US Policy Recommendations, נצפה ב־11 בדצמבר 2025, https://futureoflife.org/document/chemical-biological-weapons-and-artificial-intelligence-problem-analysis-and-us-policy-recommendations/

  11. Involuntary Jailbreak - arXiv, נצפה ב־11 בדצמבר 2025, https://arxiv.org/html/2508.13246v1

  12. Mitigating Risks at the Intersection of Artificial Intelligence and Chemical and Biological Weapons | RAND, נצפה ב־11 בדצמבר 2025, https://www.rand.org/pubs/research_reports/RRA2990-1.html

  13. LLMs in Research: the Good, the Bad, and the Future | Enable Medicine, נצפה ב־11 בדצמבר 2025, https://www.enablemedicine.com/blog/llms-in-research-the-good-the-bad-and-the-future

  14. Are large language models right for scientific research? - CAS.org, נצפה ב־11 בדצמבר 2025, https://www.cas.org/resources/cas-insights/are-large-language-models-right-scientific-research

  15. How do you implement LLM guardrails to prevent toxic outputs? - Zilliz Vector Database, נצפה ב־11 בדצמבר 2025, https://zilliz.com/ai-faq/how-do-you-implement-llm-guardrails-to-prevent-toxic-outputs

  16. How do you implement LLM guardrails to prevent toxic outputs? - Milvus, נצפה ב־11 בדצמבר 2025, https://milvus.io/ai-quick-reference/how-do-you-implement-llm-guardrails-to-prevent-toxic-outputs

  17. MaskMol: knowledge-guided molecular image pre-training framework for activity cliffs with pixel masking - NIH, נצפה ב־11 בדצמבר 2025, https://pmc.ncbi.nlm.nih.gov/articles/PMC12462177/

  18. Recent Progress in Understanding Activity Cliffs and Their Utility in Medicinal Chemistry, נצפה ב־11 בדצמבר 2025, https://www.researchgate.net/publication/256187970_Recent_Progress_in_Understanding_Activity_Clifs_and_Their_Utility_in_Medicinal_Chemistry f

  19. DeepAC – conditional transformer-based chemical language model for the prediction of activity cliffs formed by bioactive compounds - RSC Publishing, נצפה ב־11 בדצמבר 2025, https://pubs.rsc.org/en/content/articlehtml/2022/dd/d2dd00077f

  20. Breaking the Rules with Chemistry: Understanding SMILES-Prompting LLM Jailbreak Attack, נצפה ב־11 בדצמבר 2025, https://www.keysight.com/blogs/en/tech/nwvs/2025/06/12/smiles-prompting-jailbreak-attack

  21. SMILES-Prompting: A Novel Approach to LLM Jailbreak Attacks in Chemical Synthesis, נצפה ב־11 בדצמבר 2025, https://arxiv.org/html/2410.15641v1

  22. Towards Building a Robust Toxicity Predictor - arXiv, נצפה ב־11 בדצמבר 2025, https://arxiv.org/html/2404.08690v1

  23. LATENT CONSTRAINTS: LEARNING TO GENERATE CONDITIONALLY FROM UNCONDITIONAL GENERATIVE MODELS - IA, נצפה ב־11 בדצמבר 2025, https://webia.lip6.fr/~briot/cours/unirio3/Projects/Papers/Latent%20Constraints%20Learning%20to%20Generate%20Conditionally%20from%20Unconditional%20Generative%20Models.pdf

  24. Latent Constraints: Learning to Generate Conditionally from Unconditional Generative Models - Google Research, נצפה ב־11 בדצמבר 2025, https://research.google/pubs/latent-constraints-learning-to-generate-conditionally-from-unconditional-generative-models/

  25. Manifold-driven decomposition for adversarial robustness - NSF Public Access Repository, נצפה ב־11 בדצמבר 2025, https://par.nsf.gov/biblio/10568356-manifold-driven-decomposition-adversarial-robustness

  26. On the Need for Topology-Aware Generative Models for Manifold-Based Defenses - Liner, נצפה ב־11 בדצמבר 2025, https://liner.com/review/on-the-need-for-topologyaware-generative-models-for-manifoldbased-defenses

  27. Activity cliff-aware reinforcement learning for de novo drug design - PMC PubMed Central, נצפה ב־11 בדצמבר 2025, https://pmc.ncbi.nlm.nih.gov/articles/PMC12013064/

  28. [1711.05772] Latent Constraints: Learning to Generate Conditionally from Unconditional Generative Models - arXiv, נצפה ב־11 בדצמבר 2025, https://arxiv.org/abs/1711.05772

  29. Incentivizing Safer Actions in Policy Optimization for Constrained Reinforcement Learning, נצפה ב־11 בדצמבר 2025, https://arxiv.org/html/2509.09208v1

  30. Incentivizing Safer Actions in Policy Optimization for Constrained Reinforcement Learning - IJCAI, נצפה ב־11 בדצמבר 2025, https://www.ijcai.org/proceedings/2025/0592.pdf

  31. Fact Sheet: President Donald J. Trump Unveils the Genesis Mission to Accelerate AI for Scientific Discovery - The White House, נצפה ב־11 בדצמבר 2025, https://www.whitehouse.gov/fact-sheets/2025/11/fact-sheet-president-donald-j-trump-unveils-the-genesis-missionto-accelerate-ai-for-scientific-discovery/

  32. Launching the Genesis Mission - The White House, נצפה ב־11 בדצמבר 2025, https://www.whitehouse.gov/presidential-actions/2025/11/launching-the-genesis-mission/

  33. White House Launches 'Genesis Mission' to Accelerate AI-Enabled Scientific Discovery, נצפה ב־11 בדצמבר 2025, https://www.morganlewis.com/pubs/2025/12/white-house-launches-genesis-mission-to-accelerate-ai-enabled-scientific-discovery

  34. NIST AI RMF - ModelOp, נצפה ב־11 בדצמבר 2025, https://www.modelop.com/ai-governance/ai-regulations-standards/nist-ai-rmf

  35. Navigating the NIST AI Risk Management Framework - Hyperproof, נצפה ב־11 בדצמבר 2025, https://hyperproof.io/navigating-the-nist-ai-risk-management-framework/

  36. NIST AI 6001, Artificial Intelligence Risk Management Framework - Johns Hopkins Center for Health Security, נצפה ב־11 בדצמבר 2025, https://centerforhealthsecurity.org/sites/default/files/2024-06/2024-06-02-jhchs-nist-ai-6001-rfc.pdf

  37. Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile - NIST Technical Series Publications, נצפה ב־11 בדצמבר 2025, https://nvlpubs.nist.gov/nistpubs/ai/NIST.AI.600-1.pdf

  38. Understanding ISO 42001 and Demonstrating Compliance - ISMS.online, נצפה ב־11 בדצמבר 2025, https://www.isms.online/iso-42001/

  39. ISO/IEC 42001 Certification: AI Management System - DNV, נצפה ב־11 בדצמבר 2025, https://www.dnv.com/services/iso-iec-42001-artificial-intelligence-ai--250876/

  40. ISO 42001 - Promptfoo, נצפה ב־11 בדצמבר 2025, https://www.promptoo.dev/docs/red-team/iso-42001/ f

  41. ISO 42001: paving the way for ethical AI | EY - US, נצפה ב־11 בדצמבר 2025, https://www.ey.com/en_us/insights/ai/iso-42001-paving-the-way-for-ethical-ai

מעדיפים חוויה חזותית ואינטראקטיבית?

חקרו את הממצאים המרכזיים, הנתונים הסטטיסטיים והארכיטקטורה של מסמך זה בפורמט אינטראקטיבי עם מקטעים ניתנים לניווט והדמיות נתונים.

צפייה בגרסה האינטראקטיבית
שאלות נפוצות

שאלות נפוצות

כיצד ניסוי MegaSyn הדגים סיכון שימוש כפול בבינה מלאכותית?

חוקרים ב-Collaborations Pharmaceuticals היפכו את עונש הרעילות במודל כימיה יוצר, והפיקו 40,000 כלי נשק כימיים פוטנציאליים -- כולל גז העצבים VX ואנלוגים חדשים -- בפחות משש שעות על חומרה בדרגת צרכן. הניסוי דרש רק מערכי נתונים בקוד פתוח וארכיטקטורות RNN סטנדרטיות.

מדוע עטיפות LLM נכשלות במניעת תכנון נשק ביולוגי?

מעקות בטיחות מבוססי-טקסט סובלים מעיוורון הקשרי, הסתרת SMILES (העברת סימון כימי שמקודד Sarin כמחרוזת), ועיוורון לצוקי פעילות שבהם החלפת אטום בודד הופכת תרופה בטוחה לסוכן קטלני. פריצות מהכלא מסוג SMILES-prompting עוקפות מנגנוני בטיחות בשיעורי הצלחה של מעל 90%.

כיצד פיקוח על מרחב לטנטי מונע יצירת מולקולות רעילות?

במקום לסנן פלטים לאחר היצירה, פיקוח על מרחב לטנטי ממפה אזורים רעילים באמצעות הומולוגיה מתמידה, ואז מפעיל היגוי גרדיאנט באמצעות דינמיקת Langevin במהלך הדגימה כדי לדחוף וקטורים לטנטיים הרחק מיריעות אסורות לפני שכל מולקולה מפוענחת. האילוץ מתמטי, לא מבוסס-מדיניות.

בנו את ה-AI שלכם בביטחון.

שותפו עם צוות בעל ניסיון עמוק בבניית הדור הבא של AI ארגוני. אנו נסייע לכם לתכנן, לבנות ולהטמיע אסטרטגיית AI שתוכלו לסמוך עליה.

Veriprajna ייעוץ דיפ-טק מתמחה בבניית מערכות AI קריטיות לבטיחות עבור תחומי הבריאות, הפיננסים והרגולציה. הארכיטקטורות שלנו מאומתות מול פרוטוקולים מבוססים ומלוות בתיעוד ציות מקיף.