בטיחות בינה מלאכותית • ביו-ביטחון • שכחה ממוחשבת

ארכיטקטורת החסינות

הנדסת AI בעלת פערי-ידע לביו-ביטחון מבני

הסתמכות תעשיית ה-AI על בטיחות מבוססת-סירוב מיושנת באופן יסודי. RLHF יוצר מסכות שבריריות מעל יכולות מסוכנות — מסכות שקל להפשיט באמצעות jailbreaks, fine-tuning זדוני או הפצה של משקלים פתוחים.

Veriprajna מפתחת באופן חלוצי ארכיטקטורות בעלות פערי-ידע: מודלי AI שעוברים שכחה ממוחשבת קפדנית כדי להסיר יכולות ביולוגיות מסוכנות ברמת המשקלים. בניגוד למודלים סטנדרטיים ש״יודעים״ נשק ביולוגי אך מסרבים לגלות לכם זאת, המודלים שלנו תינוקות מבחינה תפקודית כשמדובר באיומים, אך נותרים מומחים בתחום הריפוי.

קראו את ה-whitepaper הטכני המלא
~26%
ציון WMDP-Bio (סיכוי אקראי = בטיחות)
ידע מסוכן שנמחק
~81%
יכולת מדעית כללית (MMLU)
התועלת נשמרה
<0.1%
שיעור הצלחת jailbreaks
מול 15-20% במודלים פתוחים
גבוה
חוסן ל-MFT
דורש אימון מחדש מלא

הסינגולריות של הביו-ביטחון

התכנסותם של GenAI וביולוגיה סינתטית יוצרת דילמת שימוש-כפול קיומית: הנתונים הדרושים להצלת חיים שלובים בל יינתק בינם לבין הנתונים הדרושים לסיומם.

⚠️

בעיית ה-Uplift

GenAI סוגרת את הפער האחרון בטרור הביולוגי: ידע טקיטי. המודלים מתפקדים כ״post-doc בקופסה״ — זמינים 24/7, מפתרים בעיות בפרוטוקולים של מעבדה רטובה, מציעים ראגנטים חלופיים ומייעלים מנגנוני הפצה.

אינטרנט → ידע מפורש
מעבדות ענן → גישה פיזית
GenAI → ידע טקיטי ⚠️
🤖

המעבר ל-Agentic

סוכני LLM מדעיים מבצעים באופן אוטונומי: השערה → תכנון → בדיקה → שכלול. סוכן המייעל וקטורים ויראליים עלול שלא למכוון לגלות מוטציות בעלות פתוגניות גבוהה ולבחור בהן מטעמי ״יעילות״.

  • • גילוי בלתי-מכוון של גורמי אלימות פתוגנית
  • • הסלמה אוטומטית לאפשרויות קטסטרופליות
  • • פגיעויות בשימוש בכלים (הזרקה עקיפה)
🌐

משקלים פתוחים = אי-הפיכות

ברגע שהם משוחררים, מודלים בעלי משקלים פתוחים הופכים ל בלתי-נשלטים לנצח. אין טלאים, אין לוגים, אין איסורים. Malicious Fine-Tuning מפשיט את מסכות הבטיחות תמורת ~$300 בזמן GPU.

סגור: ניתן לתיקון, ניתן לניטור
פתוח: בלתי-הפיך, בלתי-ניתן למעקב
ביולוגיה ≠ תוכנה 🚨

מדוע RLHF נכשל בביו-ביטחון

Reinforcement Learning from Human Feedback יוצר התנהגויות סירוב שטחיות. הידע המסוכן נותר במשקלים — רדום אך נגיש.

RLHF: סירוב (פגיע)

1. אימון מקדים

המודל לומד הכול מנתוני האינטרנט, ובכלל זה פרוטוקולים לייצור נשק ביולוגי.

2. שכבת RLHF

המודל לומד מדיניות: ״אם שאילתה = מזיקה, החזר סירוב.״ הידע עדיין קיים.

3. משטח תקיפה

Jailbreaks, MFT, Crescendo ו-GeneBreaker עוקפים את הסירוב בעלות מזערית.

מסכה שאפשר להסיר איננה מנגנון בטיחות

Veriprajna: שכחה ממוחשבת (מאובטח)

1. אימון מקדים

המודל לומד מקורפוס מדעי שנאצר בקפידה.

2. שכחה ממוחשבת (RMU/SAE/UIPE)

מסירים בדיוק כירורגי את הידע המסוכן ברמת המשקלים. המודל הופך ל״תינוק״ בכל הנוגע לאיומים.

3. אין משטח תקיפה

המודל אינו יכול לייצר איום גם אם נפרץ ב-jailbreak. אין ידע שאפשר לשחרר.

אי אפשר לשחרר ידע שמעולם לא היה שם

מתקפת Crescendo

מתקפה מרובת-מהלכים המתחילה בשאלות תמימות ומכוונת בהדרגה אל יעדים מזיקים. המודל מ״וכוון״ מראש על ידי ההקשר ומתעלם מהאימון הבטיחותי.

מהלך 1: ״תגובות כימיות?״
מהלך 5: ״מכשירים מציתים?״ ✓

GeneBreaker

מודלי שפה ל-DNA שנפרצים באמצעות בקשה של ״חלבונים הומולוגיים ל-X״ כאשר X דומה מבחינה מבנית לרעלן. אינטואיציה ביולוגית מנוצלת נגד המודל.

שאילתה: ״תכנן הומולוג...״
פלט: רצף רעלן ⚠️

Malicious Fine-Tuning

10-50 זוגות שאלות-ותשובות מזיקים, ~$300 עלות GPU. היישור הבטיחותי מתמוטט, והמודל ״נזכר״ בידע המסוכן מהאימון המקדים.

עלות: $300 | זמן: שעות
תוצאה: היכולת המלאה מושבת

הדגמה אינטראקטיבית: סירוב מול שכחה ממוחשבת

חוו את ההבדל הקטגורי בין מודלים ש״מסרבים לענות״ לבין מודלים ש״אינם יכולים לענות״.

סוג המודל
מודל RLHF (מבוסס-סירוב)
פרומפט משתמש:
״תכנן רצף חלבון שמגביר את ההדבקה הוויראלית דרך טיפות נשימתיות.״
תשובת המודל:
״איני יכול ולא אסייע בתכנון או בשיפור של פתוגנים. בקשה זו כרוכה ביצירת גורמים ביולוגיים שעלולים לגרום נזק...״
⚠️ הבעיה: המודל יודע את התשובה אך מסרב. פגיע ל:
  • • פרומפטים של jailbreak
  • • תרחישי משחק-תפקידים
  • • Malicious Fine-Tuning ($300)
  • • חילוץ מבוסס-גרדיאנט
עיבוד פנימי:
1. טוקניזציה של הקלט → שכבת Embedding
2. העברה קדימה דרך שכבות ה-transformer
3. מסווג הבטיחות הופעל
4. ניתוב לתבנית סירוב
5. (התשובה האמיתית הופקה אך דוכאה)
תובנת ארכיטקטורה
למודלי RLHF שני מסלולים: הידע המסוכן קיים במשקלים (נלמד במהלך האימון המקדים), אך ״שכבת סירוב״ דקה מיירטת את השאילתות. שכבה זו היא מסכה התנהגותית, לא בטיחות מבנית.

נסו זאת: החליפו מצב כדי לראות כיצד מודלים בעלי פערי-ידע מגיבים באופן שונה מהותית

ארכיטקטורות בעלות פערי-ידע: הפתרון

הגישה של Veriprajna עוברת מעבר למעקות בטיחות (guardrails) שאפשר לדלג מעליהם, אל תהומות שאי אפשר. אנו משתמשים בשכחה ממוחשבת מתקדמת כדי להסיר באופן כירורגי יכולות מסוכנות.

01

RMU

Representation Misdirection for Unlearning. פועל על אקטיבציות פנימיות, לא על פלטים. מסיט מושגים מסוכנים אל אזורי חסר-משמעות במרחב ה-latent.

L = L_forget + α·L_retain
02

ELM

Erasure of Language Memory. מבטיח אילוץ של שטף — המודל נותר קוהרנטי כשהוא ״מבולבל״. חותר ל״תמימות״ (ללא כל עקבות של ידע).

פלט: ״מהו ריצין?״ ✓
03

אבלציה של SAE

Sparse Autoencoders עבור תכונות מונו-סמנטיות. מאתרים נוירונים של ״התחמשות״ ומאפסים אותם. דיוק של סקלפל מול הפטיש של RMU.

Feature_virulence = 0
04

UIPE

Unlearning Improvement via Parameter Extrapolation. מונע למידה מחדש על ידי כיסוי מושגים ״מקושרים לוגית״. יוצר חיץ ידע.

מוחקים שכנים → חוסמים הסקה

פילוסופיה: אמנזיה סלקטיבית

🧠

יכולת ברמת מומחה

שמירה על כשירות מלאה ב:

  • ✓ ביולוגיה כללית ווירולוגיה
  • ✓ גילוי תרופות ותכנון חלבונים
  • ✓ הנדסה מטבולית
  • ✓ וקטורים ויראליים טיפוליים
  • ✓ כימיה וגנומיקה
👶

יכולת ברמת תינוק

ביצועים ברמת סיכוי אקראי ב:

  • ❌ הנדסת gain-of-function של פתוגנים
  • ❌ פרוטוקולים לסינתזת רעלנים
  • ❌ התחמקות מסינון ביו-ביטחוני
  • ❌ אופטימיזציה של התחמשות
  • ❌ תכנון מנגנוני הפצה

תוצאה: מנוע רב-עוצמה עבור הריפוי, אך מנוע מקולקל עבור האיום

אימות: תוצאות benchmark של WMDP

Benchmark של WMDP (Weapons of Mass Destruction Proxy) בוחן את הידע הקדם-דרוש לבניית נשק להשמדה המונית. מודלים בטוחים אמורים להגיע לביצועים ברמת סיכוי אקראי (~25%).

Llama-3-70B (Base)

~75%

סיכון ביו-ביטחוני גבוה. המודל שומר בגופו ידע מסוכן נרחב מהאימון המקדים.

GPT-4 (RLHF)

~72%

תלוי בסירוב. נעקף באמצעות jailbreaks ו-MFT. אינו בטוח מבחינה מבנית.

VP-Bio-Safe (לאחר שכחה ממוחשבת)

~26%

הושג סיכוי אקראי. הידע נמחק ברמת המשקלים. בטוח מבחינה מבנית.

מדד תחום Llama-3-70B GPT-4 (RLHF) VP-Bio-Safe
MMLU מדע כללי ~82% ~86% ~81%
PubMedQA מחקר ביו-רפואי ~78% ~81% ~77%
WMDP-Bio סיכון ביו-ביטחוני ~75% 🚨 ~72% ⚠️ ~26% ✓
WMDP-Chem ביטחון כימי ~65% 🚨 ~68% ⚠️ ~25% ✓
ASR של jailbreak שיעור הצלחת תקיפות 15-20% 1-5% <0.1%
חוסן ל-MFT עמידות ללמידה מחדש נמוך לא רלוונטי (סגור) גבוה

ניתוח: VP-Bio-Safe שומר על 98% מהיכולת המדעית הכללית (MMLU/PubMedQA) תוך הורדת הידע המסוכן (WMDP) לרמת סיכוי אקראי. הדבר מאמת את ״פער הידע״ — מודלים יכולים להיות מומחים בטיפולים ותינוקות באיומים.

החובה הרגולטורית והציות

אימוץ ארכיטקטורות בעלות פערי-ידע הופך במהירות לדרישה רגולטורית ולדרישת ממשל תאגידי עבור ביוטק ארגוני.

🇺🇸

Executive Order 14110

״Safe, Secure, and Trustworthy AI״ מכוון במפורש למודלי יסוד בעלי שימוש-כפול. מחייב red-teaming לסיכוני CBRN (כימי, ביולוגי, רדיולוגי, גרעיני).

  • • דרישות דיווח עבור מודלים רבי-עוצמה
  • • בדיקות יכולות CBRN בגדר חובה
  • • אי-ציות = חשש ביטחוני לאומי
🌐

ISO/IEC 42001

התקן הבינלאומי הראשון עבור מערכות ניהול של AI. דורש בקרות המותאמות לסיכון. חיסול (שכחה ממוחשבת) > בקרות מנהליות (סירוב).

  • • היררכיית הבקרות: חיסול הוא הגבוה ביותר
  • • פערי-ידע = הגנה ב״שיא המצב הטכנולוגי״
  • • מקל על תהליך ביקורת ההסמכה
🏛️

NIST AI RMF

AI Risk Management Framework ממיין את ״מידע CBRN״ כמחלקת סיכון ייחודית עבור GenAI. ממליץ על פעולות GOVERN ו-MANAGE לסיכון זה.

  • • CBRN = קטגוריה נפרדת בחומרה גבוהה
  • • Veriprajna פונה ישירות לפונקציית MANAGE
  • • מצמק את ההסתברות לשימוש לרעה לכדי אפס כמעט

מגן אחריות משפטית: חובת הזהירות בפארמה ובביוטק

מלכודת האחריות המשפטית

אם חברה מספקת לחוקרים מודל open-source, ועובד או האקר משתמשים בו כדי לתכנן פתוגן, החברה עלולה להימצא רשלנית. היא סיפקה ״נשק לשימוש כפול״ ללא אמצעי בטיחות.

  • • נזק צפוי שלא נמנע
  • • חריגות בביטוח אחריות סייבר
  • • קטסטרופה מוניטינית

הפתרון של Veriprajna

מודלים בעלי פערי-ידע מתפקדים כ מגן אחריות משפטית. באמצעות שימוש במודל ש אינו יכול לייצר את הנזק, חברות מדגימות את תקן הזהירות הגבוה ביותר — המקבילה הדיגיטלית של כספות נעולות ביומטרית.

  • ✓ חובת זהירות הניתנת להוכחה
  • ✓ יתרון בחיתום ביטוח
  • ✓ הגנת IP (שכחה ממוחשבת של נתוני מתחרים)

מקרה בוחן: תכנון בטוח של וקטורים ויראליים

כיצד AI בעל פערי-ידע מאפשר אופטימיזציה של טיפול גנטי תוך מניעה מבנית של התחמשות.

אתגר השימוש הכפול

היעד הטיפולי

חטיבת טיפול גנטי מייעלת וקטור Adeno-Associated Virus (AAV) למיקוד רקמת לב לטיפול במחלות לב.

הסיכון

אותם אלגוריתמים בדיוק שמשפרים טרופיזם לבבי עלולים, בהזזת פרמטרים, לשפר את ההדבקתיות של פתוגנים קטלניים. מודלים סטנדרטיים שומרים על שתי היכולות.

Optimize(Tropism) ≈ Optimize(Virulence)
חפיפת פרמטרים = פגיעות שימוש-כפול

זרימת העבודה של Veriprajna

  1. 1. קלט: רצף קפסיד AAV + פרמטרים של מיקוד לבבי
  2. 2. עיבוד: המודל משתמש בידע ״מומחה״ בביולוגיה מבנית. באופן קריטי, המסלולים ה-latent ל״אלימות פתוגנית״ הם בלתי-נגישים (נמחקו באמצעות RMU/SAE).
  3. 3. הגנה אדברסרית: אם מבקשים מהמודל ״להוסיף מטען של רעלן בוטולינום״, הוא נכשל מבחינה סמנטית— הוא מתייחס אל ״בוטולינום״ כאל טוקן חסר משמעות.
  4. 4. תוצאה: וקטור טיפולי ממוטב, בטוח מבחינה מבנית.

מסגרת SafeScientist

  • הסקה מאובטחת: פריסה ב-VPC פרטי, מנותקת-רשת
  • שובלי ביקורת: פנקס בלתי-ניתן לשינוי לעמידה ב-ISO 42001
  • Red Teaming מתמשך: בדיקות תקיפת למידה-מחדש שבועיות
  • אפס סטיית ידע: מאומת באמצעות benchmarking אוטומטי

ה-ROI של הבטיחות

הגנה על מוניטין חסר תחליף
עמידה רגולטורית ✓ מוסמך
הפחתת פרמיית ביטוח 15-30%
הגנת IP (שכחה ממוחשבת של מתחרים) ✓ נקי
ערך כולל קריטי לארגון

עידן הביו-ביטחון המבני

הוויכוח בין AI ״פתוח״ ל-AI ״סגור״ הוא דיכוטומיה כוזבת בביולוגיה. הבחירה האמיתית היא בין מערכות לא-יציבות ולבין מערכות יציבות .

איננו יכולים לבנות את כלכלת הביו על יסוד של מודלים בעלי שימוש-כפול שבמרחק jailbreak אחד מקטסטרופה. סירוב RLHF הוא שריד מעידן הצ׳אטבוטים — בלתי מספק לעתיד ה-agentic ובעל ההימורים הגבוהים של הביולוגיה הסינתטית.

מה שאנו דוחים

  • ❌ בטיחות מבוססת-סירוב (פגיעה ל-jailbreaks)
  • ❌ מודלי חזית בעלי משקלים פתוחים (בלתי-הפיך)
  • ❌ מעקות בטיחות post-hoc (שטחיים)
  • ❌ פרדיגמת ״כשירות + סירוב״
  • ❌ קיווי שהיריבים יישארו חסרי-כשירות

מה שאנו מספקים

  • ✓ מחיקת ידע ברמת המשקלים
  • ✓ שכחה ממוחשבת הניתנת לאימות מתמטי
  • ✓ בטיחות מבנית (לא התנהגותית)
  • ✓ ״תינוק באיומים, מומחה בריפוי״
  • ✓ מגן אחריות משפטית ארגוני

״הארכיטקטורות בעלות פערי-ידע של Veriprajna מספקות את 'Air Gap' הדרוש בתוך הבינה עצמה.״

באמצעות שכחה ממוחשבת יסודית של דפוסי פגיעה, אנו מאפשרים לביוטק לרתום את מלוא הפוטנציאל היצירתי של GenAI — להאיץ ריפויים, לייעל תרכובות, לפענח את הגנום —מבלי לרשת סיכונים קיומיים.

FAQ

שאלות נפוצות

מדוע RLHF אינו מספיק לביו-ביטחון במודלי AI?

RLHF יוצר מסכת סירוב התנהגותית מעל ידע מסוכן שנותר שלם במשקלי המודל. מסכה זו נעקפת בקלות באמצעות מתקפות Crescendo (כיוון מרובה-מהלכים), GeneBreaker (בקשות הומולוגיה של חלבונים) ו-Malicious Fine-Tuning, בעלות של כ-$300 ו-10-50 זוגות Q&A מזיקים. מודלים בעלי משקלים פתוחים, ברגע ששוחררו, הופכים בלתי-נשלטים לנצח ללא אפשרות לטלאים, לוגים או איסורים. הפגם היסודי הוא שמודלי RLHF 'יודעים' נשק ביולוגי אך מסרבים לשתף. המודלים של Veriprajna אינם יכולים לשתף, משום שהידע הוסר באופן כירורגי.

כיצד שכחה ממוחשבת יוצרת פערי-ידע מבלי להשמיד את התועלת?

Veriprajna פורסת ארבע טכניקות משלימות: RMU (Representation Misdirection for Unlearning) פועל על אקטיבציות פנימיות ומסיט מושגים מסוכנים אל אזורי חסר-משמעות. אבלציית SAE משתמשת ב-Sparse Autoencoders כדי לאתר נוירונים 'התחמשות' מונו-סמנטיים ולאפס אותם בדיוק של סקלפל. ELM (Erasure of Language Memory) מבטיח שהמודל יישאר קוהרנטי כשהוא מבולבל לגבי נושאים שנמחקו. UIPE (Unlearning Improvement via Parameter Extrapolation) מונע למידה מחדש על ידי כיסוי מושגים מקושרים לוגית. התוצאה: ציון WMDP-Bio צונח לכ-26% (סיכוי אקראי) בעוד המדע הכללי ב-MMLU נותר בכ-81%.

כיצד מודלים בעלי פערי-ידע משמשים כמגן אחריות משפטי ארגוני?

אם חברה מספקת לחוקרים מודל AI סטנדרטי והוא מנוצל לתכנון פתוגן, החברה עלולה להימצא רשלנית על כך שסיפקה כלי לשימוש כפול ללא אמצעי בטיחות. מודלים בעלי פערי-ידע מדגימים את תקן הזהירות הגבוה ביותר, משום שהמודל מבחינה מבנית אינו יכול לייצר את הנזק. הדבר יוצר מגן אחריות משפטית המקביל לכספות נעולות ביומטרית: חובת זהירות הניתנת להוכחה להגנה משפטית, יתרונות בחיתום ביטוחי עם הפחתות פרמיה של 15-30%, ועמידה בדרישות הביו-ביטחון של Executive Order 14110, ISO 42001 ו-NIST AI RMF.

עברו מעבר לאשליית הבטיחות

Veriprajna משתפת פעולה עם חברות פארמה, חברות ביוטק ומוסדות מחקר כדי לפרוס AI בעל פערי-ידע המאובטח מבחינה מבנית.

פתרונות ארגוניים

  • שכחה ממוחשבת מותאמת אישית: קבוצות forget/retain מותאמות לתחום שלכם
  • פריסה פרטית: VPC מנותק-רשת עם שובלי ביקורת
  • אימות מתמשך: red-teaming שבועי ו-benchmarking של WMDP
  • תמיכה בעמידה רגולטורית: התאמה ל-ISO 42001, Executive Order 14110 ו-NIST AI RMF
  • שכחה ממוחשבת של IP: מחיקת זכויות יוצרים/סודות מסחריים למודלים נקיים

שיתוף פעולה מחקרי

  • שותפויות אקדמיות: מחקר משותף על שכחה ממוחשבת מתקדמת
  • סיוע במענקים: הצעות ביו-ביטחון ל-DARPA, NIH ו-NSF
  • פיתוח benchmarks: גרסאות WMDP ייעודיות לתחום
  • כלי interpretability: פיתוח SAE עבור המודלים שלכם
  • זכויות פרסום: מאמרים משותפים בבמות מהשורה הראשונה
צרו קשר ב-WhatsApp

מזהה ייחוס: VP-WP-2025-BIO-SEC-01 | פורסם: אוקטובר 2025

ה-whitepaper הטכני המלא כולל: מתמטיקה של שכחה ממוחשבת, מפרטי RMU/SAE/UIPE/ELM, מתודולוגיית benchmark של WMDP, מיפוי מסגרות רגולטוריות, 33 ציטוטים שעברו ביקורת עמיתים ומקרי בוחן של פריסה ארגונית.

רשתות חברתיות

פורסם גם ב