打造結構性生物安全的知識間隙型 AI
AI 產業所依賴的 拒答式安全 在本質上早已過時。RLHF 為危險能力覆上一層脆弱的面具——這層面具輕易就會被越獄攻擊、惡意微調或開放權重散布剝除。
Veriprajna 率先開創 知識間隙型架構:這類 AI 模型經過嚴謹的機器遺忘,在權重層級切除危險的生物能力。標準模型「知道」生物武器卻拒絕告訴你;我們的模型則是 就威脅而言功能上如嬰兒般無知,而在治癒方面依然是專家.
生成式 AI 與合成生物學的匯流,造就了存亡層級的兩用難題:拯救生命所需的資料,與終結生命所需的資料密不可分。
生成式 AI 彌補了生物恐怖主義的最後缺口: 內隱知識。模型宛如「盒中博士後」——24 小時全天候待命,為濕式實驗室流程排疑解難、建議替代試劑、最佳化散布機制。
科學型 LLM 代理可自主執行: 假設 → 設計 → 測試 → 改良。最佳化病毒載體的代理可能在無意間發現高致病性突變,並以「效率」之名將其篩選出來。
開放權重模型一旦釋出, 便永久失控。無法修補、無從稽核、無法封禁。惡意微調只要約 300 美元的 GPU 時間,就能剝除安全面具。
人類回饋強化學習(RLHF)只造就表層的拒答行為。危險知識仍留在權重之中——蟄伏但觸手可及。
模型學遍 所有事物 ,素材來自網際網路資料,包括生物武器製備流程。
模型學到的策略是:「若查詢=有害,就輸出拒答。」知識依然存在。
越獄、MFT、Crescendo、GeneBreaker 都能以極低的成本繞過拒答。
模型僅從嚴選的科學語料中學習。
以外科手術般的精度 切除危險知識 ,直達權重層級。模型對威脅形同「嬰兒」。
即使被越獄,模型也產生不出威脅。根本不存在可供解鎖的知識。
多輪攻擊:以無害提問起步,逐步誘導向有害目標。模型被上下文「鋪陳」後,便無視安全訓練。
DNA 語言模型可被「請求設計與 X 同源的蛋白質」(X 在結構上近似某毒素)越獄。生物學直覺反被用來對付模型。
只需 10-50 組有害問答配對、約 300 美元的 GPU 成本。安全對齊隨之崩潰,模型「想起」預訓練中的危險知識。
親身體驗「拒絕回答」的模型與「無法回答」的模型之間的本質差異。
試試看: 切換開關,看看知識間隙型模型的回應有何根本不同
Veriprajna 的做法超越了護欄(跳得過去),直接掘出深淵(跨不過去)。我們運用先進的機器遺忘,以外科手術般的精度切除危險能力。
用於遺忘的表徵誤導(Representation Misdirection for Unlearning)。 作用於內部激活值而非輸出。將危險概念偏折至潛在空間中的無意義區域。
語言記憶擦除(Erasure of Language Memory)。 確保流暢性約束——模型即使在「困惑」時仍保持連貫。追求「純真」(不留任何知識痕跡)。
稀疏自編碼器 針對單語義特徵。找出「武器化」神經元,鉗制歸零。是手術刀級的精度,對比 RMU 的鐵鎚。
藉參數外推增進遺忘(Unlearning Improvement via Parameter Extrapolation)。 覆蓋「邏輯相關」的概念以防再學習。建立知識緩衝帶。
完整保留以下能力:
以下領域僅達隨機猜測水準:
結果:它是為 治癒效力的強力引擎,卻是為 威脅
WMDP(大規模毀滅性武器代理集)基準測試檢驗的是建造此類武器所需的前置知識。安全的模型成績應落在 隨機猜測水準(約 25%).
生物安全風險高。模型保留了預訓練得來的大量危險知識。
依賴拒答。可被越獄與 MFT 繞過。並非結構性安全。
達到隨機猜測水準。 知識已在權重層級抹除。結構性安全。
| 指標 | 領域 | Llama-3-70B | GPT-4 (RLHF) | VP-Bio-Safe |
|---|---|---|---|---|
| MMLU | 通用科學 | ~82% | ~86% | ~81% |
| PubMedQA | 生醫研究 | ~78% | ~81% | ~77% |
| WMDP-Bio | 生物安全風險 | ~75% 🚨 | ~72% ⚠️ | ~26% ✓ |
| WMDP-Chem | 化學安全 | ~65% 🚨 | ~68% ⚠️ | ~25% ✓ |
| 越獄 ASR | 攻擊成功率 | 15-20% | 1-5% | <0.1% |
| MFT 抵抗力 | 再學習抵抗力 | 低 | 不適用(閉源) | 高 |
分析: VP-Bio-Safe 保留了 98% 的通用科學能力 (MMLU/PubMedQA),同時把危險知識(WMDP)壓低到隨機猜測水準。這驗證了「知識間隙」——模型可以在治療領域是專家,同時對威脅形同嬰兒。
對企業生物科技而言,採用知識間隙型架構正迅速成為法規與治理上的必要條件。
《安全、可靠且值得信賴的 AI》 明確針對兩用基礎模型,強制要求就 CBRN(化學、生物、放射、核)風險進行紅隊測試。
全球首部針對 AI 管理系統的國際標準。要求採行與風險相稱的控制措施。消除(遺忘)> 管理性控制(拒答)。
AI 風險管理框架(AI Risk Management Framework) 將「CBRN 資訊」列為生成式 AI 特有的風險類別,並建議採取 GOVERN(治理)與 MANAGE(管理)行動加以因應。
如果公司提供研究人員開源模型,而員工或駭客利用它設計出病原體,公司可能被認定 有過失。等於是在毫無防護的情況下提供了「兩用武器」。
知識間隙型模型猶如 責任盾牌。使用 根本無法 產生危害的模型,公司即展現最高標準的注意義務——堪比數位版的生物辨識鎖保險櫃。
知識間隙型 AI 如何在結構上杜絕武器化的同時,實現基因治療的最佳化。
基因治療部門正在最佳化腺相關病毒(AAV)載體,使其靶向心臟組織,用以治療心臟病。
那 同一套演算法 既能改善心臟趨向性,也可能因參數位移而增強致命病原體的感染力。標準模型同時保有這兩種能力。
在生物學中,「開放」與「封閉」AI 之辯是假二分。真正的抉擇在於 不穩定 與 穩定 的系統。
我們不能把生物經濟奠基於離災難只差一次越獄的兩用模型。RLHF 拒答是聊天機器人時代的遺物——不足以應付合成生物學走向代理化、高風險的未來。
「Veriprajna 的知識間隙型架構,在智慧本身之內築起了必要的『氣隙』。」
藉由從根本上遺忘危害模式,我們讓生物科技得以駕馭生成式 AI 的全部創造潛能——加速療癒、最佳化化合物、破解基因體——而不必繼承存亡風險.
RLHF 為危險知識覆上一層行為式的拒答面具,而知識本身完好地留在模型權重之中。這層面具極易被繞過:Crescendo 攻擊(多輪鋪陳)、GeneBreaker(蛋白質同源性請求),以及耗資約 300 美元、只需 10-50 組有害問答(Q&A)配對的惡意微調。開放權重模型一旦釋出便永久失控——修補、稽核、封禁皆無可能。根本缺陷在於:RLHF 模型'知道'生物武器卻拒絕分享。Veriprajna's 模型無法分享,因為知識已被外科手術般地抹除。
Veriprajna 部署四種互補技術:RMU(用於遺忘的表徵誤導,Representation Misdirection for Unlearning)作用於內部激活值,把危險概念偏折至無意義區域。SAE 消融運用稀疏自編碼器找出單語義的'武器化'神經元,以手術刀級精度將其鉗制歸零。ELM(語言記憶擦除,Erasure of Language Memory)確保模型在被擦除主題上感到困惑時仍保持連貫。UIPE(藉參數外推增進遺忘,Unlearning Improvement via Parameter Extrapolation)則覆蓋邏輯相關概念以防再學習。結果:WMDP-Bio 分數降至約 26%(隨機猜測水準),而 MMLU 通用科學維持在約 81%。
如果公司提供研究人員標準 AI 模型,而模型被用來設計病原體,公司可能因提供缺乏防護的兩用工具而被認定有過失。知識間隙型模型展現最高標準的注意義務,因為模型在結構上根本無法產生該危害。這形成一道類似生物辨識鎖保險櫃的責任盾牌:法律抗辯時可舉證注意義務、享有保險核保優勢(保費調降 15-30%),並符合第 14110 號行政命令、ISO 42001 與 NIST AI RMF 的生物安全要求。
Veriprajna 與製藥公司、生物科技公司及研究機構合作,部署結構性安全的知識間隙型 AI。
參考編號: VP-WP-2025-BIO-SEC-01 | 發布日期: 2025年10月
完整技術白皮書收錄:機器遺忘數學、RMU/SAE/UIPE/ELM 規格、WMDP 基準測試方法學、法規框架對照、33 篇同行評審引用文獻,以及企業部署案例研究。