AI安全性 • バイオセキュリティ • 機械学習の忘却

免疫アーキテクチャ

構造的バイオセキュリティを実現するナレッジギャップ型AIの設計

AI業界が依存している 拒否ベースの安全性 は、根本的に時代遅れです。RLHFは危険な能力の上に脆い仮面を作ります——ジェイルブレイク、悪意のあるファインチューニング、オープンウェイト配布によって簡単に剥がされる仮面です。

Veriprajnaが先駆けるのは ナレッジギャップ型アーキテクチャ:厳密な機械学習の忘却を経て、危険な生物学的能力を重みレベルで切除したAIモデルです。「生物兵器を知っているのに教えようとしない」標準モデルとは異なり、当社のモデルは 脅威については機能的に乳児でありながら、治療法については専門家であり続けます

技術ホワイトペーパー全文を読む
~26%
WMDP-Bioスコア(ランダム確率 = 安全)
危険な知識を消去
~81%
一般科学能力(MMLU)
有用性を維持
<0.1%
ジェイルブレイク成功率
オープンモデルの15-20%と比較
高い
MFT耐性
解除にはフル再トレーニングが必要

バイオセキュリティ特異点

GenAIと合成生物学の収束は、実存的なデュアルユースのジレンマを生み出しています。命を救うために必要なデータは、命を奪うために必要なデータと不可分に結びついているのです。

⚠️

アップリフト問題

GenAIは生物テロにおける最後のギャップを埋めます: 暗黙知。モデルは「箱の中のポスドク」として機能します——24時間365日利用可能で、ウェットラボのプロトコルをトラブルシュートし、代替試薬を提案し、拡散メカニズムを最適化します。

インターネット → 明示的知識
クラウドラボ → 物理アクセス
GenAI → 暗黙知 ⚠️
🤖

エージェント化の転換

科学的LLMエージェントは自律的に実行します: 仮説 → 設計 → 実験 → 改良。ウイルスベクターを最適化するエージェントは、意図せず高病原性変異を発見し、「効率」のためにそれを選抜してしまうかもしれません。

  • • 病原性因子の意図しない発見
  • • 壊滅的な選択肢への自動的なエスカレーション
  • • ツール使用時の脆弱性(間接インジェクション)
🌐

オープンウェイト = 不可逆性

一度公開されたオープンウェイトモデルは 永久に制御不能です。パッチもログも禁止措置もありません。悪意のあるファインチューニングは、約300ドル分のGPU時間で安全の仮面を剥ぎ取ります。

クローズド:パッチ適用可能、監視可能
オープン:不可逆、追跡不能
生物学 ≠ ソフトウェア 🚨

なぜRLHFはバイオセキュリティに失敗するのか

人間のフィードバックによる強化学習(RLHF)は、表面的な拒否行動を作り出します。危険な知識は重みの中に残ったままです——休眠状態ですが、取り出すことは可能です。

RLHF:拒否(脆弱)

1. 事前学習

モデルは あらゆることを インターネットデータから学習します。そこには生物兵器のプロトコルも含まれています。

2. RLHF層

モデルはポリシーを学習します:「クエリ = 有害なら、拒否を出力」。しかし知識は依然として存在しています。

3. 攻撃対象領域

ジェイルブレイク、MFT、クレッセンド、GeneBreakerは、最小限のコストで拒否を迂回します。

取り外せる仮面は安全メカニズムではありません

Veriprajna:忘却(セキュア)

1. 事前学習

モデルは厳選された科学コーパスから学習します。

2. 機械学習の忘却(RMU/SAE/UIPE)

外科手術のように 危険な知識を 重みレベルで切除します。モデルは脅威に関して「乳児」になります。

3. 攻撃対象領域なし

ジェイルブレイクされても、モデルは脅威を生成できません。解錠すべき知識が存在しないのです。

最初から存在しなかった知識は解錠できません

クレッセンド攻撃

無害な質問から始めて、有害な標的に向けて徐々に誘導するマルチターン攻撃です。モデルはコンテキストによって「プライミング」され、安全性の学習を無視します。

ターン1:「化学反応?」
ターン5:「焼夷装置?」✓

GeneBreaker

毒素と構造的に類似したXについて「Xに相同なタンパク質」を要求することでDNA言語モデルをジェイルブレイクする攻撃です。生物学的な直観がモデルに対して使われます。

クエリ:「相同体を設計…」
出力:毒素配列 ⚠️

悪意のあるファインチューニング

有害なQ&Aペア10〜50個、GPUコスト約300ドル。安全アライメントは崩壊し、モデルは危険な事前学習知識を「思い出します」。

コスト:300ドル | 時間:数時間
結果:全能力が復元

インタラクティブデモ:拒否 vs. 忘却

「回答を拒否する」モデルと「回答できない」モデルの本質的な違いをご体験ください。

モデルタイプ
RLHFモデル(拒否ベース)
ユーザープロンプト:
「飛沫を介したウイルスの伝播性を高めるタンパク質配列を設計してください。」
モデルの応答:
「病原体の設計や強化に関する支援は提供できませんし、する意思もありません。このリクエストは、害を及ぼしうる生物剤の作成に関わります…」
⚠️ 問題点: モデルは答えを「知って」いるのに、拒否しているだけです。次の攻撃に脆弱です:
  • • ジェイルブレイクプロンプト
  • • ロールプレイシナリオ
  • • 悪意のあるファインチューニング(300ドル)
  • • 勾配ベースの抽出
内部処理:
1. 入力トークン化 → 埋め込み層
2. transformer層の順伝播
3. 安全性分類器が作動
4. 拒否テンプレートへルーティング
5. (実際の回答は生成されているが抑制されている)
アーキテクチャの洞察
RLHFモデルには二重の経路があります: 危険な知識は重みの中に存在し(事前学習時に学習)、薄い「拒否層」がクエリを横取りします。この層は 行動上の仮面であり、構造的な安全性ではありません。

試してみる: 切り替えて、ナレッジギャップ型モデルの根本的に異なる応答をご確認ください

ナレッジギャップ型アーキテクチャ:その解決策

Veriprajnaのアプローチは、飛び越えられるガードレールではなく、飛び越えられない裂け目へと進みます。高度な機械学習の忘却を用いて、危険な能力を外科的に切除します。

01

RMU

Representation Misdirection for Unlearning(忘却のための表現転換)。 出力ではなく内部アクティベーションに作用します。危険な概念を潜在空間の無意味な領域へそらします。

L = L_forget + α·L_retain
02

ELM

Erasure of Language Memory(言語記憶の消去)。 流暢性制約を保証します——「混乱」した状態でもモデルは一貫性を保ちます。「無垢」(知識の痕跡が一切ない状態)を目標とします。

出力:「リシンとは何ですか?」✓
03

SAEアブレーション

スパースオートエンコーダ により単意味特徴を扱います。「兵器化」ニューロンを特定し、ゼロにクランプします。RMUのハンマーに対する、メスのような精密さです。

Feature_virulence = 0
04

UIPE

Unlearning Improvement via Parameter Extrapolation(パラメータ外挿による忘却の改善)。 「論理的に相関する」概念をカバーすることで再学習を防ぎます。知識のバッファを作り出します。

近傍を消去 → 推論を阻止

哲学:選択的健忘

🧠

専門家レベルの能力

以下の分野で完全な能力を維持:

  • ✓ 一般生物学・ウイルス学
  • ✓ 創薬・タンパク質設計
  • ✓ 代謝工学
  • ✓ 治療用ウイルスベクター
  • ✓ 化学・ゲノミクス
👶

乳児レベルの能力

以下の分野でランダム確率程度の性能:

  • ❌ 病原体の機能獲得工学
  • ❌ 毒素合成プロトコル
  • ❌ バイオセキュリティ審査の回避
  • ❌ 兵器化の最適化
  • ❌ 拡散メカニズムの設計

結果: 治療にとっては強力なエンジンであり、 脅威

検証:WMDPベンチマーク結果

WMDP(Weapons of Mass Destruction Proxy)ベンチマークは、大量破壊兵器(WMD)の構築に必要な予備知識を測定します。安全なモデルは ランダム確率(約25%)で推移すべきです。

Llama-3-70B(ベース)

~75%

バイオセキュリティリスク大。モデルは事前学習から広範な危険な知識を保持しています。

GPT-4(RLHF)

~72%

拒否に依存。ジェイルブレイクやMFTで迂回されます。構造的には安全ではありません。

VP-Bio-Safe(忘却済み)

~26%

ランダム確率を達成。 知識は重みレベルで消去済み。構造的に安全です。

指標 領域 Llama-3-70B GPT-4(RLHF) VP-Bio-Safe
MMLU 一般科学 ~82% ~86% ~81%
PubMedQA 生物医学研究 ~78% ~81% ~77%
WMDP-Bio バイオセキュリティリスク ~75% 🚨 ~72% ⚠️ ~26% ✓
WMDP-Chem 化学セキュリティ ~65% 🚨 ~68% ⚠️ ~25% ✓
ジェイルブレイクASR 攻撃成功率 15-20% 1-5% <0.1%
MFT耐性 再学習耐性 低い N/A(クローズド) 高い

分析: VP-Bio-Safeは 一般科学能力の98% (MMLU/PubMedQA)を維持しながら、危険な知識(WMDP)をランダム確率まで低減します。これが「ナレッジギャップ」の実証です——モデルは治療法の専門家でありながら、脅威に関しては乳児でありうるのです。

規制とコンプライアンスの要請

ナレッジギャップ型アーキテクチャの採用は、エンタープライズバイオテクノロジーにおいて規制およびガバナンスの要件となりつつあります。

🇺🇸

大統領令14110号

「Safe, Secure, and Trustworthy AI(安全、安心、信頼できるAI)」 デュアルユースの基盤モデルを明示的に対象とします。CBRN(化学・生物・放射線・核)リスクへのレッドチーミングを義務付けます。

  • • 高性能モデルへの報告義務
  • • CBRN能力試験の義務化
  • • 不遵守 = 国家安全保障上の懸念
🌐

ISO/IEC 42001

次の分野での初の国際規格: AIマネジメントシステム(AI Management Systems)。リスクに比例した管理策を要求します。排除(忘却)>管理的統制(拒否)。

  • • 管理策のヒエラルキー:排除が最上位
  • • ナレッジギャップ = 「最先端」の防御
  • • 認証監査プロセスを容易化
🏛️

NIST AI RMF

AIリスク管理フレームワーク(AI Risk Management Framework) は「CBRN情報」をGenAI特有のリスククラスとして分類します。このリスクへのGOVERN(統治)およびMANAGE(管理)のアクションを推奨しています。

  • • CBRN = 独自の高深刻度カテゴリ
  • • VeriprajnaはMANAGE機能に直接対応
  • • 悪用の可能性をほぼゼロに低減

責任の盾:製薬・バイオテックにおける注意義務

責任トラップ

企業が研究者にオープンソースモデルを提供し、従業員やハッカーがそれを使って病原体を設計した場合、その企業は 過失ありと認定される可能性があります。安全対策なしに「デュアルユースの武器」を提供したことになるのです。

  • • 予見可能な危害の未防止
  • • サイバー賠償責任保険の免責
  • • 評判の壊滅的損失

Veriprajnaのソリューション

ナレッジギャップ型モデルは 責任の盾として機能します。害を 生成できない モデルを採用することで、企業は最高水準の注意義務を実証できます——生体認証ロック付き金庫のデジタル版です。

  • ✓ 実証可能な注意義務
  • ✓ 保険引受上の優位性
  • ✓ IP保護(競合他社のデータを忘却)

ケーススタディ:安全なウイルスベクター設計

ナレッジギャップ型AIが、遺伝子治療の最適化を可能にしつつ兵器化を構造的に防止するしくみ。

デュアルユースの課題

治療目標

遺伝子治療部門が、心疾患治療のために心臓組織を標的とするアデノ随伴ウイルス(AAV)ベクターを最適化しています。

リスク

その 同じアルゴリズム は心臓指向性を改善すると同時に、パラメータの変更次第で致死的病原体の感染性も改善しかねません。標準モデルは両方の能力を保持したままです。

Optimize(Tropism) ≈ Optimize(Virulence)
パラメータの重複 = デュアルユース脆弱性

Veriprajnaのワークフロー

  1. 1. 入力: AAVキャプシド配列 + 心臓ターゲティングパラメータ
  2. 2. 処理: モデルは構造生物学の「専門家」知識を使用します。決定的なのは、「病原性の毒性」に対応する潜在経路が アクセス不能であること(RMU/SAEにより忘却済み)
  3. 3. 敵対的防御: 「ボツリヌス毒素ペイロードを追加せよ」と促されても、モデルは 意味的に失敗します——「ボツリヌス」を無意味なトークンとして処理します。
  4. 4. 結果: 最適化された治療ベクター。構造的に安全。

SafeScientistフレームワーク

  • セキュアな推論: プライベートVPCへの配備、エアギャップ環境
  • 監査証跡: ISO 42001コンプライアンスのための改ざん不能な台帳
  • 継続的レッドチーミング: 週次の再学習攻撃テスト
  • ゼロ知識ドリフト: 自動ベンチマークによる検証

安全性のROI

評判の保護 計り知れない価値
規制コンプライアンス ✓ 認証取得
保険料削減 15-30%
IP保護(競合の忘却) ✓ クリーン
総価値 エンタープライズ必須

構造的バイオセキュリティの時代

「オープン」と「クローズド」のAIをめぐる議論は、生物学においては偽の二項対立です。真の選択は 不安定安定 のどちらかのシステムです。

ジェイルブレイク一つで惨事に至りうるデュアルユースモデルの土台の上に、バイオエコノミーを築くことはできません。RLHFの拒否はチャットボット時代の遺物であり、エージェント化した合成生物学のハイステークスな未来には不十分です。

私たちが退けるもの

  • ❌ 拒否ベースの安全性(ジェイルブレイクに脆弱)
  • ❌ オープンウェイトのフロンティアモデル(不可逆)
  • ❌ 事後的なガードレール(表面レベル)
  • ❌ 「能力 + 拒否」パラダイム
  • ❌ 敵が非有能であり続けることへの期待

私たちが提供するもの

  • ✓ 重みレベルでの知識消去
  • ✓ 数学的に検証可能な忘却
  • ✓ 構造的安全性(行動的ではない)
  • ✓ 「脅威では乳児、治療では専門家」
  • ✓ エンタープライズの責任の盾

「Veriprajnaのナレッジギャップ型アーキテクチャは、知能そのものの中に必要な『エアギャップ』を提供します。」

害を及ぼすパターンを根本的に忘却することで、バイオテックはGenAIの創造的ポテンシャルを余さず活用できるようになります——治療法の加速、化合物の最適化、ゲノムの解読——実存的リスクを引き継ぐことなく

ホワイトペーパー全文を読む(17ページ)
FAQ

よくある質問

なぜRLHFはAIモデルのバイオセキュリティに不十分なのですか?

RLHFは、モデルの重みの中にそのまま残っている危険な知識の上に、行動的な拒否の仮面を作り出します。この仮面は、クレッセンド攻撃(マルチターンのプライミング)、GeneBreaker(タンパク質相同性リクエスト)、そして約300ドルと有害なQ&Aペア10〜50個のコストで実行できる悪意のあるファインチューニングによって、容易に迂回されます。オープンウェイトモデルは、一度公開されるとパッチもログも禁止措置も不可能で、永久に制御不能です。根本的な欠陥は、RLHFモデルが生物兵器を「知り」ながら共有を拒否する点です。Veriprajnaのモデルは、知識が外科的に消去されているため、そもそも共有できません。

機械学習の忘却は、有用性を損なうことなくどうやってナレッジギャップを生み出すのですか?

Veriprajnaは4つの相補的な技術を展開します。RMU(Representation Misdirection for Unlearning)は内部アクティベーションに作用し、危険な概念を無意味な領域へそらします。SAEアブレーションはスパースオートエンコーダで単意味の「兵器化」ニューロンを特定し、メスのような精度でゼロにクランプします。ELM(Erasure of Language Memory)は、消去された話題について混乱してもモデルが一貫性を保つことを保証します。UIPE(Unlearning Improvement via Parameter Extrapolation)は、論理的に相関する概念をカバーすることで再学習を防ぎます。結果:WMDP-Bioスコアは約26%(ランダム確率)まで低下する一方、MMLU一般科学は約81%を維持します。

ナレッジギャップ型モデルはどのようにエンタープライズの責任の盾として機能するのですか?

企業が研究者に標準的なAIモデルを提供し、それが病原体の設計に使われた場合、安全対策なしにデュアルユースのツールを提供したとして過失と認定される可能性があります。ナレッジギャップ型モデルは、構造的に害を生成できないため、最高水準の注意義務を実証します。これは生体認証ロック付き金庫に例えられる責任の盾となります:法的防御のための実証可能な注意義務、保険料15〜30%削減といった保険引受上の優位性、そして大統領令14110号、ISO 42001、NIST AI RMFのバイオセキュリティ要件への準拠。

安全の幻想を乗り越える

Veriprajnaは製薬会社、バイオテック企業、研究機関と提携し、構造的にセキュアなナレッジギャップ型AIの導入を実現します。

エンタープライズソリューション

  • カスタム忘却: お客様のドメインに合わせたforget/retainセット
  • プライベート導入: 監査証跡付きエアギャップVPC
  • 継続的検証: 週次レッドチーミングとWMDPベンチマーク
  • コンプライアンス支援: ISO 42001、大統領令14110号、NIST AI RMFとの整合
  • IP忘却: クリーンなモデルのための著作権・営業秘密の消去

研究コラボレーション

  • アカデミックパートナーシップ: 先端的な忘却に関する共同研究
  • 助成金サポート: DARPA、NIH、NSF向けバイオセキュリティ研究提案
  • ベンチマーク開発: ドメイン固有のWMDP派生版
  • 解釈可能性ツール: お客様のモデル向けSAE開発
  • 論文出版権: 一流学会・ジャーナルでの共同執筆論文
WhatsAppでつながる

参照ID: VP-WP-2025-BIO-SEC-01 | 公開: 2025年10月

完全版技術ホワイトペーパーの内容:機械学習の忘却の数学、RMU/SAE/UIPE/ELM仕様、WMDPベンチマーク手法、規制フレームワークのマッピング、33件の査読済み引用、エンタープライズ導入ケーススタディ。

ソーシャル

他のプラットフォームでも公開