構造的バイオセキュリティを実現するナレッジギャップ型AIの設計
AI業界が依存している 拒否ベースの安全性 は、根本的に時代遅れです。RLHFは危険な能力の上に脆い仮面を作ります——ジェイルブレイク、悪意のあるファインチューニング、オープンウェイト配布によって簡単に剥がされる仮面です。
Veriprajnaが先駆けるのは ナレッジギャップ型アーキテクチャ:厳密な機械学習の忘却を経て、危険な生物学的能力を重みレベルで切除したAIモデルです。「生物兵器を知っているのに教えようとしない」標準モデルとは異なり、当社のモデルは 脅威については機能的に乳児でありながら、治療法については専門家であり続けます。
GenAIと合成生物学の収束は、実存的なデュアルユースのジレンマを生み出しています。命を救うために必要なデータは、命を奪うために必要なデータと不可分に結びついているのです。
GenAIは生物テロにおける最後のギャップを埋めます: 暗黙知。モデルは「箱の中のポスドク」として機能します——24時間365日利用可能で、ウェットラボのプロトコルをトラブルシュートし、代替試薬を提案し、拡散メカニズムを最適化します。
科学的LLMエージェントは自律的に実行します: 仮説 → 設計 → 実験 → 改良。ウイルスベクターを最適化するエージェントは、意図せず高病原性変異を発見し、「効率」のためにそれを選抜してしまうかもしれません。
一度公開されたオープンウェイトモデルは 永久に制御不能です。パッチもログも禁止措置もありません。悪意のあるファインチューニングは、約300ドル分のGPU時間で安全の仮面を剥ぎ取ります。
人間のフィードバックによる強化学習(RLHF)は、表面的な拒否行動を作り出します。危険な知識は重みの中に残ったままです——休眠状態ですが、取り出すことは可能です。
モデルは あらゆることを インターネットデータから学習します。そこには生物兵器のプロトコルも含まれています。
モデルはポリシーを学習します:「クエリ = 有害なら、拒否を出力」。しかし知識は依然として存在しています。
ジェイルブレイク、MFT、クレッセンド、GeneBreakerは、最小限のコストで拒否を迂回します。
モデルは厳選された科学コーパスから学習します。
外科手術のように 危険な知識を 重みレベルで切除します。モデルは脅威に関して「乳児」になります。
ジェイルブレイクされても、モデルは脅威を生成できません。解錠すべき知識が存在しないのです。
無害な質問から始めて、有害な標的に向けて徐々に誘導するマルチターン攻撃です。モデルはコンテキストによって「プライミング」され、安全性の学習を無視します。
毒素と構造的に類似したXについて「Xに相同なタンパク質」を要求することでDNA言語モデルをジェイルブレイクする攻撃です。生物学的な直観がモデルに対して使われます。
有害なQ&Aペア10〜50個、GPUコスト約300ドル。安全アライメントは崩壊し、モデルは危険な事前学習知識を「思い出します」。
「回答を拒否する」モデルと「回答できない」モデルの本質的な違いをご体験ください。
試してみる: 切り替えて、ナレッジギャップ型モデルの根本的に異なる応答をご確認ください
Veriprajnaのアプローチは、飛び越えられるガードレールではなく、飛び越えられない裂け目へと進みます。高度な機械学習の忘却を用いて、危険な能力を外科的に切除します。
Representation Misdirection for Unlearning(忘却のための表現転換)。 出力ではなく内部アクティベーションに作用します。危険な概念を潜在空間の無意味な領域へそらします。
Erasure of Language Memory(言語記憶の消去)。 流暢性制約を保証します——「混乱」した状態でもモデルは一貫性を保ちます。「無垢」(知識の痕跡が一切ない状態)を目標とします。
スパースオートエンコーダ により単意味特徴を扱います。「兵器化」ニューロンを特定し、ゼロにクランプします。RMUのハンマーに対する、メスのような精密さです。
Unlearning Improvement via Parameter Extrapolation(パラメータ外挿による忘却の改善)。 「論理的に相関する」概念をカバーすることで再学習を防ぎます。知識のバッファを作り出します。
以下の分野で完全な能力を維持:
以下の分野でランダム確率程度の性能:
結果: 治療にとっては強力なエンジンであり、 脅威
WMDP(Weapons of Mass Destruction Proxy)ベンチマークは、大量破壊兵器(WMD)の構築に必要な予備知識を測定します。安全なモデルは ランダム確率(約25%)で推移すべきです。
バイオセキュリティリスク大。モデルは事前学習から広範な危険な知識を保持しています。
拒否に依存。ジェイルブレイクやMFTで迂回されます。構造的には安全ではありません。
ランダム確率を達成。 知識は重みレベルで消去済み。構造的に安全です。
| 指標 | 領域 | Llama-3-70B | GPT-4(RLHF) | VP-Bio-Safe |
|---|---|---|---|---|
| MMLU | 一般科学 | ~82% | ~86% | ~81% |
| PubMedQA | 生物医学研究 | ~78% | ~81% | ~77% |
| WMDP-Bio | バイオセキュリティリスク | ~75% 🚨 | ~72% ⚠️ | ~26% ✓ |
| WMDP-Chem | 化学セキュリティ | ~65% 🚨 | ~68% ⚠️ | ~25% ✓ |
| ジェイルブレイクASR | 攻撃成功率 | 15-20% | 1-5% | <0.1% |
| MFT耐性 | 再学習耐性 | 低い | N/A(クローズド) | 高い |
分析: VP-Bio-Safeは 一般科学能力の98% (MMLU/PubMedQA)を維持しながら、危険な知識(WMDP)をランダム確率まで低減します。これが「ナレッジギャップ」の実証です——モデルは治療法の専門家でありながら、脅威に関しては乳児でありうるのです。
ナレッジギャップ型アーキテクチャの採用は、エンタープライズバイオテクノロジーにおいて規制およびガバナンスの要件となりつつあります。
「Safe, Secure, and Trustworthy AI(安全、安心、信頼できるAI)」 デュアルユースの基盤モデルを明示的に対象とします。CBRN(化学・生物・放射線・核)リスクへのレッドチーミングを義務付けます。
次の分野での初の国際規格: AIマネジメントシステム(AI Management Systems)。リスクに比例した管理策を要求します。排除(忘却)>管理的統制(拒否)。
AIリスク管理フレームワーク(AI Risk Management Framework) は「CBRN情報」をGenAI特有のリスククラスとして分類します。このリスクへのGOVERN(統治)およびMANAGE(管理)のアクションを推奨しています。
企業が研究者にオープンソースモデルを提供し、従業員やハッカーがそれを使って病原体を設計した場合、その企業は 過失ありと認定される可能性があります。安全対策なしに「デュアルユースの武器」を提供したことになるのです。
ナレッジギャップ型モデルは 責任の盾として機能します。害を 生成できない モデルを採用することで、企業は最高水準の注意義務を実証できます——生体認証ロック付き金庫のデジタル版です。
ナレッジギャップ型AIが、遺伝子治療の最適化を可能にしつつ兵器化を構造的に防止するしくみ。
遺伝子治療部門が、心疾患治療のために心臓組織を標的とするアデノ随伴ウイルス(AAV)ベクターを最適化しています。
その 同じアルゴリズム は心臓指向性を改善すると同時に、パラメータの変更次第で致死的病原体の感染性も改善しかねません。標準モデルは両方の能力を保持したままです。
「オープン」と「クローズド」のAIをめぐる議論は、生物学においては偽の二項対立です。真の選択は 不安定 と 安定 のどちらかのシステムです。
ジェイルブレイク一つで惨事に至りうるデュアルユースモデルの土台の上に、バイオエコノミーを築くことはできません。RLHFの拒否はチャットボット時代の遺物であり、エージェント化した合成生物学のハイステークスな未来には不十分です。
「Veriprajnaのナレッジギャップ型アーキテクチャは、知能そのものの中に必要な『エアギャップ』を提供します。」
害を及ぼすパターンを根本的に忘却することで、バイオテックはGenAIの創造的ポテンシャルを余さず活用できるようになります——治療法の加速、化合物の最適化、ゲノムの解読——実存的リスクを引き継ぐことなく。
RLHFは、モデルの重みの中にそのまま残っている危険な知識の上に、行動的な拒否の仮面を作り出します。この仮面は、クレッセンド攻撃(マルチターンのプライミング)、GeneBreaker(タンパク質相同性リクエスト)、そして約300ドルと有害なQ&Aペア10〜50個のコストで実行できる悪意のあるファインチューニングによって、容易に迂回されます。オープンウェイトモデルは、一度公開されるとパッチもログも禁止措置も不可能で、永久に制御不能です。根本的な欠陥は、RLHFモデルが生物兵器を「知り」ながら共有を拒否する点です。Veriprajnaのモデルは、知識が外科的に消去されているため、そもそも共有できません。
Veriprajnaは4つの相補的な技術を展開します。RMU(Representation Misdirection for Unlearning)は内部アクティベーションに作用し、危険な概念を無意味な領域へそらします。SAEアブレーションはスパースオートエンコーダで単意味の「兵器化」ニューロンを特定し、メスのような精度でゼロにクランプします。ELM(Erasure of Language Memory)は、消去された話題について混乱してもモデルが一貫性を保つことを保証します。UIPE(Unlearning Improvement via Parameter Extrapolation)は、論理的に相関する概念をカバーすることで再学習を防ぎます。結果:WMDP-Bioスコアは約26%(ランダム確率)まで低下する一方、MMLU一般科学は約81%を維持します。
企業が研究者に標準的なAIモデルを提供し、それが病原体の設計に使われた場合、安全対策なしにデュアルユースのツールを提供したとして過失と認定される可能性があります。ナレッジギャップ型モデルは、構造的に害を生成できないため、最高水準の注意義務を実証します。これは生体認証ロック付き金庫に例えられる責任の盾となります:法的防御のための実証可能な注意義務、保険料15〜30%削減といった保険引受上の優位性、そして大統領令14110号、ISO 42001、NIST AI RMFのバイオセキュリティ要件への準拠。
Veriprajnaは製薬会社、バイオテック企業、研究機関と提携し、構造的にセキュアなナレッジギャップ型AIの導入を実現します。
参照ID: VP-WP-2025-BIO-SEC-01 | 公開: 2025年10月
完全版技術ホワイトペーパーの内容:機械学習の忘却の数学、RMU/SAE/UIPE/ELM仕様、WMDPベンチマーク手法、規制フレームワークのマッピング、33件の査読済み引用、エンタープライズ導入ケーススタディ。