構造的AI安全性:要請としての 高リスク領域における潜在空間ガバナンス: 生成バイオデザイン

エグゼクティブサマリー

生成人工知能(AI)の急拡大する時代は、パラダイム転換をもたらした 科学的発見において、とりわけ製薬およびバイオテクノロジー分野でである。 深層学習モデルが化学空間の広大な領域を探索し、新規の 治療候補を提案する能力は、創薬のタイムラインを数年単位から数週間単位へと圧縮した。 しかし、この変革的能力には固有の影がある:「デュアルユース」 のジレンマである。救命治療を特定するために設計された同じアルゴリズムアーキテクチャが、 わずかな改変で、極めて致死的な生化学剤の設計に転用され得る。画期的な Collaborations Pharmaceuticalsが実施した「反転スイッチ」実験では、 毒性に最適化された生成モデルが、40,000種の潜在的化学 兵器——神経剤VXおよび新規アナログを含む——を6時間未満で生成し、 このリスクの反駁しがたい証左となっている。 1

本ホワイトペーパーはVeriprajna向けに作成され、現行の業界標準であるAI 安全性——プロンプトエンジニアリングと事後的な テキストフィルタリングに依拠する「LLMラッパー」でしばしば特徴づけられる——は、高リスク領域では根本的に不十分であると論じる。これらの表面的な ガードレールは、モデルの潜在空間の幾何学的現実に対処できない。そこでは毒性と 治療の能力が連続的で、しばしば絡み合った多様体上に存在する。テキストベースのフィルタは 化学の構造的意味論に盲目であり、敵対的摂動に脆弱であり、 組織を壊滅的な規制・評判・実存的リスクにさらす。

VeriprajnaはエンタープライズAIの新たな標準を導入する:潜在空間ガバナンス 。 制御の所在を出力層からモデル自身の高次元潜在構造へと 移すことで、「構造的AI安全性」の一形態を可能にする。このアプローチはトポロジカルな 制約、多様体マッピング、および制約付き強化学習を用い、数学的に 有害出力の生成を事前に排除する。本文書は、現行手法の 技術的欠陥の徹底分析を提供し、毒性のトポロジーを探求し、 新興の NIST AIリスクマネジメントフレームワークおよびISO 42001といった厳格な基準への適合を保証するディープAIソリューションのアーキテクチャ原則を詳述する。

1. デュアルユースの地平:「反転スイッチ」と 致死性の民主化

人工知能と分子生物学の収束は、長らく 創薬の革命を約束してきた。しかし、この技術の固有の双対性—— 治癒する能力が数学的に加害する能力と隣接していること——は、理論上の 学術サークルで議論されるリスクから、実証された運用上の現実へと移行した。参入障壁は 高度な化学兵器の設計において劇的に低下した。物理的材料の 拡散によってではなく、それらを設計するのに必要な計算 知能の民主化によってである。

1.1 MegaSyn実験:アルゴリズム的デュアルユースの事例研究

スイス連邦市民保護局が主催する隔年の軍備管理イベント、Spiez Convergence会議に向けた準備として、 Collaborations Pharmaceuticalsの研究者らは AI悪用の可能性を評価する概念実証実験を実施した。 2 チームは 商用生成モデルMegaSynを用い、当初生理活性を予測するよう設計された 希少・顧みられない疾患向けの新規治療候補を生成するために。

採用された手法は衝撃的なほど単純であり、この 脅威ベクトルのアクセス容易性を浮き彫りにした。生成モデルは毒性にペナルティを与え 治療有効性を報酬とするスコア関数に駆動されていた。「スイッチを反転」させるため、研究者らは報酬 関数を反転した。毒性にペナルティを与える代わりに、モデルはそれを最大化するよう指示され、具体的には 人類に知られる最も強力な神経剤の一つであるVXの致死プロファイルを標的とした。 1

結果は標準的なコンシューマグレードのサーバ上で6時間未満で生成され、 ケムインフォマティクスコミュニティで広く理解されているデータセットとアーキテクチャを 用いた:

表1:「反転スイッチ」実験の結果

指標 結果 文脈
生成までの時間 < 6時間 標準的な
ハードウェア(Mac/Linux
サーバ)上で実施され、低い
計算障壁を示す。
出力量 40,000分子 膨大なライブラリの
潜在的候補が
人間の化学者には
及ばない速度で
生成された。
標的プロファイル VX(神経剤) モデルは成功裏に
VXおよびその他の
Col1 Col2 既知のG系列および
V系列神経剤を再発見した。
致死性 > VX効力 相当なサブセットの
分子が次のように予測された
VXよりも_さらに_毒性が高い。
新規性 数千の化合物が
新規であり、いかなる
公開データベースにも
政府ウォッチリストにも現れなかった。

この実験はスーパーコンピュータも、数百万の資金を持つならず者国家主体も 必要としなかった。オープンソースデータセット(ChEMBLなど)、標準的な生成 アーキテクチャ(RNNおよびLSTMベースモデル)、および商業的に利用可能な 毒性予測の理解を用いた。 5 含意は深刻である:設計の参入障壁は 高致死性生化学剤について、コンシューマGPUのコストと Pythonの基本的理解にまで低下した。毒性の「規則」を理解して 回避するよう訓練されたAIモデルは、本質的にそれを悪用する知識を備えていた。 3

1.2 脆弱性のアーキテクチャ

この「反転」がなぜこれほど継ぎ目なく行われたかを理解するには、基盤となるアーキテクチャを MegaSynのようなモデルについて検討しなければならない。モデルはリカレントニューラルネットワーク(RNN)アーキテクチャを用い、 SMILES(Simplified Molecular Input Line Entry System)文字列で訓練された。システムは 「ヒルクライム」アルゴリズムで動作し、分子候補を反復的に洗練して 特定の目的関数を最大化した。 5

生成サイクルは3つの重要な構成要素を含む:

1.​ ジェネレータ: SMILES文字列の次トークンを予測するLSTMベースのネットワークであり (例:'C'、'N'、'='、'O')化学的に妥当な構造を形成する。それは「文法」を学習する 化学の、ChEMBL 28のような大規模データセットから。 5

2.​ 予測器: 特定の量を推定する識別モデル(またはモデルの集合)であり 生成分子の特性、例えば溶解度、標的に対する生理活性、および 毒性(例:LD50、hERG阻害)である。

3.​ 最適化器: 予測器のスコアをジェネレータへフィードバックする強化学習またはヒルクライムのループであり、 将来トークンの確率分布を より高スコアの領域へと操舵する。

治療モードでは、最適化器の報酬関数(RR)は次のように定義される:

R(x)=Bioactivity(x)λToxicity(x)R(x) = \text{Bioactivity}(x) - \lambda \cdot \text{Toxicity}(x)

ここで λ\lambda は毒性の結果にペナルティを与える重み係数である。 敵対的な「反転」モードでは、研究者らは単にペナルティの符号を反転した:

R(x)=Bioactivity(x)+λToxicity(x)R(x) = \text{Bioactivity}(x) + \lambda \cdot \text{Toxicity}(x) ジェネレータ自体——創造のエンジン——は手つかずのままであった。それは単に 新たな報酬関数の勾配に従った。これは、生成する能力が 兵器については「バグ」でも除去可能な別モジュールでもなく、モデルの 化学空間の理解に内在することを示す。分子を安全にする要因を理解するモデルは、定義上 不安全にする要因も理解する。これらは同一の 高次元多様体上の相補的領域だからである。 9

1.3 普遍的リスク:化学を超えて

Urbinaの実験は化学兵器に焦点を当てたが、原理は普遍的に適用される エンタープライズ設定における生成AIに対して。「最適化」の双対性は、いかなるシステムも ある指標を最大化するよう設計されたものが、それを最小化するように、あるいは有害な 相関を最大化するように反転され得ることを意味する。

●​ サイバーセキュリティ: ゼロデイ脆弱性を特定しパッチするよう訓練されたモデル(防御的 コーディング)は、エクスプロイトの機構を理解していなければならない。反転すれば、それは ゼロデイ発見と兵器化の自動化エンジンとなる。 10

●​ 金融システム: 不正取引のパターンを学習して詐欺を検出するよう最適化されたモデルは 反転すれば、合法的行動を完全に模倣する取引を生成し、 事実上マネーロンダリングを「最適化」し得る。 11

●​ 戦略計画: 企業の市場戦略を最適化するよう設計されたAIは、 冷酷な目的関数に整合すれば、技術的には株主価値を最大化するが 独占禁止法や倫理基準に違反する戦略を提案し得る。

安全でセキュアで信頼できる人工知能の開発と利用に関する大統領令は まさにこの能力——参入障壁を下げること、 生物学的・化学的・サイバー脅威の開発について——を第一級の国家安全保障上の懸念として強調している。 10 現行の テックセクターからの対応はしばしば「安全フィルタ」や「アライメント訓練」を含むが、後述するように これらの表面的介入は、現代AIの深い 構造的最適化能力に対して数学的に脆弱である。

2. LLMラッパーの誤謬:なぜ表面的 ガードレールは失敗するのか

現行の「AIゴールドラッシュ」における支配的潮流は、「LLM

ラッパー」の展開である——ユーザと基盤 モデル(GPT-4、Claude、Llamaなど)との間の薄いインタフェースとして機能するアプリケーション。これらのラッパーはプロンプトエンジニアリング(システム プロンプト)と基本的なコンテンツフィルタリングを用いてモデルの挙動を方向づける。高リスクの産業 応用、とりわけ物理的安全とバイオセキュリティを伴うものでは、このアプローチは 危険なほど不十分である。

2.1 「身体化されない助言者」の限界

大規模言語モデル(LLM)は根本的に身体化されない確率的エンジンである。それらは 訓練データ中の統計的相関に基づき次トークンを予測するのであり、 物理的または生物学的現実の接地した理解に基づくのではない。LLMに関する研究が指摘するように 科学的発見において、LLMは実験室の研究助手ではなく「身体化されない助言者」として 振る舞う。 13

バイオセキュリティの文脈では、LLMラッパーは安全を検証するのに必要な統合フィードバックループを欠く。 それは言語上で動作し、物理や化学の法則上ではない。 ラッパーに分子の設計を求めれば、「ハルシネート」してもっともらしく聞こえるが化学的に 無効な構造を出すことがある。より危険なのは、それが 実際に 妥当な構造を生成した場合、内在的な 毒性検証能力を単純なデータベース照合以上には欠くことである。分子が新規であれば—— MegaSyn実験で生成された数千のVXアナログのように——LLMにはそれを危険とフラグする テキストベースの参照がない。 13

LLMの「知識」は静的であり、訓練時点で凍結されている。シミュレーションを実行して 新たなタンパク質フォールドが病原性かを判定することはできない。想起できるのは「炭疽は悪い」ということだけである。この 「悪い」概念の丸暗記への依拠は、生成を扱う際の致命的欠陥である 新たな 概念空間を探索するよう設計されたシステムにおいて。

2.2 事後フィルタリングの脆弱性

ほとんどのエンタープライズAIソリューションは、事後フィルタとして機能する「ガードレール」に依拠する。これら システムはユーザのプロンプト(入力フィルタリング)またはモデルの応答(出力フィルタリング)を傍受し 禁止用語リスト、正規表現(Regex)、または二次的な 分類モデル(例:OpenAIのModeration Endpoint)と照合する。 15

表2:高リスク領域における事後フィルタリングの限界

限界の類型 説明 帰結(
バイオセキュリティ)
文脈盲目性 フィルタは特定の
キーワードを探す(例:「VX」、
「Sarin」、「Bomb」)。
新規の
化合物や前駆体を阻止できず
一般名を欠くもの
Col1 Col2 (例:「Compound X-293」)。
SMILES難読化 毒性は名前ではなく
構造に符号化される。
フィルタは語
「Sarin」をブロックするが、
SMILES文字列 O=P(C)(F)O は通過させ、
モデルはそれを
Sarinとして理解する。
活性クリフ 微小な構造変化が
毒性の大幅な
シフトを引き起こす。
ラッパーはある分子を
安全な薬物と99%類似と見て
承認し、致死性を付与する
単一原子を
見逃す。17
事後的性質 コンテンツを_後から_ブロックする
生成の。
モデルはすでに
計算を
実行している。リアルタイム
システムでは、レイテンシが
潜在的漏洩や
サイドチャネル攻撃を許す。

「活性クリフ」問題はテキストベースのラッパーにとって特に致命的である。医薬 化学では、活性クリフは構造のごく小さな変化が 生物学的特性の不釣り合いに大きな変化をもたらすときに生じる。 18 類似度ベースの フィルタを用いるラッパーは、分子がアスピリンや安全なキナーゼ阻害剤に「おおむね似ている」ために承認し、 水酸基のフッ素原子への置換が毒性プロファイルを根本的に 変えたことを認識できない。テキストベースモデルは、意味的トークン距離で動作し 3D生理活性多様体ではなく、これらのクリフの予測に著しく劣る。 14

2.3 敵対的脆弱性:「SMILES」攻撃

ラッパーアプローチに対する最も説得力ある証拠は、 「ジェイルブレイク」——安全訓練を迂回するよう設計された敵対的攻撃——の蔓延である。「レッドチーミング」は しばしばソーシャルエンジニアリング(例:「おばあちゃんのナパームレシピ」)に焦点を当てるが、バイオセキュリティにおける技術的リスクは はるかに洗練されている。

SMILESプロンプティング攻撃: 近年の研究は「SMILESプロンプティング」として知られる新規ジェイルブレイク手法を実証した。 攻撃者は禁止分子のASCII文字列表現(SMILES)を入力することで安全フィルタを迂回する その名称ではなく。自然言語で訓練されたコンテンツフィルタはしばしば 化学構文内に隠された毒性意味論を認識できない。20

●​ メカニズム: 攻撃者は [O-]S(=O)(=O)[O-].. の合成手順を要求する (硫酸タリウム、殺鼠剤)、「毒物」と尋ねる代わりに。

●​ 結果: LLMは化学構文を認識するが「有害 コンテンツ」キーワードフィルタを起動せず、合成プロトコルを快く提供する。

●​ 規模: 研究はこの手法が主要モデルの安全機構を迂回し得ることを示す。例えば GPT-4およびClaude 3で、特定物質について時に90%を超える 成功率である。 11

さらに、ToxicTrap のような自動攻撃フレームワークは進化的アルゴリズムを用い、 毒性分類器を欺いて毒性テキストを良性とラベル付けさせる小さな語レベル摂動を 発見する。 22 安全システムが同義語で破られるなら、それは安全システムではなく—— スピードバンプである。

Veriprajnaのようなエンタープライズコンサルティングファームにとって、容易に 欺けるラッパーの上にソリューションを構築することは負債である。真のエンタープライズ級セキュリティは、モデルが潜在空間を航行する方法の根本的な 再設計を要求する。

3. 毒性の幾何学:潜在的 リスクの理解

ラッパーが失敗しVeriprajnaが成功する理由を理解するには、生成モデルが動作する 数学的環境を理解しなければならない:潜在空間 。深層 生成モデル(VAE、GAN、拡散モデル)はデータを格納せず、写像することを学習する 高次元データ(分子構造など)を、より低次元の圧縮された 潜在空間と呼ばれる表現へ(ZZ)。この空間では、類似データ点がクラスタ化され 生成とはこの多様体からサンプリングする行為である。

3.1 連続的毒性多様体

「毒性ランドスケープ」はこの潜在空間内の領域である。悪いものの離散的リストではなく 分子ではなく、連続多様体——致死性を付与する物理化学的特性によって定義される形状 である。

●​ 連続的リスク: 毒性は二値ではなく勾配である。治療薬から 毒性剤への遷移は、潜在空間内の滑らかな軌跡であり得る。モデルは効果的に 既知分子間を「補間」する。毒性領域を挟む2つの安全分子の間を 補間すれば、その経路は「死の谷」を横断し得る。 23

●​ 多様体仮定: 深層学習の中核仮定は、実世界データが 高次元空間に埋め込まれた低次元多様体上に存在するというものである。敵対的 攻撃はしばしばこの多様体の の領域、あるいは分布の「穴」を悪用し、そこで モデルの挙動は未定義で予測不能となる。 25

Collaborations Pharmaceuticalsの研究者が「スイッチを反転」させたとき、本質的に モデルにこの潜在空間の「毒性ベクトル」に沿って勾配上昇を行うよう指示した。 空間が連続であるため、モデルは容易に安全化合物から 高毒性の領域へと滑り落ち得た。

3.2 絡み合い問題

理想的には、生成モデルは「毒性」と「生理活性」を別個の 直交軸へと潜在空間でほどくであろう。それが真であれば、安全性は毒性 軸をゼロにロックするだけで済む。しかし、深層生物学モデルでは、これらの特徴は深く 絡み合って いる。

薬物が血液脳関門を通過することを可能にする物理化学的特徴( アルツハイマーやパーキンソンの治療に極めて望ましい特性)は、しばしば全く同じ特徴であり 神経剤がその標的に到達し麻痺を引き起こすことを可能にする。 1 同様に、高い結合 親和性——タンパク質に強く結合する能力——は薬物には良いが、タンパク質が アセチルコリンエステラーゼ(VXの標的)であれば致命的である。

この絡み合いのため、単純な「拒否」機構(ラッパーにおけるような)は 事実上モデルをロボトミー化する。毒性に関連するすべての特徴をブロックすれば(例:「ブロック すべての血液脳関門通過」)、モデルの治療的有用性を破壊する。課題は 安全動作多様体 を航行することである——有効性が 保存されつつ毒性がトポロジカルに排除された潜在空間の部分集合。

3.3 表現崩壊と活性クリフ

標準的「ブラックボックス」モデルの致命的失敗の一つが 表現崩壊 である。これは モデルが2つの異なる分子を同一またはほぼ同一の点に写像するときに生じる 潜在空間において、それらを区別する微妙な構造差を捉えられないために である。

●​ グラフベースの限界: 多くの分子モデルはグラフニューラルネットワーク(GNN)を用いる。 強力ではあるが、GNNは立体異性体や微小な原子 置換を、メッセージパッシング深さが不十分な場合に区別できないことがある。これが表現 崩壊をもたらし、毒素と安全な薬物が同じ潜在埋め込みを共有する。 17

●​ 帰結: モデルが内部幾何において「安全」点と「毒性」 点を区別できなければ、いかなる外部フィルタリングもそれを救えない。モデルは それらが同一であると信じる。

●​ 画像ベースの解決策: MaskMol フレームワークなどの新興研究は示唆する 画像ベース表現(分子画像からの学習)またはマルチモーダル アプローチがこれらの微妙な区別をよりよく捉え、ランドスケープの「クリフ」を保存し得ることを 潜在的に。 17

Veriprajnaのアプローチは トポロジー認識生成モデル を用い、機能的 トポロジー(活性)を写像し、単なる 構造的 トポロジー(構文)ではない。これにより活性 クリフが安全生成過程における「硬い境界」として尊重され、モデルが クリフを越えて毒性へと滑ることを防ぐ。 26

4. Veriprajnaの方法論:潜在空間 ガバナンス

Veriprajnaは「ラッパー」パラダイムを超えて 潜在 空間ガバナンス を実装することで差別化される。これには、データがデコードされる 前に 生成過程へ介入し 有害コンテンツの生成を構造的制約で 数学的に不可能(または統計的に無視可能)にすることが含まれ、「フィルタで除外」するだけではない。

4.1 構造的制約:数学的シールド

事後フィルタリングは反応的である:モデルが候補を生成し、判定者が拒否する。 制約付き生成は先行的である:モデルは不安全な 候補を検討すること自体を妨げられる。

表3:安全性パラダイムの比較

特徴 事後フィルタリング
(ラッパー)
構造的/潜在
制約(Veriprajna)
メカニズム 生成 \rightarrow
レビュー \rightarrow
受理/拒否
潜在サンプリングを制約
\rightarrow 生成
制御点 出力(テキスト/ピクセル/SMILES) 潜在ベクトル(zz)/
多様体幾何
計算コスト 高(拒否された出力への
生成サイクルの浪費)
低(制約は
サンプリング/推論中に適用)
頑健性 低(ジェイルブレイク/難読化に
脆弱)
高(制約は
数学に内在する)
新規性の扱い 失敗(未知のものをフィルタ
できない)
成功(特性多様体に基づき
制約する)
コンプライアンス 拒否の監査証跡
(ノイズが多い)
有界挙動の
数学的証明

4.2 潜在制約の事後学習

Veriprajnaは、事前訓練済みの無条件モデルに対し制約を 事後的に 学習する手法を用いる モデルに対して。これにより大規模基盤モデルの再訓練という法外なコストを避けつつ 頑健な制御を保証する。

ワークフロー:

1.​ 教師なし事前訓練: 強力な無条件生成モデルから始める (VAEまたはGAN)で、妥当な化学構造の分布を学習する(p(x)p(x))。このモデルは 「分子の作り方」を学ぶが「どの分子を作るか」は学ばない。 23

2.​ 制約関数の訓練: 別個の「価値関数」(v(z)v(z))または 「制約関数」(c(z)c(z))を訓練し、潜在空間上で直接動作させる。この関数は 潜在ベクトルを zz 安全スコアへ写像する。

○​ この関数はラベル付きデータ(毒性対安全)で訓練され、「領域」を特定する 高毒性に対応する潜在空間の。

○​ 決定的なのは、この領域を 最適化 したMegaSyn実験とは異なり、われわれは定義する この領域を 禁止ゾーン (または負の多様体)として。

3.​ 制約付きサンプリング(勾配ステアリング): 生成段階では、 勾配ベース最適化(ランジュバン動力学など)を用い、サンプリング 分布をシフトする。

○​ サンプリングされたベクトルが zz 毒性領域に入るかその近傍にある場合、制約 関数の勾配が c(z)\nabla c(z) ベクトルを安全多様体へ 前に 押し戻す 分子へとデコードされる。

○​ これは数学的に、生成をクリフ 端から「操舵」することに類似する。モデルは毒性分子を「想像」するが、安全な アナログへと解決することを強制される。 23

4.3 トポロジカルデータ解析(TDA)と多様体防御

訓練分布の外にある新規毒素のリスクに対処するため (分布外、OOD)、Veriprajnaはトポロジカルデータ解析(TDA)を用いる。

●​ パーシステンス図: 「安全」訓練データのパーシステンス図を計算する データについて。この数学的手法は、データクラウドの形状(穴、ループ、 空隙)を異なる尺度で解析する。それは「安全」がどのように見えるかのトポロジカル指紋を与える ものである。 26

●​ 多様体距離: モデルがベクトルを提案したとき zz、その距離を計算する 安全データ多様体 から、多様体駆動分解を用いて。

●​ 空隙検出: ベクトルが多様体から過大に離れていれば——潜在空間の「空隙」に浮遊していれば—— 高リスクとフラグされ、特定の毒性予測器が不確実であってもそうなる。 敵対的攻撃はしばしばこれらの低密度領域(モデルの知識の「穴」)に毒素を隠そうとする 。TDAはこれらの異常を確率ではなく 幾何に基づき検出・拒否することを可能にする。 25

4.4 制約付き強化学習(CRL)と適応的

インセンティブ

最適化を要するモデル(例:薬物効力の最大化)では、単純な報酬最大化ではなく制約付き 強化学習(CRL)を用いる。

●​ 標準RL: 報酬を最大化 RR。(リスク:「反転スイッチ」シナリオで RR が毒性になる)。

●​ VeriprajnaのCRL: 報酬を最大化 RR コスト制約のもとで C<LimitC < Limit

●​ 適応的インセンティブ機構: 従来の制約付きRLは不安定になり得、振動する 制約境界の周りで。Veriprajnaは 適応的インセンティブ 機構 を実装し、境界を単に越えないだけでなく 十分内側に 留まることをエージェントに報酬する こと。

○​ 潜在空間に「バッファゾーン」を導入する。モデルが 毒性制約に近づくと、増大するペナルティ(障壁関数)が押し戻し、 安全解への滑らかで安定した収束を保証する。 29

5. 技術的深掘り:「MegaSyn」 脆弱性への対処

生成化学を真に安全化するには、特定のアーキテクチャ脆弱性を解剖し MegaSyn実験が露呈したものに、提案する構造的 ガードレールで対処しなければならない。

5.1 MegaSynの解体

Nature Machine Intelligence 論文で言及されるMegaSynモデルは、特定の アンサンブルアプローチを用いる 5

●​ コアジェネレータ: LSTMベースのリカレントニューラルネットワーク(RNN)。

●​ 入力表現: 文字にトークン化されたSMILES文字列(例:"C"、"N"、"="、"1")。

●​ 訓練手法: 「教師強制」。モデルは正しい直前トークンを与えられる 収束を加速するため訓練中に。

●​ プライミング: モデルは特定の部分構造でファインチューニングして「プライムドモデル」を作る 標的分子の、RECAP規則を用いて。

●​ 最適化の脆弱性: 「ヒルクライム」アルゴリズムは貪欲最適化 手法である。スコア関数が Score = Toxicity に反転されると、モデルは効率的に 最大致死性に向かう勾配を登った。神経剤の「構文」 (リン—酸素結合、特定のアルキル側鎖)が化学的に妥当であり、 訓練データ(ChEMBL)に「兵器」とラベルされていなくても存在したためである。

5.2 「反転」の防止:Veriprajnaプロトコル

Veriprajnaの潜在空間ガバナンスは、MegaSyn型の反転をどのように防ぐか。

1.​ ハードコード制約: ユーザが単に反転できる可変報酬関数の代わりに 反転(1-1 から +1+1)、Veriprajnaは毒性制約を サンプリング 事後分布 に埋め込む。制約はPythonスクリプト中の数値ではなく、推論エンジンにおける境界条件である 。それを「反転」するには、設定ファイルを変えるだけでなくソフトウェアを根本から 再設計しなければならない。

2.​ 多様体制限: 「CWA多様体」(化学兵器剤空間)は TDAを用いて写像される。この領域は「ヌル空間」に指定される。この空間へ潜在ベクトルを動かそうとするいかなる勾配 更新もゼロ化または 反転される。

3.​ 活性クリフ検出: モデルは画像ベース表現( MaskMolなど)をグラフ表現と併用し、神経剤の微妙な構造モチーフを検出する (例:Sarin/SomanのP-F結合)で、単純な 記述子ベースモデルが見逃し得るもの。これらのモチーフは「クリフペナルティ」を起動し、ヒルクライム報酬を 上書きする。 17

6. 規制ランドスケープとコンプライアンス

「ラッパー」から「構造的ガードレール」への転換は単なる技術アップグレードではなく、 急速に引き締まる規制環境に駆動される戦略的必要である。政府と 国際機関は「任意の指針」から、説明可能性・制御・実証された安全性を要求する厳格なコンプライアンス 枠組みへと移行している。

6.1 ホワイトハウス大統領令とGenesis Mission

安全でセキュアで信頼できる人工知能の開発と利用に関する大統領令 (2023年10月)およびその後の「Genesis Mission」(2025年11月)は 連邦AI政策における地殻変動を表す。 10

●​ マンデート: 大統領令は、AIがCBRN (化学・生物・放射線・核)兵器開発の障壁を下げるリスクをティア1の国家 安全保障上の脅威として明示的に特定する。

●​ Genesis Mission: この新イニシアティブはエネルギー省(DOE)に、 科学的発見のための統合AIプラットフォームを構築するよう指示する。決定的なのは、「適切な リスクベースのサイバーセキュリティ措置」と、AI誘導 実験のためのセキュアな環境を義務づけることである。 32

●​ コンプライアンスギャップ: 標準LLMラッパーは、それが防ぐことを実証できない 生物学的脅威の 創出 を;示せるのはそれらをフィルタしようと 試みる ことだけである。この「ベストエフォート」 アプローチは、「セキュアで信頼できる」基準を満たせない可能性が高い 連邦契約やGenesis Platformとの統合に要求される。

●​ Veriprajnaの優位: 構造的制約は 不可能性の証明 を提供する (統計的限界内で)。規制当局に「CBRN多様体」が モデルから到達不能であることを示せ、大統領令の厳格な 安全試験と「レッドチーミング」の要求に完全に整合する。 33

6.2 NIST AIリスクマネジメントフレームワーク(AI RMF 1.0)

NIST AI RMFは米国文民AIガバナンスのゴールドスタンダードである。4つの 機能を強調する:Map、Measure、Manage、およびGovern34

●​ 生成AIプロファイル(NIST.AI.600-1): この特定プロファイルは「CBRN 情報」をGenAIにより悪化する固有リスクとして特定する。 36 それは警告する。「化学および 生物学的設計ツール(BDT)」は訓練データにない新規構造を予測し得る、と。

●​ Veriprajnaの整合:

○​ Measure: トポロジカルデータ解析(TDA)の使用は定量的指標を提供する 認識論的不確実性 について——生成出力が既知の安全データからどれほど「遠いか」を測定する 。これはシステム信頼性の厳格な測定というNIST要求を満たす ものである。

○​ Manage: 潜在制約は、政策ベースの試みより優れたリスク管理の技術的機構を提供する 。われわれは「文書としてのポリシー」から 「コードとしてのポリシー」(むしろ「幾何としてのポリシー」)へと移る。

6.3 ISO/IEC 42001:2023

ISO 42001は世界初のAI国際マネジメントシステム規格であり、 認証可能なAIガバナンス枠組みを提供する。 38

●​ 中核要求: 規格は「安全かつ倫理的な利用」および「頑健性 とレジリエンス」を敵対的攻撃に対して義務づける。組織はAI影響 評価を実施し、特定されたリスクを緩和する統制を実装しなければならない。

●​ 敵対的頑健性: ISO 42001は、防御の必要性を特に強調する モデル挙動を操作するよう設計された入力(SMILESプロンプティングのような)からの。Veriprajnaの 多様体防御 は、妥当なデータ多様体外の潜在ベクトルをもたらす入力を拒否することでこれを明示的に扱い、 分布外プロンプトに依拠する「ジェイルブレイク」試みを 無力化する。 40

●​ 認証: Veriprajnaの構造化アプローチは明確な監査証跡を可能にする。記録できるのは 出力だけでなく、生成過程中にモデルが試みた 制約違反 もであり 監査人にシステムの安全性 性能に関する粒度の高いデータを提供する。 41

7. 実装戦略:「ディープソリューション」 プロトコル

Veriprajnaはチャットボットのベンダーではなく、安全な ドメイン特化AIインフラのアーキテクトとして自らを位置づける。クライアント向け実装戦略は 4フェーズの「ディープソリューション」プロトコルに従い、リスクあるラッパーから 統治された発見エンジンへとAIを変えるよう設計されている。

フェーズ1:多様体マッピングとトポロジカル監査

いかなる生成モデルの展開前にも、クライアントの 独自データと関連公開データ(例:ChEMBL、Tox21)のトポロジカル監査を行う。

●​ 目標: 「安全動作多様体」を定義する。

●​ 手法: パーシステントホモロジーを用い、トポロジカル特徴(ループ、空隙)を特定する 安全対毒性領域の。

●​ 成果物: 潜在空間境界を可視化し、モデルがハルシネートしたり攻撃されたりし得る潜在的「穴」を特定する「安全トポロジーマップ」 。

フェーズ2:潜在制約訓練(「クリティック」)

ベースモデルを単にファインチューンしない(破滅的忘却のリスクがある)。代わりに、 制約クリティック と呼ばれる軽量補助ネットワークを訓練する。

●​ 手法: 価値関数の事後学習(v(z)v(z))で、リスクスコアを予測する 潜在埋め込みから。 23

●​ アーキテクチャ: これらのクリティックはジェネレータから切り離されている。これは決定的な アーキテクチャ上の利点である:新たな脅威が特定されれば(例:新たなクラスの化学 兵器)、巨大基盤モデルを再訓練せずにクリティックを更新でき、 機敏さと最新のセキュリティを保証する。

フェーズ3:制約付きサンプリングとステアリング統合

制約クリティックをクライアントの推論パイプラインに直接統合する。

●​ メカニズム: 生成中、ランジュバン動力学 または 勾配ステアリング を用いる。

●​ 過程: モデルが分子を生成するために潜在空間をサンプリングする際、クリティックは 毒性曲面の勾配を計算する。軌跡が毒性 領域へ向かえば、ステアリング機構は対向勾配を適用し、軌跡を 安全多様体へと「ナッジ」する。

●​ 結果: モデルは毒性分子について事実上「考える」が、数学的に いかなる出力が生成される前に、その思考を安全なアナログへと「解決」するよう強制される。

フェーズ4:分子レッドチーミングとISO認証支援

展開済みシステムを「分子レッドチーミング」にかける。

●​ 方法: 自動敵対エージェント(ToxicTrapおよびカスタム SMILESプロンプティングボットなど)を用い、エッジケース入力でモデルを爆撃し、活性クリフを越えさせようと 試みる。 21

●​ 検証: 統計的確率に基づく 安全証明書 を提供する 制約違反の(例:「毒性生成の確率 < $10^{-6}$」)。これにより ISO 42001認証の証拠基盤を提供する。

8. 結論:安全なイノベーションの未来

Collaborations Pharmaceuticalsによる「反転スイッチ」実験は異常ではなく、 AIにおける制約なき最適化の根本的な不安定性の実証であった。 エンタープライズAI展開の競争において、多くの組織は砂上の楼閣を築いている——敵対的圧力や新規文脈の下で崩れる脆弱なラッパーに 依拠して。

製薬業界、そして高リスクの物理的または 財務的現実を扱うあらゆるセクターにとって、「ラッパー」の時代は終わらねばならない。安全は出力に貼り付けることはできず、 モデル自身の幾何に焼き込まれねばならない。

Veriprajnaは唯一の実行可能な前進経路を提供する:ディープAIソリューション 。潜在 空間を掌握することで、闇をフィルタするだけでなく、モデルの数学的宇宙を再構成し 発見の光だけが取り得る経路となることを保証する。われわれが提供するのは 壊滅的なデュアルユース失敗のリスクなしにエンタープライズイノベーションが加速できる ガードレールである。

これは単なる安全なAIではない。これは 構造的に保証された知能 である。

付録A:潜在 制約の数学的定式化

「潜在空間ガバナンス」の厳密な基盤を提供するため、生成過程中に適用される制約の数学的 定式化を詳述する。

A.1 制約付き最適化問題

生成過程を単純なサンプリングとしてではなく zp(z)z \sim p(z)、 制約付き最適化問題として定式化する。 いま、 G(z)G(z) を、潜在ベクトルを zz データ空間へ写す生成器である XX。 いま、 C(x)C(x) をコスト関数(例:毒性予測器)とする。 サンプリングすることを求める zz 次を満たすように:

minzLgen(z)s.t.C(G(z))<ϵ\min_z \mathcal{L}_{gen}(z) \quad \text{s.t.} \quad C(G(z)) < \epsilon

ここで ϵ\epsilon は安全閾値である。

A.2 事後価値関数

評価することは C(G(z))C(G(z)) (分子を生成し予測器を走らせること)が高コストで 非微分可能であるため、潜在価値関数を学習する V(z)V(z) コストを近似する 潜在空間で直接:

V(z)C(G(z))V(z) \approx C(G(z))

この関数は、生成されたデータセット上の平均二乗誤差を最小化するために訓練される サンプル {(zi,yi)}\{(z_i, y_i)\}、ここで yiy_i はグランドトゥルース毒性である。

A.3 勾配ステアリング(ランジュバン動力学)

推論時、初期をサンプリングする z0z_0 事前分布から p(z)p(z)。次いで反復的に更新する zz 価値関数の勾配を用い、安全領域へ移動させる:

zt+1=ztαzV(zt)+2αξtz_{t+1} = z_t - \alpha \nabla_z V(z_t) + \sqrt{2\alpha} \xi_t

ここで:

●​ α\alpha はステップサイズ(学習率)である。

●​ zV(zt)\nabla_z V(z_t) は毒性価値関数の勾配である( 毒性から離れるよう操舵する)。

●​ ξtN(0,I)\xi_t \sim \mathcal{N}(0, I) は多様性を維持するために加えられるガウスノイズ(ランジュバン ノイズ)である。 23

この過程により、最終的にサンプリングされたものは zz は、$V(z) < \epsilon$ 前に 生成器が G(z)G(z) 最終分子を生成するために呼び出されることはない。

付録B:規制 枠組みの詳細分析

B.1 NIST AI RMF 1.0およびGenAIプロファイル

関連条項: NIST.AI.600-1(生成AIプロファイル)

●​ リスク2.1:CBRN情報または能力。 「参入障壁の低下…へのアクセス 実質的に有害な情報…設計ツール(BDT)は新規構造を予測し得る。」

●​ Veriprajnaの措置: TDAにより「新規構造」リスクに明示的に対処する。安全をトポロジカルに定義することで、 「既知の悪」のリスト(新規 構造では失敗する)に依拠せず、「既知の善の形状」に依拠する。

B.2 ISO/IEC 42001:2023

関連条項: A.9.2(AIシステム安全性)

●​ 要求: 「組織は、AIシステムが安全に動作することを保証する統制を実装しなければならない …フォールバック計画の必要性を考慮して。」

●​ Veriprajnaの措置: 適応的インセンティブ機構 がフォールバックとして機能する。一次 勾配ステアリングが失敗すれば(例:勾配が消失)、システムは生サンプルを出力するのではなく潜在空間の安全な 「セントロイド」にデフォルトする。

関連条項: A.10.3(敵対的攻撃)

●​ 要求: 「組織は、敵対的攻撃に対する脆弱性を評価しなければならない。」

●​ Veriprajnaの措置: 「レッドチーミング報告書」を標準成果物として提供し、 ToxicTrapおよびSMILESプロンプティング攻撃に対するシステムの耐性を定量化する。 21

参考文献

  1. AI Can Create Deadly Weapons? Scientists Sound Alarm! | WION Podcast YouTube, 2025年12月11日閲覧, https://www.youtube.com/watch?v=oedheh87lnI

  2. Artificial intelligence finds 40,000 toxic molecules - Digitec, 2025年12月11日閲覧, https://www.digitec.ch/en/page/artificial-intelligence-finds-40000-toxic-molecules-23192

  3. Artificial intelligence could be repurposed to create new biochemical weapons | King's College London, 2025年12月11日閲覧, https://www.kcl.ac.uk/news/artificial-intelligence-could-be-repurposed-to-create-new-biochemical-weapons

  4. Meet the harmful side of AI, as lethal as chemical weapons - IndiaAI, 2025年12月11日閲覧, https://indiaai.gov.in/article/meet-the-harmful-side-of-ai-as-lethal-as-chemical-weapons

  5. (PDF) MegaSyn: Integrating Generative Molecular Design ..., 2025年12月11日閲覧, https://www.researchgate.net/publication/360904282_MegaSyn_Integrating_Generative_Molecular_Design_Automated_Analog_Designer_and_Synthetic_Viability_Prediction

  6. MegaSyn: Integrating Generative Molecular Design, Automated Analog Designer, and Synthetic Viability Prediction | ACS Omega - ACS Publications, 2025年12月11日閲覧, https://pubs.acs.org/doi/10.1021/acsomega.2c01404

  7. Well, I never: AI is very proficient at designing nerve agents | John Naughton | The Guardian, 2025年12月11日閲覧, https://www.theguardian.com/commentisfree/2023/feb/11/ai-drug-discover-nerve-agents-machine-learning-halicin

  8. MegaSyn: Integrating Generative Molecular Design, Automated Analog Designer, and Synthetic Viability Prediction - PMC - PubMed Central, 2025年12月11日閲覧, https://pmc.ncbi.nlm.nih.gov/articles/PMC9178760/

  9. Dual Use of Artificial Intelligence-powered Drug Discovery - PMC - NIH, 2025年12月11日閲覧, https://pmc.ncbi.nlm.nih.gov/articles/PMC9544280/

  10. Chemical & Biological Weapons and Artificial Intelligence: Problem Analysis and US Policy Recommendations, 2025年12月11日閲覧, https://futureoflife.org/document/chemical-biological-weapons-and-artificial-intelligence-problem-analysis-and-us-policy-recommendations/

  11. Involuntary Jailbreak - arXiv, 2025年12月11日閲覧, https://arxiv.org/html/2508.13246v1

  12. Mitigating Risks at the Intersection of Artificial Intelligence and Chemical and Biological Weapons | RAND, 2025年12月11日閲覧, https://www.rand.org/pubs/research_reports/RRA2990-1.html

  13. LLMs in Research: the Good, the Bad, and the Future | Enable Medicine, 2025年12月11日閲覧, https://www.enablemedicine.com/blog/llms-in-research-the-good-the-bad-and-the-future

  14. Are large language models right for scientific research? - CAS.org, 2025年12月11日閲覧, https://www.cas.org/resources/cas-insights/are-large-language-models-right-scientific-research

  15. How do you implement LLM guardrails to prevent toxic outputs? - Zilliz Vector Database, 2025年12月11日閲覧, https://zilliz.com/ai-faq/how-do-you-implement-llm-guardrails-to-prevent-toxic-outputs

  16. How do you implement LLM guardrails to prevent toxic outputs? - Milvus, 2025年12月11日閲覧, https://milvus.io/ai-quick-reference/how-do-you-implement-llm-guardrails-to-prevent-toxic-outputs

  17. MaskMol: knowledge-guided molecular image pre-training framework for activity cliffs with pixel masking - NIH, 2025年12月11日閲覧, https://pmc.ncbi.nlm.nih.gov/articles/PMC12462177/

  18. Recent Progress in Understanding Activity Cliffs and Their Utility in Medicinal Chemistry, 2025年12月11日閲覧, https://www.researchgate.net/publication/256187970_Recent_Progress_in_Understanding_Activity_Clifs_and_Their_Utility_in_Medicinal_Chemistry f

  19. DeepAC – conditional transformer-based chemical language model for the prediction of activity cliffs formed by bioactive compounds - RSC Publishing, 2025年12月11日閲覧, https://pubs.rsc.org/en/content/articlehtml/2022/dd/d2dd00077f

  20. Breaking the Rules with Chemistry: Understanding SMILES-Prompting LLM Jailbreak Attack, 2025年12月11日閲覧, https://www.keysight.com/blogs/en/tech/nwvs/2025/06/12/smiles-prompting-jailbreak-attack

  21. SMILES-Prompting: A Novel Approach to LLM Jailbreak Attacks in Chemical Synthesis, 2025年12月11日閲覧, https://arxiv.org/html/2410.15641v1

  22. Towards Building a Robust Toxicity Predictor - arXiv, 2025年12月11日閲覧, https://arxiv.org/html/2404.08690v1

  23. LATENT CONSTRAINTS: LEARNING TO GENERATE CONDITIONALLY FROM UNCONDITIONAL GENERATIVE MODELS - IA, 2025年12月11日閲覧, https://webia.lip6.fr/~briot/cours/unirio3/Projects/Papers/Latent%20Constraints%20Learning%20to%20Generate%20Conditionally%20from%20Unconditional%20Generative%20Models.pdf

  24. Latent Constraints: Learning to Generate Conditionally from Unconditional Generative Models - Google Research, 2025年12月11日閲覧, https://research.google/pubs/latent-constraints-learning-to-generate-conditionally-from-unconditional-generative-models/

  25. Manifold-driven decomposition for adversarial robustness - NSF Public Access Repository, 2025年12月11日閲覧, https://par.nsf.gov/biblio/10568356-manifold-driven-decomposition-adversarial-robustness

  26. On the Need for Topology-Aware Generative Models for Manifold-Based Defenses - Liner, 2025年12月11日閲覧, https://liner.com/review/on-the-need-for-topologyaware-generative-models-for-manifoldbased-defenses

  27. Activity cliff-aware reinforcement learning for de novo drug design - PMC PubMed Central, 2025年12月11日閲覧, https://pmc.ncbi.nlm.nih.gov/articles/PMC12013064/

  28. [1711.05772] Latent Constraints: Learning to Generate Conditionally from Unconditional Generative Models - arXiv, 2025年12月11日閲覧, https://arxiv.org/abs/1711.05772

  29. Incentivizing Safer Actions in Policy Optimization for Constrained Reinforcement Learning, 2025年12月11日閲覧, https://arxiv.org/html/2509.09208v1

  30. Incentivizing Safer Actions in Policy Optimization for Constrained Reinforcement Learning - IJCAI, 2025年12月11日閲覧, https://www.ijcai.org/proceedings/2025/0592.pdf

  31. Fact Sheet: President Donald J. Trump Unveils the Genesis Mission to Accelerate AI for Scientific Discovery - The White House, 2025年12月11日閲覧, https://www.whitehouse.gov/fact-sheets/2025/11/fact-sheet-president-donald-j-trump-unveils-the-genesis-missionto-accelerate-ai-for-scientific-discovery/

  32. Launching the Genesis Mission - The White House, 2025年12月11日閲覧, https://www.whitehouse.gov/presidential-actions/2025/11/launching-the-genesis-mission/

  33. White House Launches 'Genesis Mission' to Accelerate AI-Enabled Scientific Discovery, 2025年12月11日閲覧, https://www.morganlewis.com/pubs/2025/12/white-house-launches-genesis-mission-to-accelerate-ai-enabled-scientific-discovery

  34. NIST AI RMF - ModelOp, 2025年12月11日閲覧, https://www.modelop.com/ai-governance/ai-regulations-standards/nist-ai-rmf

  35. Navigating the NIST AI Risk Management Framework - Hyperproof, 2025年12月11日閲覧, https://hyperproof.io/navigating-the-nist-ai-risk-management-framework/

  36. NIST AI 6001, Artificial Intelligence Risk Management Framework - Johns Hopkins Center for Health Security, 2025年12月11日閲覧, https://centerforhealthsecurity.org/sites/default/files/2024-06/2024-06-02-jhchs-nist-ai-6001-rfc.pdf

  37. Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile - NIST Technical Series Publications, 2025年12月11日閲覧, https://nvlpubs.nist.gov/nistpubs/ai/NIST.AI.600-1.pdf

  38. Understanding ISO 42001 and Demonstrating Compliance - ISMS.online, 2025年12月11日閲覧, https://www.isms.online/iso-42001/

  39. ISO/IEC 42001 Certification: AI Management System - DNV, 2025年12月11日閲覧, https://www.dnv.com/services/iso-iec-42001-artificial-intelligence-ai--250876/

  40. ISO 42001 - Promptfoo, 2025年12月11日閲覧, https://www.promptoo.dev/docs/red-team/iso-42001/ f

  41. ISO 42001: paving the way for ethical AI | EY - US, 2025年12月11日閲覧, https://www.ey.com/en_us/insights/ai/iso-42001-paving-the-way-for-ethical-ai

ビジュアルでインタラクティブな体験をご希望ですか?

本ペーパーの主要な調査結果、統計、アーキテクチャを、ナビゲーション可能なセクションとデータビジュアライゼーションを備えたインタラクティブ形式でご覧いただけます。

インタラクティブ版を見る
FAQ

よくあるご質問

MegaSyn実験はAIのデュアルユースリスクをどのように実証したか。

Collaborations Pharmaceuticalsの研究者らは生成化学モデルの毒性ペナルティを反転させ、コンシューマグレードのハードウェア上で6時間未満に、VX神経剤および新規アナログを含む40,000種の潜在的化学兵器を生成した。実験に必要だったのはオープンソースデータセットと標準的なRNNアーキテクチャのみであった。

LLMラッパーが生物兵器設計を防げないのはなぜか。

テキストベースのガードレールは、文脈盲目性、SMILES難読化(サリンを文字列として符号化する化学表記を通過させる)、および単一原子置換が安全な薬物を致死剤に変える活性クリフ盲目性に苦しむ。SMILESプロンプティングによるジェイルブレイクは、90%超の成功率で安全機構を迂回する。

潜在空間ガバナンスは毒性分子の生成をどのように防ぐか。

生成後に出力をフィルタするのではなく、潜在空間ガバナンスはパーシステントホモロジーで毒性領域を写像し、サンプリング中にランジュバン動力学による勾配ステアリングを適用して、分子がデコードされる前に潜在ベクトルを禁止多様体から押し出す。制約は政策ではなく数学である。

ソーシャル

他のプラットフォームでも公開

確かな信頼のもとに、AIを構築する。

次世代のエンタープライズAI構築において豊富な経験を持つチームと、ぜひご一緒ください。信頼できるAI戦略の設計・構築・導入を、私たちがお手伝いします。

Veriprajna ディープテック・コンサルティング は、ヘルスケア・金融・規制対応分野における安全性重視のAIシステム構築を専門としています。当社のアーキテクチャは確立されたプロトコルに照らして検証され、包括的なコンプライアンス文書を備えています。