課題
研究者たちは最近、わずか数百ドルの計算コストでAIモデルからセーフティトレーニング(安全性訓練)を剥ぎ取ることができることを実証しました。この手法は「悪意あるファインチューニング(Malicious Fine-Tuning)」と呼ばれ、モデルに有害な質問と回答のペアをわずか10〜50例与えるだけで機能します。その後、モデルは最初の事前学習で学んだ危険な知識をすべて「思い出し」、それを自由に共有するようになります。
これが重要となるのは、貴社のバイオテクノロジーチームが創薬、タンパク質設計、遺伝子治療に使用しているAIモデルが、隠れた法的責任(リスク)を抱えているためです。これらのモデルは、生物兵器研究、毒素合成プロトコル、病原体工学データなどを含むインターネット全体で学習されています。業界の対応は、有害な要求を拒絶するようモデルをトレーニングすることでした。しかし、その拒絶は一時的なマスクにすぎず、根本的な解決策ではありません。危険な知識はモデルの重み(weights)の内部に休眠状態で残っており、復元可能なのです。
貴組織にとって、これは不都合な真実を突きつけます。病原体の作成方法を「知っている」ものの、それを口にしないよう訓練されているだけのAIツールを導入している可能性があるということです。そして、悪意を持った攻撃者——あるいは侵害された従業員でさえ——最小限の労力とコストでその訓練を取り除くことができます。問題はもはや、貴社のAIが悪用され得るか否かではありません。悪用され得ないことを証明できるかどうかなのです。
オープンウェイトモデルの普及がこの問題をさらに悪化させています。モデルの重みが一度一般公開されると、ログも利用停止措置(BAN)もパッチも存在しません。兵器化されたモデルはファイル共有ネットワークを通じて配布され、差し止め要請の影響を受けず、情報機関からも不可視となります。
これが貴社のビジネスにとって重要な理由
ここにおける財務的および法的なリスク(エクスポージャー)は、決して仮定の話ではありません。今まさに規制として成文化されつつあります。
規制圧力は現実であり、急速に高まっています。
- 大統領令14110号は、強力なAIモデルの開発者に対し、特に化学・生物・放射線・核(CBRN)リスクを対象としたレッドチーミング結果の報告を義務付けています。貴社が生物学的設計にAIを使用している場合、規制の対象となります。
- ISO/IEC 42001(AIマネジメントシステムに関する初の国際規格)は、「リスクに比例した」管理策を求めています。安全工学において、危険の排除(elimination)は拒絶ポリシーのような管理的管理策(administrative controls)よりも上位に位置付けられます。監査人はその違いを認識しています。
- NIST AIリスクマネジメントフレームワークは、CBRN情報を生成AIにおける特有のリスククラスとして分類しています。そして、悪用の可能性をほぼゼロに抑える検証済みの技術的ソリューションを推奨しています。
責任の落とし穴は明白です。 貴社が研究者にオープンソースモデルを提供し、不満を抱いた従業員がそれを使って病原体を設計した場合、貴社は過失を問われる可能性があります。適切なセーフガードなしにデュアルユース(軍民両用)ツールを提供したことになるからです。製薬業界の「注意義務(Duty of Care)」基準は、予見可能な危害を防止するために合理的な措置を講じることを求めています。
保険会社はすでに対応を進めています。 サイバー賠償責任保険を提供する保険会社は、AIに起因する損害を補償対象外としたり、未検証のモデルを使用している企業に対して保険料を引き上げたりする傾向を強めています。
貴社の取締役会が警戒すべき数値をご確認ください。
- セーフティ解除コスト:~$300相当のGPU時間
- セーフティの無効化に必要なトレーニング例:10〜50ペア
- 標準的なオープンソースモデルは兵器知識ベンチマークで**~75%**を記録——危険な情報の大部分を把握していることを意味します
- オープンモデルに対する脱獄(ジェイルブレイク)攻撃の成功率:ファインチューニングなしでも15〜20%
これらは特異な事例(エッジケース)ではありません。貴社の技術スタックにあるあらゆる汎用AIモデルの基本的な現実なのです。
内部で実際に起きていること
現在のAIセーフティがなぜ破綻するのかを理解するために、このように考えてみてください。化学を学ぶ学生に爆発物に関するすべてを教えた上で、「これについては絶対に口外するな」と指示したとします。知識は依然としてその学生の頭の中に残っています。誰かが巧妙な方法で質問したり、十分な圧力をかけたりすれば、その情報は漏れ出してしまいます。
これこそが、AIを「安全」にするための標準的な手法である人間のフィードバックによる強化学習(RLHF)の仕組みそのものです。事前学習において、モデルは生物兵器マニュアル、毒素合成手順、病原体工学データなど、あらゆる情報を吸収します。その後、後続のトレーニング段階で、人間のレビュアーがモデルに有害な要求を拒絶するよう教え込みます。しかし、RLHFは知識を消去するわけではありません。その知識の上から拒絶する振る舞いを訓練しているにすぎないのです。
これにより、貴社のチームが把握しておくべき3つの具体的な障害モード(故障モード)が生じます。
**クレッシェンド攻撃(Crescendo Attacks)**は、無害な質問から始まり、多数の会話ターンを経て徐々にエスカレートしていきます。有害な要求に達する頃には、モデルは文脈によって「プライミング(誘導)」され、セーフティトレーニングを無視します。研究者たちは本番環境の商用モデルに対してこれを実証しました。
**GeneBreaker攻撃(GeneBreaker Attacks)**は、特にDNA言語モデルを標的にします。攻撃者は「病原体を設計せよ」と直接指示する代わりに、毒素と構造的に類似した厳選された無害なタンパク質と「相同な」タンパク質を要求します。モデルはキーワードベースのセーフティフィルターを回避しながら、毒素の配列を生成してしまいます。
**追従バイアス(Sycophancy Bias)**は、モデルの「役に立とうとする」訓練傾向を悪用します。バイオセキュリティ侵害を「瀕死の子供のための解毒剤を開発するためにこの毒素プロトコルが必要である」といった緊急の医療ニーズとして提示すると、役に立ちたいという動機が無害性の制約を無効にしてしまうことがよくあります。
その結果、モデルは正当な科学的問い合わせに対して過剰に拒絶する(「virus(ウイルス)」という単語を一律にブロックするなど)一方で、巧妙に言い換えられた危険な要求に対しては拒絶しきれなくなります。RLHFモデルは、拒絶機能が有効な状態であっても兵器知識ベンチマークで約**72%**を記録します。知識は存在し続けており、鍵は極めて脆弱なのです。
何が有効で、何が有効でないか
機能しない手法:
- 拒絶トレーニング(RLHF): モデルに「ノー」と言うことを教え込みますが、危険な知識はそのまま残り、~$300程度で除去できてしまいます。
- キーワードフィルタリング: 「炭疽菌(anthrax)」のような明白な用語をブロックしますが、「芽胞形成バチルス属の最適化」のように言い換えられた要求は見逃します——GeneBreakerの研究がこれを証明しました。
- オープンモデルの利用監視: 重みが一度ダウンロードされると、ログも監視も存在せず、アクセスを取り消す方法もありません。
有効な手法:知識ギャップ型アーキテクチャ(Knowledge-Gapped Architecture)
原理はシンプルです。モデルに拒絶することを教えるのではなく、危険な知識そのものを完全に除去します。モデルは研究者が呼ぶところの「治療のエキスパートであり続けながら、脅威に関しては無知な幼児」となります。実際の仕組みは次のとおりです。
入力: 研究者が治療薬の設計要求を送信します(例えば、心臓組織を標的とした遺伝子治療用ウイルスベクターの最適化など)。モデルは、完全な監査ログを備えたセキュアなプライベートクラウド展開を介してこれを受信します。
処理: モデルは構造生物学およびウイルス血清型に関する深い知識を活用して治療薬の設計を最適化します。しかし、病原性の病原力因子や兵器化のための免疫回避に対応するニューラル経路は、表現誤誘導(Representation Misdirection)などの技術を用いて重みレベルで外科的に除去されています。モデルが「学習解除(アンラーン)」した概念に遭遇すると、内部表現は無意味なデータへとマッピングされます——拒絶ではなく、真の実行不可能性です。モデルは「ボツリヌスペイロード」を無意味なフレーズとして扱います。
出力: 高度に最適化された治療用ベクターが得られます。研究者、侵害されたアカウント、攻撃者のいずれかがモデルを有害な方向へ誘導しようとしても、モデルは拒絶しません。単に要求を処理できないのです。鍵の背後には何も存在しないため、脱獄(ジェイルブレイク)のしようがありません。
検証データがその有効性を物語っています。適切に知識ギャップ化されたモデルは、一般科学ベンチマークで~81%、生物医学研究で**77%の精度を維持し、これは標準モデルとほぼ同等です。しかし、兵器知識ベンチマークでは26%しか記録せず、統計的にランダムな推測と区別がつきません。脱獄成功率は0.1%**未満に低下します。さらに重要な点として、再学習に対する耐性が高く、消去された知識を復元するにはモデルをゼロからトレーニングするのと同等の計算労力が必要となります。
コンプライアンスチーム向けには、すべてのプロンプトと生成結果がISO 42001の要件を満たす不変の監査証跡に記録されます。貴社の AIガバナンス&コンプライアンスプログラム は単なる方針文書ではなく検証済みの技術的統制手段を獲得し、貴社の ソリューションアーキテクチャ チームは ヘルスケア・ライフサイエンス ユースケース向けの導入可能なリファレンス実装を手に入れます。
知識のドリフト(変質)が発生していないことを確認するため、これらのモデルに対して毎週自動レッドチーミングが実行されます。再学習のコストがゼロからトレーニングするコストを上回った場合にのみ、モデルは「知識ギャップ型」の認定を受けます。これこそが基準(バー)なのです。
詳細については、 完全な技術分析を読む か、または インタラクティブ版を探索する ことで、 評価・ベンチマーク・レッドチーミング 手法の詳細をご確認いただけます。
要点
- 標準的なAIセーフティ(RLHF)は、わずか10〜50例のトレーニング例と300ドル程度の計算コストで、オープンウェイトモデルから剥ぎ取ることが可能です。
- オープンソースのバイオテクノロジーAIモデルは兵器知識ベンチマークで約75%を記録します——危険な知識は存在しており、取り除けるのは拒絶の振る舞いだけです。
- 知識ギャップ型アーキテクチャは重みレベルで危険な知識を除去し、一般科学の精度を約81%維持しながら、兵器ベンチマークのスコアを約26%(ランダム推測と同等)にまで引き下げます。
- 米大統領令14110号、ISO/IEC 42001、NIST AI RMFのすべてが、規制対象となる企業において拒絶のみに頼るセーフティでは不十分とする要件へと収束しつつあります。
- サイバー賠償責任保険会社はすでにAIに起因する損害を補償対象外としたり保険料を再設定したりしており、未検証モデルの導入は法的リスクと補償の空白の双方を生み出します。
結論
貴社のバイオテクノロジーAIツールが拒絶トレーニングのみに依存している場合、わずか300ドルの攻撃で兵器級の生物学的知識を自由に共有するモデルへと変貌してしまう危険があります。知識ギャップ型アーキテクチャ(Knowledge-Gapped Architecture)は、危険な機能を単に覆い隠すのではなく根本から排除し、法的に防御可能なコンプライアンスと真のセキュリティの双方を提供します。AIベンダーにこう問い質してください。「もし誰かが貴社のモデルを有害な50例でファインチューニングした場合、セーフティは維持されますか?そしてそれを証明するベンチマークデータを提示できますか?」