Autonomous Lab AI · 自律駆動型材料探索
自律型ラボ(Self-Driving Lab)の失敗は、オプティマイザの能力不足によるものではありません。処方の最初の1行目から化学的に不可能な実験が多く実行され、事後的にその正当性を一切証明できないことが原因です。本ベンチマークでは、クローズドループのDesign-Make-Test-Analyze(設計・作成・テスト・分析)サイクルにより、ランダムスクリーニングが約1,491回を要するところを75回の実験で厳格な仕様を達成します。同時に、デジタルツイン・セーフティゲートが試薬やロボット時間が浪費される前に実行不可能なすべての合成を遮断し、あらゆる決定を改ざん防止機能付きのALCOA+レコードに記録・署名します。エージェントが進言し、コードが決断する。
$4,419
デジタルツインゲートが防いだ試薬の浪費(38件の破綻が確実な合成を阻止し、90.1ロボット時間を削減)
シード411ベンチマーク実行、合成目的関数
20× 削減
同一の未知目的関数において仕様適合材料に到達するまでの実験数:ランダムスクリーニングの約1,491回に対し75回
シード411ベンチマーク実行、19.9倍少ない実験数
113
ハッシュチェーン化されたALCOA+レコード(決定ごとに1件、改ざん防止仕様。1件でも編集すればチェーンが破断)
シード411ベンチマーク実行、75件の合成+38件のブロック
18次元の鉛フリーペロブスカイト組成およびプロセス探索における本機構の実稼働デモ。オプティマイザとセーフティゲートはAPIキー不要で完全にnumpyおよびscipy上で動作し、モデルを呼び出せるのは2つのアドバイザーエージェントのみです。
ボトルネックはサロゲートモデルではありません。モデルが決して提案すべきではなかった破綻確実な実験と、後からその正当性を証明できないという事実にあります。
バークレー校のA-Labは71%の成功率を報告しましたが、これは試行の約29%がターゲットを生成できなかったことを意味します(A-Lab, Nature, 2023)。自律運用されるラボにおいて、この失敗率は単なる歩留まりの低下にとどまりません。ロボットが動き出す前からすでに電荷の不均衡、幾何学的足場としての不安定さ、あるいは化学的危険性を抱えていた合成に対して、試薬が分注され、ロボット時間が予約され、測定機器の稼働時間が浪費されたことを意味します。
探索空間の広大さが事態をさらに悪化させます。この規模のペロブスカイト組成・プロセス空間は、いかなるスクリーニング予算よりも天文学的に大きいため、純粋なスクリーニングは戦略ではなく宝くじにすぎません。本ベンチマークでの個別の成立性調査では、ランダムヒット率は0.01%(80,000件中8候補)であり、スクリーニング単体で最初のターゲットに到達するには10,000回規模の実験が必要となることが示されました。より優れた獲得関数(acquisition function)の採用は、問題のこの半分を解決するのに役立ちます。
しかし、もう半分の問題には何も寄与しません。物性予測モデルがどれほど優れていても、その合成の試行が安全であるかどうかを判断することはできず、規制当局や自社のQAが受け入れられる記録を作成することもできません。創薬開発におけるAI利用に関するFDAおよびEMAの指針は、出所(来歴)の帰属性(attributable)および同時性(contemporaneous)の担保を明示的に求めています(FDA/EMA, 2026)。成立性の判断と監査可能性こそがモデルの関与しない部分であり、これらこそ私たちが解消しようとした2つのギャップです。
Design-Make-Test-Analyze(設計・作成・テスト・分析)の1サイクルをステージごとに表示。成立性の判定は平易なコード内に存在し、モデルに委ねられることは決してありません。
このループは18次元の鉛フリーペロブスカイト空間を探索します。Cs、MA、FAのカチオン比率、Sn、Ge、BiのBサイト置換、I、Br、Clのハロゲン化物比率に加え、プロセス変数を扱います。ターゲット指向のParEGO型獲得関数を備えたガウス過程(GP)サロゲートが、60件の履歴フィクスチャからコールドスタートして次の候補を提案します。すべての提案は実際に合成される前にゲートを通過するため、処方とロボットの間に立つのはオプティマイザの信頼度ではなく、このゲートです。
デジタルツインゲートは、いかなる言語モデルからも独立した部分です。提案されたすべての候補は、試薬を消費する前に査読済み論文等で公開された5つの実際の化学ルールと照合され、ゲートは違反した正確なルール、回避された試薬予算およびロボット時間とともに「成立」または「ブロック」を返します。これは平易なnumpyおよびscipyコードであり、エージェントやサロゲートの外側に位置し、最も重要な意思決定を担います。破綻する処方はここで阻止され、ロボットが実行した後に発覚することはありません。
コアの上で、2つのエージェントが情報の読み取りと対話を行います。「Lab Director」がキャンペーン戦略を解説し、「Critic」が独立してドリフトや停滞を警告する検証者(verifier-in-the-loop)として機能します。これらはLLM_PROVIDER設定によってプロバイダの切り替えが可能で、デフォルトはclaude-opus-4-8です。APIキーがない場合は決定論的な解説にフォールバックするため、デモは常に動作します。オプティマイザとゲートがLLMに依存することは一切ありません。エージェントが進言し、コードが決断する。
| チェック項目 | 検出内容 | 根拠 |
|---|---|---|
| ゴールドシュミット許容因子 | ペロブスカイト形成可能領域から外れた組成。ゲートは0.78〜1.05のスクリーニング帯を使用します。 | ペロブスカイト結晶化学 |
| 八面体因子 | 安定な八面体領域である0.41〜0.90から外れたイオン半径比。 | ペロブスカイト結晶化学 |
| 電荷中性 | Bi(III)置換などに起因するBサイトの非補償電荷。 | イオン電荷バランス |
| Sn(II)酸化ハザード | 湿潤空気中で酸化するSn(II)。プロセス湿度下では安全性を欠き、破綻が確実となります。 | スズハロゲン化物安定性 |
| 分解上限温度 | MAおよびFAカチオンが熱分解する温度(約190℃)を超えるアニーリング。 | 前駆体熱安定性 |
永続的な価値を持つのはセーフティゲートと監査証跡であり、より優れたサロゲートモデルではありません。完璧な物性予測モデルであっても、電荷不均衡や酸化ハザードを抱える合成の実行を止めることはできず、規制当局が受け入れられる記録を作成することもできません。オプティマイザはその制御層内部で交換可能な1コンポーネントにすぎないため、AIモデルが進歩してもこのアプローチが陳腐化することはありません。本デモに搭載されているオプティマイザは、ターゲット指向獲得関数を備えたnumpyおよびscipyによるGPであり、本番環境での移行先はBoTorchおよびAxです。
以下のすべての数値は、ハードコードされたものではなく、実行時にリアルタイム計算された単一の決定論的ベンチマークキャンペーン(シード411)からのものです。目的関数は物理学に基づいた合成ベンチマークであり、実際のDFTやラボデータではありません。またラボはSiLA-2準拠インターフェースの背後にあるシミュレータです。ここで物理的に合成されたものは一切ありません。
クローズドループは75回目の実験で目標仕様に到達し、同一の未知目的関数においてランダムスクリーニングが想定する約1,491回と比較して19.9倍少ない実験数で達成しました。これと並行してスコアボードは、速度以上に重要な数値を追跡します。4,419米ドルの試薬廃棄防止、90ロボット時間の削減、合成前に阻止された38件の実行不可能候補、そして「仕様適合(spec met)」を示すステータスです。効率性の向上は本物ですが、防止された無駄と出所の証明性こそが、どのようなモデル品質においても色褪せない部分です。
阻止された1件の詳細をここに示します。提案された候補はプロセス湿度下でのSn(II)酸化ハザードを抱えており、予測されたバンドギャップ、相安定性、熱分解温度はすべて目標範囲外でした。ゲートは合成前にこれを拒否し、105米ドルの試薬と2.33ロボット時間を節約した上で、その拒否理由をハッシュチェーン化されたALCOA+レコードとして記録します。決定論的化学がすでに知っていた事実を確かめるために、オプティマイザがロボット時間を1時間たりとも浪費することはありません。
この単一のブロックは偶然の産物ではなく、一貫した動作パターンです。実行全体を通じて、ゲートは合成前に38件の実行不可能な候補を遮断しました。それぞれがSn(II)酸化ハザード、非補償Bサイトによる電荷中性違反、形成可能領域外のゴールドシュミット許容因子など、違反した物理化学的原則を節約金額やロボット時間とともに明記しています。ブロックにより防止された浪費は合計4,419米ドルおよび90ロボット時間に達し、実行不可能な合成は1件も行われませんでした。
探索マップは、シミュレーション内でループが合成した各材料をバンドギャップ対相安定性空間にプロットし、熱分解温度で色分けしています。破線のボックスは目標ウィンドウ(1.2〜1.5 eVのバンドギャップと高い安定性)を示しています。初期のプロットは分散していますが、サロゲートの学習に伴い後期のプロットはボックスに向かって集束し、最良の材料がその内部に到達します。これはオプティマイザがその真価を発揮している姿ですが、それはゲートが通過を許可した候補に対してのみ機能しています。
発見された最良材料はすべての仕様を満たしています:組成 (Cs0.46MA0.22FA0.31)(Sn0.69Ge0.31)(I0.73Br0.21Cl0.06)3、バンドギャップ 1.43 eV、相安定性スコア 0.743、熱分解温度 250.5℃。適用範囲を明確にしておくと、これは物理学に基づいた合成目的関数の出力であり、実際に作成された材料ではありません。これはループが収束することの証明であり、現実の新材料発見を主張するものではありません。
75件の合成と38件のブロックの双方を含むすべての決定は、追記限定(append-only)レコード(全113件)に書き込まれ、ALCOA+原則に対応付けられたキャンペーン来歴レポートとしてエクスポートされます。各行にはタイムスタンプ、アクション、候補、ゲート判定、違反項目、根拠、および直前のレコードと連鎖するSHA-256ハッシュが含まれます。レポートには「チェーン完全維持(chain intact)」および「改ざん防止(tamper-evident)」と表示され、これこそ規制対象ラボが提出しなければならない帰属性と同時性を備えた来歴情報です。
改ざん検知性は、実際に作動する様子を確認できて初めて価値を持ちます。エクスポートされた監査記録内のペイロードを1つでも編集すると、検証機能はそのレコードでチェーンが破断したことを報告し、「改ざんを検出(tamper detected)」と警告して、提出された監査記録が証明可能な形で変更されている旨を明示します。肝心なのはレコードを変更できないことではなく、変更を隠蔽できないことであり、それこそが監査証跡の正当性を担保します。
これは既存ハードウェア上に構築される頭脳、セーフティゲート、および来歴管理レイヤーであり、ホスト型ラボではなく、機器やDFT計算を代替するものでもありません。
| 懸念事項 | 物性モデルまたはオプティマイザ単体 | 本レイヤー |
|---|---|---|
| 化学的に不可能な提案 | 合成が実行された後、失敗として評価される | 試薬が消費される前に決定論的ゲートによって阻止される |
| 候補が却下された理由 | 記録されたとしても損失関数の中に埋没する | 公開された5つの化学ルールと照合して明示され、節約された金額と時間も記録される |
| 自動化された意思決定の出所(来歴) | アドホックなログ(編集可能) | 追記限定・ハッシュチェーン化されたALCOA+レコード(改ざん防止) |
| 安全性判断の主体 | LLM、またはオプティマイザ自身の信頼度 | エージェントの外部にある平易な決定論的コード |
| サンプル効率 | 獲得関数によって変動 | 本ベンチマークの未知目的関数において仕様到達まで75回(ランダムスクリーニングの約1,491回に対し) |
| ハードウェアおよびモデルのロックイン | ホスト型スタックであることが多い | SiLA-2準拠インターフェースを通じて自社機器上で動作、LLMプロバイダは交換可能 |
本レイヤーは、お客様がすでに所有しているハードウェアの上位に位置する頭脳、セーフティゲート、および来歴記録です。クローズドループが次に実行すべき実験を決定し、はるかに少ない実験数で厳格な仕様に到達します。また決定論的デジタルツインゲートが、試薬やロボット時間を消費する前に化学的に不可能または危険な合成を拒絶し、すべての決定が改ざん防止監査証跡に記録されます。本ベンチマークでは、ゲートが破綻確実な38件の合成を阻止し、4,419米ドルと90.1ロボット時間を節約し、実行不可能な実験がロボットに到達することは一切ありませんでした。
いいえ、その点については明確にしています。目的関数は物理学に基づいた合成ベンチマークであり、実際のDFTやラボデータではありません。またラボはSiLA-2準拠インターフェースの背後にあるシミュレータであるため、ここで物理的に作成されたものは一切ありません。本デモが実証しているのは、モデル品質に左右されることのないメカニズム、ループ、決定論的セーフティゲート、および監査可能な来歴管理です。発見された組成とその物性値はベンチマークの出力であり、実験結果ではありません。
オプティマイザの制約条件は、ターゲット達成を試行しているのと同じモデルの内部に存在しており、そのモデル自身の自己報告と同じ程度の信頼性しかありません。当社のゲートは、エージェントやサロゲートの外部で動作する独立した決定論的コードであり、すべての提案を公開された5つの化学ルール(ゴールドシュミット許容因子、八面体因子、電荷中性、Sn(II)湿度酸化、および有機前駆体の分解上限温度)と照合します。違反した正確なルール、節約された金額およびロボット時間とともに「成立」または「ブロック」を返すため、破綻する処方はロボットに渡る前に確実に阻止されます。
エージェントが決断を下すことは決してないからです。Lab DirectorおよびCriticエージェントは戦略を解説しドリフトを警告するだけであり、実行内容を決定するのはオプティマイザと決定論的ゲートであり、どちらもLLMに依存しません。APIキーがない場合、エージェントは決定論的な解説にフォールバックしますが、ループは全く同様に動作します。「エージェントが進言し、コードが決断する」というこの分離こそが核心です。自律型ラボへの信頼を、モデル自身の自己弁述に委ねることはできません。
来歴機能は実装され、ALCOA+原則に対応付けられています。すべての決定が追記限定・ハッシュチェーン化レコードに書き込まれ、いずれかのレコードを編集するとチェーンが目に見えて破断します。これはFDAおよびEMAの指針が求める帰属性と同時性を備えた来歴そのものです(FDA/EMA, 2026)。お客様のSOPに対するIQ、OQ、またはPQバリデーションを受けたものではなく、その適格性確認はプロジェクト契約の範囲であり、初期状態で保証するものではありません。本デモではレコードと改ざんテストを公開しており、形式的なチェック項目ではなく実質的な機能をご確認いただけます。
これはシード411による単一の決定論的実行の結果です。同一の未知目的関数において仕様適合材料に達するまで、ランダムスクリーニングが想定する約1,491回に対して75回の実験で到達し、これは19.9倍少ない数値です。10シードのベンチマーク全体では、ループの平均実験数は67回で10回中9回解決したのに対し、ランダムスクリーニングは1,000回以内で5回中1回しか解決できず、グリッド探索は一度も仕様に到達しませんでした。前提条件が重要です。これらは合成目的関数上でのオプティマイザ対ベースラインの数値であり、見せかけの比較対象ではなく再現可能なベースラインに対して実行されたものであり、オープンワールドでの普遍的な約束ではありません。
いいえ。当社はホスト型のロボットラボを運営しておらず、本レイヤーはSiLA-2準拠インターフェースを介してお客様の機器上に組み込まれるよう設計されています。オプティマイザとゲートは平易なnumpyおよびscipyであり、APIキーなしで完全にオフラインで動作し、LLMプロバイダは交換可能(デフォルトはclaude-opus-4-8)です。デモに同梱されているオプティマイザはターゲット指向獲得関数を備えたGPであり、本番環境での移行先はBoTorchおよびAxです。これらはお客様のハードウェア上で動作し、当社のインフラではありません。
より少ない実験で仕様に到達し、破綻する実験を実行前に遮断し、事後的にすべての決定を証明する。
貴社チームが自律型ラボの立ち上げを進めており、成立性判断の信頼性向上と監査証跡の正当性確保をご検討中であれば、ぜひ貴社のお考えをお聞かせください。この課題は業界全体のものであり、その解決策もまた共有されるべきものです。