Autonomous Lab AI · 自律駆動型材料探索

ロボットは開始前から破綻が確実な合成であっても夜通し稼働し続けてしまいます。私たちはそれを拒絶する決定論的ゲートと、その理由を証明する監査証跡を構築しました。

自律型ラボ(Self-Driving Lab)の失敗は、オプティマイザの能力不足によるものではありません。処方の最初の1行目から化学的に不可能な実験が多く実行され、事後的にその正当性を一切証明できないことが原因です。本ベンチマークでは、クローズドループのDesign-Make-Test-Analyze(設計・作成・テスト・分析)サイクルにより、ランダムスクリーニングが約1,491回を要するところを75回の実験で厳格な仕様を達成します。同時に、デジタルツイン・セーフティゲートが試薬やロボット時間が浪費される前に実行不可能なすべての合成を遮断し、あらゆる決定を改ざん防止機能付きのALCOA+レコードに記録・署名します。エージェントが進言し、コードが決断する。

$4,419

デジタルツインゲートが防いだ試薬の浪費(38件の破綻が確実な合成を阻止し、90.1ロボット時間を削減)

シード411ベンチマーク実行、合成目的関数

20× 削減

同一の未知目的関数において仕様適合材料に到達するまでの実験数:ランダムスクリーニングの約1,491回に対し75回

シード411ベンチマーク実行、19.9倍少ない実験数

113

ハッシュチェーン化されたALCOA+レコード(決定ごとに1件、改ざん防止仕様。1件でも編集すればチェーンが破断)

シード411ベンチマーク実行、75件の合成+38件のブロック

18次元の鉛フリーペロブスカイト組成およびプロセス探索における本機構の実稼働デモ。オプティマイザとセーフティゲートはAPIキー不要で完全にnumpyおよびscipy上で動作し、モデルを呼び出せるのは2つのアドバイザーエージェントのみです。

自律型ラボの予算の大半は、化学的にすでに除外されている事実の再証明に費やされている

ボトルネックはサロゲートモデルではありません。モデルが決して提案すべきではなかった破綻確実な実験と、後からその正当性を証明できないという事実にあります。

バークレー校のA-Labは71%の成功率を報告しましたが、これは試行の約29%がターゲットを生成できなかったことを意味します(A-Lab, Nature, 2023)。自律運用されるラボにおいて、この失敗率は単なる歩留まりの低下にとどまりません。ロボットが動き出す前からすでに電荷の不均衡、幾何学的足場としての不安定さ、あるいは化学的危険性を抱えていた合成に対して、試薬が分注され、ロボット時間が予約され、測定機器の稼働時間が浪費されたことを意味します。

探索空間の広大さが事態をさらに悪化させます。この規模のペロブスカイト組成・プロセス空間は、いかなるスクリーニング予算よりも天文学的に大きいため、純粋なスクリーニングは戦略ではなく宝くじにすぎません。本ベンチマークでの個別の成立性調査では、ランダムヒット率は0.01%(80,000件中8候補)であり、スクリーニング単体で最初のターゲットに到達するには10,000回規模の実験が必要となることが示されました。より優れた獲得関数(acquisition function)の採用は、問題のこの半分を解決するのに役立ちます。

しかし、もう半分の問題には何も寄与しません。物性予測モデルがどれほど優れていても、その合成の試行が安全であるかどうかを判断することはできず、規制当局や自社のQAが受け入れられる記録を作成することもできません。創薬開発におけるAI利用に関するFDAおよびEMAの指針は、出所(来歴)の帰属性(attributable)および同時性(contemporaneous)の担保を明示的に求めています(FDA/EMA, 2026)。成立性の判断と監査可能性こそがモデルの関与しない部分であり、これらこそ私たちが解消しようとした2つのギャップです。

クローズドループが提案し、エージェント外の決定論的ゲートが実行の可否を決断する

Design-Make-Test-Analyze(設計・作成・テスト・分析)の1サイクルをステージごとに表示。成立性の判定は平易なコード内に存在し、モデルに委ねられることは決してありません。

このループは18次元の鉛フリーペロブスカイト空間を探索します。Cs、MA、FAのカチオン比率、Sn、Ge、BiのBサイト置換、I、Br、Clのハロゲン化物比率に加え、プロセス変数を扱います。ターゲット指向のParEGO型獲得関数を備えたガウス過程(GP)サロゲートが、60件の履歴フィクスチャからコールドスタートして次の候補を提案します。すべての提案は実際に合成される前にゲートを通過するため、処方とロボットの間に立つのはオプティマイザの信頼度ではなく、このゲートです。

GPサロゲート(提案) → デジタルツインゲート(成立またはブロック、純粋コード) → 合成および特性評価、SiLA-2準拠(シミュレーション) → 分析およびサロゲート更新 → ALCOA+レコード(ハッシュチェーン化)。Lab DirectorおよびCriticエージェントは並行して状況を解説しドリフトを警告するのみで、決して決定は下しません。

決定論的トラストコア

デジタルツインゲートは、いかなる言語モデルからも独立した部分です。提案されたすべての候補は、試薬を消費する前に査読済み論文等で公開された5つの実際の化学ルールと照合され、ゲートは違反した正確なルール、回避された試薬予算およびロボット時間とともに「成立」または「ブロック」を返します。これは平易なnumpyおよびscipyコードであり、エージェントやサロゲートの外側に位置し、最も重要な意思決定を担います。破綻する処方はここで阻止され、ロボットが実行した後に発覚することはありません。

進言のみに限定されたエージェント

コアの上で、2つのエージェントが情報の読み取りと対話を行います。「Lab Director」がキャンペーン戦略を解説し、「Critic」が独立してドリフトや停滞を警告する検証者(verifier-in-the-loop)として機能します。これらはLLM_PROVIDER設定によってプロバイダの切り替えが可能で、デフォルトはclaude-opus-4-8です。APIキーがない場合は決定論的な解説にフォールバックするため、デモは常に動作します。オプティマイザとゲートがLLMに依存することは一切ありません。エージェントが進言し、コードが決断する。

ゲートが強制適用する5つの成立性チェック

チェック項目 検出内容 根拠
ゴールドシュミット許容因子 ペロブスカイト形成可能領域から外れた組成。ゲートは0.78〜1.05のスクリーニング帯を使用します。 ペロブスカイト結晶化学
八面体因子 安定な八面体領域である0.41〜0.90から外れたイオン半径比。 ペロブスカイト結晶化学
電荷中性 Bi(III)置換などに起因するBサイトの非補償電荷。 イオン電荷バランス
Sn(II)酸化ハザード 湿潤空気中で酸化するSn(II)。プロセス湿度下では安全性を欠き、破綻が確実となります。 スズハロゲン化物安定性
分解上限温度 MAおよびFAカチオンが熱分解する温度(約190℃)を超えるアニーリング。 前駆体熱安定性

永続的な価値を持つのはセーフティゲートと監査証跡であり、より優れたサロゲートモデルではありません。完璧な物性予測モデルであっても、電荷不均衡や酸化ハザードを抱える合成の実行を止めることはできず、規制当局が受け入れられる記録を作成することもできません。オプティマイザはその制御層内部で交換可能な1コンポーネントにすぎないため、AIモデルが進歩してもこのアプローチが陳腐化することはありません。本デモに搭載されているオプティマイザは、ターゲット指向獲得関数を備えたnumpyおよびscipyによるGPであり、本番環境での移行先はBoTorchおよびAxです。

画面上の実行プロセス

以下のすべての数値は、ハードコードされたものではなく、実行時にリアルタイム計算された単一の決定論的ベンチマークキャンペーン(シード411)からのものです。目的関数は物理学に基づいた合成ベンチマークであり、実際のDFTやラボデータではありません。またラボはSiLA-2準拠インターフェースの背後にあるシミュレータです。ここで物理的に合成されたものは一切ありません。

スコアボード:ループが消費したものと削減したもの

クローズドループは75回目の実験で目標仕様に到達し、同一の未知目的関数においてランダムスクリーニングが想定する約1,491回と比較して19.9倍少ない実験数で達成しました。これと並行してスコアボードは、速度以上に重要な数値を追跡します。4,419米ドルの試薬廃棄防止、90ロボット時間の削減、合成前に阻止された38件の実行不可能候補、そして「仕様適合(spec met)」を示すステータスです。効率性の向上は本物ですが、防止された無駄と出所の証明性こそが、どのようなモデル品質においても色褪せない部分です。

75回の実験実行、ランダムスクリーニングの約1,491回と比較して19.9倍少ない実験数、デジタルツインによって防止された4,419米ドルの廃棄、90ロボット時間の削減、合成前にブロックされた38件の実行不可能候補、および実験75で「仕様適合(spec met)」となったステータスを表示するライブスコアボード。
スコアボード:75回の実験、ランダム比19.9倍削減、$4,419および90ロボット時間を削減、38件の実行不可能候補をブロック、実験75で仕様適合。

決定的な違い:破綻する処方をロボットに届く前に阻止

阻止された1件の詳細をここに示します。提案された候補はプロセス湿度下でのSn(II)酸化ハザードを抱えており、予測されたバンドギャップ、相安定性、熱分解温度はすべて目標範囲外でした。ゲートは合成前にこれを拒否し、105米ドルの試薬と2.33ロボット時間を節約した上で、その拒否理由をハッシュチェーン化されたALCOA+レコードとして記録します。決定論的化学がすでに知っていた事実を確かめるために、オプティマイザがロボット時間を1時間たりとも浪費することはありません。

「合成前にブロック(blocked before synthesis)」と表示され、予測バンドギャップ、相安定性、分解温度がすべて「目標範囲外」とマークされ、その理由としてプロセス湿度でのSn(II)酸化ハザード、節約された105米ドルの試薬と2.33ロボット時間、およびレコード111のハッシュチェーン化ALCOA+受領書を示すブロック候補詳細パネル。
単一のブロック事例:目標外と予測された物性、明示されたSn(II)酸化ハザード、合成前に節約された$105と2.33ロボット時間。

38件のブロック事例、それぞれに明記された化学的根拠

この単一のブロックは偶然の産物ではなく、一貫した動作パターンです。実行全体を通じて、ゲートは合成前に38件の実行不可能な候補を遮断しました。それぞれがSn(II)酸化ハザード、非補償Bサイトによる電荷中性違反、形成可能領域外のゴールドシュミット許容因子など、違反した物理化学的原則を節約金額やロボット時間とともに明記しています。ブロックにより防止された浪費は合計4,419米ドルおよび90ロボット時間に達し、実行不可能な合成は1件も行われませんでした。

合成前に検出された38件の実行不可能候補を表示するデジタルツインによる全ブロックリスト。各行にはSn(II)酸化ハザード、電荷中性違反、形成領域外のゴールドシュミット許容因子などの違反内容が、候補ごとに節約された金額・ロボット時間、および合計4,419ドルと90ロボット時間の防止された浪費とともに記載されています。
全38件のブロック:それぞれに明記された化学的違反内容、節約された試薬予算とロボット時間。いずれも一切合成されることはありませんでした。

目標仕様ボックスへと収束するループ

探索マップは、シミュレーション内でループが合成した各材料をバンドギャップ対相安定性空間にプロットし、熱分解温度で色分けしています。破線のボックスは目標ウィンドウ(1.2〜1.5 eVのバンドギャップと高い安定性)を示しています。初期のプロットは分散していますが、サロゲートの学習に伴い後期のプロットはボックスに向かって集束し、最良の材料がその内部に到達します。これはオプティマイザがその真価を発揮している姿ですが、それはゲートが通過を許可した候補に対してのみ機能しています。

探索マップ:x軸にバンドギャップ、y軸に相安定性をプロットし熱分解温度で色分けした合成材料の散布図。左上領域に破線の目標仕様ボックスがあり、その目標ウィンドウ内に最良材料が輝点として配置されています。
バンドギャップ対相安定性:合成されたプロットが破線の目標ボックスへと向かい、最良材料がその内部に到達。

実験75で得られた仕様適合材料

発見された最良材料はすべての仕様を満たしています:組成 (Cs0.46MA0.22FA0.31)(Sn0.69Ge0.31)(I0.73Br0.21Cl0.06)3、バンドギャップ 1.43 eV、相安定性スコア 0.743、熱分解温度 250.5℃。適用範囲を明確にしておくと、これは物理学に基づいた合成目的関数の出力であり、実際に作成された材料ではありません。これはループが収束することの証明であり、現実の新材料発見を主張するものではありません。

「すべての仕様に適合(meets every spec)」と表示され、組成 (Cs0.46MA0.22FA0.31)(Sn0.69Ge0.31)(I0.73Br0.21Cl0.06)3、バンドギャップ 1.43 eV、相安定性スコア 0.743、熱分解温度 250.5℃を示す最良材料パネル。
合成目的関数による実験75での仕様適合組成:バンドギャップ 1.43 eV、安定性 0.743、熱分解温度 250.5℃。

受領書:113件のレコード、チェーン完全維持

75件の合成と38件のブロックの双方を含むすべての決定は、追記限定(append-only)レコード(全113件)に書き込まれ、ALCOA+原則に対応付けられたキャンペーン来歴レポートとしてエクスポートされます。各行にはタイムスタンプ、アクション、候補、ゲート判定、違反項目、根拠、および直前のレコードと連鎖するSHA-256ハッシュが含まれます。レポートには「チェーン完全維持(chain intact)」および「改ざん防止(tamper-evident)」と表示され、これこそ規制対象ラボが提出しなければならない帰属性と同時性を備えた来歴情報です。

ALCOA+に対応付けられたエクスポート済みキャンペーン来歴レポート。「キャンペーンSDL-411、113件のレコード、チェーン完全維持・改ざん防止」というヘッダーの下に、タイムスタンプ、ブロックまたは提案・合成のアクション、候補、ゲート判定、違反項目、根拠、および各行を直前の行と連鎖させるハッシュの列を備えた決定テーブルが表示されています。
エクスポートされたALCOA+レポート:ハッシュチェーン化された113件のレコード、チェーン完全維持、すべてのブロックを含む自律的意思決定ごとに1行。

改ざんテスト:1件のレコードを編集するとチェーンの破断が可視化される

改ざん検知性は、実際に作動する様子を確認できて初めて価値を持ちます。エクスポートされた監査記録内のペイロードを1つでも編集すると、検証機能はそのレコードでチェーンが破断したことを報告し、「改ざんを検出(tamper detected)」と警告して、提出された監査記録が証明可能な形で変更されている旨を明示します。肝心なのはレコードを変更できないことではなく、変更を隠蔽できないことであり、それこそが監査証跡の正当性を担保します。

改ざんテスト後のALCOA+来歴パネル:113件のレコードバッジとエクスポート操作部の横に、レコード2でチェーンが破断した旨の赤い警告文「改ざんを検出(tamper detected)」および提出監査記録の改変が証明可能である旨を表示。
改ざんテスト:1件のレコード編集後、そのレコードでチェーンが破断し、改ざんされた監査記録としてフラグが付与されます。

本レイヤーの位置づけと適用範囲

これは既存ハードウェア上に構築される頭脳、セーフティゲート、および来歴管理レイヤーであり、ホスト型ラボではなく、機器やDFT計算を代替するものでもありません。

懸念事項 物性モデルまたはオプティマイザ単体 本レイヤー
化学的に不可能な提案 合成が実行された後、失敗として評価される 試薬が消費される前に決定論的ゲートによって阻止される
候補が却下された理由 記録されたとしても損失関数の中に埋没する 公開された5つの化学ルールと照合して明示され、節約された金額と時間も記録される
自動化された意思決定の出所(来歴) アドホックなログ(編集可能) 追記限定・ハッシュチェーン化されたALCOA+レコード(改ざん防止)
安全性判断の主体 LLM、またはオプティマイザ自身の信頼度 エージェントの外部にある平易な決定論的コード
サンプル効率 獲得関数によって変動 本ベンチマークの未知目的関数において仕様到達まで75回(ランダムスクリーニングの約1,491回に対し)
ハードウェアおよびモデルのロックイン ホスト型スタックであることが多い SiLA-2準拠インターフェースを通じて自社機器上で動作、LLMプロバイダは交換可能

本デモに含まれない事項

  • 目的関数、発見されたペロブスカイト、およびすべての物性値は物理学に基づく合成ベンチマークであり、実際のDFT、Materials Projectからの取得データ、あるいは実験室データではありません。物理的に合成されたものはなく、ラボはSiLA-2準拠インターフェースの背後にあるシミュレータです。
  • 20倍少ない実験数、75回の実験での発見、および節約された4,419米ドルという数値は、未知の合成目的関数における本ベンチマークの数値であり、オープンワールドでの保証ではありません。10シードのベンチマークにおいて、ループは10回中10回ではなく10回中9回の試行で目標を解決し、ループ自体は約10〜15%のロボット障害を吸収します。
  • ALCOA+来歴は実装され対応付けられていますが、お客様のSOPに対するIQ(据付時適格性確認)、OQ(運転時適格性確認)、またはPQ(性能適格性確認)のバリデーションを受けたものではありません。その適格性評価は個別プロジェクト契約の範囲であり、本デモで主張するものではありません。
  • 実際の機器ドライバ、実際のDFTまたはCGCNNサロゲート、および複数機器のスケジューリング機能は含まれていません。これらは今後の開発対象です。
  • デモに同梱されているオプティマイザは、ターゲット指向獲得関数を備えたnumpyおよびscipyによるGPです。BoTorchおよびAxは本番環境での移行先であり、デモ用エンジンではありません。
  • 当社はホスト型のロボットラボを運営しておらず、既存の自律型ラボベンダーのクローンでもありません。本レイヤーは、お客様がすでに所有しているハードウェア上に組み込めるよう設計されています。
  • 実在の顧客、特定ラボの名称、導入事例、または主張されたROI(投資対効果)は含まれていません。本デモの構築過程で私たちが得た知見を誠実に提示しています。

導入検討時によくある質問

すでにロボットとELN(電子実験ノート)を導入済みです。自律型ラボレイヤーを追加すると実際に何が得られますか?

本レイヤーは、お客様がすでに所有しているハードウェアの上位に位置する頭脳、セーフティゲート、および来歴記録です。クローズドループが次に実行すべき実験を決定し、はるかに少ない実験数で厳格な仕様に到達します。また決定論的デジタルツインゲートが、試薬やロボット時間を消費する前に化学的に不可能または危険な合成を拒絶し、すべての決定が改ざん防止監査証跡に記録されます。本ベンチマークでは、ゲートが破綻確実な38件の合成を阻止し、4,419米ドルと90.1ロボット時間を節約し、実行不可能な実験がロボットに到達することは一切ありませんでした。

これは現実の新材料発見ですか?実際にそのペロブスカイトを合成したのですか?

いいえ、その点については明確にしています。目的関数は物理学に基づいた合成ベンチマークであり、実際のDFTやラボデータではありません。またラボはSiLA-2準拠インターフェースの背後にあるシミュレータであるため、ここで物理的に作成されたものは一切ありません。本デモが実証しているのは、モデル品質に左右されることのないメカニズム、ループ、決定論的セーフティゲート、および監査可能な来歴管理です。発見された組成とその物性値はベンチマークの出力であり、実験結果ではありません。

デジタルツインゲートは、当社のベイズ最適化ツールにすでに組み込まれている制約条件と何が違うのですか?

オプティマイザの制約条件は、ターゲット達成を試行しているのと同じモデルの内部に存在しており、そのモデル自身の自己報告と同じ程度の信頼性しかありません。当社のゲートは、エージェントやサロゲートの外部で動作する独立した決定論的コードであり、すべての提案を公開された5つの化学ルール(ゴールドシュミット許容因子、八面体因子、電荷中性、Sn(II)湿度酸化、および有機前駆体の分解上限温度)と照合します。違反した正確なルール、節約された金額およびロボット時間とともに「成立」または「ブロック」を返すため、破綻する処方はロボットに渡る前に確実に阻止されます。

ラボ内でLLMエージェントを動かしていますが、ハルシネーション(幻覚)によって誤った実験が開始されないとどうして言えるのですか?

エージェントが決断を下すことは決してないからです。Lab DirectorおよびCriticエージェントは戦略を解説しドリフトを警告するだけであり、実行内容を決定するのはオプティマイザと決定論的ゲートであり、どちらもLLMに依存しません。APIキーがない場合、エージェントは決定論的な解説にフォールバックしますが、ループは全く同様に動作します。「エージェントが進言し、コードが決断する」というこの分離こそが核心です。自律型ラボへの信頼を、モデル自身の自己弁述に委ねることはできません。

当社の監査証跡はFDA、EMA、および自社のQA基準を満たす必要があります。これはGxPバリデーション済みですか?

来歴機能は実装され、ALCOA+原則に対応付けられています。すべての決定が追記限定・ハッシュチェーン化レコードに書き込まれ、いずれかのレコードを編集するとチェーンが目に見えて破断します。これはFDAおよびEMAの指針が求める帰属性と同時性を備えた来歴そのものです(FDA/EMA, 2026)。お客様のSOPに対するIQ、OQ、またはPQバリデーションを受けたものではなく、その適格性確認はプロジェクト契約の範囲であり、初期状態で保証するものではありません。本デモではレコードと改ざんテストを公開しており、形式的なチェック項目ではなく実質的な機能をご確認いただけます。

実験回数が20倍削減されたという数値は、都合の良いデータだけを抽出(チェリーピック)したものではありませんか?

これはシード411による単一の決定論的実行の結果です。同一の未知目的関数において仕様適合材料に達するまで、ランダムスクリーニングが想定する約1,491回に対して75回の実験で到達し、これは19.9倍少ない数値です。10シードのベンチマーク全体では、ループの平均実験数は67回で10回中9回解決したのに対し、ランダムスクリーニングは1,000回以内で5回中1回しか解決できず、グリッド探索は一度も仕様に到達しませんでした。前提条件が重要です。これらは合成目的関数上でのオプティマイザ対ベースラインの数値であり、見せかけの比較対象ではなく再現可能なベースラインに対して実行されたものであり、オープンワールドでの普遍的な約束ではありません。

これにより貴社のモデル、クラウド、またはホスト型ラボへのロックインが発生しますか?

いいえ。当社はホスト型のロボットラボを運営しておらず、本レイヤーはSiLA-2準拠インターフェースを介してお客様の機器上に組み込まれるよう設計されています。オプティマイザとゲートは平易なnumpyおよびscipyであり、APIキーなしで完全にオフラインで動作し、LLMプロバイダは交換可能(デフォルトはclaude-opus-4-8)です。デモに同梱されているオプティマイザはターゲット指向獲得関数を備えたGPであり、本番環境での移行先はBoTorchおよびAxです。これらはお客様のハードウェア上で動作し、当社のインフラではありません。

技術リサーチ

本デモを支える研究 — アーキテクチャ、検証設計、およびエンタープライズ向けブループリント。

自律性が真に信頼を獲得する場所に、セーフティゲートと監査証跡を配置する

より少ない実験で仕様に到達し、破綻する実験を実行前に遮断し、事後的にすべての決定を証明する。

貴社チームが自律型ラボの立ち上げを進めており、成立性判断の信頼性向上と監査証跡の正当性確保をご検討中であれば、ぜひ貴社のお考えをお聞かせください。この課題は業界全体のものであり、その解決策もまた共有されるべきものです。

自律型ラボ導入レディネス評価

  • ✓ ワークフロー内で破綻する合成や失敗試行が集中している箇所をマッピング
  • ✓ 成立性および安全性のルールを決定論的ゲートとしてコード化
  • ✓ 自社QAおよび規制当局が承認するALCOA+来歴を定義
  • ✓ 再現可能なベースラインに照らしてクローズドループの目的関数を設定

共同開発

  • ✓ ターゲット指向獲得関数を備えたGP、またはBoTorchおよびAxによるオプティマイザ
  • ✓ エージェントの外部で動作する決定論的デジタルツインゲート
  • ✓ ハッシュチェーン化された改ざん防止仕様のALCOA+監査証跡
  • ✓ 既存機器に接続するSiLA-2準拠インターフェース(ロックインなし)
ソーシャル

他のプラットフォームでも公開