Autonomous Lab AI · 自動化材料探索
自動駕駛實驗室之所以失敗,並非因為其優化器效能不足,而是因為其執行的實驗中有很大一部分從配方的第一行起在化學上就是不可能實現的,且事後完全無法證明其過程。在此基準測試中,我們的「設計-製造-測試-分析」(Design-Make-Test-Analyze)閉環僅需 75 次實驗即可達到嚴格規範,而隨機篩選在相同隱藏目標下約需 1,491 次;同時,數位分身安全閘門會在耗費試劑或機器人小時之前,攔截每一次不可行的合成,並將每個決策簽署至具防篡改特性的 ALCOA+ 記錄中。代理提供建議,程式碼做出決策。
$4,419
數位分身閘門所防止的試劑浪費,成功攔截 38 次註定失敗的合成並節省 90.1 個機器人小時
Seed-411 基準測試運行,合成目標
減少 20×
達到符合規範材料僅需 75 次實驗,而在相同隱藏目標下隨機篩選約需 1,491 次
Seed-411 基準測試運行,減少 19.9 倍
113
雜湊鏈結 ALCOA+ 記錄,每個決策一筆,具防篡改特性。修改其中一筆,鏈條即斷裂
Seed-411 基準測試運行,75 次合成加上 38 次攔截
在 18 維無鉛鈣鈦礦成分與製程搜尋上展示該機制的具體可運行示範。優化器與安全閘門完全在 numpy 和 scipy 中運行,無需 API 金鑰;兩位顧問代理是唯一可呼叫模型的部分。
瓶頸不在於代理模型,而在於模型根本不該提出的註定失敗實驗,以及事後完全無法證明過程的事實。
柏克萊的 A-Lab 報告了 71% 的成功率,這意味著其大約 29% 的嘗試未能產生目標產物(A-Lab, Nature, 2023)。在自主運行的實驗室中,這種失敗份額不僅僅是產率損失,更是在機器人開始動作之前,就因電荷不平衡、幾何結構不穩定或化學危害等問題,在註定失敗的合成上耗費了試劑分配、預約了機器人小時並燒掉了儀器時間。
搜尋空間使情況更加嚴峻。如此規模的鈣鈦礦成分與製程空間在數量級上遠大於任何篩選預算,因此純粹篩選並非策略,而是一場博弈。在此基準測試上進行的獨立可行性探測發現,隨機命中率僅為 0.01%(80,000 個候選物中僅有 8 個),這意味著僅靠篩選預計需要大約 10,000 次實驗才能達到第一個目標。更好的獲取函數有助於解決這半個問題。
但對另一半問題卻毫無助益。物性模型無論多麼優秀,都無法判定一項合成是否安全可行,也無法產生監管機構或您自身 QA 能夠接受的記錄。FDA 與 EMA 針對藥物開發中 AI 的指導原則明確指出,來源追溯必須具備可歸屬性與同步性(FDA/EMA, 2026)。可行性與可審計性恰恰是模型無法觸及的部分,而這正是我們著手彌合的兩個缺口。
單一「設計-製造-測試-分析」週期,一次展示一個階段。可行性決策存在於純程式碼中,絕不存在於模型中。
該閉環搜尋一個 18 維無鉛鈣鈦礦空間:Cs、MA 與 FA 陽離子比例,Sn、Ge 與 Bi 的 B 位取代,I、Br 與 Cl 鹵素比例,再加上製程變數。採用具備目標導向、ParEGO 風格獲取函數的高斯過程代理模型提出下一個候選物,並從 60 筆記錄的歷史夾具進行冷啟動。隨後,每個提議在進行任何合成之前都必須通過閘門,因此站在配方與機器人之間的,是閘門而非優化器的信賴度。
數位分身閘門是獨立於任何語言模型之外的部分。每個提出的候選物在消耗試劑之前,都會依據五條真實且已發表的化學規則進行檢查,閘門會返回可行或攔截,並具體指出違反的規則以及所避免的試劑預算與機器人小時。它是純 numpy 和 scipy 程式碼,位於代理和代理模型之外,承擔著核心決策重任。註定失敗的配方在此被終止,而不是等機器人運行後才被發現。
在核心之上,有兩個代理負責讀取與溝通。實驗室主任敘述實驗策略,審查員則獨立標記漂移或停滯,作為迴圈中的驗證器。它們可透過 LLM_PROVIDER 設定更換提供商,預設為 claude-opus-4-8;在沒有金鑰時,它們會回退到確定性敘述,確保示範始終可以運行。優化器與閘門絕不依賴 LLM。代理提供建議,程式碼做出決策。
| 檢查項目 | 攔截內容 | 依據 |
|---|---|---|
| Goldschmidt 容差因子 | 成分超出鈣鈦礦可形成性窗口;閘門採用 0.78 至 1.05 的篩選區間。 | 鈣鈦礦結晶化學 |
| 八面體因子 | 半徑比超出 0.41 至 0.90 的穩定八面體窗口。 | 鈣鈦礦結晶化學 |
| 電荷中性 | 未補償的 B 位電荷,例如來自 Bi(III) 取代。 | 離子電荷平衡 |
| Sn(II) 氧化危害 | Sn(II) 在潮濕空氣中會氧化,在製程濕度下既不安全且註定失敗。 | 錫鹵化物穩定性 |
| 分解溫度上限 | 退火溫度高於 MA 與 FA 陽離子降解的溫度(約攝氏 190 度)。 | 前驅物熱穩定性 |
持久的價值在於安全閘門與審計軌跡,而非更優越的代理模型。即使是完美的物性模型,依然無法阻止電荷不平衡或具氧化危害的合成被執行,也無法產生監管機構能接受的記錄。優化器只是該控制層內部一個可抽換的組件,這也是該方法不會隨著模型進步而過時的原因。現行交付的優化器是採用目標導向獲取函數的 numpy 和 scipy GP;生產環境中的替換方案則是 BoTorch 與 Ax。
以下每個數字均來自單次確定性基準測試活動(seed 411),在運行時即時計算得出,而非寫死於程式中。目標是一個具備物理意義的合成基準測試,而非真實的 DFT 或實驗室數據,且實驗室是位於 SiLA-2 規範介面背後的模擬器。此處沒有進行任何實體物理合成。
閉環在第 75 次實驗時達到目標規範,與在相同隱藏目標下隨機篩選預期的約 1,491 次相比,實驗次數減少了 19.9 倍。與此同時,計分板追蹤了比速度更重要的數據:防止了 4,419 美元的試劑浪費、節省了 90 個機器人小時,並在合成前攔截了 38 個不可行的候選物,規範狀態顯示為符合規範。效率提升是真實的,但防止浪費與來源追溯才是無論模型品質如何都能成立的核心部分。
以下是其中一次攔截的詳細資訊。某個被提出的候選物在製程濕度下存在 Sn(II) 氧化危害,且其預測的能隙、相穩定性與分解溫度均超出目標範圍。閘門在合成前拒絕了它,節省了 105 美元的試劑與 2.33 個機器人小時,並將此拒絕記錄寫入雜湊鏈結的 ALCOA+ 記錄中。優化器完全不需要浪費機器人小時去發現確定性化學原理早已知道的事實。
單次攔截絕非僥倖捕獲,而是一種常態模式。在整個運行過程中,閘門在合成前攔截了 38 個不可行的候選物,每一個都明確指出了所違反的物理法則——Sn(II) 氧化危害、未補償 B 位導致的電荷中性違規,或超出可形成性窗口的 Goldschmidt 容差——並列出所節省的美元與機器人小時。攔截總計防止了 4,419 美元與 90 個機器人小時的浪費,且執行的不可行合成次數為零。
探索地圖在「能隙與相穩定性」空間中繪製出閉環在模擬中合成的每種材料,並以分解溫度著色,虛線方框標記出目標窗口(能隙 1.2 至 1.5 eV 且具高穩定性)。早期的點較為分散;隨著代理模型不斷學習,後期的點逐漸向方框聚集,而最佳材料正落在方框內部。這正是優化器在發揮作用,但僅作用於閘門允許通過的候選物上。
所發現的最佳材料符合所有規範:成分為 (Cs0.46MA0.22FA0.31)(Sn0.69Ge0.31)(I0.73Br0.21Cl0.06)3,能隙為 1.43 eV,相穩定性得分為 0.743,分解溫度為攝氏 250.5 度。為明確其範圍,這是具物理意義合成目標的輸出結果,而非任何人實際製造出的材料。這是閉環收斂的證明,而非對真實發現的宣稱。
每個決策(包括 75 次合成與 38 次攔截)都會寫入僅供附加的記錄中,總計 113 筆,並匯出為對應 ALCOA+ 原則的實驗活動來源追溯報告。每一行都包含時間戳記、操作、候選物、閘門判定、違規項目、理由以及將其與前一筆記錄連結的 SHA-256 雜湊值。報告顯示鏈條完整且具防篡改性,這正是受監管實驗室必須歸檔的可歸屬且同步的來源追溯證明。
防篡改性只有在您能親眼見證其觸發時才有意義。在匯出的審計記錄中修改單一有效負載,驗證器就會報告鏈條在該記錄處斷裂、偵測到篡改,並指出歸檔的審計記錄已被可證明地更動。重點不在於記錄無法被修改,而在於修改無法被隱藏,這正是讓追溯軌跡具備可防禦性的關鍵。
它是建構在您現有硬體之上的大腦、安全閘門與來源追溯層,而非託管實驗室,也不是要取代您的儀器或 DFT。
| 關注議題 | 單純使用物性模型或優化器 | 本架構層 |
|---|---|---|
| 化學上不可能實現的提議 | 進行合成,隨後評定為失敗 | 在耗費任何試劑前由確定性閘門攔截 |
| 候選物被拒絕的原因 | 埋沒在損失函數中(如果有的話) | 依據五條已發表的化學規則明確指明,並附帶節省的金額與小時數 |
| 自動化決策的來源追溯 | 臨時日誌,可被編輯 | 僅供附加、雜湊鏈結的 ALCOA+ 記錄,具防篡改性 |
| 誰做出安全決策 | LLM,或優化器自身的信賴度 | 代理之外純粹、確定性的程式碼 |
| 樣本效率 | 隨獲取函數而異 | 在此基準測試的隱藏目標下,達到規範需 75 次實驗,對比約 1,491 次 |
| 硬體與模型綁定 | 通常為託管技術堆疊 | 透過 SiLA-2 規範介面在您的儀器上運行,LLM 提供商可自由抽換 |
該架構層是建構在您已擁有的硬體之上的大腦、安全閘門與來源追溯記錄。閉環決定下一步運行什麼,並以少得多的實驗次數達到嚴格規範;確定性數位分身閘門在消耗試劑與機器人小時之前拒絕化學上不可能或具危害性的合成;且每個決策都會寫入具防篡改性的審計軌跡中。在此基準測試中,閘門攔截了 38 次註定失敗的合成,節省了 4,419 美元與 90.1 個機器人小時,且抵達機器人的不可行實驗次數為零。
並非如此,我們對此明確說明。該目標是一個具備物理意義的合成基準測試,而非真實的 DFT 或實驗室數據,且實驗室是位於 SiLA-2 規範介面背後的模擬器,因此這裡沒有任何實體製造的產物。本示範所證明的是其機制、閉環、確定性安全閘門以及可審計的來源追溯,這些在任何模型品質下均能成立。所發現的成分及其物性數值均為基準測試輸出,而非實驗結果。
優化器的約束條件存在於試圖達成目標的同一個模型內部,其可靠程度僅取決於該模型的自我報告。我們的閘門是獨立、確定性的程式碼,在代理和代理模型之外運行,並依據五條已發表的化學規則檢查每個提議:Goldschmidt 容差、八面體因子、電荷中性、Sn(II) 濕度氧化以及有機前驅物分解溫度上限。它會返回可行或攔截,並具體指出違反的規則以及避免的金額與機器人小時,因此註定失敗的配方在機器人接觸到之前就會被終止。
因為代理絕不做決策。實驗室主任與審查員代理僅負責敘述策略與標記漂移,而優化器與確定性閘門決定運行內容,兩者均不依賴 LLM。在沒有 API 金鑰的情況下,代理會回退到確定性敘述,閉環依然以完全相同的方式運行。這種「代理提供建議,程式碼做出決策」的分離正是關鍵所在:對自動駕駛實驗室的信任,絕不能建立在模型對自身的自我陳述之上。
來源追溯已具備並對應至 ALCOA+ 原則:每個決策都會寫入僅供附加、雜湊鏈結的記錄,且修改任何記錄都會使鏈條明顯斷裂,這正是 FDA 與 EMA 指導原則所要求的可歸屬、同步的來源追溯證明(FDA/EMA, 2026)。它尚未針對您的 SOP 進行 IQ、OQ 或 PQ 驗證,該資格驗證屬於專案服務範疇,而非我們宣稱開箱即用的特性。本示範展示了記錄與防篡改測試,以便您評估其實質內容而非僅僅核對勾選框。
這是單次確定性運行(seed 411)的結果:達到符合規範材料需 75 次實驗,而在相同隱藏目標下隨機篩選預期約需 1,491 次,即減少了 19.9 倍。在 10 個 seed 的基準測試中,閉環平均需 67 次實驗並解決了 10 次運行中的 9 次,而隨機篩選在 1,000 次內僅解決了 5 次中的 1 次,網格搜尋則從未達到規範。評估範疇至關重要:這些是針對合成目標的「優化器對比基準線」數據,是與可重現的基準線而非假想敵進行對比,並非開放世界的承諾。
不會。我們不運營託管機器人實驗室,且該架構層設計為透過 SiLA-2 規範介面建置於您的儀器上。優化器與閘門是純 numpy 和 scipy 程式碼,完全在離線狀態下運行且無需 API 金鑰,LLM 提供商可自由抽換(預設為 claude-opus-4-8)。現行交付的優化器是採用目標導向獲取函數的 GP,生產環境中的替換方案則是 BoTorch 與 Ax,運行在您的硬體上,而非我們的硬體。
以更少的實驗次數達到規範,在運行前攔截註定失敗的實驗,並在事後證明每個決策。
如果您的團隊正在建置自動駕駛實驗室,並正在研究如何讓可行性判定值得信賴、讓來源追溯具備可防禦性,我們非常樂意聽聽您的想法。這是全行業面臨的共同挑戰,其解答也將適用於整個產業。