Autonomous Lab AI · 自動化材料探索

機器人會毫不知情地在註定失敗的合成上整夜運行。我們構建了拒絕它的確定性閘門,以及證明原因的審計軌跡。

自動駕駛實驗室之所以失敗,並非因為其優化器效能不足,而是因為其執行的實驗中有很大一部分從配方的第一行起在化學上就是不可能實現的,且事後完全無法證明其過程。在此基準測試中,我們的「設計-製造-測試-分析」(Design-Make-Test-Analyze)閉環僅需 75 次實驗即可達到嚴格規範,而隨機篩選在相同隱藏目標下約需 1,491 次;同時,數位分身安全閘門會在耗費試劑或機器人小時之前,攔截每一次不可行的合成,並將每個決策簽署至具防篡改特性的 ALCOA+ 記錄中。代理提供建議,程式碼做出決策。

$4,419

數位分身閘門所防止的試劑浪費,成功攔截 38 次註定失敗的合成並節省 90.1 個機器人小時

Seed-411 基準測試運行,合成目標

減少 20×

達到符合規範材料僅需 75 次實驗,而在相同隱藏目標下隨機篩選約需 1,491 次

Seed-411 基準測試運行,減少 19.9 倍

113

雜湊鏈結 ALCOA+ 記錄,每個決策一筆,具防篡改特性。修改其中一筆,鏈條即斷裂

Seed-411 基準測試運行,75 次合成加上 38 次攔截

在 18 維無鉛鈣鈦礦成分與製程搜尋上展示該機制的具體可運行示範。優化器與安全閘門完全在 numpy 和 scipy 中運行,無需 API 金鑰;兩位顧問代理是唯一可呼叫模型的部分。

自動駕駛實驗室的大部分預算,都花在證明化學原理早已排除的事情上

瓶頸不在於代理模型,而在於模型根本不該提出的註定失敗實驗,以及事後完全無法證明過程的事實。

柏克萊的 A-Lab 報告了 71% 的成功率,這意味著其大約 29% 的嘗試未能產生目標產物(A-Lab, Nature, 2023)。在自主運行的實驗室中,這種失敗份額不僅僅是產率損失,更是在機器人開始動作之前,就因電荷不平衡、幾何結構不穩定或化學危害等問題,在註定失敗的合成上耗費了試劑分配、預約了機器人小時並燒掉了儀器時間。

搜尋空間使情況更加嚴峻。如此規模的鈣鈦礦成分與製程空間在數量級上遠大於任何篩選預算,因此純粹篩選並非策略,而是一場博弈。在此基準測試上進行的獨立可行性探測發現,隨機命中率僅為 0.01%(80,000 個候選物中僅有 8 個),這意味著僅靠篩選預計需要大約 10,000 次實驗才能達到第一個目標。更好的獲取函數有助於解決這半個問題。

但對另一半問題卻毫無助益。物性模型無論多麼優秀,都無法判定一項合成是否安全可行,也無法產生監管機構或您自身 QA 能夠接受的記錄。FDA 與 EMA 針對藥物開發中 AI 的指導原則明確指出,來源追溯必須具備可歸屬性與同步性(FDA/EMA, 2026)。可行性與可審計性恰恰是模型無法觸及的部分,而這正是我們著手彌合的兩個缺口。

閉環提出提議;代理之外的確定性閘門決定允許運行哪些實驗

單一「設計-製造-測試-分析」週期,一次展示一個階段。可行性決策存在於純程式碼中,絕不存在於模型中。

該閉環搜尋一個 18 維無鉛鈣鈦礦空間:Cs、MA 與 FA 陽離子比例,Sn、Ge 與 Bi 的 B 位取代,I、Br 與 Cl 鹵素比例,再加上製程變數。採用具備目標導向、ParEGO 風格獲取函數的高斯過程代理模型提出下一個候選物,並從 60 筆記錄的歷史夾具進行冷啟動。隨後,每個提議在進行任何合成之前都必須通過閘門,因此站在配方與機器人之間的,是閘門而非優化器的信賴度。

GP 代理模型(提議)→ 數位分身閘門(可行或攔截,純程式碼)→ 合成與表徵,SiLA-2 規範介面(模擬)→ 分析並更新代理模型 → ALCOA+ 記錄(雜湊鏈結)。實驗室主任與審查員代理在旁敘述並標記漂移,絕不參與決策。

確定性信任核心

數位分身閘門是獨立於任何語言模型之外的部分。每個提出的候選物在消耗試劑之前,都會依據五條真實且已發表的化學規則進行檢查,閘門會返回可行或攔截,並具體指出違反的規則以及所避免的試劑預算與機器人小時。它是純 numpy 和 scipy 程式碼,位於代理和代理模型之外,承擔著核心決策重任。註定失敗的配方在此被終止,而不是等機器人運行後才被發現。

受限於建議職能的代理

在核心之上,有兩個代理負責讀取與溝通。實驗室主任敘述實驗策略,審查員則獨立標記漂移或停滯,作為迴圈中的驗證器。它們可透過 LLM_PROVIDER 設定更換提供商,預設為 claude-opus-4-8;在沒有金鑰時,它們會回退到確定性敘述,確保示範始終可以運行。優化器與閘門絕不依賴 LLM。代理提供建議,程式碼做出決策。

閘門執行的五項可行性檢查

檢查項目 攔截內容 依據
Goldschmidt 容差因子 成分超出鈣鈦礦可形成性窗口;閘門採用 0.78 至 1.05 的篩選區間。 鈣鈦礦結晶化學
八面體因子 半徑比超出 0.41 至 0.90 的穩定八面體窗口。 鈣鈦礦結晶化學
電荷中性 未補償的 B 位電荷,例如來自 Bi(III) 取代。 離子電荷平衡
Sn(II) 氧化危害 Sn(II) 在潮濕空氣中會氧化,在製程濕度下既不安全且註定失敗。 錫鹵化物穩定性
分解溫度上限 退火溫度高於 MA 與 FA 陽離子降解的溫度(約攝氏 190 度)。 前驅物熱穩定性

持久的價值在於安全閘門與審計軌跡,而非更優越的代理模型。即使是完美的物性模型,依然無法阻止電荷不平衡或具氧化危害的合成被執行,也無法產生監管機構能接受的記錄。優化器只是該控制層內部一個可抽換的組件,這也是該方法不會隨著模型進步而過時的原因。現行交付的優化器是採用目標導向獲取函數的 numpy 和 scipy GP;生產環境中的替換方案則是 BoTorch 與 Ax。

運行過程螢幕展示

以下每個數字均來自單次確定性基準測試活動(seed 411),在運行時即時計算得出,而非寫死於程式中。目標是一個具備物理意義的合成基準測試,而非真實的 DFT 或實驗室數據,且實驗室是位於 SiLA-2 規範介面背後的模擬器。此處沒有進行任何實體物理合成。

計分板:閉環所花費與節省的資源

閉環在第 75 次實驗時達到目標規範,與在相同隱藏目標下隨機篩選預期的約 1,491 次相比,實驗次數減少了 19.9 倍。與此同時,計分板追蹤了比速度更重要的數據:防止了 4,419 美元的試劑浪費、節省了 90 個機器人小時,並在合成前攔截了 38 個不可行的候選物,規範狀態顯示為符合規範。效率提升是真實的,但防止浪費與來源追溯才是無論模型品質如何都能成立的核心部分。

即時計分板顯示執行了 75 次實驗,比隨機篩選的約 1,491 次減少 19.9 倍,數位分身防止了 4,419 美元的浪費,節省了 90 個機器人小時,在合成前攔截了 38 個不可行候選物,且規範狀態在第 75 次實驗時顯示為符合規範。
計分板:75 次實驗,比隨機篩選少 19.9 倍,節省 $4,419 美元與 90 個機器人小時,攔截 38 個不可行候選物,在第 75 次實驗達到規範。

核心差異:註定失敗的配方在送達機器人之前即被終止

以下是其中一次攔截的詳細資訊。某個被提出的候選物在製程濕度下存在 Sn(II) 氧化危害,且其預測的能隙、相穩定性與分解溫度均超出目標範圍。閘門在合成前拒絕了它,節省了 105 美元的試劑與 2.33 個機器人小時,並將此拒絕記錄寫入雜湊鏈結的 ALCOA+ 記錄中。優化器完全不需要浪費機器人小時去發現確定性化學原理早已知道的事實。

遭攔截候選物詳細資訊面板,顯示在合成前攔截,預測能隙、相穩定性與分解溫度皆標記為超出目標,原因為製程濕度下的 Sn(II) 氧化危害,節省了 105 美元試劑與 2.33 個機器人小時,並附有記錄 111 的雜湊鏈結 ALCOA+ 收據。
單次攔截:預測物性超出目標,指出 Sn(II) 氧化危害,並在合成前節省 $105 美元與 2.33 個機器人小時。

三十八次攔截,每一次都明確指出其化學原理

單次攔截絕非僥倖捕獲,而是一種常態模式。在整個運行過程中,閘門在合成前攔截了 38 個不可行的候選物,每一個都明確指出了所違反的物理法則——Sn(II) 氧化危害、未補償 B 位導致的電荷中性違規,或超出可形成性窗口的 Goldschmidt 容差——並列出所節省的美元與機器人小時。攔截總計防止了 4,419 美元與 90 個機器人小時的浪費,且執行的不可行合成次數為零。

完整的「遭數位分身攔截」清單顯示在合成前捕獲的 38 個不可行候選物,每一行均列出其違規項目(例如 Sn(II) 氧化危害、電荷中性違規或超出可形成性窗口的 Goldschmidt 容差),並包含每個候選物節省的美元與機器人小時,總計防止了 4,419 美元與 90 個機器人小時的浪費。
全部 38 次攔截,每一次均指明化學違規項目以及所節省的試劑預算與機器人小時,且無一被實體合成。

閉環導向目標規範區間

探索地圖在「能隙與相穩定性」空間中繪製出閉環在模擬中合成的每種材料,並以分解溫度著色,虛線方框標記出目標窗口(能隙 1.2 至 1.5 eV 且具高穩定性)。早期的點較為分散;隨著代理模型不斷學習,後期的點逐漸向方框聚集,而最佳材料正落在方框內部。這正是優化器在發揮作用,但僅作用於閘門允許通過的候選物上。

探索地圖:合成材料的散佈圖,X 軸為能隙,Y 軸為相穩定性,並以分解溫度著色,左上方區域設有虛線目標規範方框,最佳材料顯示為位於該目標窗口內的亮點。
能隙與相穩定性:合成的數據點導向虛線目標方框,最佳材料落於其內部。

第 75 次實驗中符合規範的材料

所發現的最佳材料符合所有規範:成分為 (Cs0.46MA0.22FA0.31)(Sn0.69Ge0.31)(I0.73Br0.21Cl0.06)3,能隙為 1.43 eV,相穩定性得分為 0.743,分解溫度為攝氏 250.5 度。為明確其範圍,這是具物理意義合成目標的輸出結果,而非任何人實際製造出的材料。這是閉環收斂的證明,而非對真實發現的宣稱。

最佳材料面板標註符合所有規範,顯示成分 (Cs0.46MA0.22FA0.31)(Sn0.69Ge0.31)(I0.73Br0.21Cl0.06)3,能隙為 1.43 eV,相穩定性得分為 0.743,分解溫度為攝氏 250.5 度。
第 75 次實驗中符合規範的成分(來自合成目標):能隙 1.43 eV,穩定性 0.743,分解溫度攝氏 250.5 度。

收據:113 筆記錄,鏈條完整

每個決策(包括 75 次合成與 38 次攔截)都會寫入僅供附加的記錄中,總計 113 筆,並匯出為對應 ALCOA+ 原則的實驗活動來源追溯報告。每一行都包含時間戳記、操作、候選物、閘門判定、違規項目、理由以及將其與前一筆記錄連結的 SHA-256 雜湊值。報告顯示鏈條完整且具防篡改性,這正是受監管實驗室必須歸檔的可歸屬且同步的來源追溯證明。

對應 ALCOA+ 的匯出實驗活動來源追溯報告,標題為 campaign SDL-411,包含 113 筆記錄且鏈條完整具防篡改性,顯示決策表格,其欄位包含時間戳記、攔截或提議並合成的操作、候選物、閘門判定、違規項目、理由以及將每一行與前一行鏈結的雜湊值。
匯出的 ALCOA+ 報告:113 筆雜湊鏈結記錄,鏈條完整,每個自主決策(包含每一次攔截)各佔一行。

防篡改測試:修改一筆記錄,鏈條明顯斷裂

防篡改性只有在您能親眼見證其觸發時才有意義。在匯出的審計記錄中修改單一有效負載,驗證器就會報告鏈條在該記錄處斷裂、偵測到篡改,並指出歸檔的審計記錄已被可證明地更動。重點不在於記錄無法被修改,而在於修改無法被隱藏,這正是讓追溯軌跡具備可防禦性的關鍵。

防篡改測試後的 ALCOA+ 來源追溯面板,在 113 筆記錄標章與匯出控制項旁,顯示紅色警告:鏈條在記錄 2 處斷裂、偵測到篡改,且歸檔的審計記錄已被可證明地更動。
防篡改測試:在修改一筆記錄後,鏈條在該記錄處斷裂,更動後的審計記錄被標記為可證明遭篡改。

此層適用的定位與邊界

它是建構在您現有硬體之上的大腦、安全閘門與來源追溯層,而非託管實驗室,也不是要取代您的儀器或 DFT。

關注議題 單純使用物性模型或優化器 本架構層
化學上不可能實現的提議 進行合成,隨後評定為失敗 在耗費任何試劑前由確定性閘門攔截
候選物被拒絕的原因 埋沒在損失函數中(如果有的話) 依據五條已發表的化學規則明確指明,並附帶節省的金額與小時數
自動化決策的來源追溯 臨時日誌,可被編輯 僅供附加、雜湊鏈結的 ALCOA+ 記錄,具防篡改性
誰做出安全決策 LLM,或優化器自身的信賴度 代理之外純粹、確定性的程式碼
樣本效率 隨獲取函數而異 在此基準測試的隱藏目標下,達到規範需 75 次實驗,對比約 1,491 次
硬體與模型綁定 通常為託管技術堆疊 透過 SiLA-2 規範介面在您的儀器上運行,LLM 提供商可自由抽換

本示範未涵蓋之範疇

  • 目標、所發現的鈣鈦礦及每個物性數值均為具備物理意義的合成基準測試,而非真實的 DFT、Materials Project 擷取資料或實驗室數據。此處未進行任何實體物理合成;實驗室是位於 SiLA-2 規範介面背後的模擬器。
  • 減少 20 倍實驗次數、75 次實驗完成發現以及節省 4,419 美元,均為此基準測試在隱藏合成目標下的數據,而非開放世界的保證。在 10 個 seed 的基準測試中,閉環解決了 10 次運行中的 9 次(非 10 次全部),且閉環本身可承受約 10% 至 15% 的機器人故障率。
  • ALCOA+ 來源追溯已具備並完成對應,但尚未針對您的 SOP 進行 IQ、OQ 或 PQ 驗證。該資格驗證屬於專案服務範疇,而非在此提出的宣稱。
  • 本示範不包含真實儀器驅動程式、真實 DFT 或 CGCNN 代理模型,亦無多儀器排程。這些項目留待後續實施。
  • 現行交付的優化器是採用目標導向獲取函數的 numpy 和 scipy GP。BoTorch 與 Ax 是生產環境的替換方案,而非本示範引擎。
  • 我們不運營託管機器人實驗室,亦不複製現有的自動駕駛實驗室廠商。該架構層旨在建構於您已擁有的硬體之上。
  • 此處沒有真實客戶、具名實驗室、推薦證言或宣稱的 ROI。我們如實陳述在構建此示範過程中所發現的事實。

買方常見問題

我們已經購買了機器人和電子實驗記錄本(ELN)。自主實驗室層究竟能增加什麼價值?

該架構層是建構在您已擁有的硬體之上的大腦、安全閘門與來源追溯記錄。閉環決定下一步運行什麼,並以少得多的實驗次數達到嚴格規範;確定性數位分身閘門在消耗試劑與機器人小時之前拒絕化學上不可能或具危害性的合成;且每個決策都會寫入具防篡改性的審計軌跡中。在此基準測試中,閘門攔截了 38 次註定失敗的合成,節省了 4,419 美元與 90.1 個機器人小時,且抵達機器人的不可行實驗次數為零。

這是一項真實的發現嗎?你們真的合成了那種鈣鈦礦嗎?

並非如此,我們對此明確說明。該目標是一個具備物理意義的合成基準測試,而非真實的 DFT 或實驗室數據,且實驗室是位於 SiLA-2 規範介面背後的模擬器,因此這裡沒有任何實體製造的產物。本示範所證明的是其機制、閉環、確定性安全閘門以及可審計的來源追溯,這些在任何模型品質下均能成立。所發現的成分及其物性數值均為基準測試輸出,而非實驗結果。

數位分身閘門與我們貝氏優化器中既有的約束條件有何不同?

優化器的約束條件存在於試圖達成目標的同一個模型內部,其可靠程度僅取決於該模型的自我報告。我們的閘門是獨立、確定性的程式碼,在代理和代理模型之外運行,並依據五條已發表的化學規則檢查每個提議:Goldschmidt 容差、八面體因子、電荷中性、Sn(II) 濕度氧化以及有機前驅物分解溫度上限。它會返回可行或攔截,並具體指出違反的規則以及避免的金額與機器人小時,因此註定失敗的配方在機器人接觸到之前就會被終止。

你們在實驗室中運行 LLM 代理。我如何確保幻覺不會觸發一場糟糕的實驗?

因為代理絕不做決策。實驗室主任與審查員代理僅負責敘述策略與標記漂移,而優化器與確定性閘門決定運行內容,兩者均不依賴 LLM。在沒有 API 金鑰的情況下,代理會回退到確定性敘述,閉環依然以完全相同的方式運行。這種「代理提供建議,程式碼做出決策」的分離正是關鍵所在:對自動駕駛實驗室的信任,絕不能建立在模型對自身的自我陳述之上。

我們的審計軌跡必須滿足 FDA、EMA 以及我們內部 QA 的要求。這通過 GxP 驗證了嗎?

來源追溯已具備並對應至 ALCOA+ 原則:每個決策都會寫入僅供附加、雜湊鏈結的記錄,且修改任何記錄都會使鏈條明顯斷裂,這正是 FDA 與 EMA 指導原則所要求的可歸屬、同步的來源追溯證明(FDA/EMA, 2026)。它尚未針對您的 SOP 進行 IQ、OQ 或 PQ 驗證,該資格驗證屬於專案服務範疇,而非我們宣稱開箱即用的特性。本示範展示了記錄與防篡改測試,以便您評估其實質內容而非僅僅核對勾選框。

實驗次數減少 20 倍這個數字,是刻意挑選出來的嗎?

這是單次確定性運行(seed 411)的結果:達到符合規範材料需 75 次實驗,而在相同隱藏目標下隨機篩選預期約需 1,491 次,即減少了 19.9 倍。在 10 個 seed 的基準測試中,閉環平均需 67 次實驗並解決了 10 次運行中的 9 次,而隨機篩選在 1,000 次內僅解決了 5 次中的 1 次,網格搜尋則從未達到規範。評估範疇至關重要:這些是針對合成目標的「優化器對比基準線」數據,是與可重現的基準線而非假想敵進行對比,並非開放世界的承諾。

這是否會將我們綁定在你們的模型、你們的雲端或託管實驗室中?

不會。我們不運營託管機器人實驗室,且該架構層設計為透過 SiLA-2 規範介面建置於您的儀器上。優化器與閘門是純 numpy 和 scipy 程式碼,完全在離線狀態下運行且無需 API 金鑰,LLM 提供商可自由抽換(預設為 claude-opus-4-8)。現行交付的優化器是採用目標導向獲取函數的 GP,生產環境中的替換方案則是 BoTorch 與 Ax,運行在您的硬體上,而非我們的硬體。

技術研究

本示範背後的研究——架構、驗證設計與企業藍圖。

將安全閘門與審計軌跡置於自主系統真正贏得信任之處

以更少的實驗次數達到規範,在運行前攔截註定失敗的實驗,並在事後證明每個決策。

如果您的團隊正在建置自動駕駛實驗室,並正在研究如何讓可行性判定值得信賴、讓來源追溯具備可防禦性,我們非常樂意聽聽您的想法。這是全行業面臨的共同挑戰,其解答也將適用於整個產業。

自主實驗室就緒度評估

  • ✓ 標繪工作流程中註定失敗的合成與失敗運行所集中的環節
  • ✓ 將您的可行性與安全規則編碼為確定性閘門
  • ✓ 定義您的 QA 與監管機構能夠接受的 ALCOA+ 來源追溯標準
  • ✓ 參照可重現的基準線界定閉環目標範圍

與我們攜手建構

  • ✓ 具備目標導向獲取函數的 GP(或 BoTorch 與 Ax)優化器
  • ✓ 在代理之外運行的確定性數位分身閘門
  • ✓ 雜湊鏈結、具防篡改特性的 ALCOA+ 審計軌跡
  • ✓ 連接現有儀器的 SiLA-2 規範介面,無廠商綁定
社群媒體

同步發佈於