在構建自主材料發現閉環的過程中,我發現持久價值在於確定性可行性閘道與稽核軌跡,而非代理模型。
Self Driving LabsMaterials ScienceLab Automation

完美的模型無法阻止自動化實驗室執行注定失敗的合成,於是我構建了能做到這點的安全閘道

Ashutosh SinghalAshutosh Singhal2026年7月11日12 min

看過我們產品的研究人員總是不斷問我同一個問題,而在很長一段時間裡,我也總是順著他們期望的方式回答:「你們的樣本效率倍數是多少?」你們的閉環相較於暴力篩選可以減少多少次實驗?這是一個合理的問題。但我後來逐漸意識到,這也是一個錯誤的切入點;直到我坐下來,親眼看著一個模擬機器人興高采烈地執行一份在混合完成前就會在空氣中氧化的配方時,我才真正明白了這一點。

我是 Ashutosh,負責營運 Veriprajna。我們在實驗室現有的硬體基礎上,為自動化實驗室打造大腦、安全閘道以及數據溯源層。這不是託管式的機器人設施,也不是要取代材料研究團隊耗費十年購置的儀器,而是一個輕量且承擔關鍵職責的軟體層——它決定下一步該執行什麼、拒絕注定失敗的實驗,並保存監管機構所要求的各類紀錄。你可以親自開啟並體驗這個展示,網址位於 veriprajna.com/zh-Hant/demos/autonomous-lab-ai,這正是我用來向自己證明『這個軟體層、而非模型本身,才是真正的產品』的地方。

每個人都在問我的那個數字,其實是個錯誤的指標

在最初開發的第一個月裡,我全力追求這個倍數,因為這是該領域最看重的回報。目前關於自動化實驗室的討論,主要聚焦於尋找更好的代理模型,以及追求更高的貝氏最佳化對比隨機篩選比率。我能理解,這是一個簡潔且極具說服力的引用數據。在我們自訂的隱藏目標函數下,閉環系統達到符合規格材料所需的實驗為 75 次實驗,而隨機篩選則需要約 1,491 次,儀表板顯示這相當於減少了 19.9 倍的實驗量。這是在真實、可重現的基準線上取得的真實成果,我也為此感到高興。

但真正讓我停下腳步的是:一個完美的代理模型,即使能毫無瑕疵地預測每一項性質,依然無法阻止電荷不平衡的合成反應被執行;它無法拒絕在接觸潮濕空氣時就會氧化的成分;它無法產生藥品監管機構認可的紀錄;而且它單憑自身無法實現閉環。模型是所有人競相角逐的部分,卻也是持久價值最低的部分,因為 一旦你的模型足夠優秀,你的問題就不再是預測,而是控制、安全與證明。

更好的模型並不會讓自動化實驗室變得值得信賴;它只會讓實驗室更快地執行那些你依然無法證明當初是否該執行的實驗。

柏克萊的 A-Lab 作為目前引用最多的自主合成研究之一,報告了 71% 的成功率,這意味著大約 29% 的嘗試並未產出目標產物(A-Lab,Nature,2023 年)。請用實驗室主管的視角來解讀這個數字:將近三分之一的機器人運作時間與試劑,都耗費在毫無成果的實驗上。更好的採樣函數無法解決這個問題,必須由其他機制來搞定。

一場注定失敗的實驗到底要付出多少代價?

我是後來才構建這個安全閘道,但事實證明這才是我一開始就該做的事。它位於 Agent 之外,由確定性程式碼實現;在接觸任何試劑之前,最佳化器提出的每一個候選配方都必須通過它的檢驗。它執行五項檢查,每一項都是已發表的化學原理,而非我發明的啟發式規則:戈德施密特容差因子超出鈣鈦礦可形成性範圍、八面體因子超出穩定八面體範圍、電荷中性因未補償的 B 位取代而遭破壞、Sn(II) 氧化危害在製程濕度下的風險,以及 退火溫度高於有機前驅物分解溫度。若候選配方觸發其中任何一項,閘道便會返回 BLOCKED,指明違規規則,並回報剛剛省下的費用與機器人工時。

數位孿生閘道詳細資訊面板顯示一個被阻擋的鈣鈦礦候選配方:預測能隙 2.426 eV、相穩定性 0.155,以及分解溫度 214.8 °C 均被標記為偏離目標,因在製程濕度下存在 Sn(II) 氧化危害而被拒絕,節省了 105 美元的試劑與 2.33 小時的機器人工時,並記錄為 ALCOA+ 第 111 號紀錄。
這是一個在合成前被閘道攔截的候選配方。它標記了在 50% 濕度下的 Sn(II) 氧化危害,顯示了無論如何都會偏離目標的三項性質,並記錄下省下的 105 美元與 2.33 機器人工時。每一次阻擋都會寫入專屬的 ALCOA+ 憑證,此處為第 111 號紀錄。

當我第一次點進這些被阻擋的卡片時,我感到所有的爭論都有了定論。看看面板顯示了什麼:一個含有大量 Sn(II) 的配方在製程濕度下被數位孿生拒絕,因為該氧化態的錫在潮濕空氣中會氧化。這並不是模型本該捕捉到的拙劣預測,這是一個物理事實,而模型從來就不是用來強制執行這類事實的正確工具。 單單針對這一個候選配方,閘道就節省了 105 美元和兩個多小時的機器人工時,並為該決策開具了憑證。將這項成效推廣到整個實驗週期,你所談論的就不再只是錦上添花,而是在有明確目標地堵住那 29% 的資源流失。

我想精確說明這到底是什麼,因為對我而言,誠實的表述遠比令人驚艷的包裝更重要。這個閘道背後的「實驗室」是一個具有 SiLA-2 風格介面的模擬器,其目標是一個基於物理機制的 合成基準測試,而非真實的 DFT 運算,亦非真實的實驗台數據。我並非聲稱我們合成出了某種新材料;我是在表明:確定性拒絕注定失敗之化學配方的機制是真實、可檢驗的,且完全獨立於任何模型的好壞。

我曾試著讓模型自我監督,結果它面不改色地對我說了謊

我一開始並未認定閘道必須是確定性的。老實說,我最初的直覺是跟隨當前的潮流:讓語言模型 Agent 來推理可行性。我安排了一個 實驗室總監 Agent 來敘述策略,以及一個 審查 Agent 來標記漂移,直接問它們「這個候選配方是否安全且合理?」看起來既優雅又直接。因此,有一個下午我讓模型的判斷取代了規則檢查。

它胸有成竹地為一個電荷不平衡的配方進行合理化辯解。它給出了一段流暢的文字,解釋為什麼該 B 位取代可能沒有問題,但那段論述完全是錯的,而且它的語氣絲毫沒有透露出任何錯誤跡象。正是從那個下午開始,這項設計原則不再只是一句口號,而是成為了我絕不妥協的鐵律。

Agent 提供建議,程式碼做決定。在自動化實驗室中,這並非一種限制,而是自主系統贏得無人值守運作資格的唯一途徑。

因此,我將可行性與安全的決策權永久移出了 Agent,放入確定性程式碼中,並且讓最佳化器也獨立於語言模型。Agent 負責敘述與評論,如果你在沒有 API 金鑰的情況下執行此展示,它們會退回到確定性的敘述邏輯,而整個系統依然正常運作,因為 閘道與最佳化器完全不依賴於模型。最佳化器本身並不新奇,比起故弄玄虛,我寧可坦誠相告:它是一個高斯程序代理模型,搭配目標導向的 ParEGO 採樣函數,由 numpy 與 scipy 編寫而成。這是成熟且刻意保持樸實的方法;在生產環境中則可替換為 BoTorch 與 Ax。重點從來不是一個多巧妙的最佳化器,而是:你託付安全重任的部分,絕對不能是那個用自信語氣講述成段言論的部分。

我真正關心的計分板

現在我看待這個計分板的心態與剛開始時完全不同。大家的目光通常會落在 19.9 倍這個數字上,而它確實很出色。但當研發主管問我們到底改變了什麼時,我指出的數字就在它旁邊:在合成前阻擋了 38 個不可行的候選配方,避免了 4,419 美元的試劑浪費與 90.1 小時的機器人工時,且注定失敗的實驗執行次數為零。 在完全相同的隱藏目標下,隨機篩選不僅耗時更長,還會把上述的所有成本消耗殆盡。

Crucible 儀表板計分板顯示執行了 75 次實驗,比隨機篩選減少了 19.9 倍,數位孿生避免了 4,419 美元的浪費,節省了 90 個機器人工時,阻擋了 38 個不可行的候選配方,並在第 75 次實驗時達到規格要求。
這是 seed-411 運行的即時計分板。我主打的數字不是 19.9 倍的倍數,而是 4,419 美元與 38 次阻擋:這是閘道所避免的浪費,硬體設備完全不需要接觸注定失敗的配方。
隨著每個團隊的模型逐漸改進,倍數指標的吸引力會逐漸減弱。然而,安全閘道所避免的浪費以及它所留存的紀錄,價值只會越來越高。

請注意這個閉環系統沒有做的事:它並未聲稱自己完美無缺。在多隨機種子基準測試中,閉環系統在預算範圍內解決了 10 次運行中的 9 次,而非 10 次全部,並且該閉環能夠承受 10% 到 15% 的人為注入機器人故障率,因為真實的機器人確實會出錯,若假裝不會發生只會讓這個展示變成謊言。稽核軌跡中的其中一筆紀錄就是一次 失敗並被作為負樣本數據記錄下來的合成,因為一個丟棄失敗案例的自動化實驗室,正在拋棄能精確劃定邊界的關鍵資訊。我是刻意讓它保持可見的。

而且這個倍數是有適用範疇的,我不容許任何人忽視這一點。75 對比 1,491 的結果、19.9 倍、$4,419 美元,所有這一切都是在單一隱藏合成目標下相對於基準線的貝氏最佳化結果。這是證明引擎有效的佐證,但它 並非開放世界保證,若該閉環未能擊敗基準線,我也會如實回報。我所主打的核心價值——避免浪費與數據溯源——在任何模型品質下均成立。倍數是取決於基準測試的部分,因此我必須牢牢附帶這項但書。

監管機構會相信你的機器人嗎?

我原本沒想到數據溯源層會是說服人們的關鍵,但對於任何在監管體系下工作的人來說,這正是最有說服力的一環。FDA 與 EMA 於 2026 年發布的《藥物開發中人工智慧指導原則》(Guiding Principles for AI in drug development)要求具備可歸屬與同步記錄的數據溯源。簡而言之:對於每一項自動化決策,是誰或什麼系統在何時根據什麼依據做出的,以及你是否能證明該紀錄事後未被竄改。更好的代理模型絲毫無法幫你達成這點,只有嚴格的紀錄才能做到。

一個無法證明昨晚做了什麼的自動化實驗室稱不上是自主的;它是不可問責的,受監管的實驗室絕不會讓它運行第二次。

因此,系統所做的每一項決策(無論是合成還是阻擋),都會成為一筆僅供附加的 ALCOA+ 紀錄:包含時間戳記、做出選擇的演算法、預測性質及其不確定性、決策依據、閘道判定以及實測結果。每一筆紀錄都帶有與前一筆連結的 SHA-256 雜湊值。在 seed-411 的實驗任務中,總共產生了 113 筆紀錄,其中包括 75 次合成與 38 次阻擋,你可以將完整內容匯出為 JSON 格式或視覺化報告。

匯出的實驗任務數據溯源報告標題為 ALCOA+ mapped,顯示 113 筆紀錄、具備防竄改特性的 CHAIN INTACT 標記,以及 BLOCK 和 PROPOSE_AND_SYNTHESIZE 決策表格,每筆決策均附有時間戳記、候選配方、閘道判定、違規項目、決策依據與雜湊值。
這是匯出的數據溯源報告。113 項決策,每一列都透過雜湊值與上一列串聯,每次阻擋都標明其化學違規項目及避免的浪費。這才是受監管實驗室歸檔所需的正式文件,而不是一張儀表板截圖。

這是我必須謹慎的地方,也是我看到其他人過度宣傳之處。這只是 ALCOA+ 數據溯源的 對應(mapped),並非針對客戶標準作業程序完成的 IQ/OQ/PQ 確效驗證。 那種確效屬於客製化專案導入範疇,並不是我能在展示中隨意勾選的核取方塊。我能向你展現的是這項特性的真實性與可檢驗性,而非裝飾品。因此我做了一個竄改測試(Tamper test),修改其中一筆紀錄並重新執行鏈結檢查。

竄改測試後的 ALCOA+ 數據溯源面板,顯示 113 筆紀錄並跳出紅色警報:Chain broken at record #2, tamper detected, the filed audit is provably altered(紀錄 #2 處雜湊鏈斷裂,偵測到竄改,歸檔的稽核紀錄已被證實遭修改)。
竄改測試修改了一筆紀錄,雜湊鏈便精確地在該筆紀錄處斷裂。無法偵測自身是否被竄改的數據溯源只是裝飾品;而這個系統能偵測到篡改,並明確指出位置。

當我第一次執行該測試並看著它印出 「紀錄 #2 處雜湊鏈斷裂:偵測到竄改。歸檔的稽核紀錄已被證實遭修改」 時,我明白了自己真正打造出的是什麼。不是一個更快的最佳化器,而是一個讓實驗室在事後能證明其自主決策完全如紀錄所述的軟體層。這是更好的模型買不到的,也是監管機構、稽核員或未來的你自己所要求的。

我認為自動化實驗室競賽所遺漏的關鍵

我一開始並不是要反對樣本效率,我也想在此澄清我並非反對它。用更少的實驗達到目標具有實質價值,而我們的閉環系統也確實做到了這點。但在建構了整個系統並看清自己真正的信任建立在何處之後,我深信:整個領域過度執著於一個隨著技術成熟而持久價值越來越低的數字。當每個團隊都擁有優秀的代理模型時,倍數指標就不再具備差異化優勢。拒絕注定失敗之化學反應的閘道,以及證明執行了什麼的紀錄,只會變得越來越有價值,因為這些才是自主系統在獲准無人值守運作之前不可或缺的部分。

因此,我願意為之押上整個公司的逆向思維之舉,就是將可行性與安全決策置於 Agent 之外的確定性程式碼中,並將每一項自動化決策都視為日後必須能夠被證明的紀錄。這並非因為模型不好,而是因為決定自動化實驗室是否獲准通宵運作的關鍵,從來不是預測問題,而是安全問題與數據溯源問題——而這些需要的是程式碼與雜湊值,而非自信滿滿的段落。

你可以親自開啟此閉環、阻擋注定失敗的合成、破壞稽核鏈,看看你是否認同,網址為 veriprajna.com/zh-Hant/demos/autonomous-lab-ai

如果你想親眼看看而非只讀我的描述,以下是整個系統端到端運行的完整過程。

這是我一直在反覆思考的問題,也是我由衷希望從任何運行真實自動化系統的人那裡得到的答案:如果你的實驗室今晚在無人值守的情況下執行了一千次實驗,明天早上你最想拿到的是哪一樣——一個更好的模型,還是一份你可以證明的紀錄?

相關研究

同步發佈於

自信打造您的 AI。

與一支在打造新世代企業級 AI 方面擁有深厚經驗的團隊攜手合作。讓我們協助您設計、建置並部署值得信賴的 AI 策略。

Veriprajna 深度科技顧問公司 專精於為醫療、金融及法規監管領域打造攸關安全的 AI 系統。我們的架構均依循既定規範進行驗證,並備有完整的合規文件。