在构建自主材料发现闭环的过程中,我发现持久价值在于确定性可行性关卡与审计追踪,而非代理模型。
Self Driving LabsMaterials ScienceLab Automation

完美的模型无法阻止自动驾驶实验室执行注定失败的合成实验。我构建了能做到这一点的安全关卡。

Ashutosh SinghalAshutosh Singhal2026年7月11日12 min

每当研究人员看到我们构建的系统时,总会问我同一个问题,在很长一段时间里,我也一直按照他们期望的方式来回答:“你们的样本效率倍数是多少?”相比暴力筛选,你们的闭环系统能减少多少次实验?这是一个合情合理的问题。但我也逐渐意识到,这并不是最应该首先提出的问题;直到我坐下来,看着模拟机器人兴高采烈地执行一份在混合完成之前就会在空气中氧化的配方时,我才真正理解了其中的原因。

我是 Ashutosh,也是 Veriprajna 的负责人。我们在实验室已有的硬件之上,为自动驾驶实验室构建大脑、安全关卡以及可追溯性层。不是托管式机器人设施,也不是要替代材料团队花十年采购的仪器,而是薄而承重的软件层——由它决定下一步运行什么、拒绝注定失败的实验,并保留监管机构所要求的记录。你可以在 veriprajna.com/zh-Hans/demos/autonomous-lab-ai 亲自打开并体验这个演示,正是在这里,我向自己证明了软件层(而非模型)才是真正的产品。

每个人都在向我询问的那个数字其实并不是真正关键的指标

在构建初期,我花了一个月时间去追求这个倍数,因为这正是该领域所看重的。目前关于自动驾驶实验室的讨论,实质上是一场追求更优代理模型和更高贝叶斯优化对筛选比率的竞赛。我理解这一点。这是一个清晰且易于引用的数字。在我们自己的隐藏目标函数上,闭环系统仅用 75 次实验就达到了符合规格的材料,而随机筛选大约需要 1,491 次,仪表板报告这相当于减少了 19.9 倍。这是在真实且可复现的基准上取得的真实结果,我很高兴看到它的存在。

但让我停下脚步的是:一个即使能够完美预测所有属性的理想代理模型,仍然无法阻止电荷不平衡的合成实验被执行。它无法拒绝在接触潮湿空气时就会氧化的配方。它无法生成药品监管机构认可的记录。而且它本身无法完成闭环。模型是所有人都在竞争的部分,却也是持久价值最低的部分,因为一旦你的模型足够优秀,你的问题就不再是预测,而是控制、安全与证明。

更好的模型并不能让自动驾驶实验室值得信赖,它只会让你更快地执行那些你仍然无法证明当初是否应该运行的实验。

伯克利的 A-Lab 作为业内被引用最多的自主合成成果之一,报告了 71% 的成功率,这意味着大约 29% 的尝试未能合成出目标产物(A-Lab,Nature,2023 年)。请像实验室主任那样去解读这个数字:将近三分之一的机器人时间和试剂都耗费在毫无产出的实验上。更优秀的采集函数解决不了这个问题,必须依靠其他机制。

一次注定失败的实验究竟要付出多大代价?

我是后来才构建安全关卡的,事实证明它本应是我首先构建的东西。它位于智能体之外,运行在确定性代码中,在触碰任何一滴试剂之前,优化器提出的每一个候选配方都必须先通过它。它执行五项检查,每一项都是已发表的化学原理,而非我凭空捏造的启发式规则:戈德施密特容差因子(Goldschmidt tolerance factor)超出钙钛矿可形成性窗口,八面体因子(octahedral factor)超出稳定八面体窗口,电荷中性因未补偿的 B 位取代而被打破,在工艺湿度下的 Sn(II) 氧化风险,以及退火温度高于有机前驱体的分解温度。如果候选配方触发了其中任何一项,关卡就会返回 BLOCKED(已拦截),指出违规规则,并报告刚刚节省的资金与机器人工时。

数字孪生关卡详情面板展示了一个被拦截的钙钛矿候选配方:预测带隙 2.426 eV、相稳定性 0.155 以及分解温度 214.8 ℃ 均被标记为偏离目标,因工艺湿度下的 Sn(II) 氧化风险而被拒绝,节省了 105 美元的试剂与 2.33 个机器人工时,并记录为 ALCOA+ 记录 #111。
一个在合成前被关卡拦截的候选配方。它标记了 50% 湿度下的 Sn(II) 氧化风险,展示了本就无法达标的三项属性,并记录了节省的 105 美元与 2.33 个机器人工时。每一次拦截都会生成专属的 ALCOA+ 凭证,此处为记录 #111。

当我第一次点开这些被拦截的卡片之一时,心中的疑虑便烟消云散了。看看面板展示了什么:一个含有大量 Sn(II) 的配方在工艺湿度下被数字孪生拒绝,因为处于该氧化态的锡在潮湿空气中极易氧化。这并不是模型本应捕捉到的糟糕预测,而是一个物理事实,模型从一开始就不是强制执行这一事实的正确工具。关卡仅在这一项候选配方上就节省了 105 美元和两个多小时的机器人工时,并为这一决策写入了凭证。将这一点放大到整个研发活动中,你谈论的就不再是一个可有可无的锦上添花之物,而是有针对性地堵住了那 29% 的漏洞。

我想对这项工作的本质做出严谨说明,因为对我而言,坦诚的表述远比令人印象深刻的修饰更重要。该关卡背后的“实验室”是一个具有 SiLA-2 形式接口的模拟器,其目标是一个受物理规律启发的合成基准,而非真实的 DFT 计算或真实的实验台数据。我并不是声称我们合成了一种新材料。我想要表明的是,这种机制——对注定失败的化学配方进行确定性拒绝——是真实的、可检查的,且完全独立于任何模型的表现优劣。

我曾尝试让模型自我监管,它却面不改色地对我撒了谎。

我最初并没有坚信关卡必须是确定性的。坦白讲,我的第一直觉是顺应潮流:让语言模型智能体去推理可行性。我设置了一个实验室主任智能体(Lab Director agent)来陈述策略,以及一个评审智能体(Critic agent)来标记偏差,直接向它们提问“这个候选配方是否安全合理?”在当时看来十分优雅。于是一个下午,我让模型的判断代替了实际检查。

它为一种电荷不平衡的配方进行了合理解释,而且言之凿凿。它生成了一段流畅的文字,阐述为什么该 B 位取代可能没有问题,但这段论述是错误的,而且从其语气中完全看不出任何破绽。正是在那个下午,这条设计原则不再是一句口号,而是变成了我绝不妥协的铁律。

智能体提供建议,代码做出决定。在自动驾驶实验室中,这绝非限制,而是自动化系统赢得无人值守运行资格的唯一途径。

因此,我将可行性与安全性决策永久性地移出了智能体,转入确定性代码中,并让优化器也独立于语言模型。智能体负责叙述与评审,如果你在没有 API 密钥的情况下运行演示,它们会回退到确定性叙述,一切依然正常运转,因为关卡和优化器根本不依赖语言模型。优化器本身并不奇特,我宁愿如实相告也不愿夸大其词:它是一个高斯过程代理模型,配合基于目标导向的 ParEGO 采集函数,用 numpy 和 scipy 编写。这是一种成熟且刻意保持朴实的方法。生产环境中可替换为 BoTorch 和 Ax。核心从来不是多么巧妙的优化器,而是托付安全责任的部分绝不能是那个用自信段落说话的模型。

我真正关心的计分板

如今我看待这个计分板的角度已与最初截然不同。所有人的目光都会被 19.9 倍这个数字吸引,它确实很出色。但当研发负责人询问我们究竟改变了什么时,我指向的是它旁边的数据:在合成前拦截了 38 个不可行的候选配方,避免了 4,419 美元的试剂浪费和 90.1 个机器人工时,且执行的注定失败实验数为零。在完全相同的隐藏目标函数下,随机筛选不仅耗时更长,而且会把这些资源白白消耗殆尽。

Crucible 仪表板计分板显示运行了 75 次实验,比随机筛选少 19.9 倍,数字孪生避免了 4,419 美元的浪费,节省了 90 个机器人工时,拦截了 38 个不可行候选配方,并在第 75 次实验达到规格要求。
来自 seed-411 运行的实时计分板。我重点展示的数据不是 19.9 倍的倍数,而是 4,419 美元和 38 次拦截:关卡所避免的浪费,让硬件根本无需触碰注定失败的配方。
随着各方模型的不断改进,倍数优势会变得不再那么引人注目;而关卡所避免的浪费以及它保留的记录,只会变得愈发宝贵。

请注意闭环系统没有做出什么宣称:它并未自称完美无缺。在多随机种子基准测试中,闭环系统在预算内成功完成了10 次运行中的 9 次,而非 10 次全部成功,而且该闭环能容忍 10% 到 15% 的注入式机器人故障率,因为真实的机器人确实会发生故障,假装不存在故障只会让演示变成谎言。审计追踪中的一条记录正是一次失败并被捕获为负样本数据的合成实验,因为如果自动驾驶实验室丢弃失败数据,就是在抛弃能够精准明确边界的关键信息。我特意保留了这部分的可见性。

而且这个倍数有一个适用范围,我绝不允许任何人脱离上下文来谈论它。75 次对比 1,491 次的结果、19.9 倍以及 4,419 美元,所有这些都是在一个隐藏合成目标上对比基线的贝叶斯优化结果。它是证明该引擎有效的佐证,但并非开放世界下的绝对保证;如果闭环系统未能击败基线,我也会如实报告。我所主打的核心价值——避免浪费与可追溯性——在任何模型质量下都成立。倍数是依赖于具体基准的部分,因此我必须始终附带这些限制说明。

监管机构会相信你的机器人吗?

我原本没指望可追溯性层会成为说服人们的关键,但它却给所有在监管要求下工作的人留下了最深刻的印象。FDA 和 EMA 在 2026 年发布的《药物研发中人工智能指导原则》要求具备可归属性和同步性的追溯能力。通俗地说:对于每一项自动化决策,是谁或什么做出的、依据是什么、在什么时刻做出的,以及你是否能证明该记录在此后未被篡改。更出色的代理模型无法让你在这方面前进一步,而合规记录可以。

一个无法证明自己昨晚做了什么的自动驾驶实验室,根本算不上自主;它是无法问责的,任何受监管的实验室都不会让它运行第二次。

因此,系统做出的每一项决策(无论是合成还是拦截)都会生成一条仅限追加的 ALCOA+ 记录:时间戳、做出选择的算法、预测属性及其不确定性、决策理由、关卡裁决以及实际测量结果。每条记录都带有 SHA-256 哈希值,并与前一条记录形成哈希链。在 seed-411 活动中,总共生成了 113 条记录,包括 75 次合成与 38 次拦截,你可以将全部内容导出为 JSON 以及渲染好的报告。

导出的研发活动溯源报告(标题为 ALCOA+ mapped),显示 113 条记录、CHAIN INTACT 防篡改状态,以及包含 BLOCK 和 PROPOSE_AND_SYNTHESIZE 决策的表格,每项均包含时间戳、候选配方、关卡裁决、违规项、决策理由及哈希值。
导出的溯源报告。113 项决策,每一行都与上一行形成哈希链关联,每次拦截都明确指出其化学违规项及所避免的浪费。这才是受监管实验室会归档的交付物,而不是一张仪表板截图。

在这里我必须保持谨慎,因为我见过其他人过度夸大。这是 ALCOA+ 溯源的对照映射(mapped),尚未针对客户的标准操作规程完成 IQ/OQ/PQ 验证。那种验证属于实际合作交付内容,绝非我在演示中勾选一下就能完成的事。我能向你展示的是,这种特性是真实且可检查的,绝非装点门面的摆设。因此我构建了一个防篡改测试(Tamper test),通过编辑单条记录并重新运行链校验。

防篡改测试后的 ALCOA+ 溯源面板,显示 113 条记录以及一条红色警报:Chain broken at record #2, tamper detected, the filed audit is provably altered(记录 #2 处哈希链断裂,检测到篡改,归档审计已被证实发生更改)。
防篡改测试修改了一条记录,哈希链恰好在该记录处断裂。无法检测自身是否被篡改的可追溯性只是花架子。而该系统能够检测到篡改,并明确指出发生位置。

当我第一次运行该测试并看到它打印出“Chain broken at record #2: tamper detected. The filed audit is provably altered”(记录 #2 处哈希链断裂:检测到篡改。归档审计已被证实发生更改)时,我终于明白自己真正构建了什么。不是一个更快的优化器,而是一个能让实验室在事后证明其自主决策与记录完全一致的软件层。这是单凭更好的模型永远买不到的,也是监管机构、审计人员或未来的你自己必然会要求拿出来的东西。

我认为当前的自动驾驶实验室竞赛所遗漏的东西

我初衷并非反对样本效率,我也想明确澄清我绝无此意。以更少的实验达成目标确实具有实际价值,我们的闭环系统也做到了这一点。在构建了整个系统并体会到我真正的信任来源之后,我所坚信的是:该领域执着于一个随着技术成熟而持久价值日益递减的指标。当每个团队都拥有优秀的代理模型时,倍数优势将不再是差异化壁垒。而拒绝注定失败化学实验的安全关卡,以及能够证明实际运行记录的可追溯性,只会变得越来越有价值,因为在任何人允许系统无人值守运行之前,这才是自动化真正不可或缺的部分。

因此,这一反共识的举措——也是我愿意为之赌上公司未来的决定——就是将可行性与安全性决策置于智能体之外的确定性代码中,并将每一项自动化决策都视为日后必须能够加以证实的事项。这并非因为模型不好,而是因为决定自动驾驶实验室能否获准通宵运行的问题从来不是预测问题,而是安全问题与可追溯性问题,而解决这些问题需要的是代码与哈希值,而不是充满自信的文字段落。

你可以亲自打开闭环、拦截一次注定失败的合成、破坏审计链,看看你是否认同这一观点,访问网址:veriprajna.com/zh-Hans/demos/autonomous-lab-ai

如果你更想亲眼见证而非听我描述,以下是整个系统的端到端运行过程。

我一直在反复思考一个问题,也是我真诚希望任何从事实际自动化工作的人给予回答的问题:如果你的实验室今晚在无人值守的情况下运行了一千次实验,明天一早你最希望得到的是哪一个——一个更优秀的模型,还是一份可被证实的记录?

相关研究

同步发布于

满怀信心地构建您的 AI。

与一支在打造新一代企业级 AI 方面拥有深厚经验的团队携手合作。让我们助您设计、构建并部署一套值得信赖的 AI 战略。

Veriprajna 深度科技咨询公司 专注于为医疗健康、金融和监管等领域构建安全攸关的 AI 系统。我们的架构均依据成熟的规范进行验证,并配有完善的合规文档。