Autonomous Lab AI · 自动驾驶材料发现
自动驾驶实验室之所以失败,并非因为其优化器孱弱,而是因为其运行的大部分实验从配方的第一行起就存在化学不可行性,且事后完全无法得到证实。在这一基准测试中,我们的“设计-制备-测试-分析”闭环仅用 75 项实验就达到了严苛的规格指标,而随机筛选则需要约 1,491 项实验;与此同时,数字孪生安全门禁会在消耗试剂或机器人小时之前拦截每一项不可行的合成,并将每项决策签名记录至具备篡改可察觉性的 ALCOA+ 记录中。智能体提供建议,代码做出决定。
$4,419
数字孪生门禁阻止的试剂浪费:拦截了 38 项注定失败的合成并节省了 90.1 机器人小时
种子 411 基准运行,合成目标
减少 20×
在相同的隐藏目标下,达成符合规格材料仅需 75 项实验,而随机筛选约为 1,491 项
种子 411 基准运行,减少 19.9 倍
113
哈希链式 ALCOA+ 记录,每项决策一条,具备篡改可察觉性。篡改一条,整条链即断裂
种子 411 基准运行,75 项合成加上 38 项拦截
该机制在 18 维无铅钙钛矿组分与工艺搜索上的可运行演示。优化器与安全门禁完全基于 numpy 和 scipy 运行,无需 API 密钥;两个顾问智能体是唯一可以调用模型的部分。
瓶颈并非代理模型本身,而是模型本就不该提出的注定失败的实验,以及事后完全无法加以证实这一事实。
伯克利的 A-Lab 报告了 71% 的成功率,这意味着大约 29% 的尝试未能获得目标产物(A-Lab, Nature, 2023)。在一个全自动运行的实验室中,这种失败比例不仅仅是产率损失,更是试剂的消耗、机器人工时的占用以及仪器时间的浪费——而这些合成在机器人尚未启动之前就已存在电荷不平衡、几何不稳定或化学危害。
搜索空间使情况进一步恶化。如此规模的钙钛矿组分与工艺空间,在天文数字级别上远超任何筛选预算,因此单纯筛选并非一种策略,而是一场彩票。在此基准测试上进行的一项独立可行性探测显示,随机命中率仅为 0.01%(80,000 个候选物中仅 8 个),这意味着仅凭筛选预计需要约 10,000 项实验才能首次达到目标。更好的采集函数有助于解决这一半的问题。
但这对于另一半问题毫无帮助。一个物性模型无论多么优秀,都无法判定某项合成尝试是否安全,也无法生成监管机构或企业内部 QA 所能接受的记录。FDA 和 EMA 关于药物开发中 AI 的指导原则明确指出,溯源记录必须具备可归属性和同步性(FDA/EMA, 2026)。可行性与可审计性恰恰是模型所无法触及的环节,而这正是我们着手填补的两大空白。
一次完整的“设计-制备-测试-分析”循环,逐阶段展示。可行性决策存在于纯代码中,绝不存在于模型中。
该闭环在 18 维无铅钙钛矿空间中进行搜索:包括 Cs、MA 和 FA 阳离子比例,Sn、Ge 和 Bi 的 B 位取代,I、Br 和 Cl 卤化物比例,以及工艺变量。一个采用目标导向、ParEGO 风格采集函数的高斯过程代理模型在包含 60 条记录的历史基准数据集上冷启动,并提出下一个候选方案。每个提议在进行任何实际合成之前都必须通过门禁,因此把守在配方与机器人之间的,是安全门禁而非优化器的置信度。
数字孪生门禁是独立于任何语言模型之外的部分。每个提出的候选方案在消耗试剂之前都会根据五条真实的、已发表的化学规则进行检查,门禁会返回可行或拦截,并明确指出所违反的具体规则以及避免的试剂预算和机器人工时。它由纯粹的 numpy 和 scipy 代码实现,位于智能体和代理模型之外,承担着核心决策重任。注定失败的配方在此被阻止,而不是在机器人运行之后才被发现。
在核心之上,两个智能体负责读取并进行沟通。实验室主管(Lab Director)负责叙述实验方案策略,评审员(Critic)作为闭环中的验证者独立标记漂移或停滞。它们可通过 LLM_PROVIDER 设置更换提供商,默认采用 claude-opus-4-8;在没有密钥的情况下,它们会回退到确定性旁白,以确保演示始终可以运行。优化器和门禁绝不依赖于大语言模型。智能体提供建议,代码做出决定。
| 检查项 | 捕获的问题 | 依据 |
|---|---|---|
| Goldschmidt 容差因子 | 组分超出钙钛矿可形成性窗口;门禁采用 0.78 至 1.05 的筛选区间。 | 钙钛矿晶体化学 |
| 八面体因子 | 半径比超出 0.41 至 0.90 的稳定八面体窗口。 | 钙钛矿晶体化学 |
| 电荷中性 | 未补偿的 B 位电荷,例如来自 Bi(III) 取代。 | 离子电荷平衡 |
| Sn(II) 氧化风险 | Sn(II) 在潮湿空气中氧化,在工艺湿度下既不安全且注定失败。 | 卤化锡稳定性 |
| 分解上限温度 | 退火温度高于 MA 和 FA 阳离子降解的温度(约 190 摄氏度)。 | 前驱体热稳定性 |
持久的价值在于安全门禁与审计追踪,而非更出色的代理模型。即使是完美的物性模型,依然无法阻止电荷不平衡或存在氧化风险的合成运行,也无法生成监管机构认可的记录。优化器只是该控制层内部一个可替换的组件,正因如此,随着模型的演进,该方法不会过时。出厂配置中,优化器是带有目标导向采集函数的 numpy 与 scipy GP;生产环境中的替换方案为 BoTorch 和 Ax。
以下所有数据均来自单次确定性基准实验(种子 411),在运行时实时计算而非硬编码。目标是基于物理原理的合成基准,而非真实的 DFT 或实验室数据,且实验室是基于符合 SiLA-2 规范接口的模拟器。此处未进行任何物理合成。
该闭环在第 75 项实验时达到目标规格,相比在相同隐藏目标下随机筛选预期的约 1,491 项实验减少了 19.9 倍。与此同时,计分板记录了比速度更重要的数据:避免了 4,419 美元的试剂浪费,节省了 90 机器人小时,并在合成前拦截了 38 个不可行的候选方案,规格状态显示为“达到规格”。效率提升显而易见,但避免浪费与可溯源性无论在何种模型质量下都始终有效。
以下是一次拦截的详细信息。提出的候选方案在工艺湿度下存在 Sn(II) 氧化风险,且其预测带隙、相稳定性和分解温度均超出目标范围。门禁在合成前拒绝了该方案,节省了 105 美元的试剂与 2.33 机器人小时,并将此次拒绝写入哈希链式 ALCOA+ 记录。优化器无需耗费机器人小时去探索确定性化学早已获知的结果。
单次拦截并非偶发巧合,而是普遍规律。在整个运行过程中,门禁在合成前拦截了 38 个不可行的候选方案,每一个都指明了其所违反的物理化学规律——Sn(II) 氧化风险、未补偿 B 位导致的电荷中性破坏,或超出可形成性窗口的 Goldschmidt 容差——同时列出了节省的美元和机器人工时。拦截累计避免了 4,419 美元和 90 机器人小时的浪费,且不可行合成的执行次数为零。
发现图谱在带隙与相稳定性空间中绘制了闭环在模拟中合成的每种材料,并按分解温度着色;虚线框标记了目标窗口(带隙 1.2 至 1.5 eV 且具备高稳定性)。早期的点较为分散;随着代理模型的学习,后期的点向目标框聚集,最佳材料成功落入其中。这正是优化器发挥作用的体现,但其前提是只针对门禁允许通过的候选方案进行操作。
发现的最佳材料满足各项规格指标:组分为 (Cs0.46MA0.22FA0.31)(Sn0.69Ge0.31)(I0.73Br0.21Cl0.06)3,带隙为 1.43 eV,相稳定性评分为 0.743,分解温度为 250.5 摄氏度。需要明确的是,这是基于物理原理的合成目标的输出,并非实际制备的材料。这是闭环收敛的证明,而非真实发现的主张。
每项决策(包括 75 项合成与 38 项拦截)均被写入仅追加记录中,共计 113 条,并导出为符合 ALCOA+ 原则的实验溯源报告。每一行都包含时间戳、操作、候选方案、门禁判定、违规项、理论依据,以及将其与前一条记录关联的 SHA-256 哈希值。报告显示“链条完整”且“具备篡改可察觉性”,这正是受监管实验室必须提交的具备可归属性与同步性的溯源依据。
只有当能够亲眼见证防篡改机制触发时,这种特性才有意义。在导出的审计记录中篡改单个载荷,验证器就会报告该记录处的链条断裂、检测到篡改,并声明已归档的审计记录被明确篡改。关键不在于记录不可更改,而在于任何更改都无法被隐瞒,这正是让审计追踪具备合规可抗辩性的原因。
它是构建在您现有硬件之上的大脑、安全门禁与溯源层,而非托管式实验室,也并非用于替代您的仪器或 DFT。
| 关注点 | 仅使用物性模型或优化器 | 本方案控制层 |
|---|---|---|
| 化学上不可行的提议 | 付诸合成,随后评定为失败 | 在消耗任何试剂之前被确定性门禁拦截 |
| 候选方案被拒绝的原因 | 即便有所记录,也仅淹没在损失函数中 | 对照五条已发表的化学规则明确指明,并列出节省的金额与工时 |
| 自动化决策的溯源依据 | 临时日志,可随意编辑 | 仅追加、哈希链式 ALCOA+ 记录,具备篡改可察觉性 |
| 安全决策的执行主体 | 大语言模型或优化器自身的置信度 | 位于智能体之外的纯确定性代码 |
| 样本效率 | 随采集函数而异 | 在此基准测试的隐藏目标上,达成规格需 75 项实验对比约 1,491 项 |
| 硬件与模型绑定 | 通常为托管式技术栈 | 通过符合 SiLA-2 规范的接口在您的仪器上运行,LLM 提供商可自由更换 |
该控制层是构建在您已有硬件之上的大脑、安全门禁和溯源记录系统。闭环系统决定下一步运行的实验,以大幅减少的实验次数达到严苛规格;确定性数字孪生门禁在消耗试剂和机器人工时之前,拒绝化学上不可行或存在危险的合成;每一项决策都会记录在具备篡改可察觉性的审计追踪中。在此基准测试中,门禁拦截了 38 项注定失败的合成,节省了 4,419 美元和 90.1 机器人小时,且未让任何不可行的实验流向机器人。
并非如此,我们对此明确说明。目标函数是基于物理原理的合成基准,而非真实的 DFT 或实验室数据,实验室是符合 SiLA-2 规范接口背后的模拟器,因此此处并未进行任何物理制备。该演示所证明的是机制本身——闭环流程、确定性安全门禁以及可审计的溯源体系,这些在任何模型质量下均保持有效。所发现的组分及其物性数值均为基准测试的输出结果,而非实际实验结论。
优化器的约束条件存在于试图达成目标的同一个模型内部,其可信度仅取决于该模型自身的自我报告。而我们的门禁是独立运行于智能体和代理模型之外的确定性代码,它对照五条已发表的化学规则对每个提议进行检查:Goldschmidt 容差、八面体因子、电荷中性、Sn(II) 湿度氧化以及有机前驱体分解上限温度。门禁返回“可行”或“拦截”,并附带所违反的具体规则以及避免的金额和机器人工时,从而在机器人接收到配方之前就将注定失败的方案终止。
因为智能体绝不拥有最终决策权。实验室主管(Lab Director)和评审员(Critic)智能体仅负责叙述策略并标记漂移,而优化器与确定性门禁决定运行什么,两者均不依赖于 LLM。在没有 API 密钥的情况下,智能体会回退至确定性旁白,且闭环仍能完全一致地运行。这种“智能体提供建议,代码做出决定”的分离机制正是关键所在:对自动驾驶实验室的信任,绝不能建立在模型自身的自我陈述之上。
溯源体系已完备并与 ALCOA+ 原则相映射:每项决策都会写入仅追加、哈希链式的记录中,编辑任何记录都会导致链条明显断裂,这正是 FDA 和 EMA 指导原则所要求的具备可归属性与同步性的溯源依据(FDA/EMA, 2026)。本系统尚未针对您的 SOP 进行 IQ、OQ 或 PQ 验证,该资质认定属于定制合作服务,而非我们现成宣称的内容。演示展示了记录与防篡改测试,以便您评估其实质价值而非仅仅核对复选框。
这是单次确定性运行(种子 411)的结果:达成符合规格材料需 75 项实验,而相同隐藏目标下随机筛选预期需要约 1,491 项,减少了 19.9 倍。在 10 个种子的基准测试中,闭环平均需要 67 项实验,且在 10 次运行中成功解决了 9 次;而随机筛选在 1,000 次内仅 5 次中成功 1 次,网格扫描则从未达到规格。适用范围至关重要:这些是在合成目标上优化器与基准线的对比数据,是基于可复现基准线而非虚设靶子进行的测试,并非开放世界场景的承诺。
不会。我们不运营托管式机器人实验室,该层旨在通过符合 SiLA-2 规范的接口部署在您的仪器上。优化器和门禁基于纯粹的 numpy 和 scipy 构建,无需 API 密钥即可完全离线运行,且 LLM 提供商可自由更换(默认采用 claude-opus-4-8)。出厂配置中优化器为采用目标导向采集函数的 GP,生产环境中的替换方案为 BoTorch 和 Ax,均运行在您的硬件而非我们的硬件上。
用更少的实验达到规格指标,在运行前拦截注定失败的方案,并在事后证实每项决策。
如果您的团队正在搭建自动驾驶实验室,并探索如何让可行性决策可信、让溯源记录具备合规可抗辩性,我们十分期待倾听您的想法。这是整个行业共同面对的挑战,其解决方案也必将服务于整个行业。