爱迪生时代的终结: 闭环 AI 时代的 确定性发现

执行摘要

材料科学与药物发现的历史一直由一种 持久的方法论所定义:爱迪生式方法。其特征是高通量试错、 人类直觉与偶然发现,这种方法为人类服务了一个多世纪, 从电灯泡到第一代合成药物,带来了诸多创新。然而, 随着所需材料复杂性的提升,以及小分子领域的 "低垂果实"被逐步采尽,爱迪生式方法已撞上统计与经济的 高墙。类药分子的搜索空间估计介于 $10^{60}$ 与 $10^{100}$ 1之间, 这一量级使物理筛选在物理上不可能、在经济上不可承受。 我们正见证直觉驱动发现的黄昏,以及 闭环自主发现的黎明——一种将主动学习、 物理信息机器学习(PIML)与机器人自动化整合为统一 确定性引擎的方法论。

Veriprajna 站在这一范式转变的最前沿。我们认为,研发的未来 不在于更快地移液,而在于更聪明地预测。通过从开环直觉转向 闭环算法选择,企业可以精准地穿越化学的浩瀚空间, 将发现的"艺术"转化为严谨的工程学科。本 白皮书阐述采用 闭环发现实验室的架构、数学与经济必要性。它剖析传统高通量 筛选(HTS)的局限、贝叶斯优化相对随机搜索的数学优势、 "负向数据"关键却常被低估的作用,以及构建 自动驾驶实验室的结构要求。我们挑战对"生成式 AI 封装器"的普遍依赖,倡导深度、符合物理规律的 AI 方案,以重新定义创新 的经济学。

给行业的信息很明确:"爱迪生方法"已过时。若您仍在湿实验室中 物理测试新材料而未先进行模拟,您就是在烧钱。 不要猜测再验证。先模拟再选择。

1. 爱迪生式发现之统计不可能性

1.1 试错遗产及其现代局限

归因于托马斯·爱迪生的方法论——测试数千种碳丝以找到 能发光的一种——根植于理论理解远滞后于 实验能力的时代。爱迪生本人及其同时代人如尼古拉·特斯拉, 即使在 19 世纪就已认识到这种方法的极度低效。特斯拉曾著名地 批评爱迪生的方法论,指出"一点理论与计算"本可节省 90% 的劳动。 3 尽管爱迪生最终采用了更结构化的方法,其遗产在 现代研发中仍以"蛮力"方法存续:合成并测试海量化合物 库,以期找到"命中"。

在 21 世纪,这种方法已不再可行。低效源于 理论与实验之间的根本脱节,导致一种被称为 "间断进化"的现象。 4 在此模型中,长期渐进改进 仅被罕见的、往往偶然发现的跃迁所打断。在 能源材料领域,例如,可疑想法因缺乏严格 预验证而存续数年,导致资本浪费于违反热力学 可能性的材料。 4 "快速失败"的口头禅虽流行,却往往在过程中应用过晚。在 传统湿实验室中,失败代价高昂。试剂、合成时间与设备使用消耗 资本。

爱迪生式方法的根本缺陷在于依赖"筛选"而非 "设计"。筛选假设答案存在于预合成库中。然而,当我们 涉足复杂生物制剂、多元合金与纳米结构界面时, 最优解存在于物理可管理库中的概率降至 接近零。爱迪生式方法试图以劳动替代智能,这一策略 随问题空间复杂性增加而呈指数级失效。

1.2 化学空间的天文量级

要理解物理试错的徒劳,必须把握搜索问题的 巨大规模。"化学空间"指由所有 符合给定构建 原则与边界条件的分子与化合物所张成的性质空间。 1 符合 Lipinski 规则(分子量 < 500,原子类型受限)的药理学活性小分子 数量估计为 $10^{60}$。 1 当扩展至更广泛的有机化学空间,包括卤素、 复杂环结构及更大生物制剂时,数量接近 $10^{100}$。 3

为便于理解,可观测宇宙中的原子数约为 $10^{80}$。标准高通量筛选(HTS)活动可能测试 $10^{6}$(一百 万)种化合物。即使制药巨头筛选十亿种化合物($10^9$), 其所探索的也仅为 $0.000000000000000000000000000000000000000000000000001%$ 的可用空间。"小分子宇宙"是天文级的。化学家以 直觉或随机筛选搜索它时,实际上已迷失。 2

此语境下的"爱迪生方法"犹如用茶匙在随机位置 舀取太平洋海水来绘制地图。没有地图——预测模型——搜索 在数学上注定低效。该空间的绝大多数仍是化学中的 "暗物质"——理论上稳定但从未被 合成或测试的化合物。穿越这一浩瀚的唯一途径是从物理 探索转向计算探索,其中测试假设的成本以 毫秒级计算时间衡量,而非数天实验室时间。

1.3 直觉的经济后果

这种低效的经济后果令人震惊。截至 2024 年,开发一种新 药物的成本已升至约 23 亿美元。 5 这一数字包括 单一成功之前数千次失败的成本。制药研发的内含报酬率 (IRR)虽近期显现复苏迹象,却在 2022 年触及 12 年低点 1.2%, 2024 年反弹至 5.9%,主要由 GLP-1 激动剂等离群值驱动。 6 这种 研发生产力下降,常被称为"Eroom 定律"(Moore 定律倒拼),是 靶点难度增加与易发现分子 枯竭的直接结果。

行业面临"专利悬崖"与竞争加剧,必须从 偶然转向可预测。 7 高通量筛选(HTS)本应通过 工业化试错过程解决此问题。然而,HTS 往往产生高假阳性率 并识别理化性质不佳(如溶解度、毒性)的化合物, 因为筛选是随机的而非理性的。 8 此外,维持庞大物理化合物库与自动化筛选 基础设施所需的资本支出,对除最大机构外的所有组织都 难以承受。 9

经济现实是:物理实验是研发最昂贵的阶段。 测试热力学不稳定材料或合成可预测为 有毒的分子——是在烧钱。 11 要 恢复发现的经济学,我们必须倒置漏斗:进行大规模、低成本的 计算机模拟筛选以识别最高概率候选物,将昂贵的 湿实验室留给验证,而非搜索。

1.4 "更好电池"的错觉与材料失败

爱迪生式方法的局限在材料科学中尤为突出, 其中"更好电池"的错觉说明了直觉主导研究的陷阱。 在追求更高能量密度时,研究者常追求理论上可提供高 性能但实践中违反热力学稳定性或动力学约束的材料。 4 由于 这些材料未经严格模拟即被物理测试,"死胡同"仅在 大量投资后才被发现。

历史观察表明,电池材料发展遵循 "间断进化",在新材料类别(如 LiFePO4)发现后出现大幅跃迁, 随后是长期渐进优化。 4 爱迪生式 方法在优化阶段(渐进进化)相对有效,但 在统计上不太可能找到下一次"大跃迁"(间断进化),因为新 材料类别的搜索空间过于广阔,随机采样无法覆盖。预测性 AI 相反可以 在合成一克之前扫描整个已知与假设无机晶体结构数据库以识别 热力学稳定候选物。 11

2. 计算必然性:合成之前 先模拟

2.1 物理信息机器学习(PIML)与黑箱 AI

要摆脱爱迪生陷阱,研发必须转向计算机模拟。然而,并非所有 AI 都生而平等。 市场目前充斥着仅从数据 相关性学习的"黑箱"AI 模型。这些模型不足以用于科学发现,因为新领域的实验数据 往往稀疏、嘈杂且获取昂贵。此外,标准 机器学习模型难以外推——在训练数据范围内表现良好, 但当被要求预测全新类别 材料性质时灾难性失败。

解决方案,也是 Veriprajna 产品的核心,是物理信息机器学习 (PIML)。PIML 将基本物理定律——质量守恒、能量守恒、 热力学与量子力学——直接整合进神经网络架构或 损失函数。 13 我们不再要求 AI 用数百万数据 点从零学习物理(新材料的此类数据并不存在),而是将支配系统的偏微分方程 (PDE)嵌入模型。

此方法提供三项关键优势:

1.​ 数据效率: PIML 模型所需训练数据显著更少,因为"游戏规则" (物理)已知。例如,在材料损伤 表征中,PIML 框架通过强制应力平衡与应变-位移相容性 约束, 在缩减数据集上实现高预测精度。 14

2.​ 可泛化性: 纯数据驱动模型在被要求预测训练分布外(外推)时失败。 受物理定律约束的 PIML 模型, 外推能力远优,确保预测在 化学空间未探索区域仍保持物理合理性。 15

3.​ 物理一致性: 标准生成式 AI 可"幻觉"出违反 价键规则或质量守恒的分子。PIML 确保系统追踪每个电子, 防止反应预测中物质的虚假创生或消失。例如, "FlowER"(电子重分布流匹配)系统显式 追踪电子重分布以确保化学反应预测中的质量与电荷守恒,这是标准大语言模型 无法做到的。 16

2.2 以 AI 超越密度泛函理论(DFT)

密度泛函理论(DFT)数十年来一直是计算化学的 主力,允许从第一性原理计算电子结构。然而, DFT 计算昂贵且随系统规模扩展性差,通常 O(N3)O(N^3)O(N4)O(N^4)。对复杂分子或晶体表面的单次高保真 DFT 计算可 在高性能计算集群上耗时数天。 17 这一计算成本将 DFT 限制为 验证少量候选物,而非扫描整个搜索空间。

现代工作流利用 AI 以极低成本逼近 DFT 精度。通过在现有 DFT 数据上 训练图神经网络(GNN),我们创建"代理模型"或 机器学习势(MLP)。 17 这些模型可在毫秒而非小时内预测势能面 与力,实现 $1000\times$ 或更高的加速。

●​ 案例: 采用主动学习开发的 ANI-1x 势在分子基准上达到 DFT 级 精度,仅使用朴素 随机采样所需数据的 10%。 18

●​ 搜索完备性: 将 DFT 与 ML 结合可计算"搜索 完备性"——估计可发现稳定化合物中被 找到的比例。这使材料发现从开放式搜寻转为有界 优化问题。 19 通过贝叶斯统计模型分析 DFT 能量分布,研究者可判断特定化学空间搜索何时 达到收益递减,从而优化计算资源分配。 19

2.3 图神经网络(GNN)与大语言模型的角色

普遍存在一种误解,认为 GPT-4、Claude 或 Gemini 等大语言模型(LLM)是所有 AI 问题(包括科学)的通用解。尽管 LLM 擅长 处理文本并可辅助文献综述、方案生成或编码,它们 本质上难以处理分子的几何与拓扑本质。 20 分子 不是句子;它们是由节点(原子)与边(键)定义的 3D 图,具有特定 几何约束、手性与电子性质,无法线性映射为文本 串。

LLM 通常将分子视为字符串表示(SMILES),可能导致 "幻觉"——生成看似有效但对应化学上不可能或 不稳定结构的字符串。 21

●​ GNN 优势: 基准显示,显式建模分子图 结构并在相邻原子间传递消息的 GNN,在涉及几何结构的性质预测任务中 持续优于 LLM。 20 GNN 具有 "置换不变性"(原子顺序无关,与文本串不同),可直接 纳入 3D 坐标与键角。

●​ 混合方法: Veriprajna 倡导的理想架构是混合 架构。LLM 充当"推理智能体"或"编排器",解析科学文献以 提取合成配方并设计高层实验方案。同时, 专用 GNN 与 PIML 模型充当"专家引擎",执行 严格的性质预测、逆向设计与稳定性分析。 24 这一"副驾驶" 模型利用 LLM 的语义推理,同时依赖 GNN 的几何精度 承担分子设计的重任。 24

特性 大语言
模型(LLM)
图神经
网络(GNN)
物理信息
ML(PIML)
数据
表示
一维文本串
(SMILES)
3D 图
(节点/边)
微分
方程 / 张量
主要优势 推理、
文献
综合、编码
拓扑/几何
性质
预测
物理
一致性、
外推
弱点 幻觉、缺乏
3D 感知
语义理解
理解
复杂
实现,
求解器
理想角色 编排器 /
智能体
性质预测器 约束 /
模拟引擎

3. 自主架构:闭环 发现

3.1 主动学习的"飞轮"

从爱迪生式到计算式仅是第一步。终极跃迁是 闭环发现实验室,常称为自动驾驶实验室(SDL)。在此范式中, AI 不仅是被动分析师,更是主动实验者。系统闭合 预测与验证之间的环路,创造加速 的良性循环。

工作流作为持续循环运行,常描述为设计-制造-测试-分析 (DMTA) 12

1.​ 假设生成(设计): AI 模型("智能体")利用对搜索空间的当前理解预测具有优化性质的候选 材料。它利用对搜索空间的当前理解优化其性质。 它不只是猜测;它优化采集函数以选择产生 最大价值的实验。

2.​ 自动化合成(制造): 机器人平台接收设计指令。 移液工作站、流动反应器或 3D 打印机在无人工 干预下合成材料。

3.​ 表征(测试): 集成传感器(光谱、XRD、显微)测量 合成材料的性质。

4.​ 反馈(分析): 结果反馈至 AI 模型。关键是,模型 基于新数据点更新其内部信念(代理模型)。

5.​ 迭代: 循环重复,AI 选择下一实验。

这一"飞轮"效应将发现加速数个数量级。伯克利 A-Lab, 例如在 17 天内合成了 41 种新型无机材料——人类研究者需数月或 数年才能完成。 26 AI 智能体基于中间结果自主修正合成 配方,展现真正的自适应行为。

3.2 主动学习:数学引擎

闭环实验室的大脑是主动学习。与传统监督学习 需要海量静态标注数据集不同,主动学习从小数据出发, 迭代向"神谕"(实验)查询最有价值的数据点。 28 核心 机制在于平衡探索(搜索化学空间未知区域) 与利用(精化已知命中物周边区域)。这通常通过 贝叶斯优化实现。

3.2.1 贝叶斯优化(BO)与高斯过程

贝叶斯优化是化学主动学习的标准数学框架。它使用 概率模型(通常为高斯过程 GP)逼近昂贵的"黑 箱"函数(实验)。 30 GP 对搜索空间中每一点预测两件事: 1.​ **均值(

):** 预期性质值(如产率、导电性)。μ\mu2.​ **方差(

):** 该预测的不确定性。σ2\sigma^2这种不确定性量化是 BO 的超能力。它使系统识别模型

一无所知的"暗"区域,以及对其 高性能有信心的"亮"区域。 3.2.2 采集函数:搜索策略

系统使用采集函数基于 GP 预测

决定下一实验。函数选择决定 AI 的策略 : 30 ●​ 上置信界(UCB): 此策略乐观。它选择_可能_

极佳的点(高不确定性 + 高均值)。它实质上在说:"此区域不确定,但 上限很高,我们去看看。" 参数 λ\lambda 调节探索 与利用的平衡。

●​ 期望改进(EI): 计算新点击败 当前已知最优值的概率,并按改进幅度加权。这是 更保守、偏重利用的策略。

●​ 汤普森采样: 从 后验分布采样函数并选择最大值的概率方法。它特别擅长处理 复杂非凸景观与批量实验,因为它自然 促进所选批次的多样性。 32

3.2.3 多保真与成本知情优化

真实实验在成本与保真度上各异。计算机模拟(DFT)廉价但 近似;湿实验室合成昂贵但准确。Veriprajna 倡导 多保真贝叶斯优化(MF-BO)34

●​ MF-BO: 此算法融合低保真源(模拟)与 高保真源(实验)的数据。它学习两者相关性。若 模拟在某区域与现实高度相关,AI 将依赖廉价 模拟探索该区域,仅在 必要时触发昂贵实验。 34

●​ 成本知情 BO(CIBO): 此变体显式将实验的货币或时间 成本纳入采集函数。若两个实验提供相似 信息增益,但一个需要 5,000 美元试剂而另一个仅需 50 美元,CIBO 将选择更便宜路径。研究表明 CIBO 可将优化成本降低高达 90% 同时达成相同结果。 36

3.3 负向数据的价值

在爱迪生模型中,负向结果(失败实验)常被丢弃或埋没于 实验记录本。在主动学习模型中,负向数据是黄金。

●​ 决策边界: 要区分"药物"与"非药物",AI 必须知道 非药物长什么样。负向数据锐化模型决策边界。 29

●​ 减少幻觉: 在训练集中纳入负向数据有助于锚定 生成模型,防止其预测热力学 上不可能的反应。 38

●​ 绘制死胡同: 通过系统探索并记录失败,AI 绘制化学 "死胡同"。对失败景观的拓扑知识是 永久 IP,防止组织再次在那些路径上浪费资源 。 3

4. 中间件与集成:数字神经 系统

4.1 弥合鸿沟:AI 到硬件

部署自主实验室的主要瓶颈是实验室硬件的碎片化。 不同厂商的谱仪、移液工作站与加热板使用不同 专有语言。要构建闭环,我们需要通用翻译层——机器人 中间件。没有它,AI 只是缸中之脑,无法控制双手。

4.2 SiLA 2 标准

**实验室自动化标准化(SiLA 2)**已成为 现代自主实验室的关键使能者。与 OPC UA 等工业标准不同——后者笨重、 以工厂为中心、对科学工作流实现复杂——SiLA 2 专为 生命科学设计,基于现代 Web 协议。 40

●​ 微服务架构: SiLA 2 将每台仪器视为微服务。这使 AI 智能体可发送高层命令(如"移取 5ml")而无需 了解特定机械臂的低层串口命令。 40

●​ 云连接: 它支持安全的服务器发起连接(HTTP/2、gRPC), 使基于云的 AI 大脑(如 Veriprajna 模型)可安全穿越防火墙 控制本地实验室硬件。 41

●​ 互操作性: 它允许将遗留设备与尖端 机器人集成。一台 20 年历史的 HPLC 可封装 SiLA 2 驱动并融入 尖端自主环路。 42

对比:SiLA 2 与 OPC UA

特性 SiLA 2 OPC UA
领域 生命科学 / 研发 工业自动化 /
制造
架构 微服务
(gRPC/HTTP2)
客户端-服务器(二进制/XML)
复杂性 低(特性定义 高(复杂信息
Col1 语言) 模型)
研发适用性 高(灵活、敏捷) 低(僵化、部署繁重)

4.3 数字孪生:执行之前先模拟

在物理机器人动一根肌肉之前,实验应在数字 孪生中模拟。数字孪生是物理实验室的动态虚拟副本,包括仪器、 环境与样品物流。 43

●​ 模拟与验证: AI 可在数字 孪生中运行数千次"虚拟实验"以在执行前验证方案的逻辑、时序与碰撞路径 。这可防止昂贵碰撞与样品损失。 44

●​ 异常检测: 通过将实验室实时传感器数据与数字 孪生预测对比,系统可检测异常(如堵塞移液头导致 压力尖峰,或漂移的温度传感器)以免毁掉整批。孪生充当 运营健康的"地面真值"。 44

●​ 产能规划: 数字孪生允许实验室管理者模拟人员配置与 设备利用率,识别工作流瓶颈(如离心机积压) 并优化排程以实现最大吞吐。 43

4.4 AI 驱动 LIMS

实验室信息管理系统(LIMS)是实验室的脊梁。传统 LIMS 是被动的数据库。新一代是AI 驱动 LIMS45

●​ 主动监控: 不仅存储结果,AI-LIMS 实时分析。 它可立即标记超规结果并触发自动复测或暂停 工作流。 45

●​ 预测性维护: 通过监控 LIMS 中存储的仪器使用模式与性能 数据,AI 可预测设备何时需要维护,_在_其 故障之前,减少停机时间。 46

5. 经济影响:闭环的投资回报

5.1 资本支出与运营支出优化

向 AI 驱动研发的转型从根本上改变发现的成本结构。

●​ 运营支出削减: 传统 HTS 运营支出繁重(耗材、试剂、人员 时间)。主动学习将找到命中物所需物理实验数量 降低数个数量级(通常 10 至 100 倍)。例如,CIBO 策略可 将试剂成本降低 90%。 36

●​ 资本支出效率: 虽构建机器人实验室需前期资本支出,自主设备 利用率接近 100%(24/7 运行),相比之下人工实验室典型 利用率为 30-40%。资产回报率(ROA)因此 显著更高。

5.2 加速上市时间

速度是制药与材料领域的首要货币。药物的"专利寿命"固定; 研发每节省一天,市场就多一天独占期。

●​ 案例研究(Exscientia): AI 设计的小分子约 12 个月进入 I 期试验,而行业平均为 4-5 年。 47

●​ 案例研究(Insilico Medicine): AI 发现的纤维化候选物从 靶点发现到临床前候选物不足 18 个月,成本仅为典型 的一小部分。 47

●​ 材料科学: "A-Lab" 证明自主系统可在数天内绘制相 图并发现稳定结构,而历史上这一过程需 数十年。 26

5.3 "不"模拟的代价

"爱迪生方法"产生隐性"机会成本"。每一美元花在可用模拟 排除的材料测试上,就是未投给可行候选物的一美元。制药研发失败率 徘徊在 90% 左右,AI "快速失败"与"虚拟 失败"的能力是提升 ROI 的最大杠杆。 3 Broad Institute 等开发的预测模型 用于药物毒性(DILI/DICT),使研究者在 合成_之前_过滤有毒化合物,节省数百万下游失败成本。 48

6. 案例研究与真实世界验证

向闭环发现的转变并非理论;它已在 企业中产生成果。

6.1 A-Lab(材料科学)

劳伦斯·伯克利国家实验室的"A-Lab"是完全 自主发现引擎的典范。

●​ 吞吐: 它在 17 天内合成了 41 种新型无机化合物。

●​ 自主性: 系统使用主动学习修正自身合成配方。当 反应未产生目标相时,AI 分析 XRD 图谱,调整 前驱体比例或加热曲线,并重试。

●​ 影响: 新型材料 71% 的成功率远高于人类 直觉驱动合成。 26

6.2 制药领军者

●​ 默克: 积极使用 AI 与自动化为 Keytruda 的"专利悬崖" 做准备,利用这些技术以高质量 候选物充实管线。 7

●​ Exscientia 与 Insilico: 这些"AI 优先"生物技术公司验证了 AI 可比传统大型制药 方法更快更便宜交付临床候选物的模式。它们的成功迫使整个行业转向。 47

7. 战略展望:从封装器到解决方案

7.1 超越"封装器"

市场上许多当前 AI 产品不过是公共 LLM API (OpenAI、Anthropic)的"封装器"。这些对文本生成有用但不足以支撑深度科学。 它们缺乏领域特异性、物理约束及与硬件 集成,无法实现真正的研发转型。封装器无法与 SiLA 2 移液工作站集成; 它无法在化学反应中强制质量守恒;它无法以贝叶斯严谨性 导航 $10^{100}$ 搜索空间。

Veriprajna 将自己定位为深度 AI 解决方案提供商。这意味着:

●​ 定制架构: 我们构建结合 GNN(分子 几何)、PIML(物理一致性)与 LLM(推理)的混合模型。

●​ 数据主权: 我们部署私有微调模型,确保专有 化学数据永不离开客户安全环境。

●​ 全栈集成: 我们不仅提供代码;我们架构整个环路,从 贝叶斯优化算法到控制移液头的 SiLA 2 驱动。

7.2 化学的未来

$10^{100}$ 的搜索空间不再是不可逾越的深渊;它是待 导航的景观。高性能计算、生成式 AI 与机器人 自动化的融合使我们能够移液通往突破——但仅_在_我们模拟 路径之后。

未来属于那些停止猜测、开始计算的人。爱迪生方法 是过去的必然。闭环发现是未来的必然。

不要猜测再验证。先模拟再选择。

参考文献

  1. Chemical space - Wikipedia,2025 年 12 月 11 日访问,b https://en.wikipedia.org/wiki/Chemical_space

  2. Scientists Map All Possible Drug-like Chemical Compounds - Duke Today,b 2025 年 12 月 11 日访问, https://today.duke.edu/2013/04/smallmolecules

  3. Edisonian approach - Wikipedia,2025 年 12 月 11 日访问,b https://en.wikipedia.org/wiki/Edisonian_approach

  4. Addressing Edison's Concern,2025 年 12 月 11 日访问,b https://www.its.caltech.edu/~matsci/bt/EdisonText.html f

  5. Measuring the return from pharmaceutical innovation 2024 | Deloitte US,b 2025 年 12 月 11 日访问, https://www.deloitte.com/us/en/Industries/life-sciences-health-care/articles/measturing-return-from-pharmaceutical-innovation.html

  6. Pharma R&D Returns Grow Again, But Deloitte Warns Progress is 'Fragile' b BioSpace,2025 年 12 月 11 日访问, https://www.biospace.com/business/pharma-r-d-returns-grow-again-but-deloite-warns-progress-is-fragile

  7. Top 10 pharma R&D budgets in 2024 - Fierce Biotech,2025 年 12 月 11 日访问,b https://www.fiercebiotech.com/special-reports/top-10-pharma-rd-budgets-2024

  8. Virtual Screening and High-Throughput Screening in Drug Discovery b ResearchGate,2025 年 12 月 11 日访问, https://www.researchgate.net/publication/392708243_Virtual_Screening_and_High-Throughput_Screening_in_Drug_Discovery

  9. High Throughput Screening Market Forecast, 2025-2032 - Coherent Market Insights,2025 年 12 月 11 日访问, https://www.coherentmarketinsights.com/industry-reports/high-throughput-screening-market

  10. How do you choose between HTS, virtual screening and FBDD? - Domainex,2025 年 12 月 11 日访问, https://www.domainex.co.uk/news/how-do-you-choose-between-hts-virtual-screening-and-fbdd

  11. How the Materials Project connects computational and experimental materials science,2025 年 12 月 11 日访问, https://it.lbl.gov/how-the-materials-project-connects-computational-and-experimental-materials-science/

  12. The Bright Future of Materials Science with AI: Self-Driving Laboratories and Closed-Loop Discovery - ResearchGate,2025 年 12 月 11 日访问, https://www.researchgate.net/publication/397193999_The_Bright_Future_of_Materials_Science_with_AI_Self-Driving_Laboratories_and_Closed-Loop_Discovery

  13. Physics-informed machine learning for combustion: A review - arXiv,2025 年 12 月 11 日访问, https://arxiv.org/html/2509.03347v1

  14. Physics-Informed Machine Learning Models for the Characterization of Materials b with Damage, 18-R6214 | Southwest Research Institute,2025 年 12 月 11 日访问, https://www.swri.org/what-we-do/internal-research-development/2023/chemistry-materials/physics-informed-machine-learning-models-the-characterization-of-materials-damage-18-r6214

  15. Physics-Constrained Machine Learning for Chemical Engineering - arXiv,2025 年 12 月 11 日访问, https://arxiv.org/html/2508.20649v1

  16. A new generative AI approach to predicting chemical reactions | MIT News,2025 年 12 月 11 日访问, https://news.mit.edu/2025/generative-ai-approach-to-predicting-chemical-reactions-0903

  17. Machine Learning Approaches for Accelerated Materials Discovery - AZoM,2025 年 12 月 11 日访问, https://www.azom.com/article.aspx?ArticleID=23290

  18. Less is more: Sampling chemical space with active learning - AIP Publishing,2025 年 12 月 11 日访问, https://pubs.aip.org/aip/jcp/article/148/24/241733/963478/Less-is-more-Sampling-chemical-space-with-active

  19. A Combined DFT/Machine Learning Framework for Materials Discovery: Application to Spinels and Assessment of Search Completeness and Efficiency | Theoretical and Computational Chemistry | ChemRxiv | Cambridge Open Engage,2025 年 12 月 11 日访问, https://chemrxiv.org/engage/chemrxiv/article-details/60c750b0469df44174f448e9

  20. Benchmarking Large Language Models for Molecule Prediction Tasks | alphaXiv,2025 年 12 月 11 日访问, https://www.alphaxiv.org/overview/2403.05075

  21. LLM Copilots for Bench Scientists: A Practical Guide | IntuitionLabs,2025 年 12 月 11 日访问, https://intuitionlabs.ai/articles/llm-copilots-bench-scientists

  22. Evaluating the Performance and Robustness of LLMs in Materials Science Q&A and Property Predictions - arXiv,2025 年 12 月 11 日访问, https://arxiv.org/html/2409.14572v2

  23. Graph Neural Networks in Modern AI-Aided Drug Discovery | Chemical Reviews,2025 年 12 月 11 日访问, https://pubs.acs.org/doi/10.1021/acs.chemrev.5c00461

  24. Large Language Models Meet Graph Neural Networks: A Perspective of Graph Mining - MDPI,2025 年 12 月 11 日访问, https://www.mdpi.com/2227-7390/13/7/1147

  25. Large Language Models vs Graph Neural Networks: It Depends - Symmetry Systems,2025 年 12 月 11 日访问, https://www.symmetry-systems.com/blog/large-language-models-vs-graph-neural-networks-it-depends/

  26. Artificial intelligence-driven autonomous laboratory for accelerating chemical discovery,2025 年 12 月 11 日访问, https://www.oaepublish.com/articles/cs.2025.66

  27. Autonomous Chemical Experiments: Challenges and Perspectives on Establishing a Self-Driving Lab - PMC - PubMed Central,2025 年 12 月 11 日访问, https://pmc.ncbi.nlm.nih.gov/articles/PMC9454899/

  28. Active learning in robotics - Thomas A. Berrueta,2025 年 12 月 11 日访问, https://tberrueta.github.io/assets/pdfs/TaylorMechatronics2021.pdf

  29. The Hidden Value of Failure: Why Negative Data is Critical for AI-Driven Drug Discovery,2025 年 12 月 11 日访问, https://www.digitalchemistry.ai/resources/white-papers/the-hidden-value-of-failure-why-negative-data-is-critical-for-ai-driven-drug-discovery/

  30. Acquisition functions in Bayesian Optimization | Let's talk about science!,2025 年 12 月 11 日访问, https://ekamperi.github.io/machine%20learning/2021/06/11/acquisition-functions.html

  31. Bayesian Optimization for Chemical Synthesis in the Era of Artificial Intelligence: Advances and Applications - MDPI,2025 年 12 月 11 日访问, https://www.mdpi.com/2227-9717/13/9/2687

  32. what is Thompson sampling and upper Confidence bound | by Yashwanth Reddy - Medium,2025 年 12 月 11 日访问, https://medium.com/@reddyyashu20/what-is-thompson-sampling-and-upper-confidence-bound-d8088a703b02

  33. Deconstructing the human algorithms for exploration - PMC - NIH,2025 年 12 月 11 日访问, https://pmc.ncbi.nlm.nih.gov/articles/PMC5801139/

  34. Bayesian Optimization over Multiple Experimental Fidelities ...,2025 年 12 月 11 日访问, https://pubs.acs.org/doi/10.1021/acscentsci.4c01991

  35. Multi-fidelity Sequential Learning for Accelerated Materials Discovery - ChemRxiv,2025 年 12 月 11 日访问, https://chemrxiv.org/engage/api-gateway/chemrxiv/assets/orp/resource/item/60c756c60f50dbb7f939813f/original/multi-fidelity-sequential-learning-for-accelerated-materials-discovery.pdf

  36. Cost-Informed Bayesian Reaction Optimization - ChemRxiv,2025 年 12 月 11 日访问, https://chemrxiv.org/engage/api-gateway/chemrxiv/assets/orp/resource/item/66220e8a21291e5d1d27408d/original/cost-informed-bayesian-reaction-optimization.pdf

  37. Cost-informed Bayesian reaction optimization - PMC - NIH,2025 年 12 月 11 日访问, https://pmc.ncbi.nlm.nih.gov/articles/PMC11465108/

  38. 2025 年 12 月 11 日访问, https://pmc.ncbi.nlm.nih.gov/articles/PMC12164950/#:~:text=Here%2C%20we%20demonstrate%20that%20information,limited%20volume%20of%20successful%20data.

  39. Negative chemical data boosts language models in reaction outcome prediction PMC,2025 年 12 月 11 日访问, https://pmc.ncbi.nlm.nih.gov/articles/PMC12164950/

  40. Standardization in Lab Automation - Wikipedia,2025 年 12 月 11 日访问, https://en.wikipedia.org/wiki/Standardization_in_Lab_Automation

  41. SiLA Rapid Integration - Standards,2025 年 12 月 11 日访问, https://sila-standard.com/standards/

  42. SiLA 2: The Next Generation Lab Automation Standard - ResearchGate,2025 年 12 月 11 日访问, https://www.researchgate.net/publication/360985834_SiLA_2_The_Next_Generation_Lab_Automation_Standard

  43. Optimising digital twin laboratories with conversational AIs: enhancing immersive training and simulation through virtual reality - RSC Publishing,2025 年 12 月 11 日访问, https://pubs.rsc.org/en/content/articlehtml/2025/dd/d4dd00330f

  44. Digital Twins in Pharmaceutical Quality Control | Lab Manager,2025 年 12 月 11 日访问, https://www.labmanager.com/digital-twins-in-pharmaceutical-quality-control-34142

  45. AI-Powered LIMS Systems: Transforming Lab Accuracy & Automation | Medium,2025 年 12 月 11 日访问, https://medium.com/@healthray/ai-powered-lims-systems-transforming-lab-accuracy-automation-6e5aaf0748ba

  46. AI-Driven Pharma LIMS Analytics Transform Lab Data Insights - LabLynx,2025 年 12 月 11 日访问, https://www.lablynx.com/resources/articles/ai-driven-pharma-lims-analytics/

  47. Measuring AI ROI in Drug Discovery: Key Metrics & Outcomes | IntuitionLabs,2025 年 12 月 11 日访问, https://intuitionlabs.ai/articles/measuring-ai-roi-drug-discovery

  48. De-risking drug discovery with predictive AI | Broad Institute,2025 年 12 月 11 日访问, https://www.broadinstitute.org/news/de-risking-drug-discovery-predictive-ai

更喜欢可视化的交互式体验?

通过可导航的章节和数据可视化,以交互式格式探索本文的关键发现、统计数据和架构。

查看交互版
常见问题

常见问题解答

为何高通量筛选不足以支撑现代药物发现?

类药分子搜索空间跨越 10^60 至 10^100 种候选物。即使筛选十亿(10^9)种化合物,也不足空间的 10^-51%。药物开发成本已达每资产 23 亿美元,研发回报率在 2022 年触及 12 年低点 1.2%,HTS 在经济与统计上均不足。采用贝叶斯优化的闭环 AI 可在湿实验室验证前以计算方式导航空间,将所需物理实验减少 10–100 倍。

图神经网络在分子设计上如何优于大语言模型?

分子是具有特定几何约束与手性的 3D 图(节点为原子、边为键)。LLM 将分子视为一维 SMILES 字符串,易产生违反价键或稳定性规则的幻觉结构。GNN 直接建模图结构,具有置换不变性,可纳入 3D 坐标与键角,在涉及几何结构的性质预测基准中持续优于 LLM。

负向数据在 AI 驱动材料发现中扮演什么角色?

在闭环发现中,失败实验是关键 IP。负向数据锐化代理模型决策边界,防止生成模型幻觉热力学上不可能的反应,并永久标注化学空间的死胡同区域。对失败景观的拓扑知识确保组织永不重复浪费资源于已失败路径——这是传统爱迪生式工作流无法实现的。

满怀信心地构建您的 AI。

与一支在打造新一代企业级 AI 方面拥有深厚经验的团队携手合作。让我们助您设计、构建并部署一套值得信赖的 AI 战略。

Veriprajna 深度科技咨询公司 专注于为医疗健康、金融和监管等领域构建安全攸关的 AI 系统。我们的架构均依据成熟的规范进行验证,并配有完善的合规文档。