问题
阳台之所以能够立得住,并不是因为某个AI模型说它“看起来很稳固”。它立得住,是因为荷载路径连续、应力保持在材料极限范围之内,且结构满足支配性的物理方程。这种“听起来对”与“真正正确”之间的区别,正是当今AI在建筑设计与施工领域彻底失灵的地方。
当您将一份结构蓝图输入GPT-4V或Gemini等多模态AI时,模型看到的并非梁、柱或荷载路径,而是像素。它会将您的蓝图切分成一个个小图块——16×16像素的微小方块——并在它们之间寻找统计模式。它或许能学到,一条竖线(柱)通常出现在一条横线(梁)附近。但它并不理解梁是由柱支撑的。移除这根柱子,AI的置信度或许只会略微下降。但它内部并没有任何物理规律,能告诉它这根梁此刻必然会坍塌。
研究人员已经直接验证了这一点。当图像图块被打乱顺序后,这些AI模型往往仍能保持很高的分类准确率。这说明它们依赖的是纹理和局部模式,而非真正的空间结构。在工程领域,一个“大体齐全”但缺失了关键荷载路径的连接节点,并不是90%安全。它是100%不安全。您的AI系统分辨不出这其中的差别。
这对您的业务意味着什么
这些数字应该让每一位风险官都为之警醒。DSR-Bench研究——一项在4,140个问题实例上测试了十个领先AI模型的基准测试——发现,表现最好的模型在复杂结构推理任务上也仅得到满分1.0中的0.498分。对于建筑是屹立还是倒塌这样的决策而言,这样的可靠性无异于抛硬币。
这对贵组织意味着以下几点:
- 监管风险: 无法依据建筑规范核验结构要求的AI模型会带来责任风险。DesignQA基准测试表明,模型能够从文档中提取出诸如“最大允许挠度”这样的规则,但却无法将该规则应用到实际的梁设计中。您的合规签核,其可靠程度取决于背后的系统本身。
- 材料成本超支: 研究发现,AI模型对钛合金或碳纤维等新奇的高性能材料存在强烈偏好——即便项目本需要更具成本效益的方案。原因何在?因为这些材料在高科技训练数据中出现得更频繁。您的AI可能会推荐一些在没有任何工程依据的情况下,就使预算成倍飙升的材料。
- 复杂度上升时性能崩溃: 随着结构问题在空间上变得更复杂、更多维,AI的准确率会大幅下降。当问题以自然语言描述而非以形式化代码描述时,模型的表现也会更差。这意味着,您的工程师用日常语言描述现实世界中非标准情形的程度越高,AI出错的可能性就越大——对于独特问题,其出错概率可能高达50%。
- 隐性推理失效: 这些模型难以完成多跳推理——即通过若干个中间连接来追踪某种关系。在建筑中,这意味着要将荷载从屋顶阳台一路追踪,经过梁、柱,直至基础。如果您的AI无法追踪这一完整链条,它就无法验证结构安全性。
这种风险并非纸上谈兵。它是这些模型所承诺的与其实际所能兑现的之间,一个可衡量、经过基准测试验证的差距。
幕后到底发生了什么
不妨这样理解。假设您聘请了一位建筑质检员,他记住了成千上万张安全建筑的照片。当您向他展示一份新设计时,他会将其与记忆中的照片进行比对。他会说:“这看起来像我以前见过的一栋安全建筑。”但他从未学过工程学。他无法计算一根梁能否承受荷载。他做的是模式匹配,而不是求解物理问题。
多模态AI模型的运作方式正是如此。它们是“下一个词元预测”引擎——这些系统经过训练,会根据训练数据中的模式,猜测最可能出现的下一个词或像素。当您问AI“这个阳台安全吗?”时,它并没有在计算惯性矩。它是在预测,在其训练过的数百万份文档中,通常会有哪些词紧跟在这个问题之后。如果其训练数据中包含成千上万份得出“该结构看起来是稳固的”这一结论的报告,那么在统计上,AI就会倾向于生成类似的安慰性回答——无论实际蓝图显示的是什么。
该白皮书将这称为“随机鹦鹉”问题:AI会不断重复那些听起来言之有理的答案,却并不理解其背后的物理原理。结构工程是确定性的——如果合力不为零,结构就会产生加速度(发生位移、坍塌)。这其中不存在任何概率可言。但AI却把每一个答案都当作一个概率分布来处理。当您的建筑需要的是精确计算时,它给您的只是一个最佳猜测。
这种架构上的错配——将一个概率性引擎应用于一个确定性领域——正是即便最先进的AI模型,在结构推理上也会遭遇49.8%准确率天花板的原因。
什么方法有效(什么方法无效)
我们先来看看哪些方法行不通。
基于像素的AI分析: 将蓝图输入视觉模型,是把您的工程图纸当作待分类的图像来处理,而不是待计算的结构。AI看到的是纹理和图案,而非荷载路径和连接节点。它忽略了结构安全非此即彼的二元本质。
用于规范合规的通用AI: 模型能够流畅地引用建筑规范条文,却无法将量化约束条件应用到具体设计中。它们只是提取规则,而没有真正执行规则。您的合规核查因此沦为一份摘要,而非一次真正的验证。
大模型暴力堆叠: 用更多互联网数据训练更大的模型,并不能解决核心问题。在DSR-Bench测试中,结构推理性能并未随着模型规模的扩大而出现有意义的提升。更多的参数并不会带来对物理规律的理解。
以下是真正有效的方法——也是Veriprajna所采用的方法:
1. 将蓝图转换为图结构,而非像素。 该系统不会将蓝图切分成像素图块,而是将您的建筑信息模型(BIM)转换为一个数学图。图中每个节点代表一个真实的结构构件——梁、柱或楼板——并携带杨氏模量、屈服强度等实际物理属性。每条边代表一个荷载得以传递的真实物理连接。这张图捕捉的是您结构的逻辑,而不仅仅是其外观。
2. 将物理规律直接嵌入AI的训练过程。 该系统使用物理信息神经网络(PINN)——这类AI模型将结构力学的支配性方程直接内置于其学习过程之中。如果模型预测出的挠度形态违反了平衡定律,其训练过程中的物理惩罚项就会迫使它自我纠正。AI无法“凭空想象”出一个违背牛顿定律的答案。图结构物理信息DeepONet——这一方法的进阶版本——已经实现了R² = 0.9999的准确度,运行速度比传统工程求解器快7至8倍。
3. 以算法方式追踪每一条荷载路径。 该系统运用图论,追踪从荷载施加点到基础之间所有可行的荷载传递路径。它会计算一项名为U*指数的指标,用以可视化您结构的“脊柱”——即贯穿建筑的最刚性路线。如果您的阳台设计存在荷载路径不连续的问题,系统不会去猜测。流线会戛然而止,精确标记出失效点所在。
对于您的合规和审计团队而言,这种方法创造了一条 玻璃盒式决策追溯路径。因为图中的每一个节点都与一个物理部件一一对应,您可以准确追溯系统标记问题的原因:“该立柱之所以失效,是因为从梁A和梁B传递来的荷载超出了其承载能力。”这是一个可审计、可解释的结果——而非黑箱式的置信度评分。
该系统在本地部署运行。您的团队无需将敏感蓝图发送至公共API。物理引擎运行在您自己的服务器上,保护您的 知识产权和项目数据 ,同时为您提供确定性的答案。
Veriprajna的方法充当验证层。建筑师和设计师仍可使用生成式AI进行创意构思。但每个构思都必须先经过一次 确定性物理校验 ,才能到达您的工程师手中。如果校验未通过,系统会返回一个硬性约束条件——例如“将梁的截面高度增加200毫米”或“增加背跨连接”——从而强制进行符合物理规律的重新设计。您因此获得了创意速度,同时拥有 由仿真与数字孪生工作流支撑的工程确定性。
关键要点
- 最优秀的AI模型在结构推理基准测试中的得分也仅为49.8%——在建筑安全决策上并不比抛硬币更可靠。
- 多模态AI将蓝图视为像素图案,而非物理结构,因而无法追踪荷载路径或验证规范合规性。
- 物理信息图神经网络通过将工程方程直接嵌入AI,实现了R² = 0.9999的准确度,运行速度比传统求解器快7至8倍。
- 基于图结构的AI将每一次预测都映射到一个实际物理构件,从而形成合规团队能够真正核验的可审计决策追溯路径。
- 这些专用模型基于物理方程而非互联网数据进行训练,因此可以在本地部署运行,无需将敏感蓝图暴露给公共API。
总结
您的AI工具或许对结构安全信誓旦旦,但基准测试显示,它们的判断正确率其实只有五成——跟抛硬币差不多。物理信息图神经网络用可逐步追溯的确定性计算,取代了这种猜测,审计人员和监管机构都能核验每一步。不妨问问您的AI供应商:当系统判定某个结构安全时,它能否展示出从施力点到基础的完整荷载路径,并证明路径上每一个连接节点都满足支配性的物理方程?