問題所在
陽台不會因為AI模型說它看起來「穩固」就屹立不搖。它之所以屹立不搖,是因為傳力路徑連續不斷、應力維持在材料極限之內,且結構滿足物理學的支配方程式。「聽起來正確」與「真正正確」之間的這種區別,正是當今AI在建築設計與施工領域中崩潰失靈之處。
當你將結構藍圖輸入像GPT-4V或Gemini這樣的多模態AI時,該模型看到的不是梁、柱或傳力路徑,而是像素。它會將你的藍圖切割成小區塊——16×16像素的微小方塊——並在其中尋找統計模式。它或許能學會一條垂直線(柱)通常出現在一條水平線(梁)附近。但它並不理解梁是由柱支撐的。移除該柱,AI的信心分數或許只會略微下降。但它內部沒有物理法則能告訴它,此時梁必然會倒塌。
研究人員已直接測試過這一點。當圖像區塊被打亂順序時,這些AI模型往往仍能維持很高的分類準確率。它們依賴的是紋理與局部模式,而非真正的空間結構。在工程領域中,一個「大致完整」但缺少關鍵傳力路徑的連接細節,並非90%安全。它是100%不安全。你的AI系統無法分辨這其中的差異。
這對你的業務為何至關重要
這些數字應該讓每一位風險主管都為之駐足。DSR-Bench研究——一項在4,140個問題實例中測試十個頂尖AI模型的基準測試——發現表現最佳的模型在複雜結構推理任務上僅得0.498(滿分1.0)。對於建築物是屹立不搖還是倒塌的決策而言,這相當於擲硬幣般的可靠度。
這對你的組織意味著什麼:
- 法規風險: 無法依建築法規驗證結構要求的AI模型,會產生法律責任。DesignQA基準測試顯示,模型能從文件中擷取像「最大容許撓度」這樣的規則,但卻無法將該規則套用到實際的梁設計上。你的合規簽核,其可靠程度取決於背後系統的能力。
- 材料成本暴增: 研究發現,AI模型強烈偏好鈦金屬或碳纖維等特殊高性能材料——即使專案需要的是符合成本效益的解決方案。原因為何?因為這些材料在高科技訓練資料中出現的頻率較高。你的AI可能會建議一些材料,在沒有任何工程理由的情況下,讓你的預算暴增達數個數量級。
- 複雜度提升導致效能崩潰: 隨著結構問題在空間上變得更複雜、更多維,AI的準確率會顯著下降。當問題以自然語言描述而非正式程式碼描述時,模型的表現也會變差。這意味著,你的工程師以平實英語描述現實世界中非標準情境的內容越多,AI出錯的可能性就越高——在獨特問題上,可能有50%的時候會出錯。
- 隱藏的推理失誤: 這些模型在多跳推理(multi-hop reasoning)方面表現吃力——也就是透過多個中間連結來追蹤某種關係。在建築物中,這意味著要追蹤荷載從屋頂陽台,經由梁、柱,一路傳遞至基礎的路徑。如果你的AI無法追蹤這條鏈條,它就無法驗證結構安全性。
這種風險並非紙上談兵。這是一個可測量、有基準數據佐證的落差,存在於這些模型所承諾的與其實際交付的成果之間。
幕後究竟發生了什麼事
不妨這樣想。假設你聘請了一位建築檢查員,他背下了數千張安全建築的照片。當你向這位檢查員展示一份新設計時,他會將其與記憶中的照片進行比對。他會說:「這看起來像我以前見過的一棟安全建築。」但他從未學過工程學。他無法計算一根梁是否撐得住。他是在比對圖案模式,而不是在求解物理問題。
這正是多模態AI模型的運作方式。它們是「下一個詞元預測引擎」——經過訓練,根據其訓練資料中的模式來猜測最可能出現的下一個詞或像素的系統。當你問AI「這個陽台安全嗎?」時,它並不是在計算慣性矩。它是在預測,在它所訓練過的數百萬份文件中,通常會有哪些詞緊接在這個問題之後出現。如果其訓練資料中包含數千份結論為「該結構看似穩固」的報告,AI在統計上就會偏向生成類似的安心保證——無論實際藍圖顯示的是什麼。
該白皮書將此稱為「隨機鸚鵡」(Stochastic Parrot)問題:AI不斷重複聽起來合理的答案,卻不理解其背後的物理原理。結構工程是決定性的——如果力的總和不等於零,結構就會產生加速度(它會移動、會倒塌)。這其中不涉及任何機率。但AI卻將每一個答案都視為一種機率分布。當你的建築需要的是精確計算時,它給你的卻只是最佳猜測。
這種架構上的錯配——將機率性引擎套用於決定性領域——正是為何即使是最先進的AI模型,在結構推理上也會遇到49.8%準確率天花板的原因。
什麼有效(什麼無效)
讓我們先從失敗的做法談起。
以像素為基礎的AI分析: 將藍圖輸入視覺模型,等於是把你的工程圖當作待分類的影像,而非待計算的結構。AI看到的是紋理與圖案模式,而非傳力路徑與連接關係。它忽略了結構安全性「非黑即白」的二元本質。
用於法規合規的通用型AI: 模型能流暢地引述建築法規,卻無法將定量限制套用到具體設計上。它們擷取規則,卻不予以落實執行。你的合規檢查因此淪為一份摘要,而非一項驗證。
大型模型暴力法: 用更多網路資料訓練更大型的模型,並不能解決核心問題。在DSR-Bench測試中,結構推理的表現並未隨著模型規模擴大而有顯著提升。更多的參數並不能創造出對物理學的理解。
以下才是真正有效的做法——也就是Veriprajna所採用的方法:
1. 將藍圖轉換為圖(graph),而非像素。 系統不會將藍圖切割成像素區塊,而是將你的建築資訊模型(BIM)轉換成一個數學圖(graph)。每個節點代表一個真實的結構構件——梁、柱或樓板——並承載著楊氏模數與降伏強度等實際物理性質。每條邊則代表荷載傳遞所經過的真實實體連接。這個圖捕捉的是你結構的邏輯,而不僅僅是外觀。
2. 將物理學直接嵌入AI的訓練過程。 系統採用物理知情神經網路(Physics-Informed Neural Networks,簡稱PINNs)——這類AI模型將結構力學的支配方程式內建於其學習過程之中。若模型預測出違反平衡定律的撓度形狀,其訓練中的物理懲罰項就會迫使它自我修正。AI無法「憑空想像」出違反牛頓定律的答案。圖結構物理知情DeepONets(Graph-Structured Physics-Informed DeepONets)——這種方法的進階版本——已達到R² = 0.9999的準確率,同時運算速度比傳統工程求解器快7至8倍。
3. 以演算法追蹤每一條傳力路徑。 系統運用圖論,追蹤從施力點到基礎之間所有可行的荷載傳遞路徑。它會計算一項稱為U指數(U Index)的指標,將你結構的「脊柱」——也就是貫穿整棟建築物剛度最高的路徑——視覺化呈現。如果你的陽台設計存在傳力路徑不連續的問題,系統不會用猜的。流線會在該處驟然中斷,精確標示出失效點所在。
對你的合規與稽核團隊而言,這種做法能創造出一條 玻璃盒式決策軌跡。因為圖中的每個節點都與一個實體構件一一對應,你可以精確追蹤系統標示問題的原因:「該柱因梁A與梁B傳遞的荷載超出承載能力而失效。」這是一項可稽核、可解釋的結果——而非黑箱式的信心分數。
此系統採用地端部署運行。你的團隊無需將敏感藍圖傳送至公開API。物理引擎運行於你自己的伺服器上,保護你的 智慧財產權與專案資料 同時為你提供決定性的答案。
Veriprajna的方法可作為一層驗證機制。建築師與設計師仍可使用生成式AI進行創意發想。但每個概念都必須先通過一項 決定性物理檢驗 才會送達你的工程師手中。若檢驗未通過,系統會回傳一項硬性限制條件——例如「將梁深增加200mm」或「加設背跨連接」——強制進行符合物理原理的重新設計。你因此能同時擁有創意速度,以及 以模擬與數位孿生(digital twin)工作流程為後盾的工程確定性。
關鍵要點
- 表現最佳的AI模型在結構推理基準測試中僅得49.8%——對於建築安全決策而言,其可靠度並不比擲硬幣好。
- 多模態AI將藍圖視為像素圖案,而非實體結構,因此無法追蹤傳力路徑或驗證法規合規性。
- 物理知情圖神經網路透過將工程方程式直接嵌入AI中,達到R² = 0.9999的準確率,運算速度比傳統求解器快7至8倍。
- 以圖為基礎的AI會將每一項預測對應到一個實體構件,創造出合規團隊能夠實際驗證的可稽核決策軌跡。
- 這些專門化模型是以物理方程式而非網路資料進行訓練,因此能夠採用地端部署運行,無需將敏感藍圖暴露於公開API。
總結
你的AI工具或許在結構安全上聽起來信心十足,但基準測試顯示,它們的判斷只有一半機率答對。物理知情圖神經網路以逐步可追蹤的決定性計算,取代了這種憑猜測行事的做法,讓稽核人員與監管機關都能逐步查核。不妨這樣問你的AI供應商:當系統判定某結構安全時,它能否展示從施力點到基礎的確切傳力路徑——並證明路徑上的每一個連接都符合物理學的支配方程式?