在合成二甲雙胍病例中,準確的HbA1c與危險建議並存。本文闡釋病歷感知型安全網關如何捕獲兩者差異。
醫療 AIClinical Informatics病人安全

我構建了即使陳述屬實也能將其攔截的臨床AI檢查機制

Ashutosh SinghalAshutosh Singhal2026年7月25日10 min

在一份合成的患者門戶草稿中,我發現了一項準確的6.8%的HbA1c數值,旁邊卻附有繼續服用二甲雙胍的建議。而同一份合成病歷顯示的eGFR為28。當我將這些事實綜合在一起時,問題不再僅僅是AI能否準確引用化驗結果,而是演變為:一句正確的陳述是否會為一個需要臨床醫生審查的醫療處置提供不恰當的背書。

我構建了ChartSieve的交互式演練,正是圍繞這一張力展開。這是一項基於固定合成病歷和樁函數模擬AI輸出的演示,而非實際的臨床部署。它能讓我清晰展示一條審查路徑:草稿送達,主張得到依據支撐,推薦的醫療處置與病歷進行核對,隨後確定性的策略網關決定草稿應當放行、保留審查還是阻斷。系統不會直接向患者發送任何消息。

通過了我第一個問題的句子

我逐條主張追蹤患者門戶草稿。HbA1c 6.8%與合成病歷吻合。二甲雙胍出現在用藥清單中。我可以為每個事實附上來源依據,僅憑這兩項吻合,完全沒有理由叫停草稿。然而最後一條醫囑指示患者繼續用藥。我在這處動詞停頓了。僅僅證明該藥物存在於病歷中,並不能直接授權繼續用藥的建議。

我從有據可查的詞句轉向最新的腎功能數值eGFR 28。此時,預設的CONTRAINDICATION_RENAL規則將草稿保留以供臨床醫生審查。這正是我在ChartSieve中做出的架構轉折:將推薦的行動與有據可查的主張分開核查,然後將兩者的結果保持可見。我不會為了更輕易地解釋保留原因而將HbA1c謊稱為假。化驗數值在屏幕上依然顯示為正確,而行動建議則獲得不同的裁定。

我還讓肌酐的變化歷史保持可見:從1.4上升到1.9再到2.3 mg/dL。它為腎臟病理所見補充了背景,但並非該處置裁決的獨立觸發條件。我非常注重這一區分,因為人們很容易被令人擔憂的指標趨勢所吸引,進而誤將其當成實際的規則。最新的eGFR決定了規則結論,這是該合成病例的關鍵。審查人員應該能夠針對引發保留決定的確切證據和規則提出異議,而不是針對我對看似驚險的病歷圖表的個人解讀。

當我觀察病例界面時,最有價值的細節絕非僅僅是一個紅色的警示徽標。原始語句依然展示在處置結論和規則所見旁邊。我可以在單一視圖中同時查看草稿、HbA1c主張以及將其保留審查的腎臟原因。這就是通用警報與可審查決策之間的差異。真實的臨床醫生依然需要評估現實世界的診療環境;本演示不能替代醫生的專業判斷,也不能證明醫生已經採取了行動。

ChartSieve的合成腎臟病例展示了包含HbA1c 6.8%的草稿、保留處置狀態,以及與eGFR 28關聯的腎臟規則所見。
合成患者門戶草稿準確引用了HbA1c 6.8%。腎臟所見引用了eGFR 28,並將二甲雙胍建議保留以供審查。

有據可查的主張與被保留的行動

我可以明確指出固定合成病歷中的eGFR 28,因此預設的保留顯得乾脆利落。然而在生產環境中,規則必須首先決定採用哪一項腎功能結果。如果兩項檢測結果衝突、最新數值不可用或相關的就診記錄不明確,該如何處理?ChartSieve並未解決這些問題。選擇病歷數值本身就是一項安全決策。代碼中的規則可以非常精確,但輸入該規則的證據本身可能不完整或存在爭議。

我希望這一選擇過程也能向審查人員公開。所選的結果、時間戳以及任何缺失的背景,都應當在有人根據保留採取行動之前清晰可見。否則,定義明確的規則可能會淪為關於隱藏輸入值的爭論,迫使負責審查草稿的人不得不從頭重新檢索病歷。

我選擇在最新eGFR旁邊顯示肌酐歷史,是因為審查人員應當看到背景,而不至於將其誤認為是觸發條件。這種區分需要在規則維護中保持下去。誰負責維護腎臟規則?哪些臨床指南和院內規章制約該規則?在規則影響草稿之前如何進行測試?演示採用的是精選的種子規則集,它並不提供持續維護的臨床知識庫,也不提供解答這些權責歸屬問題的機制。

我構建了病例面板,以便能準確定位分歧所在。藥物清單證實了患者正在服用二甲雙胍的事實。而獨立的CONTRAINDICATION_RENAL規則根據eGFR 28保留了繼續用藥的建議。審查人員可以對數據源的選擇、規則或對醫囑的解釋提出異議,而無需假裝HbA1c主張是虛假的。這些屬於不同類型的分歧,真實的醫療工作流程需要有一種機制來記錄發生的是哪一種異議。

如果臨床醫生不同意保留決定,我會詢問醫療團隊接下來應當如何處置。需要記錄怎樣的理由?誰有權放行草稿,需要保留哪些證據憑證?演示系統標記內容以待審查,但並沒有將該狀態綁定至特定醫生,也沒有記錄人工覆蓋操作。這種尚未完結的權責交接,恰恰是醫療機構必須明確定義職責的關鍵所在。一個寫著「已保留」的屏幕無法告訴我,最終是誰接受、修訂或拒絕了面向患者的醫療建議。

我希望保留決策是可審查的

我不希望審查人員僅僅收到某個模型認為草稿看起來有風險的單方意見。在演示中,驗證智能體可以添加事實依據、公平性和紅隊防禦建議。連接實時大模型供應商是可選的且回復可以被緩存;若未啟用,系統將採用確定性的諮詢建議文本。這些建議可以豐富審查人員所見的信息,但絕不能決定或覆蓋系統處置。確定性的策略網關返回:RELEASE、HOLD_FOR_REVIEW或BLOCK。

在這個病例中,這種邊界至關重要。即使建議寫得再有說服力,只要規則所見顯示為保留,草稿在模擬工作流中就保持保留狀態。即使建議缺失或缺乏說服力,相同的規則依然會執行評估。網關的權威是明確的,而不是被暗中摻雜在另一個模型生成的看似合理的話語中。我可以對種子規則的設計方式持有不同意見,但依然能夠確切知道是系統的哪個模塊做出了決策。對於治理而言,這遠比單一不透明的置信度評分有用得多。

安全憑證(Safety Receipt)為我提供了審視保留決定的另一種途徑。針對二甲雙胍病例,演示記錄包括裁定結果、可用依據來源、腎臟所見、顧問建議、時間戳以及以16位十六進制字符展示的SHA-256摘要。我可以追溯伴隨決策出現的全部證據。顯示憑證中的摘要經過了截斷;生產環境的完整性與存檔設計需要遠多於此的記錄支撐。可見的字段使這一預設處置變得可審查。

合成腎臟安全憑證展示了HOLD_FOR_REVIEW、依據來源、腎臟所見、驗證建議以及截斷的摘要。
腎臟安全憑證記錄了此種子病例的保留裁定和支持字段。其顯示的SHA-256數值是截斷摘要,而非數字簽名。

我從保留裁定反向閱讀該憑證。首先尋找引發保留的規則所見,然後查找依然有效的主張依據。這種順序防止我將該裁定誤當作是對草稿中每一句話的徹底否定。它還為審查人員提供了表達異議的具體著力點。他們可以反駁種子規則、選定的腎功能指標或對服藥醫囑的解讀。這些屬於不同的異議,憑證將相關字段緊密排列以便彼此區分。單一的風險標籤將迫使審查人員自行從頭推導整個推理鏈。

我也避免製造一種被保留的草稿已經經過醫師審查的虛假敘事。界面只是將其標記為待審查,並未記錄醫療團隊的實際操作。在「醫生已審查」的說辭進入面向患者或面向審計的記錄之前,這聽起來可能只是微小的語義差異。安全工作流必須嚴謹區分已經發生的事實與僅僅處於等待狀態的事項。憑證在演示中的價值在於讓模擬的處置結論及其依據變得可審查,而不是證明發生了一次真實的臨床交接。

讓我駐足深思的基準

查看基準測試時,我再次回到二甲雙胍草稿。如果僅檢查陳述的化驗數值,6.8%與病歷完全一致。如果對照最新的腎功能指標檢查推薦的行動,eGFR 28會觸發預設的保留。我希望回歸測試集能夠將這種問題維度的演變展示在單一界面之外,同時坦誠說明測試本身的規模是多麼有限且具有人工構造性。

測試集包含34個固定的合成標註構件:12個標記為安全,22個標記為不安全。ChartSieve的確定性防火牆攔截或阻斷了全部22個不安全構件,且未對12個安全構件實施保留或阻斷。對比基準將陳述的化驗值與病歷核對,並放行臨床決策支持結論。它僅捕獲了22個不安全構件中的4個,漏掉了18個。化驗值比對器回答的是一個更窄的問題,相比於本種子規則的檢查更是如此。二甲雙胍界面揭示了原因所在:準確的數值與被規則保留的醫囑指令赫然並存於同一份草稿中。

ChartSieve的固定合成回歸基準顯示,在34個受評構件中,其確定性防火牆成功捕獲了全部22個不安全構件。
演示中包含34個構件的回歸測試集表明,22個不安全病例中的22個都被種子防火牆攔截。這些屬於合成回歸結果,並非真實的臨床表現估算。

我依然需要知道誰來審查規則定義、分歧如何記錄、標註集排除了哪些錯誤,以及當規則所需的依據缺失時會發生什麼。演示為這些疑問提供了一個具體的具象實體:可審查的草稿、合成病歷、規則所見以及處置裁決。化驗比對基準中的18項遺漏說明了更廣泛的種子安全檢查能為這一固定集合帶來什麼;但它們無法證明系統在面對全新臨床病例時的表現。這些示例均嵌入了已知模式,而基準屬於特意設定的狹窄對比,並非其他商業競品。

我希望擺在醫療團隊面前的內容

我會從二甲雙胍界面而非評分卡開啟對話。它為臨床資訊學負責人提供了可以具體質疑的對象。最新的eGFR是否是維護中的規則的正確觸發器?哪些例外情況和數據缺失至關重要?審查人員應當看到什麼,而在他們覆蓋保留時系統應當記錄什麼?這些都屬於臨床治理的決策範疇,而不是市場營銷宣傳語或不可追責的模型輸出。

如果您更願意親眼目睹其運行而不是閱讀我的文字描述,這裡提供了端到端運行的完整演示。

這份臨床AI安全演示的完整剖析展示了該病例與審查路徑。我再次聚焦於其中的一幅畫面:準確的化驗數值與被保留的用藥醫囑緊挨在一起。這兩個事實都理應保持可見。掩蓋正確的主張會讓草稿看起來明顯低劣;而掩蓋腎臟指標所見又會讓它看起來完全可以發送。真正的攻堅在於:當界面同時保留這兩者在屏幕上,並要求有人為介於它們之間的醫療行動承擔責任之時。

相關研究

同步發佈於

自信打造您的 AI。

與一支在打造新世代企業級 AI 方面擁有深厚經驗的團隊攜手合作。讓我們協助您設計、建置並部署值得信賴的 AI 策略。

Veriprajna 深度科技顧問公司 專精於為醫療、金融及法規監管領域打造攸關安全的 AI 系統。我們的架構均依循既定規範進行驗證,並備有完整的合規文件。