視覺模型與致動器之間的執行期信任層

你的檢測 AI 沒有準確率問題。它有包絡問題。

實驗室準確率達 97% 的模型,在生產現場的誤判退件率可能高達 14%——不是因為模型變差了,而是因為眩光、冷模具與換班,把輸入推離了模型當初通過驗證時的分布。Inspection Trust Gate 會將每張影像對照模型的已驗證包絡加以檢查,套用模型無法覆寫的確定性把關規則,把任何超出包絡的零件暫扣待人工審查,並寫下一筆逐件的稽核溯源紀錄。代理人提供建議,程式碼做決定。

0

因漂移而被把關機制自動報廢的良品

未加包絡基準誤判退件 95.5% 至 100%(MVTec metal_nut 保留測試分割)

93/93

漂移條件下的缺陷零件仍被攔截或升級處理

從未被自動放行(同一保留測試分割)

1.00

在一個保留的漂移族上的包絡 AUROC

從未針對該族調校,因此此檢查並非循環驗證(MVTec metal_nut 保留測試分割)

這是可實際運行的示範。PLC 致動器與 MES 接收端是模擬轉接器,會記錄它們原本會執行的動作;零件影像是真實的 MVTec AD metal_nut 照片;漂移則是套用在真實良品照片上的誠實影像損壞。

實驗室裡 97% 的模型。沖床上 14% 的誤判退件率。

讓邊緣檢測部署卡住的失效模式,是輸入失效,而非模型失效。

我們研究中的典型案例,是一台以每分鐘 40 衝程運轉的 200 噸連續模沖床:視覺模型在驗證時達到 97% 準確率,到了生產現場卻崩潰成 14% 的誤判退件率。模型並沒有變差。廠房天井燈眩光會隨每個衝程角度而變,潤滑劑在熱模與冷模上的積聚方式不同,而一個班次的前 50 件零件會在達到熱平衡之前抵達。輸入離開了模型通過驗證時的分布,而任何模型、無論準確率多高,在那裡都不可信。

產業慣例顯示,模型從來就不是專案本身。開箱即用的 AOI 系統會誤判退件 5% 至 15% 的良品,調校良好的系統則低於 2%:這是校正與資料問題,而非模型架構問題。整合佔部署時程的 60%,模型訓練佔 15%,而 84% 的系統整合專案失敗或部分失敗。

法規提高了賭注。歐盟 AI 法的高風險義務涵蓋附件三下的安全關鍵品質決策,自 2026 年 8 月 2 日起全面適用,最嚴重的禁止實務違規最高罰款為 3,500 萬歐元或全球營業額的 7%。一台退件致動器若依未經驗證的模型判定觸發、且沒有任何原因紀錄,正是該制度要揭露的對象。

解方不是更好的模型。即使完美的模型,也只在已驗證包絡內的輸入上有效。產線需要的是一個執行期層:它知道那個包絡、拒絕在包絡外致動,並且能逐件證明它決定了什麼、以及為什麼。

Inspection Trust Gate 如何運作

由確定性把關機制決定什麼會被致動,而非模型,也非 LLM。

每一件零件都走同一條流程:

影像 → 物理 + 紋理特徵 → 包絡檢查(OOD)→ 缺陷判定 → 確定性把關 → 致動/暫扣 → 稽核紀錄

1. 已驗證包絡

EnvelopeDetector 在物理訊號空間(曝光、對比、動態範圍、對焦、高頻細節、熱色偏、飽和度、眩光占比)計算馬氏距離,並以 220 張訓練良品影像擬合。它只回答一個問題:這張影像是否處於模型通過驗證時的擷取條件之內?超出包絡,意味著任何模型輸出都不可信。

2. 確定性把關機制

獨立於任何 LLM 之外的樸實程式碼,模型無法覆寫:依本示範自身資料擬合的校準信心閾值(低於 0.948 自動放行,高於 1.30 自動退件),以及硬性的 750 ms 衝程窗口延遲預算。每一件零件會被路由至 AUTO_PASS、AUTO_REJECT 或 HOLD;HOLD 會將其送入人工升級佇列。

3. 稽核溯源

每一項決策都會寫下一筆 JSONL 紀錄:零件 id、工位、模型 id 與版本、資料集雜湊、缺陷信心、OOD 分數、物理訊號、觸發的把關規則、對照預算的延遲、致動與 MES 日誌,以及風險標籤 high-risk:quality-gate(歐盟 AI 法附件三,生效 2026-08-02)。一鍵即可匯出整個班次。

缺陷模型刻意不是產品本身

本示範的 DefectDetector 是紋理空間中對訓練良品的 kNN 距離(PatchCore-lite),作為你 NVIDIA Metropolis、Cognex 或客製模型的替身,置於固定介面之後。它是真實可運作的替身(在乾淨良品對缺陷上 AUROC 為 0.845),如實報告,而產品主張從不建立在它之上。持久的價值在於其外圍層:漂移把關、來源溯源與受治理的致動,在任何模型準確率下都成立,因此該層能挺過每一次模型升級。

代理人提供建議,程式碼做決定

當零件堆積在 HOLD 佇列中,一對具代理能力的 Drift Triage 會說明原因:診斷代理人讀取被暫扣零件的排序物理訊號偏差,提出根因假設與建議行動;評論代理人則對照數值證據核實該假設,若所引用的訊號實際上並非主導偏差,便將其降級為人工調查。代理人建置於 Pydantic AI 之上,且可替換供應商;若未設定 API 金鑰,分診會回退到確定性範本,讓整個示範可離線運行。無論哪種方式,代理人只提供建議。把關機制早已決定。

換班,從頭到尾走一遍

第 3 號產線工位上的腳本化班次,以真實的 MVTec AD metal_nut 保留測試零件重播。下方每張影像都是運行中應用程式的截圖。

正常運轉:乾淨零件在數十毫秒內放行

漂移發生前,乾淨良品會在充裕時間內自動放行:隨附的稽核日誌顯示零件 test-good-288 為 37.7 ms、test-good-289 為 24.4 ms,對照 750 ms 衝程窗口預算,且各有完整溯源紀錄。儀表板顯示每件零件的即時決策流程,以及各階段量測的實際經過時間與其輸出背後的證據。

正常運轉時的 Inspection Trust Gate 儀表板:一件判定為 PASS 的乾淨零件、顯示各階段毫秒數的即時決策流程,以及處於標稱狀態的包絡監測。
一件自動放行的乾淨零件:PASS 判定、各階段計時、包絡監測為標稱。

06:00,換班:輸入離開包絡

接著腳本化標記觸發:SHIFT CHANGE 06:00,冷模具,廠房燈開啟。十二件保留的良品帶著眩光、失焦與熱色偏抵達(套用在真實良品照片上的誠實影像損壞,並在應用程式中如此標示)。包絡監測變紅。把關機制將每一件都暫扣待人工審查,而不是讓致動器依模型從未被驗證可給出的判定觸發。

漂移瞬間:SHIFT CHANGE 06:00 橫幅、讀為 needs proof 的 HOLD 判定、零件周圍的分布外違規環,以及未加包絡的 AOI 原本會將其退件的註記。
漂移瞬間:HOLD 而非誤判退件。未加包絡的 AOI 路徑原本會報廢這件良品。
逐項訊號說明的包絡違規:亮度位於正 7.6 個標準差,貢獻馬氏距離的 87.1%。
包絡為何觸發:亮度為 +7.6 sigma,佔距離的 87.1%。這是證據,而非黑箱旗標。

同一個班次,兩條路徑上的量測

比較面板將相同零件分別送入未加包絡的基準與 Trust Gate。基準會誤判退件漂移良品;把關機制自動報廢 0 件並將其暫扣,使此腳本化班次的誤判退件 KPI 從 57.1% 降至 0%。推估面板將量測到的未加包絡誤判退件率外推至整個班次(每分鐘 40 衝程、8 小時即 19,200 件),以每件 $2.42 計,這是有來源的數量級報廢成本(餅乾製造商案例:因 8.7% 的報廢浪費降低而每年節省 $94K)。美元數字始終是標示為推估的數字,絕非量測到的節省。

效益面板:未加包絡基準報廢 12 件良品,對照 Trust Gate 為 0;被暫扣零件的升級佇列;誤判退件 KPI 從 57.1% 降至 0%;以及標示為推估的報廢成本約 $26.5k。
未加包絡路徑報廢 12 件良品,把關機制為 0。被暫扣的零件在升級佇列等候;美元計數器是標示為推估的數字。

真實缺陷被自動退件,並如實註記

若缺陷能躲在其下,漂移把關便毫無價值。一件真實的嚴重結構缺陷(MVTec 類別 flip,零件 test-flip-264)被自動退件,模擬致動器記錄 REJECT actuated in 25 ms,對照 750 ms 預算。幾何深入說明指出此零件上未定位到任何異常:退件僅依紋理信心,而區域規則回退到中心預設。顯示那段文字是刻意的。示範展示規則棄權,而非假裝。在整個保留分割上,漂移期間注入的缺陷零件仍被攔截或升級處理,93 件中的 93 件,從未被自動放行。

自動退件真實缺陷 test-flip-264 的完整決策軌跡,模擬致動器日誌顯示 REJECT actuated in 25 ms,對照 750 ms 預算。
自動退件軌跡:真實缺陷,由模擬轉接器記錄的致動。
自動退件零件上的誠實深入說明:未定位到異常,退件僅依紋理信心。
產品中的揭露:未定位到異常,僅依紋理信心。

憑據,以及解釋

點選任一零件,稽核抽屜會顯示其完整溯源紀錄:模型 id metalnut-defect-knn 版本 v7、資料集雜湊 ae95b5b533c8、OOD 分數、物理訊號、觸發的規則、對照預算的延遲、致動與 MES 日誌,以及風險標籤 high-risk:quality-gate(歐盟 AI 法附件三,生效 2026-08-02)。Export Audit 會將班次下載為 inspection_audit.jsonl;在保留分割上,已決策零件的稽核完整度為 100%。執行 Drift Triage 時,診斷代理人會為被暫扣零件提出根因,評論代理人則在核發 verified 徽章前對照數值證據加以核實。

逐件稽核溯源 JSON,含模型 id 與版本、資料集雜湊、OOD 分數、觸發的把關規則、延遲,以及歐盟 AI 法附件三高風險標籤。
逐件溯源紀錄,設計為高風險符合性檔案可歸檔的證據。
Drift Triage 輸出:診斷代理人的根因假設與建議行動,以及評論代理人的已核實徽章。
Drift Triage:診斷代理人提出,評論代理人核實。僅供諮詢;把關機制早已決定。

數字,以及它們確切的適用範圍

所有量測皆來自本示範在 MVTec AD metal_nut 官方保留測試分割上的基準腳本(220 張訓練良品擬合影像;22 件良品與 93 件缺陷測試零件),在相同影像上比較未加包絡的基準與 Trust Gate。基準對各漂移族誤判退件 95.5% 至 100% 的漂移良品(平均 98.9%);把關機制自動報廢 0.0% 並暫扣 100%。包絡偵測器在一個它從未被調校過的保留漂移族(曝光不足)上得到 AUROC 1.00。損壞為全強度,因此基準的崩潰在構造上接近全面:誠實的主張是方向——一旦輸入離開包絡,在乾淨條件下通過驗證的模型便會崩潰——而非確切百分比。這些是研究基準上的示範量測,絕非開放世界保證。

未加包絡的 AOI 流程對照 Inspection Trust Gate

示範即時運行的同一比較,使用相同零件。

維度 未加包絡的 AOI(無包絡檢查) Inspection Trust Gate
超出包絡的輸入 仍信任模型判定 不信任任何模型輸出;零件被 HELD 待審查
漂移良品(眩光、失焦、熱色偏) 各漂移族誤判退件 95.5% 至 100% 自動報廢 0;100% 被暫扣(MVTec metal_nut 保留測試分割)
誰觸發致動器 直接依模型判定 模型無法覆寫的確定性把關機制
延遲課責 硬性 750 ms 衝程窗口預算,逐件量測
稽核軌跡 逐件 JSONL 溯源紀錄,可按班次匯出
當產線漂移時 報廢堆到有人注意到為止 升級佇列加上諮詢性 Drift Triage(診斷代理人、評論代理人)

本示範不做什麼

  • ✓ 它不運行真實產線。通往 Allen-Bradley ControlLogix 退件致動器的 EtherNet/IP 以及 MES 接收端,都是模擬轉接器,會記錄它們原本會執行的動作;相機則是錄製的影像串流。第 3 號產線工位與班次皆為腳本化。
  • ✓ 它不主張開放世界保證。0.0% 的把關誤判退件、1.00 的包絡 AUROC,以及 93/93 的攔截率,都是在全強度合成損壞下、對 MVTec metal_nut 保留分割的量測。
  • ✓ 它不展示真實廠房漂移。漂移是套用在真實 MVTec 照片上的誠實影像損壞(眩光、失焦、熱色偏):真實照片、合成漂移,並在應用程式中如此標示。
  • ✓ 它不銷售缺陷模型。kNN 替身的存在,是為了展示其外圍層;在正式環境中模型是你的,我們不主張能超越 AOI 供應商的檢測能力。
  • ✓ 它不交付正式環境計量。幾何區域規則是粗略替身,在 93 件保留缺陷中的 33 件上定位異常,並在 93 件中的 1 件上改變把關結果;UI 會逐件揭露這一點。
  • ✓ 它不報告量測到的節省。報廢成本計數器是以每件 $2.42 標示的推估,屬於有來源的數量級,且此示範不存在任何客戶、部署或案例研究。

買家真正會問的問題

為什麼換班後,我們的視覺系統會把良品退件?

通常是因為輸入漂移了,而不是模型變差。廠房天井燈眩光、冷模具,以及達到熱平衡前一個班次的前幾件零件,會把影像移出模型通過驗證時的分布,而任何模型在已驗證包絡外的輸入上都不可信。實驗室 97% 的模型在沖床上達到 14% 生產誤判退件率,就是典型例子。持久的解方是一道能偵測超出包絡輸入、並將那些零件暫扣待審查而非致動的把關機制。

我們必須更換既有的檢測模型或 AOI 系統嗎?

不必。Inspection Trust Gate 以固定介面包覆你的模型;在示範中,缺陷偵測器是 NVIDIA Metropolis、Cognex 或客製引擎的刻意替身。產品是模型周圍的那一層:包絡檢查、確定性把關機制、升級佇列,以及稽核溯源。那一層在每一次模型升級中都會持續發揮價值,因為它防止的是輸入失效,而非模型失效。

對真實沖壓產線來說夠快嗎?

把關機制是帶有硬性延遲預算的樸實程式碼:退件決策必須落在以每分鐘 40 衝程運轉的沖床的 750 ms 衝程窗口內。在示範隨附的稽核日誌中,決策落在數十毫秒內,例如對照 750 ms 預算的 24.4 ms 與 37.7 ms,儀表板會回報即時 p99。這些是示範量測,而非正式環境保證,但預算是逐件強制執行的。

歐盟 AI 法適用於 AI 品質檢測嗎,我們必須記錄什麼?

安全關鍵的品質決策落在該法的高風險義務(附件三)之下,自 2026 年 8 月 2 日起全面適用,最嚴重的禁止實務違規最高罰款為 3,500 萬歐元或全球營業額的 7%。示範會寫下逐件溯源紀錄:模型 id 與版本、資料集雜湊、OOD 分數、觸發的規則、對照預算的延遲、致動日誌,以及風險標籤,可匯出為 JSONL。該紀錄設計為高風險符合性檔案可歸檔的證據;它不是認證。

AI 或 LLM 能觸發退件致動器嗎?

不能。致動由確定性把關機制決定:擬合的信心閾值與延遲預算寫在樸實程式碼中,任何模型輸出與任何 LLM 都無法覆寫。具代理能力的部分 Drift Triage,是診斷代理人加上評論代理人,用來解釋產線為何漂移;它們只提供建議,從不致動。若未設定 API 金鑰,分診會降級為確定性回退,整個示範可離線運行。

我們怎麼知道漂移偵測器不是專門為示範調校的?

這正是我們做的獨立性檢查:包絡偵測器在一個它從未被調校過的保留漂移族(曝光不足)上得到 AUROC 1.00,量測於 MVTec metal_nut 保留分割。它在物理訊號空間以 220 張已知良品影像擬合,因此會標記會移動那些訊號的擷取漂移,而不只是我們建構的漂移族。損壞為全強度,因此分離在構造上很鮮明;誠實的主張是方向,而非確切百分比。

這是真實產線還是示範?

一個證明機制的可運行示範。通往 Allen-Bradley ControlLogix 退件致動器的 EtherNet/IP 以及 MES 接收端,都是模擬轉接器,會記錄它們原本會執行的動作;相機是真實 MVTec AD metal_nut 照片的錄製串流;漂移是套用在真實良品照片上的誠實影像損壞。包絡檢查、確定性把關機制、升級佇列與稽核匯出都是真實的,並完全依所示運行,每一個標題數字都量測於 MVTec metal_nut 保留測試分割。

技術研究

支撐此示範的研究——架構、驗證設計,以及企業藍圖。

正在復原或強化邊緣檢測部署?

模型與致動器之間的信任層才是難處。我們打造它。

如果你的團隊正為每次換班後的誤判退件而苦惱,或在思考歐盟 AI 法的高風險義務對一條以每分鐘 40 衝程決策的產線意味著什麼,我們真心想聽聽你是怎麼思考這件事的。這個問題遍及整個產業,答案也將如此。

包絡評估

  • ✓ 對應你產線的輸入在何處離開模型的已驗證包絡
  • ✓ 在你的擷取訊號上擬合分布外偵測器
  • ✓ 依你自己的資料定義把關閾值與 HOLD 政策
  • ✓ 指定你的符合性檔案所需的溯源紀錄

打造信任層

  • ✓ 落在你衝程窗口預算內的確定性把關機制
  • ✓ 產線上的包絡監測與升級佇列
  • ✓ 逐件 JSONL 稽核溯源,一鍵匯出
  • ✓ 有界的漂移分診代理人:只提供建議,從不致動
社群媒體

同步發佈於