视觉模型与执行器之间的运行时信任层

你的质检 AI 没有准确率问题。它有包络问题。

实验室里 97% 的模型,在产线上可能达到 14% 的误剔率,不是因为模型变差了,而是因为眩光、冷模和换班把输入带出了它当初通过验证的分布。Inspection Trust Gate 会把每张图像对照模型的已验证包络加以检查,施加模型无法覆盖的确定性关卡,将任何包络外的件扣留待人工复核,并写入按件的审计溯源记录。智能体只作建议,代码作出裁定。

0

被关卡自动报废的漂移合格件

朴素基线误剔 95.5% 至 100%(MVTec metal_nut 留出划分)

93/93

漂移下的缺陷件仍被检出或升级

从未自动放行(同一留出划分)

1.00

留出漂移族上的包络 AUROC

从未针对该族调参,因此该项检查不是循环论证(MVTec metal_nut 留出划分)

这是一个可运行演示。PLC 执行器与 MES 接收端是记录其本会执行动作的模拟适配器,零件图像是真实的 MVTec AD metal_nut 照片,漂移则是施加在真实合格照片上的如实图像损坏。

实验室里 97% 的模型。冲压机上 14% 的误剔率。

卡住边缘检测部署的失败模式,是输入失败,而非模型失败。

我们研究中的典型案例是一台 200 吨级进模冲压机,每分钟 40 次冲程:在验证中达到 97% 准确率的视觉模型,在生产中坍缩到 14% 的误剔率。模型并没有变差。车间顶灯眩光随冲程角度而变,润滑剂在热模与冷模上积聚方式不同,换班后的前 50 件在热平衡到来之前就已到达。输入离开了模型通过验证的分布,而任何模型、无论准确率多高,在那里都不可信。

行业模式表明:模型从来就不是这个项目。开箱 AOI 系统会误剔 5% 至 15% 的合格件,调校良好的系统可到 2% 以下:这是标定与数据问题,不是模型架构问题。集成占部署时间线的 60%,模型训练占 15%,而 84% 的系统集成项目失败或部分失败。

监管抬高了赌注。欧盟《AI 法案》的高风险义务覆盖附件 III 下的安全关键质量决策,自 2026 年 8 月 2 日起全面适用,对最严重的、被禁止实践的违规,最高罚款 3,500 万欧元或全球营业额的 7%。一台在未经验证的模型裁决上触发、且没有任何原因记录的剔除执行器,正是该制度要揭露的对象。

修复方案不是更好的模型。即便是完美模型,也只在已验证包络内的输入上有效。产线需要的是一层运行时:它知道那个包络,拒绝在包络外执行动作,并能逐件证明它裁定了什么、以及为什么。

Inspection Trust Gate 如何工作

由确定性关卡决定什么被执行,而不是模型,也不是 LLM。

每一件都走同一条流水线:

图像 → 物理 + 纹理特征 → 包络检查 (OOD) → 缺陷裁决 → 确定性关卡 → 执行 / 扣留 → 审计记录

1. 已验证包络

EnvelopeDetector 在物理信号空间(曝光、对比度、动态范围、对焦、高频细节、热色偏、饱和度、眩光占比)中计算马氏距离,在 220 张训练合格图像上拟合。它只回答一个问题:这张图像是否处于模型通过验证的采集条件之内?包络外意味着任何模型输出都不可信。

2. 确定性关卡

位于任何 LLM 之外的朴素代码,模型无法覆盖:根据演示自身数据拟合的校准置信度阈值(低于 0.948 自动放行,高于 1.30 自动剔除)以及硬性的 750 ms 冲程窗口时延预算。每一件被路由到 AUTO_PASS、AUTO_REJECT 或 HOLD,HOLD 将其送入人工升级队列。

3. 审计溯源

每一次裁定都写入一条 JSONL 记录:零件 id、工位、模型 id 与版本、数据集哈希、缺陷置信度、OOD 分数、物理信号、触发的关卡规则、对照预算的时延、执行与 MES 日志,以及风险标签 high-risk:quality-gate(欧盟《AI 法案》附件 III,生效 2026-08-02)。一键导出整班。

缺陷模型刻意不是产品本身

本演示的 DefectDetector 是纹理空间中到训练合格件的 kNN 距离(PatchCore-lite),作为你的 NVIDIA Metropolis、Cognex 或自定义模型在固定接口之后的替身。它是真实可用的替身(在干净合格件对缺陷件上 AUROC 为 0.845),如实报告,产品主张从不建立在它之上。持久价值是围绕它的那一层:漂移门控、溯源与受治理的执行,在任何模型准确率下都成立,因此这一层能扛过每一次模型升级。

智能体只作建议,代码作出裁定

当零件在 HOLD 队列中堆积时,一对智能体式 Drift Triage 会解释原因:诊断智能体读取被扣留件的排序物理信号偏差,提出根因假设及建议动作;评审智能体对照数值证据核验该假设,若被引用的信号并非实际主导偏差,则将其降级为人工排查。智能体基于 Pydantic AI 构建,可切换供应商;未配置 API 密钥时,分流回退到确定性模板,使整个演示可离线运行。无论哪种方式,智能体只作建议。关卡早已作出裁定。

换班,端到端走一遍

工位 Line 3 上的脚本化班次,在真实的 MVTec AD metal_nut 留出测试件上回放。下方每张图都是运行中应用的截图。

正常运行:干净零件在数十毫秒内放行

漂移之前,干净合格件自动放行且时间充裕:随附的审计日志显示零件 test-good-288 为 37.7 ms、test-good-289 为 24.4 ms,对照 750 ms 冲程窗口预算,每件都有完整溯源记录。仪表盘展示每件的实时决策流水线,含各阶段测得的墙钟时间及其输出背后的证据。

正常运行期间的 Inspection Trust Gate 仪表盘:一件带 PASS 裁决的干净零件、展示各阶段毫秒数的实时决策流水线,以及处于标称状态的包络监视器。
一件自动放行的干净零件:PASS 裁决、各阶段计时、包络监视器处于标称。

06:00,换班:输入离开包络

随后脚本化标记触发:SHIFT CHANGE 06:00,冷模,车间灯开启。十二件留出合格件到达时已损坏,带有眩光、失焦和热色偏(施加在真实合格照片上的如实图像损坏,并在应用中如此标注)。包络监视器变红。关卡将每一件都扣留待人工复核,而不是让执行器在模型从未被验证可给出的裁决上触发。

漂移时刻:SHIFT CHANGE 06:00 横幅,一条读作 needs proof 的 HOLD 裁决,零件周围的分布外突破环,以及一条朴素 AOI 本会将其剔除的备注。
漂移时刻:HOLD,而非误剔。朴素 AOI 路径本会报废这件合格件。
逐信号解释的包络突破:亮度处于正 7.6 sigma,贡献马氏距离的 87.1%。
包络为何触发:亮度处于 +7.6 sigma,占距离的 87.1%。这是证据,不是黑盒标志。

同一班次,两条路径上的度量

对比面板将相同零件分别送入无包络的朴素基线与 Trust Gate。基线误剔漂移合格件;关卡自动报废 0 件并予以扣留,在该脚本化班次中把误剔 KPI 从 57.1% 打到 0%。投影面板将测得的朴素误剔率外推到整班(每分钟 40 次冲程、8 小时即 19,200 件),按每件 $2.42 计,这是有来源的数量级报废成本(饼干制造商案例:因 8.7% 报废浪费下降而每年节省 $94K)。美元数字始终是带标签的投影,从未是测得的节省。

结果面板:朴素基线报废 12 件合格件,Trust Gate 为 0,被扣留件的升级队列,误剔 KPI 从 57.1% 降至 0%,以及约 $26.5k 的带标签报废成本投影。
朴素路径报废 12 件合格件,关卡为 0。被扣留件在升级队列中等待;美元计数器是带标签的投影。

真实缺陷自动剔除,并如实标注

如果缺陷能藏在其下,漂移门控就毫无价值。一个真实的严重结构缺陷(MVTec 类别 flip,零件 test-flip-264)被自动剔除,模拟执行器记录在 25 ms 内 REJECT actuated,对照 750 ms 预算。几何下钻说明该件上没有定位到任何异常:剔除仅依据纹理置信度,分区规则回退到其中心默认值。展示这段文字是刻意的。演示显示规则弃权,而非假装。在整个留出划分上,漂移期间注入的缺陷件仍被检出或升级,93 件中的 93 件,从未自动放行。

被自动剔除的真实缺陷 test-flip-264 的完整决策轨迹,模拟执行器日志显示在 25 ms 内 REJECT actuated,对照 750 ms 预算。
自动剔除轨迹:一个真实缺陷,由模拟适配器记录的执行。
对被自动剔除件的诚实下钻:未定位到异常,剔除仅依据纹理置信度。
产品中的披露:未定位到异常,仅依据纹理置信度。

凭据,以及解释

点击任一零件,审计抽屉显示其完整溯源记录:模型 id metalnut-defect-knn 版本 v7,数据集哈希 ae95b5b533c8,OOD 分数,物理信号,触发的规则,对照预算的时延,执行与 MES 日志,以及风险标签 high-risk:quality-gate(欧盟《AI 法案》附件 III,生效 2026-08-02)。Export Audit 将整班下载为 inspection_audit.jsonl;在留出划分上,已裁定件的审计完整度为 100%。运行 Drift Triage 时,诊断智能体为被扣留件提出根因,评审智能体在其获得 verified 徽章之前对照数值证据加以核验。

按件审计溯源 JSON,含模型 id 与版本、数据集哈希、OOD 分数、触发的关卡规则、时延,以及欧盟《AI 法案》附件 III 高风险标签。
按件溯源记录,设计为高风险符合性卷宗中可归档的证据。
Drift Triage 输出:诊断智能体的根因假设与建议动作,以及评审智能体的 verified 徽章。
Drift Triage:诊断智能体提出,评审智能体核验。仅供建议;关卡早已作出裁定。

数字,及其确切范围

所有度量均来自演示的基准脚本,基于 MVTec AD metal_nut 官方留出测试划分(220 张训练合格拟合图像;22 件合格与 93 件缺陷测试件),在相同图像上对比无包络的朴素基线与 Trust Gate。基线按漂移族误剔 95.5% 至 100% 的漂移合格件(平均 98.9%);关卡自动报废 0.0% 并扣留其中 100%。包络检测器在一个从未针对其调参的留出漂移族(欠曝光)上得到 AUROC 1.00。损坏为全强度,因此基线的坍缩在构造上近乎彻底:诚实的主张是方向——干净验证的模型一旦输入离开包络就会坍缩——而非精确百分比。这些是研究基准上的演示度量,从来不是开放世界保证。

朴素 AOI 流水线对比 Inspection Trust Gate

演示实时运行的同一对比,基于相同零件。

维度 朴素 AOI(无包络检查) Inspection Trust Gate
包络外输入 仍然采信模型裁决 不采信任何模型输出;零件被 HOLD 待复核
漂移合格件(眩光、失焦、热色偏) 每个漂移族误剔 95.5% 至 100% 0 件自动报废;100% 扣留(MVTec metal_nut 留出划分)
谁触发执行器 直接由模型裁决 模型无法覆盖的确定性关卡
时延问责 硬性 750 ms 冲程窗口预算,按件度量
审计轨迹 按件 JSONL 溯源记录,可按班次导出
当产线漂移时 报废堆积,直到有人注意到 升级队列外加咨询性 Drift Triage(诊断智能体、评审智能体)

本演示不做什么

  • ✓ 它不运行真实产线。通往 Allen-Bradley ControlLogix 剔除执行器的 EtherNet/IP 以及 MES 接收端,都是记录其本会执行动作的模拟适配器,相机是录制的图像流。工位 Line 3 与班次是脚本化的。
  • ✓ 它不主张开放世界保证。关卡 0.0% 误剔、1.00 包络 AUROC 以及 93/93 检出率,是在全强度合成损坏下、于 MVTec metal_nut 留出划分上的度量。
  • ✓ 它不展示真实工厂漂移。漂移是施加在真实 MVTec 照片上的如实图像损坏(眩光、失焦、热色偏):真实照片,合成漂移,并在应用中如此标注。
  • ✓ 它不推销缺陷模型。kNN 替身的存在是为了展示围绕它的那一层;生产中模型是你的,我们不主张比 AOI 厂商检出得更好。
  • ✓ 它不交付生产计量。几何分区规则是粗粒度替身,在 93 件留出缺陷中的 33 件上定位异常,并在 93 件中的 1 件上改变关卡结果;界面按件披露这一点。
  • ✓ 它不报告测得的节省。报废成本计数器是按每件 $2.42 的带标签投影,有来源的数量级,且本演示不存在客户、部署或案例研究。

买家真正会问的问题

为什么换班后我们的视觉系统会剔除合格件?

通常是因为输入发生了漂移,而不是模型变差了。车间顶灯眩光、冷模,以及热平衡到来之前换班后的前几件,会把图像移出模型通过验证的分布,而任何模型在已验证包络外的输入上都不可信。实验室 97% 的模型在冲压机上打出 14% 生产误剔率,就是那个典型例子。持久的修复是一道关卡:检出包络外输入,扣留那些件待复核,而不是执行动作。

我们必须替换现有的检测模型或 AOI 系统吗?

不必。Inspection Trust Gate 在固定接口之后包裹你的模型;演示中的缺陷检测器是 NVIDIA Metropolis、Cognex 或自定义引擎的刻意替身。产品是模型周围的那一层:包络检查、确定性关卡、升级队列和审计溯源。那一层在每一次模型升级中都持续创造价值,因为它防止的是输入失败,而非模型失败。

它快到足以用于真实冲压线吗?

关卡是带硬性时延预算的朴素代码:剔除裁定必须落在每分钟 40 次冲程的冲压机 750 ms 冲程窗口之内。在演示随附的审计日志中,裁定落在数十毫秒内,例如对照 750 ms 预算的 24.4 ms 和 37.7 ms,仪表盘报告实时 p99。这些是演示度量,不是生产保证,但预算按件强制执行。

欧盟《AI 法案》适用于 AI 质量检测吗,我们必须记录什么?

安全关键的质量决策落入该法案的高风险义务(附件 III),自 2026 年 8 月 2 日起全面适用,对最严重的、被禁止实践的违规,最高罚款 3,500 万欧元或全球营业额的 7%。演示写入按件溯源记录:模型 id 与版本、数据集哈希、OOD 分数、触发的规则、对照预算的时延、执行日志以及风险标签,可导出为 JSONL。该记录设计为高风险符合性卷宗中可归档的证据;它不是认证。

AI 或 LLM 能否触发剔除执行器?

不能。执行由确定性关卡裁定:拟合的置信度阈值和时延预算写在朴素代码中,任何模型输出和任何 LLM 都无法覆盖。智能体部分 Drift Triage 是诊断智能体加评审智能体,解释产线为何漂移;它们只作建议,从不执行。未配置 API 密钥时,分流降级为确定性回退,整个演示离线运行。

我们如何知道漂移检测器不只是针对演示调过参?

这就是我们做的独立性检查:包络检测器在一个从未针对其调参的留出漂移族(欠曝光)上得到 AUROC 1.00,度量于 MVTec metal_nut 留出划分。它在物理信号空间中对 220 张已知合格图像拟合,因此标记的是移动那些信号的采集漂移,而不仅是我们构造的漂移族。损坏为全强度,因此分离在构造上很鲜明;诚实的主张是方向,而非精确百分比。

这是真实产线还是演示?

一个证明该机制的可运行演示。通往 Allen-Bradley ControlLogix 剔除执行器的 EtherNet/IP 以及 MES 接收端,都是记录其本会执行动作的模拟适配器,相机是真实 MVTec AD metal_nut 照片的录制流;漂移是施加在真实合格照片上的如实图像损坏。包络检查、确定性关卡、升级队列和审计导出都是真实的,并完全按所示运行,每一个头条数字都度量于 MVTec metal_nut 留出测试划分。

技术研究

支撑本演示的研究——架构、验证设计,以及企业蓝图。

正在恢复或加固边缘检测部署?

模型与执行器之间的信任层,才是难点。我们来构建它。

如果你的团队正在应对每次换班后的误剔,或欧盟《AI 法案》的高风险义务对一条每分钟 40 次冲程作决策的产线意味着什么,我们真心希望听听你们的想法。这个问题是全行业的,答案也将如此。

包络评估

  • ✓ 标出产线输入离开模型已验证包络的位置
  • ✓ 在你的采集信号上拟合分布外检测器
  • ✓ 根据你自己的数据定义关卡阈值与 HOLD 策略
  • ✓ 明确符合性卷宗所需的溯源记录

构建信任层

  • ✓ 落在你冲程窗口预算内的确定性关卡
  • ✓ 产线上的包络监视与升级队列
  • ✓ 按件 JSONL 审计溯源,一键导出
  • ✓ 有界的漂移分诊智能体:只作建议,从不执行
社交媒体

同步发布于