A camada de confiança em tempo de execução entre o modelo de visão e o atuador
Um modelo de laboratório com 97% pode atingir uma taxa de falso rejeito de 14% em produção, não porque o modelo piorou, mas porque ofuscamento, matrizes frias e trocas de turno tiraram as entradas da distribuição em que ele foi validado. O Inspection Trust Gate verifica cada imagem em relação ao envelope validado do modelo, aplica portões determinísticos que o modelo não pode anular, retém qualquer coisa fora do envelope para revisão humana e grava um registro de linhagem de auditoria por peça. Agentes aconselham, o código decide.
0
Peças boas com deriva sucateadas automaticamente pelo portão
A linha de base ingênua rejeita falsamente 95.5 a 100% (split held-out MVTec metal_nut)
93/93
Peças defeituosas sob deriva ainda detectadas ou escalonadas
Nunca aprovadas automaticamente (mesmo split held-out)
1.00
AUROC do envelope em uma família de deriva held-out
Nunca ajustado contra ela, então a verificação não é circular (split held-out MVTec metal_nut)
Esta é uma demonstração executável. O atuador PLC e o destino MES são adaptadores simulados que registram o que fariam, as imagens das peças são fotografias reais MVTec AD metal_nut, e a deriva é corrupção honesta de imagem aplicada a fotos boas reais.
O modo de falha que trava implantações de inspeção de borda é uma falha de entrada, não uma falha de modelo.
O caso canônico da nossa pesquisa é uma prensa de estampagem progressiva de 200 toneladas rodando 40 golpes por minuto: um modelo de visão que atingiu 97% de acurácia na validação colapsa para uma taxa de falso rejeito de 14% em produção. O modelo não piorou. O ofuscamento das luzes do pavilhão varia por ângulo de golpe, o lubrificante se acumula de forma diferente em matrizes quentes e frias, e as primeiras 50 peças de um turno chegam antes do equilíbrio térmico. As entradas saíram da distribuição em que o modelo foi validado, e nenhum modelo, em qualquer acurácia, é confiável ali.
O padrão da indústria diz que o modelo nunca foi o projeto. Sistemas AOI prontos rejeitam falsamente 5 a 15% das peças boas, enquanto sistemas bem calibrados ficam abaixo de 2%: um problema de calibração e dados, não de arquitetura de modelo. A integração é 60% do cronograma de uma implantação e o treinamento do modelo 15%, e 84% dos projetos de integração de sistemas falham ou falham parcialmente.
A regulação eleva as apostas. As obrigações de alto risco da Lei de IA da UE, que cobrem decisões de qualidade críticas para a segurança no Anexo III, são plenamente aplicáveis a partir de 2 de agosto de 2026, com multas máximas de 35 milhões de euros ou 7% do faturamento global para as violações mais graves, de práticas proibidas. Um atuador de rejeição que dispara com um veredito de modelo não validado, sem registro do porquê, é exatamente o que esse regime foi desenhado para expor.
A correção não é um modelo melhor. Mesmo um modelo perfeito só é válido em entradas dentro do seu envelope validado. O que a linha precisa é uma camada em tempo de execução que conheça esse envelope, recuse atuar fora dele e possa provar, peça a peça, o que decidiu e por quê.
Um portão determinístico decide o que atua, não um modelo e não um LLM.
Cada peça percorre o mesmo pipeline:
imagem → atributos físicos + de textura → verificação de envelope (OOD) → veredito de defeito → portão determinístico → atuar / reter → registro de auditoria
Um EnvelopeDetector calcula a distância de Mahalanobis no espaço de sinais físicos (exposição, contraste, faixa dinâmica, foco, detalhe de alta frequência, desvio cromático térmico, saturação, fração de ofuscamento), ajustado em 220 imagens train-good. Ele responde a uma pergunta: esta imagem está dentro das condições de captura em que o modelo foi validado? Fora do envelope significa que nenhuma saída do modelo é confiável.
Código simples, fora de qualquer LLM, que o modelo não pode anular: limiares de confiança calibrados ajustados a partir dos próprios dados da demonstração (aprovação automática abaixo de 0.948, rejeição automática acima de 1.30) e um orçamento rígido de latência de 750 ms na janela do golpe. Cada peça segue para AUTO_PASS, AUTO_REJECT ou HOLD, que a envia a uma fila de escalonamento humano.
Cada decisão grava um registro JSONL: id da peça, estação, id e versão do modelo, hash do dataset, confiança de defeito, escore OOD, sinais físicos, as regras do portão que dispararam, latência contra o orçamento, logs de atuação e MES, e a etiqueta de risco high-risk:quality-gate (Lei de IA da UE Anexo III, vig. 2026-08-02). Um clique exporta o turno.
O DefectDetector da demonstração é uma distância kNN até peças train-good no espaço de textura (PatchCore-lite), no lugar do seu NVIDIA Metropolis, Cognex ou modelo customizado por trás de uma interface fixa. É um substituto real e funcional (AUROC 0.845 em peças boas limpas versus defeito), reportado com honestidade, e a alegação do produto nunca se apoia nele. O valor durável é a camada ao redor: portão por deriva, proveniência e atuação governada se sustentam em qualquer acurácia de modelo, então a camada sobrevive a cada upgrade do modelo.
Quando as peças se acumulam na fila HOLD, um par agêntico de Drift Triage explica o porquê: um agente de diagnóstico lê os desvios ranqueados de sinais físicos das peças retidas e propõe uma hipótese de causa raiz com uma ação recomendada, e um agente crítico verifica essa hipótese contra a evidência numérica, rebaixando-a a investigação manual se o sinal citado não for de fato o desvio dominante. Os agentes são construídos sobre Pydantic AI e o provedor é intercambiável; sem chave de API configurada, a triagem recorre a um template determinístico para que a demonstração inteira rode offline. De qualquer forma, os agentes apenas aconselham. O portão já decidiu.
Um turno roteirizado na estação Line 3, reproduzido sobre peças de teste held-out reais do MVTec AD metal_nut. Cada imagem abaixo é uma captura de tela do aplicativo em execução.
Antes da deriva, peças boas limpas recebem aprovação automática com folga: o log de auditoria incluso na demonstração mostra a peça test-good-288 em 37.7 ms e test-good-289 em 24.4 ms contra o orçamento de 750 ms da janela do golpe, cada uma com um registro de linhagem completo. O painel mostra o pipeline de decisão ao vivo por peça, com o wall-clock medido de cada estágio e a evidência por trás da sua saída.
Então o marcador roteirizado dispara: SHIFT CHANGE 06:00, matrizes frias, luzes do pavilhão acesas. Doze peças boas held-out chegam corrompidas com ofuscamento, desfoque e desvio cromático térmico (corrupção honesta de imagem aplicada a fotos boas reais, rotulada como tal no aplicativo). O monitor de envelope fica vermelho. O portão retém cada uma delas para revisão humana em vez de deixar o atuador disparar com um veredito que o modelo nunca foi validado para dar.
O painel de comparação passa as peças idênticas pela linha de base ingênua sem envelope e pelo Trust Gate. A linha de base rejeita falsamente as peças boas com deriva; o portão sucateia automaticamente 0 e as retém, levando o KPI de falso rejeito de 57.1% para 0% neste turno roteirizado. Um painel de projeção extrapola a taxa de falso rejeito ingênua medida para um turno completo (40 golpes por minuto ao longo de 8 horas são 19,200 peças) a $2.42 por peça, um custo de sucata de ordem de grandeza com fonte (caso de fabricante de biscoitos: $94K de economia anual a partir de uma redução de 8.7% no desperdício de sucata). A cifra em dólares é sempre uma projeção rotulada, nunca uma economia medida.
O portão por deriva não valeria nada se defeitos se escondessem sob ele. Um defeito estrutural grosseiro real (classe flip do MVTec, peça test-flip-264) é rejeitado automaticamente, e o atuador simulado registra REJECT actuated em 25 ms contra o orçamento de 750 ms. O detalhamento de geometria declara que nada foi localizado nesta peça: a rejeição se apoia só na confiança de textura, e a regra de zona recuou para o padrão de centro. Mostrar esse texto é deliberado. A demonstração exibe a regra se abstendo em vez de fingir. Em todo o split held-out, peças defeituosas injetadas durante a deriva ainda são detectadas ou escalonadas, 93 de 93, nunca aprovadas automaticamente.
Clique em qualquer peça e a gaveta de auditoria mostra o registro de linhagem completo: model id metalnut-defect-knn version v7, hash do dataset ae95b5b533c8, escore OOD, sinais físicos, as regras que dispararam, latência contra o orçamento, os logs de atuação e MES, e a etiqueta de risco high-risk:quality-gate (Lei de IA da UE Anexo III, vig. 2026-08-02). Export Audit baixa o turno como inspection_audit.jsonl; a completude da auditoria é 100% das peças decididas no split held-out. Execute Drift Triage e o agente de diagnóstico propõe uma causa raiz para as peças retidas enquanto o agente crítico a verifica contra a evidência numérica antes de ganhar um selo verificado.
Todas as medições vêm do script de benchmark da demonstração no split oficial de teste held-out do MVTec AD metal_nut (220 imagens train-good de ajuste; 22 peças de teste boas e 93 defeituosas), comparando a linha de base ingênua sem envelope com o Trust Gate nas mesmas imagens. A linha de base rejeita falsamente 95.5 a 100% das peças boas com deriva por família de deriva (média 98.9%); o portão sucateia automaticamente 0.0% e retém 100% delas. O detector de envelope marca AUROC 1.00 em uma família de deriva held-out (subexposição) contra a qual nunca foi ajustado. As corrupções são em força total, então o colapso da linha de base é quase total por construção: a alegação honesta é a direção, um modelo validado em condições limpas colapsa quando as entradas saem do envelope, não o percentual exato. Estas são medições de demonstração em um benchmark de pesquisa, nunca garantias em mundo aberto.
A mesma comparação que a demonstração executa ao vivo, nas mesmas peças.
| Dimensão | AOI ingênuo (sem verificação de envelope) | Inspection Trust Gate |
|---|---|---|
| Entradas fora do envelope | Veredito do modelo confiado mesmo assim | Nenhuma saída do modelo é confiável; peça em HOLD para revisão |
| Peças boas com deriva (ofuscamento, desfoque, desvio cromático térmico) | 95.5 a 100% rejeitadas falsamente por família de deriva | 0 sucateadas automaticamente; 100% retidas (split held-out MVTec metal_nut) |
| Quem dispara o atuador | O veredito do modelo, diretamente | Um portão determinístico que o modelo não pode anular |
| Prestação de contas de latência | Nenhuma | Orçamento rígido de 750 ms na janela do golpe, medido por peça |
| Trilha de auditoria | Nenhuma | Registro de linhagem JSONL por peça, exportável por turno |
| Quando a linha deriva | A sucata se acumula até alguém perceber | Fila de escalonamento mais Drift Triage consultivo (agente de diagnóstico, agente crítico) |
Em geral porque as entradas derivaram, não porque o modelo piorou. Ofuscamento das luzes do pavilhão, matrizes frias e as primeiras peças de um turno antes do equilíbrio térmico tiram as imagens da distribuição em que o modelo foi validado, e nenhum modelo é confiável em entradas fora do seu envelope validado. Um modelo de laboratório com 97% atingindo uma taxa de falso rejeito de 14% em produção em uma prensa de estampagem é o exemplo canônico. A correção durável é um portão que detecta entradas fora do envelope e retém essas peças para revisão em vez de atuar.
Não. O Inspection Trust Gate envolve o seu modelo por trás de uma interface fixa; na demonstração o detector de defeito é um substituto deliberado de um NVIDIA Metropolis, Cognex ou motor customizado. O produto é a camada ao redor do modelo: a verificação de envelope, o portão determinístico, a fila de escalonamento e a linhagem de auditoria. Essa camada continua valendo a pena a cada upgrade do modelo, porque a falha que ela impede é uma falha de entrada, não uma falha de modelo.
O portão é código simples com um orçamento rígido de latência: a decisão de rejeição precisa cair dentro da janela de golpe de 750 ms de uma prensa a 40 golpes por minuto. No log de auditoria incluso na demonstração, as decisões caem em dezenas de milissegundos, por exemplo 24.4 ms e 37.7 ms contra o orçamento de 750 ms, e o painel reporta o p99 ao vivo. Estas são medições de demonstração, não uma garantia de produção, mas o orçamento é imposto por peça.
Decisões de qualidade críticas para a segurança caem sob as obrigações de alto risco da Lei (Anexo III), plenamente aplicáveis a partir de 2 de agosto de 2026, com multas máximas de 35 milhões de euros ou 7% do faturamento global para as violações mais graves, de práticas proibidas. A demonstração grava um registro de linhagem por peça: id e versão do modelo, hash do dataset, escore OOD, as regras que dispararam, latência contra o orçamento, log de atuação e a etiqueta de risco, exportável como JSONL. Esse registro é desenhado para ser evidência arquivável de um dossiê de conformidade de alto risco; não é uma certificação.
Não. A atuação é decidida por um portão determinístico: limiares de confiança ajustados e um orçamento de latência em código simples que nenhuma saída de modelo e nenhum LLM pode anular. A parte agêntica, Drift Triage, é um agente de diagnóstico mais um agente crítico que explicam por que a linha derivou; eles aconselham e nunca atuam. Sem chave de API configurada, a triagem degrada para um fallback determinístico e a demonstração inteira roda offline.
Essa é a verificação de independência que rodamos: o detector de envelope marcou AUROC 1.00 em uma família de deriva held-out (subexposição) contra a qual nunca foi ajustado, medido no split held-out MVTec metal_nut. Ele é ajustado em 220 imagens conhecidas como boas no espaço de sinais físicos, então sinaliza deriva de captura que move esses sinais, não só as famílias de deriva que construímos. As corrupções são em força total, então a separação é nítida por construção; a alegação honesta é a direção, não o percentual exato.
Uma demonstração executável que prova o mecanismo. O EtherNet/IP para o atuador de rejeição Allen-Bradley ControlLogix e o destino MES são adaptadores simulados que registram o que fariam, e a câmera é um fluxo gravado de fotografias reais MVTec AD metal_nut; a deriva é corrupção honesta de imagem aplicada a fotos boas reais. A verificação de envelope, o portão determinístico, a fila de escalonamento e a exportação de auditoria são reais e rodam exatamente como mostrado, e cada número de destaque é medido no split de teste held-out MVTec metal_nut.
A pesquisa por trás desta demonstração — a arquitetura, o desenho de verificação e o blueprint empresarial.
A camada de confiança entre o modelo e o atuador é a parte difícil. Nós a construímos.
Se a sua equipe está lutando com falsos rejeitos depois de cada troca de turno, ou com o que as obrigações de alto risco da Lei de IA da UE significam para uma linha que decide a 40 golpes por minuto, gostaríamos de verdade de ouvir como vocês estão pensando nisso. O problema é de toda a indústria e as respostas também serão.