La capa de confianza en tiempo de ejecución entre el modelo de visión y el actuador

Tu IA de inspección no tiene un problema de precisión. Tiene un problema de envolvente.

Un modelo de laboratorio al 97% puede alcanzar una tasa de falsos rechazos del 14% en producción, no porque el modelo empeorara, sino porque el deslumbramiento, los troqueles fríos y los cambios de turno sacaron las entradas de la distribución sobre la que se validó. El Inspection Trust Gate comprueba cada imagen frente a la envolvente validada del modelo, aplica puertas deterministas que el modelo no puede anular, retiene cualquier cosa fuera de la envolvente para revisión humana y escribe un registro de linaje de auditoría por pieza. Los agentes aconsejan, el código decide.

0

Piezas buenas con deriva desechadas automáticamente por la puerta

La línea base ingenua rechaza en falso del 95.5 al 100% (partición held-out de MVTec metal_nut)

93/93

Piezas defectuosas bajo deriva aún detectadas o escaladas

Nunca aprobadas automáticamente (la misma partición held-out)

1.00

AUROC de la envolvente en una familia de deriva held-out

Nunca ajustado contra ella, así que la comprobación no es circular (partición held-out de MVTec metal_nut)

Esta es una demostración ejecutable. El actuador PLC y el sumidero MES son adaptadores simulados que registran lo que harían, las imágenes de las piezas son fotografías reales de MVTec AD metal_nut, y la deriva es una corrupción honesta de imagen aplicada a fotos reales de piezas buenas.

Un modelo al 97% en el laboratorio. Una tasa de falsos rechazos del 14% en la prensa.

El modo de fallo que detiene las implementaciones de inspección en el borde es un fallo de entrada, no un fallo del modelo.

El caso canónico de nuestra investigación es una prensa de troquel progresivo de 200 toneladas que funciona a 40 golpes por minuto: un modelo de visión que alcanzó un 97% de precisión en validación se derrumba hasta una tasa de falsos rechazos del 14% en producción. El modelo no empeoró. El deslumbramiento de las luces cenitales de la nave varía con cada ángulo de golpe, el lubricante se acumula de forma distinta en troqueles calientes y fríos, y las primeras 50 piezas de un turno llegan antes del equilibrio térmico. Las entradas salieron de la distribución sobre la que se validó el modelo, y ningún modelo, con cualquier precisión, es de fiar ahí.

El patrón del sector dice que el modelo nunca fue el proyecto. Los sistemas AOI listos para usar rechazan en falso del 5 al 15% de las piezas buenas, mientras que los sistemas bien ajustados bajan del 2%: un problema de calibración y de datos, no de arquitectura del modelo. La integración es el 60% del cronograma de una implementación y el entrenamiento del modelo el 15%, y el 84% de los proyectos de integración de sistemas fracasan o fracasan parcialmente.

La regulación eleva la apuesta. Las obligaciones de alto riesgo de la Ley de IA de la UE, que cubren las decisiones de calidad críticas para la seguridad según el Anexo III, son plenamente aplicables a partir del 2 de agosto de 2026, con multas máximas de 35 millones de euros o el 7% de la facturación mundial por las infracciones más graves, de prácticas prohibidas. Un actuador de rechazo que dispara con el veredicto de un modelo no validado, sin registro de por qué, es exactamente lo que ese régimen está diseñado para exponer.

La solución no es un modelo mejor. Incluso un modelo perfecto solo es válido en entradas dentro de su envolvente validada. Lo que la línea necesita es una capa en tiempo de ejecución que conozca esa envolvente, se niegue a accionar fuera de ella y pueda demostrar, pieza a pieza, qué decidió y por qué.

Cómo funciona el Inspection Trust Gate

Una puerta determinista decide qué se acciona, no un modelo ni un LLM.

Cada pieza recorre el mismo pipeline:

imagen → características físicas + de textura → comprobación de envolvente (OOD) → veredicto de defecto → puerta determinista → accionar / retener → registro de auditoría

1. La envolvente validada

Un EnvelopeDetector calcula la distancia de Mahalanobis en el espacio de señales físicas (exposición, contraste, rango dinámico, foco, detalle de alta frecuencia, dominante de color térmica, saturación, fracción de deslumbramiento), ajustado sobre 220 imágenes train-good. Responde una sola pregunta: ¿está esta imagen dentro de las condiciones de captura sobre las que se validó el modelo? Fuera de la envolvente significa que no se confía en ninguna salida del modelo.

2. La puerta determinista

Código simple, fuera de cualquier LLM, que el modelo no puede anular: umbrales de confianza calibrados ajustados a partir de los propios datos de la demostración (auto-pass por debajo de 0.948, auto-reject por encima de 1.30) y un presupuesto duro de latencia de 750 ms de ventana de golpe. Cada pieza se enruta a AUTO_PASS, AUTO_REJECT o HOLD, que la envía a una cola de escalado humano.

3. El linaje de auditoría

Cada decisión escribe un registro JSONL: id de pieza, estación, id y versión del modelo, hash del conjunto de datos, confianza de defecto, puntuación OOD, señales físicas, las reglas de la puerta que se dispararon, latencia frente al presupuesto, registros de actuación y MES, y la etiqueta de riesgo high-risk:quality-gate (Anexo III de la Ley de IA de la UE, vig. 2026-08-02). Un clic exporta el turno.

El modelo de defectos no es, deliberadamente, el producto

El DefectDetector de la demostración es una distancia kNN a las piezas train-good en el espacio de textura (PatchCore-lite), que sustituye a su NVIDIA Metropolis, Cognex o modelo personalizado detrás de una interfaz fija. Es un sustituto real y funcional (AUROC 0.845 en piezas buenas limpias frente a defectuosas), informado con honestidad, y la reivindicación del producto nunca descansa en él. El valor duradero es la capa que lo rodea: el gating de deriva, la procedencia y la actuación gobernada se sostienen con cualquier precisión del modelo, de modo que la capa sobrevive a cada actualización del modelo.

Los agentes aconsejan, el código decide

Cuando las piezas se acumulan en la cola de HOLD, un par agéntico de Drift Triage explica por qué: un agente de diagnóstico lee las desviaciones de señales físicas ordenadas de las piezas retenidas y propone una hipótesis de causa raíz con una acción recomendada, y un agente crítico verifica esa hipótesis frente a la evidencia numérica, degradándola a investigación manual si la señal citada no es realmente la desviación dominante. Los agentes están construidos sobre Pydantic AI y el proveedor es intercambiable; sin una clave de API configurada, el triaje recurre a una plantilla determinista para que toda la demostración funcione sin conexión. En cualquier caso, los agentes solo aconsejan. La puerta ya ha decidido.

El cambio de turno, de punta a punta

Un turno guionizado en la estación Línea 3, reproducido sobre piezas de prueba held-out reales de MVTec AD metal_nut. Cada imagen de abajo es una captura de pantalla de la aplicación en ejecución.

Operación normal: las piezas limpias pasan en decenas de milisegundos

Antes de la deriva, las piezas buenas limpias se aprueban automáticamente con tiempo de sobra: el registro de auditoría entregado muestra la pieza test-good-288 a 37.7 ms y test-good-289 a 24.4 ms frente al presupuesto de ventana de golpe de 750 ms, cada una con un registro de linaje completo. El panel muestra el pipeline de decisión en vivo por pieza, con el tiempo de reloj de pared medido de cada etapa y la evidencia detrás de su salida.

El panel del Inspection Trust Gate durante la operación normal: una pieza limpia con un veredicto PASS, el pipeline de decisión en vivo mostrando milisegundos por etapa, y el monitor de envolvente en nominal.
Una pieza limpia aprobada automáticamente: veredicto PASS, tiempos por etapa, monitor de envolvente en nominal.

06:00, cambio de turno: las entradas salen de la envolvente

Entonces se dispara el marcador guionizado: SHIFT CHANGE 06:00, troqueles fríos, luces de nave encendidas. Llegan doce piezas buenas held-out corrompidas con deslumbramiento, desenfoque y dominante térmica (corrupción honesta de imagen aplicada a fotos reales de piezas buenas, etiquetada como tal en la aplicación). El monitor de envolvente se pone en rojo. La puerta retiene todas ellas para revisión humana en lugar de dejar que el actuador dispare con un veredicto que el modelo nunca fue validado para dar.

El momento de la deriva: banner SHIFT CHANGE 06:00, un veredicto HOLD que lee needs proof, un anillo de brecha fuera de distribución alrededor de la pieza, y una nota de que un AOI ingenuo lo habría rechazado.
El momento de la deriva: HOLD en lugar de un falso rechazo. La vía AOI ingenua habría desechado esta pieza buena.
La brecha de la envolvente explicada señal a señal: brillo a plus 7.6 sigma que contribuye el 87.1% de la distancia de Mahalanobis.
Por qué se disparó la envolvente: brillo a +7.6 sigma, el 87.1% de la distancia. Evidencia, no una bandera de caja negra.

El mismo turno, medido en ambas vías

El panel de comparación recorre las mismas piezas por la línea base ingenua sin envolvente y por el Trust Gate. La línea base rechaza en falso las piezas buenas con deriva; la puerta desecha automáticamente 0 y las retiene, llevando el KPI de falsos rechazos del 57.1% al 0% en este turno guionizado. Un panel de proyección extrapola la tasa de falsos rechazos ingenua medida a un turno completo (40 golpes por minuto durante 8 horas son 19,200 piezas) a $2.42 por pieza, un coste de desecho de orden de magnitud con fuente (caso de un fabricante de galletas: $94K de ahorro anual a partir de una reducción del 8.7% de merma por desecho). La cifra en dólares es siempre una proyección etiquetada, nunca un ahorro medido.

El panel de resultado: línea base ingenua 12 piezas buenas desechadas frente a Trust Gate 0, la cola de escalado de piezas retenidas, el KPI de falsos rechazos cayendo del 57.1% al 0%, y una proyección etiquetada de coste de desecho de unos $26.5k.
Ingenua 12 piezas buenas desechadas, puerta 0. Las piezas retenidas esperan en la cola de escalado; el contador en dólares es una proyección etiquetada.

Un defecto real se rechaza automáticamente, anotado con honestidad

El gating de deriva no valdría nada si los defectos se ocultaran bajo él. Un defecto estructural grosero real (clase flip de MVTec, pieza test-flip-264) se rechaza automáticamente, y el actuador simulado registra REJECT actuated in 25 ms frente al presupuesto de 750 ms. El desglose geométrico indica que no se localizó nada en esta pieza: el rechazo descansa solo en la confianza de textura, y la regla de zona recayó en su valor por defecto del centro. Mostrar ese texto es deliberado. La demostración muestra la regla absteniéndose en lugar de fingir. En toda la partición held-out, las piezas defectuosas inyectadas durante la deriva siguen detectándose o escalándose, 93 de 93, nunca aprobadas automáticamente.

El rastreo completo de decisión del defecto real rechazado automáticamente test-flip-264, con el registro del actuador simulado mostrando REJECT actuated in 25 ms frente al presupuesto de 750 ms.
El rastreo del rechazo automático: un defecto real, actuación registrada por el adaptador simulado.
El desglose de honestidad en la pieza rechazada automáticamente: ninguna anomalía localizada, el rechazo descansa solo en la confianza de textura.
La divulgación, en el producto: ninguna anomalía localizada, solo confianza de textura.

El comprobante, y la explicación

Haz clic en cualquier pieza y el cajón de auditoría muestra su registro de linaje completo: id de modelo metalnut-defect-knn versión v7, hash del conjunto de datos ae95b5b533c8, puntuación OOD, señales físicas, las reglas que se dispararon, latencia frente al presupuesto, los registros de actuación y MES, y la etiqueta de riesgo high-risk:quality-gate (Anexo III de la Ley de IA de la UE, vig. 2026-08-02). Export Audit descarga el turno como inspection_audit.jsonl; la completitud de la auditoría es el 100% de las piezas decididas en la partición held-out. Ejecuta Drift Triage y el agente de diagnóstico propone una causa raíz para las piezas retenidas mientras el agente crítico la verifica frente a la evidencia numérica antes de que gane una insignia verified.

El linaje de auditoría JSON por pieza con id y versión del modelo, hash del conjunto de datos, puntuación OOD, reglas de la puerta disparadas, latencia y la etiqueta de alto riesgo del Anexo III de la Ley de IA de la UE.
El registro de linaje por pieza, diseñado como evidencia archivable para un expediente de conformidad de alto riesgo.
Salida de Drift Triage: la hipótesis de causa raíz y la acción recomendada del agente de diagnóstico, con la insignia verified del agente crítico.
Drift Triage: un agente de diagnóstico propone, un agente crítico verifica. Solo consultivo; la puerta ya ha decidido.

Las cifras, con su alcance exacto

Todas las mediciones provienen del script de referencia de la demostración sobre la partición de prueba held-out oficial de MVTec AD metal_nut (220 imágenes train-good de ajuste; 22 piezas de prueba buenas y 93 defectuosas), comparando la línea base ingenua sin envolvente con el Trust Gate sobre las mismas imágenes. La línea base rechaza en falso del 95.5 al 100% de las piezas buenas con deriva por familia de deriva (promedio 98.9%); la puerta desecha automáticamente el 0.0% y retiene el 100% de ellas. El detector de envolvente puntúa AUROC 1.00 en una familia de deriva held-out (subexposición) contra la que nunca se ajustó. Las corrupciones son a plena intensidad, así que el colapso de la línea base es casi total por construcción: la reivindicación honesta es la dirección, un modelo validado en limpio se derrumba cuando las entradas salen de la envolvente, no el porcentaje exacto. Estas son mediciones de demostración sobre un banco de investigación, nunca garantías de mundo abierto.

Pipeline AOI ingenuo frente al Inspection Trust Gate

La misma comparación que la demostración ejecuta en vivo, sobre las mismas piezas.

Dimensión AOI ingenuo (sin comprobación de envolvente) Inspection Trust Gate
Entradas fuera de la envolvente El veredicto del modelo se acepta de todos modos No se confía en ninguna salida del modelo; pieza HELD para revisión
Piezas buenas con deriva (deslumbramiento, desenfoque, dominante térmica) 95.5 al 100% rechazadas en falso por familia de deriva 0 desechadas automáticamente; 100% retenidas (partición held-out de MVTec metal_nut)
Quién dispara el actuador El veredicto del modelo, directamente Una puerta determinista que el modelo no puede anular
Rendición de cuentas de latencia Ninguna Presupuesto duro de 750 ms de ventana de golpe, medido por pieza
Rastro de auditoría Ninguno Registro de linaje JSONL por pieza, exportable por turno
Cuando la línea deriva El desecho se acumula hasta que alguien se da cuenta Cola de escalado más Drift Triage consultivo (agente de diagnóstico, agente crítico)

Lo que esta demostración no hace

  • ✓ No ejecuta una línea en vivo. El EtherNet/IP hacia el actuador de rechazo Allen-Bradley ControlLogix y el sumidero MES son adaptadores simulados que registran lo que harían, y la cámara es un flujo de imágenes grabado. La estación Línea 3 y el turno están guionizados.
  • ✓ No reivindica garantías de mundo abierto. El 0.0% de falsos rechazos de la puerta, el AUROC 1.00 de la envolvente y la tasa de detección 93/93 son mediciones sobre la partición held-out de MVTec metal_nut bajo corrupciones sintéticas a plena intensidad.
  • ✓ No muestra deriva real de planta. La deriva es corrupción honesta de imagen (deslumbramiento, desenfoque, dominante térmica) aplicada a fotografías reales de MVTec: fotos reales, deriva sintética, etiquetada como tal en la aplicación.
  • ✓ No vende el modelo de defectos. El sustituto kNN existe para poder mostrar la capa que lo rodea; en producción el modelo es el tuyo, y no reivindicamos superar en detección a los proveedores de AOI.
  • ✓ No entrega metrología de producción. La regla de zona geométrica es un sustituto tosco que localiza una anomalía en 33 de 93 defectos held-out y cambia el resultado de la puerta en 1 de 93; la IU lo divulga por pieza.
  • ✓ No informa de ahorros medidos. El contador de coste de desecho es una proyección etiquetada a $2.42 por pieza, un orden de magnitud con fuente, y no existen clientes, implementaciones ni estudios de caso para esta demostración.

Preguntas que hacen los compradores

¿Por qué nuestro sistema de visión rechaza piezas buenas después de un cambio de turno?

Normalmente porque las entradas derivaron, no porque el modelo empeorara. El deslumbramiento de las luces de nave, los troqueles fríos y las primeras piezas de un turno antes del equilibrio térmico sacan las imágenes de la distribución sobre la que se validó el modelo, y ningún modelo es de fiar en entradas fuera de su envolvente validada. Un modelo de laboratorio al 97% que alcanza una tasa de falsos rechazos del 14% en producción en una prensa de estampado es el ejemplo canónico. La solución duradera es una puerta que detecta entradas fuera de la envolvente y retiene esas piezas para revisión en lugar de accionar.

¿Tenemos que sustituir nuestro modelo de inspección o sistema AOI existente?

No. El Inspection Trust Gate envuelve tu modelo detrás de una interfaz fija; en la demostración el detector de defectos es un sustituto deliberado de un motor NVIDIA Metropolis, Cognex o personalizado. El producto es la capa alrededor del modelo: la comprobación de envolvente, la puerta determinista, la cola de escalado y el linaje de auditoría. Esa capa sigue ganándose el sueldo con cada actualización del modelo, porque el fallo que evita es un fallo de entrada, no un fallo del modelo.

¿Es lo bastante rápido para una línea de estampado real?

La puerta es código simple con un presupuesto duro de latencia: la decisión de rechazo debe aterrizar dentro de la ventana de golpe de 750 ms de una prensa que funciona a 40 golpes por minuto. En el registro de auditoría entregado de la demostración, las decisiones aterrizan en decenas de milisegundos, por ejemplo 24.4 ms y 37.7 ms frente al presupuesto de 750 ms, y el panel informa el p99 en vivo. Estas son mediciones de demostración, no una garantía de producción, pero el presupuesto se aplica por pieza.

¿Se aplica la Ley de IA de la UE a la inspección de calidad con IA, y qué tenemos que registrar?

Las decisiones de calidad críticas para la seguridad caen bajo las obligaciones de alto riesgo de la Ley (Anexo III), plenamente aplicables a partir del 2 de agosto de 2026, con multas máximas de 35 millones de euros o el 7% de la facturación mundial por las infracciones más graves, de prácticas prohibidas. La demostración escribe un registro de linaje por pieza: id y versión del modelo, hash del conjunto de datos, puntuación OOD, las reglas que se dispararon, latencia frente al presupuesto, registro de actuación y la etiqueta de riesgo, exportable como JSONL. Ese registro está diseñado para ser evidencia archivable de un expediente de conformidad de alto riesgo; no es una certificación.

¿Puede la IA, o un LLM, disparar el actuador de rechazo?

No. La actuación la decide una puerta determinista: umbrales de confianza ajustados y un presupuesto de latencia en código simple que ninguna salida de modelo y ningún LLM pueden anular. La parte agéntica, Drift Triage, es un agente de diagnóstico más un agente crítico que explican por qué derivó la línea; aconsejan y nunca accionan. Sin una clave de API configurada, el triaje degrada a un respaldo determinista y toda la demostración funciona sin conexión.

¿Cómo sabemos que el detector de deriva no está simplemente ajustado a la demostración?

Esa es la comprobación de independencia que ejecutamos: el detector de envolvente puntuó AUROC 1.00 en una familia de deriva held-out (subexposición) contra la que nunca se ajustó, medido sobre la partición held-out de MVTec metal_nut. Se ajusta sobre 220 imágenes conocidas como buenas en el espacio de señales físicas, de modo que marca la deriva de captura que mueve esas señales, no solo las familias de deriva que construimos. Las corrupciones son a plena intensidad, así que la separación es nítida por construcción; la reivindicación honesta es la dirección, no el porcentaje exacto.

¿Es esto una línea en vivo o una demostración?

Una demostración ejecutable que prueba el mecanismo. El EtherNet/IP hacia el actuador de rechazo Allen-Bradley ControlLogix y el sumidero MES son adaptadores simulados que registran lo que harían, y la cámara es un flujo grabado de fotografías reales de MVTec AD metal_nut; la deriva es corrupción honesta de imagen aplicada a fotos reales de piezas buenas. La comprobación de envolvente, la puerta determinista, la cola de escalado y la exportación de auditoría son reales y se ejecutan exactamente como se muestra, y cada cifra destacada se mide sobre la partición de prueba held-out de MVTec metal_nut.

Investigación técnica

La investigación detrás de esta demostración: la arquitectura, el diseño de verificación y el modelo de referencia empresarial.

¿Recuperando o endureciendo una implementación de inspección en el borde?

La capa de confianza entre el modelo y el actuador es la parte difícil. La construimos.

Si tu equipo está lidiando con falsos rechazos después de cada cambio de turno, o con lo que las obligaciones de alto riesgo de la Ley de IA de la UE significan para una línea que decide a 40 golpes por minuto, nos encantaría de verdad escuchar cómo lo estáis planteando. El problema afecta a todo el sector y las respuestas también lo harán.

Evaluación de la envolvente

  • ✓ Mapear dónde las entradas de tu línea salen de la envolvente validada del modelo
  • ✓ Ajustar un detector fuera de distribución sobre tus señales de captura
  • ✓ Definir umbrales de puerta y política de HOLD a partir de tus propios datos
  • ✓ Especificar el registro de linaje que necesita tu expediente de conformidad

Construir la capa de confianza

  • ✓ Una puerta determinista dentro de tu presupuesto de ventana de golpe
  • ✓ Supervisión de la envolvente y una cola de escalado en la línea
  • ✓ Linaje de auditoría JSONL por pieza con exportación de un clic
  • ✓ Agentes acotados de triaje de deriva que aconsejan, nunca accionan
Redes sociales

También publicado en