La capa de confianza en tiempo de ejecución entre el modelo de visión y el actuador
Un modelo de laboratorio al 97% puede alcanzar una tasa de falsos rechazos del 14% en producción, no porque el modelo empeorara, sino porque el deslumbramiento, los troqueles fríos y los cambios de turno sacaron las entradas de la distribución sobre la que se validó. El Inspection Trust Gate comprueba cada imagen frente a la envolvente validada del modelo, aplica puertas deterministas que el modelo no puede anular, retiene cualquier cosa fuera de la envolvente para revisión humana y escribe un registro de linaje de auditoría por pieza. Los agentes aconsejan, el código decide.
0
Piezas buenas con deriva desechadas automáticamente por la puerta
La línea base ingenua rechaza en falso del 95.5 al 100% (partición held-out de MVTec metal_nut)
93/93
Piezas defectuosas bajo deriva aún detectadas o escaladas
Nunca aprobadas automáticamente (la misma partición held-out)
1.00
AUROC de la envolvente en una familia de deriva held-out
Nunca ajustado contra ella, así que la comprobación no es circular (partición held-out de MVTec metal_nut)
Esta es una demostración ejecutable. El actuador PLC y el sumidero MES son adaptadores simulados que registran lo que harían, las imágenes de las piezas son fotografías reales de MVTec AD metal_nut, y la deriva es una corrupción honesta de imagen aplicada a fotos reales de piezas buenas.
El modo de fallo que detiene las implementaciones de inspección en el borde es un fallo de entrada, no un fallo del modelo.
El caso canónico de nuestra investigación es una prensa de troquel progresivo de 200 toneladas que funciona a 40 golpes por minuto: un modelo de visión que alcanzó un 97% de precisión en validación se derrumba hasta una tasa de falsos rechazos del 14% en producción. El modelo no empeoró. El deslumbramiento de las luces cenitales de la nave varía con cada ángulo de golpe, el lubricante se acumula de forma distinta en troqueles calientes y fríos, y las primeras 50 piezas de un turno llegan antes del equilibrio térmico. Las entradas salieron de la distribución sobre la que se validó el modelo, y ningún modelo, con cualquier precisión, es de fiar ahí.
El patrón del sector dice que el modelo nunca fue el proyecto. Los sistemas AOI listos para usar rechazan en falso del 5 al 15% de las piezas buenas, mientras que los sistemas bien ajustados bajan del 2%: un problema de calibración y de datos, no de arquitectura del modelo. La integración es el 60% del cronograma de una implementación y el entrenamiento del modelo el 15%, y el 84% de los proyectos de integración de sistemas fracasan o fracasan parcialmente.
La regulación eleva la apuesta. Las obligaciones de alto riesgo de la Ley de IA de la UE, que cubren las decisiones de calidad críticas para la seguridad según el Anexo III, son plenamente aplicables a partir del 2 de agosto de 2026, con multas máximas de 35 millones de euros o el 7% de la facturación mundial por las infracciones más graves, de prácticas prohibidas. Un actuador de rechazo que dispara con el veredicto de un modelo no validado, sin registro de por qué, es exactamente lo que ese régimen está diseñado para exponer.
La solución no es un modelo mejor. Incluso un modelo perfecto solo es válido en entradas dentro de su envolvente validada. Lo que la línea necesita es una capa en tiempo de ejecución que conozca esa envolvente, se niegue a accionar fuera de ella y pueda demostrar, pieza a pieza, qué decidió y por qué.
Una puerta determinista decide qué se acciona, no un modelo ni un LLM.
Cada pieza recorre el mismo pipeline:
imagen → características físicas + de textura → comprobación de envolvente (OOD) → veredicto de defecto → puerta determinista → accionar / retener → registro de auditoría
Un EnvelopeDetector calcula la distancia de Mahalanobis en el espacio de señales físicas (exposición, contraste, rango dinámico, foco, detalle de alta frecuencia, dominante de color térmica, saturación, fracción de deslumbramiento), ajustado sobre 220 imágenes train-good. Responde una sola pregunta: ¿está esta imagen dentro de las condiciones de captura sobre las que se validó el modelo? Fuera de la envolvente significa que no se confía en ninguna salida del modelo.
Código simple, fuera de cualquier LLM, que el modelo no puede anular: umbrales de confianza calibrados ajustados a partir de los propios datos de la demostración (auto-pass por debajo de 0.948, auto-reject por encima de 1.30) y un presupuesto duro de latencia de 750 ms de ventana de golpe. Cada pieza se enruta a AUTO_PASS, AUTO_REJECT o HOLD, que la envía a una cola de escalado humano.
Cada decisión escribe un registro JSONL: id de pieza, estación, id y versión del modelo, hash del conjunto de datos, confianza de defecto, puntuación OOD, señales físicas, las reglas de la puerta que se dispararon, latencia frente al presupuesto, registros de actuación y MES, y la etiqueta de riesgo high-risk:quality-gate (Anexo III de la Ley de IA de la UE, vig. 2026-08-02). Un clic exporta el turno.
El DefectDetector de la demostración es una distancia kNN a las piezas train-good en el espacio de textura (PatchCore-lite), que sustituye a su NVIDIA Metropolis, Cognex o modelo personalizado detrás de una interfaz fija. Es un sustituto real y funcional (AUROC 0.845 en piezas buenas limpias frente a defectuosas), informado con honestidad, y la reivindicación del producto nunca descansa en él. El valor duradero es la capa que lo rodea: el gating de deriva, la procedencia y la actuación gobernada se sostienen con cualquier precisión del modelo, de modo que la capa sobrevive a cada actualización del modelo.
Cuando las piezas se acumulan en la cola de HOLD, un par agéntico de Drift Triage explica por qué: un agente de diagnóstico lee las desviaciones de señales físicas ordenadas de las piezas retenidas y propone una hipótesis de causa raíz con una acción recomendada, y un agente crítico verifica esa hipótesis frente a la evidencia numérica, degradándola a investigación manual si la señal citada no es realmente la desviación dominante. Los agentes están construidos sobre Pydantic AI y el proveedor es intercambiable; sin una clave de API configurada, el triaje recurre a una plantilla determinista para que toda la demostración funcione sin conexión. En cualquier caso, los agentes solo aconsejan. La puerta ya ha decidido.
Un turno guionizado en la estación Línea 3, reproducido sobre piezas de prueba held-out reales de MVTec AD metal_nut. Cada imagen de abajo es una captura de pantalla de la aplicación en ejecución.
Antes de la deriva, las piezas buenas limpias se aprueban automáticamente con tiempo de sobra: el registro de auditoría entregado muestra la pieza test-good-288 a 37.7 ms y test-good-289 a 24.4 ms frente al presupuesto de ventana de golpe de 750 ms, cada una con un registro de linaje completo. El panel muestra el pipeline de decisión en vivo por pieza, con el tiempo de reloj de pared medido de cada etapa y la evidencia detrás de su salida.
Entonces se dispara el marcador guionizado: SHIFT CHANGE 06:00, troqueles fríos, luces de nave encendidas. Llegan doce piezas buenas held-out corrompidas con deslumbramiento, desenfoque y dominante térmica (corrupción honesta de imagen aplicada a fotos reales de piezas buenas, etiquetada como tal en la aplicación). El monitor de envolvente se pone en rojo. La puerta retiene todas ellas para revisión humana en lugar de dejar que el actuador dispare con un veredicto que el modelo nunca fue validado para dar.
El panel de comparación recorre las mismas piezas por la línea base ingenua sin envolvente y por el Trust Gate. La línea base rechaza en falso las piezas buenas con deriva; la puerta desecha automáticamente 0 y las retiene, llevando el KPI de falsos rechazos del 57.1% al 0% en este turno guionizado. Un panel de proyección extrapola la tasa de falsos rechazos ingenua medida a un turno completo (40 golpes por minuto durante 8 horas son 19,200 piezas) a $2.42 por pieza, un coste de desecho de orden de magnitud con fuente (caso de un fabricante de galletas: $94K de ahorro anual a partir de una reducción del 8.7% de merma por desecho). La cifra en dólares es siempre una proyección etiquetada, nunca un ahorro medido.
El gating de deriva no valdría nada si los defectos se ocultaran bajo él. Un defecto estructural grosero real (clase flip de MVTec, pieza test-flip-264) se rechaza automáticamente, y el actuador simulado registra REJECT actuated in 25 ms frente al presupuesto de 750 ms. El desglose geométrico indica que no se localizó nada en esta pieza: el rechazo descansa solo en la confianza de textura, y la regla de zona recayó en su valor por defecto del centro. Mostrar ese texto es deliberado. La demostración muestra la regla absteniéndose en lugar de fingir. En toda la partición held-out, las piezas defectuosas inyectadas durante la deriva siguen detectándose o escalándose, 93 de 93, nunca aprobadas automáticamente.
Haz clic en cualquier pieza y el cajón de auditoría muestra su registro de linaje completo: id de modelo metalnut-defect-knn versión v7, hash del conjunto de datos ae95b5b533c8, puntuación OOD, señales físicas, las reglas que se dispararon, latencia frente al presupuesto, los registros de actuación y MES, y la etiqueta de riesgo high-risk:quality-gate (Anexo III de la Ley de IA de la UE, vig. 2026-08-02). Export Audit descarga el turno como inspection_audit.jsonl; la completitud de la auditoría es el 100% de las piezas decididas en la partición held-out. Ejecuta Drift Triage y el agente de diagnóstico propone una causa raíz para las piezas retenidas mientras el agente crítico la verifica frente a la evidencia numérica antes de que gane una insignia verified.
Todas las mediciones provienen del script de referencia de la demostración sobre la partición de prueba held-out oficial de MVTec AD metal_nut (220 imágenes train-good de ajuste; 22 piezas de prueba buenas y 93 defectuosas), comparando la línea base ingenua sin envolvente con el Trust Gate sobre las mismas imágenes. La línea base rechaza en falso del 95.5 al 100% de las piezas buenas con deriva por familia de deriva (promedio 98.9%); la puerta desecha automáticamente el 0.0% y retiene el 100% de ellas. El detector de envolvente puntúa AUROC 1.00 en una familia de deriva held-out (subexposición) contra la que nunca se ajustó. Las corrupciones son a plena intensidad, así que el colapso de la línea base es casi total por construcción: la reivindicación honesta es la dirección, un modelo validado en limpio se derrumba cuando las entradas salen de la envolvente, no el porcentaje exacto. Estas son mediciones de demostración sobre un banco de investigación, nunca garantías de mundo abierto.
La misma comparación que la demostración ejecuta en vivo, sobre las mismas piezas.
| Dimensión | AOI ingenuo (sin comprobación de envolvente) | Inspection Trust Gate |
|---|---|---|
| Entradas fuera de la envolvente | El veredicto del modelo se acepta de todos modos | No se confía en ninguna salida del modelo; pieza HELD para revisión |
| Piezas buenas con deriva (deslumbramiento, desenfoque, dominante térmica) | 95.5 al 100% rechazadas en falso por familia de deriva | 0 desechadas automáticamente; 100% retenidas (partición held-out de MVTec metal_nut) |
| Quién dispara el actuador | El veredicto del modelo, directamente | Una puerta determinista que el modelo no puede anular |
| Rendición de cuentas de latencia | Ninguna | Presupuesto duro de 750 ms de ventana de golpe, medido por pieza |
| Rastro de auditoría | Ninguno | Registro de linaje JSONL por pieza, exportable por turno |
| Cuando la línea deriva | El desecho se acumula hasta que alguien se da cuenta | Cola de escalado más Drift Triage consultivo (agente de diagnóstico, agente crítico) |
Normalmente porque las entradas derivaron, no porque el modelo empeorara. El deslumbramiento de las luces de nave, los troqueles fríos y las primeras piezas de un turno antes del equilibrio térmico sacan las imágenes de la distribución sobre la que se validó el modelo, y ningún modelo es de fiar en entradas fuera de su envolvente validada. Un modelo de laboratorio al 97% que alcanza una tasa de falsos rechazos del 14% en producción en una prensa de estampado es el ejemplo canónico. La solución duradera es una puerta que detecta entradas fuera de la envolvente y retiene esas piezas para revisión en lugar de accionar.
No. El Inspection Trust Gate envuelve tu modelo detrás de una interfaz fija; en la demostración el detector de defectos es un sustituto deliberado de un motor NVIDIA Metropolis, Cognex o personalizado. El producto es la capa alrededor del modelo: la comprobación de envolvente, la puerta determinista, la cola de escalado y el linaje de auditoría. Esa capa sigue ganándose el sueldo con cada actualización del modelo, porque el fallo que evita es un fallo de entrada, no un fallo del modelo.
La puerta es código simple con un presupuesto duro de latencia: la decisión de rechazo debe aterrizar dentro de la ventana de golpe de 750 ms de una prensa que funciona a 40 golpes por minuto. En el registro de auditoría entregado de la demostración, las decisiones aterrizan en decenas de milisegundos, por ejemplo 24.4 ms y 37.7 ms frente al presupuesto de 750 ms, y el panel informa el p99 en vivo. Estas son mediciones de demostración, no una garantía de producción, pero el presupuesto se aplica por pieza.
Las decisiones de calidad críticas para la seguridad caen bajo las obligaciones de alto riesgo de la Ley (Anexo III), plenamente aplicables a partir del 2 de agosto de 2026, con multas máximas de 35 millones de euros o el 7% de la facturación mundial por las infracciones más graves, de prácticas prohibidas. La demostración escribe un registro de linaje por pieza: id y versión del modelo, hash del conjunto de datos, puntuación OOD, las reglas que se dispararon, latencia frente al presupuesto, registro de actuación y la etiqueta de riesgo, exportable como JSONL. Ese registro está diseñado para ser evidencia archivable de un expediente de conformidad de alto riesgo; no es una certificación.
No. La actuación la decide una puerta determinista: umbrales de confianza ajustados y un presupuesto de latencia en código simple que ninguna salida de modelo y ningún LLM pueden anular. La parte agéntica, Drift Triage, es un agente de diagnóstico más un agente crítico que explican por qué derivó la línea; aconsejan y nunca accionan. Sin una clave de API configurada, el triaje degrada a un respaldo determinista y toda la demostración funciona sin conexión.
Esa es la comprobación de independencia que ejecutamos: el detector de envolvente puntuó AUROC 1.00 en una familia de deriva held-out (subexposición) contra la que nunca se ajustó, medido sobre la partición held-out de MVTec metal_nut. Se ajusta sobre 220 imágenes conocidas como buenas en el espacio de señales físicas, de modo que marca la deriva de captura que mueve esas señales, no solo las familias de deriva que construimos. Las corrupciones son a plena intensidad, así que la separación es nítida por construcción; la reivindicación honesta es la dirección, no el porcentaje exacto.
Una demostración ejecutable que prueba el mecanismo. El EtherNet/IP hacia el actuador de rechazo Allen-Bradley ControlLogix y el sumidero MES son adaptadores simulados que registran lo que harían, y la cámara es un flujo grabado de fotografías reales de MVTec AD metal_nut; la deriva es corrupción honesta de imagen aplicada a fotos reales de piezas buenas. La comprobación de envolvente, la puerta determinista, la cola de escalado y la exportación de auditoría son reales y se ejecutan exactamente como se muestra, y cada cifra destacada se mide sobre la partición de prueba held-out de MVTec metal_nut.
La investigación detrás de esta demostración: la arquitectura, el diseño de verificación y el modelo de referencia empresarial.
La capa de confianza entre el modelo y el actuador es la parte difícil. La construimos.
Si tu equipo está lidiando con falsos rechazos después de cada cambio de turno, o con lo que las obligaciones de alto riesgo de la Ley de IA de la UE significan para una línea que decide a 40 golpes por minuto, nos encantaría de verdad escuchar cómo lo estáis planteando. El problema afecta a todo el sector y las respuestas también lo harán.