La couche de confiance d'exécution entre le modèle de vision et l'actionneur

Votre IA d'inspection n'a pas un problème de précision. Elle a un problème d'enveloppe.

Un modèle à 97 % en laboratoire peut atteindre un taux de faux rejets de 14 % en production, non pas parce que le modèle s'est dégradé, mais parce que les reflets, les matrices froides et les changements de poste ont fait sortir les entrées de la distribution sur laquelle il avait été validé. L'Inspection Trust Gate vérifie chaque image par rapport à l'enveloppe validée du modèle, applique des portes déterministes que le modèle ne peut pas outrepasser, met en attente tout ce qui est hors enveloppe pour une revue humaine, et écrit un enregistrement de lignée d'audit par pièce. Les agents conseillent, le code décide.

0

Bonnes pièces dérivées mises au rebut automatiquement par la porte

La référence naïve rejette à tort 95.5 à 100 % (split réservé MVTec metal_nut)

93/93

Pièces défectueuses sous dérive toujours détectées ou escaladées

Jamais validées automatiquement (même split réservé)

1.00

AUROC de l'enveloppe sur une famille de dérive réservée

Jamais ajusté contre elle, donc le contrôle n'est pas circulaire (split réservé MVTec metal_nut)

Ceci est une démo exécutable. L'actionneur PLC et le puits MES sont des adaptateurs simulés qui consignent ce qu'ils feraient, les images de pièces sont de vraies photographies MVTec AD metal_nut, et la dérive est une corruption d'image honnête appliquée à de vraies photos de bonnes pièces.

Un modèle à 97 % en laboratoire. Un taux de faux rejets de 14 % sur la presse.

Le mode de défaillance qui bloque les déploiements d'inspection en edge est une défaillance d'entrée, pas une défaillance de modèle.

Le cas canonique de notre recherche est une presse à emboutissage progressif de 200 tonnes tournant à 40 coups par minute : un modèle de vision qui a atteint 97 % de précision en validation s'effondre à un taux de faux rejets de 14 % en production. Le modèle ne s'est pas dégradé. Les reflets des plafonniers d'atelier varient selon l'angle de frappe, le lubrifiant s'accumule différemment sur des matrices chaudes et froides, et les 50 premières pièces d'un poste arrivent avant l'équilibre thermique. Les entrées ont quitté la distribution sur laquelle le modèle avait été validé, et aucun modèle, à quelque précision que ce soit, n'est digne de confiance là-bas.

Le schéma industriel dit que le modèle n'a jamais été le projet. Les systèmes AOI sortis de boîte rejettent à tort 5 à 15 % des bonnes pièces, tandis que les systèmes bien calibrés descendent sous 2 % : un problème de calibration et de données, pas un problème d'architecture de modèle. L'intégration représente 60 % du calendrier d'un déploiement et l'entraînement du modèle 15 %, et 84 % des projets d'intégration système échouent ou échouent partiellement.

La réglementation élève les enjeux. Les obligations à haut risque de l'EU AI Act, qui couvrent les décisions de qualité critiques pour la sécurité au titre de l'annexe III, sont pleinement applicables à compter du 2 août 2026, avec des amendes maximales de 35 millions d'euros ou 7 % du chiffre d'affaires mondial pour les violations les plus graves, de pratiques interdites. Un actionneur de rejet qui se déclenche sur un verdict de modèle non validé, sans enregistrement du pourquoi, est exactement ce que ce régime est conçu pour exposer.

La solution n'est pas un meilleur modèle. Même un modèle parfait n'est valide que sur des entrées situées à l'intérieur de son enveloppe validée. Ce dont la ligne a besoin, c'est d'une couche d'exécution qui connaît cette enveloppe, refuse d'actionner en dehors, et peut prouver, pièce par pièce, ce qu'elle a décidé et pourquoi.

Comment fonctionne l'Inspection Trust Gate

Une porte déterministe décide de ce qui s'actionne, pas un modèle et pas un LLM.

Chaque pièce emprunte le même pipeline :

image → caractéristiques physiques + texture → contrôle d'enveloppe (OOD) → verdict de défaut → porte déterministe → actionner / mettre en attente → enregistrement d'audit

1. L'enveloppe validée

Un EnvelopeDetector calcule la distance de Mahalanobis dans l'espace des signaux physiques (exposition, contraste, plage dynamique, mise au point, détail haute fréquence, dominante thermique, saturation, fraction d'éblouissement), ajusté sur 220 images d'entraînement de bonnes pièces. Il répond à une question : cette image est-elle à l'intérieur des conditions de capture sur lesquelles le modèle a été validé ? Hors enveloppe signifie qu'aucune sortie de modèle n'est digne de confiance.

2. La porte déterministe

Du code brut, en dehors de tout LLM, que le modèle ne peut pas outrepasser : des seuils de confiance calibrés ajustés à partir des propres données de la démo (validation automatique sous 0.948, rejet automatique au-dessus de 1.30) et un budget de latence strict de 750 ms pour la fenêtre de frappe. Chaque pièce est acheminée vers AUTO_PASS, AUTO_REJECT ou HOLD, qui l'envoie vers une file d'escalade humaine.

3. La lignée d'audit

Chaque décision écrit un enregistrement JSONL : identifiant de pièce, station, identifiant et version du modèle, hachage du jeu de données, confiance de défaut, score OOD, signaux physiques, les règles de porte qui se sont déclenchées, latence par rapport au budget, journaux d'actionnement et MES, et l'étiquette de risque high-risk:quality-gate (EU AI Act annexe III, eff. 2026-08-02). Un clic exporte le poste.

Le modèle de défauts n'est délibérément pas le produit

Le DefectDetector de la démo est une distance kNN aux bonnes pièces d'entraînement dans l'espace de texture (PatchCore-lite), qui se substitue à votre NVIDIA Metropolis, Cognex ou modèle custom derrière une interface fixe. C'est un véritable succédané fonctionnel (AUROC 0.845 sur bonnes pièces propres versus défauts), rapporté honnêtement, et la promesse produit ne repose jamais dessus. La valeur durable est la couche autour : le filtrage de dérive, la provenance et l'actionnement gouverné tiennent à n'importe quelle précision de modèle, de sorte que la couche survit à chaque mise à niveau du modèle.

Les agents conseillent, le code décide

Lorsque les pièces s'accumulent dans la file HOLD, un duo agentique Drift Triage explique pourquoi : un agent de diagnostic lit les écarts de signaux physiques ordonnés des pièces mises en attente et propose une hypothèse de cause racine avec une action recommandée, et un agent critique vérifie cette hypothèse par rapport aux preuves numériques, la rétrogradant en investigation manuelle si le signal cité n'est pas réellement l'écart dominant. Les agents sont construits sur Pydantic AI et sont interchangeables selon le fournisseur ; sans clé API configurée, le triage bascule vers un modèle déterministe afin que toute la démo s'exécute hors ligne. Dans tous les cas, les agents ne font que conseiller. La porte a déjà décidé.

Le changement de poste, de bout en bout

Un poste scripté sur la station Line 3, rejoué sur de vraies pièces de test réservées MVTec AD metal_nut. Chaque image ci-dessous est une capture d'écran de l'application en cours d'exécution.

Fonctionnement normal : les pièces propres passent en quelques dizaines de millisecondes

Avant la dérive, les bonnes pièces propres sont validées automatiquement avec de la marge : le journal d'audit livré montre la pièce test-good-288 à 37.7 ms et test-good-289 à 24.4 ms par rapport au budget de 750 ms de la fenêtre de frappe, chacune avec un enregistrement de lignée complet. Le tableau de bord affiche le pipeline de décision en direct par pièce, avec le temps d'horloge mesuré de chaque étape et les preuves derrière sa sortie.

Le tableau de bord de l'Inspection Trust Gate en fonctionnement normal : une pièce propre avec un verdict PASS, le pipeline de décision en direct indiquant les millisecondes par étape, et le moniteur d'enveloppe nominal.
Une pièce propre validée automatiquement : verdict PASS, timings par étape, moniteur d'enveloppe nominal.

06:00, changement de poste : les entrées quittent l'enveloppe

Puis le marqueur scripté se déclenche : SHIFT CHANGE 06:00, matrices froides, plafonniers allumés. Douze bonnes pièces réservées arrivent corrompues par de l'éblouissement, du flou et une dominante thermique (corruption d'image honnête appliquée à de vraies photos de bonnes pièces, étiquetée comme telle dans l'application). Le moniteur d'enveloppe passe au rouge. La porte met chacune d'elles en attente pour une revue humaine au lieu de laisser l'actionneur se déclencher sur un verdict que le modèle n'a jamais été validé à donner.

Le moment de dérive : bannière SHIFT CHANGE 06:00, un verdict HOLD indiquant needs proof, un anneau de violation hors distribution autour de la pièce, et une note qu'une AOI naïve l'aurait rejetée.
Le moment de dérive : HOLD au lieu d'un faux rejet. Le chemin AOI naïf aurait mis cette bonne pièce au rebut.
La violation d'enveloppe expliquée signal par signal : luminosité à plus 7.6 sigma contribuant 87.1 % de la distance de Mahalanobis.
Pourquoi l'enveloppe s'est déclenchée : luminosité à +7.6 sigma, 87.1 % de la distance. Des preuves, pas un indicateur opaque.

Le même poste, mesuré sur les deux chemins

Le panneau de comparaison fait passer les mêmes pièces par la référence naïve sans enveloppe et par l'Inspection Trust Gate. La référence rejette à tort les bonnes pièces dérivées ; la porte met au rebut automatiquement 0 et les met en attente, faisant passer l'indicateur de faux rejets de 57.1 % à 0 % dans ce poste scripté. Un panneau de projection extrapole le taux de faux rejets naïf mesuré à un poste complet (40 coups par minute sur 8 heures font 19,200 pièces) à $2.42 par pièce, un ordre de grandeur de coût de rebut sourcé (cas d'un fabricant de biscuits : $94K d'économies annuelles grâce à une réduction de 8.7 % des déchets de rebut). Le chiffre en dollars est toujours une projection étiquetée, jamais une économie mesurée.

Le panneau de résultat : référence naïve 12 bonnes pièces mises au rebut contre Inspection Trust Gate 0, la file d'escalade des pièces mises en attente, l'indicateur de faux rejets passant de 57.1 % à 0 %, et une projection étiquetée du coût de rebut d'environ $26.5k.
Naïf : 12 bonnes pièces mises au rebut, porte : 0. Les pièces mises en attente attendent dans la file d'escalade ; le compteur en dollars est une projection étiquetée.

Un vrai défaut est rejeté automatiquement, annoté honnêtement

Le filtrage de dérive ne vaudrait rien si les défauts s'y cachaient. Un vrai défaut structurel grossier (classe MVTec flip, pièce test-flip-264) est rejeté automatiquement, et l'actionneur simulé consigne REJECT actuated in 25 ms par rapport au budget de 750 ms. La vue géométrique détaillée indique que rien n'a été localisé sur cette pièce : le rejet repose uniquement sur la confiance de texture, et la règle de zone est retombée sur sa valeur par défaut au centre. Afficher ce texte est délibéré. La démo montre la règle qui s'abstient plutôt que de faire semblant. Sur l'ensemble du split réservé, les pièces défectueuses injectées pendant la dérive sont toujours détectées ou escaladées, 93 sur 93, jamais validées automatiquement.

La trace de décision complète du vrai défaut rejeté automatiquement test-flip-264, avec le journal de l'actionneur simulé indiquant REJECT actuated in 25 ms par rapport au budget de 750 ms.
La trace de rejet automatique : un vrai défaut, actionnement consigné par l'adaptateur simulé.
La vue d'honnêteté détaillée sur la pièce rejetée automatiquement : aucune anomalie localisée, le rejet repose uniquement sur la confiance de texture.
La divulgation, dans le produit : aucune anomalie localisée, confiance de texture seule.

Le reçu, et l'explication

Cliquez sur n'importe quelle pièce et le tiroir d'audit affiche son enregistrement de lignée complet : identifiant de modèle metalnut-defect-knn version v7, hachage de jeu de données ae95b5b533c8, score OOD, signaux physiques, les règles qui se sont déclenchées, latence par rapport au budget, les journaux d'actionnement et MES, et l'étiquette de risque high-risk:quality-gate (EU AI Act annexe III, eff. 2026-08-02). Export Audit télécharge le poste sous inspection_audit.jsonl ; la complétude d'audit est de 100 % des pièces décidées sur le split réservé. Lancez Drift Triage et l'agent de diagnostic propose une cause racine pour les pièces mises en attente tandis que l'agent critique la vérifie par rapport aux preuves numériques avant qu'elle n'obtienne un badge verified.

La lignée d'audit JSON par pièce avec identifiant et version du modèle, hachage du jeu de données, score OOD, règles de porte déclenchées, latence, et l'étiquette à haut risque de l'annexe III de l'EU AI Act.
L'enregistrement de lignée par pièce, conçu comme preuve déposable pour un dossier de conformité à haut risque.
Sortie de Drift Triage : l'hypothèse de cause racine et l'action recommandée de l'agent de diagnostic, avec le badge verified de l'agent critique.
Drift Triage : un agent de diagnostic propose, un agent critique vérifie. Consultatif uniquement ; la porte a déjà décidé.

Les chiffres, avec leur périmètre exact

Toutes les mesures proviennent du script de benchmark de la démo sur le split de test officiel réservé MVTec AD metal_nut (220 images d'ajustement de bonnes pièces d'entraînement ; 22 bonnes et 93 pièces de test défectueuses), comparant la référence naïve sans enveloppe à l'Inspection Trust Gate sur les mêmes images. La référence rejette à tort 95.5 à 100 % des bonnes pièces dérivées par famille de dérive (moyenne 98.9 %) ; la porte met au rebut automatiquement 0.0 % et met en attente 100 % d'entre elles. Le détecteur d'enveloppe obtient un AUROC de 1.00 sur une famille de dérive réservée (sous-exposition) contre laquelle il n'a jamais été ajusté. Les corruptions sont à pleine intensité, de sorte que l'effondrement de la référence est quasi total par construction : la revendication honnête est la direction, un modèle validé à l'état propre s'effondre dès que les entrées quittent l'enveloppe, pas le pourcentage exact. Ce sont des mesures de démo sur un benchmark de recherche, jamais des garanties en conditions réelles.

Pipeline AOI naïf versus l'Inspection Trust Gate

La même comparaison que la démo exécute en direct, sur les mêmes pièces.

Dimension AOI naïve (sans contrôle d'enveloppe) Inspection Trust Gate
Entrées hors enveloppe Verdict du modèle tout de même jugé digne de confiance Aucune sortie de modèle n'est digne de confiance ; pièce HELD pour revue
Bonnes pièces dérivées (éblouissement, flou, dominante thermique) 95.5 à 100 % de faux rejets par famille de dérive 0 mises au rebut automatiquement ; 100 % mises en attente (split réservé MVTec metal_nut)
Qui déclenche l'actionneur Le verdict du modèle, directement Une porte déterministe que le modèle ne peut pas outrepasser
Responsabilité de latence None Budget strict de 750 ms pour la fenêtre de frappe, mesuré par pièce
Piste d'audit None Enregistrement de lignée JSONL par pièce, exportable par poste
Quand la ligne dérive Les rebuts s'accumulent jusqu'à ce que quelqu'un s'en aperçoive File d'escalade plus Drift Triage consultatif (agent de diagnostic, agent critique)

Ce que cette démo ne fait pas

  • ✓ Elle ne fait pas tourner une ligne en direct. L'actionneur de rejet EtherNet/IP vers Allen-Bradley ControlLogix et le puits MES sont des adaptateurs simulés qui consignent ce qu'ils feraient, et la caméra est un flux d'images enregistré. La station Line 3 et le poste sont scriptés.
  • ✓ Elle ne revendique pas de garanties en conditions réelles. Le 0.0 % de faux rejets de la porte, l'AUROC d'enveloppe de 1.00 et le taux de détection 93/93 sont des mesures sur le split réservé MVTec metal_nut sous corruptions synthétiques à pleine intensité.
  • ✓ Elle ne montre pas de dérive réelle d'usine. La dérive est une corruption d'image honnête (éblouissement, flou, dominante thermique) appliquée à de vraies photographies MVTec : photos réelles, dérive synthétique, étiquetée comme telle dans l'application.
  • ✓ Elle ne vend pas le modèle de défauts. Le succédané kNN existe pour que la couche autour puisse être montrée ; en production le modèle est le vôtre, et nous ne prétendons pas mieux détecter que les fournisseurs d'AOI.
  • ✓ Elle ne livre pas de métrologie de production. La règle de zone géométrique est un succédané grossier qui localise une anomalie sur 33 des 93 défauts réservés et change le résultat de la porte sur 1 des 93 ; l'interface le divulgue par pièce.
  • ✓ Elle ne rapporte pas d'économies mesurées. Le compteur de coût de rebut est une projection étiquetée à $2.42 par pièce, un ordre de grandeur sourcé, et aucun client, déploiement ou étude de cas n'existe pour cette démo.

Les questions que les acheteurs posent vraiment

Pourquoi notre système de vision rejette-t-il de bonnes pièces après un changement de poste ?

Habituellement parce que les entrées ont dérivé, pas parce que le modèle s'est dégradé. Les reflets des plafonniers d'atelier, les matrices froides et les premières pièces d'un poste avant l'équilibre thermique font sortir les images de la distribution sur laquelle le modèle avait été validé, et aucun modèle n'est digne de confiance sur des entrées hors de son enveloppe validée. Un modèle à 97 % en laboratoire qui atteint un taux de faux rejets de 14 % en production sur une presse d'emboutissage est l'exemple canonique. La solution durable est une porte qui détecte les entrées hors enveloppe et met ces pièces en attente pour revue au lieu d'actionner.

Devons-nous remplacer notre modèle d'inspection ou notre système AOI existant ?

Non. L'Inspection Trust Gate encapsule votre modèle derrière une interface fixe ; dans la démo, le détecteur de défauts est un succédané délibéré d'un moteur NVIDIA Metropolis, Cognex ou custom. Le produit est la couche autour du modèle : le contrôle d'enveloppe, la porte déterministe, la file d'escalade et la lignée d'audit. Cette couche continue de justifier son existence à chaque mise à niveau du modèle, parce que la défaillance qu'elle empêche est une défaillance d'entrée, pas une défaillance de modèle.

Est-ce assez rapide pour une vraie ligne d'emboutissage ?

La porte est du code brut avec un budget de latence strict : la décision de rejet doit aboutir à l'intérieur de la fenêtre de frappe de 750 ms d'une presse tournant à 40 coups par minute. Dans le journal d'audit livré de la démo, les décisions aboutissent en quelques dizaines de millisecondes, par exemple 24.4 ms et 37.7 ms par rapport au budget de 750 ms, et le tableau de bord affiche le p99 en direct. Ce sont des mesures de démo, pas une garantie de production, mais le budget est appliqué par pièce.

L'EU AI Act s'applique-t-il à l'inspection qualité par IA, et que devons-nous consigner ?

Les décisions de qualité critiques pour la sécurité relèvent des obligations à haut risque de l'Acte (annexe III), pleinement applicables à compter du 2 août 2026, avec des amendes maximales de 35 millions d'euros ou 7 % du chiffre d'affaires mondial pour les violations les plus graves, de pratiques interdites. La démo écrit un enregistrement de lignée par pièce : identifiant et version du modèle, hachage du jeu de données, score OOD, les règles qui se sont déclenchées, latence par rapport au budget, journal d'actionnement et l'étiquette de risque, exportable en JSONL. Cet enregistrement est conçu comme preuve déposable pour un dossier de conformité à haut risque ; ce n'est pas une certification.

L'IA, ou un LLM, peut-elle déclencher l'actionneur de rejet ?

Non. L'actionnement est décidé par une porte déterministe : des seuils de confiance ajustés et un budget de latence en code brut qu'aucune sortie de modèle et aucun LLM ne peut outrepasser. La partie agentique, Drift Triage, est un agent de diagnostic plus un agent critique qui expliquent pourquoi la ligne a dérivé ; ils conseillent et n'actionnent jamais. Sans clé API configurée, le triage se dégrade vers un repli déterministe et toute la démo s'exécute hors ligne.

Comment savons-nous que le détecteur de dérive n'est pas simplement ajusté à la démo ?

C'est le contrôle d'indépendance que nous avons mené : le détecteur d'enveloppe a obtenu un AUROC de 1.00 sur une famille de dérive réservée (sous-exposition) contre laquelle il n'a jamais été ajusté, mesuré sur le split réservé MVTec metal_nut. Il est ajusté sur 220 images de bonnes pièces connues dans l'espace des signaux physiques, de sorte qu'il signale la dérive de capture qui déplace ces signaux, pas seulement les familles de dérive que nous avons construites. Les corruptions sont à pleine intensité, de sorte que la séparation est nette par construction ; la revendication honnête est la direction, pas le pourcentage exact.

S'agit-il d'une ligne en direct ou d'une démo ?

Une démo exécutable qui prouve le mécanisme. L'actionneur de rejet EtherNet/IP vers Allen-Bradley ControlLogix et le puits MES sont des adaptateurs simulés qui consignent ce qu'ils feraient, et la caméra est un flux enregistré de vraies photographies MVTec AD metal_nut ; la dérive est une corruption d'image honnête appliquée à de vraies photos de bonnes pièces. Le contrôle d'enveloppe, la porte déterministe, la file d'escalade et l'export d'audit sont réels et s'exécutent exactement comme montré, et chaque chiffre phare est mesuré sur le split de test réservé MVTec metal_nut.

Recherche technique

La recherche derrière cette démo — l'architecture, la conception de la vérification et le plan d'entreprise.

Vous redressez ou durcissez un déploiement d'inspection en edge ?

La couche de confiance entre le modèle et l'actionneur est la partie difficile. Nous la construisons.

Si votre équipe se débat avec les faux rejets après chaque changement de poste, ou avec ce que les obligations à haut risque de l'EU AI Act signifient pour une ligne qui décide à 40 coups par minute, nous aimerions vraiment entendre comment vous y réfléchissez. Le problème est à l'échelle de l'industrie et les réponses le seront aussi.

Évaluation d'enveloppe

  • ✓ Cartographier où les entrées de votre ligne quittent l'enveloppe validée du modèle
  • ✓ Ajuster un détecteur hors distribution sur vos signaux de capture
  • ✓ Définir les seuils de porte et la politique HOLD à partir de vos propres données
  • ✓ Spécifier l'enregistrement de lignée dont votre dossier de conformité a besoin

Construire la couche de confiance

  • ✓ Une porte déterministe à l'intérieur de votre budget de fenêtre de frappe
  • ✓ Surveillance d'enveloppe et une file d'escalade sur la ligne
  • ✓ Lignée d'audit JSONL par pièce avec export en un clic
  • ✓ Agents de triage de dérive bornés qui conseillent, n'actionnent jamais
Réseaux sociaux

Également publié sur