Vision par ordinateur sous contraintes physiques

La physique l'emporte sur les pixels.

Sous les projecteurs, un crâne chauve et luisant peut obtenir une détection de « ballon » avec une confiance de 98 %, et une caméra qui suit la confiance la plus élevée bifurque hors du terrain. Plumbline est une couche déterministe de portes physiques qui se place après votre détecteur et rejette la détection que la physique interdit, tout en restant verrouillée sur le vrai ballon.

C'est la couche de vérification entre votre détecteur et votre système d'action. Exécutez-la, puis lisez la justification physique qu'elle a consignée pour chaque décision.

Visite guidée et commentée du tableau de bord Plumbline en cours d'exécution (3:58).

97.7%

Temps sur cible, porte physique

Benchmark synthétique, graine 7

82.3σ

Pire imposteur, rejeté au-delà de la ligne des 5σ

Audit bald_linesman, 44 images

68.3%

Temps sur cible, extrait de diffusion réel

YOLO11x réel, 240 images, espace image

Les deux périmètres de benchmark sont maintenus distincts tout au long de cette page. Le chiffre synthétique constitue un maximum contrôlé par rapport à une vérité terrain connue ; le chiffre sur séquences réelles est honnêtement inférieur sur des vidéos réelles difficiles.

Un détecteur n'a aucune mémoire de l'endroit où un objet réel peut se trouver à l'instant suivant

La défaillance est une défaillance de physique, pas une défaillance de détection.

Un détecteur d'objets est indépendant des images. Il évalue chaque image selon la texture et la forme, sans aucune notion de l'endroit où un objet réel peut physiquement se trouver dans l'image suivante. Sous les projecteurs d'un stade, un crâne chauve brille comme un ballon, de sorte que le détecteur émet un « ballon » avec une confiance de 98 % sur la tête alors que le vrai ballon obtient un score inférieur, et une caméra qui suit la confiance la plus élevée suit la tête au lieu du match.

Ceci est documenté, et non hypothétique. En octobre 2020 à l'Inverness Caledonian Thistle, une caméra automatisée Pixellot a suivi le crâne chauve d'un juge de touche à la place du ballon pendant tout un match (page de solution Veriprajna WP43, 2026). Il ne s'agit pas non plus d'un échec isolé que de meilleurs modèles élimineraient d'eux-mêmes : le propre benchmark de suivi de SoccerNet conclut que le suivi multi-objets dans le football est « loin d'être résolu », aucun suivi conscient de la physique n'étant encore intégré dans les méthodes de référence, une lacune manifeste (recherche Veriprajna WP43, 2026).

La raison pour laquelle ce problème ne disparaît pas à mesure que les détecteurs s'améliorent est qu'une détection physiquement impossible reste fausse quel que soit le niveau de précision du détecteur. Un « ballon » immobile à une hauteur constante de 1.7 m et se déplaçant à 3 mph n'est pas un ballon, quelle que soit la certitude du modèle. Pour une équipe assumant la responsabilité juridique d'une décision visuelle automatisée, c'est dans les cas limites que réside le coût : un rapport sectoriel les évalue à « 80 % du temps d'ingénierie, 90 % des coûts de support, 100 % de l'exposition à la responsabilité » (recherche Veriprajna WP43, 2026).

Trois portes déterministes que le modèle ne peut pas outrepasser

Plumbline s'exécute en aval du détecteur. Il prend chaque détection candidate et vérifie si la physique l'autorise, puis achemine l'image vers accept, review ou coast, et consigne la justification par écrit.

Porte 1 : cinématique

Un filtre de Kalman/UKF (modèle d'évolution balistique plus modèle de mesure sténopéique non linéaire) prédit où un vrai ballon peut se trouver. L'innovation de chaque candidat devient une distance de Mahalanobis . Les seuils sont fournis en configuration : accepter sous 3σ, rejeter au-delà de 5σ, marquer de 3 à 5σ comme REVIEW. Sur la pire image de la scène du juge de touche chauve, l'imposteur a obtenu 82.3σ.

Porte 2 : flux optique

La porte compare la vitesse en pixels prédite par la trajectoire au flux optique local du candidat, et rejette en cas d'incohérence de direction ou de magnitude (plage configurée : ratio de flux dans [0.35, 3.0], cosinus d'au moins 0.3). Un « ballon » presque immobile en plein jeu échoue à ce test.

Porte 3 : géométrique

Le modèle sténopéique donne la taille en pixels qu'un ballon de 22 cm peut sous-tendre à la profondeur implicite du candidat, et la porte rejette les tailles impossibles (tolérance de ratio de taille de 1.8x sur le chemin synthétique, 1.5x sur le chemin en espace image des séquences réelles). Une tête d'environ 50 px ne peut pas être un ballon de 22 cm à environ 12 m, qui sous-tend environ 22 px.

Une porte de politique déterministe prend ensuite la décision, en utilisant le même gates.py inchangé sur les deux chemins d'entrée. Elle n'accepte que lorsque toutes les portes sont validées. Elle marque un candidat limite (3 à 5σ sans défaillance stricte) comme REVIEW, et la trajectoire poursuit sur prédiction (coast), transmise pour revue plutôt que feinte avec assurance. Elle passe en COAST (prédiction seule) lorsque chaque candidat est rejeté, par exemple lors d'une brève occultation, et réacquiert la cible lorsque le ballon réapparaît. Les seuils relèvent de la configuration, et ne sont fixés par aucun modèle.

Chaque décision est consignée dans un enregistrement d'audit par décision. L'en-tête comprend la graine, le scénario, l'identifiant du détecteur et les seuils des portes. Chaque image répertorie chaque candidat avec sa classe et sa confiance, le verdict numérique de chaque porte et son explication en langage clair, l'action finale et la trajectoire verrouillée. Un narrateur d'audit optionnel convertit cette télémétrie en un résumé d'incident en langage clair pour l'exportation, mais il n'est que consultatif, n'intervient jamais dans le chemin d'acceptation ou de rejet, et bascule vers un résumé déterministe basé sur des modèles prédéfinis lorsqu'aucune clé de modèle ni pont n'est présent, de sorte que la démo fonctionne entièrement hors ligne.

La même politique à trois portes s'exécute sur deux types d'entrées, ce qui est précisément l'intérêt. Sur les scènes synthétiques, elle utilise le filtre de Kalman sans parfum (Unscented Kalman Filter) dans l'espace monde. Sur l'extrait de diffusion réel, elle s'exécute dans le plan image avec un filtre de Kalman 2D (kf2d), car un extrait unique non calibré ne fournit aucune profondeur métrique et simuler un filtre 3D serait malhonnête. Les portes sont réutilisées sans modification ; seul le filtre change en toute transparence. C'est ce qui rend cette couche agnostique au détecteur : la valeur réside dans les portes, pas dans le détecteur.

Ce que font les portes, image par image

Les captures d'écran ci-dessous proviennent du tableau de bord réel de Plumbline en cours d'exécution. L'imposteur au crâne chauve est une reproduction injectée par l'auteur de l'incident documenté de 2020, clairement mentionnée dans l'application.

Écran partagé Plumbline : à gauche, la boîte du suivi naïf se positionne sur le crâne chauve du juge de touche ; à droite, le suivi régulé par la physique reste sur le vrai ballon tandis que le flux des portes en direct montre le candidat de la tête rejeté à 82.3 sigma.

Le rejet du juge de touche chauve (synthétique)

Sur la scène de 44 images, le détecteur simulé émet 18 fausses détections de « ballon » avec une confiance élevée sur la tête du juge de touche, jusqu'à 98 % de confiance. Les trois portes rejettent la totalité des 18. Le pire imposteur individuel obtient un score de 82.3σ sur la porte cinématique, bien au-delà de la ligne de rejet de 5σ, tandis que le vrai ballon, à environ 87 % de confiance et 0.4σ, valide les trois portes et reste verrouillé. Sur ce seul scénario, la couche physique a maintenu un temps sur cible de 97.7 % avec 1 changement d'ID, contre 59.1 % pour le suivi de la confiance maximale et 20.5 % pour le seuil rehaussé (l'agrégat synthétique des trois scénarios figure dans le tableau comparatif plus bas).

Plumbline sur le scénario d'occultation : un joueur passe devant le ballon, le suivi naïf bascule sur le joueur, et le suivi physique maintient une position prédite marquée COAST jusqu'à ce que le ballon réapparaisse.

Maintien prédictif pendant l'occultation (synthétique)

Lorsqu'un joueur passe brièvement devant le ballon, le suivi naïf le perd ou accroche le joueur. Le suivi physique passe en COAST et suit la prédiction à travers l'intervalle, puis réacquiert le ballon lorsqu'il réapparaît. Il n'invente jamais de détection pour combler le vide ; il prédit, marque l'état et attend.

Plumbline en cours d'exécution sur un extrait de diffusion réel avec des détections YOLO11x réelles dans l'espace image, affichant le tableau des scores avec 68.3 % de temps sur cible pour la physique contre 43.8 % et 30.0 % pour les deux références.

Les mêmes portes sur des séquences réelles

Sur un extrait de diffusion réel de 240 images, des détections YOLO11x réelles alimentent les mêmes trois portes s'exécutant dans l'espace image. Les portes ont maintenu le suivi du ballon sur 68.3 % des images, contre 43.8 % pour le suivi naïf et 30.0 % pour le suivi à seuil rehaussé, avec 4 changements d'ID contre 7 et une erreur moyenne de 26.2 px contre 193.0 px. Ce résultat est honnêtement inférieur au plafond synthétique car les séquences réelles sont plus difficiles. Le constat selon lequel la physique surpasse les deux références reste vérifié sur des détections réelles, et pas seulement simulées.

Le journal des décisions exporté de Plumbline ouvert dans le navigateur, affichant l'en-tête avec la graine et les seuils de portes, ainsi que des lignes par image répertoriant chaque candidat, les verdicts des portes et la justification physique en langage clair pour chaque décision.

Une justification physique consignée pour chaque décision

Le journal des décisions exporté révèle l'intégralité de la piste d'audit : graine, scénario, identifiant du détecteur et seuils en haut, puis un enregistrement image par image de la classe et de la confiance de chaque candidat, le verdict numérique de chaque porte avec sa justification en langage clair, l'action finale et la trajectoire verrouillée, pour finir par le tableau des scores. Pour une équipe assumant une responsabilité juridique sur une décision visuelle automatisée, cela constitue une traçabilité archivable expliquant pourquoi chaque détection a été validée ou refusée.

La comparaison mesurée, avec son périmètre exact

Il s'agit de métriques de qualité de suivi, indépendantes de la qualité du détecteur. Elles ne constituent en aucun cas un taux d'erreur du modèle ni une garantie en monde ouvert. Les deux séries ci-dessous portent sur des périmètres différents et ne sont pas combinées.

Agrégat synthétique (graine 7, sur bald_linesman, occlusion et clean)

Système de suivi Temps sur cible Changements d'ID Erreur moy. (px) Manqués sur jeu propre
Physique Veriprajna 97.7% 3 2.7 2.3%
B1 : suivre la confiance maximale 80.3% 4 63.0 0.0%
B2 : seuil de confiance rehaussé 40.2% 29 115.0 43.2%

Séquences de diffusion réelles (YOLO11x réel, 240 images, portes en espace image)

Système de suivi Temps sur cible Changements d'ID Erreur moy. (px)
Physique Veriprajna 68.3% 4 26.2
B1 : suivre la confiance maximale 43.8% 7 193.0
B2 : seuil de confiance rehaussé 30.0% 1 245.1

Le chiffre qui démontre la thèse est le résultat d'orthogonalité. Sur le jeu propre synthétique, relever le seuil de confiance (B2) abandonne 43.2 % des vrais ballons de faible confiance, tandis que la physique limite ses manqués sur jeu propre à 2.3 %, ce qui correspond à une latence d'acquisition d'une seule image et non à un faux négatif. Modifier le curseur de confiance échange une erreur contre une autre. La physique opère de manière orthogonale. (Le seul changement d'ID de B2 sur les séquences réelles est un artefact dû au fait qu'il ne suit presque rien à 30 % sur cible, pas une réussite.)

Ce que cette démo ne fait pas

  • Il s'agit d'une démo exécutable qui prouve le mécanisme des portes, et non d'un pipeline déployé.
  • L'imposteur au crâne chauve est une reproduction injectée par l'auteur de l'incident de 2020, et non un bruit organique de détecteur capté en direct.
  • Le traitement des séquences réelles s'effectue honnêtement en espace image (un filtre de Kalman 2D), et non avec un filtre étalonné en 3D dans l'espace monde, car un extrait unique non calibré ne dispose pas de profondeur métrique.
  • Les références comparatives appartiennent à la classe des modes de défaillance sans physique (B1 et B2), et non à un fournisseur particulier. Nous ne prétendons pas surpasser Pixellot, Veo, Spiideo ou tout autre produit commercialisé, et les micrologiciels ultérieurs de Pixellot ont déjà corrigé le cas particulier du crâne chauve.
  • YOLO11x est utilisé comme détecteur interchangeable sur l'extrait réel, hors ligne. Nous ne construisons ni n'améliorons le détecteur.
  • La porte de parallaxe pour les semi-conducteurs et la porte de réflectance pour la fabrication constituent des extensions modulaires prévues ultérieurement, non démontrées ici.
  • Aucun client, déploiement, ligue sportive ou diffuseur n'est sous-entendu. L'incident d'Inverness de 2020 et SoccerNet sont des références publiques citées, et non nos clients.
  • Le narrateur d'audit est consultatif. Il explique les décisions ; il ne les prend jamais.

Questions posées par les équipes d'ingénierie et de produit

N'est-ce pas simplement un meilleur détecteur, ou un wrapper autour de YOLO ?

Non. Plumbline se place en aval du détecteur que vous utilisez déjà et décide des détections candidates auxquelles faire confiance. Dans la démo, le même code de porte s'exécute sur un détecteur en boîte noire simulé pour les scènes synthétiques et sur des détections réelles de YOLO11x pour l'extrait de diffusion. Nous ne modifions pas la qualité de sortie du détecteur. Le produit est la couche déterministe de portes qui l'entoure, de sorte que la valeur perdure même si le détecteur sous-jacent s'améliore.

Pourquoi ne pas simplement rehausser le seuil de confiance pour éliminer le faux ballon ?

Parce que ce n'est pas le bon curseur. Sur le jeu propre synthétique, relever le seuil de confiance élimine 43.2 % des vrais ballons de faible confiance tout en conservant l'imposteur à confiance élevée. Les portes physiques fonctionnent de manière orthogonale à la confiance : elles ont limité leurs manqués sur jeu propre à 2.3 %, ce qui correspond à une latence d'acquisition d'une seule image plutôt qu'à un ballon abandonné. Vous ne pouvez pas distinguer un vrai ballon d'un imposteur par le seul score lorsque l'imposteur obtient un score supérieur.

Cela fonctionne-t-il réellement sur des séquences réelles, ou seulement en simulation ?

Les deux, et nous distinguons clairement les deux cas. Lors d'une exécution synthétique contrôlée avec vérité terrain connue (graine 7), la couche physique a maintenu 97.7 % de temps sur cible, contre 80.3 % pour le suivi de la confiance maximale et 40.2 % pour le seuil rehaussé. Sur un extrait de diffusion réel de 240 images avec de réelles détections YOLO11x, les mêmes portes ont maintenu le ballon sur 68.3 % des images, contre 43.8 % et 30.0 %. Le chiffre sur séquences réelles est honnêtement plus bas car la vidéo réelle est plus complexe. Nous ne présentons jamais le résultat synthétique comme un résultat en conditions réelles.

Comment savoir que ce sont les portes qui ont décidé, et non un modèle de langage ?

Les trois portes sont du simple code numpy et scipy en dehors de tout modèle : une porte cinématique Kalman/UKF (acceptation sous 3 sigma, rejet au-delà de 5 sigma), une porte de cohérence de flux optique et une porte de perspective géométrique. La confiance ne dépend pas de l'auto-évaluation d'un modèle. Un narrateur d'audit optionnel convertit la télémétrie des portes en un résumé en langage clair, mais il est purement consultatif, n'intervient jamais dans la décision d'acceptation ou de rejet, et se replie sur un modèle déterministe basé sur des modèles prédéfinis en l'absence de clé de modèle.

Puis-je voir pourquoi une détection spécifique a été acceptée ou rejetée ?

Oui. Chaque décision conserve une justification physique archivée. Le journal des décisions exporté consigne la graine, le scénario, l'identifiant du détecteur et les seuils des portes dans l'en-tête, puis répertorie pour chaque image tous les candidats avec leur classe et confiance, le verdict numérique de chaque porte et sa justification en langage clair (par exemple, Mahalanobis 82 sigma au-delà de la ligne des 5 sigma, cinématiquement impossible), l'action finale et la trajectoire verrouillée. Il s'exporte au format JSON ou HTML.

Ce système est-il prêt pour un déploiement, et surpasse-t-il Pixellot ou Veo ?

Non sur les deux points. Il s'agit d'une démo exécutable qui prouve le mécanisme des portes, et non d'un pipeline déployé. Les références que nous surpassons appartiennent à la classe des modes de défaillance sans physique (suivre la confiance maximale et rehausser le seuil), et non à un fournisseur particulier. Nous ne prétendons pas surpasser le suivi d'un produit commercial, et les fabricants de caméras reconnus ont déjà corrigé le cas spécifique du juge de touche chauve de 2020 dans des versions ultérieures de leur micrologiciel. L'imposteur au crâne chauve dans la démo est une reproduction injectée par l'auteur de cet incident documenté, et non un bruit de détecteur organique capté en direct.

Recherche technique

La recherche derrière cette démo — l'architecture, la conception de la vérification et le schéma directeur d'entreprise.

Réseaux sociaux

Également publié sur

Placez une porte physique entre votre détecteur et votre système d'action

Si une décision visuelle automatisée engage votre responsabilité juridique, le mode de défaillance relève de la physique, pas de la confiance.

Nous avons conçu Plumbline pour prouver qu'une couche de portes déterministes peut rejeter une détection physiquement impossible et en fournir une justification archivable. Le même cadre s'adapte à d'autres contraintes physiques : une porte de parallaxe pour une usine de semi-conducteurs, une porte de réflectance pour une ligne de production. Faites-nous part de la contrainte que votre détecteur ne cesse de violer et nous évaluerons si une couche de portes est adaptée.

Revue des modes de défaillance en vision

  • ✓ Cartographiez les divergences entre la confiance de votre détecteur et la physique
  • ✓ Identifiez les détections physiquement impossibles sur lesquelles vous agissez aujourd'hui
  • ✓ Définissez les contraintes cinématiques, de flux et géométriques applicables
  • ✓ Délimitez la piste d'audit requise par une décision exposée à une responsabilité juridique

Développement d'une couche de portes physiques

  • ✓ Portes déterministes sous forme de code inspectable en dehors de tout modèle
  • ✓ Agnostique au détecteur : conservez le détecteur que vous utilisez déjà
  • ✓ Journal d'audit par décision avec justification physique consignée
  • ✓ Métriques de qualité de suivi qui perdurent à mesure que le détecteur s'améliore