MeterGuard | Évaluation pré-déploiement de firmware pour compteurs intelligents
Un correctif synthétique réduit fortement les défaillances de compteurs prédites, mais reçoit tout de même un avis NO-GO. Nous montrons comment l'état du parc, l'incertitude modélisée et les données probantes manquantes façonnent une recommandation de déploiement de firmware.
Visite guidée de 11 min 55 s. Parcs et manifestes synthétiques ; aucun déploiement réel sur compteurs.
2,85 %
Taux moyen de défaillance modélisé du correctif
Cas synthétique de Plano, 86 078 points de terminaison évalués
4,10 %
Taux supérieur de l'intervalle modélisé
Même cas, intervalle de comptage modélisé à 90 %
3,0 %
Seuil NO-GO configuré
Blocage strict à ce taux supérieur ou au-delà
Pour les responsables AMI des services publics et les gestionnaires de modifications de firmware : examinez ce qu'une recommandation couvre, ce qui la déclenche et quelles preuves restent en suspens.
Une étiquette de version décrit une intention. Une évaluation pré-déploiement doit examiner le comportement proposé par rapport au parc qui le recevra. Dans cette démonstration, l'état de la batterie, la récupération radio et l'usure de la flash influencent les défaillances modélisées, de sorte qu'une amélioration moyenne ne peut à elle seule déterminer si une version candidate respecte le seuil de risque déclaré.
Le cas étudié utilise un parc généré désigné Plano Water et des manifestes de firmware synthétiques. L'estimation initiale d'optimisation de batterie prédit 63 883 défaillances parmi 86 078 points de terminaison évalués. Un correctif avec limitation de courant d'appel réduit cette estimation à 2 449, mais son taux modélisé supérieur reste de 4,10 %. Tous deux reçoivent un avis NO-GO en vertu de la même règle de risque supérieur à 3,0 %.
La distinction importe lors de l'examen des éléments probants avant déploiement : demandez-vous quelle population a été évaluée, ce que l'incertitude englobe et quelle règle autorise le déploiement. Une comparaison favorable avec une version candidate antérieure ne répond qu'à l'une de ces questions.
Le profileur de firmware lit un journal des modifications synthétique et estime le courant du modem, le courant supplémentaire d'écriture flash, la probabilité de récupération et l'amplification d'écriture. Les exemples enregistrés utilisent des profils assistés par modèle mis en cache. Une heuristique déterministe peut servir de solution de repli lorsque la sortie de la passerelle est indisponible ou non analysable ; aucune de ces voies ne mesure un binaire de firmware.
Python/NumPy modélise les chutes de tension, les réinitialisations, les échecs de récupération et la corruption flash à l'aide de mécanismes postulés. Chaque pré-déploiement utilise 200 itérations de Monte Carlo et la graine 1234. L'intervalle de comptage modélisé à 90 % correspond au 5e au 95e percentile des comptages simulés, et non à une couverture garantie sur le terrain.
| Ordre des politiques | Condition configurée | Recommandation |
|---|---|---|
| 1. Risque supérieur | Taux supérieur de l'intervalle à 3,0 % ou plus | NO-GO |
| 2. Confiance dans les données | Sous le blocage strict, mais la confiance du profil est faible | STAGED-CANARY |
| 3. Risque moyen | Sous le blocage strict, la confiance n'est pas faible et la moyenne est à 0,5 % ou moins | GO |
| 4. Risque résiduel | Sous le blocage strict avec une moyenne intermédiaire | STAGED-CANARY |
La barrière de politique déterministe émet une recommandation locale. L'arbitre de gouvernance rédige ensuite une note consultative et ne peut pas annuler directement le verdict. La précision du profil reste essentielle car l'estimation fournit les entrées du simulateur.
La télémétrie manquante est exclue du dénominateur de prédiction et recommandée pour un examen manuel. Une recommandation autre que GO propose 500 points de terminaison présentant le risque modélisé le plus faible, un palier d'observation de 72 heures et une réévaluation avec la télémétrie canari observée ; l'élargissement nécessite un taux de défaillance observé inférieur à 0,1 %. Cette application n'exécute ni le canari ni l'examen manuel.
Tous les parcs, manifestes, étiquettes de version et enregistrements présentés ici sont synthétiques. Ces captures réelles utilisent des profils assistés par modèle mis en cache, 200 itérations de Monte Carlo et la graine 1234. Une recommandation modélisée n'est pas un déploiement de firmware exécuté ni une preuve indépendante de sûreté sur le terrain.
Commençons par la population générée de Plano Water de 88 000 points de terminaison. L'instantané en évalue 86 078 et en exclut 1 922 présentant une télémétrie insuffisante. Nous comparons un manifeste initial d'optimisation de batterie avec un correctif avec limitation de courant d'appel par rapport à cette même population et à cette même politique, afin que l'amélioration et le seuil de déploiement restant puissent être examinés séparément.

Le profil initial mis en cache estime le courant de base du modem à 120 mA plus un courant supplémentaire de 100 mA lors d'une écriture flash. Sa probabilité de récupération après réinitialisation est de 0,02. Le profil du correctif modifie ces entrées pour 100 mA de base, 10 mA de courant supplémentaire et une probabilité de récupération de 0,96. Il s'agit d'estimations dérivées du journal des modifications, et non de courants mesurés sur le matériel ou d'analyses d'un binaire de firmware.
| Entrée de profil | Manifeste initial | Manifeste du correctif |
|---|---|---|
| Courant de base du modem | 120 mA | 100 mA |
| Courant supplémentaire d'écriture flash | 100 mA | 10 mA |
| Probabilité de réenregistrement après réinitialisation | 0,02 | 0,96 |
| Amplification d'écriture | 0,018 | 0,004 |
| Jeton de confiance du profil | Élevée | Élevée |
La population générée présente une charge médiane de batterie de 69,0 % et un âge médian de 4,4 ans. Dans le modèle postulé de chute de tension, une écriture flash peut provoquer une réinitialisation lorsque la tension aux bornes chute sous 3,30 V ; l'échec de la récupération radio et la corruption flash contribuent aux défaillances modélisées. Un jeton de confiance élevée n'établit pas une certitude calibrée quant à ces entrées.

La version candidate initiale prédit 63 883 défaillances, soit 74,22 % des points de terminaison évalués. Le correctif abaisse la prédiction à 2 449, soit 2,85 %. Il s'agit d'une nette amélioration modélisée, mais la barrière vérifie d'abord l'intervalle supérieur : 3 531 divisé par 86 078 donne environ 4,10 %, ce qui reste supérieur au blocage strict configuré de 3,0 %. Elle renvoie donc NO-GO, même si la moyenne est inférieure à 3,0 %.

L'intervalle de comptage modélisé à 90 % s'étend de 1 536 à 3 531 pour le correctif. Il décrit la dispersion des résultats simulés sous ces entrées, et non une plage garantie sur le terrain. La distinction pratique lors de l'examen se fait entre « meilleur que la version candidate précédente » et « à l'intérieur du seuil de déploiement déclaré » ; cet exemple ne satisfait qu'à la première condition.
La même estimation comportementale du correctif aboutit à GO sur la population générée de la coopérative Hill Country Electric Co-op. Sa charge médiane de batterie est de 83,5 %, son âge médian est de 2,8 ans et un signal radio faible concerne 2,3 % des compteurs, contre 69,0 %, 4,4 ans et 13,4 % pour Plano. La comparaison montre pourquoi une estimation de firmware ne peut être dissociée de l'état de la population évaluée.

| Cas synthétique | Évalués / exclus | Défaillances moyennes modélisées | Intervalle de comptage à 90 % | Taux supérieur | Verdict |
|---|---|---|---|---|---|
| Plano, manifeste initial | 86 078 / 1 922 | 63 883 (74,22 %) | 59 894 à 67 395 | 78,30 % | NO-GO |
| Plano, correctif | 86 078 / 1 922 | 2 449 (2,85 %) | 1 536 à 3 531 | 4,10 % | NO-GO |
| Coopérative, même profil de correctif | 118 222 / 1 778 | 24 (0,02 %) | 17 à 33 | 0,03 % | GO pour les points de terminaison évalués |
| Coopérative, manifeste restreint | 118 222 / 1 778 | 54 (0,05 %) | 39 à 75 | 0,06 % | STAGED-CANARY |
L'avis GO ne couvre pas les 1 778 points de terminaison exclus de la coopérative, n'autorise pas une tâche OTA et ne démontre pas que la même image est compatible avec le matériel de différents fabricants. Nous comparons un comportement d'écriture estimé à travers des distributions de santé générées, et ne déployons pas une image chez plusieurs fabricants.
Le cas du manifeste restreint sur la population de la coopérative ne prédit que 54 défaillances, avec un intervalle de comptage de 39 à 75 et un taux supérieur de 0,06 %. La confiance de son profil étant faible, la deuxième branche de la politique empêche le statut GO et recommande STAGED-CANARY. Il s'agit d'un profil différent : la probabilité de récupération est de 0,50 et l'amplification d'écriture est de 0,008, contre 0,96 et 0,004 pour le correctif.

La recommandation autre que GO propose une cohorte de 500 points de terminaison présentant le risque modélisé le plus bas, un palier de 72 heures et une télémétrie fraîchement observée avant tout élargissement ; la condition configurée pour le taux de défaillance observé est inférieure à 0,1 %. L'application n'exécute pas ce canari. Une cohorte saine sélectionnée n'établit pas non plus que la population dégradée ou exclue est sans danger.
L'enregistrement HTML du cas initial ci-dessous montre comment la recommandation conserve l'instantané synthétique, la ventilation des cohortes, les exclusions et la note consultative. Les 1 922 points de terminaison sans télémétrie restent en dehors du dénominateur de prédiction et sont recommandés pour un examen manuel. L'exportation de l'enregistrement ne réalise pas cet examen et ne les comptabilise pas implicitement comme sains.

L'exportation conserve également les entrées du profil, la prédiction et l'intervalle, les seuils de politique, la graine et l'horodatage. Son identifiant est un hachage de contenu SHA-256 tronqué ; la signature de l'opérateur est en attente et le hachage du firmware est un espace réservé synthétique. Ces champs rendent la décision générée contrôlable, mais n'en font pas une approbation signée, un certificat de conformité ou une archive d'audit immuable.
L'écran final associe trois mesures issues d'une évaluation synthétique fixe de 120 scénarios à deux contrôles de régression sur le profil actuel. Chaque scénario d'évaluation utilise 20 000 points de terminaison générés entièrement observés et 80 itérations de simulateur, avec la graine 2026. La vérité générée provient du même mécanisme postulé avec un bruit nouveau, et non d'un ensemble de données indépendant d'un service public.

| Contrôle | Résultat observé | Périmètre et interprétation |
|---|---|---|
| Couverture de l'intervalle | 86,7 %, PASS | Intervalle nominal à 90 % ; le seuil de réussite configuré est de 80 %. L'objectif nominal n'est pas atteint. |
| Rappel sur les déploiements dangereux | 74/74 = 1,000, PASS | L'ensemble des 74 scénarios étiquetés dangereux sont bloqués lors de cette exécution fixe ; le plancher configuré est de 0,95. |
| Précision de la barrière de déploiement | 74/87 = 0,851, PASS | 74 scénarios bloqués sur 87 sont étiquetés dangereux ; le plancher configuré est de 0,80. |
| Régression initiale de Plano | NO-GO, PASS | Le profil initial actuel atteint son objectif configuré NO-GO. |
| Contrôle du correctif de Plano | NO-GO, REVIEW | Le correctif actuel n'atteint pas son objectif configuré GO. |
Le danger est défini comme un taux de défaillance généré supérieur à 1,0 % ; NO-GO et STAGED-CANARY comptent tous deux comme bloqués. L'évaluation enregistre 74 vrais positifs, 13 faux positifs, 33 vrais négatifs et zéro faux négatif au sein de cette exécution synthétique fixe. Quatre contrôles réussis et un nécessitant un examen révèlent un écart sensible aux entrées ; ils n'établissent pas une exactitude parfaite, une validation indépendante ou une prévention universelle.
MeterGuard aide à inspecter une décision proposée : comportement estimé, hypothèses sur la population, incertitude, exclusions et politique utilisée. Le tableau sépare les éléments démontrés des travaux qu'un déploiement en production exigerait encore.
| Besoin décisionnel | Cette démonstration présente | Éléments probants requis pour la production |
|---|---|---|
| Comportement du firmware | Estimations de modèle dérivées du journal des modifications, mise en cache et solution de repli | Comportement dérivé du binaire ou mesuré, validé sur du matériel pertinent |
| État du parc | Distributions générées de l'état de la batterie, de la radio et de l'usure de la flash | Télémétrie réelle, contrôles de qualité des données et étalonnage propre au service public |
| Contrôle de déploiement | Recommandations explicites GO / NO-GO / STAGED-CANARY | Intégration aux contrôles de déploiement autorisés et résultats observés du canari |
| Enregistrement de décision | Export HTML/JSON préservant les entrées et les exclusions | Approbation de l'opérateur, signatures et évaluation de conformité applicable |
Elle ne se connecte pas à un flux AMI réel, n'analyse aucun binaire de firmware, ne déclenche ni ne bloque aucune tâche OTA, n'exécute aucun canari et ne réalise aucun examen manuel. Les parcs, manifestes et listes de compteurs sont synthétiques. Le certificat exporté comporte un signataire en attente et un identifiant par hachage de contenu ; il ne s'agit pas d'une approbation signée ou d'une certification de conformité.
MeterGuard présente une évaluation pré-déploiement combinant un profil estimé de comportement de firmware avec un instantané synthétique de l'état du parc. Elle modélise les défaillances, restitue un intervalle d'incertitude et applique une politique de déploiement déclarée. Une évaluation en production requiert toujours une télémétrie réelle, un comportement de firmware validé et un étalonnage par rapport aux résultats des campagnes du service public.
Sur le parc synthétique de Plano, le correctif abaisse les défaillances prédites à 2 449 sur 86 078 points de terminaison évalués, soit 2,85 %. Le taux supérieur de son intervalle modélisé est de 4,10 %, ce qui dépasse le seuil de blocage strict configuré de 3,0 %. Une moyenne plus faible ne suffit pas à respecter ce seuil.
Les points de terminaison sans télémétrie sont exclus du taux de défaillance modélisé et recommandés pour un examen manuel. L'exemple synthétique de Plano exclut 1 922 points de terminaison sur une population de 88 000. L'application ne réalise pas cet examen et ne présume pas que ces points de terminaison sont sains.
La note de gouvernance est rédigée après que la barrière de politique déterministe a émis sa recommandation et ne peut pas l'annuler directement. Le profil de firmware assisté par modèle fournit toujours les entrées de simulation, de sorte que des estimations inexactes peuvent modifier le verdict. Une règle codée rend la décision contrôlable sans pour autant valider le profil.
Cette démonstration utilise des parcs et des manifestes de firmware synthétiques, sans flux d'infrastructure de comptage avancé (AMI) en direct ni déploiement à distance (OTA) exécuté. L'avis GO est une recommandation modélisée pour les points de terminaison évalués, et non une approbation d'installation ou une preuve de compatibilité matérielle. L'intégration à une télémétrie réelle et à des contrôles de déploiement constitue un travail prospectif.
L'exportation enregistre les entrées, la prédiction, les exclusions et la politique utilisées pour la recommandation. Son identifiant est un hachage de contenu tronqué et la signature de l'opérateur est en attente. Il s'agit d'un enregistrement de décision contrôlable, et non d'une approbation signée numériquement ou d'un certificat de conformité.
Découvrez les recherches associées pour un contexte plus large sur cette démonstration.
Échangez sur un flux de travail pré-déploiement adapté à votre service public et à votre environnement de firmware.
Nous pouvons cadrer la télémétrie, la validation comportementale et l'intégration des politiques nécessaires pour passer de cette démonstration synthétique à une évaluation en production.