MeterGuard | Évaluation pré-déploiement de firmware pour compteurs intelligents

Une estimation réduite du risque de firmware nécessite toujours un seuil de déploiement

Un correctif synthétique réduit fortement les défaillances de compteurs prédites, mais reçoit tout de même un avis NO-GO. Nous montrons comment l'état du parc, l'incertitude modélisée et les données probantes manquantes façonnent une recommandation de déploiement de firmware.

Visite guidée de 11 min 55 s. Parcs et manifestes synthétiques ; aucun déploiement réel sur compteurs.

2,85 %

Taux moyen de défaillance modélisé du correctif

Cas synthétique de Plano, 86 078 points de terminaison évalués

4,10 %

Taux supérieur de l'intervalle modélisé

Même cas, intervalle de comptage modélisé à 90 %

3,0 %

Seuil NO-GO configuré

Blocage strict à ce taux supérieur ou au-delà

Pour les responsables AMI des services publics et les gestionnaires de modifications de firmware : examinez ce qu'une recommandation couvre, ce qui la déclenche et quelles preuves restent en suspens.

Une estimation améliorée peut tout de même échouer à la politique de déploiement

Une étiquette de version décrit une intention. Une évaluation pré-déploiement doit examiner le comportement proposé par rapport au parc qui le recevra. Dans cette démonstration, l'état de la batterie, la récupération radio et l'usure de la flash influencent les défaillances modélisées, de sorte qu'une amélioration moyenne ne peut à elle seule déterminer si une version candidate respecte le seuil de risque déclaré.

Le cas étudié utilise un parc généré désigné Plano Water et des manifestes de firmware synthétiques. L'estimation initiale d'optimisation de batterie prédit 63 883 défaillances parmi 86 078 points de terminaison évalués. Un correctif avec limitation de courant d'appel réduit cette estimation à 2 449, mais son taux modélisé supérieur reste de 4,10 %. Tous deux reçoivent un avis NO-GO en vertu de la même règle de risque supérieur à 3,0 %.

La distinction importe lors de l'examen des éléments probants avant déploiement : demandez-vous quelle population a été évaluée, ce que l'incertitude englobe et quelle règle autorise le déploiement. Une comparaison favorable avec une version candidate antérieure ne répond qu'à l'une de ces questions.

Du comportement estimé à une recommandation contrôlable

Estimer le comportement d'écriture

Le profileur de firmware lit un journal des modifications synthétique et estime le courant du modem, le courant supplémentaire d'écriture flash, la probabilité de récupération et l'amplification d'écriture. Les exemples enregistrés utilisent des profils assistés par modèle mis en cache. Une heuristique déterministe peut servir de solution de repli lorsque la sortie de la passerelle est indisponible ou non analysable ; aucune de ces voies ne mesure un binaire de firmware.

Modéliser ce parc

Python/NumPy modélise les chutes de tension, les réinitialisations, les échecs de récupération et la corruption flash à l'aide de mécanismes postulés. Chaque pré-déploiement utilise 200 itérations de Monte Carlo et la graine 1234. L'intervalle de comptage modélisé à 90 % correspond au 5e au 95e percentile des comptages simulés, et non à une couverture garantie sur le terrain.

Ordre des politiquesCondition configuréeRecommandation
1. Risque supérieurTaux supérieur de l'intervalle à 3,0 % ou plusNO-GO
2. Confiance dans les donnéesSous le blocage strict, mais la confiance du profil est faibleSTAGED-CANARY
3. Risque moyenSous le blocage strict, la confiance n'est pas faible et la moyenne est à 0,5 % ou moinsGO
4. Risque résiduelSous le blocage strict avec une moyenne intermédiaireSTAGED-CANARY

La barrière de politique déterministe émet une recommandation locale. L'arbitre de gouvernance rédige ensuite une note consultative et ne peut pas annuler directement le verdict. La précision du profil reste essentielle car l'estimation fournit les entrées du simulateur.

La télémétrie manquante est exclue du dénominateur de prédiction et recommandée pour un examen manuel. Une recommandation autre que GO propose 500 points de terminaison présentant le risque modélisé le plus faible, un palier d'observation de 72 heures et une réévaluation avec la télémétrie canari observée ; l'élargissement nécessite un taux de défaillance observé inférieur à 0,1 %. Cette application n'exécute ni le canari ni l'examen manuel.

Suivre le correctif de l'amélioration estimée au seuil de déploiement

Tous les parcs, manifestes, étiquettes de version et enregistrements présentés ici sont synthétiques. Ces captures réelles utilisent des profils assistés par modèle mis en cache, 200 itérations de Monte Carlo et la graine 1234. Une recommandation modélisée n'est pas un déploiement de firmware exécuté ni une preuve indépendante de sûreté sur le terrain.

Exemple concret : une estimation bien inférieure, le même NO-GO

Commençons par la population générée de Plano Water de 88 000 points de terminaison. L'instantané en évalue 86 078 et en exclut 1 922 présentant une télémétrie insuffisante. Nous comparons un manifeste initial d'optimisation de batterie avec un correctif avec limitation de courant d'appel par rapport à cette même population et à cette même politique, afin que l'amélioration et le seuil de déploiement restant puissent être examinés séparément.

Écran de saisie de MeterGuard avec la population synthétique de Plano et le manifeste initial d'optimisation de batterie sélectionnés.
Population synthétique de Plano et manifeste STAR v4.2.1 avant l'évaluation pré-déploiement. Les mentions relatives au fournisseur, à la version, au laboratoire et aux rapports de terrain proviennent du jeu d'essai créé, et non de preuves vérifiées du fabricant ou d'incidents. Ouvrez l'image pour l'examiner en taille réelle.

1. Examiner l'estimation du comportement avant de se fier à l'étiquette de version

Le profil initial mis en cache estime le courant de base du modem à 120 mA plus un courant supplémentaire de 100 mA lors d'une écriture flash. Sa probabilité de récupération après réinitialisation est de 0,02. Le profil du correctif modifie ces entrées pour 100 mA de base, 10 mA de courant supplémentaire et une probabilité de récupération de 0,96. Il s'agit d'estimations dérivées du journal des modifications, et non de courants mesurés sur le matériel ou d'analyses d'un binaire de firmware.

Entrées estimées pour la même population synthétique de Plano
Entrée de profilManifeste initialManifeste du correctif
Courant de base du modem120 mA100 mA
Courant supplémentaire d'écriture flash100 mA10 mA
Probabilité de réenregistrement après réinitialisation0,020,96
Amplification d'écriture0,0180,004
Jeton de confiance du profilÉlevéeÉlevée

La population générée présente une charge médiane de batterie de 69,0 % et un âge médian de 4,4 ans. Dans le modèle postulé de chute de tension, une écriture flash peut provoquer une réinitialisation lorsque la tension aux bornes chute sous 3,30 V ; l'échec de la récupération radio et la corruption flash contribuent aux défaillances modélisées. Un jeton de confiance élevée n'établit pas une certitude calibrée quant à ces entrées.

Résultat initial synthétique de Plano : NO-GO, 63 883 défaillances modélisées, 74,22 % et un intervalle de comptage de 59 894 à 67 395.
Cas initial synthétique de Plano : 63 883 défaillances prédites parmi 86 078 points de terminaison évalués, un taux moyen de 74,22 % et un intervalle de comptage modélisé de 59 894 à 67 395. Le taux supérieur est de 78,30 % ; 1 922 autres points de terminaison sont exclus. Ouvrez l'image pour l'examiner en taille réelle.

2. Comparer l'intervalle supérieur avec le seuil déclaré

La version candidate initiale prédit 63 883 défaillances, soit 74,22 % des points de terminaison évalués. Le correctif abaisse la prédiction à 2 449, soit 2,85 %. Il s'agit d'une nette amélioration modélisée, mais la barrière vérifie d'abord l'intervalle supérieur : 3 531 divisé par 86 078 donne environ 4,10 %, ce qui reste supérieur au blocage strict configuré de 3,0 %. Elle renvoie donc NO-GO, même si la moyenne est inférieure à 3,0 %.

Fenêtre modale NO-GO de MeterGuard pour un correctif synthétique de Plano : 2 449 défaillances prédites, taux évalué de 2,85 % et intervalle modélisé de 1 536 à 3 531.
Correctif synthétique de Plano : 2 449 défaillances prédites parmi 86 078 points de terminaison évalués, avec un intervalle de comptage modélisé de 1 536 à 3 531. Son taux supérieur de 4,10 % déclenche le NO-GO au seuil de 3,0 % ; 1 922 points de terminaison restent exclus et recommandés pour un examen manuel. Ouvrez l'image pour l'examiner en taille réelle.

L'intervalle de comptage modélisé à 90 % s'étend de 1 536 à 3 531 pour le correctif. Il décrit la dispersion des résultats simulés sous ces entrées, et non une plage garantie sur le terrain. La distinction pratique lors de l'examen se fait entre « meilleur que la version candidate précédente » et « à l'intérieur du seuil de déploiement déclaré » ; cet exemple ne satisfait qu'à la première condition.

3. Conserver le profil de comportement, changer la population

La même estimation comportementale du correctif aboutit à GO sur la population générée de la coopérative Hill Country Electric Co-op. Sa charge médiane de batterie est de 83,5 %, son âge médian est de 2,8 ans et un signal radio faible concerne 2,3 % des compteurs, contre 69,0 %, 4,4 ans et 13,4 % pour Plano. La comparaison montre pourquoi une estimation de firmware ne peut être dissociée de l'état de la population évaluée.

Résultat du correctif de la coopérative synthétique : GO, 24 défaillances modélisées, 0,02 % et un intervalle de comptage de 17 à 33.
Le même profil comportemental de correctif mis en cache sur la population de la coopérative synthétique produit GO pour 118 222 points de terminaison évalués : 24 défaillances modélisées, un intervalle de comptage de 17 à 33 et un taux supérieur de 0,03 %. Les 1 778 points de terminaison exclus ne sont pas couverts. Cela n'établit pas la compatibilité du firmware entre différents fournisseurs ni un déploiement achevé. Ouvrez l'image pour l'examiner en taille réelle.
Recommandations actuellement enregistrées, avec dénominateurs et incertitude associés
Cas synthétiqueÉvalués / exclusDéfaillances moyennes modéliséesIntervalle de comptage à 90 %Taux supérieurVerdict
Plano, manifeste initial86 078 / 1 92263 883 (74,22 %)59 894 à 67 39578,30 %NO-GO
Plano, correctif86 078 / 1 9222 449 (2,85 %)1 536 à 3 5314,10 %NO-GO
Coopérative, même profil de correctif118 222 / 1 77824 (0,02 %)17 à 330,03 %GO pour les points de terminaison évalués
Coopérative, manifeste restreint118 222 / 1 77854 (0,05 %)39 à 750,06 %STAGED-CANARY

L'avis GO ne couvre pas les 1 778 points de terminaison exclus de la coopérative, n'autorise pas une tâche OTA et ne démontre pas que la même image est compatible avec le matériel de différents fabricants. Nous comparons un comportement d'écriture estimé à travers des distributions de santé générées, et ne déployons pas une image chez plusieurs fabricants.

4. Une estimation faible ne peut remplacer des preuves adéquates sur le firmware

Le cas du manifeste restreint sur la population de la coopérative ne prédit que 54 défaillances, avec un intervalle de comptage de 39 à 75 et un taux supérieur de 0,06 %. La confiance de son profil étant faible, la deuxième branche de la politique empêche le statut GO et recommande STAGED-CANARY. Il s'agit d'un profil différent : la probabilité de récupération est de 0,50 et l'amplification d'écriture est de 0,008, contre 0,96 et 0,004 pour le correctif.

Fenêtre modale STAGED de MeterGuard pour un manifeste restreint de coopérative synthétique : 54 défaillances modélisées et un profil à faible confiance qui empêche GO.
Cas du manifeste restreint de la coopérative synthétique : 54 défaillances modélisées parmi 118 222 points de terminaison évalués, avec un intervalle de comptage de 39 à 75 et un taux supérieur de 0,06 %. La faible confiance dans le profil produit STAGED-CANARY, affiché sous la forme STAGED dans la fenêtre modale. Les 1 778 points de terminaison exclus, le canari proposé et l'examen manuel restent en suspens ; aucun canari ni examen n'est exécuté. Ouvrez l'image pour l'examiner en taille réelle.

La recommandation autre que GO propose une cohorte de 500 points de terminaison présentant le risque modélisé le plus bas, un palier de 72 heures et une télémétrie fraîchement observée avant tout élargissement ; la condition configurée pour le taux de défaillance observé est inférieure à 0,1 %. L'application n'exécute pas ce canari. Une cohorte saine sélectionnée n'établit pas non plus que la population dégradée ou exclue est sans danger.

5. Préserver les exclusions et le fondement de la décision

L'enregistrement HTML du cas initial ci-dessous montre comment la recommandation conserve l'instantané synthétique, la ventilation des cohortes, les exclusions et la note consultative. Les 1 922 points de terminaison sans télémétrie restent en dehors du dénominateur de prédiction et sont recommandés pour un examen manuel. L'exportation de l'enregistrement ne réalise pas cet examen et ne les comptabilise pas implicitement comme sains.

Enregistrement de décision généré pour le cas initial montrant les cohortes de parcs synthétiques, 1 922 points de terminaison exclus et une signature d'opérateur en attente.
L'enregistrement exporté concerne le cas initial synthétique de Plano STAR v4.2.1, et non le correctif. Il conserve la ventilation par cohorte, les 1 922 exclusions, la note consultative, l'horodatage et le signataire en attente. L'identifiant par hachage de contenu n'est pas une signature cryptographique, et le hachage du firmware est synthétique. Toute mention visible de coût repose sur des estimations hypothétiques, et non sur un devis ou des économies vérifiées. Ouvrez l'image pour l'examiner en taille réelle.

L'exportation conserve également les entrées du profil, la prédiction et l'intervalle, les seuils de politique, la graine et l'horodatage. Son identifiant est un hachage de contenu SHA-256 tronqué ; la signature de l'opérateur est en attente et le hachage du firmware est un espace réservé synthétique. Ces champs rendent la décision générée contrôlable, mais n'en font pas une approbation signée, un certificat de conformité ou une archive d'audit immuable.

Lire le benchmark sans dissimuler le contrôle nécessitant un examen

L'écran final associe trois mesures issues d'une évaluation synthétique fixe de 120 scénarios à deux contrôles de régression sur le profil actuel. Chaque scénario d'évaluation utilise 20 000 points de terminaison générés entièrement observés et 80 itérations de simulateur, avec la graine 2026. La vérité générée provient du même mécanisme postulé avec un bruit nouveau, et non d'un ensemble de données indépendant d'un service public.

Benchmark finalisé de MeterGuard avec une couverture de 86,7 %, un rappel de 1,000, une précision de 0,851, quatre contrôles réussis et un contrôle de correctif nécessitant un examen.
La suite synthétique actuelle de cinq contrôles compte quatre contrôles réussis et un nécessitant un examen : le correctif reçoit un avis NO-GO par rapport à son objectif configuré GO. L'intervalle nominal à 90 % couvre 86,7 % des résultats générés ; la mention PASS utilise un plancher configuré de 80 %, et non l'atteinte d'une couverture de 90 %. Ouvrez l'image pour l'examiner en taille réelle.
Cinq contrôles actuels et leur interprétation délimitée
ContrôleRésultat observéPérimètre et interprétation
Couverture de l'intervalle86,7 %, PASSIntervalle nominal à 90 % ; le seuil de réussite configuré est de 80 %. L'objectif nominal n'est pas atteint.
Rappel sur les déploiements dangereux74/74 = 1,000, PASSL'ensemble des 74 scénarios étiquetés dangereux sont bloqués lors de cette exécution fixe ; le plancher configuré est de 0,95.
Précision de la barrière de déploiement74/87 = 0,851, PASS74 scénarios bloqués sur 87 sont étiquetés dangereux ; le plancher configuré est de 0,80.
Régression initiale de PlanoNO-GO, PASSLe profil initial actuel atteint son objectif configuré NO-GO.
Contrôle du correctif de PlanoNO-GO, REVIEWLe correctif actuel n'atteint pas son objectif configuré GO.

Le danger est défini comme un taux de défaillance généré supérieur à 1,0 % ; NO-GO et STAGED-CANARY comptent tous deux comme bloqués. L'évaluation enregistre 74 vrais positifs, 13 faux positifs, 33 vrais négatifs et zéro faux négatif au sein de cette exécution synthétique fixe. Quatre contrôles réussis et un nécessitant un examen révèlent un écart sensible aux entrées ; ils n'établissent pas une exactitude parfaite, une validation indépendante ou une prévention universelle.

Où cette démonstration s'intègre dans un flux de déploiement

MeterGuard aide à inspecter une décision proposée : comportement estimé, hypothèses sur la population, incertitude, exclusions et politique utilisée. Le tableau sépare les éléments démontrés des travaux qu'un déploiement en production exigerait encore.

Besoin décisionnelCette démonstration présenteÉléments probants requis pour la production
Comportement du firmwareEstimations de modèle dérivées du journal des modifications, mise en cache et solution de repliComportement dérivé du binaire ou mesuré, validé sur du matériel pertinent
État du parcDistributions générées de l'état de la batterie, de la radio et de l'usure de la flashTélémétrie réelle, contrôles de qualité des données et étalonnage propre au service public
Contrôle de déploiementRecommandations explicites GO / NO-GO / STAGED-CANARYIntégration aux contrôles de déploiement autorisés et résultats observés du canari
Enregistrement de décisionExport HTML/JSON préservant les entrées et les exclusionsApprobation de l'opérateur, signatures et évaluation de conformité applicable

Ce que cette démonstration ne fait PAS

Elle ne se connecte pas à un flux AMI réel, n'analyse aucun binaire de firmware, ne déclenche ni ne bloque aucune tâche OTA, n'exécute aucun canari et ne réalise aucun examen manuel. Les parcs, manifestes et listes de compteurs sont synthétiques. Le certificat exporté comporte un signataire en attente et un identifiant par hachage de contenu ; il ne s'agit pas d'une approbation signée ou d'une certification de conformité.

Questions avant un déploiement de firmware

Comment évaluer le risque lié au firmware d'un compteur intelligent avant un déploiement ?

MeterGuard présente une évaluation pré-déploiement combinant un profil estimé de comportement de firmware avec un instantané synthétique de l'état du parc. Elle modélise les défaillances, restitue un intervalle d'incertitude et applique une politique de déploiement déclarée. Une évaluation en production requiert toujours une télémétrie réelle, un comportement de firmware validé et un étalonnage par rapport aux résultats des campagnes du service public.

Pourquoi le correctif reçoit-il tout de même un avis NO-GO ?

Sur le parc synthétique de Plano, le correctif abaisse les défaillances prédites à 2 449 sur 86 078 points de terminaison évalués, soit 2,85 %. Le taux supérieur de son intervalle modélisé est de 4,10 %, ce qui dépasse le seuil de blocage strict configuré de 3,0 %. Une moyenne plus faible ne suffit pas à respecter ce seuil.

Qu'advient-il des compteurs dont la télémétrie est manquante ?

Les points de terminaison sans télémétrie sont exclus du taux de défaillance modélisé et recommandés pour un examen manuel. L'exemple synthétique de Plano exclut 1 922 points de terminaison sur une population de 88 000. L'application ne réalise pas cet examen et ne présume pas que ces points de terminaison sont sains.

L'IA peut-elle passer outre la décision de déploiement ?

La note de gouvernance est rédigée après que la barrière de politique déterministe a émis sa recommandation et ne peut pas l'annuler directement. Le profil de firmware assisté par modèle fournit toujours les entrées de simulation, de sorte que des estimations inexactes peuvent modifier le verdict. Une règle codée rend la décision contrôlable sans pour autant valider le profil.

MeterGuard se connecte-t-il à notre système AMI ou installe-t-il le firmware ?

Cette démonstration utilise des parcs et des manifestes de firmware synthétiques, sans flux d'infrastructure de comptage avancé (AMI) en direct ni déploiement à distance (OTA) exécuté. L'avis GO est une recommandation modélisée pour les points de terminaison évalués, et non une approbation d'installation ou une preuve de compatibilité matérielle. L'intégration à une télémétrie réelle et à des contrôles de déploiement constitue un travail prospectif.

Le certificat exporté constitue-t-il une approbation signée ?

L'exportation enregistre les entrées, la prédiction, les exclusions et la politique utilisées pour la recommandation. Son identifiant est un hachage de contenu tronqué et la signature de l'opérateur est en attente. Il s'agit d'un enregistrement de décision contrôlable, et non d'une approbation signée numériquement ou d'un certificat de conformité.

Recherche technique

Découvrez les recherches associées pour un contexte plus large sur cette démonstration.

Définissez les éléments probants requis par votre décision de déploiement

Échangez sur un flux de travail pré-déploiement adapté à votre service public et à votre environnement de firmware.

Nous pouvons cadrer la télémétrie, la validation comportementale et l'intégration des politiques nécessaires pour passer de cette démonstration synthétique à une évaluation en production.

Évaluation des éléments probants avant déploiement

  • ✓ Télémétrie du parc et critères d'exclusion
  • ✓ Hypothèses sur le comportement du firmware
  • ✓ Seuils de risque et incertitude
  • ✓ Exigences d'approbation de l'opérateur

Périmètre d'intégration en production

  • ✓ Interfaces de télémétrie réelle
  • ✓ Validation du comportement matériel
  • ✓ Étalonnage des résultats de campagne
  • ✓ Intégration des contrôles de déploiement