ClaimLens · Justification des allégations d'IA
Synthetic Nimbus Capital AI annonce une exactitude de détection de contenu de 98%. Son test fourni enregistre 53%. ClaimLens conserve la phrase, la preuve et la règle de décision ensemble afin que les réviseurs puissent examiner l'écart.
6 min 56 sec · Enregistrements synthétiques · Réponses consultatives en cache
98% revendiqués
Exactitude de détection de contenu
Affirmation sur le site web de Synthetic Nimbus
53% enregistrés
Résultat du test sur texte mixte fourni
Jeu d'essai de test Synthetic Nimbus
Écart de 45 points
Dépasse la tolérance configurée
Règle de démonstration : plus de 5 points de pourcentage
Un examen des enregistrements fournis pour les équipes juridiques, de conformité, de marketing et d'ingénierie. Les verdicts de démonstration n'établissent pas la conformité légale et ne valident pas les preuves de manière indépendante.
Une allégation d'exactitude engage une équipe sur une tâche et un résultat mesuré. Une déclaration de pleine autonomie formule également une allégation sur l'intervention humaine. L'examen doit conserver ces engagements suffisamment longtemps pour les comparer aux enregistrements qui sous-tendent la formulation.
Dans l'exemple de Nimbus, le constat essentiel réside dans la relation entre l'exactitude annoncée et le test fourni. Un réviseur peut voir quelle phrase requiert une attention particulière et pourquoi. Ce même enregistrement rend également concrète la question suivante : la formulation est-elle erronée, les preuves sont-elles incomplètes, ou le test sous-jacent nécessite-t-il une investigation ?
Nous démontrons un flux de travail délimité sur trois divulgations synthétiques et 14 enregistrements de preuves fournis. Il extrait dix allégations, relie leurs sujets aux enregistrements et conserve le motif de chaque verdict configuré.
01 / EXTRACT
Le découpage déterministe des phrases et la correspondance par mot-clé d'IA ou par sujet sélectionnent les allégations issues des divulgations fournies. La formulation source reste visible.
02 / LINK
L'extraction associe un champ de sujet structuré aux enregistrements de test et opérationnels. Elle n'effectue pas de recherche sémantique et n'authentifie pas ces enregistrements.
03 / DECIDE
Du code Python brut applique les vérifications configurées. Un écart numérique de plus de cinq points de pourcentage produit CONTRADICTED dans l'exemple de métrique présenté.
Le Substantiation Judge conseille sans modifier la décision de la barrière de contrôle. L'Adversarial Examiner s'exécute sur les allégations justifiées par la barrière et peut les rétrograder à PARTIALLY_SUBSTANTIATED lorsqu'il renvoie REFUTED ; il ne peut pas les surclasser. L'enregistrement rejoue les réponses consultatives en cache pendant que les vérifications déterministes s'exécutent. Les quatre réponses de l'examinateur en cache confirment toutes leurs résultats étayés.
L'exécution terminée peut exporter un JSON Substantiation Package. Il conserve l'allégation, la source, le verdict, la règle, la justification et les identifiants de preuve pour le suivi, ainsi qu'un récapitulatif et des informations de version. Il référence les enregistrements sous-jacents ; il n'intègre pas une archive complète des preuves.
Ces vues proviennent de la démonstration locale de ClaimLens. Chaque entreprise Nimbus, divulgation, test et enregistrement opérationnel présenté ici est synthétique.

L'affirmation d'intégration distincte promet l'absence d'humain dans la boucle. Son journal opérationnel synthétique enregistre 68% d'intervention humaine. La règle sans humain configurée renvoie CONTRADICTED au-delà de 10% d'intervention ; ce seuil est un choix de démonstration, et non une limite juridiquement suffisante.
Le modèle de portefeuille existe, mais son journal fourni n'enregistre une influence que sur 1.5% des décisions d'allocation. La barrière de contrôle renvoie NEEDS_PROOF. Le juge en cache la qualifie de contredite, montrant pourquoi un avis consultatif et un résultat final requièrent des étiquettes distinctes.


L'allégation synthétique de détection de fraude reste justifiée avec sa précision divulguée de 94% et les enregistrements de test et opérationnels à l'appui. Un résultat de jeu d'essai étayé demeure une allégation relative à des enregistrements fournis. Le réviseur doit valider les mesures réelles et leur pertinence avant de se fier à la formulation effective.

ClaimLens démontre un examen de concordance allégation-enregistrement. Le tableau sépare ce que le flux de travail enregistré rend inspectable du travail qu'un examen réel requiert encore.
| Tâche d'examen | Ce que fournit cette démonstration | Ce qui reste en dehors |
|---|---|---|
| Trouver l'engagement | Une phrase reliée à sa source fournie | Ingestion générale de documents et découverte complète des allégations |
| Comparer les éléments à l'appui | Liaison d'enregistrements basée sur le sujet et vérifications configurées | Authentification des preuves et évaluation indépendante des tests |
| Comprendre le résultat | Un verdict, une règle de décision et une justification | Conseil juridique ou approbation réglementaire |
| Transmettre l'examen | Un paquet JSON avec les identifiants de preuves | Une archive complète de preuves ou une chaîne de conservation infalsifiable |
Il s'agit d'une démonstration locale utilisant des données synthétiques groupées. Elle ne dispose pas de robot d'indexation de sites web ou de dépôts en direct, de téléversement arbitraire de documents, d'intégration AIBOM ou CI/CD de production, de recherche sémantique, d'évaluation juridique autonome ou d'export de classeur HTML. Ses seuils n'établissent pas de confiance statistique ni de suffisance juridique. Cette page explique le flux de travail enregistré ; elle ne donne pas accès à l'application locale.
ClaimLens compare la formulation fournie et les enregistrements techniques à l'aide de règles de démonstration configurées. Un résultat justifié ne constitue pas une validation juridique, et les étiquettes réglementaires affichées dans l'interface sont des étiquettes de routage illustratives. L'examen humain et la validation des enregistrements sous-jacents demeurent nécessaires.
Cette démonstration utilise le jeu de données synthétique groupé de Nimbus. Elle n'accepte pas de téléversements arbitraires de documents et n'explore pas les sites web, les dépôts réglementaires ou les systèmes internes. La page montre le flux de travail enregistré et ses vues de preuves.
La démonstration relie les phrases extraites aux enregistrements techniques fournis par l'intermédiaire d'un champ de sujet structuré. Ces enregistrements comprennent des tests et des journaux opérationnels. Les contrôles comparent des valeurs et des conditions configurées ; ils n'authentifient pas les enregistrements et n'évaluent pas de manière indépendante la méthodologie des tests.
Le Substantiation Judge fournit des avis sans modifier la décision de la barrière de contrôle. L'Adversarial Examiner peut rétrograder une allégation justifiée par la barrière lorsqu'il renvoie une réfutation, mais il ne peut pas surclasser une allégation. Dans cet enregistrement, les réponses consultatives sont mises en cache et les quatre réponses de l'examinateur confirment toutes les résultats étayés.
Un enregistrement de modèle établit qu'un composant est documenté, tandis qu'une allégation opérationnelle nécessite également des preuves de ce qu'il fait. Dans l'exemple synthétique de portefeuille, le journal fourni enregistre une influence sur seulement 1.5% des décisions d'allocation. La barrière configurée renvoie NEEDS_PROOF, préservant cet écart pour examen.
Le bouton Exporter du navigateur enregistre un paquet JSON issu de l'exécution terminée, avec chaque allégation, source, verdict, règle de décision, justification et identifiants de preuve. Il comprend également un récapitulatif, la version du moteur et un horodatage de génération. Il n'intègre pas les enregistrements complets de preuves, les transcriptions consultatives ou une chaîne de conservation infalsifiable.
Explorez les recherches associées pour obtenir un contexte plus large sur cette démonstration.
Discutez d'un flux de travail de justification des allégations avec Veriprajna.
Nous pouvons discuter des enregistrements, des limites d'examen et des décisions humaines dont votre équipe a besoin avant de définir une implémentation.