Vérification de la conformité fiscale par l'IA

Votre IA fiscale n'a pas un problème d'exactitude. Elle a un problème de vérification.

StatuteGuard est une couche indépendante des fournisseurs qui prouve de façon déterministe les positions fiscales rédigées par l'IA par rapport à la loi encodée. Collez une position provenant de n'importe quelle plateforme : il renvoie un PASS, BLOCK ou NEEDS-REVIEW catégorique, avec une chaîne de citations statutaires et un dossier d'audit IRC §6662 déposable. L'agent conseille, le code décide.

71.4%

Couverture déterministe

Jeu de référence étiqueté de 42 cas

100%

Précision de la porte, 0 faux blocages

Jeu de référence étiqueté de 42 cas

20%

Pénalité pour inexactitude IRC §6662

Retombe sur la personne qui a signé

Une démonstration exécutable, pas un déploiement. Toutes les positions sont synthétiques ; la logique statutaire est ancrée dans le droit primaire. Ceci n'est pas un conseil fiscal ou juridique.

Le problème de la préparation est en train d'être résolu. Celui de la vérification ne l'est pas.

Le secteur s'est précipité pour automatiser la rédaction. Le service « Ready to Review » de Thomson Reuters prépare automatiquement les déclarations 1040, CCH Axcess Expert AI rédige des analyses-conseils dans des milliers de cabinets, et Blue J répond aux questions de recherche. Ce que personne n'a automatisé, c'est l'étape à la pénalité la plus élevée : cette position est-elle réellement défendable au regard de la loi ?

Le véritable mode de défaillance n'est pas une mauvaise grammaire. C'est une classification erronée énoncée avec assurance : une position plausible, bien rédigée, qui place une déduction sur la mauvaise ligne. Lorsqu'une IA classe à tort une déduction comme « au-dessus de la ligne » plutôt qu'« en dessous de la ligne », la pénalité de 20% pour inexactitude prévue à l'IRC §6662 s'applique à la personne qui a signé la déclaration, et non à l'algorithme qui l'a rédigée. La pénalité pour fraude prévue au §6663 atteint 75 %. La conformité fiscale des entreprises américaines coûte déjà plus de $126B par an, et le taux d'audit des grandes entreprises par l'IRS est passé de 8.8% à 22.6% (recherche de la solution WP#1, 2026).

On ne peut pas faire confiance à un LLM pour surveiller un LLM à travers les mêmes poids qui ont produit l'erreur. Un autocontrôle interne au modèle rejoue exactement le raisonnement qui a mal classé la position au départ. La réponse durable est une vérification qui vit en dehors du modèle.

L'agent conseille, le code décide.

StatuteGuard inverse le modèle de confiance. Une IA peut rédiger, mais un moteur de politiques déterministe décide si la position est défendable. La seule étape LLM est l'extraction, qui transforme un langage naturel désordonné en une revendication structurée et typée. Il s'abstient lorsqu'il n'est pas sûr. Tout ce qui suit est du code que le modèle ne peut pas outrepasser. Nous l'appelons neuro-symbolique : extraction neuronale, vérification symbolique.

Étape Ce qui s'exécute Qui décide
Extraire Le LLM lit le mémo de position et propose une revendication typée, en indiquant sa confiance. En dessous du plancher de confiance, il escalade plutôt que de trancher. LLM (consultatif uniquement)
Récupérer GraphRAG parcourt le graphe de connaissances des références croisées de l'IRC pour extraire les dispositions en jeu et leurs relations typées. Déterministe
Vérifier De véritables politiques OPA/Rego (ou un jumeau identique en Python pur) testent la revendication par rapport à la loi encodée. Déterministe
Porte PASS (défendable), BLOCK (contredit la loi encodée), NEEDS-REVIEW (zone grise réelle), ou OUT-OF-COVERAGE (non encodé dans la V1). Déterministe
Audit Rédige un dossier de diligence raisonnable IRC §6662 déposable, au format JSON plus un certificat HTML imprimable. Déterministe

Parce que le verdict est du code de politique et non un appel au modèle, vous pouvez lire le Rego et confirmer qu'il correspond à la loi. La couche de vérification s'exécute comme une infrastructure, mesurée à des dizaines de milliers de positions par seconde (environ 40k à 60k selon les exécutions, machine et passe dépendantes), et non comme une inférence de modèle par position.

Les dispositions encodées dans cette version : QPVLI de l'OBBBA (§163(h)(4) / §63(b)(7)), QBI du §199A, la limitation des intérêts d'entreprise du §163(j), l'échange de biens de même nature du §1031, le bureau à domicile du §280A, le crédit pour véhicule propre du §30D, et la distinction AGI des §62/§63. Tout ce qui est hors de cet ensemble renvoie OUT-OF-COVERAGE et est acheminé vers un humain. StatuteGuard ne prétend pas encoder l'IRC dans son intégralité.

Ce qu'il détecte, montré de trois façons

La démonstration parcourt un BLOCK, un PASS et une escalade, tous sur des positions synthétiques. Les captures d'écran ci-dessous sont de véritables captures de l'application en cours d'exécution.

Le cas d'ancrage : une position d'intérêts de prêt automobile de l'OBBBA rédigée comme « au-dessus de la ligne »

Une déclaration rédigée indique : « La nouvelle déduction d'intérêts de prêt automobile de l'OBBBA est une déduction au-dessus de la ligne qui réduit l'AGI du client. » Elle est plausible, bien écrite, et fausse. Les intérêts de prêt sur véhicule de tourisme admissible sont une déduction en dessous de la ligne en vertu du §63(b)(7) ; ils ne réduisent pas l'AGI. Selon le propre README de la démonstration, les guides grand public de préparation fiscale (y compris le site de H&R Block) l'ont mal étiquetée comme au-dessus de la ligne. StatuteGuard renvoie BLOCK: DO NOT FILE, anime la chaîne de citations §163(h)(1) → §163(h)(4)(A) → §63(b)(7) → §62/§63, et signale une cascade en aval à 5 voies de ce qui casse si l'on dépose tel que rédigé : AGI, impôt d'État arrimé à l'AGI, cotisations Medicare IRMAA, le plancher de déduction pour frais médicaux, et le remboursement des prêts étudiants en fonction du revenu.

Écran de verdict StatuteGuard montrant BLOCK: DO NOT FILE sur la position d'intérêts de prêt automobile de l'OBBBA, avec l'étape d'ancrage statutaire rendue en 7 microsecondes, six nœuds statutaires de §163(h)(1) jusqu'à §63, et une cascade en aval en cinq panneaux pour l'AGI, l'impôt sur le revenu d'État, Medicare IRMAA, le plancher des frais médicaux, et l'IDR des prêts étudiants.

L'étape d'extraction a pris 5.93s ; l'ancrage déterministe a rendu son verdict en microsecondes.

Un échange §1031 conforme passe

Un échange de biens de même nature conforme portant sur un bien immobilier d'investissement renvoie CLEARED: safe to file as drafted, avec sa propre chaîne de citations à deux nœuds (§1031(a)(1) et §1031(a)(2)-TCJA). C'est la discipline qui compte : une position correcte n'est jamais signalée à tort. La précision de la porte est de 100% avec 0 faux blocages sur le jeu de référence.

StatuteGuard montrant CLEARED, sûr à déposer, sur un échange de biens de même nature §1031 portant sur un bien immobilier d'investissement, avec un graphe d'ancrage statutaire à deux nœuds pour §1031(a)(1) et §1031(a)(2)-TCJA.

Une zone grise du §280A est escaladée

Une position de bureau à domicile dont le dossier n'établit pas un usage professionnel exclusif est un test de faits et de circonstances, hors de la couverture déterministe. StatuteGuard renvoie NEEDS HUMAN REVIEW plutôt que de bluffer. Le LLM propose une revendication vérifiable et indique sa confiance ; en dessous du plancher, la position est escaladée, jamais tranchée par le modèle.

StatuteGuard exécutant le pipeline sur une position de bureau à domicile §280A dont le dossier n'établit pas l'usage exclusif, avec la légende indiquant que la position en zone grise est acheminée vers NEEDS HUMAN REVIEW.

Vous pouvez lire les politiques vous-même

Le visualiseur Policy Rules montre la logique statutaire déterministe sous forme de tables de décision lisibles à côté de la véritable source OPA/Rego. C'est tout l'intérêt d'une couche de vérification que vous pouvez défendre : vous confirmez que le code correspond à la loi, plutôt que de faire confiance au résumé qu'en donne un modèle.

Panneau Policy Rules de StatuteGuard montrant des tables de décision pour le bureau à domicile §280A et le crédit pour véhicule propre §30D, y compris les plafonds MSRP et les plafonds d'AGI modifié, au-dessus des commentaires de la source OPA/Rego réelle.

Chaque verdict écrit un dossier déposable

L'étape d'audit produit une liasse de diligence raisonnable Form SG-6662 : la source, l'autorité statutaire primaire, la revendication extraite, le récit de détermination, et la chaîne de citations complète, prêts à imprimer ou à enregistrer en PDF et à conserver dans le dossier client. Il étaye une position de cause raisonnable au titre du §6662 ; ce n'est pas un conseil.

Certificat de diligence raisonnable imprimable StatuteGuard, Form SG-6662, pour la position OBBBA bloquée, montrant la liasse source, la source primaire, la revendication extraite, une liste de contrôle de détermination de diligence raisonnable, le récit de détermination, et la chaîne de citations statutaires.

Mesuré sur un jeu de référence étiqueté, évalué localement

Run Benchmark rejoue un jeu de référence étiqueté de 42 positions (14 correctes, 16 en erreur, 12 à escalader). Le tableau de bord indique 71.4% de couverture déterministe, 100% de précision de la porte avec 0 faux blocages, 100% de complétude de détection d'erreurs, et 100% d'escalade correcte des zones grises, chaque verdict correspondant à son étiquette. Ces chiffres décrivent la couche de vérification, pas un taux d'erreur de modèle, ils tiennent donc à mesure que les modèles de base s'améliorent. Pendant la construction, les verdicts ont été recoupés avec OPA 1.17.1 et ont concordé exactement avec le jumeau en Python pur sur les 42 cas.

Tableau de bord du benchmark du jeu de référence StatuteGuard : 71.4% de couverture déterministe, 100% de précision de la porte avec zéro faux blocage, 100% de complétude de détection d'erreurs, 100% des zones grises correctement escaladées, et 58,648 positions par seconde, au-dessus d'un tableau par cas des verdicts attendus versus réels.

Ces chiffres sont mesurés sur un jeu de référence étiqueté fixe de 42 cas des dispositions encodées, et non une garantie en monde ouvert.

Où une couche de vérification s'insère

StatuteGuard ne concurrence pas votre outil de rédaction et ne remplace pas une plateforme de conformité. Il se superpose à ce que vous utilisez déjà et vérifie la seule chose qu'ils ne peuvent pas : si la position rédigée tient face à la loi.

Question IA de rédaction (ONESOURCE, CCH Axcess, Blue J, ChatGPT) Autocontrôle LLM StatuteGuard
Mission principale Préparer et rédiger des positions Relire son propre brouillon Vérifier une position rédigée par rapport à la loi
Qui rend le verdict Un modèle de langage Le même modèle, les mêmes poids Un moteur de politiques déterministe (OPA/Rego)
Sur une véritable zone grise Produit une prose assurée Produit une prose assurée Escalade vers un humain (NEEDS-REVIEW / OUT-OF-COVERAGE)
Dossier §6662 déposable Non Non Oui, une liasse de diligence raisonnable imprimable
Lit la sortie de n'importe quelle plateforme Lié à son propre produit Lié à son propre modèle Indépendant des fournisseurs par conception

Ce que cette démonstration ne fait pas

  • C'est une démonstration exécutable, pas un pipeline déployé. Elle prouve le mécanisme ; ce n'est pas un système de production avec des clients.
  • Les connecteurs ONESOURCE, CCH Axcess et Blue J, les appels LLM en direct, et le graphe Neo4j sont simulés ou stubbés. La démonstration s'exécute sur une extraction par rejeu en cache et un graphe JSON en mémoire afin de fonctionner hors ligne ; FastAPI et Neo4j sont le remplacement de production documenté.
  • Chaque position montrée est synthétique. La logique statutaire est ancrée dans le droit primaire (IRC et Federal Register) ; les positions sont illustratives, pas de véritables contribuables ou clients.
  • Elle encode un ensemble précis de dispositions, pas l'IRC dans son intégralité. Tout ce qui est hors de cet ensemble renvoie OUT-OF-COVERAGE et est acheminé vers un humain.
  • Les chiffres du benchmark tiennent sur le jeu de référence étiqueté de 42 cas des dispositions encodées. Ils ne constituent pas une garantie en monde ouvert de « zéro erreur » ni de « conformité garantie ».
  • Elle étaye une position de cause raisonnable et de diligence raisonnable au titre du §6662. Ce n'est pas un conseil fiscal ou juridique.

Les questions qu'une équipe fiscale et de conformité pose réellement

En quoi cela diffère-t-il de notre logiciel de préparation fiscale ou d'un outil de recherche par IA comme Blue J ?

Ces outils rédigent et préparent. StatuteGuard vérifie. C'est une couche indépendante des fournisseurs qui se superpose à la plateforme que vous utilisez déjà : collez une position provenant de ONESOURCE, CCH Axcess, Blue J, ChatGPT ou d'un modèle interne, et il renvoie un PASS, BLOCK ou NEEDS-REVIEW catégorique par rapport à la loi encodée. Il ne prépare pas les déclarations et ne remplace pas une plateforme de conformité ; il détecte les erreurs au niveau des positions que l'outil de rédaction ne peut pas voir.

Puis-je faire confiance à une IA pour vérifier le travail d'une autre IA ?

Non, et StatuteGuard ne vous le demande pas. La seule étape LLM est l'extraction, qui transforme un langage désordonné en une revendication structurée. Le verdict est rendu par un moteur de politiques déterministe (véritable OPA/Rego, ou un jumeau identique en Python pur), que le modèle ne peut pas outrepasser. On ne peut pas faire confiance à un LLM pour surveiller un LLM à travers les mêmes poids qui ont produit l'erreur, donc la décision vit en dehors du modèle, dans du code de politique que vous pouvez lire par rapport à la loi.

Que se passe-t-il lorsqu'une position tombe dans une zone grise que les règles ne couvrent pas ?

Elle est escaladée vers un humain au lieu de deviner. Une véritable question de faits et de circonstances (un bureau à domicile §280A, par exemple) renvoie NEEDS-REVIEW ; une disposition non encodée dans cette version renvoie OUT-OF-COVERAGE. Les deux sont acheminées vers un réviseur plutôt que vers un bluff assuré. Sur le jeu de référence étiqueté de 42 cas, les zones grises ont été correctement escaladées 100% du temps ; la couverture est indiquée honnêtement à 71.4%.

Nos données clients ou la position quittent-elles notre environnement ?

La démonstration s'exécute entièrement en local, sans clé API, en utilisant par défaut une extraction par rejeu en cache, de sorte qu'aucune position ni donnée client n'a à quitter le périmètre. Cette posture locale, fermée et auditable est délibérée après l'arrêt Heppner (SDNY, février 2026) qui a soulevé une question de renonciation au secret professionnel à propos d'une requête de recherche dans un outil d'IA public. L'architecture est conçue pour préserver le secret professionnel, pas pour envoyer des positions à un service extérieur.

Y a-t-il une connexion en direct à ONESOURCE, CCH Axcess ou Blue J ?

Pas dans cette démonstration. Les connecteurs REST ONESOURCE, CCH Axcess et Blue J, les appels LLM en direct, et le graphe Neo4j sont simulés ou stubbés ; la démonstration s'exécute sur un rejeu en cache et un graphe JSON en mémoire afin de toujours fonctionner hors ligne. Le mécanisme de vérification est réel et indépendant des fournisseurs par conception ; la version de production documente FastAPI, Neo4j et les connecteurs en direct comme voie de remplacement.

Que signifient réellement les chiffres de 71.4% de couverture et de 100% de précision ?

Ils sont mesurés sur un jeu de référence étiqueté fixe de 42 positions des dispositions encodées, et non une garantie en monde ouvert. Sur cet ensemble : 71.4% des positions ont été tranchées de façon déterministe sans escalade, la précision de la porte était de 100% avec 0 faux blocages, et chaque verdict correspondait à son étiquette. Ces chiffres décrivent la couverture et la précision de la couche de vérification, pas un taux d'erreur de modèle, c'est pourquoi ils tiennent à mesure que les modèles de base s'améliorent. Elle étaye une position de diligence raisonnable au titre du §6662 ; ce n'est pas un conseil fiscal ou juridique.

Recherche technique

La recherche derrière cette démonstration — l'architecture, la conception de la vérification, et le plan directeur d'entreprise.

Placez une couche de vérification entre votre IA et votre signature

La pénalité de 20% pèse sur la personne qui signe, pas sur le modèle qui a rédigé. Un vérificateur déterministe est le moyen de prouver quelle disposition statutaire a étayé quelle position.

Si votre équipe réfléchit à la façon de vérifier des positions fiscales rédigées par l'IA sans confier à un modèle le soin d'en surveiller un autre, nous aimerions sincèrement échanger sur la façon dont vous l'envisagez. Le problème est à l'échelle du secteur, et les réponses le seront aussi.

Évaluation de la vérification

  • Cartographier où les positions rédigées par l'IA entrent dans votre flux de dépôt
  • Identifier les dispositions à la pénalité la plus élevée à encoder en premier
  • Examiner votre piste de preuves actuelle de diligence raisonnable au titre du §6662
  • Évaluer le risque de levée du secret professionnel post-Heppner lié à vos outils d'IA

Construire une couche déterministe

  • Encoder vos dispositions prioritaires en politique OPA/Rego lisible
  • Mettre en place la porte PASS / BLOCK / NEEDS-REVIEW sur votre plateforme
  • Brancher des connecteurs indépendants des fournisseurs aux outils que vous exécutez déjà
  • Générer des dossiers §6662 déposables avec une chaîne de citations complète
Réseaux sociaux

Également publié sur