AI-verificatie van fiscale compliance

Uw fiscale AI heeft geen nauwkeurigheidsprobleem. Het heeft een verificatieprobleem.

StatuteGuard is een leveranciersneutrale laag die door AI opgestelde belastingposities deterministisch toetst aan de gecodeerde wet. Plak een positie van elk platform en het geeft een hard PASS, BLOCK of NEEDS-REVIEW terug, met een wettelijke citatieketen en een indienbaar IRC §6662-auditdossier. Agent adviseert, code beslist.

71.4%

Deterministische dekking

Gelabelde gouden set van 42 cases

100%

Poortprecisie, 0 valse blocks

Gelabelde gouden set van 42 cases

20%

IRC §6662-nauwkeurigheidsboete

Komt terecht bij de mens die tekende

Een uitvoerbare demo, geen uitrol. Alle posities zijn synthetisch; de wettelijke logica is verankerd in primaire wetgeving. Geen fiscaal of juridisch advies.

Het voorbereidingsprobleem wordt opgelost. Het verificatieprobleem niet.

De sector racete om het opstellen te automatiseren. Thomson Reuters "Ready to Review" bereidt 1040s automatisch voor, CCH Axcess Expert AI stelt adviserende inzichten op bij duizenden kantoren, en Blue J beantwoordt onderzoeksvragen. Wat niemand automatiseerde is de stap met de hoogste boete: is deze positie daadwerkelijk verdedigbaar onder de wet?

De echte faalmodus is geen slechte grammatica. Het is zelfverzekerde misclassificatie: een aannemelijke, goed geschreven positie die een aftrekpost op de verkeerde regel zet. Wanneer een AI een aftrekpost classificeert als boven de streep in plaats van onder de streep, geldt de 20% IRC §6662-nauwkeurigheidsgerelateerde boete voor de mens die de aangifte tekende, niet voor het algoritme dat hem opstelde. De §6663-fraudeboete loopt tot 75%. De Amerikaanse zakelijke fiscale compliance kost al meer dan $126B per jaar, en het IRS-auditpercentage voor grote ondernemingen is gestegen van 8.8% naar 22.6% (WP#1-oplossingsonderzoek, 2026).

U kunt een LLM niet vertrouwen om een LLM te controleren via dezelfde gewichten die de fout produceerden. Een in-model zelfcontrole voert exact de redenering uit die de positie in eerste instantie verkeerd classificeerde. Het duurzame antwoord is verificatie die buiten het model leeft.

Agent adviseert, code beslist.

StatuteGuard keert het vertrouwensmodel om. Een AI mag opstellen, maar een deterministische beleidsengine beslist of de positie verdedigbaar is. De enige LLM-stap is extractie: rommelige natuurlijke taal omzetten in een gestructureerde, getypeerde claim. Het onthoudt zich wanneer het onzeker is. Alles stroomafwaarts is code die het model niet kan overrulen. Wij noemen het neuro-symbolisch: neurale extractie, symbolische verificatie.

Fase Wat draait Wie beslist
Extract De LLM leest de positiememo en stelt een getypeerde claim voor, met rapportage van de betrouwbaarheid. Onder de betrouwbaarheidsdrempel escaleert het in plaats van te beslissen. LLM (alleen adviserend)
Retrieve GraphRAG doorloopt de IRC-kruisverwijzingskennisgraaf om de relevante bepalingen en hun getypeerde relaties op te halen. Deterministisch
Verify Echte OPA/Rego-beleidsregels (of een identieke pure-Python-tweeling) toetsen de claim aan de gecodeerde wet. Deterministisch
Gate PASS (verdedigbaar), BLOCK (spreekt de gecodeerde wet tegen), NEEDS-REVIEW (echt grijs gebied), of OUT-OF-COVERAGE (niet gecodeerd in V1). Deterministisch
Audit Schrijft een indienbaar IRC §6662-due-diligence-dossier als JSON plus een afdrukbaar HTML-certificaat. Deterministisch

Omdat het oordeel beleidscode is en geen modelaanroep, kunt u de Rego lezen en bevestigen dat die overeenkomt met de wet. De verificatielaag draait als infrastructuur, gemeten op tienduizenden posities per seconde (ongeveer 40k tot 60k over runs, afhankelijk van machine en run), niet als een modelinferentie per positie.

De in deze versie gecodeerde bepalingen: OBBBA QPVLI (§163(h)(4) / §63(b)(7)), §199A QBI, de §163(j)-beperking van zakelijke rente, §1031 like-kind exchange, §280A thuiskantoor, het §30D-krediet voor schone voertuigen, en het §62/§63-AGI-onderscheid. Alles buiten die set geeft OUT-OF-COVERAGE terug en gaat naar een mens. StatuteGuard claimt niet de volledige IRC te coderen.

Wat het vangt, op drie manieren getoond

De demo doorloopt een BLOCK, een PASS en een escalatie, allemaal op synthetische posities. De screenshots hieronder zijn echte vastleggingen van de draaiende app.

Het anker: een OBBBA-autoleningrentepositie opgesteld als boven de streep

Een opgestelde verklaring luidt: „De nieuwe OBBBA-aftrek voor autoleningrente is een aftrek boven de streep die de AGI van de cliënt verlaagt.” Het is aannemelijk, goed geschreven, en fout. Qualified passenger vehicle loan interest is een aftrek onder de streep onder §63(b)(7); het verlaagt AGI niet. Volgens de eigen README van de demo heeft gangbare belastingaangiftebegeleiding (inclusief de site van H&R Block) het verkeerd gelabeld als boven de streep. StatuteGuard geeft BLOCK: NIET INDIENEN, animeert de citatieketen §163(h)(1) → §163(h)(4)(A) → §63(b)(7) → §62/§63, en markeert een 5-weg-cascade stroomafwaarts van wat breekt als het wordt ingediend zoals opgesteld: AGI, aan AGI gekoppelde staatsbelasting, Medicare IRMAA-premies, de drempel voor medische-kostenaftrek, en inkomensafhankelijke aflossing van studieleningen.

StatuteGuard-oordeelscherm dat BLOCK: NIET INDIENEN toont op de OBBBA-autoleningrentepositie, met de wetverankeringsfase gerenderd in 7 microseconden, zes wettelijke knopen van §163(h)(1) tot en met §63, en een vijf-panelen-cascade stroomafwaarts voor AGI, staatsinkomstenbelasting, Medicare IRMAA, de drempel voor medische-kostenaftrek, en studielening-IDR.

De extractiestap duurde 5.93s; de deterministische verankering renderde het oordeel in microseconden.

Een schone §1031-exchange slaagt

Een conforme like-kind exchange van vastgoed als belegging geeft VRIJGEGEVEN: veilig om in te dienen zoals opgesteld, met een eigen citatieketen van twee knopen (§1031(a)(1) en §1031(a)(2)-TCJA). Dit is de discipline die ertoe doet: een correcte positie wordt nooit ten onrechte gemarkeerd. Poortprecisie is 100% met 0 valse blocks op de gouden set.

StatuteGuard toont VRIJGEGEVEN, veilig om in te dienen, op een §1031 like-kind exchange van vastgoed als belegging, met een wetverankeringsgrafiek van twee knopen voor §1031(a)(1) en §1031(a)(2)-TCJA.

Een §280A-grijs gebied escaleert

Een thuiskantoorpositie waarbij het dossier geen exclusief zakelijk gebruik vaststelt, is een feiten-en-omstandigheden-toets, buiten deterministische dekking. StatuteGuard geeft MENSELIJKE BEOORDELING VEREIST in plaats van te bluffen. De LLM stelt een toetsbare claim voor en rapporteert de betrouwbaarheid; onder de betrouwbaarheidsdrempel wordt de positie geëscaleerd, nooit door het model beslist.

StatuteGuard voert de pijplijn uit op een §280A-thuiskantoorpositie waarvan het dossier geen exclusief gebruik vaststelt, met het bijschrift dat de grijsgebiedpositie naar MENSELIJKE BEOORDELING VEREIST gaat.

U kunt de beleidsregels zelf lezen

De Policy Rules-viewer toont de deterministische wettelijke logica als leesbare beslissingstabellen naast de echte OPA/Rego-bron. Dit is het punt van een verificatielaag die u kunt verdedigen: u bevestigt dat de code overeenkomt met de wet, in plaats van een samenvatting van een model te vertrouwen.

StatuteGuard Policy Rules-paneel met beslissingstabellen voor §280A thuiskantoor en het §30D-krediet voor schone voertuigen, inclusief de MSRP-plafonds en modified-AGI-plafonds, boven de echte OPA/Rego-broncommentaren.

Elk oordeel schrijft een indienbaar dossier

De auditfase produceert een Form SG-6662 due-diligence-werkdocument: de bron, de primaire wettelijke autoriteit, de geëxtraheerde claim, het vaststellingsverhaal, en de volledige citatieketen, klaar om af te drukken of als PDF op te slaan en in het klantdossier te bewaren. Het ondersteunt een §6662 reasonable-cause-positie; het is geen advies.

StatuteGuard afdrukbaar due-diligence-certificaat, Form SG-6662, voor de geblokkeerde OBBBA-positie, met het bronwerkdocument, de primaire bron, de geëxtraheerde claim, een due-diligence-vaststellingschecklist, het vaststellingsverhaal, en de wettelijke citatieketen.

Gemeten op een gelabelde gouden set, lokaal geëvalueerd

Run Benchmark speelt een gelabelde gouden set van 42 posities opnieuw af (14 schoon, 16 fout, 12 escaleren). Het scorebord rapporteert 71.4% deterministische dekking, 100% poortprecisie met 0 valse blocks, 100% volledigheid van foutvangst, en 100% correcte escalatie van grijze gebieden, waarbij elk oordeel overeenkomt met het label. Deze beschrijven de verificatielaag, niet een modelfoutpercentage, dus ze blijven gelden naarmate basismodellen verbeteren. Tijdens de bouw werden de oordelen kruislings gecontroleerd tegen OPA 1.17.1 en kwamen ze exact overeen met de pure-Python-tweeling op alle 42 cases.

StatuteGuard-scorebord van de gouden-set-benchmark: 71.4% deterministische dekking, 100% poortprecisie met nul valse blocks, 100% volledigheid van foutvangst, 100% grijze gebieden correct geëscaleerd, en 58,648 posities per seconde, boven een per-case-tabel van verwachte versus werkelijke oordelen.

Deze cijfers zijn gemeten op een vaste gelabelde gouden set van 42 cases van de gecodeerde bepalingen, geen open-wereldgarantie.

Waar een verificatielaag past

StatuteGuard concurreert niet met uw opsteltool en vervangt geen complianceplatform. Het zit bovenop wat u al gebruikt en controleert het enige wat zij niet kunnen: of de opgestelde positie standhoudt tegen de wet.

Vraag Opstel-AI (ONESOURCE, CCH Axcess, Blue J, ChatGPT) LLM-zelfcontrole StatuteGuard
Primaire taak Posities voorbereiden en opstellen De eigen opgestelde tekst opnieuw lezen Een opgestelde positie toetsen aan de wet
Wie het oordeel velt Een taalmodel Hetzelfde model, dezelfde gewichten Een deterministische beleidsengine (OPA/Rego)
Bij een echt grijs gebied Produceert zelfverzekerd proza Produceert zelfverzekerd proza Escaleert naar een mens (NEEDS-REVIEW / OUT-OF-COVERAGE)
Indienbaar §6662-dossier Nee Nee Ja, een afdrukbaar due-diligence-werkdocument
Leest de output van elk platform Gebonden aan het eigen product Gebonden aan het eigen model Leveranciersneutraal van ontwerp

Wat deze demo niet doet

  • Het is een uitvoerbare demo, geen uitgerolde pijplijn. Het bewijst het mechanisme; het is geen productiesysteem met klanten.
  • De ONESOURCE-, CCH Axcess- en Blue J-connectors, de live LLM-aanroepen en de Neo4j-grafiek zijn gesimuleerd of als stub uitgevoerd. De demo draait op cached-replay-extractie en een in-memory JSON-grafiek zodat het offline werkt; FastAPI en Neo4j zijn de gedocumenteerde productievervanging.
  • Elke getoonde positie is synthetisch. De wettelijke logica is verankerd in primaire wetgeving (IRC en de Federal Register); de posities zijn illustratief, geen echte belastingplichtigen of klanten.
  • Het codeert een specifieke set bepalingen, niet de volledige IRC. Alles daarbuiten geeft OUT-OF-COVERAGE terug en gaat naar een mens.
  • De benchmarkcijfers gelden op de gelabelde gouden set van 42 cases van de gecodeerde bepalingen. Ze zijn geen open-wereldgarantie van „nul fouten” of „gegarandeerde compliance.”
  • Het ondersteunt een §6662 reasonable-cause- en due-diligence-positie. Het is geen fiscaal of juridisch advies.

Vragen die een fiscaal en complianceteam daadwerkelijk stelt

Hoe verschilt dit van onze belastingaangiftesoftware of een AI-onderzoekstool zoals Blue J?

Die tools stellen op en bereiden voor. StatuteGuard verifieert. Het is een leveranciersneutrale laag die bovenop het platform zit dat u al gebruikt: plak een positie van ONESOURCE, CCH Axcess, Blue J, ChatGPT of een intern model, en het geeft een hard PASS, BLOCK of NEEDS-REVIEW terug tegen de gecodeerde wet. Het bereidt geen aangiften voor en vervangt geen complianceplatform; het controleert de fouten op positieniveau die de opsteltool niet kan zien.

Kan ik een AI vertrouwen om het werk van een andere AI te controleren?

Nee, en StatuteGuard vraagt u dat ook niet. De enige LLM-stap is extractie: rommelige taal omzetten in een gestructureerde claim. Het oordeel wordt geveld door een deterministische beleidsengine (echte OPA/Rego, of een identieke pure-Python-tweeling), die het model niet kan overrulen. U kunt een LLM niet vertrouwen om een LLM te controleren via dezelfde gewichten die de fout produceerden, dus de beslissing leeft buiten het model in beleidscode die u tegen de wet kunt lezen.

Wat gebeurt er wanneer een positie in een grijs gebied valt dat de regels niet dekken?

Het escaleert naar een mens in plaats van te gokken. Een echte feiten-en-omstandigheden-vraag (een §280A-thuiskantoor, bijvoorbeeld) geeft NEEDS-REVIEW terug; een bepaling die in deze versie niet is gecodeerd geeft OUT-OF-COVERAGE terug. Beide gaan naar een beoordelaar in plaats van een zelfverzekerde bluf. Op de gelabelde gouden set van 42 cases werden grijze gebieden 100% van de tijd correct geëscaleerd; dekking wordt eerlijk gesteld op 71.4%.

Verlaten onze klantdata of de positie onze omgeving?

De demo draait volledig lokaal zonder API-sleutel, standaard met cached-replay-extractie, zodat geen positie of klantdata de perimeter hoeft te verlaten. Die lokale, gesloten, auditeerbare houding is bewust, nadat de Heppner-uitspraak (SDNY, februari 2026) een vraag over afstand van privilege opwierp over een onderzoeksvraag via een publieke AI-tool. De architectuur is ontworpen om privilege-veilig te zijn, niet om posities naar een externe dienst te sturen.

Koppelt het live aan ONESOURCE, CCH Axcess of Blue J?

Niet in deze demo. De ONESOURCE-, CCH Axcess- en Blue J-REST-connectors, de live LLM-aanroepen en de Neo4j-grafiek zijn gesimuleerd of als stub uitgevoerd; de demo draait op cached replay en een in-memory JSON-grafiek zodat het altijd offline werkt. Het verificatiemechanisme is echt en van ontwerp leveranciersneutraal; de productiebouw documenteert FastAPI, Neo4j en live connectors als het inwisselpad.

Wat betekenen de cijfers van 71.4% dekking en 100% precisie eigenlijk?

Ze zijn gemeten op een vaste gelabelde gouden set van 42 posities van de gecodeerde bepalingen, geen open-wereldgarantie. Op die set: 71.4% van de posities werd deterministisch opgelost zonder escalatie, poortprecisie was 100% met 0 valse blocks, en elk oordeel kwam overeen met het label. Deze beschrijven de dekking en precisie van de verificatielaag, niet een modelfoutpercentage, daarom blijven ze gelden naarmate basismodellen verbeteren. Het ondersteunt een §6662-due-diligence-positie; het is geen fiscaal of juridisch advies.

Technisch onderzoek

Het onderzoek achter deze demo — de architectuur, het verificatieontwerp en de enterprise-blauwdruk.

Zet een verificatielaag tussen uw AI en uw handtekening

De 20%-boete komt terecht bij de persoon die tekent, niet bij het model dat opstelde. Een deterministische verificator is hoe u bewijst welke wettelijke bepaling welke positie ondersteunde.

Als uw team overweegt hoe door AI opgestelde belastingposities te verifiëren zonder het ene model te vertrouwen om het andere te controleren, zouden we oprecht van gedachten willen wisselen over hoe u erover nadenkt. Het probleem is sectorbreed en de antwoorden zullen dat ook zijn.

Verificatiebeoordeling

  • Breng in kaart waar door AI opgestelde posities uw indieningsworkflow binnenkomen
  • Identificeer de bepalingen met de hoogste boete om eerst te coderen
  • Beoordeel uw huidige §6662-due-diligence-bewijsspoor
  • Beoordeel de post-Heppner-privilegeblootstelling van uw AI-tooling

Bouw een deterministische laag

  • Codeer uw prioriteitsbepalingen als leesbaar OPA/Rego-beleid
  • Richt de PASS / BLOCK / NEEDS-REVIEW-poort in op uw platform
  • Koppel leveranciersneutrale connectors aan de tools die u al draait
  • Genereer indienbare §6662-dossiers met een volledige citatieketen
Social

Ook gepubliceerd op