KI-Verifizierung der Steuercompliance

Ihre Steuer-KI hat kein Genauigkeitsproblem. Sie hat ein Verifizierungsproblem.

StatuteGuard ist eine anbieterneutrale Schicht, die KI-entworfene Steuerpositionen deterministisch gegen das kodierte Gesetz belegt. Fügen Sie eine Position von einer beliebigen Plattform ein, und sie liefert ein hartes PASS, BLOCK oder NEEDS-REVIEW mit einer gesetzlichen Zitierkette und einem einreichungsfähigen IRC-§6662-Audit-Datensatz zurück. Der Agent berät, der Code entscheidet.

71.4%

Deterministische Abdeckung

Gelabeltes Golden Set mit 42 Fällen

100%

Gate-Präzision, 0 falsche Blocks

Gelabeltes Golden Set mit 42 Fällen

20%

IRC-§6662-Genauigkeitsstrafe

Trifft den Menschen, der unterschrieben hat

Eine lauffähige Demo, keine Produktivsetzung. Alle Positionen sind synthetisch; die gesetzliche Logik stützt sich auf Primärrecht. Keine Steuer- oder Rechtsberatung.

Das Vorbereitungsproblem wird gelöst. Das Verifizierungsproblem nicht.

Die Branche ist in einem Wettlauf, den Entwurf zu automatisieren. Thomson Reuters „Ready to Review“ bereitet 1040s automatisch vor, CCH Axcess Expert AI entwirft Beratungshinweise in Tausenden von Kanzleien, und Blue J beantwortet Recherchefragen. Was niemand automatisiert hat, ist der Schritt mit der höchsten Strafe: Ist diese Position unter dem Gesetz tatsächlich verteidigungsfähig?

Der eigentliche Fehlermodus ist nicht schlechte Grammatik. Es ist selbstsichere Fehlklassifikation: eine plausible, gut geschriebene Position, die einen Abzug in die falsche Zeile setzt. Wenn eine KI einen Abzug als Above-the-Line statt als Below-the-Line fehlklassifiziert, gilt die 20%ige IRC-§6662-genauigkeitsbezogene Strafe für den Menschen, der die Erklärung unterschrieben hat, nicht für den Algorithmus, der sie entworfen hat. Die §6663-Betrugsstrafe reicht bis zu 75%. Die US-Unternehmens-Steuercompliance kostet bereits mehr als $126B pro Jahr, und die IRS-Betriebsprüfungsquote für Großunternehmen ist von 8.8% auf 22.6% gestiegen (WP#1 Lösungsrecherche, 2026).

Man kann einem LLM nicht vertrauen, ein LLM über dieselben Gewichte zu überwachen, die den Fehler erzeugt haben. Eine modellinterne Selbstprüfung führt genau das Reasoning aus, das die Position ursprünglich fehlklassifiziert hat. Die belastbare Antwort ist Verifizierung, die außerhalb des Modells liegt.

Der Agent berät, der Code entscheidet.

StatuteGuard kehrt das Vertrauensmodell um. Eine KI darf entwerfen, aber eine deterministische Policy-Engine entscheidet, ob die Position verteidigungsfähig ist. Der einzige LLM-Schritt ist die Extraktion: unordentliche natürliche Sprache wird in einen strukturierten, typisierten Claim überführt. Bei Unsicherheit enthält sie sich. Alles danach ist Code, den das Modell nicht übersteuern kann. Wir nennen das neuro-symbolisch: neurale Extraktion, symbolische Verifizierung.

Stufe Was läuft Wer entscheidet
Extrahieren Das LLM liest das Positionsmemo und schlägt einen typisierten Claim vor, mit Angabe seiner Konfidenz. Unterhalb der Konfidenzschwelle eskaliert es, statt aufzulösen. LLM (nur beratend)
Abrufen GraphRAG durchläuft den IRC-Querverweis-Wissensgraphen, um die betroffenen Vorschriften und ihre typisierten Beziehungen zu holen. Deterministisch
Verifizieren Echte OPA/Rego-Policies (oder ein identischer Pure-Python-Zwilling) prüfen den Claim gegen das kodierte Gesetz. Deterministisch
Gate PASS (verteidigungsfähig), BLOCK (widerspricht dem kodierten Gesetz), NEEDS-REVIEW (echter Graubereich) oder OUT-OF-COVERAGE (in V1 nicht kodiert). Deterministisch
Audit Schreibt einen einreichungsfähigen IRC-§6662-Due-Diligence-Datensatz als JSON plus ein druckbares HTML-Zertifikat. Deterministisch

Weil das Urteil Policy-Code ist und kein Modellaufruf, können Sie das Rego lesen und bestätigen, dass es dem Gesetz entspricht. Die Verifizierungsschicht läuft als Infrastruktur, gemessen in Zehntausenden Positionen pro Sekunde (rund 40k bis 60k über Läufe hinweg, abhängig von Maschine und Lauf), nicht als Modellinferenz pro Position.

Die in dieser Version kodierten Vorschriften: OBBBA QPVLI (§163(h)(4) / §63(b)(7)), §199A QBI, die §163(j)-Zinsabzugsbeschränkung für Unternehmen, §1031 Like-Kind-Tausch, §280A Homeoffice, die §30D-Clean-Vehicle-Steuergutschrift und die §62/§63-AGI-Unterscheidung. Alles außerhalb dieses Satzes liefert OUT-OF-COVERAGE und geht an einen Menschen. StatuteGuard behauptet nicht, den gesamten IRC zu kodieren.

Was es erkennt, auf drei Arten gezeigt

Die Demo führt ein BLOCK, ein PASS und eine Eskalation vor, jeweils an synthetischen Positionen. Die Screenshots unten sind echte Aufnahmen der laufenden App.

Der Anker: eine OBBBA-Autokreditzins-Position, entworfen als Above-the-Line

Eine entworfene Aussage lautet: „The new OBBBA car-loan interest deduction is an above-the-line deduction that reduces the client's AGI.“ Sie ist plausibel, gut geschrieben und falsch. Qualified-Passenger-Vehicle-Loan-Interest ist ein Below-the-Line-Abzug nach §63(b)(7); er mindert das AGI nicht. Laut der README der Demo selbst haben gängige Hinweise zur Steuererstellung (einschließlich der Seite von H&R Block) sie als Above-the-Line fehlbeschriftet. StatuteGuard liefert BLOCK: DO NOT FILE, animiert die Zitierkette §163(h)(1) → §163(h)(4)(A) → §63(b)(7) → §62/§63 und markiert eine 5-Wege-Kaskade nachgelagerter Brüche, wenn wie entworfen eingereicht wird: AGI, AGI-gekoppelte bundesstaatliche Steuer, Medicare-IRMAA-Prämien, die Schwelle des Krankheitskostenabzugs und die einkommensabhängige Rückzahlung von Studiendarlehen.

StatuteGuard-Urteilsbildschirm mit BLOCK: DO NOT FILE zur OBBBA-Autokreditzins-Position, mit der Statute-Grounding-Stufe in 7 Mikrosekunden gerendert, sechs gesetzlichen Knoten von §163(h)(1) bis §63 und einer Fünf-Panel-Kaskade nachgelagerter Wirkungen für AGI, bundesstaatliche Einkommensteuer, Medicare IRMAA, die Krankheitskosten-Schwelle und Studiendarlehen-IDR.

Der Extraktionsschritt dauerte 5.93s; das deterministische Grounding hat sein Urteil in Mikrosekunden gerendert.

Ein sauberer §1031-Tausch besteht

Ein konformer Like-Kind-Tausch von Anlageimmobilien liefert CLEARED: safe to file as drafted, mit einer eigenen Zwei-Knoten-Zitierkette (§1031(a)(1) und §1031(a)(2)-TCJA). Das ist die Disziplin, auf die es ankommt: eine korrekte Position wird nie fälschlich markiert. Die Gate-Präzision beträgt 100% bei 0 falschen Blocks auf dem Golden Set.

StatuteGuard zeigt CLEARED, safe to file, bei einem §1031-Like-Kind-Tausch von Anlageimmobilien, mit einem Zwei-Knoten-Statute-Grounding-Graphen für §1031(a)(1) und §1031(a)(2)-TCJA.

Ein §280A-Graubereich eskaliert

Eine Homeoffice-Position, bei der die Akte keine ausschließliche betriebliche Nutzung belegt, ist ein Tatsachen-und-Umstände-Test, außerhalb der deterministischen Abdeckung. StatuteGuard liefert NEEDS HUMAN REVIEW statt zu bluffen. Das LLM schlägt einen prüfbaren Claim vor und meldet die Konfidenz; unterhalb der Schwelle wird die Position eskaliert, niemals vom Modell aufgelöst.

StatuteGuard führt die Pipeline an einer §280A-Homeoffice-Position aus, deren Akte keine ausschließliche Nutzung belegt; die Bildunterschrift vermerkt, dass die Graubereich-Position an NEEDS HUMAN REVIEW geht.

Sie können die Policies selbst lesen

Die Policy-Rules-Ansicht zeigt die deterministische gesetzliche Logik als lesbare Entscheidungstabellen neben dem echten OPA/Rego-Quelltext. Das ist der Sinn einer Verifizierungsschicht, die Sie verteidigen können: Sie bestätigen, dass der Code dem Gesetz entspricht, statt der Zusammenfassung eines Modells zu vertrauen.

StatuteGuard-Policy-Rules-Panel mit Entscheidungstabellen für §280A Homeoffice und die §30D-Clean-Vehicle-Steuergutschrift, einschließlich der MSRP-Obergrenzen und der Obergrenzen für modifiziertes AGI, oberhalb der echten OPA/Rego-Quellkommentare.

Jedes Urteil schreibt einen einreichungsfähigen Datensatz

Die Audit-Stufe erzeugt ein Form SG-6662 Due-Diligence-Arbeitspapier: die Quelle, die primäre gesetzliche Autorität, den extrahierten Claim, die Feststellungserzählung und die vollständige Zitierkette, bereit zum Drucken oder Speichern als PDF und zur Ablage in der Mandantenakte. Es stützt eine §6662-Reasonable-Cause-Position; es ist keine Beratung.

StatuteGuard-druckbares Due-Diligence-Zertifikat, Form SG-6662, für die geblockte OBBBA-Position, mit dem Quellen-Arbeitspapier, der Primärquelle, dem extrahierten Claim, einer Due-Diligence-Feststellungscheckliste, der Feststellungserzählung und der gesetzlichen Zitierkette.

Gemessen an einem gelabelten Golden Set, lokal ausgewertet

Run Benchmark spielt ein gelabeltes Golden Set mit 42 Positionen erneut ab (14 sauber, 16 Fehler, 12 eskalieren). Die Anzeigetafel weist 71.4% deterministische Abdeckung, 100% Gate-Präzision bei 0 falschen Blocks, 100% Vollständigkeit der Fehlererkennung und 100% korrekte Eskalation von Graubereichen aus, wobei jedes Urteil seinem Label entspricht. Diese Zahlen beschreiben die Verifizierungsschicht, nicht eine Modellfehlerrate, daher halten sie, wenn Basismodelle besser werden. Beim Bau wurden die Urteile gegen OPA 1.17.1 gegengeprüft und stimmten auf allen 42 Fällen exakt mit dem Pure-Python-Zwilling überein.

StatuteGuard-Golden-Set-Benchmark-Anzeigetafel: 71.4% deterministische Abdeckung, 100% Gate-Präzision bei null falschen Blocks, 100% Vollständigkeit der Fehlererkennung, 100% korrekt eskalierte Graubereiche und 58,648 Positionen pro Sekunde, oberhalb einer Tabelle je Fall von erwarteten versus tatsächlichen Urteilen.

Diese Zahlen sind an einem festen gelabelten Golden Set mit 42 Fällen der kodierten Vorschriften gemessen, keine Garantie für die offene Welt.

Wo eine Verifizierungsschicht hingehört

StatuteGuard konkurriert nicht mit Ihrem Entwurfswerkzeug und ersetzt keine Compliance-Plattform. Es sitzt auf dem, was Sie bereits nutzen, und prüft das eine, was jene nicht können: ob die entworfene Position gegen das Gesetz hält.

Frage Entwurfs-KI (ONESOURCE, CCH Axcess, Blue J, ChatGPT) LLM-Selbstprüfung StatuteGuard
Primäre Aufgabe Positionen vorbereiten und entwerfen Den eigenen Entwurf erneut lesen Eine entworfene Position gegen das Gesetz verifizieren
Wer das Urteil fällt Ein Sprachmodell Dasselbe Modell, dieselben Gewichte Eine deterministische Policy-Engine (OPA/Rego)
Bei einem echten Graubereich Erzeugt selbstsichere Prosa Erzeugt selbstsichere Prosa Eskaliert an einen Menschen (NEEDS-REVIEW / OUT-OF-COVERAGE)
Einreichungsfähiger §6662-Datensatz Nein Nein Ja, ein druckbares Due-Diligence-Arbeitspapier
Liest die Ausgabe jeder Plattform An das eigene Produkt gebunden An das eigene Modell gebunden Anbieterneutral durch Design

Was diese Demo nicht tut

  • Sie ist eine lauffähige Demo, keine produktiv gesetzte Pipeline. Sie belegt den Mechanismus; sie ist kein Produktionssystem mit Kunden.
  • Die Konnektoren von ONESOURCE, CCH Axcess und Blue J, die Live-LLM-Aufrufe und der Neo4j-Graph sind simuliert oder gestubbt. Die Demo läuft auf Cached-Replay-Extraktion und einem JSON-Graphen im Speicher, damit sie offline funktioniert; FastAPI und Neo4j sind der dokumentierte Produktionstausch.
  • Jede gezeigte Position ist synthetisch. Die gesetzliche Logik stützt sich auf Primärrecht (IRC und das Federal Register); die Positionen sind illustrativ, keine echten Steuerpflichtigen oder Mandanten.
  • Sie kodiert einen bestimmten Vorschriftensatz, nicht den gesamten IRC. Alles außerhalb liefert OUT-OF-COVERAGE und geht an einen Menschen.
  • Die Benchmark-Zahlen gelten auf dem gelabelten Golden Set mit 42 Fällen der kodierten Vorschriften. Sie sind keine Garantie für die offene Welt von „null Fehlern“ oder „garantierter Compliance“.
  • Sie stützt eine §6662-Reasonable-Cause- und Due-Diligence-Position. Es ist keine Steuer- oder Rechtsberatung.

Fragen, die ein Steuer- und Compliance-Team tatsächlich stellt

Wie unterscheidet sich das von unserer Steuererstellungssoftware oder einem KI-Recherchewerkzeug wie Blue J?

Diese Werkzeuge entwerfen und bereiten vor. StatuteGuard verifiziert. Es ist eine anbieterneutrale Schicht, die auf der Plattform sitzt, die Sie bereits nutzen: Fügen Sie eine Position aus ONESOURCE, CCH Axcess, Blue J, ChatGPT oder einem internen Modell ein, und sie liefert ein hartes PASS, BLOCK oder NEEDS-REVIEW gegen das kodierte Gesetz. Sie erstellt keine Erklärungen und ersetzt keine Compliance-Plattform; sie prüft die positionsbezogenen Fehler, die das Entwurfswerkzeug nicht sehen kann.

Kann ich einer KI vertrauen, die Arbeit einer anderen KI zu prüfen?

Nein, und StatuteGuard verlangt das auch nicht. Der einzige LLM-Schritt ist die Extraktion, die unordentliche Sprache in einen strukturierten Claim überführt. Das Urteil fällt eine deterministische Policy-Engine (echtes OPA/Rego oder ein identischer Pure-Python-Zwilling), die das Modell nicht übersteuern kann. Man kann einem LLM nicht vertrauen, ein LLM über dieselben Gewichte zu überwachen, die den Fehler erzeugt haben, daher liegt die Entscheidung außerhalb des Modells in Policy-Code, den Sie gegen das Gesetz lesen können.

Was passiert, wenn eine Position in einen Graubereich fällt, den die Regeln nicht abdecken?

Sie eskaliert an einen Menschen, statt zu raten. Eine echte Tatsachen-und-Umstände-Frage (etwa ein §280A-Homeoffice) liefert NEEDS-REVIEW; eine in dieser Version nicht kodierte Vorschrift liefert OUT-OF-COVERAGE. Beide gehen an einen Prüfer statt in einen selbstsicheren Bluff. Auf dem gelabelten Golden Set mit 42 Fällen wurden Graubereiche in 100% der Fälle korrekt eskaliert; die Abdeckung wird ehrlich mit 71.4% angegeben.

Verlassen unsere Mandantendaten oder die Position unsere Umgebung?

Die Demo läuft vollständig lokal ohne API-Schlüssel, standardmäßig mit Cached-Replay-Extraktion, sodass weder Position noch Mandantendaten den Perimeter verlassen müssen. Diese lokale, geschlossene, auditierbare Haltung ist absichtlich, nachdem die Heppner-Entscheidung (SDNY, Februar 2026) eine Privilege-Waiver-Frage zu einer Rechercheanfrage an ein öffentliches KI-Werkzeug aufgeworfen hat. Die Architektur ist privilege-sicher ausgelegt, nicht darauf, Positionen an einen externen Dienst zu senden.

Verbindet es live mit ONESOURCE, CCH Axcess oder Blue J?

Nicht in dieser Demo. Die REST-Konnektoren von ONESOURCE, CCH Axcess und Blue J, die Live-LLM-Aufrufe und der Neo4j-Graph sind simuliert oder gestubbt; die Demo läuft auf Cached Replay und einem JSON-Graphen im Speicher, sodass sie immer offline funktioniert. Der Verifizierungsmechanismus ist echt und durch Design anbieterneutral; der Produktionsaufbau dokumentiert FastAPI, Neo4j und Live-Konnektoren als den Austauschpfad.

Was bedeuten die Zahlen 71.4% Abdeckung und 100% Präzision tatsächlich?

Sie sind an einem festen gelabelten Golden Set mit 42 Positionen der kodierten Vorschriften gemessen, keine Garantie für die offene Welt. Auf diesem Set: 71.4% der Positionen wurden deterministisch ohne Eskalation aufgelöst, die Gate-Präzision betrug 100% bei 0 falschen Blocks, und jedes Urteil entsprach seinem Label. Diese Zahlen beschreiben Abdeckung und Präzision der Verifizierungsschicht, nicht eine Modellfehlerrate, weshalb sie halten, wenn Basismodelle besser werden. Sie stützt eine §6662-Due-Diligence-Position; es ist keine Steuer- oder Rechtsberatung.

Technische Forschung

Die Forschung hinter dieser Demo — die Architektur, das Verifizierungsdesign und die Enterprise-Blaupause.

Setzen Sie eine Verifizierungsschicht zwischen Ihre KI und Ihre Unterschrift

Die 20%-Strafe trifft die Person, die unterschreibt, nicht das Modell, das entworfen hat. Ein deterministischer Verifizierer ist der Weg, nachzuweisen, welche gesetzliche Vorschrift welche Position getragen hat.

Wenn Ihr Team abwägt, wie KI-entworfene Steuerpositionen zu verifizieren sind, ohne einem Modell zu vertrauen, ein anderes zu überwachen, würden wir wirklich gerne Notizen dazu vergleichen, wie Sie darüber denken. Das Problem betrifft die gesamte Branche, und die Antworten werden es auch.

Verifizierungsbewertung

  • Kartieren Sie, wo KI-entworfene Positionen in Ihren Einreichungsworkflow eintreten
  • Identifizieren Sie die Vorschriften mit der höchsten Strafe, die zuerst zu kodieren sind
  • Prüfen Sie Ihren aktuellen §6662-Due-Diligence-Evidenzpfad
  • Bewerten Sie die Privilege-Exposition Ihrer KI-Werkzeuge nach Heppner

Eine deterministische Schicht aufbauen

  • Kodieren Sie Ihre Prioritätsvorschriften als lesbare OPA/Rego-Policy
  • Stellen Sie das PASS-/BLOCK-/NEEDS-REVIEW-Gate auf Ihrer Plattform auf
  • Verdrahten Sie anbieterneutrale Konnektoren mit den Werkzeugen, die Sie bereits betreiben
  • Erzeugen Sie einreichungsfähige §6662-Datensätze mit einer vollständigen Zitierkette
Social

Auch veröffentlicht auf