KI-Verifizierung der Steuercompliance
StatuteGuard ist eine anbieterneutrale Schicht, die KI-entworfene Steuerpositionen deterministisch gegen das kodierte Gesetz belegt. Fügen Sie eine Position von einer beliebigen Plattform ein, und sie liefert ein hartes PASS, BLOCK oder NEEDS-REVIEW mit einer gesetzlichen Zitierkette und einem einreichungsfähigen IRC-§6662-Audit-Datensatz zurück. Der Agent berät, der Code entscheidet.
71.4%
Deterministische Abdeckung
Gelabeltes Golden Set mit 42 Fällen
100%
Gate-Präzision, 0 falsche Blocks
Gelabeltes Golden Set mit 42 Fällen
20%
IRC-§6662-Genauigkeitsstrafe
Trifft den Menschen, der unterschrieben hat
Eine lauffähige Demo, keine Produktivsetzung. Alle Positionen sind synthetisch; die gesetzliche Logik stützt sich auf Primärrecht. Keine Steuer- oder Rechtsberatung.
Die Branche ist in einem Wettlauf, den Entwurf zu automatisieren. Thomson Reuters „Ready to Review“ bereitet 1040s automatisch vor, CCH Axcess Expert AI entwirft Beratungshinweise in Tausenden von Kanzleien, und Blue J beantwortet Recherchefragen. Was niemand automatisiert hat, ist der Schritt mit der höchsten Strafe: Ist diese Position unter dem Gesetz tatsächlich verteidigungsfähig?
Der eigentliche Fehlermodus ist nicht schlechte Grammatik. Es ist selbstsichere Fehlklassifikation: eine plausible, gut geschriebene Position, die einen Abzug in die falsche Zeile setzt. Wenn eine KI einen Abzug als Above-the-Line statt als Below-the-Line fehlklassifiziert, gilt die 20%ige IRC-§6662-genauigkeitsbezogene Strafe für den Menschen, der die Erklärung unterschrieben hat, nicht für den Algorithmus, der sie entworfen hat. Die §6663-Betrugsstrafe reicht bis zu 75%. Die US-Unternehmens-Steuercompliance kostet bereits mehr als $126B pro Jahr, und die IRS-Betriebsprüfungsquote für Großunternehmen ist von 8.8% auf 22.6% gestiegen (WP#1 Lösungsrecherche, 2026).
Man kann einem LLM nicht vertrauen, ein LLM über dieselben Gewichte zu überwachen, die den Fehler erzeugt haben. Eine modellinterne Selbstprüfung führt genau das Reasoning aus, das die Position ursprünglich fehlklassifiziert hat. Die belastbare Antwort ist Verifizierung, die außerhalb des Modells liegt.
StatuteGuard kehrt das Vertrauensmodell um. Eine KI darf entwerfen, aber eine deterministische Policy-Engine entscheidet, ob die Position verteidigungsfähig ist. Der einzige LLM-Schritt ist die Extraktion: unordentliche natürliche Sprache wird in einen strukturierten, typisierten Claim überführt. Bei Unsicherheit enthält sie sich. Alles danach ist Code, den das Modell nicht übersteuern kann. Wir nennen das neuro-symbolisch: neurale Extraktion, symbolische Verifizierung.
| Stufe | Was läuft | Wer entscheidet |
|---|---|---|
| Extrahieren | Das LLM liest das Positionsmemo und schlägt einen typisierten Claim vor, mit Angabe seiner Konfidenz. Unterhalb der Konfidenzschwelle eskaliert es, statt aufzulösen. | LLM (nur beratend) |
| Abrufen | GraphRAG durchläuft den IRC-Querverweis-Wissensgraphen, um die betroffenen Vorschriften und ihre typisierten Beziehungen zu holen. | Deterministisch |
| Verifizieren | Echte OPA/Rego-Policies (oder ein identischer Pure-Python-Zwilling) prüfen den Claim gegen das kodierte Gesetz. | Deterministisch |
| Gate | PASS (verteidigungsfähig), BLOCK (widerspricht dem kodierten Gesetz), NEEDS-REVIEW (echter Graubereich) oder OUT-OF-COVERAGE (in V1 nicht kodiert). | Deterministisch |
| Audit | Schreibt einen einreichungsfähigen IRC-§6662-Due-Diligence-Datensatz als JSON plus ein druckbares HTML-Zertifikat. | Deterministisch |
Weil das Urteil Policy-Code ist und kein Modellaufruf, können Sie das Rego lesen und bestätigen, dass es dem Gesetz entspricht. Die Verifizierungsschicht läuft als Infrastruktur, gemessen in Zehntausenden Positionen pro Sekunde (rund 40k bis 60k über Läufe hinweg, abhängig von Maschine und Lauf), nicht als Modellinferenz pro Position.
Die in dieser Version kodierten Vorschriften: OBBBA QPVLI (§163(h)(4) / §63(b)(7)), §199A QBI, die §163(j)-Zinsabzugsbeschränkung für Unternehmen, §1031 Like-Kind-Tausch, §280A Homeoffice, die §30D-Clean-Vehicle-Steuergutschrift und die §62/§63-AGI-Unterscheidung. Alles außerhalb dieses Satzes liefert OUT-OF-COVERAGE und geht an einen Menschen. StatuteGuard behauptet nicht, den gesamten IRC zu kodieren.
Die Demo führt ein BLOCK, ein PASS und eine Eskalation vor, jeweils an synthetischen Positionen. Die Screenshots unten sind echte Aufnahmen der laufenden App.
Eine entworfene Aussage lautet: „The new OBBBA car-loan interest deduction is an above-the-line deduction that reduces the client's AGI.“ Sie ist plausibel, gut geschrieben und falsch. Qualified-Passenger-Vehicle-Loan-Interest ist ein Below-the-Line-Abzug nach §63(b)(7); er mindert das AGI nicht. Laut der README der Demo selbst haben gängige Hinweise zur Steuererstellung (einschließlich der Seite von H&R Block) sie als Above-the-Line fehlbeschriftet. StatuteGuard liefert BLOCK: DO NOT FILE, animiert die Zitierkette §163(h)(1) → §163(h)(4)(A) → §63(b)(7) → §62/§63 und markiert eine 5-Wege-Kaskade nachgelagerter Brüche, wenn wie entworfen eingereicht wird: AGI, AGI-gekoppelte bundesstaatliche Steuer, Medicare-IRMAA-Prämien, die Schwelle des Krankheitskostenabzugs und die einkommensabhängige Rückzahlung von Studiendarlehen.
Der Extraktionsschritt dauerte 5.93s; das deterministische Grounding hat sein Urteil in Mikrosekunden gerendert.
Ein konformer Like-Kind-Tausch von Anlageimmobilien liefert CLEARED: safe to file as drafted, mit einer eigenen Zwei-Knoten-Zitierkette (§1031(a)(1) und §1031(a)(2)-TCJA). Das ist die Disziplin, auf die es ankommt: eine korrekte Position wird nie fälschlich markiert. Die Gate-Präzision beträgt 100% bei 0 falschen Blocks auf dem Golden Set.
Eine Homeoffice-Position, bei der die Akte keine ausschließliche betriebliche Nutzung belegt, ist ein Tatsachen-und-Umstände-Test, außerhalb der deterministischen Abdeckung. StatuteGuard liefert NEEDS HUMAN REVIEW statt zu bluffen. Das LLM schlägt einen prüfbaren Claim vor und meldet die Konfidenz; unterhalb der Schwelle wird die Position eskaliert, niemals vom Modell aufgelöst.
Die Policy-Rules-Ansicht zeigt die deterministische gesetzliche Logik als lesbare Entscheidungstabellen neben dem echten OPA/Rego-Quelltext. Das ist der Sinn einer Verifizierungsschicht, die Sie verteidigen können: Sie bestätigen, dass der Code dem Gesetz entspricht, statt der Zusammenfassung eines Modells zu vertrauen.
Die Audit-Stufe erzeugt ein Form SG-6662 Due-Diligence-Arbeitspapier: die Quelle, die primäre gesetzliche Autorität, den extrahierten Claim, die Feststellungserzählung und die vollständige Zitierkette, bereit zum Drucken oder Speichern als PDF und zur Ablage in der Mandantenakte. Es stützt eine §6662-Reasonable-Cause-Position; es ist keine Beratung.
Run Benchmark spielt ein gelabeltes Golden Set mit 42 Positionen erneut ab (14 sauber, 16 Fehler, 12 eskalieren). Die Anzeigetafel weist 71.4% deterministische Abdeckung, 100% Gate-Präzision bei 0 falschen Blocks, 100% Vollständigkeit der Fehlererkennung und 100% korrekte Eskalation von Graubereichen aus, wobei jedes Urteil seinem Label entspricht. Diese Zahlen beschreiben die Verifizierungsschicht, nicht eine Modellfehlerrate, daher halten sie, wenn Basismodelle besser werden. Beim Bau wurden die Urteile gegen OPA 1.17.1 gegengeprüft und stimmten auf allen 42 Fällen exakt mit dem Pure-Python-Zwilling überein.
Diese Zahlen sind an einem festen gelabelten Golden Set mit 42 Fällen der kodierten Vorschriften gemessen, keine Garantie für die offene Welt.
StatuteGuard konkurriert nicht mit Ihrem Entwurfswerkzeug und ersetzt keine Compliance-Plattform. Es sitzt auf dem, was Sie bereits nutzen, und prüft das eine, was jene nicht können: ob die entworfene Position gegen das Gesetz hält.
| Frage | Entwurfs-KI (ONESOURCE, CCH Axcess, Blue J, ChatGPT) | LLM-Selbstprüfung | StatuteGuard |
|---|---|---|---|
| Primäre Aufgabe | Positionen vorbereiten und entwerfen | Den eigenen Entwurf erneut lesen | Eine entworfene Position gegen das Gesetz verifizieren |
| Wer das Urteil fällt | Ein Sprachmodell | Dasselbe Modell, dieselben Gewichte | Eine deterministische Policy-Engine (OPA/Rego) |
| Bei einem echten Graubereich | Erzeugt selbstsichere Prosa | Erzeugt selbstsichere Prosa | Eskaliert an einen Menschen (NEEDS-REVIEW / OUT-OF-COVERAGE) |
| Einreichungsfähiger §6662-Datensatz | Nein | Nein | Ja, ein druckbares Due-Diligence-Arbeitspapier |
| Liest die Ausgabe jeder Plattform | An das eigene Produkt gebunden | An das eigene Modell gebunden | Anbieterneutral durch Design |
Diese Werkzeuge entwerfen und bereiten vor. StatuteGuard verifiziert. Es ist eine anbieterneutrale Schicht, die auf der Plattform sitzt, die Sie bereits nutzen: Fügen Sie eine Position aus ONESOURCE, CCH Axcess, Blue J, ChatGPT oder einem internen Modell ein, und sie liefert ein hartes PASS, BLOCK oder NEEDS-REVIEW gegen das kodierte Gesetz. Sie erstellt keine Erklärungen und ersetzt keine Compliance-Plattform; sie prüft die positionsbezogenen Fehler, die das Entwurfswerkzeug nicht sehen kann.
Nein, und StatuteGuard verlangt das auch nicht. Der einzige LLM-Schritt ist die Extraktion, die unordentliche Sprache in einen strukturierten Claim überführt. Das Urteil fällt eine deterministische Policy-Engine (echtes OPA/Rego oder ein identischer Pure-Python-Zwilling), die das Modell nicht übersteuern kann. Man kann einem LLM nicht vertrauen, ein LLM über dieselben Gewichte zu überwachen, die den Fehler erzeugt haben, daher liegt die Entscheidung außerhalb des Modells in Policy-Code, den Sie gegen das Gesetz lesen können.
Sie eskaliert an einen Menschen, statt zu raten. Eine echte Tatsachen-und-Umstände-Frage (etwa ein §280A-Homeoffice) liefert NEEDS-REVIEW; eine in dieser Version nicht kodierte Vorschrift liefert OUT-OF-COVERAGE. Beide gehen an einen Prüfer statt in einen selbstsicheren Bluff. Auf dem gelabelten Golden Set mit 42 Fällen wurden Graubereiche in 100% der Fälle korrekt eskaliert; die Abdeckung wird ehrlich mit 71.4% angegeben.
Die Demo läuft vollständig lokal ohne API-Schlüssel, standardmäßig mit Cached-Replay-Extraktion, sodass weder Position noch Mandantendaten den Perimeter verlassen müssen. Diese lokale, geschlossene, auditierbare Haltung ist absichtlich, nachdem die Heppner-Entscheidung (SDNY, Februar 2026) eine Privilege-Waiver-Frage zu einer Rechercheanfrage an ein öffentliches KI-Werkzeug aufgeworfen hat. Die Architektur ist privilege-sicher ausgelegt, nicht darauf, Positionen an einen externen Dienst zu senden.
Nicht in dieser Demo. Die REST-Konnektoren von ONESOURCE, CCH Axcess und Blue J, die Live-LLM-Aufrufe und der Neo4j-Graph sind simuliert oder gestubbt; die Demo läuft auf Cached Replay und einem JSON-Graphen im Speicher, sodass sie immer offline funktioniert. Der Verifizierungsmechanismus ist echt und durch Design anbieterneutral; der Produktionsaufbau dokumentiert FastAPI, Neo4j und Live-Konnektoren als den Austauschpfad.
Sie sind an einem festen gelabelten Golden Set mit 42 Positionen der kodierten Vorschriften gemessen, keine Garantie für die offene Welt. Auf diesem Set: 71.4% der Positionen wurden deterministisch ohne Eskalation aufgelöst, die Gate-Präzision betrug 100% bei 0 falschen Blocks, und jedes Urteil entsprach seinem Label. Diese Zahlen beschreiben Abdeckung und Präzision der Verifizierungsschicht, nicht eine Modellfehlerrate, weshalb sie halten, wenn Basismodelle besser werden. Sie stützt eine §6662-Due-Diligence-Position; es ist keine Steuer- oder Rechtsberatung.
Die Forschung hinter dieser Demo — die Architektur, das Verifizierungsdesign und die Enterprise-Blaupause.
Vollständige Lösung
Entdecken Sie die Lösung KI-Verifizierung der Steuercompliance →Die 20%-Strafe trifft die Person, die unterschreibt, nicht das Modell, das entworfen hat. Ein deterministischer Verifizierer ist der Weg, nachzuweisen, welche gesetzliche Vorschrift welche Position getragen hat.
Wenn Ihr Team abwägt, wie KI-entworfene Steuerpositionen zu verifizieren sind, ohne einem Modell zu vertrauen, ein anderes zu überwachen, würden wir wirklich gerne Notizen dazu vergleichen, wie Sie darüber denken. Das Problem betrifft die gesamte Branche, und die Antworten werden es auch.