Verificación de cumplimiento fiscal con IA
StatuteGuard es una capa neutral respecto al proveedor que prueba las posiciones fiscales redactadas por IA frente al estatuto codificado, de forma determinista. Pega una posición de cualquier plataforma y devuelve un PASS, BLOCK o NEEDS-REVIEW firme, con una cadena de citas estatutarias y un registro de auditoría IRC §6662 presentable. El agente aconseja, el código decide.
71.4%
Cobertura determinista
Conjunto dorado etiquetado de 42 casos
100%
Precisión de la puerta, 0 bloqueos falsos
Conjunto dorado etiquetado de 42 casos
20%
Sanción por exactitud del IRC §6662
Recae sobre la persona que firmó
Una demostración ejecutable, no un despliegue. Todas las posiciones son sintéticas; la lógica estatutaria se ancla en el derecho primario. No es asesoramiento fiscal ni jurídico.
El sector se apresuró a automatizar la redacción. Thomson Reuters «Ready to Review» prepara automáticamente declaraciones 1040, CCH Axcess Expert AI redacta análisis de asesoría en miles de despachos, y Blue J responde preguntas de investigación. Lo que nadie automatizó es el paso de mayor sanción: ¿es esta posición realmente defendible bajo el estatuto?
El verdadero modo de fallo no es una mala gramática. Es la clasificación errónea hecha con confianza: una posición plausible, bien redactada, que coloca una deducción en la línea equivocada. Cuando una IA clasifica erróneamente una deducción como por encima de la línea en lugar de por debajo de la línea, la sanción relacionada con la exactitud del 20% del IRC §6662 recae sobre la persona que firmó la declaración, no sobre el algoritmo que la redactó. La sanción por fraude del §6663 llega hasta el 75%. El cumplimiento fiscal empresarial de EE. UU. ya cuesta más de $126B al año, y la tasa de auditoría del IRS a grandes corporaciones ha subido del 8.8% al 22.6% (investigación de la solución WP#1, 2026).
No se puede confiar en que un LLM vigile a otro LLM a través de los mismos pesos que produjeron el error. Una autocomprobación intramodelo ejecuta exactamente el razonamiento que clasificó mal la posición en primer lugar. La respuesta duradera es una verificación que vive fuera del modelo.
StatuteGuard invierte el modelo de confianza. Una IA puede redactar, pero un motor de políticas determinista decide si la posición es defendible. El único paso de LLM es la extracción, que convierte el lenguaje natural desordenado en una afirmación estructurada y tipada. Se abstiene cuando no está seguro. Todo lo posterior es código que el modelo no puede anular. Lo llamamos neuro-simbólico: extracción neuronal, verificación simbólica.
| Etapa | Qué se ejecuta | Quién decide |
|---|---|---|
| Extraer | El LLM lee el memorando de la posición y propone una afirmación tipada, informando su confianza. Por debajo del umbral de confianza, escala en lugar de resolver. | LLM (solo consultivo) |
| Recuperar | GraphRAG recorre el grafo de conocimiento de referencias cruzadas del IRC para extraer las disposiciones en juego y sus relaciones tipadas. | Determinista |
| Verificar | Políticas OPA/Rego reales (o un gemelo idéntico en Python puro) contrastan la afirmación con el estatuto codificado. | Determinista |
| Puerta | PASS (defendible), BLOCK (contradice el estatuto codificado), NEEDS-REVIEW (zona gris genuina) u OUT-OF-COVERAGE (no codificado en V1). | Determinista |
| Auditoría | Escribe un registro de diligencia debida IRC §6662 presentable como JSON más un certificado HTML imprimible. | Determinista |
Como el veredicto es código de políticas y no una llamada al modelo, puedes leer el Rego y confirmar que coincide con el estatuto. La capa de verificación se ejecuta como infraestructura, medida en decenas de miles de posiciones por segundo (aproximadamente 40k a 60k entre ejecuciones, según la máquina y la ejecución), no como inferencia de modelo por posición.
Las disposiciones codificadas en esta versión: OBBBA QPVLI (§163(h)(4) / §63(b)(7)), §199A QBI, la limitación de intereses empresariales del §163(j), el intercambio de bienes de igual naturaleza del §1031, la oficina en casa del §280A, el crédito para vehículos limpios del §30D y la distinción AGI del §62/§63. Todo lo que queda fuera de ese conjunto devuelve OUT-OF-COVERAGE y se deriva a un humano. StatuteGuard no pretende codificar el IRC completo.
La demostración recorre un BLOCK, un PASS y una escalada, todos sobre posiciones sintéticas. Las capturas de pantalla siguientes son tomas reales de la aplicación en ejecución.
Una declaración redactada dice: «La nueva deducción OBBBA de intereses de préstamo de automóvil es una deducción por encima de la línea que reduce el AGI del cliente». Es plausible, está bien escrita y es incorrecta. Los intereses cualificados de préstamos para vehículos de pasajeros son una deducción por debajo de la línea bajo el §63(b)(7); no reducen el AGI. Según el propio README de la demostración, la guía general de preparación fiscal (incluido el sitio de H&R Block) la ha etiquetado erróneamente como por encima de la línea. StatuteGuard devuelve BLOCK: DO NOT FILE, anima la cadena de citas §163(h)(1) → §163(h)(4)(A) → §63(b)(7) → §62/§63, y señala una cascada posterior de 5 vías de lo que se rompe si se presenta tal como se redactó: AGI, impuesto estatal acoplado al AGI, primas Medicare IRMAA, el suelo de la deducción de gastos médicos, y el reembolso de préstamos estudiantiles basado en los ingresos.
El paso de extracción tardó 5.93s; el anclaje determinista emitió su veredicto en microsegundos.
Un intercambio conforme de bienes de igual naturaleza de inmuebles de inversión devuelve CLEARED: safe to file as drafted, con su propia cadena de citas de dos nodos (§1031(a)(1) y §1031(a)(2)-TCJA). Esta es la disciplina que importa: una posición correcta nunca se marca por error. La precisión de la puerta es del 100% con 0 bloqueos falsos en el conjunto dorado.
Una posición de oficina en casa en la que el expediente no establece el uso exclusivo para negocios es una prueba de hechos y circunstancias, fuera de la cobertura determinista. StatuteGuard devuelve NEEDS HUMAN REVIEW en lugar de farolear. El LLM propone una afirmación comprobable e informa la confianza; por debajo del umbral, la posición se escala, nunca la resuelve el modelo.
El visor Policy Rules muestra la lógica estatutaria determinista como tablas de decisión legibles junto al código fuente OPA/Rego real. Este es el sentido de una capa de verificación que puedes defender: confirmas que el código coincide con el estatuto, en lugar de confiar en el resumen de un modelo.
La etapa de auditoría produce un papel de trabajo de diligencia debida Form SG-6662: la fuente, la autoridad estatutaria primaria, la afirmación extraída, la narración de la determinación y la cadena de citas completa, listo para imprimir o guardar como PDF y conservar en el expediente del cliente. Sustenta una posición de causa razonable del §6662; no es asesoramiento.
Run Benchmark reproduce un conjunto dorado etiquetado de 42 posiciones (14 limpias, 16 con error, 12 a escalar). El marcador informa 71.4% de cobertura determinista, 100% de precisión de la puerta con 0 bloqueos falsos, 100% de completitud de captura de errores y 100% de escalada correcta de zonas grises, con cada veredicto coincidiendo con su etiqueta. Estas cifras describen la capa de verificación, no una tasa de error del modelo, por lo que se sostienen a medida que mejoran los modelos base. Durante la construcción, los veredictos se contrastaron con OPA 1.17.1 y coincidieron con el gemelo en Python puro exactamente en los 42 casos.
Estas cifras se miden sobre un conjunto dorado etiquetado fijo de 42 casos de las disposiciones codificadas, no una garantía de mundo abierto.
StatuteGuard no compite con tu herramienta de redacción ni sustituye una plataforma de cumplimiento. Se sitúa encima de lo que ya usas y comprueba lo único que ellas no pueden: si la posición redactada se sostiene frente al estatuto.
| Pregunta | IA de redacción (ONESOURCE, CCH Axcess, Blue J, ChatGPT) | Autocomprobación del LLM | StatuteGuard |
|---|---|---|---|
| Función principal | Preparar y redactar posiciones | Releer su propio borrador | Verificar una posición redactada frente al estatuto |
| Quién emite el veredicto | Un modelo de lenguaje | El mismo modelo, los mismos pesos | Un motor de políticas determinista (OPA/Rego) |
| En una zona gris genuina | Produce prosa segura de sí misma | Produce prosa segura de sí misma | Escala a un humano (NEEDS-REVIEW / OUT-OF-COVERAGE) |
| Registro §6662 presentable | No | No | Sí, un papel de trabajo de diligencia debida imprimible |
| Lee la salida de cualquier plataforma | Atado a su propio producto | Atado a su propio modelo | Neutral respecto al proveedor por diseño |
Esas herramientas redactan y preparan. StatuteGuard verifica. Es una capa neutral respecto al proveedor que se sitúa encima de la plataforma que ya usas: pega una posición de ONESOURCE, CCH Axcess, Blue J, ChatGPT o un modelo interno, y devuelve un PASS, BLOCK o NEEDS-REVIEW firme frente al estatuto codificado. No prepara declaraciones ni sustituye una plataforma de cumplimiento; comprueba los errores a nivel de posición que la herramienta de redacción no puede ver.
No, y StatuteGuard no te pide que lo hagas. El único paso de LLM es la extracción, que convierte el lenguaje desordenado en una afirmación estructurada. El veredicto lo emite un motor de políticas determinista (OPA/Rego real, o un gemelo idéntico en Python puro), que el modelo no puede anular. No se puede confiar en que un LLM vigile a otro LLM a través de los mismos pesos que produjeron el error, así que la decisión vive fuera del modelo, en código de políticas que puedes leer frente al estatuto.
Escala a un humano en lugar de adivinar. Una pregunta genuina de hechos y circunstancias (una oficina en casa del §280A, por ejemplo) devuelve NEEDS-REVIEW; una disposición no codificada en esta versión devuelve OUT-OF-COVERAGE. Ambas se derivan a un revisor en lugar de a un farol confiado. En el conjunto dorado etiquetado de 42 casos, las zonas grises se escalaron correctamente el 100% de las veces; la cobertura se declara con honestidad en el 71.4%.
La demostración se ejecuta por completo en local, sin clave de API, usando por defecto extracción por reproducción en caché, de modo que ni la posición ni los datos del cliente tienen que salir del perímetro. Esa postura local, cerrada y auditable es deliberada tras el fallo Heppner (SDNY, febrero de 2026), que planteó una cuestión de renuncia al privilegio por una consulta de investigación a una herramienta de IA pública. La arquitectura está diseñada para ser segura para el privilegio, no para enviar posiciones a un servicio externo.
No en esta demostración. Los conectores REST de ONESOURCE, CCH Axcess y Blue J, las llamadas LLM en vivo y el grafo Neo4j están simulados o sustituidos por stubs; la demostración se ejecuta con reproducción en caché y un grafo JSON en memoria para que siempre funcione sin conexión. El mecanismo de verificación es real y neutral respecto al proveedor por diseño; la arquitectura de producción documenta FastAPI, Neo4j y conectores en vivo como la vía de recambio.
Se miden sobre un conjunto dorado etiquetado fijo de 42 posiciones de las disposiciones codificadas, no una garantía de mundo abierto. En ese conjunto: el 71.4% de las posiciones se resolvió de forma determinista sin escalada, la precisión de la puerta fue del 100% con 0 bloqueos falsos, y cada veredicto coincidió con su etiqueta. Estas cifras describen la cobertura y la precisión de la capa de verificación, no una tasa de error del modelo, por eso se sostienen a medida que mejoran los modelos base. Sustenta una posición de diligencia debida del §6662; no es asesoramiento fiscal ni jurídico.
La investigación detrás de esta demostración: la arquitectura, el diseño de verificación y el modelo de referencia empresarial.
Solución completa
Explora la solución Verificación de cumplimiento fiscal con IA →La sanción del 20% recae sobre quien firma, no sobre el modelo que redactó. Un verificador determinista es cómo demuestras qué disposición estatutaria respaldó qué posición.
Si tu equipo está sopesando cómo verificar posiciones fiscales redactadas por IA sin confiar en que un modelo vigile a otro, nos gustaría de verdad intercambiar impresiones sobre cómo lo estáis planteando. El problema es de todo el sector y las respuestas también lo serán.