Visual de tres interfaces de chat de IA que muestran la misma respuesta incorrecta sobre legislación fiscal frente al estatuto real que las contradice, ilustrando el Error de Consenso.
Artificial IntelligenceTaxMachine Learning

Todas las IA se equivocaron en la misma pregunta fiscal, y nadie lo notó hasta que revisamos el estatuto

Ashutosh SinghalAshutosh Singhal23 de enero de 202614 min

Era un martes por la noche y yo miraba fijamente tres pestañas del navegador — ChatGPT, Claude, Gemini — y todas me decían lo mismo. Las tres estaban equivocadas.

La pregunta era bastante simple: según la nueva Omnibus Budget Reconciliation Act, ¿puede un contribuyente deducir los intereses de un préstamo para un automóvil personal? Todos los modelos dijeron que sí. Cada modelo explicó la disposición correctamente: las fechas, los requisitos del vehículo, incluso los límites de ingresos. Y cada modelo ubicó la deducción en la sección equivocada del código tributario, lo que significaba que el asesoramiento financiero derivado era una basura.

No ligeramente desviado. No «bueno, depende de la interpretación». Simplemente equivocado. El tipo de error que, si un CPA lo siguiera, provocaría una auditoría del IRS. El tipo de error que podría costarle a un jubilado miles de dólares en recargos inesperados en las primas de Medicare. ¿Y la parte aterradora? Si no conocías ya la respuesta, nunca lo detectarías. La IA sonaba perfecta.

Ese momento cambió mi forma de pensar sobre la IA en el cumplimiento normativo. No porque me sorprendiera que un modelo de lenguaje alucinara — todos sabemos que lo hacen. Lo que me estremeció fue que los tres alucinaron exactamente de la misma manera, exactamente por la misma razón. Habían aprendido la respuesta errónea de Internet, e Internet estaba tan uniformemente equivocada que no quedaba ninguna señal para que los modelos se autocorrigieran.

Comenzamos a llamar a este fenómeno Error de Consenso. Y una vez que lo entendimos, ya no pudimos dejar de verlo.

¿Qué es el Error de Consenso y por qué debería importarle?

La mayoría de las personas que trabajan con IA están familiarizadas con las alucinaciones: momentos en los que un modelo inventa una cita, fabrica una estadística o afirma con seguridad algo que no es cierto. Esas son aterradoras, pero también son algo aleatorias. A menudo se pueden detectar porque suenan raras o porque una búsqueda rápida en Google revela la invención.

El Error de Consenso es diferente. Es lo que sucede cuando una IA le da la respuesta equivocada no porque carezca de datos, sino porque los datos con los que fue entrenada son abrumadora y confiadamente incorrectos. El modelo no está adivinando a ciegas. Le está reflejando la opinión mayoritaria de Internet, y resulta que la opinión mayoritaria es legalmente falsa.

Cuando la propia Internet está equivocada, cada IA entrenada en ella hereda el mismo engaño. El Error de Consenso no es un fallo técnico fortuito: es una característica de cómo aprenden los modelos de lenguaje.

Piense en las matemáticas por un momento. Si el 90 % de los artículos en la web sobre una disposición fiscal en particular la describen incorrectamente — usando lenguaje simplificado, fusionando dos secciones diferentes del código o simplemente copiando los errores de los demás —, entonces los pesos internos del modelo convergen en la respuesta equivocada con alta confianza. Incluso si el estatuto real existe en los datos de entrenamiento, aparece una o dos veces en un denso lenguaje legal, mientras que la interpretación incorrecta aparece miles de veces en una prosa accesible y optimizada para SEO.

El modelo hace aquello para lo que fue diseñado: predecir el siguiente token más probable. Y el token más probable es el equivocado.

La deducción de préstamos de automóviles que rompió tres IA

Un diagrama que muestra la diferencia crítica entre la Sección 62 («above the line», reduce el AGI) y la Sección 63 («below the line», reduce únicamente el Ingreso Imponible), con las consecuencias derivadas que fluyen de cada vía.

Permítame guiarle a través del caso específico, porque los detalles importan.

La OBBBA creó una nueva categoría llamada «Qualified Passenger Vehicle Loan Interest»: una deducción temporal de los intereses pagados por préstamos para vehículos de pasajeros nuevos y ensamblados en EE. UU., disponible para los años fiscales 2025 a 2028. Hasta aquí, todo bien. Todas las IA entendieron bien esta parte.

Aquí es donde todo se desmorona. La deducción se añadió a la Sección 63 del IRC, que rige el Ingreso Imponible. No se añadió a la Sección 62 del IRC, que rige el Ingreso Bruto Ajustado (AGI). En impuestos, esta distinción lo es todo.

Una deducción de la Sección 62 — «por encima de la línea» (above the line) — reduce su AGI. Su AGI determina la elegibilidad para docenas de otros beneficios: planes de pago de préstamos estudiantiles, límites mínimos de deducción de gastos médicos, la tributación de los beneficios del Seguro Social y recargos en las primas de Medicare. Reduzca su AGI y desbloqueará una cascada de ahorros derivados.

Una deducción de la Sección 63 — «por debajo de la línea» (below the line) — reduce su Ingreso Imponible. Todavía le ahorra dinero en su factura de impuestos federales, pero no le hace absolutamente nada a su AGI. Ninguno de esos beneficios derivados se ve afectado.

Cada uno de los principales LLM les dijo a los usuarios que esta deducción reduciría su AGI. Absolutamente todos. Porque eso es lo que decía el ecosistema de contenido financiero. Artículos explicativos ampliamente compartidos y optimizados para SEO publicaron titulares como «¡Los intereses de préstamos de automóviles ahora son deducibles!» sin especificar en qué parte del cálculo de impuestos se aplicaba. Aparentemente, la distinción entre la Sección 62 y la Sección 63 es demasiado aburrida para los creadores de contenido que optimizan para conseguir clics.

¿Pero para el contribuyente que sigue este consejo? Las consecuencias son reales.

Un jubilado que reporte incorrectamente un AGI más bajo podría enfrentar recargos inesperados del IRMAA de Medicare. Un prestatario en un plan de pago de préstamos estudiantiles basado en los ingresos podría perder la elegibilidad para pagos más bajos. Un contribuyente en un estado como Arizona, que vincula su impuesto sobre la renta al AGI federal, podría enfrentar una auditoría estatal. Escribí sobre toda la cascada de consecuencias financieras en la versión interactiva de nuestra investigación — los efectos en cadena son peores de lo que la mayoría de la gente asume.

¿Por qué RAG no solucionó esto?

Ya puedo escuchar la objeción: «Simplemente use RAG. Recupere el estatuto real. Problema resuelto».

Lo intentamos. No lo resolvió.

La Generación Aumentada por Recuperación (Retrieval-Augmented Generation o RAG) — la técnica en la que se introducen documentos relevantes en la ventana de contexto del modelo junto con la pregunta del usuario — es la respuesta actual de la industria a las alucinaciones. Y para muchos casos de uso, ayuda. Pero para el razonamiento legal, tiene tres debilidades estructurales que aparecieron de inmediato en nuestras pruebas.

En primer lugar, la legislación fiscal no se lee como una narrativa. La OBBBA no dice «esta es una deducción below-the-line». Dice: «La Sección 163(h) se modifica insertando después del párrafo (3) el siguiente nuevo párrafo...». El modelo tiene que reconstruir el estado lógico del código tributario a partir de una serie de enmiendas. Cuando el fragmento recuperado dice «deducción permitida» pero no indica explícitamente su posición en el flujo de cálculo, el modelo llena el vacío con su sesgo de entrenamiento: las publicaciones de blogs.

En segundo lugar, la búsqueda vectorial encuentra lo que es similar, no lo que es relevante por omisión. Una consulta sobre deducciones de préstamos para automóviles recupera párrafos sobre deducciones de préstamos para automóviles. No recupera el párrafo de la Sección 62 que define el AGI, porque ese párrafo no menciona los préstamos para automóviles. Simplemente los excluye al no enumerarlos. En el derecho, la ausencia de algo en una lista es significativa. En la búsqueda por similitud vectorial, la ausencia es invisible.

En tercer lugar — y esto es lo que no me deja dormir por las noches —, RAG resuelve la recuperación, no el razonamiento. Puede poner el estatuto correcto delante del modelo y este aún lo malinterpretará si sus pesos internos están sesgados por millones de ejemplos de entrenamiento incorrectos. Se convierte en un lector sesgado, viendo lo que espera ver en lugar de lo que el texto dice en realidad.

RAG pone el documento correcto frente a la IA. Pero un lector sesgado con el libro correcto todavía llega a la conclusión equivocada.

Después de semanas de probar diferentes estrategias de recuperación, tamaños de fragmentos y configuraciones de prompts, mi equipo tuvo una discusión que lo aclaró todo. Uno de nuestros ingenieros quería seguir perfeccionando el pipeline de RAG: mejores embeddings, fragmentación más precisa, instrucciones explícitas para «usar únicamente el texto recuperado». Nuestra asesora legal lo miró y dijo: «Estás intentando hacer unas mejores gafas para alguien que no sabe hacer matemáticas». Ella tenía razón. El problema no era lo que el modelo podía ver. Era sobre lo que el modelo podía razonar.

¿Qué sucede cuando la IA lee mal la ley?

El caso de la OBBBA también incluye reglas de eliminación gradual (phase-out) que agravan el problema. La deducción tiene un límite máximo de 10.000 dólares por año y se reduce en 200 dólares por cada 1.000 dólares en que los ingresos del contribuyente superen los 100.000 dólares (declarantes individuales) o 200.000 dólares (declarantes conjuntos). A los 150.000 o 250.000 dólares respectivamente, la deducción desaparece por completo.

Cuando probamos esto con un contribuyente hipotético que ganaba 125.000 dólares, los modelos tuvieron dificultades. Algunos ignoraron la eliminación gradual por completo. Otros aplicaron una curva de reducción tomada del Crédito Tributario por Hijos (Child Tax Credit), una disposición completamente diferente con cálculos matemáticos distintos. Los modelos estaban haciendo coincidencia de patrones con estructuras familiares en lugar de calcular la regla real.

Este es el problema de la «Alucinación Aritmética» superpuesto al Error de Consenso. El modelo no solo se equivoca en el marco legal: también se equivoca en los cálculos matemáticos. Y cuando se comprimen estos modelos para un despliegue eficiente mediante cuantización, las capacidades de razonamiento se degradan más rápido que las habilidades lingüísticas. El modelo suena más seguro mientras se vuelve menos preciso. Esa es una combinación peligrosa en cualquier dominio. En el cumplimiento tributario, es una responsabilidad jurídica de alto riesgo.

Hay otra dimensión que la mayoría de la gente pasa por alto por completo. La OBBBA también creó la Sección 6050AA, que impone nuevos requisitos de presentación de informes a los prestamistas. Cualquier empresa que reciba 600 dólares o más en intereses sobre un préstamo de vehículo calificado debe presentar una declaración informativa ante el IRS. Cuando preguntamos a los modelos qué debían hacer los bancos y las cooperativas de crédito respecto a la nueva ley, se centraron casi exclusivamente en la deducción del prestatario, porque de eso escribía el ecosistema de contenidos. La obligación de cumplimiento normativo del prestamista apenas se registró. Para una empresa fintech que utiliza IA para resumir cambios regulatorios, esa omisión podría significar un incumplimiento sistemático y sanciones en virtud de las Secciones 6721 y 6722 del IRC.

La arquitectura que realmente funciona

Un diagrama de pipeline en tres etapas que muestra la arquitectura neuro-simbólica: Analizador de Intenciones (neuronal) → Ancla de Verdad (lógica simbólica) → Generador de Respuestas (neuronal, restringido), con las entradas y salidas clave etiquetadas en cada etapa.

Después del descalabro del préstamo para automóviles, pasé un mes convencido de que todo el enfoque de utilizar modelos de lenguaje para el cumplimiento normativo estaba fundamentalmente roto. Luego construimos algo que me hizo cambiar de opinión — no acerca de los LLM, sino sobre cómo deberían usarse.

La conclusión fue simple, una vez que la vimos: deje de pedirle a la IA que razone sobre las leyes. Déjela hacer aquello en lo que es buena — entender el lenguaje — y delegue el razonamiento en algo que realmente pueda ejecutar lógica.

Esta es la idea central detrás de la IA neuro-simbólica: una arquitectura híbrida que combina la fluidez lingüística de las redes neuronales con el rigor determinista de los sistemas de lógica simbólica. Construimos lo que llamamos un Motor Fiscal Determinista, y funciona en tres etapas.

La primera etapa es el Analizador de Intenciones. Aquí es donde vive el LLM, haciendo lo que mejor saben hacer los LLM. Un usuario sube una factura, escribe una pregunta o conecta un feed bancario. La capa neuronal extrae entidades estructuradas: tipo de vehículo, fecha de compra, monto del préstamo, lugar de ensamblaje, ingresos del contribuyente. No decide nada sobre el tratamiento tributario. Simplemente traduce la desordenada realidad humana en datos limpios.

La segunda etapa es el Ancla de Verdad. Aquí es donde toma el control la capa simbólica. Codificamos el código tributario — no como texto para ser «leído», sino como lógica ejecutable utilizando lenguajes especializados como Catala (desarrollado por INRIA para la administración tributaria del gobierno francés) y PROLEG (un sistema de razonamiento legal basado en Prolog). El estatuto se convierte en un programa. El Ancla de Verdad consulta un Gráfico de Conocimiento, aplica las reglas codificadas, verifica los datos faltantes y calcula el resultado determinista. Si el vehículo fue ensamblado en México, la deducción es denegada. Si los ingresos superan el umbral de eliminación gradual, la reducción se calcula al centavo. Sin probabilidades. Sin conjeturas.

La tercera etapa es el Generador de Respuestas. Otra capa neuronal, pero restringida. Recibe la salida del solucionador lógico — «Deducción: DENEGADA. Motivo: Eliminación gradual superada en el nivel de ingresos $135.000» — y la traduce a un lenguaje claro y legible para los humanos. El LLM hace que la respuesta sea legible. Tiene cero libertad para hacer que la respuesta sea diferente.

No le pedimos a la IA que adivine la ley. Le enseñamos a calcular la ley. La capa neuronal maneja el lenguaje. La capa simbólica maneja la verdad. Ninguna intenta hacer el trabajo de la otra.

Este desacoplamiento es lo que elimina el Error de Consenso. La capa neuronal podría «saber» por su entrenamiento que los sitios financieros populares dicen que los intereses de los préstamos de automóviles reducen el AGI. Pero nunca se le pide que tome esa determinación. Solo se le pide que extraiga los detalles del vehículo. La decisión reside en la capa simbólica, que no tiene acceso a Reddit — solo al estatuto codificado.

Para la arquitectura técnica completa y el análisis formal, incluyendo cómo Catala maneja la lógica de excepciones por defecto y cómo Answer Set Programming verifica la coherencia en una declaración de impuestos completa, publicamos un artículo de investigación detallado.

¿Por qué importa esto más allá de una sola deducción fiscal?

Seré honesto sobre algo. Cuando comencé a explicar el Error de Consenso a la gente, la respuesta más común era: «De acuerdo, pero ese es un caso extremo aislado. La mayor parte del tiempo, la IA lo hace bien».

Esa respuesta malinterpreta la naturaleza del problema. La deducción de préstamos de automóviles de la OBBBA no es especial. Es típica. Cada vez que el Congreso aprueba una nueva disposición, el ecosistema de contenidos genera miles de interpretaciones simplificadas y a veces incorrectas antes de que el IRS emita siquiera una guía. Cada vez que un estado se desacopla del tratamiento tributario federal, Internet se queda rezagada. Cada vez que un fallo judicial cambia la interpretación de un estatuto existente, la interpretación antigua persiste en los datos de entrenamiento durante años.

El Error de Consenso no es un caso aislado. Es el estado por defecto para cualquier área del derecho que sea compleja, haya cambiado recientemente o sea poco comprendida por redactores generalistas. Es decir: la mayor parte del derecho tributario.

La implicación más amplia se refiere a lo que esperamos de la IA en dominios de alto riesgo. El paradigma actual — darle al LLM más contexto, mejores prompts, ventanas más grandes — es una mejora incremental en una arquitectura fundamentalmente incompatible. Se le está pidiendo a un motor de coincidencia de patrones que realice un razonamiento formal. A veces tiene suerte. En el cumplimiento tributario, «a veces» no es suficiente.

De caja negra a caja de cristal

Hay una cosa más que importa enormemente a cualquiera que se haya sentado frente a un auditor: la trazabilidad.

Cuando un LLM estándar le dice a un contribuyente «sí, puede deducir eso», y el IRS luego no está de acuerdo, ¿cuál es el rastro de auditoría? El modelo predijo que «sí» era el siguiente token más probable según el contexto. Esa no es una respuesta que se pueda presentar ante un agente fiscal.

En nuestro Motor Neuro-Simbólico, cada determinación produce una ruta gráfica:

Deduction_Allowed = True porque Loan_Date está dentro de la ventana 2025–2028 (verificado), Vehicle_Type es Passenger (verificado), Assembly_Location es US (verificado), Income está por debajo del umbral de eliminación gradual (verificado), Rule_Reference es IRC § 163(h)(4).

Cada nodo de esa cadena es auditable. Cada hecho se puede rastrear hasta un documento de origen. Cada regla se puede rastrear hasta una sección específica del código. Si algo cambia — un nuevo dictamen del IRS, una disposición enmendada —, se actualiza el Gráfico de Conocimiento y el solucionador lógico, y cada determinación afectada se marca automáticamente para su revisión.

Esto transforma la IA de algo en lo que hay que confiar ciegamente en algo que se puede verificar a petición. La gente siempre me pregunta si este enfoque es más lento o más costoso que simplemente usar un LLM. La respuesta honesta: la codificación inicial del estatuto requiere un trabajo real. Pero una vez codificado, ejecutar una determinación es casi instantáneo, y el coste de verificar el 100 % de las transacciones se acerca al coste de verificar el 1 %. Esa no es una mejora marginal sobre las auditorías tradicionales basadas en muestreo. Es una categoría diferente de garantía.

La pregunta que nadie está haciendo todavía

Esto es lo que más me inquieta. La industria de servicios financieros se apresura a implementar asistentes de IA, preparadores de impuestos con IA y monitores de cumplimiento con IA. El marketing dice «impulsado por IA». La letra pequeña dice «no constituye asesoramiento fiscal». Y en medio, millones de personas reciben respuestas que suenan autorizadas, citan legislación real, hacen referencia a fechas y montos reales en dólares — y ubican la deducción en la sección equivocada del código tributario.

No estamos en un mundo donde la IA esté obviamente equivocada y los humanos puedan notarlo. Estamos en un mundo donde la IA está sutilmente equivocada de formas que requieren una profunda experiencia en el dominio para detectarlo. Eso es más peligroso que un fallo evidente, porque erosiona el instinto de verificar dos veces.

La pregunta no es si la IA debería usarse en el cumplimiento tributario. Absolutamente debería — la complejidad del código ha superado la capacidad humana para aplicarlo de manera consistente. La pregunta es si estamos dispuestos a construir sistemas de IA que respeten la naturaleza del dominio en el que operan. El derecho tributario es determinista. Tiene respuestas correctas y respuestas incorrectas, definidas por estatutos, no por la opinión popular. Una arquitectura que trata la verdad legal como una distribución de probabilidad siempre será vulnerable al Error de Consenso, sin importar cuán grande sea el modelo o cuán ingenioso sea el prompt.

En el derecho tributario, la popularidad no es un sustituto de la verdad. Una respuesta repetida diez mil veces en Internet no es más correcta que el estatuto que la contradice una sola vez.

Construimos Veriprajna porque creo que la era de «confiar, pero verificar» ya terminó para la IA en el cumplimiento normativo. Los sistemas que se ganen la confianza empresarial serán aquellos que verifiquen primero y hablen después: aquellos donde la lógica sea auditable, las matemáticas sean deterministas y la confianza de la IA esté respaldada por algo más duradero que la probabilidad de un token.

Al estatuto no le importa lo que piense Internet. A su IA tampoco debería importarle.

Investigación relacionada

También publicado en

Construya su IA con confianza.

Colabore con un equipo que cuenta con amplia experiencia en la creación de la próxima generación de IA empresarial. Permítanos ayudarle a diseñar, construir e implementar una estrategia de IA en la que pueda confiar.

Veriprajna consultora de Deep Tech está especializada en la creación de sistemas de IA críticos para la seguridad en los sectores de salud, finanzas y ámbitos regulatorios. Nuestras arquitecturas se validan conforme a protocolos establecidos, con documentación de cumplimiento integral.