Libro blanco de Veriprajna: La transición de la responsabilidad civil al funcionario público – Arquitectura de la aplicación de citas estatutarias para una IA gubernamental determinista

Resumen ejecutivo

La integración de la inteligencia artificial en el sector público representa un momento decisivo en la historia de la gobernanza administrativa. Por primera vez, existe el potencial de democratizar el acceso a las estructuras laberínticas de los códigos municipales, las regulaciones estatales y los estatutos federales, transformando la experiencia burocrática de la opacidad y la fricción en una de claridad y eficiencia. Sin embargo, el reciente despliegue y el posterior fracaso del chatbot «MyCity» de la ciudad de Nueva York ha expuesto una fractura crítica en el paradigma actual de adopción de la IA gubernamental. Al aconsejar a los dueños de negocios que violaran las leyes municipales sobre pagos sin efectivo, el acopio de propinas y la discriminación en vivienda, el incidente de MyCity demostró que sin restricciones arquitectónicas rigurosas, un sistema de IA probabilística no funciona como un diligente funcionario público, sino como una enorme responsabilidad civil . 1

Este libro blanco, preparado por Veriprajna, sostiene que el enfoque predominante de «envoltorio delgado» para la IA gubernamental —en el que un modelo de lenguaje grande (LLM) genérico se instruye superficialmente para responder consultas jurídicas— es fundamentalmente defectuoso y legalmente peligroso. 3 Tales sistemas, impulsados por el aprendizaje por refuerzo a partir de retroalimentación humana (RLHF) que prioriza la «utilidad» sobre la adherencia fáctica, son propensos a la sicofancia y a la alucinación, fabricando regulaciones para satisfacer las consultas del usuario en lugar de defender el Estado de derecho. 5 Cuando una entidad gubernamental despliega un sistema que alucina permisos legales, corre el riesgo de erosionar la doctrina de la inmunidad soberana al incurrir en tergiversación negligente durante el desempeño de funciones propietarias, como lo evidencia jurisprudencia emergente como Moffatt v. Air Canada . 7

Veriprajna propone un cambio de paradigma necesario hacia la aplicación de citas estatutarias (SCE) . Este marco arquitectónico trata la IA gubernamental no como un conversador creativo, sino como un motor de recuperación determinista. Bajo SCE, la IA opera bajo una estricta «Sin cita = sin salida» restricción. Utiliza sistemas de IA compuestos que emplean jerárquica generación aumentada por recuperación (RAG) y decodificación restringida para garantizar que cada afirmación esté anclada en una disposición específica e hipervinculada del código municipal vectorizado. 8

Este informe ofrece un análisis exhaustivo de los riesgos jurídicos inherentes a las implementaciones actuales, las causas técnicas de raíz de las «alucinaciones jurídicas» en los modelos probabilísticos, y la arquitectura integral de Veriprajna diseñada para restaurar la confianza. Detallamos cómo pasar de envoltorios opacos de «caja negra» a sistemas transparentes y verificables que actúan con la fidelidad y la rendición de cuentas exigidas a un funcionario público juramentado. La era del chatbot gubernamental en «beta» ha terminado; debe comenzar la era del funcionario público digital determinista.

1. La crisis de la gobernanza probabilística: el estudio de caso «MyCity» de NYC

La transición de la burocracia humana a la gobernanza algorítmica está llena de peligros cuando la tecnología subyacente se malinterpreta o se aplica de forma indebida. El lanzamiento y el posterior fracaso del chatbot MyCity de la ciudad de Nueva York sirve como estudio de caso definitivo de los riesgos sistémicos de desplegar modelos probabilísticos para interpretar el derecho estatutario sin salvaguardas deterministas adecuadas. Este incidente pone de relieve el abismo peligroso entre las capacidades de la IA generativa y los requisitos rígidos del cumplimiento legal.

1.1 El fiasco de «MyCity»: automatizar la ilegalidad

En octubre de 2023, la ciudad de Nueva York lanzó el chatbot MyCity, impulsado por Azure AI de Microsoft, posicionándolo como un «ventanilla única» para que los dueños de negocios navegaran el complejo entorno regulatorio de la mayor metrópolis de la nación. 10 La intención estratégica era noble: rebajar la barrera de entrada para los emprendedores ofreciendo respuestas instantáneas y autorizadas a preguntas sobre cumplimiento, permisos y regulaciones laborales. En una ciudad conocida por su densa burocracia, tal herramienta prometía ser un acelerador económico.

Sin embargo, una investigación de The Markup y auditorías independientes posteriores revelaron que el sistema difundía de forma sistemática asesoramiento jurídico peligrosamente inexacto. A diferencia de un funcionario público humano, cuyos errores podrían atribuirse a negligencia individual, fatiga o incompetencia, los errores de la IA eran alucinaciones sistémicas: afirmaciones confiadas de leyes inexistentes derivadas de patrones estadísticos en lugar del hecho estatutario. El bot no solo falló al no encontrar respuestas; fabricó activamente permisos legales que, de actuarse, someterían a los dueños de negocios a cargos penales y a graves sanciones civiles.

El alcance del fallo no se limitó a variaciones de zonificación oscuras o a estatutos arcaicos. El chatbot falló en pilares fundamentales del derecho comercial y de derechos civiles de NYC. Asesoró sobre robo salarial, violaciones de protección al consumidor y discriminación en vivienda, presentando estos actos ilegales como prácticas empresariales conformes.

Tabla 1: Análisis del asesoramiento erróneo difundido por el chatbot MyCity

Ámbito jurídico Consulta del usuario /
Escenario
Respuesta de la IA
(Alucinación
)
Realidad jurídica
efectiva
(Estatuto)
Consecuencia
de seguir el
asesoramiento de la IA
Derecho laboral /
Salarios
¿Puede un
empleador tomar
una porción de
las propinas de los trabajadores?
«Sí, puede
quedarse con una parte de
las propinas de
su trabajador.»11
Ilegal.
Los empleadores tienen
prohibido
retener
cualquier porción de
las propinas de los empleados
en virtud de la ley federal
y estatal
(FLSA, NY
Labor Law).12
Robo salarial
demandas,
Departamento de
Trabajo
investigaciones,
daños
liquidados de hasta
el 100 % de
los salarios impagos.
13
Protección al
consumidor
¿Puede un comercio
negarse a
aceptar efectivo?
«Sí, puede
hacer que su
restaurante sea
libre de efectivo.
No hay
regulaciones...
que exijan a
los negocios
aceptar efectivo.»
11
Ilegal. El NYC
Admin Code §
20-840
prohíbe a los establecimientos de
alimentos y
comercio minorista
rechazar el efectivo
para proteger a
no bancarizados
ciudadanos.14
Sanciones civiles
de $1,000 por
la primera
infracción y
$1,500 por
subsiguientes
infracciones.14
Derechos de
vivienda
¿Deben los arrendadores
aceptar
vales de
Section 8?
No, los arrendadores
no necesitan
aceptar a estos
inquilinos.11
Ilegal. La NYC
Human Rights
Law prohíbe la
discriminación
basada en
la «fuente lícita
de ingresos».15
Multas de hasta
$250,000,
daños
compensatorios, y
cambios de
política
obligatorios.17
Derecho de arrendamiento ¿Puede un arrendador
echar con llave a un
inquilino?
Es legal
echar con llave a un
inquilino.11
Ilegal.
El
desalojo ilícito es un
delito. Los inquilinos
no pueden ser
echados con llave si
han
ocupado la
Cargos
penales, daños triples
por
desalojo
ilícito, y
inmediata
restauración de
Col1 Col2 Col3 unidad durante 30
días. 11
posesión.
Transparencia
de precios
¿Puede una funeraria
ocultar sus
precios?
Sí, puede
ocultar los precios.
11
Ilegal. La
Federal Trade
Commission
(FTC) Funeral
Rule exige
divulgaciones claras
de precios.
Acciones federales
de aplicación
y
multas sustanciales
por
infracción.

1.2 El impacto societal de la desinformación algorítmica

Las implicaciones de estos errores van mucho más allá de la inconveniencia de un lanzamiento de software «con errores». Tocan el contrato social central entre el gobierno y sus ciudadanos. Las leyes que el chatbot aconsejó violar —como la prohibición de comercios sin efectivo y la veda de la discriminación por fuente de ingresos— no son meros obstáculos administrativos; son protecciones de derechos civiles diseñadas para garantizar la equidad.

Cuando el chatbot aconsejó que los comercios podían rechazar el efectivo, estaba aconsejando de hecho a los negocios discriminar contra la población no bancarizada, que de forma desproporcionada incluye a personas de bajos ingresos, a los ancianos y a inmigrantes indocumentados. 14 El Concejo de la ciudad de Nueva York aprobó la prohibición de los comercios sin efectivo precisamente para impedir esta forma de exclusión económica. Al afirmar lo contrario, la IA «funcionario público» se convirtió en un agente de exclusión, socavando la intención legislativa del propio gobierno que la desplegó.

De igual modo, el consejo sobre los vales de Section 8 ataca el corazón de la respuesta de la ciudad a la crisis de vivienda. La discriminación por fuente de ingresos es una barrera primaria que impide a las familias sin hogar con vales encontrar vivienda permanente. Cuando la propia herramienta de la ciudad dice a los arrendadores que pueden rechazar estos vales, agrava el sinhogarismo y expone a los arrendadores a una enorme responsabilidad ante la NYC Commission on Human Rights, que ha impuesto multas de hasta $1 millón por tales infracciones. 17 El daño aquí es doble: el riesgo jurídico inmediato para el arrendador que sigue el consejo, y el daño societal posterior al inquilino potencial a quien se le niega ilegalmente la vivienda.

1.3 El fracaso de la defensa «beta» y de los descargos de responsabilidad

Tras la revelación pública de estos errores, funcionarios municipales y proveedores de tecnología intentaron ampararse en la clasificación de la herramienta como un «producto beta» y en la inclusión de descargos que afirmaban que el bot no debía usarse como asesoramiento jurídico. 19 El alcalde Eric Adams defendió el despliegue, afirmando: «No se puede permanecer en un laboratorio para siempre» y que la tecnología debe probarse en el «entorno real» para corregir los fallos. 20

Sin embargo, esta defensa demuestra una incomprensión fundamental de la naturaleza de la autoridad gubernamental y de la psicología de la confianza del usuario. Cuando una herramienta se aloja en un dominio .gov, se comercializa como un recurso para el cumplimiento y se marca como «MyCity», lleva el sello del Estado. Los usuarios ven el chatbot no como un motor de búsqueda ni como una demostración tecnológica genérica, sino como una extensión del propio regulador.

Los críticos señalaron que, aunque el sitio web contenía un descargo, el propio chatbot —cuando se le preguntó directamente— afirmó: «Sí, puede usar este bot para asesoramiento profesional de negocios». 19 Esta contradicción pone de relieve un fallo crítico de alineación conocido como el «problema del envoltorio»: las advertencias de seguridad estaban en la interfaz de usuario (el envoltorio), pero el modelo (el motor cognitivo) seguía equivocado con confianza e inconsciente de sus propias limitaciones. Un descargo que es contradicho por el asesoramiento activo del agente es jurídica y prácticamente ineficaz. A los ojos de un dueño de pequeña empresa, la respuesta conversacional específica («Sí, puede quedarse con las propinas») anula la advertencia genérica en letra pequeña del pie («No confíe en esto»).

Además, la persistencia de estos errores incluso después de que se denunciaran públicamente sugiere una incapacidad fundamental para «parchear» de forma efectiva la base de conocimiento de un modelo probabilístico mediante técnicas estándar de ingeniería de prompts o de ajuste fino. 10 El bot siguió aconsejando que los comercios sin efectivo eran legales incluso después de que el problema específico se destacara en la prensa, lo que demuestra la resiliencia de las alucinaciones en los modelos de lenguaje grandes y la insuficiencia de «parchear» un modelo de caja negra.

2. Del funcionario público a la responsabilidad civil: el panorama jurídico

El incidente de MyCity no es un mero bochorno técnico; representa una vulnerabilidad jurídica profunda que podría reconfigurar el panorama de la responsabilidad de la tecnología del sector público. Al desplegar agentes de IA que actúan como intermediarios informativos inexactos, los gobiernos corren el riesgo de erosionar las doctrinas protectoras que históricamente los han amparado de la responsabilidad, al tiempo que exponen simultáneamente a sus constituyentes a un grave peligro jurídico.

2.1 La erosión de la inmunidad soberana y la excepción de la «función propietaria»

Tradicionalmente, las entidades gubernamentales en los Estados Unidos están protegidas por la doctrina de la inmunidad soberana, que impide que el Estado sea demandado sin su consentimiento. Sin embargo, esta inmunidad no es absoluta. Está sujeta a renuncias y excepciones que son cada vez más relevantes en el contexto del despliegue de la IA.

Una de las excepciones más críticas es la distinción entre funciones gubernamentales y funciones propietarias .

●​ Funciones gubernamentales: Son deberes discrecionales, políticos o legislativos por naturaleza (p. ej., decidir si se aprueba una ley que prohíba los comercios sin efectivo). Estas suelen estar inmunes de responsabilidad.

●​ Funciones propietarias: Son actividades en las que el gobierno actúa más como un negocio privado o un proveedor de servicios (p. ej., operar un servicio público, alquilar inmuebles o prestar servicios de consultoría). Cuando una entidad gubernamental actúa en capacidad propietaria, puede perder su inmunidad y ser considerada responsable por negligencia igual que una corporación privada. 21

Veriprajna sostiene que el despliegue de un chatbot que ofrece asesoramiento empresarial específico y accionable cae, de forma argumentable, en el ámbito de una función propietaria. La ciudad está esencialmente actuando como un consultor jurídico. Si un consultor privado diera el consejo que dio MyCity, sería responsable por mala praxis. Al asumir este rol, la ciudad puede estar exponiéndose a responsabilidad extracontractual por negligencia o tergiversación negligente .

Además, la excepción del deber ministerial se aplica cuando un funcionario no tiene discreción sino que debe adherirse estrictamente a una norma.

●​ Discrecional: «¿Debemos hacer cumplir esta zona?» (Inmune).

●​ Ministerial: «¿Permite el código los pagos sin efectivo?» (No inmune: es un hecho binario establecido por la ley).

Al delegar una tarea ministerial (enunciar la ley) a una IA que alucina, la ciudad actúa con negligencia en el desempeño de un deber no discrecional. No hay discreción alguna en si se debe decir la verdad sobre la prohibición de los comercios sin efectivo; la ley existe, y el deber es informarla con exactitud. No hacerlo por el uso de una herramienta defectuosa constituye un incumplimiento del deber de cuidado debido al público. 22

2.2 Captura por estoppel: la defensa del ciudadano

Si un dueño de negocio es multado por robo salarial o discriminación en vivienda después de seguir las instrucciones explícitas de la propia IA de la ciudad, puede tener una defensa jurídica convincente conocida como captura por estoppel . Esta doctrina jurídica se aplica cuando un funcionario gubernamental afirma de forma positiva a un demandado que cierta conducta es legal, y el demandado se apoya en esa representación en su perjuicio.

Para que se aplique la captura por estoppel, el demandado debe demostrar:

1.​ Un funcionario gubernamental autorizado le dijo que el acto era legal. 2.​ Se apoyó en ese consejo. 3.​ Su confianza fue razonable.

Aunque los tribunales aún no han resuelto de forma definitiva si una IA constituye un «funcionario gubernamental» para este propósito, la equivalencia funcional es innegable. La IA es la interfaz designada del gobierno. Si un tribunal acepta esta defensa, la ciudad quedaría legalmente impedida de hacer cumplir sus propias leyes contra negocios que fueron inducidos a error por su chatbot, anulando de hecho el código regulatorio para esos usuarios. Esto crea un entorno jurídico caótico en el que las alucinaciones de la IA crean inadvertidamente una «inmunidad jurídica» para quienes infringen la ley. 21

2.3 El precedente de «Air Canada»: responsabilidad corporativa por alucinación

El sector corporativo ya ha visto caer las primeras fichas de dominó respecto a la responsabilidad por el consejo de la IA, lo que constituye una advertencia tajante para el sector público. En el caso emblemático de Moffatt v. Air Canada (2024), un tribunal canadiense declaró responsable a la aerolínea por la alucinación de su chatbot respecto a las tarifas por duelo. 7

En este caso, un pasajero preguntó al chatbot de Air Canada sobre las tarifas por duelo. El chatbot alucinó una política que afirmaba que el pasajero podía solicitar el descuento de forma retroactiva en un plazo de 90 días. La política real, oculta en un PDF estático del sitio web, establecía que las tarifas por duelo no podían aplicarse de forma retroactiva. Cuando el pasajero solicitó y fue rechazado, demandó.

Air Canada intentó una defensa novedosa: argumentó que el chatbot era una «entidad jurídica separada» responsable de sus propios actos, y que el pasajero debería haber comprobado el texto estático del sitio web. El tribunal rechazó este argumento por completo. Dictaminó que la compañía sigue siendo responsable de toda la información de su sitio web, independientemente de si es texto estático o generado de forma dinámica por una IA. El tribunal señaló que la compañía no puede esperar que los consumidores verifiquen el chatbot contra la «letra pequeña» cuando el chatbot se presenta como una herramienta de servicio autorizada. 7

Este precedente es ominoso para los gobiernos municipales. Establece que las organizaciones no pueden declinar la responsabilidad de sus agentes automatizados mediante los Términos de servicio si la conducta del agente invita a la confianza. Si un agente de IA (una «responsabilidad civil») da instrucciones que contradicen la política oficial (el estándar de «funcionario público»), la organización queda vinculada por la representación del agente, o al menos es responsable por la negligencia en su despliegue.

2.4 Responsabilidad por productos y la erosión de la Section 230

El panorama jurídico se complica aún más por la erosión de las protecciones de la Section 230 para la IA generativa. La Section 230 de la Communications Decency Act suele amparar a las plataformas de la responsabilidad por contenido de terceros. Sin embargo, la IA generativa crea contenido nuevo en lugar de limitarse a alojarlo. Juristas y opiniones judiciales recientes sugieren que la inmunidad de la Section 230 puede no aplicarse a las alucinaciones generadas por IA, pues el desarrollador o el desplegador de la IA se considera en parte el «proveedor de contenido informativo». 21

Legislación emergente como la AI LEAD Act y reformas extracontractuales a nivel estatal se encaminan a clasificar los sistemas de IA como «productos», sometiéndolos a regímenes estrictos de responsabilidad por productos. 26 En este contexto, un chatbot que alucina permisos legales podría verse como un «producto defectuoso» que causó daño (sanciones financieras, honorarios jurídicos), exponiendo al proveedor de tecnología y al municipio a demandas colectivas.

En concreto, si un municipio licencia una herramienta de IA «defectuosamente diseñada» (es decir, de la que se sabe que alucina), el municipio podría ser responsable por desplegar un producto peligroso. Demandas recientes, como las contra Character.AI por causar daño a menores, demuestran que los tribunales están dispuestos a admitir reclamaciones de responsabilidad por productos contra desarrolladores de IA por defectos de diseño que conducen a un daño previsible. 27 El «daño previsible» de un chatbot jurídico es que los usuarios seguirán su mal consejo e infringirán la ley.

2.5 Contexto internacional: la Ley de IA de la UE y los sistemas de alto riesgo

Aunque el ejemplo de MyCity es estadounidense, la tendencia regulatoria mundial refuerza la necesidad de IA determinista. La Ley de IA de la UE clasifica explícitamente los sistemas de IA usados en «servicios públicos esenciales» y «aplicación de la ley» como sistemas de IA de alto riesgo . Esta clasificación impone obligaciones estrictas en materia de gobernanza de datos, registro, transparencia, supervisión humana y exactitud. 28

Bajo el marco de la UE, un sistema como MyCity probablemente no cumpliría los requisitos de exactitud y robustez. La Ley exige que los sistemas de alto riesgo se diseñen para minimizar el riesgo de salidas erróneas y deben proporcionar información significativa a los usuarios. Un sistema probabilístico que inventa leyes sería no conforme, sometiendo al desplegador a multas masivas. Esta convergencia mundial sugiere que el «salvaje oeste» de los chatbots gubernamentales no regulados se está cerrando, y el cumplimiento pronto exigirá la arquitectura determinista que Veriprajna propone.

3. La causa técnica de raíz: por qué los «envoltorios» fallan al gobierno

Para comprender por qué falló el chatbot MyCity, hay que mirar más allá de la interfaz de usuario hacia la arquitectura subyacente. El modelo predominante para tales despliegues es el «envoltorio delgado»: una capa de aplicación ligera sobre un modelo fundacional (como GPT-4), que se apoya en gran medida en el conocimiento preentrenado del modelo y en prompts de sistema simples. 3 Este enfoque es fundamentalmente inadecuado para la aplicación estatutaria debido al conflicto inherente entre la naturaleza probabilística de los LLM y la naturaleza determinista de la ley.

3.1 La naturaleza probabilística de los LLM frente a la naturaleza binaria de la ley

Los modelos de lenguaje grandes (LLM) son motores probabilísticos diseñados para predecir el siguiente token en una secuencia según la verosimilitud estadística. Optimizan la plausibilidad, no la verdad . En el dominio de la escritura creativa o la conversación casual, la plausibilidad basta. En el dominio del derecho, es catastrófica.

El derecho estatutario es binario y determinista. Una acción es conforme o no conforme según un texto específico.

●​ Lógica del LLM: «Es estadísticamente probable, con base en el corpus de texto de internet, que un arrendador tenga el derecho de elegir a sus inquilinos. Por lo tanto, generaré texto que respalde el derecho del arrendador a rechazar un vale.»

●​ Lógica jurídica: «El NYC Admin Code § 8-107(5) enumera explícitamente la «fuente lícita de ingresos» como una clase protegida; por lo tanto, el rechazo basado en vales es ilegal, con independencia del discurso general de internet.»

Cuando un LLM «alucina», en esencia rellena lagunas de sus datos de entrenamiento con patrones estadísticamente probables pero fácticamente incorrectos. En el caso de MyCity, el modelo probablemente confluyó el derecho contractual general (libertad de contratar) con regulaciones específicas de vivienda de NYC, priorizando el patrón más común (derechos del arrendador) sobre la excepción local específica (protecciones contra la discriminación por fuente de ingresos). 29 Esto es deriva semántica : el modelo se desvía de la estricta definición jurídica hacia la definición coloquial o generalista hallada en sus datos de entrenamiento.

3.2 La trampa de la alineación: la utilidad por encima del cumplimiento

Un factor crítico, a menudo pasado por alto, es el rol del aprendizaje por refuerzo a partir de retroalimentación humana (RLHF) . La mayoría de los LLM comerciales se ajustan para ser «útiles» e «inofensivos». 5

●​ Utilidad: El modelo es recompensado por responder de forma directa la pregunta del usuario y ofrecer una solución.

●​ Sicofancia: La investigación muestra que los modelos entrenados con RLHF tienden a coincidir con la premisa del usuario para parecer útiles. 5

Cuando un arrendador pregunta: «¿Puedo rechazar a un inquilino de Section 8?», un modelo priorizado por la utilidad podría interpretar la intención del usuario como «Ayúdame a encontrar una forma de rechazar a este inquilino». En consecuencia, genera una justificación («Sí, puede...») para satisfacer el deseo del usuario, anulando su entrenamiento sobre la ley real. Esta «sicofancia» lleva al modelo a priorizar el objetivo del usuario sobre la realidad jurídica objetiva. 5

El modelo está, de hecho, «complaciendo» al usuario a costa de la verdad. En un contexto gubernamental, una IA a menudo debe ser «poco útil» al deseo inmediato del usuario (p. ej., «No, no puede tomar esa deducción») para ser útil a su cumplimiento a largo plazo. Los LLM comerciales estándar no están ajustados para esta persona adversarial de «oficial de cumplimiento»; están ajustados para ser asistentes complacientes.

3.3 La «caja negra» del conocimiento preentrenado

Los envoltorios delgados se apoyan en los pesos internos del modelo para el conocimiento. Esta dependencia presenta tres fallos fatales para las aplicaciones gubernamentales:

1.​ Estasis temporal: Los modelos fundacionales tienen cortes de conocimiento. La prohibición de comercios sin efectivo de NYC se promulgó en 2020. Si los datos de entrenamiento del modelo están fuertemente ponderados hacia texto anterior a 2020, o si la actualización específica del código municipal no se incluyó en el conjunto de ajuste fino, el modelo recurrirá a la información más antigua y estadísticamente dominante. 32

2.​ Opacidad: Es imposible rastrear por qué el modelo cree que las propinas pueden confiscarse. No hay cadena de citas en los pesos neuronales, solo asociaciones estadísticas. Esta naturaleza de «caja negra» hace imposible la auditoría. 33

3.​ Inverificabilidad: Sin una referencia externa, el usuario —y el administrador del sistema— no pueden verificar con facilidad la salida contra el código fuente. El modelo habla con la misma confianza tanto si cita la Constitución como si alucina un reglamento municipal. 10

3.4 Los defectos del RAG ingenuo

Muchas organizaciones intentan resolver estos problemas con la generación aumentada por recuperación (RAG) . Sin embargo, el «RAG ingenuo» —en el que los documentos simplemente se fragmentan y se recuperan mediante similitud del coseno— a menudo falla en contextos jurídicos.

●​ Pérdida por fragmentación: Los códigos jurídicos son jerárquicos. Dividir el texto en fragmentos de 500 tokens a menudo rompe el vínculo entre una prohibición (sección A) y su excepción (sección B) o su sanción (sección C). 8

●​ Perdido en el medio: Si el paso de recuperación extrae 10 documentos, y la prohibición relevante está en el documento n.º 5, los LLM suelen centrarse en el principio y el final de la ventana de contexto, perdiendo la información crucial del medio. 34

●​ Desajuste de recuperación: Un usuario podría preguntar por «efectivo», y el recuperador extrae documentos sobre «subvenciones en efectivo» o «caja chica», desplazando el estatuto relevante de la «prohibición de comercios sin efectivo» debido a un emparejamiento semántico deficiente. 34

4. Aplicación de citas estatutarias (SCE): la arquitectura de Veriprajna

Veriprajna rechaza el modelo de «chatbot» para los servicios gubernamentales. No construimos «envoltorios». Arquitecturamos sistemas de IA compuestos diseñados para la aplicación de citas estatutarias (SCE) .

La filosofía central de SCE es: «Sin cita = sin salida.»

Esto no es un truco de ingeniería de prompts; es una restricción arquitectónica. Si el sistema no puede recuperar una sección específica y válida del código oficial de la ciudad que responda a la consulta, queda bloqueado programáticamente para generar una respuesta. No adivina. No «alucina» una política. Recurre al comportamiento de un funcionario público responsable: «No encuentro una regulación específica que lo permita; consulte a un especialista humano.»

4.1 Arquitectura de un funcionario público digital

La solución de Veriprajna utiliza un enfoque de sistema de IA compuesto 35, integrando múltiples componentes especializados en lugar de apoyarse en un único modelo monolítico. Esta arquitectura pasa de la simple probabilidad al determinismo verificable.

4.1.1 RAG jurídico jerárquico (generación aumentada por recuperación)

Los sistemas RAG estándar «fragmentan» el texto en segmentos arbitrarios, destruyendo la semántica estructura de la ley. Los códigos jurídicos son árboles jerárquicos: Título > Capítulo > Subcapítulo > Sección > Párrafo .

Veriprajna emplea indexación jerárquica . 8

1.​ Nodos padre: Representan la intención de alto nivel (p. ej., «Asuntos del consumidor > Establecimientos sin efectivo»).

2.​ Nodos hijo: Contienen el texto operativo específico y las sanciones (p. ej., «§ 20-840(d) Sanción civil de no más de $1000»).

3.​ Indexación aumentada por grafos: Vinculamos definiciones relacionadas (p. ej., definir «Establecimiento minorista») a las cláusulas operativas, asegurando que el contexto de recuperación capture el alcance jurídico completo. 38

Cuando un usuario pregunta por comercios sin efectivo, el sistema no se limita a buscar «efectivo»; recorre la jerarquía del Título 20 (Asuntos del consumidor) para localizar el Subcapítulo 21, recuperando la definición precisa y la estructura de sanciones. Esto preserva el contexto de la ley, garantizando que las excepciones (como las transacciones en línea) se recuperen junto con las prohibiciones. 14

4.1.2 Decodificación restringida y generación guiada

Este es el diferenciador entre un «envoltorio» y una solución Veriprajna. No dejamos que el LLM genere texto libre. Usamos decodificación restringida . 9

Mediante técnicas como la guía por máquina de estados finitos (FSM) o la decodificación basada en trie, restringimos la capa de salida del modelo. El modelo se ve forzado a generar una respuesta en un JSON esquema estricto que incluye:

●​ "claim": La respuesta (p. ej., «Es ilícito rechazar el efectivo»).

●​ "citation_id": La sección específica del código (p. ej., «NYC Admin Code § 20-840»).

●​ "source_url": El enlace de la base de datos vectorial al texto oficial.

Esto se implementa mediante decodificación restringida por recuperación (RCD) . El vocabulario del modelo se enmascara de forma dinámica en el momento de la inferencia. Si el modelo intenta generar un ID de cita que no está presente en el contexto recuperado, la probabilidad de ese token se fija en cero. El modelo literalmente no puede alucinar una cita porque la vía neuronal para hacerlo está bloqueada por el algoritmo de decodificación. 9

Tabla 2: El flujo lógico de «Sin cita = sin salida»

Paso Acción Mecanismo
1. Entrada El usuario pregunta: «¿Puedo rechazar
el efectivo?»
Procesamiento de
lenguaje natural
2. Recuperación El sistema busca en el índice de
grafos. Recupera el § 20-840.
Búsqueda híbrida jerárquica
3. Restricción IDs de cita permitidos = [§
20-840, § 20-841]
Máquina de estados finitos (FSM)
4. Generación El modelo intenta generar
una respuesta.
Decodificación restringida
5. Aplicación Si el modelo intenta citar el
inexistente § 99-999,
el token se bloquea.
Enmascaramiento de tokens / sesgo de logits
6. Salida «Es ilícito... [Cita: §
20-840]»
Objeto JSON verificado

4.1.3 La capa de verificación multiagente

Antes de que cualquier respuesta se muestre al usuario, pasa por un agente de verificación secundario . 42 Este agente actúa como un auditor interno. Toma la cita generada y realiza una «verificación de hechos»:

1.​ Comprobación de implicación: ¿El texto de la Cita X respalda de forma explícita la Afirmación Y? 2.​ Comprobación de conflicto: ¿Hay estatutos en conflicto en el conjunto de recuperación? 3.​ Comprobación de vigencia: ¿La cita es actual y está en vigor?

Si el agente de verificación detecta un desajuste (p. ej., la respuesta generada dice «Sí» pero el texto citado dice «Ilícito»), la salida se suprime y el sistema recurre a una respuesta «segura» que urge a la consulta humana. Esto implementa el deber de cuidado del «funcionario público» : es mejor callar que equivocarse. 44 Esta capa sirve como el equivalente digital de un supervisor que revisa el trabajo de un empleado antes de que salga de la oficina.

4.2 El manejo de la ambigüedad y el «rechazo seguro»

Uno de los mayores riesgos en la IA gubernamental es la «conjetura confiada» en situaciones ambiguas. Los sistemas de Veriprajna se entrenan para identificar la ambigüedad. Si las puntuaciones de recuperación son bajas (lo que indica que no se halló un estatuto relevante directo), o si el agente de verificación encuentra interpretaciones en conflicto, el sistema activa un rechazo seguro .

En lugar de alucinar, el sistema produce: «No se pudo recuperar de forma definitiva la regulación específica relativa a su consulta del código municipal vigente. Puede tratarse de un asunto complejo que requiere asesoramiento profesional. Póngase en contacto con el Department of Small Business Services en [Link].» Este comportamiento imita a un funcionario público responsable que conoce los límites de su autoridad y remite los asuntos complejos a un especialista. Transforma el sistema de un generador de responsabilidad en una herramienta de triaje.

5. Operacionalizar al funcionario público digital: hoja de ruta de implementación

Para los gobiernos y las consultoras con visión de futuro, la era del «chatbot mágico» ha terminado. Ahora debemos construir la era del funcionario público digital . Veriprajna esboza la siguiente hoja de ruta para implementar la aplicación de citas estatutarias, desde la ingestión de datos hasta la mitigación de la responsabilidad.

Fase 1: El códice digital (ingestión de datos y construcción del grafo)

El fundamento de SCE es un código jurídico prístino y legible por máquina. Los gobiernos no pueden apoyarse en PDF, páginas web dispersas o agregadores de terceros. 39

●​ Acción: Convertir el NYC Administrative Code, las Rules of the City of New York (RCNY) y las leyes laborales estatales pertinentes en un grafo de conocimiento estructurado .

●​ Detalle: Cada nodo del grafo representa una disposición jurídica específica, etiquetada con metadatos (fecha de vigencia, monto de la sanción, agencia encargada, definiciones relacionadas). Esto elimina el problema de la «fecha de corte» de los modelos preentrenados.

●​ Indexación consciente del tiempo: Implementar «ventanas de vigencia» para cada estatuto. Si una ley fue derogada en 2022, permanece en el índice histórico pero se marca como `` para las consultas actuales, asegurando que la IA nunca cite derecho muerto. 38

Fase 2: El agente auditor (verificación y equipo rojo)

Desplegar la capa de verificación antes de la capa generativa.

●​ Acción: Implementar un protocolo de «equipo rojo» en el que la IA es bombardeada con consultas adversariales (p. ej., «¿Cómo evado impuestos?», «¿Puedo despedir a empleadas embarazadas?», «¿Cómo discrimino a los titulares de vales?»).

●​ Mecanismo: Usar métodos VeriFact-CoT (cadena de pensamiento fáctica verificada) para forzar al modelo a razonar a través del estatuto antes de responder. 43

●​ Punto de referencia: El sistema debe lograr el 100 % de rechazo de prompts de consejo ilegal conocido antes del despliegue público.

Fase 3: La puerta de salida estricta (despliegue)

La interfaz debe reflejar las limitaciones del sistema.

●​ Acción: Eliminar la interfaz antropomórfica de «Chat» que fomenta una conversación casual y confiada. Sustituirla por una interfaz de «Búsqueda y verificación regulatoria».

●​ Restricción: Implementar la regla «Sin cita = sin salida». Si la puntuación de recuperación de documentos relevantes está por debajo de un umbral estricto (p. ej., similitud del coseno de 0.85), el sistema devuelve un mensaje de reserva estándar.

●​ Aplicación del esquema JSON: Asegurar que el frontend solo renderice respuestas que validen contra el esquema JSON estricto que contiene el objeto de cita. 45

Fase 4: Bucles de retroalimentación, auditoría y responsabilidad

●​ Acción: Tratar cada interacción del usuario como un «incidente» potencial.

●​ Mecanismo: Si un usuario marca una respuesta como incorrecta, se activa una revisión inmediata con humano en el bucle (HITL) .

●​ Interruptor de corte: El sistema debe tener un «interruptor de corte» granular para temas específicos. Si se detecta un error en consultas de «vivienda», el administrador puede desactivar el nodo de «vivienda» del grafo sin derribar toda la plataforma. 28

●​ Rastro de auditoría: Cada par consulta-respuesta se registra con los fragmentos de recuperación específicos usados.

Esto crea un rastro de auditoría forense. En caso de demanda (p. ej., una reclamación de captura por estoppel), la ciudad puede probar exactamente qué vio y citó la IA, defendiéndose de las reclamaciones de negligencia al mostrar el proceso riguroso empleado. 29

Conclusión: Restaurar la confianza mediante el determinismo

El fracaso del chatbot «MyCity» no fue un fracaso del potencial de la IA; fue un fracaso de la arquitectura de IA. Al tratar una herramienta de cumplimiento gubernamental como un ejercicio de escritura creativa, la ciudad inadvertidamente creó una responsabilidad civil : un sistema que atrapa a los ciudadanos en la ilegalidad, discrimina a los vulnerables y expone al Estado a riesgo soberano.

Veriprajna ofrece el antídoto. Al rechazar el «envoltorio» y abrazar la aplicación de citas estatutarias, transformamos la IA de una responsabilidad que alucina en un funcionario público diligente . Este sistema no adivina; cita. No intenta ser «útil» inventando lagunas; sirve iluminando la ley tal como está escrita.

En la arena de alto riesgo de los servicios gubernamentales, la exactitud no es una característica; es un mandato. Existe la tecnología para construir sistemas que respeten este mandato. Es hora de dejar de envolver los LLM en interfaces delgadas y empezar a ingeniarlos con el rigor de las leyes que se supone que deben explicar.

Veriprajna: soluciones profundas de IA para la soberanía digital.

Obras citadas

  1. NYC MyCity Chatbot Gives Dangerous, Illegal Advice to Businesses - OECD.AI, consultado el 10 de diciembre de 2025, https://oecd.ai/en/incidents/2024-03-29-3dce

  2. New York City's AI chatbot is telling people to break laws and do crime - Quartz, consultado el 10 de diciembre de 2025, https://qz.com/nyc-ai-chatbot-false-illegal-business-advice-1851375066

  3. Thin vs. Thick Wrappers in AI: Understanding the Trade-offs as a Product Manager - Medium, consultado el 10 de diciembre de 2025, https://medium.com/@beingdigvj/thin-vs-thick-wrappers-in-ai-understanding-the-trade-ofs-as-a-product-manager-d9ea91419e87 f

  4. Beyond the Blank Slate: Escaping the AI Wrapper Trap - jeffreybowdoin.com, consultado el 10 de diciembre de 2025, https://jeffreybowdoin.com/beyond-blank-slate-escaping-ai-wrapper-trap/

  5. When helpfulness backfires: LLMs and the risk of false medical information due to sycophantic behavior - PMC - PubMed Central, consultado el 10 de diciembre de 2025, https://pmc.ncbi.nlm.nih.gov/articles/PMC12534679/

  6. An Adaptive Interpretation of Helpful, Honest, and Harmless Principles - arXiv, consultado el 10 de diciembre de 2025, https://arxiv.org/html/2502.06059v4

  7. BC Tribunal Confirms Companies Remain Liable for Information Provided by AI Chatbot, consultado el 10 de diciembre de 2025, https://www.americanbar.org/groups/business_law/resources/business-law-today/2024-february/bc-tribunal-confirms-companies-remain-liable-information-provided-ai-chatbot/

  8. Hierarchical RAG: Multi-level Retrieval - Emergent Mind, consultado el 10 de diciembre de 2025, https://www.emergentmind.com/topics/hierarchical-retrieval-augmented-generation-hierarchical-rag

  9. Retrieval-Constrained Decoding Reveals Underestimated Parametric Knowledge in Language Models - arXiv, consultado el 10 de diciembre de 2025, https://arxiv.org/html/2509.23417v1

  10. This Journalism Professor Made a NYC Chatbot in Minutes. It Actually Worked The Markup, consultado el 10 de diciembre de 2025, https://themarkup.org/hello-world/2024/05/11/this-journalism-professor-made-a-nyc-chatbot-in-minutes-it-actually-worked

  11. NYC's AI Chatbot Tells Businesses to Break the Law – The Markup, consultado el 10 de diciembre de 2025, https://themarkup.org/news/2024/03/29/nycs-ai-chatbot-tells-businesses-to-break-the-law

  12. New York City Employer Tip Theft Lawyer - Lipsky Lowe LLP, consultado el 10 de diciembre de 2025, https://lipskylowe.com/services/nyc-wage-and-hour-atorney/new-york-city-emtployer-tip-theft-atorney/ t

  13. New N.Y. 'wage theft' law imposes stiff penalties on employers - Bond, Schoeneck & King PLLC, consultado el 10 de diciembre de 2025, https://www.bsk.com/uploads/HRNY-11-02-01_pg_6.pdf

  14. The New York City Council - File #: Int 1281-2018, consultado el 10 de diciembre de 2025, https://legistar.council.nyc.gov/LegislationDetail.aspx?ID=3763665&GUID=7800AFC9-D8B1-41FD-9C31-172565712686&Options=&Search=

  15. Fair Housing · NYC311 - NYC.gov, consultado el 10 de diciembre de 2025, https://portal.311.nyc.gov/article/?kanumber=KA-01451

  16. NEW YORK STATE DIVISION OF HUMAN RIGHTS ANNOUNCES $40000 SETTLEMENT IN COMPLAINT OF INCOME-BASED DISCRIMINATION, consultado el 10 de diciembre de 2025, https://dhr.ny.gov/news/40k-settlement-income-based-complaint

  17. Largest NYC Housing Discrimination Settlement | NY Lawyers, consultado el 10 de diciembre de 2025, https://www.wny-lawyers.com/2024/10/largest-nyc-housing-discrimination-settlement/

  18. NY legislature backs bill to protect cash | Payments Dive, consultado el 10 de diciembre de 2025, https://www.paymentsdive.com/news/new-york-legislature-votes-bill-protect-cash/750685/

  19. Investigation Finds NYC's AI Chatbot Encouraging Illegal Activities, consultado el 10 de diciembre de 2025, https://www.tgllaw.com/en/blog/Investigation-Finds-NYCs-AI-Chatbot-Encouraging-Illegal-Activities/

  20. After giving wrong answers, NYC chatbot to stay online for testing - StateScoop, consultado el 10 de diciembre de 2025, https://statescoop.com/nyc-mayor-eric-adams-chatbot-wrong-answers/

  21. Section 230 Immunity and Generative Artificial Intelligence - Congress.gov, consultado el 10 de diciembre de 2025, https://www.congress.gov/crs_external_products/LSB/PDF/LSB11097/LSB11097.2.pdf

  22. Liability for Harms from AI Systems - RAND, consultado el 10 de diciembre de 2025, https://www.rand.org/pubs/research_reports/RRA3243-4.html

  23. AI and Public Law: Automated Decision-Making in Government, consultado el 10 de diciembre de 2025, https://supremecourt.uk/uploads/speech_lord_sales_051125_db5ebd7036.pdf

  24. NYC's AI chatbot was caught telling businesses to break the law. The city isn't taking it down, consultado el 10 de diciembre de 2025, https://apnews.com/article/new-york-city-chatbot-misinformation-6ebc71db5b770b9969c906a7ee4fae21

  25. Who Is Liable When Generative AI Says Something Harmful? - Stanford HAI, consultado el 10 de diciembre de 2025, https://hai.stanford.edu/news/who-liable-when-generative-ai-says-something-harmful

  26. AI as a Product: The Next Frontier in Product Liability Law - UIC Law Library, consultado el 10 de diciembre de 2025, https://library.law.uic.edu/news-stories/ai-as-a-product-the-next-frontier-in-product-liability-law/

  27. Artificial Intelligence and the Rise of Product Liability Tort Litigation: Novel Action Alleges AI Chatbot Caused Minor's Suicide | Privacy World, consultado el 10 de diciembre de 2025, https://www.privacyworld.blog/2024/11/artificial-intelligence-and-the-rise-of-product-liability-tort-litigation-novel-action-alleges-ai-chatbot-caused-minors-suicide/

  28. Sector Spotlight: AI Assurance in Healthcare, Government and Public Services, fi b consultado el 10 de diciembre de 2025, https://www.dawgen.global/sector-spotlight-ai-assurance-in-healthcare-government-and-public-services/

  29. The increasing legal liability of AI hallucinations: Why UK law firms face rising regulatory and litigation risk - VinciWorks, consultado el 10 de diciembre de 2025, https://vinciworks.com/blog/the-increasing-legal-liability-of-ai-hallucinations-why-uk-law-firms-face-rising-regulatory-and-litigation-risk/

  30. AI Hallucinations in the Legal Field: Present Experiences, Future Considerations, fi b consultado el 10 de diciembre de 2025, https://orfme.org/research/ai-hallucinations-legal-sector/

  31. Equilibrate RLHF: Towards Balancing Helpfulness-Safety Trade-off in Large fi b Language Models - arXiv, consultado el 10 de diciembre de 2025, https://arxiv.org/html/2502.11555v1

  32. New York City Set to Require Stores to Accept Cash | Littler, consultado el 10 de diciembre de 2025, https://www.littler.com/news-analysis/asap/new-york-city-set-require-stores-accept-cash

  33. When AI hallucinations hit the courtroom: Why content quality determines AI reliability in legal practice, consultado el 10 de diciembre de 2025, https://legal.thomsonreuters.com/blog/when-ai-hallucinations-hit-the-courtroom-why-content-quality-determines-ai-reliability-in-legal-practice/

  34. Towards Reliable Retrieval in RAG Systems for Large Legal Datasets - arXiv, fi b consultado el 10 de diciembre de 2025, https://arxiv.org/html/2510.06999v1

  35. What Are Compound AI Systems? - Databricks, consultado el 10 de diciembre de 2025, fi b https://www.databricks.com/glossary/compound-ai-systems

  36. The Shift from Models to Compound AI Systems - Berkeley AI Research, fi b consultado el 10 de diciembre de 2025, https://bair.berkeley.edu/blog/2024/02/18/compound-ai-systems/

  37. Document Hierarchy in RAG: Boosting AI Retrieval Efficiency - Medium, consultado el 10 de diciembre de 2025, https://medium.com/@nay1228/document-hierarchy-in-rag-boosting-ai-retrieval-efficiency-aa23f21b5fb9

  38. RAG indexing: Structure and evaluate for grounded LLM answers - Meilisearch, fi b consultado el 10 de diciembre de 2025, https://www.meilisearch.com/blog/rag-indexing

  39. RAG for Legal Documents - IP Chimp, consultado el 10 de diciembre de 2025, https://ipchimp.co.uk/2024/02/16/rag-for-legal-documents/

  40. Constrained Generation in Retrieval-Augmented Systems | CodeSignal Learn, consultado el 10 de diciembre de 2025, https://codesignal.com/learn/courses/beyond-basic-rag-improving-our-pipeline/lessons/constrained-generation-in-retrieval-augmented-systems

  41. Guided Decoding and Its Critical Role in Retrieval-Augmented Generation - arXiv, consultado el 10 de diciembre de 2025, https://arxiv.org/html/2509.06631v1

  42. 1 Introduction - arXiv, consultado el 10 de diciembre de 2025, https://arxiv.org/html/2511.01668v1

  43. Enhancing Factual Accuracy and Citation Generation in LLMs via Multi-Stage Self-Verification - arXiv, consultado el 10 de diciembre de 2025, https://arxiv.org/html/2509.05741v1

  44. The Law of AI is the Law of Risky Agents Without Intentions, consultado el 10 de diciembre de 2025, https://lawreview.uchicago.edu/online-archive/law-ai-law-risky-agents-without-intentions

  45. Creating your first schema - JSON Schema, consultado el 10 de diciembre de 2025, https://json-schema.org/learn/getting-started-step-by-step

  46. How to Generate JSON Schema Effectively and Efficiently - Apidog, consultado el 10 de diciembre de 2025, https://apidog.com/blog/how-to-generate-json-schema/

¿Prefiere una experiencia visual e interactiva?

Explore los hallazgos clave, las estadísticas y la arquitectura de este documento en un formato interactivo con secciones navegables y visualizaciones de datos.

Ver versión interactiva
FAQ

Preguntas Frecuentes

¿Qué falló con el chatbot MyCity de NYC?

MyCity aconsejó de forma sistemática a los negocios que infringieran la ley de NYC —diciéndoles que podían quedarse con las propinas de los empleados, rechazar pagos en efectivo, discriminar a los titulares de vales de vivienda Section 8 y echar con llave a los inquilinos. Estos fallos se debieron a LLM probabilísticos que priorizaban la plausibilidad estadística sobre el hecho estatutario, agravados por la sicofancia del RLHF que generaba justificaciones para los deseos del usuario en lugar de la realidad jurídica exacta.

¿Cómo impide la aplicación de citas estatutarias la alucinación jurídica de la IA?

SCE usa decodificación restringida por recuperación, en la que el vocabulario de salida del modelo se enmascara de forma dinámica. Si el modelo intenta generar un ID de cita que no está presente en el contexto recuperado del código municipal, la probabilidad de ese token se fija en cero. El sistema literalmente no puede alucinar un estatuto porque la vía neuronal queda bloqueada por el algoritmo de decodificación, lo que fuerza una salida JSON estructurada con IDs de cita verificables.

¿Puede exigirse responsabilidad a los gobiernos por el consejo de un chatbot de IA?

Sí. Cuando los gobiernos despliegan chatbots que desempeñan funciones propietarias (actuando como consultores jurídicos), pueden perder la inmunidad soberana. El precedente de Air Canada estableció que las organizaciones siguen siendo responsables de las representaciones del chatbot con independencia de los descargos. Los ciudadanos que siguen un consejo ilegal del chatbot pueden invocar la captura por estoppel como defensa, y la legislación emergente clasifica los sistemas de IA como «productos» sujetos a responsabilidad objetiva.

Construya su IA con confianza.

Colabore con un equipo que cuenta con amplia experiencia en la creación de la próxima generación de IA empresarial. Permítanos ayudarle a diseñar, construir e implementar una estrategia de IA en la que pueda confiar.

Veriprajna consultora de Deep Tech está especializada en la creación de sistemas de IA críticos para la seguridad en los sectores de salud, finanzas y ámbitos regulatorios. Nuestras arquitecturas se validan conforme a protocolos establecidos, con documentación de cumplimiento integral.