Para responsables de riesgo y cumplimiento4 min de lectura

¿Puede su sistema de concesión de créditos con IA superar una auditoría de sesgos?

Dos importantes prestamistas se enfrentaron a sanciones regulatorias por discriminación algorítmica: esto es lo que sus fallos revelan sobre el riesgo de su propia IA.

El problema

Navy Federal Credit Union rechazó a más de la mitad de sus solicitantes de hipotecas negros en 2022. Aprobó al 77 % de los solicitantes blancos. Esa brecha de 29 puntos porcentuales fue la más amplia de cualquiera de los 50 principales prestamistas hipotecarios del país. Mientras tanto, Earnest Operations LLC pagó un acuerdo de 2,5 millones de dólares en julio de 2025 después de que Massachusetts determinara que sus modelos de concesión de préstamos basados en IA perjudicaban de manera desproporcionada a prestatarios negros, hispanos y no ciudadanos.

Estos no son incidentes aislados. Son señales de advertencia de un problema estructural en todo el sector. Si su institución utiliza la toma de decisiones automatizada para la concesión de créditos —y casi todos los prestamistas lo hacen—, usted se enfrenta a la misma exposición.

El problema central en Earnest fue una variable denominada tasa de impago por cohorte (CDR, por sus siglas en inglés). Esta métrica hace un seguimiento del promedio de impagos de préstamos en instituciones educativas específicas. Suena neutral. Pero los colegios y universidades históricamente negros (HBCU) presentan tasas de impago más altas debido a décadas de infrafinanciación sistémica y brechas de riqueza. Al ponderar la CDR en su modelo, Earnest penalizó a los solicitantes individuales por las desventajas históricas de su institución académica, con independencia de su salud financiera personal. Sobre el papel, el algoritmo parecía neutral en cuanto a la raza. En la práctica, codificaba la discriminación.

En Navy Federal, el problema fue aún más difícil de delimitar. Cuando los investigadores controlaron más de una docena de factores —ingresos, ratio deuda-ingresos, valor de la propiedad, vecindario—, los solicitantes negros seguían teniendo más del doble de probabilidades de ser denegados que los solicitantes blancos con perfiles idénticos. Algo dentro del algoritmo de suscripción de la cooperativa de crédito estaba generando un sesgo que los factores crediticios tradicionales no podían explicar.

Por qué esto le importa a su empresa

Las consecuencias financieras ya están aquí. Earnest pagó 2,5 millones de dólares para resolver una investigación estatal. Navy Federal se enfrenta a demandas colectivas consolidadas e investigaciones del Congreso. En mayo de 2024, un juez federal dictaminó que las demandas por impacto dispar contra Navy Federal podían seguir adelante, abriendo la puerta a la exhibición de pruebas sobre la lógica interna del modelo de la entidad.

Esto es lo que significa para su institución:

  • La aplicación regulatoria se está volviendo específica. La CFPB exige ahora «motivos precisos y específicos» para las acciones adversas. No puede decirle a un solicitante que fue rechazado por «ingresos insuficientes» si la verdadera razón fue una alerta algorítmica sobre un dato no tradicional. «El algoritmo lo decidió» no es una defensa jurídica.
  • La disparidad estadística por sí sola puede superar una moción de desestimación. Los tribunales le están trasladando la carga de la prueba. Su institución debe demostrar que su proceso de suscripción es tanto necesario como la opción menos discriminatoria disponible.
  • La brecha entre la política y la práctica es una fuente de responsabilidad. Earnest contaba con políticas internas que exigían la supervisión de directivos sénior para las excepciones del modelo. Los investigadores descubrieron que los evaluadores de riesgos ignoraban con frecuencia los modelos y aplicaban criterios arbitrarios sin documentarlos. Esa desconexión hizo que el sistema fuera imposible de auditar e imposible de defender.
  • Los puntos de referencia nacionales exponen los valores atípicos. La tasa media nacional de denegación de la CFPB es del 5,6 % para los solicitantes blancos y del 16,2 % para los solicitantes negros: una brecha de 10,6 puntos porcentuales. La brecha de Navy Federal fue casi el triple de esa cifra. Si sus números están por encima de las medias nacionales, los reguladores se darán cuenta.

Su consejo de administración, su director de asesoría jurídica y sus reguladores le harán todos la misma pregunta: ¿puede explicar cómo toma decisiones de concesión de préstamos su IA? Si no puede responder a eso con claridad, asume el mismo riesgo al que ahora se enfrentan Earnest y Navy Federal.

Qué está ocurriendo realmente bajo el capó

La mayoría de las herramientas de concesión de créditos basadas en IA actuales son lo que el sector denomina «wrappers» (envoltorios). Piénselo como colocar una nueva etiqueta en un producto genérico. Estos sistemas toman sus datos, los transmiten a un modelo de lenguaje de gran tamaño (LLM) de uso general como GPT-4 o Gemini, y devuelven un resultado. Parecen sofisticados. Bajo el capó, carecen de las reglas específicas del dominio, las capas de transparencia y el razonamiento causal que exigen los reguladores financieros.

He aquí el desajuste fundamental: los servicios financieros requieren una lógica determinista —las mismas entradas deben producir siempre la misma salida—. Sin embargo, los LLM son probabilísticos. Predicen la siguiente palabra de una secuencia. No recuperan hechos contrastados ni realizan cálculos actuariales. En un contexto de suscripción crediticia, un LLM puede generar una «alucinación»: una justificación inventada para la denegación de un préstamo que suena razonable pero que carece de base en el expediente financiero real del solicitante.

Este no es un riesgo teórico. Cuando el chatbot de Air Canada inventó una política de tarifas por duelo que no existía, la aerolínea fue declarada responsable. El mismo principio se aplica a sus decisiones de concesión de crédito.

Las plataformas de IA genéricas también carecen del contexto vertical para interpretar con precisión documentos hipotecarios, declaraciones de la renta y extractos bancarios. Sin una formación específica para el sector, estos modelos malinterpretan los patrones de ingresos y el flujo de caja, lo que provoca rechazos erróneos de prestatarios solventes. Y dado que los LLM se entrenan con ingentes volúmenes de texto de Internet saturados de sesgos históricos, pueden asociar determinadas nacionalidades o profesiones con una menor solvencia crediticia, incluso cuando los datos individuales del solicitante son impecables.

Lo peor de todo: nada de esto se detecta en una auditoría superficial. El sesgo reside en lo que los investigadores llaman el «espacio latente» del modelo: la capa oculta donde se forman las correlaciones. Sin las herramientas adecuadas, usted no lo verá hasta que lo haga un regulador o el abogado de la parte demandante.

Qué funciona (y qué no)

Empecemos por lo que falla ante un examen riguroso:

  • «Eliminamos la raza del modelo». Eliminar el campo de la raza no suprime el sesgo racial. Las variables proxy (sustitutas), como las tasas de impago por centro educativo, los códigos postales y los patrones de compra, transmiten la misma señal. Earnest nunca preguntó a los solicitantes por su raza y, aun así, discriminó.
  • «Utilizamos un proveedor de IA externo de confianza». Externalizar su IA no externaliza su responsabilidad legal. La CFPB responsabiliza al prestamista, no al proveedor. Si el modelo de su proveedor no puede explicar sus decisiones, la brecha de cumplimiento normativo es suya.
  • «Nuestro equipo revisa los casos límite de forma manual». Las anulaciones humanas no estructuradas en realidad empeoran la situación. Los evaluadores de riesgos de Earnest eludieron el modelo sin documentar sus motivos, creando un sistema híbrido en el que coexistían tanto el sesgo algorítmico como el humano, y ninguno de los dos era auditable.

Lo que sí funciona es una arquitectura por capas que separa los distintos tipos de decisiones en función de lo que requiere cada una:

  1. Entrada: Validación de datos antes de que la IA los vea. Cada punto de datos pasa por comprobaciones de precisión, integridad, coherencia, puntualidad, relevancia y representatividad. Esto evita que los datos contaminados generen resultados sesgados. Su sistema debe conocer el linaje de sus datos: de dónde procede cada dato de entrada y cómo se procesó.

  2. Procesamiento: El modelo adecuado para la tarea adecuada. Las comprobaciones de cumplimiento normativo estrictas —como los requisitos de residencia— se ejecutan a través de motores de reglas deterministas que proporcionan la misma respuesta en todo momento. La calificación crediticia estructurada utiliza modelos interpretables, como los árboles de decisión con potenciación de gradiente (gradient-boosted decision trees). Los LLM se encargan únicamente de tareas no estructuradas, como el análisis de documentos, y se fundamentan en los expedientes reales del solicitante mediante una técnica denominada generación aumentada por recuperación (RAG, por sus siglas en inglés), en la que se alimenta a la IA con los documentos fuente reales en lugar de dejarla adivinar.

  3. Salida: Cada decisión recibe una explicación. Las herramientas de explicabilidad como SHAP (SHapley Additive exPlanations) —un método basado en la teoría de juegos que asigna una puntuación de contribución específica a cada factor de entrada— generan motivos listos para auditoría para cada acción adversa. Mejor aún, el sistema produce explicaciones contrafactuales: «Si su uso del crédito fuera un 15 % inferior, o sus ingresos fueran 5.000 dólares mayores, este préstamo habría sido aprobado». Ese es el nivel de especificidad que exige ahora la CFPB.

La ventaja del rastro de auditoría es lo que lo conecta todo. Cada anulación manual humana se registra con una justificación obligatoria. La monitorización continua supervisa tanto la deriva del modelo (model drift) —cuando los datos entrantes dejan de coincidir con el conjunto de entrenamiento— como la deriva del sesgo (bias drift), activando alertas en tiempo real cuando su ratio de impacto dispar cae por debajo de los umbrales aceptables. Su equipo de cumplimiento normativo obtiene un registro defendible, no una caja negra. Y cuando los reguladores vengan a preguntar, usted podrá mostrarles exactamente cómo se tomó, verificó y documentó cada decisión.

El Marco de Gestión de Riesgos de IA 2.0 del NIST exige ahora una «Lista de Materiales de IA» (AI Bill of Materials): un inventario completo de sus fuentes de datos, modelos y componentes de terceros. Si hoy no puede presentarla, su institución tiene una brecha de gobernanza que los reguladores están buscando específicamente.

Puntos clave

  • La brecha de 29 puntos de Navy Federal en las tasas de aprobación de hipotecas entre solicitantes blancos y negros fue la más amplia de cualquiera de los 50 principales prestamistas, y los investigadores no pudieron justificarla por ingresos, deuda o valor de la propiedad.
  • Earnest pagó 2,5 millones de dólares por utilizar una variable de tasa de impago por centro educativo que parecía neutral pero funcionaba como un proxy racial en su modelo de concesión de créditos con IA.
  • La CFPB exige ahora motivos específicos y precisos para cada denegación de crédito: «el algoritmo lo decidió» no es una respuesta jurídicamente defendible.
  • Los wrappers genéricos de IA basados en modelos de lenguaje de gran tamaño son probabilísticos por diseño y no pueden proporcionar las decisiones deterministas y explicables que exigen los reguladores financieros.
  • Una arquitectura por capas —reglas deterministas para el cumplimiento normativo, modelos interpretables para la puntuación y LLM fundamentados para los documentos— crea el rastro de auditoría que su institución necesita para defender sus decisiones.

En resumen

Los reguladores ya no preguntan si usted utiliza IA. Preguntan si puede explicar cada decisión que toma su IA, demostrar que es la opción menos discriminatoria disponible y documentar cada anulación manual humana. El coste de no tener respuestas se mide en acuerdos sancionadores, exhibición de pruebas en demandas colectivas y comparecencias en el Congreso. Pregunte a su proveedor de IA: cuando su modelo deniega a un solicitante de préstamo, ¿puede generar una explicación contrafactual específica —exactamente qué tendría que cambiar para la aprobación— y un rastro de auditoría completo que demuestre por qué se utilizó cada variable de entrada?

FAQ

Preguntas Frecuentes

¿Se puede confiar en la IA para las decisiones de concesión de préstamos hipotecarios?

Las herramientas genéricas de IA basadas en modelos de lenguaje de gran tamaño son probabilísticas y carecen de la transparencia que exigen los reguladores. El algoritmo de Navy Federal generó una brecha de aprobación de 29 puntos entre solicitantes blancos y negros que los investigadores no pudieron explicar con factores de ingresos o crediticios. Solo se puede confiar en la IA para la concesión de créditos cuando utiliza arquitecturas por capas con reglas deterministas, modelos de puntuación interpretables y rastros de auditoría completos.

¿Qué ocurre si su modelo de concesión de créditos con IA tiene sesgos?

Earnest Operations pagó un acuerdo de 2,5 millones de dólares después de que Massachusetts determinara que su modelo de IA perjudicaba de manera desproporcionada a prestatarios negros, hispanos y no ciudadanos mediante variables proxy. Navy Federal se enfrenta a demandas colectivas e investigaciones del Congreso. Los tribunales han dictaminado que la disparidad estadística por sí sola puede superar una moción de desestimación, trasladando la carga al prestamista para demostrar que su modelo es necesario y la opción menos discriminatoria.

¿Qué exige la CFPB para el cumplimiento normativo en la concesión de créditos con IA?

La CFPB exige a los acreedores que proporcionen motivos precisos y específicos para las acciones adversas. Los prestamistas no pueden escudarse en categorías amplias como «ingresos insuficientes» si el motivo real de la denegación fue una alerta algorítmica sobre un dato no tradicional. La Oficina ha declarado que «el algoritmo lo decidió» no es una explicación jurídicamente defendible para denegar un crédito.

Construya su IA con confianza.

Colabore con un equipo que cuenta con amplia experiencia en la creación de la próxima generación de IA empresarial. Permítanos ayudarle a diseñar, construir e implementar una estrategia de IA en la que pueda confiar.

Veriprajna consultora de Deep Tech está especializada en la creación de sistemas de IA críticos para la seguridad en los sectores de salud, finanzas y ámbitos regulatorios. Nuestras arquitecturas se validan conforme a protocolos establecidos, con documentación de cumplimiento integral.