Modelado causal y contrafáctico

Canalizaciones de inferencia causal que responden preguntas de intervención y contrafácticas a partir de datos observacionales cuando las pruebas A/B son imposibles o insuficientes.

La mayoría del ML empresarial responde a la pregunta «¿qué pasará?», pero en el momento en que alguien pregunta «¿qué sucede si subimos los precios un 10%?» o «¿qué clientes responden realmente a esta promoción frente a quiénes habrían comprado de todos modos?», el modelo predictivo guarda silencio. La inferencia causal responde a una pregunta diferente: ¿cuál es el efecto de realizar X sobre el resultado Y, para qué subgrupos y qué tan seguro se puede estar de que factores no medidos no están impulsando el resultado? Nuestro enfoque construye canalizaciones de estimación causal para producción diseñadas para sobrevivir al contacto con datos observacionales reales, al escrutinio regulatorio y al día en que el científico de datos se marcha.

Por qué su modelo predictivo no puede responder a la pregunta que su negocio se plantea

Su modelo de fijación de precios predice la demanda. Su modelo de churn puntúa el riesgo. Su modelo de marketing mix atribuye los ingresos. Cada uno de ellos fue entrenado con correlaciones en datos históricos, y al cambiar la intervención, esas correlaciones se rompen. Por eso, más del 50% de las estrategias promocionales no aportan una mejora perceptible según la estimación de BCG: optimizar intervenciones con modelos correlacionales significa gastar en clientes que habrían convertido de todos modos y perder a aquellos cuyo comportamiento realmente se podría cambiar.

La inferencia causal resuelve un problema diferente al de la predicción. Responde cuál es el efecto de realizar X sobre el resultado Y, para qué subgrupos y qué tan seguro debe estar de que factores no medidos no están impulsando el resultado. Fundamentamos nuestras canalizaciones en tanto el marco de modelos causales estructurales como en la tradición de resultados potenciales, porque en la práctica se necesitan ambos: los DAG identifican qué se puede estimar, y los marcos de resultados potenciales le indican cómo estimarlo. Omitir cualquiera de los dos lados significa estimar la cantidad equivocada, o la cantidad correcta con el método equivocado.

Dónde falla el descubrimiento causal automatizado y dónde comienza la experiencia de dominio

La propuesta de los proveedores para la IA causal suele comenzar con el descubrimiento automatizado: introduzca datos en NOTEARS o DECI, y el algoritmo generará un grafo causal. La realidad es menos ordenada. La propia investigación de CausaLens demostró que NOTEARS carece de invarianza de escala: si se reescala una variable de metros a centímetros, el grafo descubierto cambia. DECI maneja relaciones no lineales pero tiene dificultades con los datos de tipo mixto y los valores faltantes que son habituales en los conjuntos de datos empresariales. Cada algoritmo de descubrimiento automatizado asume la ausencia de confusores no medidos, y cada conjunto de datos empresarial viola esa suposición.

Iniciamos los proyectos causales con la elucidación de expertos de dominio, no con el descubrimiento automatizado. Nos sentamos con las personas que comprenden el proceso de generación de datos, construimos el grafo causal de forma colaborativa y luego verificamos formalmente la identificabilidad utilizando do-calculus y los criterios de backdoor/frontdoor antes de estimar cualquier elemento. El descubrimiento automatizado tiene su utilidad como generador de hipótesis, revelando aristas candidatas para que los expertos las validen o rechacen; pero el grafo que entra en producción debe ser estructural, no decorativo (consulte nuestra investigación sobre integridad algorítmica). Cuando un grafo es incorrecto, cada estimación posterior hereda ese error, y el análisis de sensibilidad no puede salvarlo de una estructura causal mal especificada.

Estimación de efectos de tratamiento que sobrevive al contacto con datos reales

La brecha entre una estimación de CATE de tutorial y una canalización de efectos de tratamiento de nivel de producción es donde se estanca la mayoría de los proyectos de IA causal. Predominan tres modos de fallo.

Machine learning doble/desesgado que sobreajusta

Las canalizaciones de DML fallan cuando los modelos secundarios (nuisance models) de primera etapa se sobreajustan. El procedimiento de ajuste cruzado (cross-fitting) que evita esto requiere una división cuidadosa de las muestras, y la mayoría de las implementaciones rápidas lo omiten o lo implementan de forma incorrecta, produciendo estimaciones de efectos de tratamiento que son artefactos del sobreajuste en lugar de señales causales. Implementamos DML con validación explícita de cross-fitting, supervisando la calidad de predicción en la primera etapa y alertando cuando el rendimiento del modelo secundario se degrada por debajo del umbral en el que se sostiene la ortogonalización.

Violaciones de positividad que invalidan silenciosamente las estimaciones

Si ciertos segmentos de clientes nunca recibieron el tratamiento en sus datos observacionales, no es posible estimar los efectos del tratamiento para esos segmentos sin extrapolación. La ponderación estándar por probabilidad inversa amplifica el ruido para puntuaciones de propensión cercanas a cero. Diagnosticamos violaciones de positividad antes de la estimación, aplicamos ponderaciones de superposición o recorte donde corresponda, y documentamos claramente qué subpoblaciones cuentan con estimaciones fiables frente a cuáles están extrapoladas.

Análisis de sensibilidad tratado como opcional

Cada estimación causal observacional depende del supuesto de que se han medido todos los confusores, una suposición que nunca es totalmente contrastable. Calculamos E-values y Rosenbaum bounds para cada estimación de efecto de tratamiento, cuantificando con exactitud qué tan fuerte tendría que ser la confusión no medida para anular cada hallazgo (consulte nuestra investigación sobre rendición de cuentas algorítmica). Una decisión comercial basada en una estimación de CATE sin un análisis de sensibilidad es una decisión sin intervalo de confianza.

Razonamiento contrafáctico para fijación de precios, políticas y cumplimiento normativo

Las preguntas contrafácticas llevan la inferencia causal un paso más allá: no solo «¿cuál es el efecto promedio del tratamiento?», sino «¿qué le habría sucedido a esta entidad específica bajo una intervención diferente?». Esto requiere la secuencia de tres pasos de abducción-acción-predicción —procedimiento consistente en inferir las características latentes de la entidad a partir de la evidencia observada, modificar el modelo causal para reflejar la intervención hipotética y calcular el resultado bajo el modelo modificado.

En fijación de precios, los modelos de demanda contrafácticos le permiten estimar cuál habría sido la demanda a un precio que nunca cobró. Un enfoque de pronóstico causal que combina DML con modelos basados en transformers supera al pronóstico tradicional en escenarios fuera de política (off-policy), exactamente el régimen relevante para la optimización de precios, donde se desea saber qué sucede a precios que no se han probado, y no solo predecir la demanda a precios ya aplicados.

En cumplimiento normativo, el razonamiento contrafáctico responde a la pregunta que los reguladores plantean cada vez más: «¿habría recibido esta persona la misma decisión si su atributo protegido fuera diferente?». La Colorado AI Act, en vigor a partir del 30 de junio de 2026, exige a los implementadores de IA de alto riesgo ejercer un cuidado razonable contra la discriminación algorítmica, incluidas pruebas documentadas de impacto dispar en categorías protegidas. La EU AI Act aplica las obligaciones para sistemas de alto riesgo a partir del 2 de agosto de 2026, con sanciones de hasta EUR 35 millones o el 7% de la facturación global. Demostrar que un sistema no discrimina causalmente requiere métodos causales: la disparidad estadística por sí sola no distingue entre factores de riesgo legítimos y variables sustitutas (proxies) de características protegidas.

De cuadernos de investigación a canalizaciones causales de producción

Un análisis causal que vive en un cuaderno Jupyter y muere cuando el científico de datos se marcha no es una capacidad causal. Diseñamos canalizaciones causales para producción (detalladas en nuestro libro blanco técnico sobre la arquitectura empresarial posterior a los wrappers) en torno a cuatro componentes:

  • Registro de grafos causales — almacena el DAG validado con documentación de cada arista, cada arista excluida y la justificación de dominio para cada una.
  • Motor de estimación — implementa el método apropiado para la estructura de cada problema: métodos de puntuación de propensión para tratamientos binarios con fuerte superposición, DML para confusores de alta dimensión, variables instrumentales para endogeneidad, control sintético para estudios de caso comparativos, y meta-learners o bosques causales para efectos de tratamiento heterogéneos a escala.
  • Capa de refutación — ejecuta pruebas de falsación automatizadas (tratamientos placebo, causas comunes aleatorias, estabilidad de subconjuntos de datos) en cada estimación antes de que llegue a un responsable de toma de decisiones.
  • Capa de monitorización — rastrea la validez de los supuestos a lo largo del tiempo: las distribuciones de covariables cambian, las condiciones de positividad se erosionan y los mecanismos de asignación de tratamiento se modifican. Una estimación causal que era válida hace seis meses puede no ser válida hoy.

Bosques causales frente a meta-learners a escala empresarial

Específicamente para la estimación de efectos de tratamiento heterogéneos, la elección entre bosques causales y meta-learners es crucial para el despliegue en producción. Una reciente evaluación comparativa a gran escala sobre 13,98 millones de registros de clientes demostró que S-Learner con LightGBM logró el mayor rendimiento de uplift, donde el 20% superior de los clientes clasificados por CATE predicho capturó el 77,7% de todas las conversiones incrementales. Los bosques causales enfrentan restricciones computacionales que requieren submuestreo a escala empresarial. Evaluamos ambos enfoques según los datos y requisitos de escala de cada cliente en lugar de recurrir por defecto al método que el equipo haya usado antes.

Dónde termina la IA causal de plataforma y dónde comienza la ingeniería a medida

CausaLens ofrece una plataforma de inteligencia de decisiones con capacidades de descubrimiento causal, estimación de efectos y optimización. Databricks proporciona un acelerador de IA causal para la optimización de incentivos. Dataiku integra algoritmos de predicción causal. Estas plataformas gestionan la capa de herramientas: acceso a algoritmos, visualización y gestión del flujo de trabajo.

Lo que no proporcionan es la metodología. No se sientan con sus expertos de dominio para elucidar el grafo causal que refleja su proceso de negocio real. No diagnostican si sus datos satisfacen los supuestos requeridos para el estimador que la plataforma seleccionó. No le advierten que su canalización de DML produce resultados erróneos porque sus instrumentos son débiles, o que sus estimaciones de CATE para un segmento clave de clientes no son fiables debido a que se viola la positividad para ese subgrupo. No construyen el análisis de sensibilidad que demuestra a un regulador la solidez de sus afirmaciones causales frente a la confusión no medida.

El 10–15% de las empresas que han implementado con éxito la IA causal en producción ha dependido por lo general de equipos altamente especializados, a menudo con experiencia a nivel de doctorado en inferencia causal. Nuestros servicios están estructurados para ofrecer esa metodología —elucidación de grafos, implementación, validación y despliegue en producción— diseñada para integrarse con cualquier plataforma de datos que el cliente ya utilice.

Conclusiones clave

  • Los modelos predictivos fallan en el momento en que se interviene; la inferencia causal estima el efecto de realizar X sobre Y, para qué subgrupos y qué tan robusto es ese efecto frente a la confusión no medida.
  • Construimos el grafo causal con expertos de dominio y verificamos la identificabilidad mediante do-calculus y los criterios de backdoor/frontdoor; el descubrimiento automatizado (NOTEARS, DECI) actúa únicamente como generador de hipótesis.
  • La credibilidad en producción descansa en el cross-fitting explícito de DML, diagnósticos de positividad con ponderaciones de superposición o recorte, y E-values más Rosenbaum bounds en cada estimación.
  • El razonamiento contrafáctico impulsa la fijación de precios fuera de política (off-policy) y satisface la prueba causal de no discriminación exigida por la Colorado AI Act (30 de junio de 2026) y la EU AI Act (2 de agosto de 2026).
  • Las plataformas ofrecen herramientas; nosotros proporcionamos la metodología estructural, la validación y la canalización de producción en las que realmente se apoya el 10–15% de las empresas que triunfan con la IA causal.
FAQ

Preguntas Frecuentes

¿Cuánto cuesta un proyecto de inferencia causal en comparación con realizar más pruebas A/B?

La comparación de costos depende de lo que se intente aprender y de si la experimentación es siquiera viable. Las pruebas A/B son el estándar de oro cuando es posible aleatorizar, pero muchas decisiones empresariales no pueden someterse a prueba: no se pueden asignar precios aleatoriamente a segmentos de clientes durante meses, abrir o cerrar tiendas al azar, ni denegar préstamos de forma aleatoria para medir el impacto dispar. En esos casos, la comparación no es la inferencia causal frente a las pruebas A/B, sino la inferencia causal frente a las suposiciones. Para decisiones donde sí se pueden realizar experimentos, la inferencia causal a partir de datos observacionales suele complementar las pruebas A/B midiendo efectos a largo plazo, estimando efectos de tratamiento heterogéneos entre subgrupos y cerrando la brecha cuando los tamaños de muestra del experimento son demasiado pequeños para un análisis de subgrupos fiable. El alcance de los proyectos suele abarcar desde un análisis causal enfocado en un único tratamiento (elucidación del grafo, estimación, análisis de sensibilidad y documentación) hasta una canalización causal de producción con monitorización automatizada. El argumento del ROI resulta más evidente cuando el costo de la intervención es elevado: si gasta millones en promociones, modificaciones de precios o cambios de políticas, conocer qué subgrupos responden realmente frente a quiénes habrían actuado de todos modos amortiza el proyecto con rapidez.

Probamos NOTEARS para el descubrimiento causal automatizado y el grafo cambia cada vez que reescalamos variables. ¿Está dañado?

Se trata de una limitación conocida, no de un error de software. CausaLens publicó investigaciones que demuestran que NOTEARS carece de invarianza de escala: cambiar las unidades de una variable (de metros a centímetros, de dólares a miles) altera el grafo descubierto. El algoritmo utiliza una penalización L1 en los pesos de las aristas, y el reescalado modifica dichos pesos, lo que altera qué aristas sobreviven a la penalización. DECI y otros métodos de descubrimiento causal neuronal resuelven parcialmente esto, pero introducen sus propios problemas con datos de tipo mixto y valores faltantes. El problema de fondo es que el descubrimiento causal totalmente automatizado únicamente a partir de datos observacionales sigue siendo un problema de investigación abierto. Estos algoritmos asumen que no existen confusores no medidos, algo que ningún conjunto de datos empresarial puede garantizar. Utilizamos el descubrimiento automatizado como un generador de hipótesis: se ejecuta, se identifican las aristas candidatas y luego los expertos de dominio validan o rechazan cada una. El grafo de producción se construye de manera colaborativa con las personas que comprenden el proceso de generación de datos, realizando comprobaciones formales de identificabilidad antes de iniciar cualquier estimación.

Nuestra canalización de DML arroja estimaciones de CATE muy dispares según cómo dividimos los datos. ¿Cómo solucionamos esto?

Casi siempre se trata de un problema de implementación de cross-fitting. El machine learning doble/desesgado requiere que los modelos secundarios (nuisance models: propensión al tratamiento y regresión de resultados) se ajusten en particiones de datos (folds) diferentes a las utilizadas para la estimación causal final. Si el cross-fitting no se implementa correctamente, o si el número de particiones es demasiado bajo, los modelos secundarios se sobreajustan a la muestra de estimación, y las estimaciones de CATE resultantes quedan determinadas por ese sobreajuste en lugar de por una verdadera heterogeneidad del efecto del tratamiento. Diagnosticamos esto comprobando la calidad de la predicción en la primera etapa en todas las particiones, evaluando la estabilidad de la estimación bajo diferentes recuentos de particiones y semillas aleatorias, y verificando que la condición de ortogonalidad de Neyman se cumpla en la práctica. Si los modelos de primera etapa son predictores deficientes del tratamiento o del resultado, la ortogonalización que hace funcionar a DML se quiebra. En tal caso, la solución no consiste en añadir más particiones, sino en mejorar los modelos secundarios, o bien en recurrir a un método que no dependa de una fuerte predicción en la primera etapa, como las variables instrumentales o un diseño experimental directo.

¿Puede la IA causal ayudarnos a demostrar que nuestro modelo de concesión de préstamos no discrimina, para cumplir con la Colorado AI Act?

Los métodos causales son el enfoque adecuado en este caso porque la pregunta regulatoria es inherentemente causal: ¿el atributo protegido causa el resultado adverso, o la disparidad estadística se explica por factores de riesgo legítimos? La Colorado AI Act, vigente a partir del 30 de junio de 2026, exige a los implementadores de IA de alto riesgo ejercer un cuidado razonable contra la discriminación algorítmica, incluidas pruebas documentadas de impacto dispar en categorías protegidas. El análisis de disparidad estadística (que compara las tasas de aprobación entre grupos) indica si existe una brecha. El análisis causal indica por qué existe: si la brecha es impulsada por el atributo protegido en sí, por variables sustitutas correlacionadas con él o por factores de suscripción legítimos que casualmente se distribuyen de manera dispar entre los grupos. Construimos esto como un análisis de mediación causal: elaboramos el DAG de cómo los atributos del solicitante fluyen a través del modelo hacia la decisión, identificamos las rutas causales directas e indirectas desde los atributos protegidos hasta los resultados, y cuantificamos qué proporción de la disparidad observada transcurre a través de cada ruta. El resultado es un documento que asigna cada afirmación causal a sus supuestos de identificación, satisfaciendo los requisitos de documentación de la ley.

¿Cuál es la diferencia entre los bosques causales y los meta-learners, y cuál funciona mejor a escala empresarial?

Ambos estiman los efectos de tratamiento promedio condicionales (CATE), que indican quién se beneficia más de un tratamiento. Los bosques causales (Athey e Imbens) dividen los datos para maximizar directamente la heterogeneidad del efecto del tratamiento. Los meta-learners (S-Learner, T-Learner, X-Learner) readaptan modelos de ML estándar para la estimación causal entrenando modelos de resultados y calculando los efectos del tratamiento como diferencias en las predicciones. A escala empresarial, los meta-learners se imponen actualmente por practicidad. Una evaluación comparativa reciente a gran escala sobre 13,98 millones de registros de clientes demostró que S-Learner con LightGBM logró el mayor uplift, capturando el 20% superior de los clientes el 77,7% de todas las conversiones incrementales. Los bosques causales requieren submuestreo a esa escala debido a limitaciones computacionales. Los meta-learners también se integran de forma más natural en las canalizaciones de ML existentes, ya que utilizan modelos supervisados estándar como base. Evaluamos ambos enfoques con los datos de cada cliente, dado que el método óptimo depende de la estructura del efecto del tratamiento: los bosques causales pueden descubrir heterogeneidad del efecto en dimensiones inesperadas, mientras que los meta-learners aprovechan la potencia predictiva del gradient boosting para entornos donde el patrón del efecto del tratamiento es más suave.

¿Cómo gestionamos las violaciones de positividad cuando ciertos segmentos de clientes nunca recibieron el tratamiento?

Las violaciones de positividad significan que, para ciertas combinaciones de covariables, cada unidad observada recibió o no recibió el tratamiento. La ponderación de probabilidad inversa estándar amplifica el ruido de forma catastrófica para puntuaciones de propensión cercanas a cero, produciendo estimaciones de efectos de tratamiento dominadas por un puñado de ponderaciones extremas. Diagnosticamos la positividad antes de la estimación examinando la distribución de las puntuaciones de propensión e identificando regiones con superposición mínima entre los grupos de tratamiento y control. La solución depende del tipo de violación. Para violaciones prácticas (ciertos segmentos rara vez reciben el tratamiento pero este es viable), las ponderaciones de superposición o el recorte restringen la estimación a la región donde ambos grupos de tratamiento tienen una representación adecuada, y documentamos con claridad qué subpoblaciones tienen estimaciones fiables frente a cuáles están extrapoladas. Para violaciones estructurales (ciertos segmentos nunca pueden recibir el tratamiento), la propia pregunta causal carece de una definición adecuada para esos grupos, y la respuesta honesta es excluirlos del estimando en lugar de pretender estimar algo que los datos no pueden respaldar.

¿Podemos usar métodos de control sintético para medir el impacto de la apertura de una nueva tienda sin un grupo de control?

Este es uno de los casos de uso más sólidos para el control sintético. Se dispone de una unidad tratada (el mercado donde abrió la nueva tienda) y ningún grupo de control aleatorizado. El método de control sintético construye una combinación ponderada de mercados no tratados que coincide con la trayectoria previa a la intervención del mercado tratado en variables de resultado clave. El efecto del tratamiento es la divergencia entre el rendimiento real del mercado tratado tras la apertura y el rendimiento previsto por el control sintético. El método funciona bien cuando se cuenta con suficientes mercados donantes con características similares y un período previo a la intervención lo bastante amplio para validar la correspondencia. Falla cuando ninguna combinación de mercados de control puede reproducir la tendencia previa del mercado tratado, o cuando otras intervenciones (aperturas de competidores, perturbaciones macroeconómicas) afectan al mercado tratado simultáneamente. Implementamos el control sintético con pruebas de placebo (aplicando el método a mercados no tratados para verificar que no detecte efectos espurios) y diagnósticos de ajuste de tendencias previas que cuantifican la calidad del emparejamiento antes de analizar los resultados posteriores a la intervención.

¿Vale la pena el costo de la plataforma CausaLens, o deberíamos desarrollarlo sobre el código abierto de PyWhy?

CausaLens proporciona una plataforma de inteligencia de decisiones no-code con capacidades de descubrimiento causal, estimación y optimización, respaldada por más de M en financiación y experiencia en despliegues empresariales. El ecosistema PyWhy (DoWhy, EconML) es de código abierto, respaldado por Microsoft Research, con aproximadamente 24.000 estrellas en GitHub en todo el ecosistema y una amplia adopción en la comunidad. La decisión entre plataforma o código abierto depende de la experiencia en inferencia causal de su equipo y de su tolerancia a la opacidad metodológica. Si cuenta con los conocimientos estadísticos para validar supuestos, diagnosticar fallos e interpretar análisis de sensibilidad, PyWhy le brinda control absoluto sin costo de licencias. Si busca una interfaz gestionada y confía en las decisiones metodológicas de la plataforma, CausaLens reduce el esfuerzo de ingeniería. El riesgo de cualquier plataforma radica en que abstrae la metodología, y la inferencia causal es precisamente el ámbito donde las elecciones metodológicas (estructura del grafo, selección del estimador, análisis de sensibilidad) son estructurales. Trabajamos con ambos: desarrollando sobre PyWhy cuando el cliente cuenta con capacidad de ingeniería, e integrando con CausaLens cuando el cliente ya ha invertido en la plataforma. La capa metodológica es idéntica independientemente de las herramientas.

¿Cuál es el riesgo de desplegar estimaciones de efectos de tratamiento a partir de datos observacionales sin un análisis de sensibilidad?

El riesgo radica en tomar una decisión de negocio con total confianza basada en una estimación que podría explicarse en su totalidad por un factor de confusión no medido. Cada estimación causal observacional asume que se han medido todos los confusores relevantes. Esa suposición es imposible de contrastar. El análisis de sensibilidad cuantifica qué tan equivocado se podría estar: los E-values indican la fuerza mínima de confusión (riesgo relativo) que una variable no medida necesitaría tener tanto con el tratamiento como con el resultado para anular la estimación. Los Rosenbaum bounds proporcionan la cantidad máxima de sesgo oculto compatible con que su intervalo de confianza aún excluya el cero. Sin estos, una estimación de CATE de un +15% de conversión incremental podría ser real, o bien un artefacto derivado de una única variable no medida. Incluimos el análisis de sensibilidad en cada entregable causal, no como un apéndice sino como la métrica primordial de credibilidad. En presentaciones regulatorias, esto no es optativo: documentar la solidez de las afirmaciones causales frente a la confusión no medida es un requisito fundamental para demostrar cuidado razonable bajo marcos como la Colorado AI Act.

Construya su IA con confianza.

Colabore con un equipo que cuenta con amplia experiencia en la creación de la próxima generación de IA empresarial. Permítanos ayudarle a diseñar, construir e implementar una estrategia de IA en la que pueda confiar.

Veriprajna consultora de Deep Tech está especializada en la creación de sistemas de IA críticos para la seguridad en los sectores de salud, finanzas y ámbitos regulatorios. Nuestras arquitecturas se validan conforme a protocolos establecidos, con documentación de cumplimiento integral.