
La afirmación era cierta. La maté de todos modos.
El primer correo que me negué a enviar era completamente exacto.
Recuerdo la frase porque la leí unas cuarenta veces: «Vi que recientemente ha ampliado su flota One-Way Truckload a 2,735 camiones». Cada palabra era cierta. Werner Enterprises realmente reportó esa flota, en su propio Formulario 10-K, presentado ante la SEC. Y sentado frente a la demo que estaba construyendo, maté la afirmación de todos modos.
Esa decisión se sintió equivocada durante aproximadamente un día. Luego se sintió como el sentido de todo.

Había empezado este proyecto creyendo, como casi todos los que construyen en ventas con IA en este momento, que el enemigo era la alucinación. El modelo inventa algo, la cosa falsa entra en el correo, el prospecto lo nota, tu credibilidad muere. Atrapa las fabricaciones y ganas. Ese encuadre es limpio, demuestra bien, y ahora creo que es discretamente responsable de muchos dominios de envío quemados. La frase de Werner no tenía ninguna fabricación. Seguía siendo una afirmación que nunca dejaría salir del edificio.
Este es un ensayo sobre lo que me hizo cambiar de opinión, contado como realmente ocurrió, es decir, despacio y con una semana vergonzosa en el medio. Si quieres ver lo que terminé construyendo, vive aquí: veriprajna.com/es/demos/inteligencia-de-ventas-con-ia-y-prospeccion-verificada. Pero el producto es la parte aburrida. Lo interesante es por qué una frase verdadera no es una frase segura, y por qué dejé de confiar en el modelo para distinguir la diferencia.
La semana en que intenté que el modelo corrigiera su propia tarea
Pasé aproximadamente una semana intentando que el modelo de lenguaje atrapara sus propias citas obsoletas, y quiero ser honesto: no funcionó.
El montaje era razonable sobre el papel. Un agente investigador extrae hechos. Un agente escritor redacta el correo, restringido solo a esos hechos. Luego un agente verificador de hechos lee el borrador frente a las fuentes y marca cualquier cosa que no se sostenga. Tres agentes, un pipeline ordenado, el tipo de arquitectura que recibe un asentimiento en una revisión de diseño. De verdad esperaba que el verificador de hechos fuera la parte fácil.
Fue la parte que se rompió. No de forma ruidosa. Ese era el problema. El verificador de hechos leía el borrador de Werner, veía una frase sobre 2,735 camiones, encontraba una fuente que decía 2,735 camiones y la aprobaba con confianza. Lo cual es correcto, si la única pregunta es «¿una fuente respalda este número?». El modelo no tenía un sentido duradero de que la fuente tenía más de dos años y la frase decía «recientemente». Cuando lo empujaba a razonar sobre fechas, a veces atrapaba la obsolescencia y a veces la dejaba pasar, y yo no podía predecir cuál. Un verificador que no puedes predecir no es un verificador. Es una segunda opinión.
El momento en que realmente caló fue tarde una noche cuando pasé el mismo borrador por el verificador de hechos tres veces y obtuve dos aprobaciones y un rechazo, sin ningún cambio en la entrada. Me quedé mirando eso un rato. Estaba pidiendo a un sistema probabilístico que fuera la puerta determinista de otro sistema probabilístico.
Estaba pidiendo a un LLM que fuera el árbitro de confianza de un LLM, y llamando al resultado «verificación».
Eso no es verificación. Eso es que dos modelos estén de acuerdo, que es una cosa distinta y mucho más débil. Si toda la razón por la que necesitas un verificador es que no se puede confiar en la salida del modelo al pie de la letra, entonces la salida de un segundo modelo no puede ser lo que confías para comprobarla. Había construido un laberinto de espejos y le había puesto una etiqueta de cumplimiento.
¿Qué es peor, un hecho inventado o uno verdadero?
Lo que más me sorprendió mientras construía esto fue darme cuenta de que las fabricaciones nunca fueron los fallos aterradores. Las afirmaciones verdaderas pero mal usadas sí lo fueron.
Piensa en lo que realmente ocurre cuando un SDR con IA alucina un detalle de una empresa. A menudo es un disparate, obviamente erróneo, el tipo de cosa que un prospecto lee y elimina. Embarazoso, claro. Pero la afirmación que te mete en problemas de verdad es la que es comprobable y correcta y aun así errónea en contexto. Pasa todos los filtros de «¿está inventado?» precisamente porque no está inventada. La gramática es perfecta. El número es real. Y es una mentira sobre el tiempo presente.
Empecé a llamar a esto mal uso contextual, y una vez que tuve un nombre para ello lo vi en todas partes en la demo que estaba armando. Tiene más de una forma, pero cada versión comparte la propiedad que lo hace peligroso: cada una es una afirmación verdadera.
La forma que más me enseñó es la fuente obsoleta, y Werner es donde la vi con claridad por primera vez. «Recientemente creció a 2,735 camiones» cita un 10-K real, pero esa presentación aterrizó el 2024-02-26, y frente a la fecha de trabajo de la demo tiene bastante más de dos años. El número no ha dejado de ser cierto. La palabra «recientemente» ha dejado de ser cierta. Esos no son el mismo hecho, y una comprobación de coincidencia de fuentes los trata como idénticos.
Construí la misma forma una segunda vez con un lead sintético, una empresa de logística de mercado medio llamada Northwind, para poder mostrar el patrón sin fingir que una firma real dijo algo que no dijo. El borrador afirmaba que Northwind había «ampliado recientemente su presencia en APAC». Hay una fuente de aspecto real para ello. La fuente está fechada en marzo de 2019, lo que en la demo resulta en unos 2,652 días de antigüedad, más de siete años. El solapamiento de fundamentación entre afirmación y fuente es un 100% limpio. La entidad coincide. Y sigue siendo el tipo de frase que hace que un prospecto piense que no lo has mirado desde el último Mundial.

Un hecho verdadero sobre una fuente obsoleta sigue siendo una mentira sobre el presente. La fecha es parte de la afirmación, lo admita o no la frase.
La otra forma es la colisión de mismo nombre, y también la mantuve como caso sintético. «Northwind Logistics acaba de cerrar una Serie B de 40 millones de dólares» tiene una fuente real detrás. La fuente trata de Northwind Inc., una startup de ciberseguridad de Austin, una empresa completamente distinta que casualmente comparte un nombre. Cada palabra es exacta sobre un Northwind. Nada de ello es exacto sobre este.

Fíjate en lo que tienen en común los tres ejemplos. Ninguno de ellos es una alucinación. Si construyeras toda tu historia de seguridad alrededor de atrapar fabricaciones, enviarías los tres. Este es el modo de fallo detrás de los fracasos de SDR con IA que todo el mundo cita y nadie termina de explicar. Las herramientas de una sola pasada sí alucinan una porción medible de afirmaciones específicas del prospecto, en torno al 12 al 18 por ciento según un recuento del sector (AI SDR Industry Report, 2026), pero las fabricaciones son los fallos que al menos puedes imaginar atrapar. Las afirmaciones verdaderas pero obsoletas, verdaderas pero de entidad incorrecta, son las que parecen éxito hasta que te cuestan.
Lo que me hizo dejar de confiar en el modelo y empezar a confiar en una resta de fechas
Lo que finalmente funcionó fue casi insultantemente simple, y me resistí a ello más tiempo del que debí.
Si el problema con la afirmación de Werner es que «recientemente» apunta a una fuente más antigua que una ventana de actualidad sensata, entonces la comprobación no es una tarea de razonamiento. Es aritmética. Toma la fecha de la fuente, toma la fecha de trabajo, resta. Si la afirmación usa lenguaje de actualidad y la brecha es mayor de 365 días, la afirmación está obsoleta y no se envía. La antigüedad de la fuente de 2652 días es mayor que 365 días en una afirmación de actualidad, por tanto falla. No hay prompt, no hay temperatura, no hay «como modelo de lenguaje de IA». Hay un número y un umbral.
Una vez que me permití escribir eso, el resto de las comprobaciones también querían ser código. ¿La afirmación está realmente implicada por un fragmento de fuente, medida como solapamiento de tokens frente a las palabras de contenido, con el propio nombre de la empresa excluido para que una frase no pueda puntuar alto solo por repetir «Werner, Werner, Werner»? Código. ¿La fuente trata de esta entidad y no de otra con el mismo nombre? Código. El modelo de lenguaje sigue siendo el autor, y es un autor genuinamente bueno. Simplemente no es el juez.
Terminé formulando el principio de dos maneras que ahora digo constantemente. Una es «los agentes aconsejan, el código decide.» La otra es «no un LLM juzgando a un LLM.» La red neuronal se ocupa de lo que las redes neuronales hacen bien, que es escribir un borrador fluido y humano. Un verificador determinista en Python puro se ocupa de lo que el código hace bien, que es aplicar la misma regla de la misma manera cada vez. Autoría neuronal, verificación simbólica. La palabra de la industria para ese emparejamiento es neurosimbólico, aunque me importa menos la etiqueta que la propiedad que compra.
Los modelos mejores escriben mejores frases. No convierten en reciente una presentación de hace dos años. Eso no es una brecha de capacidad. Es un error de categoría.
Y la propiedad que compra es la reproducibilidad. Cuando ejecuto el verificador sobre la misma entrada, obtengo el mismo veredicto, cada vez. Eso suena a una pequeña comodidad de ingeniería. En realidad es todo el partido, porque la reproducibilidad es lo que hace que una decisión sea certificable. Puedo entregarte el rastro. Antigüedad de la fuente 2652 días, mayor que 365, afirmación de actualidad presente, veredicto obsoleta, afirmación eliminada. Puedes volver a ejecutarlo y obtener el resultado idéntico. Un juez LLM, aunque sea bueno, no puede prometerte eso. Viví la noche de tres ejecuciones y dos veredictos. No estoy construyendo una historia de cumplimiento encima de eso.

¿No es esto solo un problema de alucinación disfrazado?
Me hacen alguna versión de esto en casi cada conversación, normalmente alguien técnico, y mi respuesta se ha acortado con el tiempo. No. Y la razón de que no lo sea es la razón por la que creo que este trabajo sobrevive a la generación actual de modelos.
El encuadre de la alucinación asume en silencio que la solución es un modelo mejor. Más contexto, entrenamiento más limpio, menor tasa de fabricación, y al final el problema se encoge hasta desaparecer. Tal vez eso sea cierto para la fabricación pura. No hace nada por los fallos que de verdad me importan. Un modelo perfecto, uno que nunca invente un solo hecho, seguirá escribiendo alegremente «recientemente» sobre una presentación de 2024, porque desde dentro del borrador esa frase es verdadera y fluida y exactamente lo que pediste. El modelo no tiene obligación alguna con el calendario. La brecha entre «creció a 2,735 camiones» y «creció recientemente a 2,735 camiones» no es una brecha que cierre la escala.
Aquí es donde el mercado sigue enseñando la lección a las malas. La categoría de SDR con IA optimizó a fondo el volumen y la personalización basada en señales, y en su mayoría se saltó el paso en el que vuelves a verificar la afirmación resultante frente a una fuente actual y correcta en entidad. La economía no ha sido amable. La rotación empresarial de SDR con IA ronda el 50 al 70 por ciento al año (UserGems, 2026). El cuento con moraleja más citado, 11x.ai, recaudó 74 millones de dólares y luego se desmoronó en 2025 con una rotación reportada en el rango del 70 al 80 por ciento (TechCrunch). No publicas esas cifras porque tu modelo alucinara de vez en cuando. Las publicas porque la salida parecía personalizada y no era de fiar, y los compradores al final sienten la diferencia aunque no sepan nombrarla.
Así que la tesis a la que vuelvo una y otra vez es contundente. La personalización no es verificación. Tu SDR con IA no tiene principalmente un problema de alucinación. Tiene un problema de verificación, y un modelo base mejor no lo arreglará, porque la verificación y la procedencia no son capacidades del modelo. Son propiedades del sistema que envuelves alrededor del modelo.
La personalización no es verificación. La verificación y la procedencia no son capacidades del modelo. Son propiedades del sistema que construyes alrededor del modelo.
Qué puede significar realmente el «100%»
Quiero ser cuidadoso aquí, porque este es exactamente el lugar donde un fundador se siente tentado a exagerar, y la empresa que estoy construyendo lleva el nombre del instinto contrario.
Hay dos números en la demo y no son el mismo número. El primero es el Veracity Score, que es simplemente las afirmaciones respaldadas divididas por el total de afirmaciones fácticas en el borrador. Responde «cuánto de lo que escribió la IA resultó ser cierto», y en un borrador real a menudo queda bastante por debajo de 100, que es lo honesto y útil de él. El correo de Werner pierde su afirmación estrella. El correo de Northwind pierde dos. Eso es el sistema funcionando, no fallando.
El segundo número es la integridad de envío, y es del 100% por construcción siempre que algo sobreviva en absoluto, porque la puerta de política elimina toda afirmación no respaldada antes de que se permita enviar el correo. La garantía no es «la IA siempre tuvo razón». La garantía es «el correo que sale contiene solo afirmaciones respaldadas por fuentes». Esas son promesas muy distintas, y he visto a gente confundirlas en una mucho más grande y mucho más falsa.
También hay un benchmark, y esta es la frase que me niego a acortar: en un conjunto dorado fijo y etiquetado a mano de 25 casos, el verificador determinista acierta 25 de 25 veredictos. Eso es el 100% en ese benchmark etiquetado. No es una afirmación sobre el mundo abierto, no es una promesa sobre tu bandeja de entrada, y enfáticamente no es «cero alucinación», una frase que creo que nadie honesto debería decir. El modelo sigue redactando. Los borradores siguen conteniendo afirmaciones no demostradas. El punto es que las no demostradas se atrapan y se eliminan, y la captura es lo bastante determinista para certificar. Cualquiera que te venda una garantía de cero alucinación te está vendiendo lo que yo pasé una semana sin lograr construir.
También diré con claridad, porque el estándar que me impongo lo exige, que los conectores de la demo están simulados. La extracción de EDGAR, la recuperación de noticias, la escritura de vuelta al CRM, el envío real, todo simulado. Lo que es real es el mecanismo: las comprobaciones, la puerta, el rastro de auditoría y los extractos del 10-K de Werner, que son registro público genuino. Te estoy mostrando cómo decide el motor, no un pipeline de producción con tus datos. Si quieres verlo decidir, está aquí una vez más: veriprajna.com/es/demos/inteligencia-de-ventas-con-ia-y-prospeccion-verificada.
La pregunta con la que me quedo
Encontré que lo último que este desarrollo cambió en mí fue más pequeño que la tesis, y es lo que más ha persistido.
Hay un tercer lead en la demo, un broker-dealer sintético regulado por FINRA, y su borrador sale completamente limpio. Cada afirmación respaldada, nada eliminado, un Veracity Score perfecto. Y la puerta de política aún lo enruta a un humano, porque está regulado y es C-suite y un trato grande, y la regla dice que un humano mira esos independientemente de lo limpio que esté el borrador. La primera vez que vi un correo impecable retenido para revisión, mi instinto fue que el sistema había cometido un error. No lo había. Yo solo había asumido, sin darme cuenta, que la corrección y la seguridad eran la misma propiedad.
No lo son. Una afirmación puede ser verdadera e insegura. Un borrador puede estar limpio y aun así necesitar a una persona. Todo el trabajo resultó ser separar esas ideas y construir para ambas, en lugar de colapsarlas en un solo número que da un buen titular.
Así que la pregunta que te dejaría es la que ahora me hago antes de que cualquier cosa escrita por IA salga de mis manos. No «¿es esto cierto?», que normalmente puedo responder y que normalmente no basta. La más difícil: ¿puedo demostrar, ahora mismo, qué fuente actual respalda exactamente esta afirmación, y sobreviviría esa prueba a alguien que quisiera que fallara?
Si la respuesta es no, no importa lo bueno que se vuelva el modelo. La frase no está lista para enviar.


