La capa de verificación y gobernanza para la prospección con IA
Los SDR con IA optimizan por volumen, y los modelos de una sola pasada envían intactas las afirmaciones de fuente obsoleta, de entidad equivocada y excesivas. El Veracity Engine deja que un LLM redacte y, a continuación, comprobaciones en Python puro eliminan toda afirmación no demostrada, puntúan lo que queda y lo encaminan por una puerta de políticas calibrada al riesgo. Los agentes asesoran; el código decide.
100%
Integridad del envío cuando una afirmación sobrevive
Cada afirmación del correo enviado está respaldada por fuentes
25/25
Exactitud del veredicto en el conjunto dorado etiquetado
Determinista y reproducible (benchmark de 25 casos)
3
Comprobaciones deterministas antes de enviar
Fundamentación, coincidencia de entidad, validez temporal
Esta es una demostración ejecutable. La recuperación, el CRM y el envío de correo están simulados, y los leads son sintéticos salvo Werner Enterprises, cuyos extractos del 10-K son registro público real.
El modo de fallo detrás de los fracasos estrepitosos y muy publicitados de los SDR con IA.
Los SDR con IA están construidos para enviar más. Los LLM de una sola pasada alucinan una fracción medible de las afirmaciones específicas del prospecto, y las herramientas de personalización nunca vuelven a verificar la afirmación resultante contra una fuente actual y correcta en la entidad. Así, las afirmaciones de fuente obsoleta, de entidad equivocada y excesivas se envían intactas, y la verificación se añade después del envío o no ocurre nunca.
El contexto del sector es contundente. Los LLM de una sola pasada alucinan entre el 12 y el 18% de las afirmaciones específicas del prospecto (AI SDR Industry Report, 2026). La rotación empresarial de SDR con IA oscila entre el 50 y el 70% anual (UserGems, 2026). 11x.ai recaudó $74M y colapsó en 2025 con una rotación del 70 al 80% (TechCrunch). Solo el 7% de las empresas cuenta con gobernanza específica para sistemas agénticos (Deloitte, 2026), y Gartner proyecta que más del 40% de los proyectos de IA agéntica serán abandonados para 2027. Desde noviembre de 2025, una tasa de spam superior al 0.3% dispara el rechazo a nivel SMTP de Gmail y una recuperación del dominio de 6 a 12 semanas.
El verdadero fallo no es la mala gramática. La gramática es perfecta, lo que lo empeora. El peligro es una afirmación citada correctamente pero usada de forma engañosa: un hecho verdadero extraído de una fuente obsoleta, un hecho verdadero sobre la empresa homónima equivocada, o una afirmación de un proveedor que la fuente contradice. A eso lo llamamos uso indebido contextual, y unos modelos base mejores no lo eliminan. Un modelo perfecto sigue sin poder demostrar a FINRA o al RGPD qué fuente actual respaldó qué afirmación.
Un LLM redacta. El código determinista decide qué se envía. Esto es neurosimbólico: autoría neuronal, verificación simbólica.
El pipeline ejecuta Lead, luego Research (una hoja de hechos en la que cada hecho está ligado a una fuente fechada), luego Draft (un LLM Redactor restringido únicamente a la hoja de hechos), luego Verify (comprobaciones deterministas), luego una puerta de políticas, luego un recibo de auditoría firmado, luego una escritura simulada de vuelta al CRM. El paso de verificación no es un LLM juzgando a otro LLM. Es Python puro, de modo que la misma entrada produce el mismo veredicto en cada ejecución.
Cada afirmación fáctica se pone a prueba contra su fuente citada. La primera comprobación que falla gana, en orden de prioridad: unsourced, luego contradicted, luego entity mismatch, luego stale.
¿La afirmación está implicada por un fragmento de fuente? El solapamiento de tokens debe ser al menos 0.5 de los tokens de contenido, y los tokens del nombre de la empresa se excluyen para que una afirmación no pueda puntuar alto solo por repetir el nombre de la empresa.
¿La fuente trata de este prospecto exacto, no de otra empresa homónima? Una fuente sobre una firma distinta con el mismo nombre falla, incluso cuando las palabras coinciden.
Si la afirmación usa lenguaje de actualidad ("recently", "just", "now", "this week"), la fuente debe estar dentro de 365 días. Las fuentes más antiguas se marcan como stale, aunque el hecho sea verdadero.
Junto a ellas corren dos salvaguardas más: una comprobación de contradicción del proveedor, y un umbral de fidelidad de la oración de 0.3 que impide que un LLM en vivo monte un id de hecho válido sobre una oración alucinada. El vocabulario de veredictos determina los colores de la interfaz: supported (verde) pasa; stale (ámbar), entity_mismatch (rojo), contradicted (rojo) y unsourced (rojo) no.
La puerta elimina toda afirmación no respaldada y, a continuación, informa dos cifras. El Veracity Score es las afirmaciones respaldadas divididas por el total de afirmaciones fácticas del borrador, es decir, cuánto de lo que escribió la IA era realmente verdadero. La integridad del envío es 100% siempre que sobreviva al menos una afirmación, porque el correo enviado contiene entonces solo afirmaciones respaldadas por fuentes. Esa es la garantía de diseño.
El enrutamiento sigue el riesgo. El correo se revisa si no sobrevive nada seguro o si la cobertura del borrador cae por debajo de 0.5. Se envía a revisión humana si es de alto valor (regulado, o alta dirección, o una operación de al menos $100,000) incluso con un borrador 100% limpio. En caso contrario es elegible para envío automático. El modo de comparación, SDR con IA estándar, investiga, redacta y envía con 0 afirmaciones verificadas antes del envío; la aplicación lo muestra como una comprobación en sombra a posteriori de lo que ya salió.
Tres leads del corpus de la demostración (fecha de anclaje 2026-06-17). Cada imagen de abajo es una captura de la aplicación en ejecución.
En el lead de Northwind Logistics (un 3PL sintético de mercado medio), el borrador afirma que la empresa "recently expanded into APAC". La fuente es una noticia real de Northwind sobre APAC, el solapamiento de fundamentación es 100% y la entidad es correcta. Pero la fuente está fechada 2019-03-14, tiene 2,652 días de antigüedad (unos 7.3 años) frente a una ventana de actualidad de 365 días, así que la validez temporal falla y la afirmación se elimina. El Veracity Engine conserva las afirmaciones respaldadas (encabezadas por un impulso para contratar seis administradores de Salesforce, evidenciado por una oferta de empleo fechada 2026-06-09), atrapa las dos afirmaciones malas y envía un correo 100% respaldado por fuentes.
Werner Enterprises, Inc. es una empresa pública real, y las fuentes W1 y W2 son extractos verbatim de su Formulario 10-K del FY2023 (SEC EDGAR, CIK 0000793074, presentado 2024-02-26). La afirmación del borrador "recently growing your One-Way Truckload fleet to 2,735 trucks" es fácticamente real, pero la presentación tiene más de dos años, así que un encuadre de "recently" se atrapa como stale. Esta es exactamente la brecha de uso indebido temporal que las herramientas de personalización sobre presentaciones ante la SEC dejan abierta. (El contacto y la oferta de empleo de este lead son sintéticos; solo Werner y sus extractos del 10-K son reales.)
De vuelta al lead de Northwind, el borrador también afirma una "$40M Series B". La fuente citada es real, pero trata de "Northwind Inc.", una startup de ciberseguridad de Austin, no de "Northwind Logistics". La comprobación de coincidencia de entidad falla y la afirmación se elimina antes de poder enviarse.
Atlas Capital Markets es un broker-dealer sintético regulado por FINRA, con un contacto de Chief Revenue Officer y una operación de $220,000. Incluso un borrador 100% limpio y plenamente respaldado por fuentes se fuerza a revisión humana por la puerta de políticas, porque está regulado, es alta dirección y supera el umbral de $100,000. Un borrador limpio no es lo mismo que uno enviable.
Cada correo produce un recibo de auditoría JSON descargable: el proveedor y la versión del modelo, el prospecto y el nivel de riesgo, la hoja de hechos, el veredicto de cada afirmación con su tramo de fuente y fechas, el Veracity Score, la regla de política que se disparó y el aprobador humano. En un conjunto dorado etiquetado de 25 casos, el verificador determinista puntúa 25/25 de exactitud del veredicto: 10 de 10 afirmaciones difíciles o incorrectas atrapadas, 15 de 15 afirmaciones limpias conservadas. Esa reproducibilidad es lo que lo hace certificable, y un juez LLM no. Atribuimos el 25/25 a este benchmark etiquetado, nunca como una garantía de mundo abierto.
El mismo conmutador contra el que compara la demostración, lado a lado.
| Dimensión | SDR con IA estándar | Veracity Engine |
|---|---|---|
| Afirmaciones verificadas antes de enviar | 0 | Toda afirmación fáctica, de forma determinista |
| Quién decide qué se envía | El LLM envía lo que redactó | Comprobaciones en Python puro, no un LLM |
| Captura de fuente obsoleta | Ninguna | Validez temporal, ventana de 365 días |
| Entidad homónima equivocada | Ninguna | Comprobación de coincidencia de entidad |
| Rastro de auditoría | Ninguno | Recibo JSON firmado por correo |
| Tratamiento de alto riesgo | Envía de todos modos | Encaminado a revisión humana |
No. No añadimos otro SDR con IA al mercado. El Veracity Engine es una capa de verificación y gobernanza que se sitúa después del borrador: un verificador determinista en Python puro comprueba cada afirmación que escribió una IA contra una fuente fechada y coincidente en la entidad, elimina todo lo no demostrado y escribe un recibo de auditoría firmado antes de que el correo pueda enviarse. Los SDR con IA optimizan por volumen; nosotros decidimos qué es seguro enviar.
Cada afirmación fáctica del borrador pasa por tres comprobaciones deterministas: fundamentación (¿la afirmación está implicada por un fragmento de fuente, con un solapamiento de tokens de al menos 0.5?), coincidencia de entidad (¿la fuente trata de este prospecto exacto, no de una empresa homónima?) y validez temporal (si la afirmación usa lenguaje de actualidad, la fuente debe estar dentro de 365 días). Solo las afirmaciones que pasan se marcan como supported y se conservan; todo lo demás se elimina. El verificador es código, no un LLM juzgando a otro LLM, así que la misma entrada produce siempre el mismo veredicto.
Ese es exactamente el modo de fallo para el que lo construimos, que la demostración llama uso indebido contextual. En un lead trabajado, la oración "recently expanded into APAC" está fundamentada y trata de la empresa correcta, pero la única fuente está fechada en 2019, así que tiene 2,652 días de antigüedad frente a una ventana de actualidad de 365 días y se atrapa como stale y se elimina. Mostramos el mismo patrón en una afirmación real de Werner Enterprises respaldada por su 10-K de la SEC del FY2023: fácticamente exacta, pero la presentación tiene más de dos años, así que un encuadre de "recently" falla la validez temporal.
Ahí es donde más importa una capa de verificación y gobernanza, porque una afirmación alucinada o mal atribuida conlleva consecuencia regulatoria. En la demostración, la puerta de políticas encamina a revisión humana cualquier correo que esté regulado, se envíe a un contacto de alta dirección o esté ligado a una operación de al menos $100,000, incluso cuando el borrador está plenamente respaldado por fuentes. La gobernanza aquí es una función del riesgo, no solo de la exactitud.
Cada correo produce un recibo de auditoría JSON descargable que registra el proveedor y la versión del modelo, el prospecto y el nivel de riesgo, la hoja de hechos, el veredicto de cada afirmación con su tramo de fuente y fechas, el Veracity Score, la regla de política exacta que se disparó y el aprobador humano. Cualquier afirmación se rastrea hasta su fuente en segundos. Un modelo perfecto sigue sin poder demostrar a un auditor qué fuente actual respaldó qué afirmación; un recibo sí.
No, y ese es el punto duradero. Los modelos base mejores siguen redactando, y quien afirme una tasa de alucinación nula no está siendo honesto, así que la necesidad de demostrar procedencia, mantener un rastro de auditoría y gobernar según el riesgo no desaparece. La procedencia, los recibos de auditoría y una puerta de políticas son propiedades duraderas; un redactor más fuerte no elimina el requisito de verificar y gobernar lo que escribe.
Es una demostración ejecutable que prueba el mecanismo, no un pipeline desplegado. Las fuentes de recuperación (EDGAR, LinkedIn, Greenhouse, noticias), la lectura y escritura del CRM y el envío de correo están simulados, y la hoja de hechos está preconstruida; los leads son sintéticos salvo Werner Enterprises, cuyos extractos del 10-K son registro público real. El verificador determinista, la puerta de políticas y el recibo de auditoría son reales y se ejecutan exactamente como se muestra.
La investigación detrás de esta demostración — la arquitectura, el diseño de verificación y el plano empresarial.
La capa de verificación y gobernanza es la parte difícil. Nosotros la construimos.
Si su equipo está lidiando con cómo poner la prospección con IA delante de compradores regulados sin arriesgar una afirmación alucinada, nos gustaría de verdad oír cómo lo están pensando. El problema es de todo el sector y las respuestas también lo serán.