La couche de vérification et de gouvernance pour la prospection par IA

Un vérificateur déterministe décide ce que votre prospection par IA a le droit d'envoyer.

Les SDR par IA optimisent le volume, et les modèles à passe unique expédient intactes des affirmations fondées sur une source périmée, une entité erronée ou une surinterprétation. Le Veracity Engine laisse un LLM rédiger, puis des contrôles en Python pur retirent chaque affirmation non prouvée, notent ce qui reste et l'acheminent vers une barrière de politique calibrée au risque. Les agents conseillent, le code décide.

100%

Intégrité à l'envoi lorsqu'une affirmation survit

Chaque affirmation de l'e-mail envoyé est étayée par une source

25/25

Exactitude des verdicts sur le jeu d'or étiqueté

Déterministe et reproductible (référence de 25 cas)

3

Contrôles déterministes avant l'envoi

Ancrage, correspondance d'entité, validité temporelle

Il s'agit d'une démonstration exécutable. La récupération, le CRM et l'envoi d'e-mails sont simulés, et les leads sont synthétiques, à l'exception de Werner Enterprises, dont les extraits du 10-K sont des documents publics réels.

Le volume sans vérification détruit plus de pipeline qu'il n'en crée

Le mode d'échec derrière les effondrements très médiatisés des SDR par IA.

Les SDR par IA sont conçus pour envoyer davantage. Les LLM à passe unique hallucinent une part mesurable des affirmations spécifiques aux prospects, et les outils de personnalisation ne revérifient jamais l'affirmation résultante par rapport à une source actuelle et correcte quant à l'entité. Ainsi, des affirmations fondées sur une source périmée, une entité erronée ou une surinterprétation partent intactes, et la vérification est ajoutée après l'envoi, ou n'a jamais lieu.

Le contexte sectoriel est sans appel. Les LLM à passe unique hallucinent 12 à 18 % des affirmations spécifiques aux prospects (AI SDR Industry Report, 2026). Le taux de désabonnement annuel des SDR par IA en entreprise atteint 50 à 70 % (UserGems, 2026). 11x.ai a levé $74M et s'est effondrée en 2025 avec un désabonnement de 70 à 80 % (TechCrunch). Seules 7 % des entreprises disposent d'une gouvernance spécifique aux systèmes agentiques (Deloitte, 2026), et Gartner prévoit que plus de 40 % des projets d'IA agentique seront abandonnés d'ici 2027. Depuis novembre 2025, un taux de spam supérieur à 0.3 % déclenche un rejet au niveau SMTP de Gmail et une récupération du domaine de 6 à 12 semaines.

Le véritable bogue n'est pas une mauvaise grammaire. La grammaire est parfaite, ce qui aggrave le problème. Le danger est une affirmation correctement citée mais utilisée de façon trompeuse : un fait vrai tiré d'une source périmée, un fait vrai concernant une autre société du même nom, ou une affirmation de fournisseur que la source contredit. Nous appelons cela un usage contextuel abusif, et de meilleurs modèles de base ne le suppriment pas. Un modèle parfait ne peut toujours pas prouver à la FINRA ou au RGPD quelle source actuelle a étayé quelle affirmation.

Comment fonctionne le Veracity Engine

Un LLM rédige. Du code déterministe décide ce qui part. C'est neuro-symbolique : rédaction neurale, vérification symbolique.

Le pipeline enchaîne Lead, puis Research (une fiche de faits où chaque fait est lié à une source datée), puis Draft (un LLM rédacteur contraint à la seule fiche de faits), puis Verify (contrôles déterministes), puis une barrière de politique, puis un reçu d'audit signé, puis une réécriture CRM simulée. L'étape de vérification n'est pas un LLM qui juge un LLM. C'est du Python pur, de sorte que la même entrée produit le même verdict à chaque exécution.

Les trois contrôles déterministes

Chaque affirmation factuelle est testée par rapport à sa source citée. Le premier contrôle en échec l'emporte, par ordre de priorité : unsourced, puis contradicted, puis entity mismatch, puis stale.

1. Ancrage

L'affirmation est-elle impliquée par un extrait de source ? Le recouvrement de jetons doit être d'au moins 0.5 des jetons de contenu, et les jetons de nom d'entreprise sont exclus afin qu'une affirmation ne puisse pas obtenir un score élevé simplement en répétant le nom de l'entreprise.

2. Correspondance d'entité

La source concerne-t-elle exactement ce prospect, et non une autre société du même nom ? Une source concernant une autre entreprise du même nom échoue, même lorsque les mots correspondent.

3. Validité temporelle

Si l'affirmation utilise un langage de récence (« récemment », « vient de », « maintenant », « cette semaine »), la source doit dater de moins de 365 jours. Les sources plus anciennes sont marquées stale, même lorsque le fait est vrai.

Deux gardes supplémentaires s'exécutent en parallèle : un contrôle de contradiction fournisseur, et un plancher de fidélité de phrase de 0.3 qui empêche un LLM en direct de réutiliser un identifiant de fait valide sur une phrase hallucinée. Le vocabulaire des verdicts pilote les couleurs de l'interface : supported (vert) passe ; stale (ambre), entity_mismatch (rouge), contradicted (rouge) et unsourced (rouge) ne passent pas.

La barrière de politique

La barrière retire chaque affirmation non supported, puis rapporte deux chiffres. Le score de véracité est le nombre d'affirmations supported divisé par le total des affirmations factuelles du brouillon, c'est-à-dire la part de ce que l'IA a écrit qui était réellement vraie. L'intégrité à l'envoi est de 100 % dès qu'au moins une affirmation survit, car l'e-mail envoyé ne contient alors que des affirmations étayées par une source. C'est la garantie de conception.

Le routage suit le risque. L'e-mail est réécrit si rien de sûr ne survit ou si la couverture du brouillon tombe sous 0.5. Il est envoyé en revue humaine s'il est à haute valeur (réglementé, ou C-suite, ou une affaire d'au moins $100,000) même sur un brouillon 100 % propre. Sinon, il est auto-éligible. Le mode de comparaison, Standard AI SDR, recherche, rédige et envoie avec 0 affirmation vérifiée avant l'envoi ; l'application l'affiche comme un contrôle fantôme a posteriori de ce qui est déjà parti.

Le cas, traité de bout en bout

Trois leads issus du corpus de la démonstration (date d'ancrage 2026-06-17). Chaque image ci-dessous est une capture d'écran de l'application en cours d'exécution.

Un fait vrai tiré d'une source périmée reste la mauvaise chose à envoyer

Pour le lead Northwind Logistics (un 3PL mid-market synthétique), le brouillon affirme que l'entreprise « a récemment étendu ses activités en APAC ». La source est une vraie actualité APAC de Northwind, le recouvrement d'ancrage est de 100 %, et l'entité est correcte. Mais la source est datée du 2019-03-14, soit 2,652 jours (environ 7.3 ans) par rapport à une fenêtre de récence de 365 jours, donc la validité temporelle échoue et l'affirmation est retirée. Le Veracity Engine conserve les affirmations supported (en tête, une volonté d'embaucher six administrateurs Salesforce, étayée par une offre d'emploi datée du 2026-06-09), attrape les deux mauvaises affirmations et envoie un e-mail 100 % étayé par des sources.

Résultat du Veracity Engine pour le lead Northwind : 100 % de l'e-mail envoyé étayé par des sources, 60 % du brouillon vérifiable, deux affirmations attrapées et retirées avec les raisons affichées en ligne.
Résultat du Veracity Engine : intégrité à l'envoi 100 %, brouillon vérifiable 60 %, deux affirmations attrapées et barrées avec les raisons.
Panneau de preuves montrant un ancrage à 100 % et une entité OK, mais le contrôle temporel en échec : l'âge de la source, 2,652 jours, dépasse 365 jours pour une affirmation de récence, donc le verdict est stale.
Le panneau de preuves : l'ancrage passe, l'entité passe, la validité temporelle échoue (âge de la source 2,652 jours au-delà de la fenêtre de 365 jours). Verdict : stale.

Le même écart sur un vrai dépôt auprès de la SEC

Werner Enterprises, Inc. est une véritable société cotée, et les sources W1 et W2 sont des extraits verbatim de son formulaire 10-K FY2023 (SEC EDGAR, CIK 0000793074, déposé le 2024-02-26). L'affirmation du brouillon « recently growing your One-Way Truckload fleet to 2,735 trucks » est factuellement réelle, mais le dépôt a plus de deux ans, donc un cadrage « recently » est attrapé comme stale. C'est exactement l'écart d'usage temporel abusif que les outils de personnalisation à partir des dépôts SEC laissent ouvert. (Le contact et l'offre d'emploi de ce lead sont synthétiques ; seuls Werner et ses extraits du 10-K sont réels.)

Une affirmation réelle sur Werner Enterprises étayée par son 10-K SEC FY2023, attrapée comme stale parce que le dépôt a plus de deux ans par rapport à la fenêtre de récence de 365 jours.
Une affirmation réelle du 10-K de Werner, factuellement exacte, attrapée comme stale sur un cadrage de récence.

Une collision d'entités homonymes

Toujours sur le lead Northwind, le brouillon affirme aussi une « $40M Series B ». La source citée est réelle, mais elle concerne « Northwind Inc. », une startup de cybersécurité d'Austin, et non « Northwind Logistics ». Le contrôle de correspondance d'entité échoue et l'affirmation est retirée avant de pouvoir partir.

Panneau de preuves montrant un échec de correspondance d'entité : la source de financement citée concerne Northwind Inc., une startup de cybersécurité d'Austin, et non Northwind Logistics.
Incohérence d'entité : la source de financement décrit Northwind Inc., et non Northwind Logistics.

La gouvernance porte sur le risque, pas seulement sur l'exactitude

Atlas Capital Markets est un courtier-négociant synthétique réglementé par la FINRA, avec un contact Chief Revenue Officer et une affaire de $220,000. Même un brouillon 100 % propre, entièrement étayé par des sources, est forcé en revue humaine par la barrière de politique, parce qu'il est réglementé, C-suite, et au-dessus du seuil de $100,000. Un brouillon propre n'est pas la même chose qu'un brouillon envoyable.

Atlas Capital Markets acheminé vers la revue humaine parce qu'il est réglementé, C-suite, et une affaire de $220,000, même si le brouillon est entièrement étayé par des sources.
Atlas acheminé vers la revue humaine sur un brouillon 100 % propre : réglementé, C-suite, affaire au-dessus de $100,000.

Un reçu signé, et une référence reproductible

Chaque e-mail produit un reçu d'audit JSON téléchargeable : le fournisseur et la version du modèle, le prospect et le palier de risque, la fiche de faits, le verdict de chaque affirmation avec sa plage source et ses dates, le score de véracité, la règle de politique qui s'est déclenchée, et l'approbateur humain. Sur un jeu d'or étiqueté de 25 cas, le vérificateur déterministe obtient 25/25 d'exactitude des verdicts : 10 sur 10 affirmations difficiles ou mauvaises attrapées, 15 sur 15 affirmations propres conservées. Cette reproductibilité est ce qui le rend certifiable, et un juge LLM ne l'est pas. Nous attribuons le 25/25 à cette référence étiquetée, jamais comme une garantie en conditions ouvertes.

Le reçu d'audit JSON téléchargeable avec la trace par contrôle, la version du modèle, les verdicts, les plages source, les dates et la règle de politique qui s'est déclenchée.
Le reçu d'audit JSON signé, avec la trace complète par contrôle.
Le jeu d'or étiqueté de 25 cas obtenant 25 sur 25 d'exactitude des verdicts, déterministe et reproductible.
Le jeu d'or de 25 cas : 25/25 d'exactitude des verdicts, même résultat à chaque exécution.

Standard AI SDR versus le Veracity Engine

Le même interrupteur que la démonstration compare, côte à côte.

Dimension Standard AI SDR Veracity Engine
Affirmations vérifiées avant l'envoi 0 Chaque affirmation factuelle, de façon déterministe
Qui décide de ce qui part Le LLM envoie ce qu'il a rédigé Contrôles en Python pur, pas un LLM
Détection des sources périmées Aucune Validité temporelle, fenêtre de 365 jours
Mauvaise entité homonyme Aucune Contrôle de correspondance d'entité
Piste d'audit Aucune Reçu JSON signé par e-mail
Traitement du risque élevé Envoie quand même Acheminé vers la revue humaine

Ce que cette démonstration ne fait pas

  • ✓ Elle ne revendique pas un taux d'hallucination de zéro. Le LLM rédige toujours ; la garantie est que les affirmations non prouvées sont retirées avant l'envoi. Quiconque revendique un taux d'hallucination nul n'est pas honnête.
  • ✓ Elle n'utilise pas de connecteurs en direct. EDGAR, LinkedIn, Greenhouse, la récupération d'actualités, la lecture et l'écriture CRM, et l'envoi d'e-mails sont en stub ou simulés, et la fiche de faits est préconstruite.
  • ✓ Elle ne présente pas Northwind ni Atlas comme de vraies entreprises. Elles sont synthétiques. Seuls Werner Enterprises et ses extraits W1/W2 du 10-K sont des documents publics réels.
  • ✓ Elle ne rapporte pas la fourchette d'hallucination de 12 à 18 % comme le résultat mesuré de ce produit. Ce chiffre est un contexte de marché ; le chiffre phare de la démonstration est la couverture de provenance et le taux traité automatiquement.
  • ✓ Elle n'apporte pas de clients, d'études de cas, de témoignages ni de chiffres de ROI. Aucun n'existe encore. C'est une démonstration qui prouve le mécanisme, pas un déploiement.

Questions que les acheteurs posent réellement

N'est-ce qu'un SDR par IA de plus (comme 11x) ?

Non. Nous n'ajoutons pas un SDR par IA de plus sur le marché. Le Veracity Engine est une couche de vérification et de gouvernance qui se place après le brouillon : un vérificateur déterministe en Python pur contrôle chaque affirmation qu'une IA a écrite par rapport à une source datée et appariée à l'entité, retire tout ce qui n'est pas prouvé, et écrit un reçu d'audit signé avant que l'e-mail soit autorisé à partir. Les SDR par IA optimisent le volume ; nous décidons de ce qu'il est sûr d'envoyer.

Comment vérifiez-vous les affirmations des e-mails commerciaux générés par IA avant qu'ils ne partent ?

Chaque affirmation factuelle du brouillon passe par trois contrôles déterministes : l'ancrage (l'affirmation est-elle impliquée par un extrait de source, avec un recouvrement de jetons d'au moins 0.5), la correspondance d'entité (la source concerne-t-elle exactement ce prospect, et non une société homonyme) et la validité temporelle (si l'affirmation utilise un langage de récence, la source doit dater de moins de 365 jours). Seules les affirmations qui passent sont marquées supported et conservées ; tout le reste est retiré. Le vérificateur est du code, pas un LLM qui juge un LLM, donc la même entrée produit toujours le même verdict.

Comment attrape-t-il une affirmation techniquement vraie mais trompeuse ?

C'est exactement le mode d'échec pour lequel nous l'avons conçu, que la démonstration appelle usage contextuel abusif. Dans un lead traité, la phrase « a récemment étendu ses activités en APAC » est ancrée et concerne la bonne entreprise, mais la seule source est datée de 2019, donc elle a 2,652 jours par rapport à une fenêtre de récence de 365 jours et est attrapée comme stale et retirée. Nous montrons le même schéma sur une affirmation réelle de Werner Enterprises étayée par son 10-K SEC FY2023 : factuellement exacte, mais le dépôt a plus de deux ans, donc un cadrage « recently » échoue à la validité temporelle.

La prospection par IA peut-elle être utilisée dans des secteurs réglementés comme les services financiers / la FINRA ?

C'est là qu'une couche de vérification et de gouvernance compte le plus, parce qu'une affirmation hallucinée ou mal attribuée entraîne une conséquence réglementaire. Dans la démonstration, la barrière de politique achemine vers la revue humaine tout e-mail réglementé, envoyé à un contact C-suite, ou lié à une affaire d'au moins $100,000, même lorsque le brouillon est entièrement étayé par des sources. La gouvernance ici est une fonction du risque, pas seulement de l'exactitude.

Comment prouvez-vous quelle source a étayé une affirmation, pour un audit de conformité ?

Chaque e-mail produit un reçu d'audit JSON téléchargeable qui enregistre le fournisseur et la version du modèle, le prospect et le palier de risque, la fiche de faits, le verdict de chaque affirmation avec sa plage source et ses dates, le score de véracité, la règle de politique exacte qui s'est déclenchée, et l'approbateur humain. Toute affirmation se retrace jusqu'à sa source en quelques secondes. Un modèle parfait ne peut toujours pas prouver à un auditeur quelle source actuelle a étayé quelle affirmation ; un reçu le peut.

Un modèle d'IA meilleur/plus récent va-t-il simplement résoudre le problème d'hallucination ?

Non, et c'est le point durable. De meilleurs modèles de base rédigent toujours, et quiconque revendique un taux d'hallucination nul n'est pas honnête, donc le besoin de prouver la provenance, de conserver une piste d'audit et de filtrer selon le risque ne disparaît pas. La provenance, les reçus d'audit et une barrière de politique sont des propriétés durables ; un rédacteur plus fort ne supprime pas l'exigence de vérifier et de gouverner ce qu'il écrit.

S'agit-il d'un produit en production ou d'une démonstration ?

C'est une démonstration exécutable qui prouve le mécanisme, pas un pipeline déployé. Les sources de récupération (EDGAR, LinkedIn, Greenhouse, actualités), la lecture et l'écriture CRM, et l'envoi d'e-mails sont simulés, et la fiche de faits est préconstruite ; les leads sont synthétiques, à l'exception de Werner Enterprises, dont les extraits du 10-K sont des documents publics réels. Le vérificateur déterministe, la barrière de politique et le reçu d'audit sont réels et s'exécutent exactement comme montré.

Recherche technique

La recherche derrière cette démonstration — l'architecture, la conception de la vérification et le schéma directeur d'entreprise.

Vous placez la prospection par IA face à des acheteurs réglementés ?

La couche de vérification et de gouvernance est la partie difficile. Nous la construisons.

Si votre équipe cherche comment placer la prospection par IA face à des acheteurs réglementés sans risquer une affirmation hallucinée, nous aimerions sincèrement entendre comment vous y réfléchissez. Le problème est sectoriel et les réponses le seront aussi.

Évaluation de la vérification

  • ✓ Cartographier où votre prospection par IA peut envoyer une affirmation non prouvée
  • ✓ Définir des règles d'ancrage, d'entité et temporelles pour vos données
  • ✓ Concevoir les paliers de risque et la barrière de revue humaine
  • ✓ Spécifier le reçu d'audit dont votre équipe de conformité a besoin

Construire la couche

  • ✓ Un vérificateur déterministe sur vos sources réelles
  • ✓ Une barrière de politique calibrée à vos verticales réglementées
  • ✓ Des reçus d'audit signés et téléchargeables par envoi
  • ✓ Rédaction interchangeable selon le modèle (Anthropic, OpenAI, Gemini, Ollama)
Réseaux sociaux

Également publié sur