Die Verifizierungs- und Governance-Schicht für KI-Ansprache
KI-SDRs optimieren auf Volumen, und Single-Pass-Modelle versenden Aussagen mit veralteter Quelle, falscher Entität und überzogenen Behauptungen unverändert. Die Veracity Engine lässt ein LLM entwerfen, dann entfernen Prüfungen in reinem Python jede unbelegte Behauptung, bewerten den Rest und leiten ihn durch ein risikokalibriertes Policy-Tor. Agenten beraten, Code entscheidet.
100%
Versandintegrität, wenn eine Behauptung überlebt
Jede Behauptung in der versendeten E-Mail ist quellenbelegt
25/25
Urteilsgenauigkeit auf dem gelabelten Golden Set
Deterministisch und reproduzierbar (25-Fälle-Benchmark)
3
Deterministische Prüfungen vor dem Versand
Grounding, Entitätsabgleich, zeitliche Gültigkeit
Dies ist eine lauffähige Demo. Retrieval, CRM und E-Mail-Versand sind simuliert, und die Leads sind synthetisch mit Ausnahme von Werner Enterprises, dessen 10-K-Auszüge echte öffentliche Unterlagen sind.
Der Fehlermodus hinter den weithin bekannten KI-SDR-Abstürzen.
KI-SDRs sind gebaut, um mehr zu versenden. Single-Pass-LLMs halluzinieren einen messbaren Anteil interessentenspezifischer Behauptungen, und Personalisierungswerkzeuge prüfen die resultierende Behauptung nie erneut gegen eine aktuelle, entitätskorrekte Quelle. So werden Aussagen mit veralteter Quelle, falscher Entität und überzogenen Behauptungen unverändert versendet, und Verifizierung wird nach dem Versand nachgerüstet oder findet nie statt.
Der Branchenkontext ist schonungslos. Single-Pass-LLMs halluzinieren 12 bis 18% der interessentenspezifischen Behauptungen (AI SDR Industry Report, 2026). Die jährliche Abwanderung bei Enterprise-KI-SDR liegt bei 50 bis 70% (UserGems, 2026). 11x.ai hat $74M aufgenommen und ist 2025 mit 70 bis 80% Abwanderung zusammengebrochen (TechCrunch). Nur 7% der Unternehmen haben agentenspezifische Governance (Deloitte, 2026), und Gartner prognostiziert, dass mehr als 40% der agentic-AI-Projekte bis 2027 aufgegeben werden. Seit November 2025 löst eine Spam-Rate über 0.3% eine Ablehnung auf Gmail-SMTP-Ebene und eine Domain-Erholung von 6 bis 12 Wochen aus.
Der eigentliche Bug ist nicht schlechte Grammatik. Die Grammatik ist perfekt, und genau das macht es schlimmer. Die Gefahr ist eine Behauptung, die korrekt zitiert, aber irreführend verwendet wird: ein wahrer Fakt aus einer veralteten Quelle, ein wahrer Fakt über das falsche gleichnamige Unternehmen oder eine Anbieterbehauptung, der die Quelle widerspricht. Wir nennen das kontextuellen Missbrauch, und bessere Basismodelle beseitigen ihn nicht. Ein perfektes Modell kann FINRA oder der DSGVO trotzdem nicht beweisen, welche aktuelle Quelle welche Behauptung belegt hat.
Ein LLM entwirft. Deterministischer Code entscheidet, was versendet wird. Das ist neurosymbolisch: neurale Autorschaft, symbolische Verifizierung.
Die Pipeline läuft Lead, dann Research (ein Fact Sheet, in dem jeder Fakt an eine datierte Quelle gebunden ist), dann Draft (ein Writer-LLM, das nur auf das Fact Sheet beschränkt ist), dann Verify (deterministische Prüfungen), dann ein Policy-Tor, dann eine signierte Audit-Quittung, dann ein simulierter CRM-Rückschrieb. Der Verifizierungsschritt ist kein LLM, das ein LLM beurteilt. Es ist reines Python, sodass dieselbe Eingabe bei jedem Lauf dasselbe Urteil liefert.
Jede faktische Behauptung wird gegen ihre zitierte Quelle geprüft. Die erste fehlschlagende Prüfung gewinnt, in Prioritätsreihenfolge: unsourced, dann contradicted, dann entity mismatch, dann stale.
Folgt die Behauptung aus einem Quellenausschnitt? Die Token-Überlappung muss mindestens 0.5 der Inhaltstokens betragen, und Unternehmensnamen-Tokens werden ausgeschlossen, damit eine Behauptung nicht allein durch Wiederholen des Unternehmensnamens hoch bewertet werden kann.
Handelt die Quelle von genau diesem Interessenten, nicht von einem anderen gleichnamigen Unternehmen? Eine Quelle über eine andere Firma mit demselben Namen scheitert, selbst wenn die Wörter übereinstimmen.
Wenn die Behauptung Aktualitätssprache verwendet („kürzlich“, „gerade“, „jetzt“, „diese Woche“), muss die Quelle innerhalb von 365 Tagen liegen. Ältere Quellen werden als stale markiert, selbst wenn der Fakt wahr ist.
Zwei weitere Wächter laufen parallel dazu: eine Vendor-Widerspruchsprüfung und eine Satz-Treue-Untergrenze von 0.3, die verhindert, dass ein Live-LLM auf einer gültigen Fakt-ID einen halluzinierten Satz reitet. Das Urteilsvokabular steuert die Interface-Farben: supported (grün) besteht; stale (amber), entity_mismatch (rot), contradicted (rot) und unsourced (rot) bestehen nicht.
Das Tor entfernt jede nicht-supported Behauptung und berichtet dann zwei Zahlen. Der Veracity Score ist gestützte Behauptungen geteilt durch die gesamten faktischen Behauptungen im Entwurf, also wie viel von dem, was die KI geschrieben hat, tatsächlich wahr war. Die Versandintegrität ist 100%, sobald mindestens eine Behauptung überlebt, weil die versendete E-Mail dann nur quellenbelegte Behauptungen enthält. Das ist die Designgarantie.
Die Weiterleitung folgt dem Risiko. Die E-Mail wird überarbeitet, wenn nichts Sicheres überlebt oder die Entwurfsabdeckung unter 0.5 fällt. Sie geht in die menschliche Prüfung, wenn sie hochwertig ist (reguliert, oder C-Suite, oder ein Deal von mindestens $100,000), selbst bei einem 100%-sauberen Entwurf. Andernfalls ist sie automatisch versandberechtigt. Der Vergleichsmodus Standard AI SDR recherchiert, entwirft und versendet mit 0 vor dem Versand verifizierten Behauptungen; die App zeigt das als nachträgliche Schattenprüfung dessen, was bereits rausging.
Drei Leads aus dem Demo-Korpus (Ankerdatum 2026-06-17). Jedes Bild unten ist ein Screenshot der laufenden App.
Beim Lead Northwind Logistics (ein synthetischer Mid-Market-3PL) behauptet der Entwurf, das Unternehmen habe „kürzlich nach APAC expandiert“. Die Quelle ist echte Northwind-APAC-News, die Grounding-Überlappung beträgt 100%, und die Entität ist korrekt. Aber die Quelle ist datiert auf 2019-03-14, also 2,652 Tage alt (etwa 7.3 Jahre) gegenüber einem 365-Tage-Aktualitätsfenster, daher scheitert die zeitliche Gültigkeit und die Behauptung wird entfernt. Die Veracity Engine behält die gestützten Behauptungen (angeführt von einem Vorhaben, sechs Salesforce-Administratoren einzustellen, belegt durch eine Stellenanzeige vom 2026-06-09), fängt die zwei schlechten Behauptungen und versendet eine E-Mail, die zu 100% quellenbelegt ist.
Werner Enterprises, Inc. ist ein echtes börsennotiertes Unternehmen, und die Quellen W1 und W2 sind wörtliche Auszüge aus seinem FY2023 Form 10-K (SEC EDGAR, CIK 0000793074, eingereicht 2024-02-26). Die Entwurfsbehauptung „kürzlich Ihre One-Way Truckload-Flotte auf 2,735 Lkw ausgebaut“ ist faktisch real, aber die Einreichung ist mehr als zwei Jahre alt, daher wird ein „kürzlich“-Framing als stale erkannt. Das ist genau die Lücke des zeitlichen Missbrauchs, die Personalisierungswerkzeuge für SEC-Einreichungen offenlassen. (Der Kontakt und die Stellenanzeige in diesem Lead sind synthetisch; nur Werner und seine 10-K-Auszüge sind real.)
Zurück beim Northwind-Lead behauptet der Entwurf außerdem eine „$40M Series B“. Die zitierte Quelle ist real, aber sie handelt von „Northwind Inc.“, einem Austin-Cybersecurity-Startup, nicht von „Northwind Logistics“. Die Entitätsabgleich-Prüfung scheitert, und die Behauptung wird entfernt, bevor sie versendet werden kann.
Atlas Capital Markets ist ein synthetischer FINRA-regulierter Broker-Dealer, mit einem Chief Revenue Officer als Kontakt und einem Deal von $220,000. Selbst ein 100%-sauberer, vollständig quellenbelegter Entwurf wird vom Policy-Tor in die menschliche Prüfung gezwungen, weil er reguliert, C-Suite und über der Schwelle von $100,000 liegt. Ein sauberer Entwurf ist nicht dasselbe wie ein versendbarer.
Jede E-Mail erzeugt eine herunterladbare JSON-Audit-Quittung: den Modellanbieter und die Version, den Interessenten und die Risikostufe, das Fact Sheet, das Urteil jeder Behauptung mit ihrem Quellen-Span und Daten, den Veracity Score, die Policy-Regel, die gegriffen hat, und den menschlichen Freigeber. Auf einem gelabelten Golden Set von 25 Fällen erreicht der deterministische Prüfer 25/25 Urteilsgenauigkeit: 10 von 10 harte oder schlechte Behauptungen erkannt, 15 von 15 saubere Behauptungen erhalten. Diese Reproduzierbarkeit macht es zertifizierbar, und ein LLM-Richter ist das nicht. Wir schreiben die 25/25 diesem gelabelten Benchmark zu, niemals als Garantie für die offene Welt.
Derselbe Schalter, gegen den die Demo vergleicht, Seite an Seite.
| Dimension | Standard AI SDR | Veracity Engine |
|---|---|---|
| Behauptungen vor dem Versand verifiziert | 0 | Jede faktische Behauptung, deterministisch |
| Wer entscheidet, was versendet wird | Das LLM versendet, was es entworfen hat | Prüfungen in reinem Python, kein LLM |
| Erkennung veralteter Quellen | Keine | Zeitliche Gültigkeit, 365-Tage-Fenster |
| Falsche gleichnamige Entität | Keine | Entitätsabgleich-Prüfung |
| Audit-Trail | Keine | Signierte JSON-Quittung pro E-Mail |
| Umgang mit hohem Risiko | Versendet trotzdem | Zur menschlichen Prüfung weitergeleitet |
Nein. Wir fügen dem Markt keinen weiteren KI-SDR hinzu. Die Veracity Engine ist eine Verifizierungs- und Governance-Schicht, die nach dem Entwurf sitzt: ein deterministischer Prüfer in reinem Python prüft jede Behauptung, die eine KI geschrieben hat, gegen eine datierte, entitätsabgeglichene Quelle, entfernt alles Unbelegte und schreibt eine signierte Audit-Quittung, bevor die E-Mail versendet werden darf. KI-SDRs optimieren auf Volumen; wir entscheiden, was sicher versendet werden darf.
Jede faktische Behauptung im Entwurf läuft durch drei deterministische Prüfungen: Grounding (folgt die Behauptung aus einem Quellenausschnitt, bei einer Token-Überlappung von mindestens 0.5), Entitätsabgleich (handelt die Quelle von genau diesem Interessenten, nicht von einem gleichnamigen Unternehmen) und zeitliche Gültigkeit (wenn die Behauptung Aktualitätssprache verwendet, muss die Quelle innerhalb von 365 Tagen liegen). Nur Behauptungen, die bestehen, werden als supported markiert und behalten; alles andere wird entfernt. Der Prüfer ist Code, kein LLM, das ein LLM beurteilt, sodass dieselbe Eingabe immer dasselbe Urteil liefert.
Das ist genau der Fehlermodus, für den wir gebaut haben, den die Demo kontextuellen Missbrauch nennt. In einem durchgespielten Lead besteht der Satz „kürzlich nach APAC expandiert“ die Grounding-Prüfung und betrifft das richtige Unternehmen, aber die einzige Quelle ist auf 2019 datiert, also 2,652 Tage alt gegenüber einem 365-Tage-Aktualitätsfenster, und wird als stale erkannt und entfernt. Wir zeigen dasselbe Muster an einer echten Werner-Enterprises-Behauptung, belegt durch seinen FY2023 SEC 10-K: faktisch zutreffend, aber die Einreichung ist über zwei Jahre alt, daher scheitert ein „kürzlich“-Framing an der zeitlichen Gültigkeit.
Genau dort zählt eine Verifizierungs- und Governance-Schicht am meisten, weil eine halluzinierte oder falsch zugeordnete Behauptung regulatorische Folgen hat. In der Demo leitet das Policy-Tor jede E-Mail, die reguliert ist, an einen C-Suite-Kontakt geht oder an einen Deal von mindestens $100,000 gebunden ist, zur menschlichen Prüfung weiter, selbst wenn der Entwurf vollständig quellenbelegt ist. Governance ist hier eine Funktion des Risikos, nicht nur der Korrektheit.
Jede E-Mail erzeugt eine herunterladbare JSON-Audit-Quittung, die den Modellanbieter und die Version, den Interessenten und die Risikostufe, das Fact Sheet, das Urteil jeder Behauptung mit ihrem Quellen-Span und Daten, den Veracity Score, die genaue Policy-Regel, die gegriffen hat, und den menschlichen Freigeber festhält. Jede Behauptung lässt sich in Sekunden zu ihrer Quelle zurückverfolgen. Ein perfektes Modell kann einem Prüfer trotzdem nicht beweisen, welche aktuelle Quelle welche Behauptung belegt hat; eine Quittung kann das.
Nein, und das ist der dauerhafte Punkt. Bessere Basismodelle entwerfen weiterhin, und wer eine Halluzinationsrate von null behauptet, ist nicht ehrlich, daher verschwindet der Bedarf, Provenienz zu beweisen, einen Audit-Trail zu führen und nach Risiko zu steuern, nicht. Provenienz, Audit-Quittungen und ein Policy-Tor sind dauerhafte Eigenschaften; ein stärkerer Writer hebt die Pflicht nicht auf, zu verifizieren und zu steuern, was er schreibt.
Es ist eine lauffähige Demo, die den Mechanismus belegt, nicht eine eingeführte Pipeline. Die Retrieval-Quellen (EDGAR, LinkedIn, Greenhouse, News), das CRM-Lesen und -Schreiben und der E-Mail-Versand sind simuliert, und das Fact Sheet ist vorgebaut; die Leads sind synthetisch mit Ausnahme von Werner Enterprises, dessen 10-K-Auszüge echte öffentliche Unterlagen sind. Der deterministische Prüfer, das Policy-Tor und die Audit-Quittung sind real und laufen genau wie gezeigt.
Die Forschung hinter dieser Demo — die Architektur, das Verifizierungsdesign und der Enterprise-Blueprint.
Vollständige Lösung
Die Lösung KI-Vertriebsintelligenz & verifizierte Ansprache erkunden →Die Verifizierungs- und Governance-Schicht ist der harte Teil. Wir bauen sie.
Wenn Ihr Team damit ringt, KI-Ansprache vor regulierte Käufer zu stellen, ohne eine halluzinierte Behauptung zu riskieren, würden wir wirklich gerne hören, wie Sie darüber nachdenken. Das Problem ist branchenweit, und die Antworten werden es auch sein.