Die Verifizierungs- und Governance-Schicht für KI-Ansprache

Ein deterministischer Prüfer entscheidet, was Ihre KI-Ansprache versenden darf.

KI-SDRs optimieren auf Volumen, und Single-Pass-Modelle versenden Aussagen mit veralteter Quelle, falscher Entität und überzogenen Behauptungen unverändert. Die Veracity Engine lässt ein LLM entwerfen, dann entfernen Prüfungen in reinem Python jede unbelegte Behauptung, bewerten den Rest und leiten ihn durch ein risikokalibriertes Policy-Tor. Agenten beraten, Code entscheidet.

100%

Versandintegrität, wenn eine Behauptung überlebt

Jede Behauptung in der versendeten E-Mail ist quellenbelegt

25/25

Urteilsgenauigkeit auf dem gelabelten Golden Set

Deterministisch und reproduzierbar (25-Fälle-Benchmark)

3

Deterministische Prüfungen vor dem Versand

Grounding, Entitätsabgleich, zeitliche Gültigkeit

Dies ist eine lauffähige Demo. Retrieval, CRM und E-Mail-Versand sind simuliert, und die Leads sind synthetisch mit Ausnahme von Werner Enterprises, dessen 10-K-Auszüge echte öffentliche Unterlagen sind.

Volumen ohne Verifizierung zerstört mehr Pipeline, als es schafft

Der Fehlermodus hinter den weithin bekannten KI-SDR-Abstürzen.

KI-SDRs sind gebaut, um mehr zu versenden. Single-Pass-LLMs halluzinieren einen messbaren Anteil interessentenspezifischer Behauptungen, und Personalisierungswerkzeuge prüfen die resultierende Behauptung nie erneut gegen eine aktuelle, entitätskorrekte Quelle. So werden Aussagen mit veralteter Quelle, falscher Entität und überzogenen Behauptungen unverändert versendet, und Verifizierung wird nach dem Versand nachgerüstet oder findet nie statt.

Der Branchenkontext ist schonungslos. Single-Pass-LLMs halluzinieren 12 bis 18% der interessentenspezifischen Behauptungen (AI SDR Industry Report, 2026). Die jährliche Abwanderung bei Enterprise-KI-SDR liegt bei 50 bis 70% (UserGems, 2026). 11x.ai hat $74M aufgenommen und ist 2025 mit 70 bis 80% Abwanderung zusammengebrochen (TechCrunch). Nur 7% der Unternehmen haben agentenspezifische Governance (Deloitte, 2026), und Gartner prognostiziert, dass mehr als 40% der agentic-AI-Projekte bis 2027 aufgegeben werden. Seit November 2025 löst eine Spam-Rate über 0.3% eine Ablehnung auf Gmail-SMTP-Ebene und eine Domain-Erholung von 6 bis 12 Wochen aus.

Der eigentliche Bug ist nicht schlechte Grammatik. Die Grammatik ist perfekt, und genau das macht es schlimmer. Die Gefahr ist eine Behauptung, die korrekt zitiert, aber irreführend verwendet wird: ein wahrer Fakt aus einer veralteten Quelle, ein wahrer Fakt über das falsche gleichnamige Unternehmen oder eine Anbieterbehauptung, der die Quelle widerspricht. Wir nennen das kontextuellen Missbrauch, und bessere Basismodelle beseitigen ihn nicht. Ein perfektes Modell kann FINRA oder der DSGVO trotzdem nicht beweisen, welche aktuelle Quelle welche Behauptung belegt hat.

So funktioniert die Veracity Engine

Ein LLM entwirft. Deterministischer Code entscheidet, was versendet wird. Das ist neurosymbolisch: neurale Autorschaft, symbolische Verifizierung.

Die Pipeline läuft Lead, dann Research (ein Fact Sheet, in dem jeder Fakt an eine datierte Quelle gebunden ist), dann Draft (ein Writer-LLM, das nur auf das Fact Sheet beschränkt ist), dann Verify (deterministische Prüfungen), dann ein Policy-Tor, dann eine signierte Audit-Quittung, dann ein simulierter CRM-Rückschrieb. Der Verifizierungsschritt ist kein LLM, das ein LLM beurteilt. Es ist reines Python, sodass dieselbe Eingabe bei jedem Lauf dasselbe Urteil liefert.

Die drei deterministischen Prüfungen

Jede faktische Behauptung wird gegen ihre zitierte Quelle geprüft. Die erste fehlschlagende Prüfung gewinnt, in Prioritätsreihenfolge: unsourced, dann contradicted, dann entity mismatch, dann stale.

1. Grounding

Folgt die Behauptung aus einem Quellenausschnitt? Die Token-Überlappung muss mindestens 0.5 der Inhaltstokens betragen, und Unternehmensnamen-Tokens werden ausgeschlossen, damit eine Behauptung nicht allein durch Wiederholen des Unternehmensnamens hoch bewertet werden kann.

2. Entitätsabgleich

Handelt die Quelle von genau diesem Interessenten, nicht von einem anderen gleichnamigen Unternehmen? Eine Quelle über eine andere Firma mit demselben Namen scheitert, selbst wenn die Wörter übereinstimmen.

3. Zeitliche Gültigkeit

Wenn die Behauptung Aktualitätssprache verwendet („kürzlich“, „gerade“, „jetzt“, „diese Woche“), muss die Quelle innerhalb von 365 Tagen liegen. Ältere Quellen werden als stale markiert, selbst wenn der Fakt wahr ist.

Zwei weitere Wächter laufen parallel dazu: eine Vendor-Widerspruchsprüfung und eine Satz-Treue-Untergrenze von 0.3, die verhindert, dass ein Live-LLM auf einer gültigen Fakt-ID einen halluzinierten Satz reitet. Das Urteilsvokabular steuert die Interface-Farben: supported (grün) besteht; stale (amber), entity_mismatch (rot), contradicted (rot) und unsourced (rot) bestehen nicht.

Das Policy-Tor

Das Tor entfernt jede nicht-supported Behauptung und berichtet dann zwei Zahlen. Der Veracity Score ist gestützte Behauptungen geteilt durch die gesamten faktischen Behauptungen im Entwurf, also wie viel von dem, was die KI geschrieben hat, tatsächlich wahr war. Die Versandintegrität ist 100%, sobald mindestens eine Behauptung überlebt, weil die versendete E-Mail dann nur quellenbelegte Behauptungen enthält. Das ist die Designgarantie.

Die Weiterleitung folgt dem Risiko. Die E-Mail wird überarbeitet, wenn nichts Sicheres überlebt oder die Entwurfsabdeckung unter 0.5 fällt. Sie geht in die menschliche Prüfung, wenn sie hochwertig ist (reguliert, oder C-Suite, oder ein Deal von mindestens $100,000), selbst bei einem 100%-sauberen Entwurf. Andernfalls ist sie automatisch versandberechtigt. Der Vergleichsmodus Standard AI SDR recherchiert, entwirft und versendet mit 0 vor dem Versand verifizierten Behauptungen; die App zeigt das als nachträgliche Schattenprüfung dessen, was bereits rausging.

Der Haken, durchgängig durchgespielt

Drei Leads aus dem Demo-Korpus (Ankerdatum 2026-06-17). Jedes Bild unten ist ein Screenshot der laufenden App.

Ein wahrer Fakt aus einer veralteten Quelle ist trotzdem das Falsche zum Versenden

Beim Lead Northwind Logistics (ein synthetischer Mid-Market-3PL) behauptet der Entwurf, das Unternehmen habe „kürzlich nach APAC expandiert“. Die Quelle ist echte Northwind-APAC-News, die Grounding-Überlappung beträgt 100%, und die Entität ist korrekt. Aber die Quelle ist datiert auf 2019-03-14, also 2,652 Tage alt (etwa 7.3 Jahre) gegenüber einem 365-Tage-Aktualitätsfenster, daher scheitert die zeitliche Gültigkeit und die Behauptung wird entfernt. Die Veracity Engine behält die gestützten Behauptungen (angeführt von einem Vorhaben, sechs Salesforce-Administratoren einzustellen, belegt durch eine Stellenanzeige vom 2026-06-09), fängt die zwei schlechten Behauptungen und versendet eine E-Mail, die zu 100% quellenbelegt ist.

Veracity-Engine-Ergebnis für den Northwind-Lead: 100% der versendeten E-Mail quellenbelegt, 60% des Entwurfs verifizierbar, zwei Behauptungen erkannt und entfernt, mit inline angezeigten Gründen.
Veracity-Engine-Ergebnis: Versandintegrität 100%, Entwurf verifizierbar 60%, zwei Behauptungen erkannt und durchgestrichen mit Gründen.
Evidenzpanel mit Grounding bei 100% und Entität OK, aber die zeitliche Prüfung scheitert: Quellenalter 2,652 Tage überschreitet 365 Tage für eine Aktualitätsbehauptung, daher ist das Urteil stale.
Das Evidenzpanel: Grounding besteht, Entität besteht, zeitliche Gültigkeit scheitert (Quellenalter 2,652 Tage über dem 365-Tage-Fenster). Urteil: stale.

Dieselbe Lücke in einer echten SEC-Einreichung

Werner Enterprises, Inc. ist ein echtes börsennotiertes Unternehmen, und die Quellen W1 und W2 sind wörtliche Auszüge aus seinem FY2023 Form 10-K (SEC EDGAR, CIK 0000793074, eingereicht 2024-02-26). Die Entwurfsbehauptung „kürzlich Ihre One-Way Truckload-Flotte auf 2,735 Lkw ausgebaut“ ist faktisch real, aber die Einreichung ist mehr als zwei Jahre alt, daher wird ein „kürzlich“-Framing als stale erkannt. Das ist genau die Lücke des zeitlichen Missbrauchs, die Personalisierungswerkzeuge für SEC-Einreichungen offenlassen. (Der Kontakt und die Stellenanzeige in diesem Lead sind synthetisch; nur Werner und seine 10-K-Auszüge sind real.)

Eine echte Werner-Enterprises-Behauptung, belegt durch seinen FY2023 SEC 10-K, als stale erkannt, weil die Einreichung über zwei Jahre alt ist gegenüber dem 365-Tage-Aktualitätsfenster.
Eine echte Werner-10-K-Behauptung, faktisch zutreffend, als stale erkannt wegen eines Aktualitäts-Framings.

Eine Gleichnamen-Entitätskollision

Zurück beim Northwind-Lead behauptet der Entwurf außerdem eine „$40M Series B“. Die zitierte Quelle ist real, aber sie handelt von „Northwind Inc.“, einem Austin-Cybersecurity-Startup, nicht von „Northwind Logistics“. Die Entitätsabgleich-Prüfung scheitert, und die Behauptung wird entfernt, bevor sie versendet werden kann.

Evidenzpanel mit einem Entitätsabgleich-Fehler: Die zitierte Finanzierungsquelle handelt von Northwind Inc., einem Austin-Cybersecurity-Startup, nicht von Northwind Logistics.
Entitätsmismatch: Die Finanzierungsquelle beschreibt Northwind Inc., nicht Northwind Logistics.

Governance handelt von Risiko, nicht nur von Korrektheit

Atlas Capital Markets ist ein synthetischer FINRA-regulierter Broker-Dealer, mit einem Chief Revenue Officer als Kontakt und einem Deal von $220,000. Selbst ein 100%-sauberer, vollständig quellenbelegter Entwurf wird vom Policy-Tor in die menschliche Prüfung gezwungen, weil er reguliert, C-Suite und über der Schwelle von $100,000 liegt. Ein sauberer Entwurf ist nicht dasselbe wie ein versendbarer.

Atlas Capital Markets zur menschlichen Prüfung weitergeleitet, weil es reguliert, C-Suite und ein Deal von $220,000 ist, obwohl der Entwurf vollständig quellenbelegt ist.
Atlas zur menschlichen Prüfung weitergeleitet bei einem 100%-sauberen Entwurf: reguliert, C-Suite, Deal über $100,000.

Eine signierte Quittung und ein reproduzierbarer Benchmark

Jede E-Mail erzeugt eine herunterladbare JSON-Audit-Quittung: den Modellanbieter und die Version, den Interessenten und die Risikostufe, das Fact Sheet, das Urteil jeder Behauptung mit ihrem Quellen-Span und Daten, den Veracity Score, die Policy-Regel, die gegriffen hat, und den menschlichen Freigeber. Auf einem gelabelten Golden Set von 25 Fällen erreicht der deterministische Prüfer 25/25 Urteilsgenauigkeit: 10 von 10 harte oder schlechte Behauptungen erkannt, 15 von 15 saubere Behauptungen erhalten. Diese Reproduzierbarkeit macht es zertifizierbar, und ein LLM-Richter ist das nicht. Wir schreiben die 25/25 diesem gelabelten Benchmark zu, niemals als Garantie für die offene Welt.

Die herunterladbare JSON-Audit-Quittung mit Trace pro Prüfung, Modellversion, Urteilen, Quellen-Spans, Daten und der Policy-Regel, die gegriffen hat.
Die signierte JSON-Audit-Quittung mit dem vollständigen Trace pro Prüfung.
Das gelabelte 25-Fälle-Golden-Set mit 25 von 25 Urteilsgenauigkeit, deterministisch und reproduzierbar.
Das 25-Fälle-Golden-Set: 25/25 Urteilsgenauigkeit, dasselbe Ergebnis bei jedem Lauf.

Standard AI SDR versus die Veracity Engine

Derselbe Schalter, gegen den die Demo vergleicht, Seite an Seite.

Dimension Standard AI SDR Veracity Engine
Behauptungen vor dem Versand verifiziert 0 Jede faktische Behauptung, deterministisch
Wer entscheidet, was versendet wird Das LLM versendet, was es entworfen hat Prüfungen in reinem Python, kein LLM
Erkennung veralteter Quellen Keine Zeitliche Gültigkeit, 365-Tage-Fenster
Falsche gleichnamige Entität Keine Entitätsabgleich-Prüfung
Audit-Trail Keine Signierte JSON-Quittung pro E-Mail
Umgang mit hohem Risiko Versendet trotzdem Zur menschlichen Prüfung weitergeleitet

Was diese Demo nicht tut

  • ✓ Sie behauptet keine Halluzinationsrate von null. Das LLM entwirft weiterhin; die Garantie ist, dass unbelegte Behauptungen vor dem Versand entfernt werden. Wer eine Halluzinationsrate von null behauptet, ist nicht ehrlich.
  • ✓ Sie nutzt keine Live-Konnektoren. EDGAR, LinkedIn, Greenhouse, News-Retrieval, CRM-Lesen und -Schreiben sowie E-Mail-Versand sind gestubbt oder simuliert, und das Fact Sheet ist vorgebaut.
  • ✓ Sie stellt Northwind oder Atlas nicht als reale Unternehmen dar. Sie sind synthetisch. Nur Werner Enterprises und seine W1/W2-10-K-Auszüge sind echte öffentliche Unterlagen.
  • ✓ Sie berichtet den Halluzinationsbereich von 12 bis 18% nicht als eigenes Messergebnis dieses Produkts. Diese Zahl ist Marktkontext; die Schlagzeile der Demo ist Provenienzabdeckung und die Auto-Handled-Quote.
  • ✓ Sie enthält keine Kunden, Fallstudien, Testimonials oder ROI-Zahlen. Es gibt noch keine. Dies ist eine Demo, die den Mechanismus belegt, nicht eine Einführung.

Fragen, die Käufer tatsächlich stellen

Ist das nur ein weiterer KI-SDR (wie 11x)?

Nein. Wir fügen dem Markt keinen weiteren KI-SDR hinzu. Die Veracity Engine ist eine Verifizierungs- und Governance-Schicht, die nach dem Entwurf sitzt: ein deterministischer Prüfer in reinem Python prüft jede Behauptung, die eine KI geschrieben hat, gegen eine datierte, entitätsabgeglichene Quelle, entfernt alles Unbelegte und schreibt eine signierte Audit-Quittung, bevor die E-Mail versendet werden darf. KI-SDRs optimieren auf Volumen; wir entscheiden, was sicher versendet werden darf.

Wie verifizieren Sie KI-generierte Vertriebs-E-Mail-Behauptungen, bevor sie versendet werden?

Jede faktische Behauptung im Entwurf läuft durch drei deterministische Prüfungen: Grounding (folgt die Behauptung aus einem Quellenausschnitt, bei einer Token-Überlappung von mindestens 0.5), Entitätsabgleich (handelt die Quelle von genau diesem Interessenten, nicht von einem gleichnamigen Unternehmen) und zeitliche Gültigkeit (wenn die Behauptung Aktualitätssprache verwendet, muss die Quelle innerhalb von 365 Tagen liegen). Nur Behauptungen, die bestehen, werden als supported markiert und behalten; alles andere wird entfernt. Der Prüfer ist Code, kein LLM, das ein LLM beurteilt, sodass dieselbe Eingabe immer dasselbe Urteil liefert.

Wie fängt es eine Behauptung, die technisch wahr, aber irreführend ist?

Das ist genau der Fehlermodus, für den wir gebaut haben, den die Demo kontextuellen Missbrauch nennt. In einem durchgespielten Lead besteht der Satz „kürzlich nach APAC expandiert“ die Grounding-Prüfung und betrifft das richtige Unternehmen, aber die einzige Quelle ist auf 2019 datiert, also 2,652 Tage alt gegenüber einem 365-Tage-Aktualitätsfenster, und wird als stale erkannt und entfernt. Wir zeigen dasselbe Muster an einer echten Werner-Enterprises-Behauptung, belegt durch seinen FY2023 SEC 10-K: faktisch zutreffend, aber die Einreichung ist über zwei Jahre alt, daher scheitert ein „kürzlich“-Framing an der zeitlichen Gültigkeit.

Kann KI-Ansprache in regulierten Branchen wie Finanzdienstleistungen / FINRA eingesetzt werden?

Genau dort zählt eine Verifizierungs- und Governance-Schicht am meisten, weil eine halluzinierte oder falsch zugeordnete Behauptung regulatorische Folgen hat. In der Demo leitet das Policy-Tor jede E-Mail, die reguliert ist, an einen C-Suite-Kontakt geht oder an einen Deal von mindestens $100,000 gebunden ist, zur menschlichen Prüfung weiter, selbst wenn der Entwurf vollständig quellenbelegt ist. Governance ist hier eine Funktion des Risikos, nicht nur der Korrektheit.

Wie beweisen Sie, welche Quelle eine Behauptung belegt hat, für ein Compliance-Audit?

Jede E-Mail erzeugt eine herunterladbare JSON-Audit-Quittung, die den Modellanbieter und die Version, den Interessenten und die Risikostufe, das Fact Sheet, das Urteil jeder Behauptung mit ihrem Quellen-Span und Daten, den Veracity Score, die genaue Policy-Regel, die gegriffen hat, und den menschlichen Freigeber festhält. Jede Behauptung lässt sich in Sekunden zu ihrer Quelle zurückverfolgen. Ein perfektes Modell kann einem Prüfer trotzdem nicht beweisen, welche aktuelle Quelle welche Behauptung belegt hat; eine Quittung kann das.

Wird ein besseres/neueres KI-Modell das Halluzinationsproblem einfach beheben?

Nein, und das ist der dauerhafte Punkt. Bessere Basismodelle entwerfen weiterhin, und wer eine Halluzinationsrate von null behauptet, ist nicht ehrlich, daher verschwindet der Bedarf, Provenienz zu beweisen, einen Audit-Trail zu führen und nach Risiko zu steuern, nicht. Provenienz, Audit-Quittungen und ein Policy-Tor sind dauerhafte Eigenschaften; ein stärkerer Writer hebt die Pflicht nicht auf, zu verifizieren und zu steuern, was er schreibt.

Ist das ein Live-Produkt oder eine Demo?

Es ist eine lauffähige Demo, die den Mechanismus belegt, nicht eine eingeführte Pipeline. Die Retrieval-Quellen (EDGAR, LinkedIn, Greenhouse, News), das CRM-Lesen und -Schreiben und der E-Mail-Versand sind simuliert, und das Fact Sheet ist vorgebaut; die Leads sind synthetisch mit Ausnahme von Werner Enterprises, dessen 10-K-Auszüge echte öffentliche Unterlagen sind. Der deterministische Prüfer, das Policy-Tor und die Audit-Quittung sind real und laufen genau wie gezeigt.

Technische Forschung

Die Forschung hinter dieser Demo — die Architektur, das Verifizierungsdesign und der Enterprise-Blueprint.

KI-Ansprache vor regulierte Käufer stellen?

Die Verifizierungs- und Governance-Schicht ist der harte Teil. Wir bauen sie.

Wenn Ihr Team damit ringt, KI-Ansprache vor regulierte Käufer zu stellen, ohne eine halluzinierte Behauptung zu riskieren, würden wir wirklich gerne hören, wie Sie darüber nachdenken. Das Problem ist branchenweit, und die Antworten werden es auch sein.

Verifizierungs-Assessment

  • ✓ Kartieren, wo Ihre KI-Ansprache eine unbelegte Behauptung versenden kann
  • ✓ Grounding-, Entitäts- und Zeitregeln für Ihre Daten definieren
  • ✓ Die Risikostufen und das Tor zur menschlichen Prüfung entwerfen
  • ✓ Die Audit-Quittung spezifizieren, die Ihr Compliance-Team braucht

Die Schicht bauen

  • ✓ Ein deterministischer Prüfer über Ihren echten Quellen
  • ✓ Ein Policy-Tor, kalibriert auf Ihre regulierten Vertikalen
  • ✓ Signierte, herunterladbare Audit-Quittungen pro Versand
  • ✓ Modellaustauschbare Autorschaft (Anthropic, OpenAI, Gemini, Ollama)
Social

Auch veröffentlicht auf