Warum KI-Outreach an wahren Behauptungen scheitert, nicht nur an halluzinierten – und was ich beim Bau einer deterministischen Verifizierungsschicht lernte.
Artificial IntelligenceSalesStartup

Die Behauptung war wahr. Ich habe sie trotzdem gestrichen.

Ashutosh SinghalAshutosh Singhal22. Juni 202615 min

Die erste E-Mail, deren Versand ich jemals verweigert habe, war vollkommen korrekt.

Ich erinnere mich an den Satz, weil ich ihn etwa vierzig Mal gelesen habe: "I saw you've recently grown your One-Way Truckload fleet to 2,735 trucks." Jedes Wort davon war wahr. Werner Enterprises hat diese Flotte tatsächlich in seinem eigenen Form 10-K gemeldet, eingereicht bei der SEC. Und während ich vor der Demo saß, die ich baute, habe ich die Behauptung trotzdem gestrichen.

Diese Entscheidung fühlte sich etwa einen Tag lang falsch an. Dann fühlte sie sich wie der ganze Punkt an.

Veracity-Engine-Evidenzpanel, das die echte Werner-10-K-Behauptung über das Wachstum der One-Way-Truckload-Flotte auf 2.735 Lkw zeigt, als veraltet markiert, weil die zitierte Einreichung 842 Tage alt ist, durchgestrichen und im E-Mail-Entwurf als gestrichen gekennzeichnet.
Die Behauptung, die ich gestrichen habe. Der Satz mit den 2.735 Lkw zitiert einen echten Werner-10-K, aber die Einreichung ist 842 Tage alt gegenüber einem 365-Tage-Aktualitätsfenster, sodass „kürzlich“ scheitert und die Zeile vor dem Versand gestrichen wird. Code hat diese Entscheidung getroffen, kein Sprachmodell.

Ich hatte dieses Projekt begonnen im Glauben, wie fast jeder, der gerade in KI-Vertrieb baut, dass der Feind Halluzination sei. Das Modell erfindet etwas, das Falsche landet in der E-Mail, der Interessent bemerkt es, Ihre Glaubwürdigkeit ist hin. Fangen Sie die Erfindungen ab und Sie gewinnen. Dieses Framing ist sauber, es lässt sich gut demonstrieren, und ich denke inzwischen, dass es stillschweigend für viele verbrannte Versanddomains verantwortlich ist. Der Werner-Satz enthielt keinerlei Erfindung. Es war trotzdem eine Behauptung, die ich niemals aus dem Gebäude gelassen hätte.

Das ist ein Essay darüber, was meine Meinung geändert hat, erzählt so, wie es tatsächlich passiert ist – also langsam und mit einer peinlichen Woche in der Mitte. Wenn Sie sehen wollen, was ich am Ende gebaut habe, finden Sie es hier: veriprajna.com/de/demos/ki-vertriebsintelligenz-verifizierte-ansprache. Aber das Produkt ist der langweilige Teil. Der interessante Teil ist, warum ein wahrer Satz kein sicherer Satz ist, und warum ich aufgehört habe, dem Modell zu vertrauen, den Unterschied zu erkennen.

Die Woche, in der ich versucht habe, das Modell seine eigene Hausaufgabe bewerten zu lassen

Ich habe etwa eine Woche damit verbracht, das Sprachmodell dazu zu bringen, seine eigenen veralteten Zitate zu fangen, und ich will ehrlich sagen, dass es nicht funktioniert hat.

Das Setup war auf dem Papier vernünftig. Ein Researcher-Agent zieht Fakten. Ein Writer-Agent entwirft die E-Mail, beschränkt auf genau diese Fakten. Dann liest ein Fact-Checker-Agent den Entwurf gegen die Quellen und markiert alles, was nicht standhält. Drei Agenten, eine aufgeräumte Pipeline, die Art Architektur, die in einem Design Review ein Nicken bekommt. Ich habe wirklich erwartet, dass der Fact-Checker der leichte Teil wäre.

Es war der Teil, der kaputtging. Nicht laut. Das war das Problem. Der Fact-Checker las den Werner-Entwurf, sah einen Satz über 2.735 Lkw, fand eine Quelle, die 2.735 Lkw sagte, und genehmigte ihn selbstbewusst. Was korrekt ist, wenn die einzige Frage lautet „stützt eine Quelle diese Zahl.“ Das Modell hatte kein dauerhaftes Gespür dafür, dass die Quelle mehr als zwei Jahre alt war und der Satz „kürzlich“ sagte. Wenn ich es drängte, über Daten nachzudenken, fing es das Veralten manchmal und winkte es manchmal durch, und ich konnte nicht vorhersagen, welches von beiden. Ein Prüfer, den man nicht vorhersagen kann, ist kein Prüfer. Es ist eine Zweitmeinung.

Der Moment, in dem es wirklich landete, war spät an einem Abend, als ich denselben Entwurf dreimal durch den Fact-Checker laufen ließ und zwei Genehmigungen und eine Ablehnung bekam, ohne Änderung am Input. Ich starrte eine Weile darauf. Ich verlangte von einem probabilistischen System, das deterministische Gate für ein anderes probabilistisches System zu sein.

Ich bat ein LLM, als vertrauenswürdiger Schiedsrichter für ein LLM zu fungieren, und nannte das Ergebnis „Verifizierung.“

Das ist keine Verifizierung. Das ist, wenn zwei Modelle übereinstimmen – etwas anderes und viel Schwächeres. Wenn der ganze Grund, warum Sie einen Prüfer brauchen, ist, dass der Output des Modells nicht zum Nennwert vertrauenswürdig ist, dann kann der Output eines zweiten Modells nicht das sein, dem Sie die Prüfung anvertrauen. Ich hatte ein Spiegelkabinett gebaut und einen Compliance-Aufkleber darauf geklebt.

Was ist schlimmer, eine erfundene Tatsache oder eine wahre?

Was mich beim Bauen am meisten überraschte, war die Erkenntnis, dass die Erfindungen nie die beängstigenden Fehlschläge waren. Die wahren, aber missbrauchten Behauptungen waren es.

Denken Sie darüber nach, was tatsächlich passiert, wenn ein KI-SDR ein Firmendetail halluziniert. Oft ist es Unsinn, offensichtlich daneben, die Art Sache, die ein Interessent liest und löscht. Peinlich, klar. Aber die Behauptung, die Sie wirklich in Schwierigkeiten bringt, ist die, die überprüfbar und korrekt und trotzdem im Kontext falsch ist. Sie segelt durch jeden „ist das erfunden“-Filter genau deshalb, weil sie nicht erfunden ist. Die Grammatik ist perfekt. Die Zahl ist echt. Und sie ist eine Lüge über die Gegenwart.

Ich begann, den kontextuellen Missbrauch zu nennen, und sobald ich einen Namen dafür hatte, sah ich ihn überall in der Demo, die ich zusammenbaute. Er hat mehr als eine Form, aber jede Version teilt die Eigenschaft, die ihn gefährlich macht: jede ist eine wahre Aussage.

Die Form, aus der ich am meisten gelernt habe, ist die veraltete Quelle, und Werner ist der Ort, an dem ich sie zuerst klar gesehen habe. „Kürzlich auf 2.735 Lkw gewachsen“ zitiert einen echten 10-K, aber diese Einreichung landete am 2024-02-26, und gegenüber dem Arbeitsdatum der Demo ist sie weit über zwei Jahre alt. Die Zahl hat nicht aufgehört, wahr zu sein. Das Wort „kürzlich“ hat aufgehört, wahr zu sein. Das sind nicht dieselbe Tatsache, und eine Quellen-Matching-Prüfung behandelt sie als identisch.

Ich habe dieselbe Form ein zweites Mal mit einem synthetischen Lead gebaut, einem Mid-Market-Logistikunternehmen namens Northwind, damit ich das Muster zeigen konnte, ohne vorzutäuschen, eine echte Firma hätte etwas gesagt, das sie nicht gesagt hat. Der Entwurf behauptete, Northwind habe „kürzlich nach APAC expandiert.“ Es gibt eine echt wirkende Quelle dafür. Die Quelle ist auf März 2019 datiert, was in der Demo auf etwa 2.652 Tage hinausläuft, mehr als sieben Jahre. Die Grounding-Überlappung zwischen Behauptung und Quelle ist saubere 100%. Die Entität stimmt. Und es ist trotzdem die Art Satz, die einen Interessenten denken lässt, Sie hätten seit der letzten Fußball-Weltmeisterschaft nicht mehr hingeschaut.

Evidenzpanel für die Northwind-APAC-Behauptung: Grounding bei 100 Prozent und Entity-Match bestehen beide, zeitliche Gültigkeit scheitert bei 2.652 Tagen über dem 365-Tage-Limit, Urteil veraltete Quelle, die Behauptung durchgestrichen und gestrichen.
Dieselbe Form bei einem synthetischen Lead, sodass keine echte Firma falsch zitiert wird. Grounding 100%, Entität OK, und die zeitliche Prüfung scheitert trotzdem bei 2.652 Tagen. Eine wahre Tatsache auf einer Quelle von 2019.
Eine wahre Tatsache auf einer veralteten Quelle ist trotzdem eine Lüge über die Gegenwart. Das Datum ist Teil der Behauptung, ob der Satz es zugibt oder nicht.

Die andere Form ist die Namensgleichheits-Kollision, und ich habe sie ebenfalls als synthetischen Fall behalten. „Northwind Logistics hat gerade eine $40M Series B aufgenommen“ hat eine echte Quelle dahinter. Die Quelle handelt von Northwind Inc., einem Austin-Cybersecurity-Startup, einer völlig anderen Firma, die zufällig denselben Namen teilt. Jedes Wort ist korrekt über ein Northwind. Nichts davon ist korrekt über dieses eine.

Evidenzpanel, das zeigt, wie die $40M-Series-B-Behauptung die Entity-Match-Prüfung scheitert, weil die zitierte Quelle von Northwind Inc. handelt und nicht von Northwind Logistics, Urteil Entity-Mismatch, die Behauptung durchgestrichen und gestrichen.
Die Namensgleichheits-Kollision. Jedes Wort ist wahr über Northwind Inc., ein Austin-Cybersecurity-Startup, und nichts davon ist wahr über Northwind Logistics. Die Entity-Prüfung fängt, was ein bloßes Quellen-Matching nie fangen würde.

Beachten Sie, was alle drei Beispiele gemeinsam haben. Keines davon ist eine Halluzination. Wenn Sie Ihre gesamte Sicherheitsgeschichte um das Fangen von Erfindungen herum gebaut hätten, würden Sie alle drei ausliefern. Das ist der Fehlermodus hinter den AI-SDR-Flameouts, die jeder zitiert und niemand ganz erklärt. Die Single-Pass-Tools halluzinieren messbar einen Anteil prospekt-spezifischer Behauptungen, irgendwo im Bereich von 12 bis 18 Prozent nach einer Branchenrechnung (AI SDR Industry Report, 2026), aber die Erfindungen sind die Fehlschläge, die man sich zumindest vorstellen kann zu fangen. Die wahren-aber-veralteten, wahren-aber-falschen-Entitäts-Behauptungen sind die, die bis zum Schluss wie Erfolg aussehen – bis sie Sie etwas kosten.

Was mich dazu brachte, dem Modell nicht mehr zu vertrauen und einer Datumssubtraktion zu vertrauen

Was schließlich funktionierte, war fast beleidigend einfach, und ich habe mich länger dagegen gewehrt, als ich sollte.

Wenn das Problem mit der Werner-Behauptung ist, dass „kürzlich“ auf eine Quelle zeigt, die älter ist als ein sinnvolles Aktualitätsfenster, dann ist die Prüfung keine Reasoning-Aufgabe. Sie ist Arithmetik. Nehmen Sie das Quelldatum, nehmen Sie das Arbeitsdatum, subtrahieren Sie. Wenn die Behauptung Aktualitätssprache verwendet und die Lücke größer als 365 Tage ist, ist die Behauptung veraltet und sie wird nicht versendet. Quellalter 2652 Tage ist größer als 365 Tage bei einer Aktualitätsbehauptung, daher Fail. Es gibt kein Prompt, keine Temperature, kein „as an AI language model.“ Es gibt eine Zahl und einen Schwellenwert.

Sobald ich mir erlaubte, das zu schreiben, wollte auch der Rest der Prüfungen Code sein. Wird die Behauptung tatsächlich von einem Quellenausschnitt impliziert, gemessen als Token-Überlappung gegen die Inhaltswörter, wobei der eigene Firmenname ausgeschlossen wird, damit ein Satz nicht allein dadurch hoch punkten kann, dass er „Werner, Werner, Werner“ wiederholt? Code. Handelt die Quelle von dieser Entität und nicht von einer gleichnamigen anderen? Code. Das Sprachmodell ist weiterhin der Autor, und es ist ein wirklich guter Autor. Es ist nur nicht der Richter.

Am Ende habe ich das Prinzip auf zwei Arten formuliert, die ich jetzt ständig sage. Eine ist „Agenten beraten, Code entscheidet.“ Die andere ist „kein LLM, das ein LLM beurteilt.“ Das neuronale Netz macht, worin neuronale Netze gut sind: einen flüssigen, menschlichen Entwurf zu schreiben. Ein deterministischer Pure-Python-Verifier macht, worin Code gut ist: dieselbe Regel jedes einzelne Mal auf dieselbe Weise anzuwenden. Neuronale Autorschaft, symbolische Verifizierung. Das Branchenwort für diese Paarung ist neurosymbolisch, obwohl mir das Label weniger wichtig ist als die Eigenschaft, die es kauft.

Bessere Modelle schreiben bessere Sätze. Sie machen eine zwei Jahre alte Einreichung nicht aktuell. Das ist keine Fähigkeitslücke. Es ist ein Kategorienfehler.

Und die Eigenschaft, die es kauft, ist Reproduzierbarkeit. Wenn ich den Verifier auf denselben Input laufen lasse, bekomme ich jedes Mal dasselbe Urteil. Das klingt nach einer kleinen Engineering-Nettigkeit. Es ist tatsächlich das ganze Spiel, weil Reproduzierbarkeit das ist, was eine Entscheidung zertifizierbar macht. Ich kann Ihnen die Trace geben. Quellalter 2652 Tage, größer als 365, Aktualitätsbehauptung vorhanden, Urteil veraltet, Behauptung gestrichen. Sie können es neu ausführen und das identische Ergebnis bekommen. Ein LLM-Richter, selbst ein guter, kann Ihnen das nicht versprechen. Ich habe den Abend mit drei Läufen und zwei Urteilen erlebt. Ich baue keine Compliance-Geschichte darauf.

Signierte JSON-Audit-Quittung mit einem Download-JSON-Button, die für jede Behauptung Urteil, zitierte Tatsache und Quelle, Veröffentlichungsdatum und Aktualitätstage sowie jedes Per-Check-Ergebnis auflistet, einschließlich Quellenauflösung, Grounding, Sentence Faithfulness, Entity Match und zeitlicher Gültigkeit.
Die Quittung, die der Verifier für jede E-Mail schreibt. Jede Behauptung, ihr Urteil, die zitierte Quelle, die Daten und die exakten Prüfergebnisse, exportiert als JSON, das Sie herunterladen und neu ausführen können. Reproduzierbarkeit ist das, was sie zertifizierbar macht.

Ist das nicht nur ein Halluzinationsproblem in Verkleidung?

Ich werde in fast jedem Gespräch irgendeine Version davon gefragt, meist von jemandem Technischen, und meine Antwort ist mit der Zeit kürzer geworden. Nein. Und der Grund, warum es das nicht ist, ist der Grund, warum ich denke, dass diese Arbeit die aktuelle Modellgeneration überdauert.

Das Halluzinations-Framing nimmt stillschweigend an, dass die Lösung ein besseres Modell ist. Größerer Kontext, saubereres Training, niedrigere Erfindungsrate, und irgendwann schrumpft das Problem auf nichts. Vielleicht stimmt das für reine Erfindung. Es tut nichts für die Fehlschläge, die mich tatsächlich interessieren. Ein perfektes Modell, eines, das nie eine einzige Tatsache erfindet, wird trotzdem fröhlich „kürzlich“ über eine 2024-Einreichung schreiben, weil von innen im Entwurf dieser Satz wahr und flüssig und genau das ist, worum Sie gebeten haben. Das Modell hat keine Verpflichtung gegenüber dem Kalender. Die Lücke zwischen „auf 2.735 Lkw gewachsen“ und „kürzlich auf 2.735 Lkw gewachsen“ ist keine Lücke, die Skalierung schließt.

Hier bringt der Markt die Lektion weiterhin auf die harte Tour bei. Die AI-SDR-Kategorie hat hart auf Volumen und signalbasierte Personalisierung optimiert und den Schritt größtenteils übersprungen, bei dem man die resultierende Behauptung gegen eine aktuelle, entitätskorrekte Quelle erneut verifiziert. Die wirtschaftlichen Bedingungen waren nicht gnädig. Enterprise-AI-SDR-Churn liegt irgendwo bei 50 bis 70 Prozent im Jahr (UserGems, 2026). Die am häufigsten zitierte Warnungsgeschichte, 11x.ai, hat 74 Millionen Dollar eingesammelt und ist dann 2025 auseinandergefallen mit Churn im Bereich von 70 bis 80 Prozent (TechCrunch). Sie posten diese Zahlen nicht, weil Ihr Modell gelegentlich halluziniert hat. Sie posten sie, weil der Output personalisiert wirkte und nicht vertrauenswürdig war, und Käufer den Unterschied irgendwann spüren, auch wenn sie ihn nicht benennen können.

Also ist die These, zu der ich immer wieder zurückkomme, unverblümt. Personalisierung ist keine Verifizierung. Ihr KI-SDR hat in erster Linie kein Halluzinationsproblem. Es hat ein Verifizierungsproblem, und ein besseres Basismodell wird es nicht beheben, weil Verifizierung und Provenienz keine Modellfähigkeiten sind. Sie sind Eigenschaften des Systems, das Sie um das Modell herum wickeln.

Personalisierung ist keine Verifizierung. Verifizierung und Provenienz sind keine Modellfähigkeiten. Sie sind Eigenschaften des Systems, das Sie um das Modell herum bauen.

Was „100%“ tatsächlich bedeuten darf

Ich will hier vorsichtig sein, denn genau hier ist der Ort, an dem ein Gründer versucht ist, zu übertreiben, und das Unternehmen, das ich baue, ist nach dem gegenteiligen Instinkt benannt.

Es gibt zwei Zahlen in der Demo, und sie sind nicht dieselbe Zahl. Die erste ist der Veracity Score, der einfach unterstützte Behauptungen geteilt durch die gesamten faktischen Behauptungen im Entwurf ist. Er beantwortet „wie viel von dem, was die KI geschrieben hat, stellte sich als wahr heraus,“ und bei einem echten Entwurf liegt er oft deutlich unter 100, was das Ehrliche und Nützliche daran ist. Die Werner-E-Mail verliert ihre Headline-Behauptung. Die Northwind-E-Mail verliert zwei. Das ist das System bei der Arbeit, nicht beim Versagen.

Die zweite Zahl ist Sendungsintegrität, und sie ist per Konstruktion 100%, wann immer überhaupt etwas überlebt, weil das Policy-Gate jede nicht unterstützte Behauptung streicht, bevor die E-Mail absenden darf. Die Garantie lautet nicht „die KI hatte immer recht.“ Die Garantie lautet „die E-Mail, die rausgeht, enthält nur quellengestützte Behauptungen.“ Das sind sehr unterschiedliche Versprechen, und ich habe zugesehen, wie Leute sie zu einem viel größeren, viel falscheren zusammenwerfen.

Es gibt auch einen Benchmark, und hier ist der Satz, den ich mich weigere zu verkürzen: auf einem festen, manuell gelabelten Golden Set von 25 Fällen trifft der deterministische Verifier 25 von 25 Urteilen richtig. Das ist 100% auf diesem gelabelten Benchmark. Es ist keine Behauptung über die offene Welt, es ist kein Versprechen über Ihren Posteingang, und es ist ausdrücklich nicht „null Halluzination,“ eine Phrase, von der ich denke, dass niemand Ehrliches sie sagen sollte. Das Modell entwirft weiterhin. Entwürfe enthalten weiterhin unbewiesene Behauptungen. Der Punkt ist, dass die unbewiesenen gefangen und gestrichen werden, und das Auffangen deterministisch genug ist, um zu zertifizieren. Jeder, der Ihnen eine Null-Halluzinations-Garantie verkauft, verkauft Ihnen das, was ich eine Woche lang erfolglos zu bauen versucht habe.

Ich sage auch klar – weil der Maßstab, den ich an mich stelle, es verlangt –, dass die Connectoren der Demo simuliert sind. Der EDGAR-Pull, der News-Abruf, der CRM-Write-back, der tatsächliche Versand, alles nur Stubs. Was real ist, ist der Mechanismus: die Prüfungen, das Gate, die Audit-Spur und die Werner-10-K-Auszüge, die echte öffentliche Aufzeichnungen sind. Ich zeige Ihnen, wie die Engine entscheidet, nicht eine Produktionspipeline mit Ihren Daten darin. Wenn Sie zusehen wollen, wie sie entscheidet, ist es hier noch einmal: veriprajna.com/de/demos/ki-vertriebsintelligenz-verifizierte-ansprache.

Die Frage, mit der ich zurückbleibe

Ich habe festgestellt, dass das Letzte, was dieser Build in mir verändert hat, kleiner war als die These, und es hat am längsten gehalten.

Es gibt einen dritten Lead in der Demo, einen synthetischen FINRA-regulierten Broker-Dealer, und sein Entwurf kommt vollkommen sauber heraus. Jede Behauptung gestützt, nichts gestrichen, ein perfekter Veracity Score. Und das Policy-Gate leitet ihn trotzdem an einen Menschen, weil er reguliert und C-Suite und ein großer Deal ist, und die Regel sagt, dass ein Mensch sich diese unabhängig davon anschaut, wie sauber der Entwurf ist. Als ich zum ersten Mal zusah, wie eine makellose E-Mail zur Prüfung zurückgehalten wurde, war mein Instinkt, dass das System einen Fehler gemacht hatte. Hatte es nicht. Ich hatte nur angenommen, ohne es zu bemerken, dass Korrektheit und Sicherheit dieselbe Eigenschaft seien.

Das sind sie nicht. Eine Behauptung kann wahr und unsicher sein. Ein Entwurf kann sauber sein und trotzdem eine Person brauchen. Die ganze Aufgabe bestand am Ende darin, diese Ideen zu trennen und für beides zu bauen, statt sie in eine Zahl zusammenfallen zu lassen, die eine gute Headline macht.

Also ist die Frage, mit der ich Sie zurücklassen würde, die, die ich jetzt stelle, bevor irgendetwas KI-Geschriebenes meine Hände verlässt. Nicht „ist das wahr,“ was ich meistens beantworten kann und was meistens nicht reicht. Die schwerere: Kann ich jetzt, sofort, beweisen, welche aktuelle Quelle genau diese Behauptung stützt, und würde dieser Beweis jemanden überstehen, der wollte, dass er scheitert?

Wenn die Antwort nein ist, spielt es keine Rolle, wie gut das Modell wird. Der Satz ist nicht bereit zum Absenden.

Verwandte Forschung

Auch veröffentlicht auf

Entwickeln Sie Ihre KI mit Zuversicht.

Arbeiten Sie mit einem Team zusammen, das über umfassende Erfahrung im Aufbau der nächsten Generation von Unternehmens-KI verfügt. Wir helfen Ihnen, eine KI-Strategie zu entwerfen, zu entwickeln und einzuführen, der Sie vertrauen können.

Veriprajna Deep-Tech-Beratung ist auf die Entwicklung sicherheitskritischer KI-Systeme für die Bereiche Gesundheitswesen, Finanzen und Regulierung spezialisiert. Unsere Architekturen werden anhand etablierter Protokolle validiert und mit umfassender Compliance-Dokumentation belegt.