环绕你对话引擎的溯源门禁

一处伪造引文在读者看到之前即被捕获并拦截。

当出版商用自家档案回答读者时,它就拥有该回答,系统生成的内容不受 Section 230 庇护。The Standards Desk 是环绕你对话引擎的那一层:它将每一句已发表的句子落地到真实档案段落,逐字核验每一处引文,并把无法证明的内容路由到标准部而非读者,并为每个回答提供一键审计回执。

0

可自动放行的无依据回答

确定性门禁不变量,已单元测试

6/10

在评测集上无需人工介入即可发表

3 条自动放行加 3 条经句子修剪(本评测集的结果)

200

合成档案文章,2014 至 2025

Riverbend Ledger 语料库,完全合成,13 年

这是一份可运行的演示。Riverbend Ledger、Mayor Reyes 及每篇文章均标注为合成,且没有真实账户。确定性策略门禁、逐字引文规则以及 13 项通过的测试均为真实。

出版商正被推向直接回答读者,并要对每一个回答负责

没有核验的规模化,正是刊头发出从未说过的引文的方式。

搜索已不再把读者送到稿件。AI Overviews 现已出现在 48% 的 Google 搜索中(theStacc via Search Engine Land,2026),出版商搜索流量到 2025 年 11 月同比下降 33%,并预计到 2029 年再降近 43%(Reuters Institute Trends 2026),Daily Mail 测得当 AI Overview 出现在其链接上方时,桌面端点击率下降 89%。压力在于在刊头之下、从档案中直接回答读者。

麻烦从你生成该回答的那一刻就开始。你自己的系统从你自己的档案产出的内容没有 Section 230 庇护:你拥有它。Washington Post 把这一点落到实处:其 Ask The Post AI 项目在 2025 年底发布的播客捏造引文、错误归属来源,并把评论当作该报的社论立场,这一失败在标准编辑的 Slack 泄露后曝光(Semafor,2025)。技术根因是缺少引文核验步骤。

更强的模型修不了这个问题。起草器不是该找的地方,因为法院并不在乎模型有多自信;它在乎引文是否真实、档案是否真的那样说。耐久的答案是独立的一层:将每一项主张落地到档案,强制引文逐字对应,并对无法支撑的内容保持诚实。

The Standards Desk 如何运作

承载保证的部分是确定性 Python。智能体提供建议。门禁作出决定。

读者问题运行一条六阶段流水线,实时与离线皆可:时序规划器将其分解为时间窗口,混合检索器(BM25 加本地嵌入)拉取候选段落,覆盖下限在无一超过分数阈值时弃权,作答器写出带行内 [S#] 引注、严格落地的回答,确定性逐字引文核查将每一处引号内字符串对照其引用的来源匹配,溯源审计器为每项主张评级,确定性策略门禁签发一项裁定。每一阶段都在控制台中亮起并流式输出自身延迟,因此没有任何黑箱。

Riverbend Ledger 读者控件配有六阶段流水线控制台:时序规划器分解为 3 个时间窗口,档案检索 10 个段落,落地作答器起草 6 项主张,逐字引文核查读出 5 of 5 处引文逐字对应,溯源审计器 6 of 6 项主张获支持,策略门禁读出 Auto clear,最终出现 AUTO-CLEARED FOR PUBLICATION 横幅。
六阶段流水线按每个问题运行:规划、检索、落地、逐字引文核查、溯源审计、策略门禁。智能体提供建议,代码作出决定。

两套引擎,刻意拆分

三个提供建议的智能体

时序规划器、作答器和溯源审计器是三个带类型化逐项主张裁定的 Pydantic AI 智能体。它们可切换供应商(默认 claude-opus-4-8),同一流水线也可通过确定性离线桩或无密钥本地 Claude 桥接、无需密钥端到端运行,因此无论哪种方式门禁都保持可用。

作出决定的代码

信任边界位于智能体之外。逐字引文规则——对照所引来源文本的精确字符串匹配——以及策略门禁是纯 Python。发表安全从不依赖 LLM 的自我报告,因为买家需要可证明、可审计的裁定,而不是模型的一面之词。

每个回答对应四种门禁裁定之一

每个回答恰好落成一种裁定。两种允许发表的裁定仅在回答完全落地时才会发表;两种不允许发表的裁定会诚实说明原因。

门禁裁定 含义 裁定方
AUTO-CLEARED FOR PUBLICATION 每项主张均已落地,每处引文均逐字对应,覆盖高于下限 确定性策略门禁,无需人工介入
PUBLISHED AFTER PRUNING 删除一句无依据的句子后,剩余已落地的回答通过 确定性,计为无需人工介入即可发表
HELD FOR STANDARDS-DESK REVIEW 伪造或非逐字的引文,或一项无依据的主张 确定性,对读者拦截并路由到队列
OUTSIDE COVERAGE 检索无一超过分数下限 确定性,诚实弃权而非猜测

门禁不变量与审计回执

那一项确定性、已经单元测试的保证就是门禁不变量:带有无法核验的引文或无依据主张的回答,绝不会被自动放行。在此之上,一键为每个回答导出 JSON 审计回执,记录查询、分解后的子问题、带 article id、日期和 url 的检索来源、已发表的回答、带证据段落的逐项主张裁定、逐处引文的逐字核查、门禁裁定及原因、引擎与模型,以及 UTC 时间戳。仪表盘上的紧急开关可暂停读者控件,同时后端保持在线。

三个读者问题,三种诚实结果

下方每张图都是正在运行的应用的截图,由实时流水线在合成的 Riverbend Ledger 档案上产出。出版商、市长及文章均标注为合成。

一个向量 RAG 控件无法回答的 13 年跨度问题,获准发表

当被问及 Mayor Reyes 对市中心密度条例的立场从 2014 到 2025 如何变化时,时序规划器将问题按时间窗口拆分,作答器组装成按时间顺序的叙述,从 2014 年的 "I will not trade Riverbend's character for towers" 到 2025 年的 "I changed my mind, and I'd do it again"。每一句都带行内 [S#] 引注,每处引文都通过逐字核查,覆盖超过下限,门禁读出 AUTO-CLEARED FOR PUBLICATION。这正是单段落控件无法产出的纵向综合。

读者控件展示一份按时间顺序、全部注明出处的回答,追溯 Mayor Reyes 从 2014 到 2025 的立场变化,每一句带行内 S 编号引注和一个按日期列出的 Grounded To 来源面板,上方为绿色 AUTO-CLEARED FOR PUBLICATION 横幅。
一份跨越 13 年、按时间顺序且全部注明出处的综合回答,因每项主张均已落地、每处引文均逐字对应而自动放行。

每一句都可追溯到带日期的档案段落

Grounded To 面板不是装饰。每个 [S#] 都解析到它所取自的真实档案段落,附带日期和档案引用,因此编辑可以在发表前阅读任何一句背后的来源。例如,2019 年的引注会打开 Reyes 扭转先前立场并说 "Our downtown has to grow up, not just out." 的实际文章。落地使回答可辩护,而不仅仅是流畅。

读者控件的 Grounded To 与 Sources 面板,引注 S1 展开后显示 Mayor Reyes 支持她曾反对的市中心密度措施的完整档案段落,日期为 2019-06-24,并带档案引用。
每一处引注都打开其真实、带日期的档案段落。每一项已发表的主张都已落地,而不仅仅是看似合理。

引文陷阱:一处伪造引文被捕获并对读者拦截

当被问及 Mayor Reyes 就河滨地块向开发商承诺了什么时,档案中并无此类承诺(一篇文章注明该地块 "was not on the agenda")。作答器像普通 RAG 模型一样编造,发明了 "We're committed to moving riverfront parcel forward for the developers." 这句话。逐字引文核查在任何所引来源中都找不到该字符串,主张落地覆盖率为 50%,门禁拦截整个回答。读者只看到 HELD FOR STANDARDS-DESK REVIEW,不对读者展示。这就是 Washington Post 的失败,在发表前被阻止。

河滨地块问题的读者控件,策略门禁读出 Review,红色横幅为 HELD FOR STANDARDS-DESK REVIEW,不对读者展示,起草的回答被扣留,并有 Export Audit Receipt JSON 按钮。
一处伪造引文将门禁推向 Review,该回答被对读者拦截,而不是先发表再事后更正。

标准部看到的内容:逐项主张溯源与被标红的引文

在 The Standards Desk 仪表盘上,被拦截的回答按主张逐项审计:一项主张为 Supported,一项仅为 Partial,问题引文以红色标为 NOT verbatim in any cited source(伪造或误引)。门禁裁定及其 50% 覆盖率被记录,该回答连同被扣留的草稿和可导出的 JSON 回执进入复核队列。问题片段被高亮,以便编辑确切知道要修什么,而在此期间没有任何内容到达读者。

The Standards Desk 仪表盘对河滨地块回答的溯源审计:门禁裁定为 review,主张落地覆盖率 50%,逐项主张溯源标记为 Supported 和 Partial,逐字引文核查以红色标出一处 NOT verbatim in any source 的引文,复核队列中有被扣留的草稿和 Receipt JSON 链接。
仪表盘显示该回答被拦截的原因:逐项主张裁定、红色的逐字引文核查,以及带可导出回执的复核队列。

当档案没有答案时,它弃权而非猜测

当被问及 Riverbend 的 2026 年公共交通预算时,检索无一超过分数下限(最高相关度为 0.12,下限为 0.1784),因此流水线完全跳过作答器,门禁返回 OUTSIDE COVERAGE。读者被直白告知 "I don't have anything in this archive that answers that",而不是拿到一个自信的猜测。诚实弃权是门禁的功能,不是模型的失败。

2026 年公交预算问题的读者控件,流水线控制台显示落地作答器、逐字引文核查和溯源审计器全部跳过,策略门禁读出 Outside coverage,相关度 0.12 低于下限 0.1784,并向读者显示 OUTSIDE COVERAGE, not guessing 的信息。
无一超过分数下限,因此跳过作答器,读者得到诚实弃权而非虚张声势。

标准部可操作的治理:紧急开关

一个开关可暂停读者控件,同时后端保持在线,因此编辑可以在突发新闻或事故期间立即停止新的读者回答,而无需让档案下线。再配合每个回答的审计回执,这才是标准部真正需要的可操作治理面:暂停前端,保留证据,复核队列。

完整应用,带 Veriprajna Building True Intelligence 页眉,Reader widget paused 复选框已启用,琥珀色提示读作 Paused by the standards desk, the reader widget is offline, new reader questions are not being answered,同时流水线和审计回执仍然可见。
紧急开关立即暂停读者回答,同时后端与审计轨迹保持在线。

普通 RAG 控件对比 The Standards Desk

The Standards Desk 不是又一个对话引擎。它是决定什么可以安全地在你的刊头下发表的那一层。

维度 普通向量 RAG 控件 The Standards Desk 溯源门禁
伪造引文 在你的刊头下发出,未被捕获 由逐字字符串匹配捕获,对读者拦截
无依据主张 作为事实发表 修剪,或整个回答被拦截,并测量覆盖率
跨越多年的问题 单段落回答或什么都没有 按时间窗口规划,按时间顺序组装并附引注
档案中没有 自信的猜测 OUTSIDE COVERAGE,诚实弃权
谁决定发表 模型的置信度 纯 Python 中的确定性策略门禁
审计轨迹 每个回答一键 JSON 回执

本演示不做的事

  • ✓ 它不是聊天机器人、搜索引擎,也不是 Google、Perplexity、FT 或 Bloomberg 的竞争对手。它是环绕出版商自有对话引擎的溯源门禁。
  • ✓ 它不声称完美综合,也不声称从不幻觉。作答器可以编造,引文陷阱展示的正是这一点。价值在于门禁在读者看到之前就捕获它。
  • ✓ 评测数字(10 of 10 桶,6 of 10 已发表,200 篇文章,13 项测试)是本构建演示在标注的 10 问集合上的范围,不是开放世界保证。只有门禁不变量——无依据的回答不会自动放行——是确定性、已经单元测试的保证。60 / 20 / 20 分割是本评测集的结果,不是普遍结果。
  • ✓ Riverbend Ledger、Mayor Reyes、该条例及每篇文章均标注为合成。没有真实出版商数据,也没有真实账户,语料库引文是逐字核查的事实来源。
  • ✓ 有些部分被桩接并如此标明:生产级实体解析是预解析夹具,时序知识图谱用日期与实体标签加规划器演示,CMS 同步是 Arc XP 夹具,紧急开关支撑的是本地标志。延后:OCR 与缩微胶片摄取、对实时档案的完整 GraphRAG、许可与收入仪表盘、Intelligence 层定价、语音回答,以及站点嵌入加固。
  • ✓ 它不带客户、推荐、ROI 或节省金额数字。这些尚不存在。这证明的是机制;它不是一次部署。

出版商真正会问的问题

这是聊天机器人,还是我们档案的搜索引擎?

都不是。The Standards Desk 是一层溯源门禁,包裹你已在档案上运行的任何对话引擎。它不与 Google、Perplexity 或新闻编辑室搜索框竞争。它的工作是确定性地决定:哪些生成的回答可以安全地在你的刊头下发表,哪些要修剪一句无依据的句子,哪些留给人工处理,并无论哪种情况都留下审计回执。

模型仍然会编造。这究竟拦住了什么?

作答器能够并且确实会编造。我们的引文陷阱示例展示它发明了一处普通 RAG 控件本会发表的引文。The Standards Desk 拦住的是该回答到达读者。每处引文都对照其所引来源逐字匹配,每项主张都对照真实段落评级,因此伪造引文或无依据主张会在发表前而非更正后被捕获并路由到标准部。

我们刊头下 AI 发表的任何内容都由我们负责。这如何降低该风险?

你自己的系统从你自己的档案生成的内容没有 Section 230 庇护,因此伪造引文是你的责任,不是第三方的。门禁绝不会自动放行带有无法核验的引文或无依据主张的回答,并导出 JSON 审计回执,记录每项主张、其所引来源与裁定,以及每一处逐字引文核查。你要么发表可以证明的回答,要么从未发表过它。

更好的模型会不会让这一层变得多余?

不会,因为可安全发表是治理属性,不是模型属性。诽谤原告并不在乎模型有多自信;他们在乎引文是否真实、档案是否真的那样说。耐久的价值——将每项主张落地、强制引文逐字对应、诚实弃权——在任何模型质量下都成立,这正是逐字引文规则和策略门禁放在智能体之外的纯 Python 中的原因。

这是在真实报纸档案上运行,还是一份演示?

这是一份可运行的演示,用来证明机制,而不是一次部署。Riverbend Ledger、Mayor Reyes 以及 2014 至 2025 年的全部 200 篇文章均标注为合成,没有真实出版商数据,也没有真实账户。真实的是:确定性门禁、逐字引文规则、时序规划、检索,以及 13 项通过的测试均完全离线、按所示运行。生产级实体解析、时序知识图谱和 CMS 同步被桩接为夹具并如此标明。

审计回执里实际有什么,我们能多快取出一份?

一键为每个回答导出 JSON 回执:查询、分解后的子问题、带 article id、日期和 url 的检索来源、已发表的回答、每项主张的主张/所引来源/裁定/证据段落记录、每处引文的引文/逐字匹配/来源记录、门禁裁定及原因、引擎与模型,以及 UTC 时间戳。人工会话审计可能要花一小时重建的内容,导出只需数秒。

技术研究

本演示背后的研究——架构、核验设计,以及企业蓝图。

正用 AI 把档案放到读者面前?

溯源门禁才是难点。我们来构建它。

如果你的新闻编辑室正在摸索如何从档案回答读者、又不发表从未说过的引文,我们真心想听听你们怎么想。这个问题是全行业的,答案也会是。

溯源评估

  • ✓ 标出你的对话式 AI 可能发表无法核验引文的位置
  • ✓ 为你的档案定义落地、逐字引文与覆盖规则
  • ✓ 设计标准部复核路由与弃权阈值
  • ✓ 规定编辑与法务团队所需的审计回执

构建这一层

  • ✓ 纯 Python 中的确定性策略门禁与逐字引文规则
  • ✓ 带逐项主张溯源的落地纵向回答
  • ✓ 诚实弃权与标准部复核队列
  • ✓ 模型可切换,每个回答附 JSON 审计回执
社交媒体

同步发布于