环绕你对话引擎的溯源门禁
当出版商用自家档案回答读者时,它就拥有该回答,系统生成的内容不受 Section 230 庇护。The Standards Desk 是环绕你对话引擎的那一层:它将每一句已发表的句子落地到真实档案段落,逐字核验每一处引文,并把无法证明的内容路由到标准部而非读者,并为每个回答提供一键审计回执。
0
可自动放行的无依据回答
确定性门禁不变量,已单元测试
6/10
在评测集上无需人工介入即可发表
3 条自动放行加 3 条经句子修剪(本评测集的结果)
200
合成档案文章,2014 至 2025
Riverbend Ledger 语料库,完全合成,13 年
这是一份可运行的演示。Riverbend Ledger、Mayor Reyes 及每篇文章均标注为合成,且没有真实账户。确定性策略门禁、逐字引文规则以及 13 项通过的测试均为真实。
没有核验的规模化,正是刊头发出从未说过的引文的方式。
搜索已不再把读者送到稿件。AI Overviews 现已出现在 48% 的 Google 搜索中(theStacc via Search Engine Land,2026),出版商搜索流量到 2025 年 11 月同比下降 33%,并预计到 2029 年再降近 43%(Reuters Institute Trends 2026),Daily Mail 测得当 AI Overview 出现在其链接上方时,桌面端点击率下降 89%。压力在于在刊头之下、从档案中直接回答读者。
麻烦从你生成该回答的那一刻就开始。你自己的系统从你自己的档案产出的内容没有 Section 230 庇护:你拥有它。Washington Post 把这一点落到实处:其 Ask The Post AI 项目在 2025 年底发布的播客捏造引文、错误归属来源,并把评论当作该报的社论立场,这一失败在标准编辑的 Slack 泄露后曝光(Semafor,2025)。技术根因是缺少引文核验步骤。
更强的模型修不了这个问题。起草器不是该找的地方,因为法院并不在乎模型有多自信;它在乎引文是否真实、档案是否真的那样说。耐久的答案是独立的一层:将每一项主张落地到档案,强制引文逐字对应,并对无法支撑的内容保持诚实。
承载保证的部分是确定性 Python。智能体提供建议。门禁作出决定。
读者问题运行一条六阶段流水线,实时与离线皆可:时序规划器将其分解为时间窗口,混合检索器(BM25 加本地嵌入)拉取候选段落,覆盖下限在无一超过分数阈值时弃权,作答器写出带行内 [S#] 引注、严格落地的回答,确定性逐字引文核查将每一处引号内字符串对照其引用的来源匹配,溯源审计器为每项主张评级,确定性策略门禁签发一项裁定。每一阶段都在控制台中亮起并流式输出自身延迟,因此没有任何黑箱。
时序规划器、作答器和溯源审计器是三个带类型化逐项主张裁定的 Pydantic AI 智能体。它们可切换供应商(默认 claude-opus-4-8),同一流水线也可通过确定性离线桩或无密钥本地 Claude 桥接、无需密钥端到端运行,因此无论哪种方式门禁都保持可用。
信任边界位于智能体之外。逐字引文规则——对照所引来源文本的精确字符串匹配——以及策略门禁是纯 Python。发表安全从不依赖 LLM 的自我报告,因为买家需要可证明、可审计的裁定,而不是模型的一面之词。
每个回答恰好落成一种裁定。两种允许发表的裁定仅在回答完全落地时才会发表;两种不允许发表的裁定会诚实说明原因。
| 门禁裁定 | 含义 | 裁定方 |
|---|---|---|
| AUTO-CLEARED FOR PUBLICATION | 每项主张均已落地,每处引文均逐字对应,覆盖高于下限 | 确定性策略门禁,无需人工介入 |
| PUBLISHED AFTER PRUNING | 删除一句无依据的句子后,剩余已落地的回答通过 | 确定性,计为无需人工介入即可发表 |
| HELD FOR STANDARDS-DESK REVIEW | 伪造或非逐字的引文,或一项无依据的主张 | 确定性,对读者拦截并路由到队列 |
| OUTSIDE COVERAGE | 检索无一超过分数下限 | 确定性,诚实弃权而非猜测 |
那一项确定性、已经单元测试的保证就是门禁不变量:带有无法核验的引文或无依据主张的回答,绝不会被自动放行。在此之上,一键为每个回答导出 JSON 审计回执,记录查询、分解后的子问题、带 article id、日期和 url 的检索来源、已发表的回答、带证据段落的逐项主张裁定、逐处引文的逐字核查、门禁裁定及原因、引擎与模型,以及 UTC 时间戳。仪表盘上的紧急开关可暂停读者控件,同时后端保持在线。
下方每张图都是正在运行的应用的截图,由实时流水线在合成的 Riverbend Ledger 档案上产出。出版商、市长及文章均标注为合成。
当被问及 Mayor Reyes 对市中心密度条例的立场从 2014 到 2025 如何变化时,时序规划器将问题按时间窗口拆分,作答器组装成按时间顺序的叙述,从 2014 年的 "I will not trade Riverbend's character for towers" 到 2025 年的 "I changed my mind, and I'd do it again"。每一句都带行内 [S#] 引注,每处引文都通过逐字核查,覆盖超过下限,门禁读出 AUTO-CLEARED FOR PUBLICATION。这正是单段落控件无法产出的纵向综合。
Grounded To 面板不是装饰。每个 [S#] 都解析到它所取自的真实档案段落,附带日期和档案引用,因此编辑可以在发表前阅读任何一句背后的来源。例如,2019 年的引注会打开 Reyes 扭转先前立场并说 "Our downtown has to grow up, not just out." 的实际文章。落地使回答可辩护,而不仅仅是流畅。
当被问及 Mayor Reyes 就河滨地块向开发商承诺了什么时,档案中并无此类承诺(一篇文章注明该地块 "was not on the agenda")。作答器像普通 RAG 模型一样编造,发明了 "We're committed to moving riverfront parcel forward for the developers." 这句话。逐字引文核查在任何所引来源中都找不到该字符串,主张落地覆盖率为 50%,门禁拦截整个回答。读者只看到 HELD FOR STANDARDS-DESK REVIEW,不对读者展示。这就是 Washington Post 的失败,在发表前被阻止。
在 The Standards Desk 仪表盘上,被拦截的回答按主张逐项审计:一项主张为 Supported,一项仅为 Partial,问题引文以红色标为 NOT verbatim in any cited source(伪造或误引)。门禁裁定及其 50% 覆盖率被记录,该回答连同被扣留的草稿和可导出的 JSON 回执进入复核队列。问题片段被高亮,以便编辑确切知道要修什么,而在此期间没有任何内容到达读者。
当被问及 Riverbend 的 2026 年公共交通预算时,检索无一超过分数下限(最高相关度为 0.12,下限为 0.1784),因此流水线完全跳过作答器,门禁返回 OUTSIDE COVERAGE。读者被直白告知 "I don't have anything in this archive that answers that",而不是拿到一个自信的猜测。诚实弃权是门禁的功能,不是模型的失败。
一个开关可暂停读者控件,同时后端保持在线,因此编辑可以在突发新闻或事故期间立即停止新的读者回答,而无需让档案下线。再配合每个回答的审计回执,这才是标准部真正需要的可操作治理面:暂停前端,保留证据,复核队列。
The Standards Desk 不是又一个对话引擎。它是决定什么可以安全地在你的刊头下发表的那一层。
| 维度 | 普通向量 RAG 控件 | The Standards Desk 溯源门禁 |
|---|---|---|
| 伪造引文 | 在你的刊头下发出,未被捕获 | 由逐字字符串匹配捕获,对读者拦截 |
| 无依据主张 | 作为事实发表 | 修剪,或整个回答被拦截,并测量覆盖率 |
| 跨越多年的问题 | 单段落回答或什么都没有 | 按时间窗口规划,按时间顺序组装并附引注 |
| 档案中没有 | 自信的猜测 | OUTSIDE COVERAGE,诚实弃权 |
| 谁决定发表 | 模型的置信度 | 纯 Python 中的确定性策略门禁 |
| 审计轨迹 | 无 | 每个回答一键 JSON 回执 |
都不是。The Standards Desk 是一层溯源门禁,包裹你已在档案上运行的任何对话引擎。它不与 Google、Perplexity 或新闻编辑室搜索框竞争。它的工作是确定性地决定:哪些生成的回答可以安全地在你的刊头下发表,哪些要修剪一句无依据的句子,哪些留给人工处理,并无论哪种情况都留下审计回执。
作答器能够并且确实会编造。我们的引文陷阱示例展示它发明了一处普通 RAG 控件本会发表的引文。The Standards Desk 拦住的是该回答到达读者。每处引文都对照其所引来源逐字匹配,每项主张都对照真实段落评级,因此伪造引文或无依据主张会在发表前而非更正后被捕获并路由到标准部。
你自己的系统从你自己的档案生成的内容没有 Section 230 庇护,因此伪造引文是你的责任,不是第三方的。门禁绝不会自动放行带有无法核验的引文或无依据主张的回答,并导出 JSON 审计回执,记录每项主张、其所引来源与裁定,以及每一处逐字引文核查。你要么发表可以证明的回答,要么从未发表过它。
不会,因为可安全发表是治理属性,不是模型属性。诽谤原告并不在乎模型有多自信;他们在乎引文是否真实、档案是否真的那样说。耐久的价值——将每项主张落地、强制引文逐字对应、诚实弃权——在任何模型质量下都成立,这正是逐字引文规则和策略门禁放在智能体之外的纯 Python 中的原因。
这是一份可运行的演示,用来证明机制,而不是一次部署。Riverbend Ledger、Mayor Reyes 以及 2014 至 2025 年的全部 200 篇文章均标注为合成,没有真实出版商数据,也没有真实账户。真实的是:确定性门禁、逐字引文规则、时序规划、检索,以及 13 项通过的测试均完全离线、按所示运行。生产级实体解析、时序知识图谱和 CMS 同步被桩接为夹具并如此标明。
一键为每个回答导出 JSON 回执:查询、分解后的子问题、带 article id、日期和 url 的检索来源、已发表的回答、每项主张的主张/所引来源/裁定/证据段落记录、每处引文的引文/逐字匹配/来源记录、门禁裁定及原因、引擎与模型,以及 UTC 时间戳。人工会话审计可能要花一小时重建的内容,导出只需数秒。
溯源门禁才是难点。我们来构建它。
如果你的新闻编辑室正在摸索如何从档案回答读者、又不发表从未说过的引文,我们真心想听听你们怎么想。这个问题是全行业的,答案也会是。