環繞你對話引擎的溯源閘門
一旦出版機構用自己的檔案庫回答讀者,它就擁有該答案,而你的系統所生成的內容沒有 Section 230 保護。The Standards Desk 是環繞你對話引擎的那一層:它把每一句已發布的句子錨定到真實的檔案段落,逐字核對每一則引文,並把無法證明的內容轉交標準審核台而非讀者,且每個答案都有一鍵稽核憑證。
0
仍可能自動放行的無依據答案
確定性把關不變式,經單元測試驗證
6/10
在評測集上無需人工介入即已發布
3 則自動放行,外加 3 則經句子修剪後發布(本評測集的結果)
200
合成檔案文章,2014 至 2025
The Riverbend Ledger 語料庫,完全合成,13 年
這是一個可實際運行的示範。The Riverbend Ledger、Mayor Reyes 與每一篇文章皆標為合成,且沒有上線帳號。確定性政策把關機制、逐字引文規則,以及 13 項通過的測試皆為真實。
沒有驗證的量,正是刊頭把一句從未說過的話印出去的方式。
搜尋已不再把讀者送到報導本身。AI Overviews 如今出現在 48% 的 Google 搜尋中(theStacc via Search Engine Land, 2026),出版機構搜尋流量截至 2025 年 11 月年減 33%,並預期到 2029 年再降近 43%(Reuters Institute Trends 2026),而 Daily Mail 測得當 AI Overview 出現在其連結上方時,桌面點擊率下降 89%。壓力在於直接從檔案庫、以刊頭名義回答讀者。
麻煩從你生成那個答案的瞬間就開始。你自己的系統從你自己的檔案庫產出的內容,沒有 Section 230 保護:你擁有它。Washington Post 把這點具體化:其 Ask The Post AI 專案在 2025 年底推出一集 podcast,捏造引文、誤植來源,並把評論寫成該報的社論立場,這項失敗是在標準編輯的 Slack 外洩後浮現(Semafor, 2025)。技術根因是缺少引文驗證步驟。
更強的模型無法修正這個問題。草擬者不是該找的地方,因為法院並不在乎模型有多自信;它在乎的是引文是否真實、檔案是否真的這麼說。持久的答案是一個獨立的層:把每一項主張錨定於檔案、強制引文逐字相符,並誠實面對它無法支持的部分。
承載保證的部分是確定性 Python。Agent 提供建議。把關機制做決定。
讀者問題會跑過六階段管線,即時與離線皆可:時序規劃器把它分解成時間窗口,混合檢索器(BM25 加上本地嵌入)拉出候選段落,覆蓋下限在沒有任何結果通過分數門檻時棄權,作答器寫出嚴格錨定、帶行內 [S#] 引註的答案,確定性逐字引文檢查把每一段被引字串對照其引用來源比對,溯源稽核器為每一項主張評級,確定性政策把關機制發出一項判定。每一階段都在主控台亮起並串流自己的延遲,因此沒有任何黑箱。
時序規劃器、作答器與溯源稽核器是三個帶有類型化逐項主張判定的 Pydantic AI agent。它們可替換供應商(預設 claude-opus-4-8),同一條管線可在沒有金鑰的情況下,透過確定性離線 stub 或無金鑰本地 Claude 橋接從頭到尾運行,因此無論哪種方式把關機制都保持可用。
信任邊界位於 agent 之外。逐字引文規則——對照被引來源文本的精確字串比對——以及政策把關機制是純 Python。發布安全從不依賴 LLM 的自我陳述,因為買方需要可證明、可稽核的判定,而不是模型的片面之詞。
每個答案恰好解析為一項判定。兩種會發布的判定,僅在答案完全錨定時才發布;兩種不發布的判定,則誠實說明原因。
| 把關判定 | 含義 | 由誰決定 |
|---|---|---|
| AUTO-CLEARED FOR PUBLICATION | 每一項主張皆已錨定,每一則引文皆逐字相符,覆蓋高於下限 | 確定性政策把關,無需人工介入 |
| PUBLISHED AFTER PRUNING | 刪除一句無依據的句子,剩餘已錨定的答案通過把關 | 確定性,計為無需人工介入即已發布 |
| HELD FOR STANDARDS-DESK REVIEW | 捏造或非逐字的引文,或一項無依據的主張 | 確定性,對讀者封鎖並轉交佇列 |
| OUTSIDE COVERAGE | 檢索沒有任何結果超過分數下限 | 確定性,誠實棄權而非猜測 |
那一項確定性、經單元測試驗證的保證是把關不變式:帶有無法核實的引文或無依據主張的答案,絕不會被自動放行。除此之外,一鍵即可為每個答案匯出 JSON 稽核憑證,記錄查詢、分解後的子問題、檢索到的來源及其 article id、date 與 url、已發布答案、帶證據段落的逐項主張判定、逐則引文的逐字檢查、把關判定與理由、引擎與模型,以及 UTC 時間戳記。儀表板上的緊急切斷開關會暫停讀者小工具,同時後端保持運作。
以下每張圖都是運行中應用程式的截圖,由即時管線在合成 Riverbend Ledger 檔案上產生。出版機構、市長與文章皆標為合成。
當被問到 Mayor Reyes 對市中心密度條例的立場從 2014 到 2025 如何改變時,時序規劃器把問題拆到各個時間窗口,作答器組出時間順序敘事,從 2014 年的 "I will not trade Riverbend's character for towers" 到 2025 年的 "I changed my mind, and I'd do it again"。每一句都帶行內 [S#] 引註,每一則引文通過逐字檢查,覆蓋通過下限,把關讀為 AUTO-CLEARED FOR PUBLICATION。這是單一段落小工具無法產生的縱貫綜合。
Grounded To 面板不是裝飾。每一個 [S#] 都解析到它所取自的真實檔案段落,連同日期與檔案參照,因此編輯可以在發布前讀到任何一句背後的來源。例如 2019 年的引註會打開 Reyes 撤回先前立場並說出 "Our downtown has to grow up, not just out." 的實際文章。錨定讓答案可辯護,而不只是流暢。
當被問到 Mayor Reyes 向開發商承諾了河岸地塊什麼時,檔案並未記錄此類承諾(一篇文章註明該地塊 "was not on the agenda")。作答器如同普通 RAG 模型一樣臆造,捏造出這句 "We're committed to moving riverfront parcel forward for the developers." 逐字引文檢查在任何被引來源中都找不到該字串,主張錨定覆蓋落在 50%,把關扣住整個答案。讀者只看到 HELD FOR STANDARDS-DESK REVIEW, not shown to readers。這就是 Washington Post 的失敗,在發布前被阻止。
在 The Standards Desk 儀表板上,被扣住的答案逐項主張接受稽核:一項主張 Supported,一項僅 Partial,違規引文以紅色標為 NOT verbatim in any cited source(捏造或誤引)。把關判定及其 50% 覆蓋被記錄,答案連同被扣草稿與可匯出的 JSON 憑證進入審查佇列。違規片段被標示,讓編輯確切知道要修什麼,期間沒有任何內容到達讀者。
當被問到 Riverbend 的 2026 公共運輸預算時,檢索找不到任何高於分數下限的結果(最高相關性 0.12,對下限 0.1784),因此管線完全跳過作答器,把關回傳 OUTSIDE COVERAGE。讀者被明白告知,"I don't have anything in this archive that answers that," 而不是被塞一個自信的猜測。誠實棄權是把關的功能,不是模型的失敗。
一個開關會暫停讀者小工具,同時後端保持運作,因此編輯可以在突發新聞或事故期間立刻停止新的讀者答案,而不必讓檔案離線。再加上逐答案稽核憑證,這就是標準審核台真正需要的可操作治理面:暫停前端、保留證據、審查佇列。
The Standards Desk 不是另一個對話引擎。它是決定什麼可以安全地以你的刊頭發布的那一層。
| 維度 | 普通向量 RAG 小工具 | The Standards Desk 溯源閘門 |
|---|---|---|
| 捏造引文 | 以你的刊頭發布,未被攔截 | 被逐字字串比對攔截,不讓讀者看見 |
| 無依據主張 | 當成事實發布 | 被修剪,或整個答案被扣住,並量測覆蓋 |
| 跨越多年的問題 | 單一段落答案,或什麼都沒有 | 跨時間窗口規劃,按時間順序組裝並附引註 |
| 檔案中什麼都沒有 | 一個自信的猜測 | OUTSIDE COVERAGE,誠實棄權 |
| 誰決定發布 | 模型的信心 | 純 Python 中的確定性政策把關 |
| 稽核軌跡 | 無 | 每個答案一鍵 JSON 憑證 |
都不是。The Standards Desk 是溯源閘門,包覆你已經在檔案上運行的任何對話引擎。它不與 Google、Perplexity 或新聞室搜尋框競爭。它的工作是以確定性決定哪些生成答案可以安全地以你的刊頭發布、哪些要修剪一句無依據的句子、哪些要扣住交由人工審查,並且無論哪種結果都留下稽核憑證。
作答器可以、也確實會臆造。我們的引文陷阱例子顯示它捏造一則普通 RAG 小工具本來會發布的引文。The Standards Desk 攔住的是該答案到達讀者。每一則引文都對照其被引來源逐字比對,每一項主張都對照真實段落評級,因此捏造引文或無依據主張會在發布前被攔截並轉交標準審核台,而不是在更正之後。
你自己的系統從你自己的檔案庫生成的內容沒有 Section 230 保護,因此捏造引文是你的責任,不是第三方的。把關絕不自動放行帶有無法核實引文或無依據主張的答案,並匯出 JSON 稽核憑證,記錄每一項主張、其被引來源與判定,以及每一次逐字引文檢查。你要嘛發布一個你能證明的答案,要嘛從未發布它。
不會,因為可安全發布是治理屬性,不是模型屬性。誹謗原告並不在乎模型有多自信;他們在乎引文是否真實、檔案是否真的這麼說。持久的價值——把每一項主張錨定、強制引文逐字相符、誠實棄權——在任何模型品質下都成立,這正是逐字引文規則與政策把關活在 agent 之外的純 Python 中的原因。
這是證明機制的可運行示範,不是部署。The Riverbend Ledger、Mayor Reyes,以及 2014 至 2025 的全部 200 篇文章皆標為合成,沒有真實出版機構資料,也沒有上線帳號。真實的部分:確定性把關、逐字引文規則、時序規劃、檢索,以及 13 項通過的測試,全部完全如所示、完全離線運行。正式環境的實體解析、時序知識圖譜與 CMS 同步被 stub 為 fixture,並如此標名。
一鍵為每個答案匯出 JSON 憑證:查詢、分解後的子問題、檢索到的來源及其 article id、date 與 url、已發布答案、逐項主張的主張/被引來源/判定/證據段落紀錄、逐則引文的引文/逐字相符/來源紀錄、把關判定與理由、引擎與模型,以及 UTC 時間戳記。人工場次稽核可能要一小時才能重建的內容,匯出只需數秒。
溯源閘門才是硬的部分。我們打造它。
如果你的新聞室正在摸索如何從檔案回答讀者、卻不發布一句從未說過的話,我們會真心想聽你怎麼想。問題是全產業的,答案也會是。