打造標準審核台——出版商典藏 AI 的出處溯源閘門——讓我明白可安全發表是治理屬性,不是模型屬性。
MediaArtificial IntelligenceAI Governance

我的新聞室 AI 捏造了市長從未說過的引文。在讀者看見前抓住它,才是整個產品。

Ashutosh SinghalAshutosh Singhal2026年7月2日14 min

第一次看著我自己的答覆器把話塞進市長嘴裡時,我感到那種特定的寒意——意識到自己造出了自己最害怕的東西。

我問了它一個普通的讀者問題:雷耶斯市長向開發商承諾了什麼關於河岸地塊的事? 它所讀的典藏庫是一份十三年合成運行的虛構報紙,我稱之為 《河灣紀事報》,其中並無這樣的承諾。有一篇文章甚至注明該地塊「不在議程上」。但這些都沒能阻止語言模型。它回了一句流暢、自信、帶著引號的句子:「我們致力於為開發商推進河岸地塊。」 伊蓮娜·雷耶斯市長——一個根本不存在的人——就這樣被安排去承諾她從未說過的話,而且文筆乾淨得足以掛上報頭發表。我想看它、做決定,並把失敗的部分扣住,在 veriprajna.com/zh-Hant/demos/conversational-ai-for-publishers

這篇文章談的是我起初抱持、而當下多數為新聞室打造 AI 的人仍共享的假設,以及打造這個示範如何慢慢把它拆穿。那個假設是:捏造問題會被更好的模型解決。我不再相信這一點,並不是因為我懷疑模型會持續進步。

在我開始之前,眼前就有一次真實的失敗,而且不是合成的。2025 年末,Washington Post的「Ask The Post AI」上線了一集 AI 生成的播客,捏造引文、錯歸來源,還把評論塞進報紙的社論立場。事情照常被揭開:標準編輯的 Slack 外洩(Semafor,2025 年 12 月 11 日)。尷尬背後的技術失敗很小、很具體:缺少引文驗證步驟。 我不想打造更聰明的播客主持人。我想打造那個缺失的步驟。

我試圖讓模型停止說謊的那一週

我大約花了一週試圖讓答覆器本身變得可信,而我必須誠實說:那是錯的一週。

當時的推理感覺滴水不漏。如果模型捏造引文,就收緊模型。更好的 grounding 提示、更低的 temperature、更嚴厲的指令只准使用檢索到的段落、再加一輪自我檢查——讓模型重讀自己的答案並評分每句是否有依據。這些我都做了。它在邊緣有幫助,在核心卻失敗,因為我在意的失敗不是模型粗心,而是模型自信、流暢地錯在校對台恰好信任的那種語域。 雷耶斯引文讀起來不像幻覺。它讀起來像報導。

自我檢查那一輪,是這套做法對我徹底失效的時刻。我在要求寫出捏造引文的同一個模型告訴我,那句捏造引文是否真實——而相當可觀的比例,它說是的,核對過了。當然會如此。那一刻它對典藏原文沒有獨立存取,它只有自己的自信,而自信恰恰是你不能拿來審計自己的東西。

我在要求一個機率系統為另一個機率系統的輸出背書,還把結果叫做驗證。那不是驗證。那是兩個猜測彼此同意。

而且賭注不是學術性的,因為出版商拿不到網際網路常見的逃生口。對你自己的系統從你自己的典藏庫生成的內容,沒有 Section 230 的護盾。 當你以自己的名義回答讀者問題的那一刻,你就擁有那個答案——引文也算。誹謗原告不會問你的模型有多自信。他們會問引文是否真實、典藏庫是否真的這麼說。那是兩個問題,而我一直把它們當成模型要解決的同一個問題。

這一切在商業上之所以重要,是因為無論出版商喜不喜歡,都被推著往這條路走。AI Overviews 如今出現在 48% 的 Google 搜尋中(theStacc / Search Engine Land,2026 年 3 月)。出版商搜尋流量到 2025 年 11 月同比下跌 33%,預計到 2029 年還會再跌約 43%(Reuters Institute Trends 2026)。當 AI Overview 浮現在連結上方時,Daily Mail 的桌面點閱率下跌 89%。過去讀者找到你的典藏庫所帶來的流量正在消失,因此讓讀者直接詢問你的典藏庫的壓力極為巨大。陷阱在於:你一這麼做,第一件誠實發生的事就是雷耶斯引文。

普通小工具寫不出的答案

我想先公平對待這份野心,因為新聞室想要這一切的理由是真實的,而搜尋框做不到。

問問標準審核台 那個困難的、縱貫時間線的讀者問題——從 2014 到 2025,雷耶斯市長對市中心密度條例的立場如何改變?——時間規劃器會先把這十年拆成視窗(2014-2017、2018-2021、2022-2025),在每一段檢索,再組裝成按時間排列的敘事。它從 2014 年的「我不會用高樓換掉河灣的性格」,走到 2025 年的「我還會再做一次」,每一個子句都帶著行內[S#]標記,懸停就能看到背後真實的典藏段落。這正是普通 vector-RAG 小工具無法產出的答案,因為它不是一次查找。它是跨時間的規劃式綜合,逐句落地。

標準審核台讀者面板顯示雷耶斯縱貫時間線答案已自動放行可發表,含 2014 至 2025 的按時間引用敘事,每一子句都帶行內 S 編號並對應所列典藏來源。
縱貫時間線問題已回答並放行。時間規劃器把它拆成 2014-2017、2018-2021、2022-2025;答案帶著雷耶斯從「我不會用高樓換掉河灣的性格」走到「我還會再做一次」,每一子句標記 [S1] 到 [S6] 並對應所列來源。橫幅:AUTO-CLEARED FOR PUBLICATION。這裡的一切——報紙、市長、條例——都是合成的。

那條綠色橫幅是最誘人的部分,也是我差點第二次偏離主線的地方。管線運作時非常漂亮,而漂亮的示範會讓你想信任產出它的引擎。但綠色橫幅不是產品。決定橫幅能否變綠的那件事才是產品。 縱貫時間線答案能放行,是因為每一項主張都有落地、每一句引文都經逐字核對。幾分鐘前由同一個引擎寫出的河岸答案則沒有。兩者的差別不是模型品質,而是一道閘門。

雷耶斯市長從未說過的那句話

我一再回到河岸答案,因為正是它教會我自己實際在打造什麼。

以下是閘門對它做的事,沒有任何一步是模型在給自己打分。答案被拆成原子主張。每一項主張對照特定檢索段落落地。每一段被引用的字串都逐字對照它所引用的來源文本核對。在河岸答案上,覆蓋率回來是 50%——兩項主張中一項得到支持,而那段被引用的文字、那句致力於推進地塊的句子,在任何被引用的來源中都找不到逐字相符。 一道決定性的政策閘門讀取這些事實,把整個答案路由到HELD FOR STANDARDS-DESK REVIEW。它從未展示給讀者。

標準審核台儀表板對河岸查詢的出處溯源稽核,顯示閘門決策為覆核、主張依據覆蓋率 50%、一項主張受支持、一項部分支持,以及紅色逐字引文核對標記,標示捏造片段在任何被引來源中未找到。
「雷耶斯市長向開發商承諾了什麼關於河岸地塊的事?」的出處溯源稽核。閘門決策:覆核。主張依據覆蓋率:50%。一項主張 Supported,一項 Partial。逐字引文核對以紅色標記:NOT verbatim in any source(fabricated/misquoted):「我們致力於為開發商推進河岸地塊。」草稿對讀者暫扣,並丟進覆核佇列。

橫幅用語對我的重要性,大概超過它應有的程度。它不說「低信心」或「請覆核」。它說暫扣,且不對讀者展示,而且它言出必行,因為讀者小工具根本收不到被暫扣的草稿。這就是雷耶斯捏造與Ask The Post AI 那次事件的全部差別。Post 的引擎產出一句假引文,讀者聽到了。我的引擎產出同樣假的引文,讀者卻永遠不會聽到,因為捏造與發表是兩件分開的事,而我在中間放了一道牆。

標準審核台讀者視圖顯示河岸答案暫扣待標準審核台覆核且不對讀者展示,管線階段列出逐字引文核對為 0/1 引文逐字相符,政策閘門路由至覆核。
從讀者端看同一個答案。管線從頭跑到尾(時間規劃器、典藏檢索、落地答覆器、逐字引文核對讀數 0/1 引文逐字相符、出處溯源稽核器 1/2 主張受支持、政策閘門:覆核),讀者只看到答案在發表前被暫扣。捏造引文從未到達頁面。一鍵即可匯出 JSON 稽核回執。
答覆器虛構拼湊的方式,與沒有防護的小工具完全一樣。唯一改變結果的,是一道不信任答覆器的檢查。

差不多那時,我不再試圖阻止模型虛構拼湊。它能、它做了、它還會。價值從來不在一個永不說謊的模型。價值在於在讀者看見之前抓住謊言。 這比「我們的 AI 不會幻覺」更小、更誠實的主張,也是我唯一願意站出來擔保的,因為我在同一次工作階段裡看著模型失敗,也看著閘門扣住。

為什麼發表安全不能住在模型裡

我很早就做了一個架構決定,也是我會最用力辯護的:決定什麼可以安全發表的那一部分,完全活在語言模型之外。

管線裡有三個代理,而且它們確實有用。時間規劃器、答覆器、出處溯源稽核器,可替換供應商,預設為claude-opus-4-8。它們提供建議。但逐字引文規則——每一段被引用片段與其引用來源的精確字串比對——以及讀取覆蓋率並路由答案的政策閘門,是普通的 Python。沒有提示、沒有 temperature、沒有模型自我回報。 我在打造時不斷對自己說:代理建議,程式碼決定。如果你需要檢查的理由,是模型輸出不能照字面信任,那檢查就不能是模型再說一次關於自己的話。

這就是為什麼逐字規則刻意是決定性的。「這段被精確引用的字串是否出現在它所引用的段落裡」不是判斷題。它是對來源文本的算術,每次運行回傳相同裁決。這種可重現性,才讓稽核回執有價值。一鍵即可為每個答案匯出 JSON 回執:查詢、拆解後的子問題、帶日期與 id 的檢索來源、已發表答案、每項主張的裁決與證據段落、每段引文的逐字結果、閘門決策及其理由、引擎與模型,以及 UTC 時間戳。你可以重跑並得到完全相同的回執。 再好的模型裁判也無法向你承諾這一點,而我親歷過同一輸入給出三個不同答案的版本。

我想精確區分什麼是真實的、什麼是搭景,因為誠實就是品牌。整套系統離線運行,透過決定性 stub 或無金鑰的本地 Claude bridge,所以示範可重現。有些困難部分刻意延後,我也不會假裝不是:生產環境實體解析是預先解析的 fixture,時間知識圖譜透過日期與實體標籤加上規劃器來示範,而非即時 Neo4j,CMS 同步是 Arc XP fixture,kill switch 背後是本地旗標。真實的是機制:落地、逐字核對、決定性閘門,以及回執。

「十分之十」被允許意味著什麼

我對數字給自己訂了一條規則,因為我把公司命名為 Veriprajna——真智慧——而這樣的名字本身就是對過度宣稱的持續挑戰。

所以以下正是基準說了什麼、以及它沒有說什麼。在一個標註過的 10 查詢評估集上,每個查詢都落在預期的閘門桶裡,十分之十。十個裡有六個無人介入即發表:三個乾淨地自動放行,三個在剪掉不受支持的句子後其餘放行並發表。兩個被路由到標準審核台覆核——兩個引文陷阱案例,安全閥明顯在運作。兩個是誠實的「超出覆蓋」棄權,檢索沒有任何東西超過分數下限,系統拒絕猜測,而不是虛構一個數字。十三個單元測試通過。語料庫是 2014 至 2025 年間 200 篇合成文章。

這些是建好的示範在十個真正困難、跨四個桶的埋雷案例上的數字。它們不是開放世界的準確率保證,我也不會把它們吹成那樣。 60/20/20 的切分是這個評估集的結果,不是對你典藏庫的承諾。我會直說的唯一主張是決定性的那一條,因為它是經過單元測試的不變量,而不是希望:帶有無法核實引文或不受支持主張的答案,永遠不會被自動放行。 對照沒有防護的普通 vector-RAG 基線——出版商實際會買的那種 SaaS 聊天小工具——有五個答案它會帶著捏造片段或不受支持的主張發表,而這道閘門把它們扣住了。五是小數目。五句掛在你報頭下的錯誤引文則不是。

自信的答案很便宜。可證明的答案——帶著你可以重跑並交給律師的回執——才是你真正在付錢買的整件事。

暫扣不就是機器在迴避艱難抉擇嗎?

幾乎每次對話我都會聽到某種版本的這個問題,而我的答案變得更短、更確定。

不。暫扣答案就是艱難的抉擇,誠實做出來的;發布一個自信的猜測才是逃避。誘人的替代方案是一個永遠回給每位讀者乾淨、可發表答案的小工具,因為那示範漂亮,也從不讓標準編輯的日子更難。那也正是Ask The Post AI 的架構,而且它以完全相同的方式失敗。一個無法說「我無法核實,暫扣」的系統,就是在製造它並沒有的確定性。而新聞室這種機構最清楚:願意不刊登某件事,正是標準審核台的全部工作。

標準審核台啟用 kill switch:讀者小工具暫停離線,不再回答新的讀者問題,而後端與出處溯源閘門保持運作,稽核回執匯出仍可用。
標準編輯真正能操作的治理。Kill switch 已暫停讀者小工具(離線,新讀者問題不回答),後端保持運作,出處溯源閘門讀數為「enforced」。上一份稽核回執仍一鍵可取。這是標準編輯凌晨兩點覺得不對勁時要跑的那部分。

這就是為什麼我認為這項工作會活過當前這一代模型。就算樂觀派承諾的一切都成立:更大的模型、更乾淨的訓練、更低的捏造率。一個從不捏造引文的完美模型,仍會興高采烈地把真實引文歸給錯誤的人或錯誤的年份,因為從草稿內部看,那句話讀起來為真,也正是被問的內容。「在你的報頭下可安全發表」不是你等模型長出來的能力。它是你圍繞模型所建系統的治理屬性,而且沒有 Section 230 護盾能把你發表雷耶斯引文的那天還給你。我一再落到的不安推論是:新聞室能運行的最有價值的 AI,是願意說我無法核實,暫扣給標準審核台。 若你想看它做決定、扣住捏造、匯出回執,它在這裡:veriprajna.com/zh-Hant/demos/conversational-ai-for-publishers

若你寧願看它跑,而不是讀我描述,這裡是整套端到端運行。

所以我想留給出版商的問題,是重組了我整個打造過程的那個問題。當你的典藏庫以你的名義回答讀者,而答案流暢乾淨又引用某人時,你是否有一層願意在讀者看見之前證明引文真實?因為模型永遠聽起來很篤定。回執才是唯一確定的東西。

相關研究

同步發佈於

自信打造您的 AI。

與一支在打造新世代企業級 AI 方面擁有深厚經驗的團隊攜手合作。讓我們協助您設計、建置並部署值得信賴的 AI 策略。

Veriprajna 深度科技顧問公司 專精於為醫療、金融及法規監管領域打造攸關安全的 AI 系統。我們的架構均依循既定規範進行驗證,並備有完整的合規文件。