一整面牆數十年來的報紙頭版,匯入一個以引用連結作答的聊天面板。
Artificial IntelligenceMediaTechnology

你的新聞檔案庫才是資產。別再讓 Google 免費租走它。

Ashutosh SinghalAshutosh Singhal2026年5月9日14 min

去年冬天,我曾與一家區域性日報坐下來討論,它擁有四百萬名月讀者與長達三十二年的檔案庫,而二月的董事會資料,是在場所有人十年來讀過最糟的一份文件。自然搜尋帶來的引流量年減 41%。程式化廣告費率又下滑 18%。2023 年默默維持營運的聯盟行銷收入,已崩跌至高峰時的三分之一。財務長把那張投影片放上來,看著我,問了唯一重要的問題:Google 到底欠我們什麼,我們又該怎麼讓它付出代價?

我不得不對她說實話:Google 在合約上什麼都不欠他們。那筆構築起整個網路的不成文交易——你讓我們抓取你的內容,我們為你帶來流量——在 AI Overviews 開始出現於全部 Google 搜尋的 48%(截至 2026 年 3 月,theStacc / Search Engine Land)那一刻起便被改寫了。當 AI 摘要位於自然連結上方時,讀者鮮少往下捲動;《每日郵報》(Daily Mail)在那些查詢上的桌面點擊率下跌了 89%,從 25.23% 降到 2.79%。內容依然有人在讀,只是出版商不再因此獲得報酬。我深信,重返之路,就是建立在出版商自身檔案庫之上的對話式 AI。

那次對話,正是我在 Veriprajna 的團隊如今著手打造服務出版商的對話式 AI——在出版商自有新聞檔案庫上運行的檢索增強生成引擎,並輔以引用強制機制與授權策略,讓它們得以安心地掛在報頭之下。檢索增強生成,或稱 RAG,指的就是 AI 只依據你的文件作答,而非依據它從開放網際網路上吸收到的任何內容。事實證明,這個區別就是整場賽局的關鍵。但我想帶你走一遍我們是如何走到這一步的,因為我們第一版做得很糟,而我們搞砸的方式,正是大多數出版商即將犯錯的方式。

引流經濟已經終結,授權經濟卻尚未成形。

先從失血有多嚴重講起,因為規模本身就是論據。Google 搜尋為出版商帶來的流量大約下降了全球 33%,時間為截至 2025 年 11 月的一年,而路透新聞研究所(Reuters Institute)調查的新聞業高層預期還會進一步在未來三年下滑 43%——其中五分之一的人預備面對超過 75% 的損失(Reuters Institute Journalism Trends 2026)。個別案例的情況更糟,其中一件更演變成訴訟:聯盟行銷收入較高峰下跌超過三分之一的 Penske Media,於 2025 年 9 月控告 Google——這是首宗指控該公司強迫出版商參與 AI 訓練的重大反壟斷案。

那個曾建立起你發行通路的搜尋引擎,如今成了你最大的競爭對手,而它倒戈時根本沒徵求你的同意。

因此,每一間董事會裡的直覺反應都如出一轍:如果 Google 不再為我們送來讀者,我們就自己打造 AI,把讀者留在自家網站上。直覺沒錯。真正讓人受傷的,是執行。

我們先做了那個顯而易見的版本,結果它對一位市議員產生了幻覺。

我要老實說說我們自己的傷疤,因為那是我親身換來的。我們架起的第一套引擎,就是每家 SaaS 廠商都會向你報價 6 萬至 12 萬美元、並在幾週內部署的那種版本:把檔案庫拿來,將每篇文章切成片段,把片段轉成向量嵌入,再讓聊天機器人檢索最相近的匹配結果。它展示起來漂亮極了。你問它一則近期報導,它拉出正確的文章,聽起來很棒。

接著,在一次試點測試中,一位編輯問了它任何讀者都會問的那種問題:這位市議員與市中心開發案背後的開發商之間有什麼淵源?這是一個多跳(multi-hop)問題——它意味著要把同一個人跨越十幾篇、橫跨多年的文章串連起來,而他在其中的出現方式五花八門:有時是帶頭銜的全名,有時只有姓氏,還有一次在一張舊照片說明裡,僅被稱為「該選區代表」,那還是在他根本尚未取得席位之前。向量搜尋檢索出幾個文字上相似的片段,把它們縫合成一段流暢的文字,並斷言了一段檔案庫實際上並不支持的關係。它憑空捏造了連結的脈絡。

我看著那位編輯發現時的表情。那種神情——一名記者意識到機器剛剛以她報紙的名義捏造了一項事實——正是我如今所打造的一切都要竭力防止的東西。我們交付出去的,是一個充滿自信的騙子。

那次失敗,正是我不再相信聊天小工具算得上是一項產品的全部原因。它根本不知道那些散落各處的名字其實是同一個人。它沒有任何關於時間的模型——不知道那個人在贏得那個席位之前,已當了多年的普通市民。而且它也沒有任何機制,去檢查它剛剛生成的句子是否真的有來源作為依據。在那些無關緊要的查詢上,它表現得還行。但在讀者真正在乎的查詢上——那些縱貫時間的、關於人與金錢隨時間演變的查詢——它偏偏在最需要撐住的地方崩潰。

為什麼 RAG 沒有直接解決這個問題?

因為「RAG」描述的是一個類別,而非一種能力,而其中最困難的 60% 工作,正是沒有人在兜售的那部分。

我嚴重低估的第一件事,是資料匯入。我一開始以為一份三十年的檔案庫,是一套乾淨、等著被嵌入的語料。事實並非如此。它是歷經三次 CMS 遷移、混亂糾結的二十年 HTML、指向虛無的失效內部連結,以及一層只以掃描微縮膠卷形式存在的 2005 年以前的內容。當我們對那些掃描檔跑一般的 OCR 時,標題、正文欄位與照片說明全都糊成一團毫無意義的方塊,因為 OCR 看不出版面配置。我們不得不引進具版面感知能力的光學字元辨識——那種能偵測欄位、把標題、說明與內文區分開來的技術——使用像 Amazon Textract 與 Azure Document Intelligence 這樣的工具。這正是決定整件事能否運作、卻毫不光鮮的工作,也是每家聊天機器人廠商在報價單上都略去的那一項。

第二件事,就是那個市議員問題,它有個名字:實體解析(entity resolution)。要讓 AI 能夠針對一個人進行推理,該人物的每一次提及——每一種署名變體、每一個尊稱、每一次間接指涉——都必須收斂到單一節點。我們用認真的業者所採取的方式解決它,也就是知識圖譜:把微軟開源的 GraphRAG 疊在 Neo4j 之上,並以圖資料科學函式庫進行消歧,讓「Musk 先生」、「Elon Musk」與「那位 Tesla 執行長」成為同一個實體,而非三個。這個領域曾有一套實作達到一千兩百萬個節點。GraphRAG 開箱即用時,對你在地的政治線或你那五十個經常引用的消息來源一無所知。教會它認識你檔案庫中特有的人物,是客製化的工作,而正是這項工作,把「文字上相似的片段」轉化為「一個人真實的來龍去脈」。

向量搜尋找出的是聽起來相似的段落。知識圖譜則知道兩個段落講的是同一個活生生的人。讀者問的,是關於人的問題。

第三件事是時間。新聞本質上具有時間性——同一個職位由不同的人擔任,同一項法案在不同會期被修訂,同一家公司在合併前後判若兩者。我們為圖譜的邊賦予有效起始與有效結束的時間戳,並把「法案通過時是誰擔任委員會主席」這類問題,拆解成多個時間性子查詢,借助的是過去一年間興起的時間性 RAG 研究(T-GRAG 與 VersionRAG 這兩個系列的成果)。少了它,引擎會把歷史壓扁成一個混亂的當下,而這正是你會斷言一位普通市民早在當選多年前就已就任的原因。

每一份出版商的 RFP 都該寫上的一句話:捏造的引述由誰負責?

以下這一刻,讓我把一則 Slack 外洩訊息當作警世故事,唸給我自己的團隊聽。

2024 年 11 月,《華盛頓郵報》(Washington Post)推出了 Ask The Post AI。到了 2025 年底,他們把它擴展成一檔 AI 生成的 podcast,而在十二月,該報準則編輯的內部訊息外洩了:那東西在捏造引述、錯置來源,還把評論當成該報自身的社論立場插入其中。「這件事居然被允許推進,實在令人震驚,」一位編輯寫道(Semafor,2025 年 12 月 11 日)。技術缺陷既小又具體——少了一道引用驗證的步驟。但聲譽損害是全球性的,而且發生在地球上資源最充足的新聞編輯室之一。

我把那則外洩訊息留在手邊,因為它是這整個領域裡最廉價的一課。郵報有工程師。他們在那套工作流程裡欠缺的,是一道強制層——除非句中每一項主張都能追溯到某個檢索到的來源,否則它拒絕輸出任何句子;再加上一道信心門檻,在答案上線之前,把不穩妥的答案導向人工審查佇列;再加上一個對董事會層級問題的明確答覆:當機器捏造一則引述時,由誰負責?那樣的治理,不是收縮膜封裝好的現成軟體。它正是「一個你能掛在報頭下的工具」與「一場全球性難堪」之間的分野。

拿它跟 Ask FT 對照一下:這是《金融時報》(Financial Times)建立在 Anthropic 的 Claude 之上的產品,嚴格以 FT 的新聞內容為依據,並強制附上連回原始文章的引用。值得注意的是,它帶來的是留存率的提升,而非人人擔心的訂閱自我蠶食。這兩種結果的差別,不在於模型品質,而在於引用強制究竟是被當成產品本身,還是被當成日後再加上的一項功能。

何不直接買現成的,或是像 FT 那樣自己打造?

人們老是問我這個問題,所以讓我誠實地把整個局勢攤開來講,因為我親眼看過出版商因為選了其中每一個錯誤答案而耗盡了資金跑道。

所謂的SaaS 聊天機器人廠商,會以 6 萬到 12 萬美元的價碼,在你的網站上放個小工具。我已經告訴過你這筆錢買到的是什麼:向量嵌入、沒有實體解析、沒有時間性推理、沒有引用驗證,而你的檔案庫還寄生在別人的雲端裡。它偏偏就在那些要緊的查詢上產生幻覺。

所謂的五大巨頭的自建系統——FT、《泰晤士報》(the Times)、Bloomberg、《郵報》、《衛報》(the Guardian)——是真實而令人印象深刻的,它們是由六到二十名工程師組成的機器學習團隊,耗時十二到二十四個月打造出來的,花費高達七位數。一家工程團隊只有一到三人的區域性日報,無法複製那樣的人力規模。就這樣,沒有轉圜。要一家中型出版商「像 FT 那樣自己打造」,等於是要他們長出一個自己根本沒有的器官。

所謂的大型顧問公司——Accenture、Deloitte、IBM——絕對願意為你打造,只是專案報價落在 150 萬到 500 萬美元以上,而且光是需求探索階段就會拖過你的資金跑道。他們伸手抓取的,是跟我們一樣的微軟 GraphRAG 與 Neo4j 技術堆疊,然後在其上收取合夥人等級的費率,而他們並沒有一連做過五個出版商檔案庫,因此不知道問題到底藏在哪裡。

那道鴻溝——夾在「行不通的小工具」與「你請不起的七位數團隊」之間——正是中型出版商需要一個建置夥伴的全部原因,一個已經做完那些不起眼的匯入、實體解析與引用強制工作的夥伴。不是 SaaS 訂閱,也不是一份需求探索簡報。這正是我們建立出版商業務時所立志成為的角色,完整內容都陳列在我們針對新聞檔案庫對話式 AI 的解決方案頁面

大多數顧問公司搞錯的地方:你需要的是兩套營收打法,而不是一套。

出版商的三套營收打法——留存引擎、抓取攔截、付費情報層級——共同支撐起單一營收模式。

這是我看到連聰明的出版商都會犯的策略錯誤。他們把「打造自己的 AI」和「把內容授權給 AI 公司」當成二選一。其實兩者兼具,而且它們攔截的是不同的錢。

你自己的對話式引擎,是留存打法——它讓讀者留在你的網站上,向你的檔案庫發問,而不是彈跳到 Perplexity。但對於此刻正在發生的洩漏——AI 爬蟲免費汲取你的內容——它卻無能為力。要處理那件事,你需要的是攔截打法,而它所需的基礎設施才剛剛建立起來。

Cloudflare 於 2026 年 1 月推出 Pay Per Crawl,在大約占全部網路流量 20% 的範圍內預設封鎖 AI 爬蟲,並讓出版商能針對每一隻爬蟲,以每次請求計價的方式設定「允許」、「收費」或「封鎖」——這是首個基礎設施層級的機器人稅。Tollbit 逐一針對各機器人做類似的事;《波士頓環球報》(Boston Globe)、Vox 與 Future 都已試行過。而在 2026 年 3 月,News/Media Alliance 與 ProRata 簽署了一項協議,讓 2,200 家中小型出版商得以加入一個集體授權池,享有50/50 營收分成,適用於可追蹤出處的 AI 答案,另有一項與 Bria 的平行協議,涵蓋企業級 RAG 用途。NMA 負責處理一家區域性日報單靠自己永遠養不起人力去應付的文書作業。

爬蟲通行費攔截的是抓取營收,卻對查詢營收毫無作用。誠實的答案是同時運行通行費機制與留存引擎——任何叫你只挑其中一個的人,都是在向你兜售他們剛好會做的那一半。

我總會給的一個提醒:這些攔截工具沒有一個能阻止 AI Overviews 為你的內容做摘要,因為那些是在查詢時檢索,而非在抓取時檢索。洩漏與摘要是兩個不同的問題。但一家在抓取端運行 Tollbit 或 Cloudflare、在授權端加入 ProRata、在留存端運行自家引擎的出版商,終於用三個局部的答案重建出了一套商業模式。這就是整套策略,而把那四套系統——ProRata、Bria、Tollbit、Cloudflare——連同引擎一起縫合成一份連貫的營收計畫,正是我們實際上所做的大部分工作。

還有第三套打法,我對產業媒體與 B2B 專業出版商推得最用力,因為它是上檔空間最大的一套:這套引擎不只是一道留存的護城河,它是一項你能收費的產品。一個建立在深厚垂直檔案庫之上、以引用為依據的查詢介面——三十年的法院文件、藥物核准,或你特定領域裡的交易資料,這種語料正是合規長或分析師願意報公帳買個席位來查詢的——就是一個付費情報層級,最終成為一套 API,而競爭對手根本無法生成,因為他們並不擁有你的語料。這正是 FT 在高階市場以其千元以上的專業層級所做的動作,也是 Bloomberg 透過一套能把白話英文轉換成自家查詢語言、橫跨財報電話會議與研究報告的系統所做的。產業媒體同樣坐擁一個範圍更窄、更深的檔案庫所帶來的相同契機,而其中大多數還沒察覺到。

當它真正奏效時,會是什麼模樣

六階段的出版商 RAG 管線:OCR、實體解析、時間性推理、混合檢索、重新排序、引用強制。

從那場市議員災難中存活下來的引擎,跟第一版毫無相似之處。它以尊重版面的、具版面感知能力的 OCR 匯入檔案庫。它把實體解析進一個知識圖譜,讓一個人成為單一節點,而非十幾處散落的提及。它跨越時間進行推理,讓歷史不至於被壓扁進當下。它運行混合檢索——稀疏關鍵字比對(BM25)與稠密語意搜尋並行,因為對「402 號法案」的查詢需要精確匹配,而這是任何嵌入都無法可靠浮現的——並在候選結果送達模型之前重新排序,一個 Cohere 或 BGE 的重排器,以 50 到 200 毫秒的延遲換來檢索品質 15% 到 30% 的提升,這筆交易,只要是要緊的查詢我每次都願意做。而且它在結構上就拒絕輸出任何無法引用出處的主張,把不確定的那些導向編輯,而非讀者。

它也能栓接到出版商既有的任何 CMS 上,而那種整合從來都不是通用的。Arc XP 開放了一組內容 API,卻沒有嵌入用的掛鉤,所以你只能在它旁邊另建。WordPress VIP 允許你註冊自訂端點。Brightspot 更有彈性。學術出版商使用的 Atypon,有自己的一套搜尋,你只能在它旁邊並存。一個五種都見識過的建置者,知道每一種會在哪裡跟你較勁。

轉型最快的新聞編輯室,已經感受到方向所在——削減同質化的一般新聞,其產出量已下滑 38%,並把心力灌注到原創調查報導(增加 91%)與情境分析(增加 82%)之上(Reuters Institute)。他們那些獨特作品所構成的檔案庫,正是 AI 公司無法生成、競爭對手也無法複製的唯一資產。錯誤在於,任由它擱在某台伺服器上、被免費索引,同時任由那些做摘要的人把它變現。

那家區域性日報的財務長,問的是 Google 欠了她什麼。而更好的問題——我但願更多出版商會先問的那個——是:當他們自己掌控那部讀取它的引擎時,他們自身的檔案庫究竟值多少。三十二年的報導,是一套地球上沒有任何模型曾用來訓練過的專有語料——而唯一能把它變成一場讀者願意付費持續進行下去的對話的,正是擁有它的那群人。你可以了解我們如何從頭到尾打造那套系統,就在這裡。檔案庫一直都是資產。改變的是,你終於不得不停止把它白白送人。

相關研究

同步發佈於

自信打造您的 AI。

與一支在打造新世代企業級 AI 方面擁有深厚經驗的團隊攜手合作。讓我們協助您設計、建置並部署值得信賴的 AI 策略。

Veriprajna 深度科技顧問公司 專精於為醫療、金融及法規監管領域打造攸關安全的 AI 系統。我們的架構均依循既定規範進行驗證,並備有完整的合規文件。