数十年的报纸头版排成一面墙,汇入一个以带引用链接作答的聊天面板。
Artificial IntelligenceMediaTechnology

你的新闻档案库才是真正的资产。别再让谷歌免费白用它。

Ashutosh SinghalAshutosh Singhal2026年5月9日14 min

去年冬天我曾与一家区域性日报的团队坐下来交流,它拥有四百万月度读者和长达三十二年的档案库,而二月份的董事会材料是那间会议室里所有人十年来读过的最糟糕的文件。自然搜索带来的转介流量同比下降了41%。程序化广告费率又下降了18%。2023年悄悄维持公司运转的联盟营销收入,已经跌到巅峰时期的三分之一。首席财务官把幻灯片投上屏幕,看着我,问出了唯一重要的问题:谷歌到底欠我们什么,我们又该如何让它买单?

我不得不告诉她实情:谷歌在合同意义上什么都不欠他们。那个建立起整个互联网的、不成文的约定——你让我们抓取你的内容,我们给你导流——在AI Overviews开始出现的那一刻就被改写了,截至2026年3月,它已出现在全部谷歌搜索的48%中(theStacc / Search Engine Land)。当一段AI摘要位于自然链接之上时,读者很少会往下滚动;《每日邮报》桌面端在这些查询上的点击率下降了89%,从25.23%跌至2.79%。内容仍然在被阅读。只是出版商不再因此获得报酬。我坚信,出路在于构建在出版商自有档案库之上的对话式AI。

那次谈话,正是我在Veriprajna的团队如今构建面向出版商的对话式AI——在出版商自有新闻档案库上运行的检索增强生成引擎的原因,并配以引用强制机制和授权策略,使它们足够安全,可以挂在报头之下。检索增强生成,即RAG,简单来说就是AI只从你的文档中给出答案,而不是从它在开放互联网上吸收的任何内容中作答。事实证明,这个区别就是整场游戏的关键。但我想完整讲讲我们是如何走到这一步的,因为我们把第一个版本做得非常糟糕,而我们出错的方式,恰恰是大多数出版商即将出错的方式。

转介经济已经终结。授权经济尚未建立。

先从流血有多严重说起,因为规模本身就是论据。在截至2025年11月的一年里,谷歌搜索为出版商带来的流量在全球范围内下降了约33%,而路透研究院调查的新闻高管们预计,在未来三年里还会进一步下降43%——其中五分之一的人为超过75%的损失做好了准备(路透研究院《2026新闻趋势》)。个别案例的情况更糟,其中一个演变成了诉讼:联盟营销收入较巅峰下滑超过三分之一的Penske Media,于2025年9月起诉谷歌——这是首个指控该公司胁迫出版商参与AI训练的重大反垄断案。

那个建立起你分发渠道的搜索引擎,如今成了你最大的竞争对手,而且它换到对立阵营时根本没有征求许可。

于是每一间董事会里的本能反应都如出一辙:如果谷歌不再给我们送来读者,我们就构建自己的AI,把他们留在我们的网站上。本能是对的。而人们受伤,正是在执行环节。

我们先做了那个显而易见的东西。它对一位市议员产生了幻觉。

我会坦白讲讲我们自己的伤疤,因为那是我亲身挣来的。我们搭建的第一个引擎,就是每一家SaaS供应商都会向你开价6万到12万美元、并在几周内部署好的那个版本:拿来档案库,把每篇文章切成小块,把这些块转成向量嵌入,再让一个聊天机器人检索最相近的匹配项。它的演示效果极佳。你问它一个近期的报道,它调出正确的文章,听起来棒极了。

然后,在一次试点会话中,一位编辑向它提出了任何读者都会问的那类问题:这位市议员和市中心项目背后的开发商之间有什么历史渊源?那是一个多跳问题——它意味着要把同一个人跨越十几篇、时间横跨数年的文章连起来,而他在其中以各种面貌出现:时而是带头衔的全名,时而只是一个姓氏,还有一次,在一张旧照片的说明文字里,仅被称作“选区代表”,那还是他根本尚未坐上那个席位之前的事。向量搜索检索到了几个在文字上相似的块,把它们缝成了一段流畅的文字,并断言了一种档案库实际上并不支持的关系。它凭空捏造了那段连接的脉络。

我看着那位编辑发现问题时的表情。那种神情——一位记者意识到机器刚刚以她报纸的名义捏造了一个事实——正是我如今构建一切所要防止的东西。我们交付了一个自信满满的骗子。

那次失败,正是我不再相信聊天窗口小组件是一款产品的全部原因。它根本不知道那些散落的名字其实是同一个人。它没有关于时间的模型——不知道那个人在赢得席位之前,曾多年都只是一介平民。而且它没有任何机制来核查它刚刚生成的那句话是否真的有来源支撑。在那些无关紧要的查询上,它表现尚可。但在读者真正关心的查询上,那些纵向的、关于人与金钱随时间演变的查询上,它恰恰在最需要顶住的地方崩溃了。

为什么RAG没能直接解决这个问题?

因为“RAG”描述的是一个类别,而非一种能力,而这项工作中最难的那60%,恰恰是没人拿来兜售的部分。

我第一个严重低估的——严重地——是数据摄取。我走进去时,想当然地以为一个三十年的档案库是一片干净的、等着被嵌入的语料。它不是。它是二十年里经历三次CMS迁移而变得千疮百孔的HTML、指向乌有之处的失效内部链接,以及一个只以扫描缩微胶片形式存在的2005年之前的层。当我们对那些扫描件运行普通OCR时,标题、正文栏目和照片说明文字被融成了一整块毫无意义的东西,因为OCR看不出页面的版式。我们不得不引入版式感知的光学字符识别——那种能检测栏目、把标题、说明文字和正文区分开来的技术——借助Amazon Textract和Azure Document Intelligence这样的工具。那正是决定整套系统能否运作的、不起眼的工作,而它也正是每一家聊天机器人供应商在报价里略去的那个条目。

第二件事就是那位市议员的问题,它有个名字:实体消解。要让AI能对一个人进行推理,对那个人的每一次提及——每一种署名变体、每一个尊称、每一处含蓄的指代——都必须归拢到同一个节点上。我们用严肃的团队所用的方式解决了它,即知识图谱:把微软开源的GraphRAG叠加在Neo4j之上,用图数据科学库来做消歧,使“马斯克先生”“埃隆·马斯克”和“特斯拉CEO”成为同一个实体,而不是三个。这一领域的某个实现达到了1200万个节点。开箱即用的GraphRAG对你本地的政治报道口线或你的五十个经常出现的信源一无所知。教会它你档案库里那些特定的人,是一项定制工作,而正是这项工作,把“文字上相似的块”变成了“一个人真实的历史”。

向量搜索找到的是听起来相像的段落。知识图谱知道的是两段文字讲的是同一个人。而读者问的正是关于人的问题。

第三件事是时间。新闻本质上是时序性的——同一个职位由不同的人担任、同一项法案在不同会期被修订、同一家公司在合并前后的样貌。我们为图的边赋予“有效起始”和“有效结束”时间戳,并把诸如“法案通过时是谁在主持委员会”这样的问题拆解成时序性的子查询,借鉴过去一年里涌现的时序RAG研究(T-GRAG和VersionRAG这两条工作脉络)。没有它,引擎就会把历史压平成一个混乱的当下,而这恰恰是你会断言一介平民在当选多年之前就已担任公职的原因。

那句应该出现在每家出版商招标书里的话:那条被捏造的引语,谁来担责?

接下来这一刻,让我把一段Slack泄露内容当作警世故事,读给我自己的团队听。

2024年11月,《华盛顿邮报》推出了Ask The Post AI。到2025年末,他们已把它扩展成一档AI生成的播客,而在12月,那位标准编辑的内部消息遭到泄露:那东西正在捏造引语、错误归因信源,并把评论当作报纸自身的社论立场插入其中。“这件事竟然被允许推进,实在令人震惊,”一位编辑写道(Semafor,2025年12月11日)。技术缺陷本身很小、很具体——缺少了一个引用核查步骤。而声誉损害却是全球性的,而且它发生在地球上资源最雄厚的新闻编辑室之一。

我一直把那条泄露的消息记在心里,因为它是整个领域里能得到的最廉价的一课。《邮报》有工程师。他们在那套工作流里所缺少的,是一个强制层——除非句中每一项主张都能追溯到一个检索到的来源,否则它拒绝输出这句话;再加上一个置信度阈值,把不牢靠的答案在上线之前送进人工审核队列;再加上对那个董事会层面的问题给出一个清晰的回答:当机器捏造了一条引语,谁来担责?那种治理不是收缩包装好的软件。它正是“一款你能挂在报头之下的工具”与“一场全球性尴尬”之间的区别。

把它和Ask FT对比一下,后者是《金融时报》构建在Anthropic的Claude之上的,严格立足于FT的新闻报道,并强制附上链接回原文的引用。值得注意的是,它带来了留存率的提升,而不是所有人担心的订阅自我蚕食。两种结果之间的差别不在于模型质量。而在于引用强制机制究竟是被当作产品本身,还是被当作日后再添加的一项功能。

为什么不干脆买一个,或者像FT那样自己造一个?

人们不停地问我这个,那就让我诚实地把整个格局摊开来讲,因为我亲眼见过出版商把自己的现金跑道耗在每一个错误答案上。

那些SaaS聊天机器人供应商会以6万到12万美元的价格在你的网站上放一个小组件。我已经告诉过你那笔钱买到的是什么:向量嵌入,没有实体消解,没有时序推理,没有引用核查,而且你的档案库还寄居在别人的云上。它恰恰在那些重要的查询上产生幻觉。

那些五巨头的自建方案——FT、《泰晤士报》、彭博、《邮报》、《卫报》——是真实而令人印象深刻的,它们由六到二十名工程师组成的机器学习团队在十二到二十四个月里打造,投入达到七位数。一家工程团队只有一到三人的区域性日报,无法复制那样的人力配置。就是如此。让一家中型出版商“像FT那样去造”,等于是在让它长出一个它并不拥有的器官。

那些大型咨询公司——埃森哲、德勤、IBM——绝对会替你造,收费从150万到500万美元以上不等,而其发现阶段的时长会超过你的现金跑道。它们伸手去拿的是和我们一样的那套微软GraphRAG加Neo4j的技术栈,然后在其之上收取合伙人级别的费率,而且它们并没有一个接一个地做过五个出版商的档案库,不知道那些坑都埋在哪里。

那道鸿沟——横亘在“不管用的小组件”和“你根本配不起的七位数团队”之间——正是中型出版商需要一个建造伙伴的全部原因,这个伙伴必须已经做过那些不光鲜的摄取、实体消解和引用强制工作。不是一份SaaS订阅,也不是一叠发现阶段的方案幻灯。这正是我们把出版商业务打造成的那个具体角色,其全部内容都陈列在我们关于在新闻档案库上构建对话式AI的解决方案页面上。

大多数咨询公司搞错的那一部分:你需要的是两条营收打法,而不是一条。

出版商的三条营收打法——留存引擎、抓取捕获、付费情报层级——共同汇入一个营收模型。

这是我见到连聪明的出版商都会犯的战略错误。他们把“构建我们自己的AI”和“把我们的内容授权给AI公司”当作非此即彼的二选一。它其实是两者兼有,而且它们捕获的是不同的钱。

你自己的对话式引擎是那条留存打法——它把读者留在你的网站上、向你的档案库提问,而不是跳到Perplexity去。但它对当下正在发生的那种泄漏毫无作为,也就是AI爬虫免费摄取你内容的那种泄漏。为此你需要那条捕获打法,而支撑它的基础设施才刚刚建成。

Cloudflare于2026年1月推出了Pay Per Crawl,在约占全部网络流量20%的范围内默认拦截AI爬虫,并让出版商可以按单次请求的价格为每个爬虫设置“允许”“收费”或“拦截”——这是首个基础设施层级的机器人税。Tollbit逐个机器人地做类似的事;《波士顿环球报》、Vox和Future都已试点过它。而在2026年3月,News/Media Alliance与ProRata达成了一项协议,让2200家中小型出版商可以选择加入一个集体授权池,在按归属追踪的AI答案上享有50/50的营收分成,并有一项面向企业级RAG用途的Bria平行协议。NMA负责处理一家区域性日报永远无从独自配备人手去应对的那些文书工作。

爬虫通行费捕获的是抓取营收。它们对查询营收毫无作为。诚实的答案是同时运营一道通行费和一个留存引擎——任何叫你二选一的人,都是在向你兜售他碰巧造出来的那一半。

我总会给出一个注意事项:这些捕获工具没有一个能阻止AI Overviews对你进行摘要,因为那些是在查询时检索、而非在抓取时检索的。泄漏和摘要是两个各自独立的问题。但一个在抓取端运行Tollbit或Cloudflare、在授权端选择加入ProRata、在留存端运行自有引擎的出版商,终于用三个各自不完整的答案重新拼出了一个商业模式。那就是整套战略,而把ProRata、Bria、Tollbit、Cloudflare这四套系统与引擎一起缝成一个连贯的营收计划,正是我们实际所做工作的大部分。

还有第三条打法,我在面向行业和B2B专业出版商时推得最用力,因为它是上行空间最大的那一条:引擎不仅是一道留存护城河,它还是一款你可以收费的产品。一个立足于引用、覆盖深度垂直档案库的查询界面——你那个特定报道口线上三十年的法庭卷宗、药品批准记录或交易数据,那种合规官或分析师会报销一个席位去查询的语料——就是一个付费情报层级,并最终成为一个API,是竞争对手根本无法生成的,因为他们并不拥有你的语料。这正是FT在高端市场以其千元以上专业层级所走的那步棋,也是彭博以一套把普通英语转成其自有查询语言、横跨财报电话会议和研究报告的系统所走的那步棋。行业媒体正坐拥同样的机会,只不过覆盖的是一个更窄、更深的档案库,而其中大多数还没有察觉到。

当它真正奏效时是什么样子

出版商RAG六阶段流水线:OCR、实体消解、时序推理、混合检索、重排序、引用强制。

那个熬过我们那场市议员灾难的引擎,与第一个版本毫无相似之处。它用尊重页面版式的、版式感知的OCR来摄取档案库。它把实体消解进一个知识图谱,从而让一个人成为一个节点,而不是十几处散落的提及。它对时间进行推理,因此历史不会被压平进当下。它运行混合检索——稀疏关键词匹配(BM25)与稠密语义搜索并行,因为对“402号法案”的查询需要精确匹配,而没有任何嵌入能可靠地把它浮现出来——并且在候选项抵达模型之前对它们重排序,一个Cohere或BGE重排器以50到200毫秒的延迟换来检索质量上15-30%的提升,在一个重要的查询上,这笔交易我每次都愿意做。而且它在结构上拒绝输出任何它无法引证的主张,把那些不确定的送去给一位编辑,而不是给一位读者。

它还能对接出版商已经在用的任何CMS,而那种集成从来都不是通用的。Arc XP暴露一个内容API,却没有嵌入挂钩,所以你得在它旁边另行构建。WordPress VIP允许你注册自定义端点。Brightspot更灵活。学术出版商使用的Atypon有它自己的搜索,你只能挨着它坐下来。一个见识过全部五种的建造者,知道每一种在哪里会跟你较劲。

转型最快的那些新闻编辑室已经感受到了方向——削减大路货式的一般新闻,其产出量已下降38%,并把精力倾注到原创调查报道(增长91%)和背景分析(增长82%)上(路透研究院)。他们那份别具一格作品的档案库,是唯一一项AI公司无法生成、竞争对手无法复制的资产。错误在于任由它躺在服务器上、被免费索引,而摘要生成者却在将它变现。

那家区域性日报的CFO问的是谷歌欠了她什么。而更好的问题——我希望更多出版商能率先发问的那个——是当他们自己掌控着阅读它的那个引擎时,他们自己的档案库到底价值几何。三十二年的报道是一份专有语料,地球上没有任何模型是在它之上训练出来的——而唯一能把它变成一场读者愿意花钱持续进行的对话的人,就是拥有它的那些人。你可以在这里了解我们如何端到端地把它构建出来。档案库从来都是那项资产。改变了的是,你终于不得不停止把它拱手送人。

相关研究

同步发布于

满怀信心地构建您的 AI。

与一支在打造新一代企业级 AI 方面拥有深厚经验的团队携手合作。让我们助您设计、构建并部署一套值得信赖的 AI 战略。

Veriprajna 深度科技咨询公司 专注于为医疗健康、金融和监管等领域构建安全攸关的 AI 系统。我们的架构均依据成熟的规范进行验证,并配有完善的合规文档。