
我们打造了一套完美运作的虚假评论检测器——直到有人把它跑过 BypassGPT
最先击碎我信心的并不是一条虚假评论,而是一份价目表。
一个 Telegram 频道上的中间商——就是那种公开频道之一,一万三千多名成员,没有密码,也毫不掩饰——发布了一份菜单。点赞一次五十美分。来自带有"已验证购买"标志账户的评论,一条五美元。批量还有折扣。所提供的账户并不是垃圾邮件过滤器闭着眼睛就能抓到的新注册一次性账号;它们已经存在了两年、三年、四年,有着真实的购买记录,以及那种只有真人才会留下的不规律活动痕迹。我花了好几周时间,一直以为虚假评论检测是一个棘手的机器学习问题。而盯着那份菜单,我明白了:它确实是一个棘手的机器学习问题——只不过对方为它投入的资金,比它所针对的大多数品牌还要充足。
就在那一刻,我不再把虚假评论看作糟糕的文本,而开始把它们看作一个有组织的经济体系。我们最终在 Veriprajna 构建的一切——以及我起初搞错的一切——都源于这个转变。
从欺诈变成一种明码标价的商品那天起,它就不再是一个质量问题了。你无法靠过滤来战胜一个市场。
一场能骗过你所有工具的 47 条评论攻击

让我来描述一下现代攻击实际上是什么样子,因为人们对虚假评论的想象与它们真正的运作方式之间的差距,正是现有工具失效的主要原因。
某个竞争对手想埋葬你的产品。他们通过那些 Telegram 群组之一雇了一个中间商。这个中间商掌控着一批陈年的、被盗用的账户,并把它们部署来攻击某一个商品页面。在 72 小时内,47 条五星好评落在了竞品上——你的产品保持干净,而他们的评分节节攀升。评论文本由 GPT-4 撰写,然后经过 BypassGPT 之类的工具处理,以击败那些专门寻找"过于流畅"的机器写作的困惑度检测器。每条评论都会提到一个从商品页面自己的问答区抓取来的具体产品特性。发布时间被错开分布在三个时区,因此不会出现任何聚集。
每一条单独的评论看起来都合法。它们通过了各大评论平台的内容过滤器,也通过了 GPTZero。这些账户足够老,能躲过任何"新账户"的启发式判断。你的品牌保护团队不会察觉到任何异常——直到你的数据发生变动,而它们确实会变:一颗额外的欺诈星级能把竞争对手的需求抬高 38%,虚假差评则能让目标的营收减少多达四分之一,而这一切都在你的平均评分悄悄承受损失的同时发生。
这不是一个思想实验。2024 年 7 月,亚马逊与美国商业改进局(Better Business Bureau)首次联合起诉了评论中间商 ReviewServiceUSA.com。Trustpilot 在 2024 年删除了 450 万条虚假评论——占全部提交量的 7.4%,高于前一年的 6.1%。Tripadvisor 拦截了 270 万条欺诈性提交,其中一些是 AI 生成的房产照片,制造出"幽灵酒店",而旅客真的预订了它们,抵达后却发现只是一块空地。这一规模绝非微不足道。据世界经济论坛的数据,研究人员估计约有 30% 的在线评论是虚假的,每年给美国企业造成约 1520 亿美元的损失。
这就是我自以为已经理解的问题。而下面是我搞错的地方。
那个曾完美运作、随后却失灵的检测器
我们的第一个版本是一个文本分类器。它读取评论文本,并对该文本由机器生成的可能性打分。这是最显而易见的做法,我想诚实地说:我支持过它。它的演示效果非常漂亮。在我们的测试集上,它抓取 AI 撰写评论的准确率高到会让你在脑海里开始起草发布公告。
然后我们拿它去对付那些经过"人性化"工具处理过的评论。
如今这类工具已经有 30 多种——BypassGPT、Undetectable.ai、StealthWriter、Humanize AI,还有十几种别的。它们接收机器生成的文本,然后恰到好处地把它"打磨粗糙",足以骗过检测器:去掉那些暴露破绽的逗号,插入连接词,替换掉分类器学会与 GPT 输出联系起来的词汇。我们的准确率并没有平缓地下降。它是断崖式暴跌。那些我们原本以高置信度抓住的评论,如今都以"看起来像真人"的评价轻松蒙混过关。
我记得随后的那场争论。团队里一半人想继续调优——更多训练数据、对抗样本,追着"人性化"工具跑。这是一种合理的本能,也是一个陷阱。我看过相关研究:在某人测试过的 30 多种"人性化"工具中,只有 13 种能可靠地生成骗过最好检测器的文本。业内最顶尖的文本分类器 Originality.ai 仍能抓住其中的大多数。但当攻击者可以把一条评论跑过五种"人性化"工具、再提交得分最干净的那一条时,"大多数"就是一个错误的标准。一个纯文本检测器身处一场它在结构上早已输掉的赛跑之中。
单信号检测器并不是一个弱检测器。它是一个你已经明明白白告诉攻击者该如何击败的检测器。
更深层的问题,是我在读到那份 Telegram 价目表的那天本就应该看到的。一些破坏力最强的欺诈根本不是 AI 写的。当一个中间商付钱给一个真人网络去发帖时——被激励的真人,也就是过去那种"机械土耳其人"(Mechanical Turk)作坊的现代版本——这些文本确实是真正出自人类之手。这里没有任何语言学上的破绽可找,因为整个环节中根本没有机器参与。一个文本分类器面对一条来自真人的付费评论时,看不出任何问题,因为在语言层面上,确实没有任何问题。而这种不对称正在从两端同时扩大——到 2026 年初,23% 的评论撰写者承认至少偶尔使用 AI,而只有 31% 的消费者有信心自己能识别出一条 AI 撰写的评论。
就在那时,我们把文本模型从核心位置上撤了下来。不是完全弃用——它仍然是一个信号——只是它不再是那个信号。
究竟是什么能抓住一场有组织的行动?

拯救了这个项目的重新定义是:单独一条虚假评论几乎无法抓到,但一场行动会留下单条评论所不会留下的指纹。
即便那 47 条评论每一条都很干净,它们也共享着某些东西。它们成批涌现。它们引用同一个被抓取来的特性。而当你绘制卖家、评论者与产品之间的关系图谱时,发布这些评论的账户会亮成一个不会自然出现的簇——同一组账户在同一个时间窗口内,评论着同一小批产品。这正是那些认真对待欺诈的平台转向图方法的原因:亚马逊的技术栈在"卖家—评论者—产品"网络上运行深度图神经网络,恰恰是因为网络结构会暴露出文本永远无法暴露的协同性。我们朝着同一个方向构建——在语言层之上,融合行为信号(一个账户随时间如何行动)、时间信号(评论彼此之间在何时到达)以及关系信号(谁与谁相关联)。
其中任何单独一种都不够。一次爆发可能是真正的病毒式走红时刻。一个簇可能是真实的粉丝社群。但当它们组合在一起——一次爆发,包含抓取特性的文本,来自一个在关系上可疑的簇,还带着精心设计得看起来并不错开的错开时间——就构成了一场付费行动的特征,而且它能挺过"人性化"工具,因为"人性化"工具只会重写文字。
同样的逻辑延伸到了图像上,而这正是无人能干净利落地解决的前沿。幽灵酒店和伪造的产品照片正在蔓延,因为 AI 图像生成变得廉价了——而对于一个酒店款待品牌而言,其利害关系并不抽象:McAfee 估算 2025 年由 AI 驱动的旅行诈骗损失约为 130 亿美元,平均每位受害者约一千美元,其中很大一部分是通过那些直到入住前都看起来真实的商品页面进行的。有一项内容溯源标准,叫 C2PA,能在拍摄那一刻就对图像进行加密签名——三星的 Galaxy S25 成为首款原生对照片签名的消费级手机,而 2026 年确实是那个生态系统的一个转折点。但这里有一个我要提醒任何品牌注意的实操陷阱:平台会在图像处理过程中剥离元数据。那份证明照片真实的凭证,在它被上传到最要紧的那个市场的那一刻,就被抹掉了。溯源是一件真实的工具,但对电子商务而言它有一个真实的漏洞,假装并非如此,就是在向品牌兜售虚假的安慰。
为什么这些平台的工具没有早就解决这个问题?
这是我被问到最多的问题,而且问得合理。亚马逊每年花费超过 5 亿美元,有 8000 人在处理虚假评论。2024 年它拦截了超过 2.75 亿条虚假评论。那还有谁需要去构建任何东西呢?
因为这些平台打的是它们自己的仗,不是你的。亚马逊保护的是亚马逊——而即便投入了这么多,仍有 49% 的美国消费者表示自己有信心在那里见过虚假评论。评论管理平台则把同一条边界画向了另一边。Bazaarvoice 每月在 23 亿次购物会话中运行 1000 多条欺诈检测规则,而且它确实做得很好——在它自己的网络之内。一条关于你产品、挂在亚马逊上的虚假评论,对 Bazaarvoice 而言根本不可见。更糟的是,内容联合分发是双刃剑:一条通过了 Bazaarvoice 摄入环节的虚假评论,能在 48 小时内传播到 50 多个零售商网站,这意味着补救必须在源头节点进行,而不是在每一个下游商品页面上打地鼠。
文本检测器有它们自己的天花板——它们是单一信号,这是我付出惨痛代价才学到的。像 The Transparency Company 这样的审计服务每天做扫描并提起争议申诉,但它们是针对已知模式调优的,面对那些专门为逃避它们而调整的定制化中间商手法时就吃力了。而消费者真正信任、用来替他们核查这件事的那个工具 Fakespot,在运营九年后于 2025 年 7 月关闭了——Mozilla 找不到一个可持续的模式。就在攻击变得更强的同时,安全网却变得更小了。
没有哪家供应商在守望你品牌所处的整片战场。它们各自守着自己的院子,而欺诈就活在它们之间的街道上。
那道缝隙——跨平台的、站在品牌一方的、信号融合的——正是我们着手去占据的东西。不是要取代这些平台,而是要让一个品牌能一次性纵览亚马逊、Google、Yelp、Trustpilot 和 Tripadvisor,其检测是围绕它自己的产品品类、而非一套通用规则集来构建的。这正是我们所构建的那套评论完整性与合成内容检测系统的用途所在。
那位并不想要一个更干净评论页面的客户
我一直在推销检测准确率——召回率、精确率、我们能抓到多少条假评论。然后我和一位品牌保护负责人通了个电话,她在大约两分钟内就为我重新定义了整个产品。
她开口谈的并不是准确率。她问的是我们能拿出什么东西交给 FTC。
2024 年 10 月,FTC 的《消费者评论与推荐规则》(Consumer Reviews and Testimonials Rule)生效了,而它所做的事比"虚假评论被禁止"要微妙得多。它确立了一个"本应知道"的标准。如果虚假评论就摆在你的商品页面上,而你却没有一套合理的流程去检测并应对它们,那么缺少检测系统这件事本身就构成违规。每一次违规的罚款为 53,088 美元(截至 2025 年 1 月按通胀调整后的金额),而且违规每持续一天都单独计算。一场由 100 条虚假评论组成、未加处理的有组织行动,就意味着 530 万美元的风险敞口。2025 年 12 月,FTC 依据该规则向 10 家公司发出了首批警告信,所以这件事大约在一年前就不再是理论上的了。
而且这不只涉及美国品牌。2026 年 3 月,英国竞争与市场管理局(Competition and Markets Authority)依据新的《数字市场、竞争与消费者法》(Digital Markets, Competition and Consumers Act)启动了五项调查,罚款最高可达全球营业额的 10%。欧盟《AI 法案》第 50 条要求以机器可读的方式披露 AI 生成的内容,将于 2026 年 8 月生效。加利福尼亚州的 SB 942 于 2026 年 1 月新增了 AI 内容披露要求。监管的底线在所有品牌脚下同时移动了。
那位负责人教给我的是,检测是必要的,但并不充分。一个受监管的品牌真正需要的交付物,是尽职调查的证据——一份审计日志,表明一套合理的检测与响应流程曾经存在并运行过,无论任何单独一条虚假评论是否溜了过去。这种东西如今你在货架上买不到;平台不会把它们的检测数据给你,而那些点状解决方案也生成不了合规级别的记录。所以我们把这套系统构建成能把那条证据链作为一等输出来产出,而不是事后补上的东西。在"本应知道"规则之下,可用于抗辩的凭证并不是一个毫无瑕疵的评论页面——而是你一直在监测的书面证据。
品牌应该自建、购买,还是等待平台?
人们问我,他们能不能干脆等平台追上来。我诚实的回答是:这些平台正以它们能达到的最快速度,在一个它们已定义为"保护自己"的问题上奔跑,而监管的时钟如今正针对你单独地走着。等待也是一种立场,而在 2024 年 10 月之后,它是一种被标上了具体金额的立场。
第二个问题通常是他们能不能在内部自建这套东西。你可以——但看看那些认真的内部项目要花多少钱。亚马逊那个五亿美元、8000 人的运营,是大规模做这件事所需投入的标杆,而大多数品牌并不会为了看守自己在五个市场上的商品页面而搭建那样的东西。现实的选择是:一套针对你品类调优的定制系统,或者一堆你拼凑起来、寄望它们相互重叠的局部工具。那些大型咨询公司会把后者包装进一个框架卖给你,而任何技术真正跑起来都要在六到十二个月之后。
他们提出的第三点是军备竞赛——如果"人性化"工具不断改进,那任何检测器不都是暂时的吗?这是个正确的担忧,而这恰恰是为什么答案不能是一个文本分类器。当其中一个信号被攻击时,一个多信号系统只会缓慢退化,因为攻击者必须同时击败行为、时间和网络结构,而不只是重写文字。你赢得一场军备竞赛,靠的不是拥有一把更好的枪。你赢它,靠的是让攻击的成本超过它的回报。当欺诈被明码标价为点赞一次五十美分时,抬高一场成功行动的成本,就是整场博弈的全部。
那份 Telegram 价目表在任何模型之前就教会了我一些东西,而这也是我不断回想起的东西。对方把这当作一门有盈亏表(P&L)的生意来对待。多年来,品牌却把它当作一件需要过滤掉的麻烦事。那些能在这个十年结束时仍保住自己评分的品牌,将会是那些开始像攻击者早已在做的那样对待自己评论生态系统的品牌——把它当作值得有意去捍卫的、被争夺的基础设施。那是我会最先做出的转变,而它也正是我们所构建的系统从第一行代码起就假定的那一个。
一条你永远抓不到的虚假评论,让你损失一笔销售。而一套你从未构建的检测系统,在 2024 年 10 月之后,每天让你损失 53,088 美元。这不是同一个问题,而第二个问题正是大多数品牌尚未为之定价的那一个。


