一张自信满满的"Tabacon Springs 生态旅舍"预订确认页,旁边却是一个对这笔预订毫无记录的空荡酒店前台。
Artificial IntelligenceTravel TechnologyStartups

我们的 AI 预订了一家根本不存在的酒店——而数学早就算准了这一点

Ashutosh SinghalAshutosh Singhal2026年5月8日13 min

第一次看到我们的旅行助手确认一家根本不存在的酒店时,演示现场竟然响起了掌声。

一位测试者要求在哥斯达黎加找一家每晚低于 200 美元的豪华生态旅舍。模型返回了"Tabacon Springs 生态旅舍"——文案优美、房价看似合理、还有一张确认页面。读起来赏心悦目。但它其实是把两处真实酒店 Tabacon 和 Nayara Springs 熔成了一个虚构的地方。世界上根本没有 Tabacon Springs 生态旅舍。如果屏幕另一端坐着一个家庭,他们就会飞去哥斯达黎加,抵达一个从未听说过他们的前台。

那一刻正是agentic AI 旅行预订比看上去更难的全部原因,也正是我想在讲清我们如何做对之前,先讲清我们做错了什么。简而言之:在旅行领域,流畅的答案和真实的答案是两种不同的东西,而两者之间的鸿沟并不是靠迭代就能消除的缺陷。它是用概率模型去做一件确定性工作时的一种结构性属性。

一个对可用房源靠猜的人类旅行代理会被解雇。而一个靠猜的 AI 却因为语气得当而受到称赞——直到某位客户站在机场里为止。

董事会要的是"一套 AI 战略"。而市场给了他们一个恐慌的理由。

让我先把场景铺开,因为如果你在一家旅行管理公司或在线旅行社负责产品,你此刻正身处其中。

在 2026 年 2 月至 4 月之间,旅行业中每一个主要分销层都推出或宣布了 agentic 预订。Sabre、PayPal 和 Mindtrip 于 2 月 12 日宣布了业界首个端到端 agentic 体验——航班将于 2026 年第二季度全面上线,运行在 Sabre 的 Mosaic API 上,覆盖 420 多家航空公司和 200 万家酒店,并在其之上叠加了 Mindtrip 拥有 650 万节点的知识库。就在前一天,万豪的 CEO 确认 Google 的 AI Mode 将直接预订万豪,完全跳过 OTA 渠道。Amadeus 携手埃森哲,在 Microsoft Teams 内嵌入了一款名为 Cytric Easy 的生成式助手。Navan 则不断公布让每一家传统 TMC 都显得步履蹒跚的数据。

于是 CFO 走进会议室,问你为什么不"像 Navan 那样搞点 AI 的东西"。而我眼看着一支支聪明的团队掉进这样一个陷阱:他们把这个问题听成了赶快上线一个聊天机器人,而真正的问题——唯一重要的那个问题——其实是我们怎样才能做这件事而不像加拿大航空那样被烧到

我接触的买家并不是在纠结要不要做 agentic 预订。那场争论早已结束。他们在问的是:如何做到这一点,而不把整个公司押注在某个单一平台的库存上,也不让一台自信地犯错的机器制造出一份需要他们本人去承担的责任。

这份责任早已有了名字,而你的法务团队心知肚明

如果你想弄明白为什么旅行业的法律顾问如此紧张,你只需要看一个案子。

2024 年 2 月 14 日,不列颠哥伦比亚省民事纠纷仲裁庭裁定加拿大航空向 Jake Moffatt 赔偿 812.02 美元,起因是其聊天机器人凭空捏造了一项与航空公司实际票价规则相矛盾的追溯性丧亲票价政策。加拿大航空的辩护理由是:该聊天机器人实际上是一个独立的法律实体,须对自己的言论负责。仲裁庭以直白的语言驳回了这一说法:一家公司要对其界面上的一切负责,无论那些文字是来自一个静态网页,还是来自一个模型。

812 美元只是一个舍入误差。但这个判例不是。自此以后写下的每一份旅行科技法律备忘录都会引用 Moffatt 案,而一份更近的裁决则朝相反方向做出,却丝毫没有帮到部署方——2026 年 1 月,杭州的一家法院在一位用户试图强制执行聊天机器人的承诺时,收窄了 LLM供应商的责任。两案合起来看,都指向同一个令人不安的方向:注意义务落在旅行品牌身上,而不是模型提供方身上。你无法把责任外包给 OpenAI。

而且这不只关乎金钱。2025 年,游客们跋涉到秘鲁安第斯山脉海拔 4000 米处,寻找"Humantay 圣谷"——一个 AI 行程规划器完全凭空捏造的地方。一对马来西亚夫妇驱车 400 公里去乘坐一个根本不存在的"Kuak 空中缆车"。塔斯马尼亚一个只有 33 名居民的村庄开始接到关于它从未拥有过的温泉的咨询电话。旅行风险管理标准 ISO 31030 将旅行者安全定为部署方的义务——那些事件正是它存在的意义所在,就是为了防止这类事情。如今大约四分之一的游客用 AI 来规划行程,其波及范围早已不再是纸上谈兵。

我做错的地方:我以为这是一个提示词问题

十个 90% 的步骤复合成端到端 34%,旁边是 GPT-4 在 TravelPlanner 上 0.6% 的成功率。

接下来这部分我并不引以为傲。

老实说,我们的第一个版本是一个好看的外壳。一个能干的模型、一段精心设计的系统提示词、在酒店目录上的检索、一个整洁的聊天界面。它演示效果很好——好到我一度相信那些幻觉只是一个边缘案例,靠更好的提示词和更大的检索索引就能挤掉。大约那段时间,一位投资人跟我说,大意就是直接用 GPT、别想太多。有将近一个月,我半信半疑。

Tabacon Springs 那一刻打破了这个信念,但真正改变我想法的,是坐下来算了算我一直在回避的那笔账。

一次现实的航班预订大约有十个连续步骤:解析意图、搜索、筛选、定价、锁位、核查政策、收集乘客信息、移交支付、提交 PNR、出票。假设——说得慷慨一点——每一步都是一次概率模型调用,正确率为 90%。端到端算下来,你的成功率是 0.9 的十次方。约为 34%。

你无法靠提示词摆脱复合性的随机失败。误差不会随着步骤增加而变小。它会成倍放大。

然后我找到了那个终结内部争论的数字。俄亥俄州立大学 NLP 小组的 TravelPlanner 基准测试测得,使用流行的 ReAct 模式的 GPT-4,完成现实的多日行程的完成率为0.6%。不是 60%。是百分之零点六。一千次行程里只有六次成功。

人们四处挥舞着同一基准测试中的一个"97%"数字,我想在这里说得精确一点,因为借用它会让我们显得要么不诚实、要么天真:那 97% 来自一个代码驱动的求解器,它运行在一个静态、冻结的知识库上——OpenFlights 和 Yelp 的快照——而不是一个针对实时、变动库存进行预订的模型。它不是一个生产环境的预订数字,任何把它当作生产数字来引用的人都没读过那篇论文。对于一个驱动整个流程的 LLM 来说,诚实的数字是那个小的。

那就是转折点。问题从来不是提示词。问题在于我们竟然把一个概率模型放进了控制流里。

你怎样才能阻止 AI 预订一家不存在的酒店?

一种架构,把语言模型(意图、摘要)与掌管 GDS/NDC、政策和支付的确定性代码分开。

一旦我不再试图让模型更可靠,而是开始试图把它从那些必须可靠的部分中移除,架构几乎就自己设计好了。

我们最终确定的规则是:语言模型只做语言,别无其他。它提取旅行者的意图,并用平实的英语把结果总结回来。它不调用 GDS。它不核查政策。它不碰支付。这每一项都是硬编码的确定性逻辑。我们把编排作为一个状态机来运行——LangGraph 是我们通常的控制平面,尽管我们对它并不迷信;如果某个客户站在 AWS Bedrock AgentCore 或 Vertex AI Agent Builder 上,我们就在那里构建。

比框架更重要的细节是带类型的状态。我见过的大多数生产环境的智能体部署都死于同一种悄无声息的死法:状态在各步骤之间悄悄漂移,没人注意,而智能体自信地基于一幅被污染的世界图景采取行动。一个严格的 Pydantic 类型状态模式——每个字段都声明、在每次转换时都校验——就是那个不起眼却能阻止它发生的东西。当一次预订必须跨越多个提交时,一个 saga 模式负责处理回滚:如果在航班已经出票之后酒店预订失败了,图知道如何作废并回退,而不是让旅行者停留在预订到一半的状态。

我们把它构建为三种能力,而不是一个产品,因为并非每个买家都需要整套东西。有确定性预订智能体——核心部分。有验证即服务,一个独立的 API,任何现有的旅行 AI 团队都可以调用它来询问"这家酒店是真的吗,这个价格是当前的吗,这个 PNR 真的确认了吗?"——一道护栏,立在你已经上线的那个外壳前面,当法务在你的指导委员会上抬出 Moffatt 案时,这是一个远为便宜的答案,好过把一切推倒重来。还有一个政策与合规层,把企业差旅政策或 OTA 的票价规则编译成强制约束,为 ISO 31030 的注意义务提供工具化支持,并承载欧盟《AI 法案》的透明度要求。我们把这三者如何契合写在了这项工作的解决方案页面上。

政策执行必须是代码,而不是提示词。提示词会在不同模型版本之间漂移。业务规则不允许如此。

没人会放到路演幻灯片上的那个数字

如果我能让每一支旅行团队在上线前把一件事内化于心,那件事不会是幻觉。它会是搜索的经济账。

GDS 提供商不按每笔预订收费。他们按每次航段搜索收费,通常为 3 至 3.50 美元,外加大约 10% 的佣金,并且他们会执行查订比,对投机性的比价搜索进行惩罚。汉莎集团再次上调了其 GDS 预订费,自 2026 年 1 月 1 日起生效,涵盖 Amadeus、Sabre 和 Travelport。现在想象一个智能体,因为模型决定要"周到",就"贴心地"在每一轮对话中运行四次探索性搜索。在 OTA 3% 到 5% 的商户利润率下,那个智能体会在一个从不真正预订任何东西的聊天机器人上烧光整个季度的利润。

这是我坐过的每一场 agentic 旅行演示中最被忽视的一行,也正是那些演示一接触生产环境就撑不住的原因。一个确定性智能体会给搜索设上限并进行缓存,因为决定一次搜索是否值那笔费用的是编排层——而不是模型的心情。

而对于一家 TMC,这笔经济账直接系着 CFO 真正追逐的那个数字。这个版本推动的指标是无接触预订百分比,以及它背后的离线队列处理时长。每一笔幻觉的或无法服务的预订都是一张回落到人工代理手上的工单——而当会议室里有人说"像 Navan 那样搞点 AI 的东西"时,被指向的正是这个成本。

你为什么不能干脆基于 Amadeus API 来搭建?

有几个现实是我不得不用昂贵的方式学到的,而如今我会在第一次探索性通话中就提出来,好让没人在第三个月才吃惊。

如果你是一家 TMC,打算"干脆基于 Amadeus API 搭建",先查一查你手里是哪种密钥。Amadeus 的自助生产层级明确排除了Flight Create Orders 端点——按他们自己的说法,它是为没有旅行社认证资质的企业设计的。要真正下单,你需要 Enterprise 层级。我亲眼见过这一个单项让一份路线图整整推迟了一个季度。

然后是那道人人都当作已解决、实则并未解决的接缝:NDC 对 GDS。新分销能力(New Distribution Capability)对于最初的报价和下单很出色,但预订后的服务——改签、退款、非正常运营重订——即便原始销售是通过 NDC 完成的,仍然运行在 GDS 基础设施上。一个生产环境的智能体两条管道都需要两者,而不是在它们之间做非此即彼的二选一。而 NDC 本身也不是一个东西:通过 Verteil 或 Duffel 这类聚合商的 Level 4 订单管理,与大多数外壳止步于的 Level 3 购物,是两种不同的集成。IROPS(非正常运营)正是这道缺口变得真切的地方——一次天气事件就能让成机成机的旅客滞留,每一位的重订成本都在 500 至 2000 美元之间。一个能搜索却不能服务的智能体只是个玩具。

而如果你的设计是让智能体直接出票,而不是路由到一个主机系统,那你现在就进入了认证的领地——美国的 ARC,在满足前提条件后大约需要 25 天,或者完整的 IATA 认证,可能要六到十二个月。还有一个支付陷阱:聊天界面收集卡片数据的那一刻,你就把整个技术栈拉进了 PCI 合规范围。如今的 agentic 商务仍然把实际的授权交给一个人工支付步骤,通过 VGS 或 Checkout.com 这类提供商进行令牌化,使卡片数据不进入你的环境。

这些没有一样出现在主题演讲里。它们全都出现在生产事故报告里。

"为什么不干脆买 Sabre 的、或 Cytric、或 Navan?"

人们不停地这样问我,而我诚实的回答让他们意外:有时候你确实应该买。

如果你是一家休闲 OTA,乐于在 Sabre 的通道上分销 Sabre 的库存,那么 Sabre–PayPal–Mindtrip 这一套是一个合理的采购——只要你已经接受了被 Sabre 锁定的供给,以及企业差旅政策层或 ISO 31030 工具化支持的缺失。如果你是一家已经用着 Cytric 和 Concur 的微软原生企业,那么 Teams 内的 Cytric Easy 大概适合你,我会直接这么告诉你。如果你想彻底拆掉你的 TMC,运行一个 AI 原生平台,Navan 是真真切切挣来了它的数据——无接触报销 73%,政策违规从 35% 降到 5% 以下——我不会假装我们在"做 Navan"这件事上打败了他们。

我们契合的是一个更狭窄、更具体的场景:你想保留你现有的 GDS 合同和 TMC 关系,并在其之上添加智能,保持厂商中立,而不至于沦为你从谁那里买来智能体、就替谁做分销的分销商。这就是我们要搭建的东西。而那些我做不到的部分,我会直说出来——我们不是获得 IATA/ARC 认证的出票代理,所以出票要走你的主机;我们不拥有你的 GDS 商业协议;我们也无法修复一份含糊的企业差旅政策,尽管我们会在探索阶段帮你把它收紧,因为一份含糊的政策无论代码多好都会造出一个含糊的智能体。

那个关上窗口的截止日期

还有一件与时间赛跑的事。欧盟《AI 法案》针对部署方的透明度义务将于 2026 年 8 月 2 日生效,而高风险分类指南已于 2026 年 2 月 2 日发布。如果你的智能体与欧盟消费者对话,那么信息披露不是可选项,而"我们以后再加"就是一桩等着发生的合规问题。我们从一开始就把第 50 条的披露界面以及一套记录并可解释的审计追踪构建进去,因为把透明度改造进一个黑盒外壳,远比一开始就为它设计要痛苦得多。

所以,经历了这一切之后,我落脚在这里。流畅如今是免费的——市面上每一个外壳听起来都自信满满,而旅行者光凭阅读,分辨不出一个真实的确认和一个幻觉的确认。旅行者最终能分辨出来的,是当他们抵达时房间是否就在前台。那道鸿沟——在一句读起来为真的话,与一个确实为真的 PNR 之间——不会因为模型变大而闭合。它之所以闭合,是因为有人在上线之前决定,模型永远不会是那个回答"这是真的吗?"的东西。回答这个问题的确定性层不起眼,它演示效果没那么好,而它就是全部的活儿。

Tabacon Springs 生态旅舍仍然不是一个真实的地方。唯一重要的问题是,你的系统能否在你的客户站在大堂之前就知道这一点。如果你想看看我们是如何把我们的系统建成能够知道这一点的,完整的拆解就在这里

相关研究

同步发布于

满怀信心地构建您的 AI。

与一支在打造新一代企业级 AI 方面拥有深厚经验的团队携手合作。让我们助您设计、构建并部署一套值得信赖的 AI 战略。

Veriprajna 深度科技咨询公司 专注于为医疗健康、金融和监管等领域构建安全攸关的 AI 系统。我们的架构均依据成熟的规范进行验证,并配有完善的合规文档。