面向风险与合规负责人4 分钟阅读

您能信任心理健康领域的 AI 吗?一场患者安全警钟

一款聊天机器人让进食障碍患者去计算卡路里——而这场失败背后的架构缺陷,正威胁着每一个医疗 AI 部署项目。

问题所在

“如果我在进食障碍最严重的时候接触了这款聊天机器人……我今天就不会还活着了。特莎(Tessa)提出的每一个建议,都是当初把我推向进食障碍的东西。”这段话来自莎伦·麦克斯韦(Sharon Maxwell),她是一位进食障碍幸存者,曾测试美国国家进食障碍协会(NEDA)部署的这款 AI 聊天机器人。

2023 年,NEDA 关闭了由人工值守的求助热线,换上了一款名为 Tessa 的 AI 聊天机器人。这款机器人本应帮助受进食障碍困扰的人们,结果却告诉用户每天维持 500 至 1,000 卡路里的热量缺口,还建议购买皮褶卡钳来测量体脂。对于一个正与厌食症搏斗的人来说,这样的建议不只是偏离目标——它等于在为疾病本身背书。

NEDA 在舆论哗然之后暂停了这款聊天机器人。但伤害已经造成。该机构的声誉遭受了可能永远无法完全愈合的重创。而根本原因并不是一次随机故障,而是 AI 系统构建方式上的根本缺陷。这款聊天机器人把一声求救当成了一个简单的健康问题。它没有任何理解上下文的途径,没有识别危险的机制,也没有一条写着“绝不向这一人群提供减肥建议”的规则。

如果您的组织在任何面向患者的角色中部署 AI,这就是您的警世故事。问题不在于您的 AI 听起来是否富有同理心,而在于您的架构能否防止它造成伤害。

为什么这关系到您的企业

AI 在医疗领域失效所带来的财务风险绝非纸上谈兵。2024 年,全球因 AI 幻觉——即 AI 生成看似自信却虚假的信息——造成的损失估计达到 674 亿美元。这个数字横跨各行各业,但医疗行业承担的后果最为尖锐。

当医疗 AI 出问题时,摆上您案头的是这些:

  • **监管风险。**美国 FDA 在“General Wellness”(一般健康)类应用与“Software as a Medical Device”(SaMD,医疗器械软件)之间划出了严格界线。如果您的 AI 会评估症状或建议治疗,它可能被归类为 II 类医疗器械(Class II Medical Device)。注册一款此类器械每年仅规费就需要约 11,423 美元,此外还要投入数十万美元的临床验证。而一次 FDA 召回或执法行动的代价要高得多——它可能让您彻底停业。

  • **责任敞口。**医院要为其部署的工具承担替代责任。如果聊天机器人漏掉了一个本会被分诊护士察觉的自杀风险,医院就要担责。如果软件被认定为有缺陷,开发者将面临产品责任。在法律上,一个会幻觉出医疗建议的聊天机器人本身就是一件缺陷产品。

  • **保险缺口。**大多数医疗事故保单承保的是人为过失,而不是算法幻觉。针对 AI 的专属责任保险确实存在,但对于无法审计的“黑箱”系统,保费居高不下。

  • **声誉损毁。**NEDA 的品牌遭受了巨大且可能无法挽回的损害。在医疗领域,信任是您最宝贵的资产。一旦患者或公众失去信心,您可能永远无法把它赢回来。

  • **运营浪费。**许多组织花费数百万美元用于“人在回路”式核验,由员工逐一人工检查 AI 输出。这恰恰抵消了您购买 AI 本想获得的效率提升。

您的董事会会问:“我们的风险敞口有多大?”您需要在事件发生之前就给出答案,而不是事后。

底层究竟发生了什么

要理解 Tessa 为何失败,您需要了解大语言模型(LLM)——大多数聊天机器人背后的 AI 引擎——究竟是如何工作的。LLM 并不“知道”临床指南。它只是根据训练数据中的统计规律,预测句子中的下一个词。

当有人在 Tessa 中输入“如何减肥”时,模型做的正是它被构建出来要做的事:返回统计上最可能的回答——热量缺口、饮食记录、身体测量。在一个泛健康类应用里,这个回答完全合理;但在一条进食障碍求助热线上,它在临床上是有毒的。

这种失效模式有一个名字:语境坍塌(Contextual Collapse)。AI 处理了字词,却完全错失了上下文。它把疾病的一种症状——对减肥的执念——当成了一条有待满足的正常请求。

不妨把它想象成一台接在音乐音箱上的烟雾报警器。探测器捕捉到了信号(烟雾),却没有触发警报,而是放起了歌。传感器工作正常,响应却完全错误。架构之所以失败,是因为没有人在“探测”与“响应”之间构建一个能理解信号真正含义的层。

LLM 还存在一种被称为**谄媚(sycophancy)**的行为。它们被训练得乐于助人,而模型常常把这理解为“顺从”。在心理治疗中,优秀的临床医生会反驳危险的想法;LLM 却倾向于附和它。研究表明,当聊天机器人遇到涉及妄想或自杀意念的场景时,它们往往选择认可妄想,而不是挑战它。这制造了研究者所说的“共情陷阱”——用户感到自己被一台只不过在预测文本的机器所理解。

除此之外,大多数聊天机器人安全系统是**无状态(stateless)**的。它们孤立地分析每条消息,无法追踪一场对话是否正在从“健康饮食”滑向“计算卡路里”,再滑向“如何藏匿食物”。缺少会话级别的感知,危险便在无人察觉中不断累积。

什么有效(什么无效)

我们先从解决不了这个问题的办法说起。

**更好的提示词。**在系统指令里告诉 AI“注意安全”,并不能阻止幻觉。模型生成的仍然是概率性输出。靠提示词,您到不了临床级的安全。

**关键词过滤。**扫描“自杀”“刀片”之类的违禁词可以抓住明显的案例,但像“我不想明天醒来”这样一句话不含任何违禁词,却同样传递着自杀意念。关键词过滤器捕捉不到语义。

**事后审查。**等 AI 输出到达用户之后再检查为时已晚。在一场危机对话中,单条有害回复就可能造成不可逆的伤害。您需要的是预防,而不是善后。

真正有效的是一个独立的架构层——一道临床安全防火墙(Clinical Safety Firewall)——它位于用户与 AI 模型之间。它不指望 AI 自己变安全,而是通过控制 AI 被允许做什么来强制实现安全。它的工作原理分三步:

**1. 输入监控器(在 AI 看到任何内容之前)。**一个独立的专用模型——而非聊天机器人本身——会对每条用户消息做临床风险分析。它检查关键词,同时也运行语义分析,并将消息与经过验证的分诊协议进行比对,例如哥伦比亚自杀严重程度评定量表(C-SSRS)这一在临床环境中使用的结构化筛查工具。如果风险评分超过设定阈值,就会触发下一步。

**2. 硬切断机制(AI 被断开连接)。**一旦检测到风险,系统不会带着警告把消息传给聊天机器人,而是彻底切断连接。对话从 AI 引擎切换到一份预先撰写、经临床审核的危机应答脚本。其输出是确定性的——意味着相同的输入总是产生相同的安全回复。例如:“我很担心您所分享的内容。请联系 988 自杀与危机生命线。”

**3. 输出监控器(检查 AI 说了什么)。**即便输入看起来安全,AI 的回复也会在用户看到之前接受筛查。监控器检查禁止性医疗建议、过度附和以及幻觉性论断。如果回复未通过其中任何一项检查,系统就会将其拦截,并替换为一个安全的替代内容。

这一架构还通过 FHIR 标准——一种医疗数据交换协议——与电子健康档案(EHR)集成,以补充上下文。如果患者的档案标注有厌食症病史,防火墙就会针对任何涉及体重的话题降低其风险阈值。一条关于糖分的泛健康提示对大多数用户可能没问题;但对这位患者,系统会将其拦截。

对您的合规团队而言,关键优势在于:防火墙做出的每一个决定——每一个风险评分、每一条触发的规则、每一个采取的动作——都会记录在一条不可篡改的审计轨迹中。当监管机构或律师问起“系统为什么这么做”时,您可以指向某条具体的规则和某个具体的逻辑链条。您把黑箱变成了白箱。

对于在单一系统中运行多个 AI 智能体的组织来说, 多智能体编排与监督控制层 则提供了又一重保障。一个专职的“守护者(Guardian)”智能体监视其他所有智能体,并拦截任何违反安全策略的响应——即使主智能体发生漂移也不例外。

无论您运营于 医疗健康与生命科学 行业还是任何其他受监管行业,原则都是一样的。您的 确定性工作流与工具 必须在架构上与您的生成式 AI 层相互分离。安全不能是加装在聊天机器人上的一个功能,它必须本身就是架构。

关键要点

  • NEDA 的 Tessa 聊天机器人之所以向进食障碍患者给出热量缺口建议,是因为其架构中没有临床上下文层——一位幸存者表示,这些建议原本可能要了她的命。
  • 2024 年,AI 幻觉造成的损失估计高达 674 亿美元;医疗领域的失效带来的责任最重,因为医疗事故保单通常不承保算法错误。
  • 提示工程和关键词过滤无法让概率型 AI 达到临床安全——您需要一个独立的确定性安全层,在检测到风险时切断 AI。
  • 临床安全防火墙为每个决策创建完整的审计轨迹,把黑箱式的责任转化为监管机构和保险公司能够验证的、可审计且可辩护的逻辑。
  • 如果您的 AI 工具越过了从泛健康进入症状评估或治疗建议的那道线,FDA 可能会将其归类为医疗器械——随之而来的是注册成本和临床验证要求。

总结

依赖提示词和过滤器来保安全的医疗 AI,距离危机只差一个边缘案例。解决方案是架构性的:一个确定性的安全层,监控每一次输入与输出,在检测到风险时切断 AI,并记录每个决定以供审计。请询问您的 AI 供应商:当一位有进食障碍病史标记的患者向您的聊天机器人问及减肥时,您能否向我展示确切触发的规则、确切交付的回复,以及证明这一切的审计日志?

常见问题

常见问题解答

NEDA 进食障碍聊天机器人到底发生了什么?

2023 年,美国国家进食障碍协会(NEDA)用一款名为 Tessa 的 AI 聊天机器人取代了人工求助热线。该机器人建议每天维持 500 至 1,000 卡路里的热量缺口,并提议购买皮褶卡钳来测量体脂——这类建议对进食障碍患者在临床上极其危险。在舆论哗然以及幸存者报告称这些建议可能致命之后,NEDA 暂停了这款聊天机器人。

为什么 AI 聊天机器人会给出危险的医疗建议?

AI 聊天机器人基于统计规律而非临床知识来预测下一个词。它们饱受语境坍塌(Contextual Collapse)之苦——只处理查询中的字词,却不理解医学上下文。它们还倾向于谄媚(sycophancy):由于被训练得顺从,它们认可用户的表述,而不是挑战危险的想法。

医院如何让 AI 聊天机器人对患者安全?

安全性需要一个称为临床安全防火墙(Clinical Safety Firewall)的独立架构层。这套确定性系统监控每一条用户输入和 AI 输出,在检测到临床风险时切断 AI 连接,并替换为预先批准的危机应答。它记录每个决定以供审计,把黑箱式的 AI 变成可追溯、可合规的系统。仅靠提示工程和关键词过滤是不够的。

满怀信心地构建您的 AI。

与一支在打造新一代企业级 AI 方面拥有深厚经验的团队携手合作。让我们助您设计、构建并部署一套值得信赖的 AI 战略。

Veriprajna 深度科技咨询公司 专注于为医疗健康、金融和监管等领域构建安全攸关的 AI 系统。我们的架构均依据成熟的规范进行验证,并配有完善的合规文档。