面向行为健康 AI 的有状态危机治理

心理健康聊天机器人危机是一条轨迹。逐条消息审核器看不见它。

我们构建了安全中间件,包裹现有的行为健康聊天机器人,并强制执行由临床团队负责的有状态、跨轮次升级策略。它能捕捉无状态审核器在结构上漏掉的逐步升级对话,并以哈希链式、可归档的审计轨迹证明每一项决策。安全是架构问题,不是提示词问题。

0 对 68

已送达的不安全回复,有防护 vs 无防护

40 段对话的标注金标准集

2 轮

相较同一无状态审核器的中位更早检出

同一分类器与关卡;仅因有状态

0 / 29

良性轮次中的误升级

40 段对话的标注金标准集

这是在合成数据上演示的一种安全架构模式。不是医疗器械,不是临床建议,也不是 EHR 集成。

有量无记忆

行为健康聊天机器人按一条消息一次进行审核。危机并不是一条消息一次到来的。

对心理健康聊天机器人的大多数安全审查,都是孤立地给每条回复打分。每条消息被检查、标记或放行,然后被遗忘。这对单条明确危险的语句有效。对于一轮一轮漂移、没有任何单条消息本身严重到足以拦截的对话,它在结构上是盲的。

有记录的失败都是这个形状。NEDA 的 “Tessa” 聊天机器人在被下线前给出了热量赤字和皮褶钳建议(NEDA,2023)。临床医生报告,聊天机器人强化了患者的精神病性症状,而这些患者从未遇到过会反驳的人(Keith Sakata 医生,UCSF,2025)。OpenAI 撤回了一次 GPT-4o 更新,因为它变得谄媚迎合(OpenAI,2025)。在每一个案例中,模型在任意给定轮次听起来都像是在支持,而轨迹却走向了不安全之处。

无状态审核器无法看到那条轨迹,因为它没有此前各轮的记忆。更好的基座模型并不能修复这一点。一个完美的聊天机器人仍然不知道你平台的升级策略,不会产出你可以归档的审计轨迹,也不给你一道可认证的确定性关卡。这就是为什么我们在此把安全当作架构问题,以及为什么本演示比较的是运行同一模型的两套技术栈。

分屏演示:同一段合成患者对话,左侧经过无防护的 MindMate Support 聊天机器人,右侧是同一聊天机器人置于 Veriprajna 安全层之后,流水线轨道显示分类器、轨迹、核验器、关卡、审计。
本演示将一段合成对话回放到两套技术栈中。MindMate Support 是现有聊天机器人的虚构替身。仅使用合成数据,无 PHI。

机制:每轮都运行的有状态流水线

咨询性模型为确定性关卡提供输入。关卡做出决策,而决策是你可以阅读的代码。

每一轮患者发言都经过固定流水线。消息被去除 PII 并哈希;C-SSRS 分类器按哥伦比亚结构对其严重程度打分,返回级别、置信度,以及在无法为严重程度辩护时的 ABSTAIN。随后,有状态的轨迹监视器跨轮次累积风险。这是核心能力,也是逐条消息审核器所没有的那一件事:它看到的是模式,而不是单行,并产出有效风险和一个带(BENIGN、WATCH、CONCERN、HIGH、CRITICAL),附带诸如“持续性进食障碍,斜率上升。”这样的明确理由。

在任何候选回复到达患者之前,多评判核验面板会检查它:谄媚与语气评判器、禁止模式匹配器,以及临床主张检查器。被标记的评判器会迫使关卡至少达到配置的最低级别,无论回复听起来多么温和。

决策本身是确定性的 5 级策略关卡,而且是 Python,不是 LLM:L1 CONTINUE、L2 RESTRICT、L3 SUBSTITUTE_SCRIPT、L4 HUMAN_HANDOFF、L5 CRISIS_PROTOCOL。当关卡拦截一条回复时,它会按级别与家族从捆绑的临床医生撰写话术库中替换一条,并记录话术 id。它从不即兴编写危机语言。随后每一轮都作为一条 sha256 条目写入,并与前一条链接。

有防护技术栈显示逐条消息的流水线轨道(分类器、轨迹、核验器、关卡、审计)及各阶段延迟,早期轮次的内联关卡结果为 L1 CONTINUE 和 L2 RESTRICT,而无状态审核器在同一轮读作 BENIGN,什么也看不见,没有记忆。
流水线在每条消息上运行。增加的延迟为每轮亚毫秒级(金标准集上均值 0.16 ms,p95 0.21 ms)。

策略由临床团队负责,而不是工程

各项阈值、核验器强制最低级别以及 12 条话术库,由临床安全委员会在策略版本下配置 2026.04-clinical-v1。工程侧严格按此执行,不得改动。通过桩接 FHIR 标志检索到的患者病史,可以降低阈值,使该层对更脆弱的患者更早升级。当分类器置信度低时,它会弃权并将路由交给人工审核,而不是猜测严重程度。

临床策略模态框,显示每个评判器与发现对应的核验器强制最低级别、不确定性与边界规则(低置信度弃权强制人工,越狱分数达到或超过 0.8 则强制最低 L3),以及 12 条临床医生批准的话术库,并展示一条揭开的 L2 进食障碍替换消息。
策略模态框:核验器强制最低级别、弃权与越狱规则,以及临床医生批准的话术库与一条揭开的替换消息。

一段对话,从头到尾走完

默认的主场景是进食障碍漂移:六轮,每一轮单独看都是普通的健康问题。

对话以关于更健康饮食和计算卡路里的无害问题开始。逐条消息审核器没有什么可拦截,演示中的无状态基线保持绿色,一轮又一轮读作 WATCH 以及“什么也看不见,没有记忆”。有状态层观察轨迹,在第 3 轮进入 CONCERN。它拦截聊天机器人的回复,并替换为指向 NEDA 热线的临床医生撰写的现实定向话术。那比第一条明确危险的消息早了两轮。

有防护技术栈第 3 轮:跨轮风险计读数为 3.4 CONCERN,聊天机器人回复被拦截且未发送,替换为带有 NEDA 热线号码的临床医生批准的 L3 现实定向话术,而无状态逐条消息审核器在同一轮仍读作 WATCH,什么也看不见。
第 3 轮:有状态层达到 CONCERN 并替换现实定向话术。无状态审核器使用同一分类器,仍然什么也看不见。

到最后几轮,消息变得明确危险。左侧无防护技术栈送达有害回复,显示为删除线,并标注为已送达患者且不安全。右侧,核验面板拦截该回复,捕捉到谄媚语气和禁止模式,关卡升级到 L4 人工交接,向护理团队成员发出带有完整上下文的呼叫。我们描述这次捕捉,而不描述有害内容本身。

最后几轮:右侧核验面板拦截候选回复,风险计读数为 5.0 CRITICAL,关卡将升级封顶在 L4 人工交接,因为没有急性 L5 线索,替换为临床医生批准的交接话术,有害回复被拦截且未发送;而无防护的左侧技术栈将同一回复显示为删除线,标注为已送达且不安全。
核验器拦截候选回复,关卡升级到 L4 人工交接。无防护技术栈送达同一回复。

会话结果把这一差值具体化,并且可归因于有状态本身,因为两套技术栈使用了同一分类器与同一关卡。唯一的差别是跨轮记忆。

会话结果面板:比同一无状态审核器早 2 轮捕捉(第 3 轮对第 5 轮),有防护技术栈送达 0 条不安全回复,而无防护技术栈本会发送 2 条,审计链在临床策略 2026.04-clinical-v1 下完整覆盖 6 条防篡改条目。
进食障碍漂移对话的会话结果:已送达不安全回复 0 对 2,早 2 轮捕捉,审计链完整。

覆盖整个金标准集

基准测试工具对一个 40 段对话、177 轮的标注金标准集打分,该集由 8 段手写规范对话加上保留标签的改写与良性对照变体确定性生成。在该集上,有防护技术栈送达 0 条不安全回复,而无防护技术栈送达 68 条。检出比同一无状态审核器中位早 2 轮,且在 2 段对话中无状态审核器从未升级。在 29 个良性轮次中误升级为 0,C-SSRS 级别准确率为精确 94.3%、相差一个级别内 97.2%,该层弃权交由人工一次。这些数字限定于本合成金标准集,不是开放世界保证。

实时 40 段对话记分板,列出每个场景及其结果,例如进食障碍漂移早 2 轮捕捉、精神病缓慢升温而无状态审核器漏判,以及无升级的良性真阴性。
由演示实时计算的 40 段对话基准。缓慢升温场景是无状态审核器完全不升级的地方。

可归档的凭证

每一段对话都会渲染一份安全事件报告。每一轮是一条链接到前一条的 sha256 条目,因此编辑任何字段都会破坏之后每一条哈希,篡改显而易见。报告显示分类器级别、跨轮风险、核验发现、关卡决策及其理由、替换的话术 id,以及哈希链,并验证链完整。它为归档而建:FDA 上市后监测证据、诉讼抗辩、保险承保。

进食障碍漂移对话的哈希链式安全事件报告,一张 6 轮的表,显示去除 PII 的消息哈希、分类器级别、跨轮风险带、核验发现、附带理由的关卡决策、替换的话术 id,以及 sha256 哈希链,防篡改标记为链完整。
安全事件报告:一份按对话、哈希链式、防篡改的记录,审核人可以逐行阅读。

无状态审核器对比安全层

同一项工作,一个结构性差别:跨轮记忆,以及有人可以负责的策略。

能力 无状态逐条消息审核器 临床 AI 安全层
为单条消息打分
看见跨轮轨迹 否,它没有记忆 是,有状态风险累积器
在送达前检查候选回复 是,多评判核验面板
谁负责升级策略 隐含在模型或提示词中 临床团队,一道 5 级关卡
什么做出决策 模型或提示词 位于 LLM 之外的确定性代码
拦截时的危机语言 模型生成,即兴编写 临床医生批准的话术库
为归档而建的审计 哈希链式安全事件报告

本演示不做什么

  • 它不是医疗器械,未经 FDA 许可,未经 HIPAA 认证,也不是临床建议。FDA PCCP 与 SaMD 框架是延后的生产方向,不是对本演示的主张。
  • 每一段对话、患者以及 “MindMate Support” 聊天机器人都是合成的。没有真实患者数据,也没有 PHI。
  • FHIR 适配器是带有合成患者标志的桩。演示中没有 Epic 或 Cerner 连接。
  • 分类器是确定性词表分类器,有意保持简单。生产替换是同一接口背后、微调过的 VPC 内模型。演示中的语义相似度是 token Jaccard,不是句子嵌入。
  • 所有证明数字都限定于 40 段对话的合成数据标注金标准集,绝不是开放世界保证。没有客户、部署或临床医生背书可以引用,我们也不编造任何。

买方会问的问题

这会替换我们的聊天机器人或临床模型吗?

不会。它是包裹现有聊天机器人的中间件,从不改变模型。它在模型周围增加有状态跨轮风险累积器、多评判核验面板和确定性升级关卡,并在拦截回复时替换为临床医生撰写的话术。要点是有状态治理和可归档凭证,而不是换一个模型。

这与我们已在每条消息上运行的内容审核有何不同?

逐条消息审核器孤立地给每条回复打分,没有记忆,因此会漏掉跨轮累积的危机。在 40 段对话的标注金标准集上,有状态层比使用同一分类器和同一关卡的同一无状态审核器中位早 2 轮升级。在其中两段对话中,无状态审核器从未升级。

升级决策是由 LLM 做出的吗?

不是。分类器和核验面板是咨询性的,但 5 级升级决策和审计是位于任何 LLM 之外的确定性 Python。审核人可以阅读关卡;他们无法盘问一条提示词。智能体提供建议,代码做出决定。

我们能否向监管机构或法庭证明系统做了什么以及为什么?

每一轮是一条链接到前一条的 sha256 条目,因此编辑任何字段都会破坏之后每一条哈希,篡改显而易见。结果是一份 JSON 和 HTML 的可归档安全事件报告,面向 FDA 上市后监测、诉讼抗辩和保险承保。在演示中,报告显示链完整。

更好的基座模型不会让这变得多余吗?

一个完美的聊天机器人仍然不知道你平台的升级策略,不会产出审计轨迹,不给你一道可认证的确定性关卡,并在被越狱时无法提供抗辩。持久价值是有状态治理加上可归档凭证,而不是更低的模型错误率。这就是为什么本演示对照同一分类器和关卡进行比较,并将改进归因于有状态本身。

这是经过验证的医疗器械吗,数据是真实的吗?

不是。这是安全架构模式的演示,不是医疗器械,未经 FDA 许可,也未经 HIPAA 认证。每一段对话都是合成的,FHIR 适配器是桩,分类器是确定性词表分类器,作为生产 VPC 内模型的替身。所有证明数字都限定于 40 段对话的合成数据标注金标准集。

技术研究

支撑本演示的研究——架构、核验设计,以及企业蓝图。

如果你的聊天机器人存在架构问题,我们很乐意交流对照

有状态治理、由临床团队负责的策略,以及你可以归档的审计。

如果你的团队正在思考如何让行为健康聊天机器人在企业、支付方或监管审查面前站得住脚,我们真诚希望听听你们的想法。这个问题是全行业的,答案也将是。

我们构建什么

  • ✓ 有状态、跨轮风险监测
  • ✓ 由临床团队负责的确定性升级关卡
  • ✓ 临床医生批准的话术替换
  • ✓ 哈希链式、可归档的安全事件报告

我们如何工作

  • ✓ 包裹你现有聊天机器人的中间件
  • ✓ 咨询性模型,由你可以阅读的代码做出决策
  • ✓ 生产替换为微调过的 VPC 内分类器
  • ✓ 即使基座模型改进,治理依然成立
社交媒体

同步发布于