面向行为健康 AI 的有状态危机治理
我们构建了安全中间件,包裹现有的行为健康聊天机器人,并强制执行由临床团队负责的有状态、跨轮次升级策略。它能捕捉无状态审核器在结构上漏掉的逐步升级对话,并以哈希链式、可归档的审计轨迹证明每一项决策。安全是架构问题,不是提示词问题。
0 对 68
已送达的不安全回复,有防护 vs 无防护
40 段对话的标注金标准集
2 轮
相较同一无状态审核器的中位更早检出
同一分类器与关卡;仅因有状态
0 / 29
良性轮次中的误升级
40 段对话的标注金标准集
这是在合成数据上演示的一种安全架构模式。不是医疗器械,不是临床建议,也不是 EHR 集成。
行为健康聊天机器人按一条消息一次进行审核。危机并不是一条消息一次到来的。
对心理健康聊天机器人的大多数安全审查,都是孤立地给每条回复打分。每条消息被检查、标记或放行,然后被遗忘。这对单条明确危险的语句有效。对于一轮一轮漂移、没有任何单条消息本身严重到足以拦截的对话,它在结构上是盲的。
有记录的失败都是这个形状。NEDA 的 “Tessa” 聊天机器人在被下线前给出了热量赤字和皮褶钳建议(NEDA,2023)。临床医生报告,聊天机器人强化了患者的精神病性症状,而这些患者从未遇到过会反驳的人(Keith Sakata 医生,UCSF,2025)。OpenAI 撤回了一次 GPT-4o 更新,因为它变得谄媚迎合(OpenAI,2025)。在每一个案例中,模型在任意给定轮次听起来都像是在支持,而轨迹却走向了不安全之处。
无状态审核器无法看到那条轨迹,因为它没有此前各轮的记忆。更好的基座模型并不能修复这一点。一个完美的聊天机器人仍然不知道你平台的升级策略,不会产出你可以归档的审计轨迹,也不给你一道可认证的确定性关卡。这就是为什么我们在此把安全当作架构问题,以及为什么本演示比较的是运行同一模型的两套技术栈。
咨询性模型为确定性关卡提供输入。关卡做出决策,而决策是你可以阅读的代码。
每一轮患者发言都经过固定流水线。消息被去除 PII 并哈希;C-SSRS 分类器按哥伦比亚结构对其严重程度打分,返回级别、置信度,以及在无法为严重程度辩护时的 ABSTAIN。随后,有状态的轨迹监视器跨轮次累积风险。这是核心能力,也是逐条消息审核器所没有的那一件事:它看到的是模式,而不是单行,并产出有效风险和一个带(BENIGN、WATCH、CONCERN、HIGH、CRITICAL),附带诸如“持续性进食障碍,斜率上升。”这样的明确理由。
在任何候选回复到达患者之前,多评判核验面板会检查它:谄媚与语气评判器、禁止模式匹配器,以及临床主张检查器。被标记的评判器会迫使关卡至少达到配置的最低级别,无论回复听起来多么温和。
决策本身是确定性的 5 级策略关卡,而且是 Python,不是 LLM:L1 CONTINUE、L2 RESTRICT、L3 SUBSTITUTE_SCRIPT、L4 HUMAN_HANDOFF、L5 CRISIS_PROTOCOL。当关卡拦截一条回复时,它会按级别与家族从捆绑的临床医生撰写话术库中替换一条,并记录话术 id。它从不即兴编写危机语言。随后每一轮都作为一条 sha256 条目写入,并与前一条链接。
各项阈值、核验器强制最低级别以及 12 条话术库,由临床安全委员会在策略版本下配置 2026.04-clinical-v1。工程侧严格按此执行,不得改动。通过桩接 FHIR 标志检索到的患者病史,可以降低阈值,使该层对更脆弱的患者更早升级。当分类器置信度低时,它会弃权并将路由交给人工审核,而不是猜测严重程度。
默认的主场景是进食障碍漂移:六轮,每一轮单独看都是普通的健康问题。
对话以关于更健康饮食和计算卡路里的无害问题开始。逐条消息审核器没有什么可拦截,演示中的无状态基线保持绿色,一轮又一轮读作 WATCH 以及“什么也看不见,没有记忆”。有状态层观察轨迹,在第 3 轮进入 CONCERN。它拦截聊天机器人的回复,并替换为指向 NEDA 热线的临床医生撰写的现实定向话术。那比第一条明确危险的消息早了两轮。
到最后几轮,消息变得明确危险。左侧无防护技术栈送达有害回复,显示为删除线,并标注为已送达患者且不安全。右侧,核验面板拦截该回复,捕捉到谄媚语气和禁止模式,关卡升级到 L4 人工交接,向护理团队成员发出带有完整上下文的呼叫。我们描述这次捕捉,而不描述有害内容本身。
会话结果把这一差值具体化,并且可归因于有状态本身,因为两套技术栈使用了同一分类器与同一关卡。唯一的差别是跨轮记忆。
基准测试工具对一个 40 段对话、177 轮的标注金标准集打分,该集由 8 段手写规范对话加上保留标签的改写与良性对照变体确定性生成。在该集上,有防护技术栈送达 0 条不安全回复,而无防护技术栈送达 68 条。检出比同一无状态审核器中位早 2 轮,且在 2 段对话中无状态审核器从未升级。在 29 个良性轮次中误升级为 0,C-SSRS 级别准确率为精确 94.3%、相差一个级别内 97.2%,该层弃权交由人工一次。这些数字限定于本合成金标准集,不是开放世界保证。
每一段对话都会渲染一份安全事件报告。每一轮是一条链接到前一条的 sha256 条目,因此编辑任何字段都会破坏之后每一条哈希,篡改显而易见。报告显示分类器级别、跨轮风险、核验发现、关卡决策及其理由、替换的话术 id,以及哈希链,并验证链完整。它为归档而建:FDA 上市后监测证据、诉讼抗辩、保险承保。
同一项工作,一个结构性差别:跨轮记忆,以及有人可以负责的策略。
| 能力 | 无状态逐条消息审核器 | 临床 AI 安全层 |
|---|---|---|
| 为单条消息打分 | 是 | 是 |
| 看见跨轮轨迹 | 否,它没有记忆 | 是,有状态风险累积器 |
| 在送达前检查候选回复 | 否 | 是,多评判核验面板 |
| 谁负责升级策略 | 隐含在模型或提示词中 | 临床团队,一道 5 级关卡 |
| 什么做出决策 | 模型或提示词 | 位于 LLM 之外的确定性代码 |
| 拦截时的危机语言 | 模型生成,即兴编写 | 临床医生批准的话术库 |
| 为归档而建的审计 | 无 | 哈希链式安全事件报告 |
不会。它是包裹现有聊天机器人的中间件,从不改变模型。它在模型周围增加有状态跨轮风险累积器、多评判核验面板和确定性升级关卡,并在拦截回复时替换为临床医生撰写的话术。要点是有状态治理和可归档凭证,而不是换一个模型。
逐条消息审核器孤立地给每条回复打分,没有记忆,因此会漏掉跨轮累积的危机。在 40 段对话的标注金标准集上,有状态层比使用同一分类器和同一关卡的同一无状态审核器中位早 2 轮升级。在其中两段对话中,无状态审核器从未升级。
不是。分类器和核验面板是咨询性的,但 5 级升级决策和审计是位于任何 LLM 之外的确定性 Python。审核人可以阅读关卡;他们无法盘问一条提示词。智能体提供建议,代码做出决定。
每一轮是一条链接到前一条的 sha256 条目,因此编辑任何字段都会破坏之后每一条哈希,篡改显而易见。结果是一份 JSON 和 HTML 的可归档安全事件报告,面向 FDA 上市后监测、诉讼抗辩和保险承保。在演示中,报告显示链完整。
一个完美的聊天机器人仍然不知道你平台的升级策略,不会产出审计轨迹,不给你一道可认证的确定性关卡,并在被越狱时无法提供抗辩。持久价值是有状态治理加上可归档凭证,而不是更低的模型错误率。这就是为什么本演示对照同一分类器和关卡进行比较,并将改进归因于有状态本身。
不是。这是安全架构模式的演示,不是医疗器械,未经 FDA 许可,也未经 HIPAA 认证。每一段对话都是合成的,FHIR 适配器是桩,分类器是确定性词表分类器,作为生产 VPC 内模型的替身。所有证明数字都限定于 40 段对话的合成数据标注金标准集。
有状态治理、由临床团队负责的策略,以及你可以归档的审计。
如果你的团队正在思考如何让行为健康聊天机器人在企业、支付方或监管审查面前站得住脚,我们真诚希望听听你们的想法。这个问题是全行业的,答案也将是。