
90%的AI保险拒赔在申诉后被推翻——法院直接判定这是违约
一个家庭自掏腰包支付了16,768美元,只为让母亲能继续躺在医院的病床上。
她患有高铁血红蛋白血症(methemoglobinemia)——一种会让身体缺氧的血液疾病。决定她保险覆盖的算法并不知道这一点,或者更准确地说,它知道,却毫不在意。它被训练成根据诊断分组来预测住院时长,而该分组中的普通患者已经可以回家了。于是系统按照人群化的时间线把她标记为可出院,而她实际的血氧水平却讲述着截然不同的故事。她的家人凑齐了这笔钱。大多数家庭做不到——而且大多数人甚至从未尝试:在这起 UnitedHealth 诉讼中,只有约0.2%的 Medicare 受益人对其拒赔提出过申诉。
该案例正处于Lokken 诉 UnitedHealth 案的核心——这起围绕 nH Predict(一款用于预测 Medicare Advantage 使用管理中康复时间线的 AI 工具)提起的集体诉讼。而真正应让每一位健康计划高管不寒而栗的数字是:大约该诉讼中约90%由 AI 生成的拒赔在申诉后被推翻——而这仅限于那一小撮愿意提出异议的会员之中。我第一次读到时,本能反应和大多数工程师一样——90%的推翻率是个模型准确性问题,用更好的训练数据和更严格的阈值就能修复。我错了,而法院告诉了我原因。一位联邦法官并未把这90%当作技术缺陷,而是当作违约的证据。正是这一重新定义,构成了Medicare Advantage AI 治理真正必须回答的问题,也是我最终围绕它创立一家公司的原因。
90%的申诉推翻率不是一个调优参数。它是一份供认——这套系统从一开始就根本没有在判定医疗必要性。
这场诉讼针对的是你合同里的一句话,而不是你模型里的一个缺陷
让我羞愧地花了很久才明白的是:这类案件中的法律风险并不存在于模型权重里。它存在于你的《承保证明》(Evidence of Coverage)之中。
你的 EOC——每位会员都要签署的那份合同——承诺保险覆盖决定由临床服务人员和医生做出。这就是约定。当我开始调取各计划的 EOC 条款,并把它们与其实际的自动裁定队列并排放在一起时,那道差距几乎总是白纸黑字地摆在那里。合同说由医生决定。而工作流呈现的却是:一个算法为请求评分,一个人对它返回的任何结果点击批准。对方律师不需要数据科学家来找出这道差距。他们只需要一名律师助理和一支荧光笔。
2026年3月,Lokken 案(2026 WL 658883)中的证据开示令让这一点变得具体。法院准许原告查阅 AI 开发文档、训练数据规格以及验证报告。我一直留着那份命令的打印件,上面圈出了一个条款,因为它改变了我与每一家计划的谈话方式:你的 AI 文档如今是可开示的。如果你的模型无法生成结构化的决策日志、受版本控制的训练数据以及有据可查的验证结果,你就无法重建自己为何拒付了一项索赔——而你无法为自己无法重建的东西辩护。
“人在环中”(human-in-the-loop)沦为一纸虚构的那一刻
有一段时间,我以为被起诉的那些计划是运行全自动拒赔的鲁莽异类。现实更令人不安,而每当一位首席医疗官告诉我他们很安全、因为有临床医生签字时,这也正是我如今开门见山会讲的细节。
崩坏发生在一个房间之外无人看得见的单一运营决策上。nH Predict 的管理者把对模型预测的可接受偏差范围从3%收窄到1%。在纸面上,这是一次调优改动。而实际上,它把一款决策支持工具变成了自动化的守门人,因为偏离算法数字哪怕一丝一毫的临床医生如今都算违规。一些推翻系统结论的人面临了纪律处分。
那正是“人在环中”不再是一道保障、而沦为一场表演的瞬间。一位一旦不同意模型就会丢掉工作的医生,行使的并不是临床判断——她是在盖橡皮图章。而每一笔经由这种表演式审查放行的拒赔,都承担着与自动化拒赔完全相同的合同与监管责任,因为它在功能上就是自动化拒赔。
偏差区间就埋藏在某个委员会的会议纪要里。诉讼的胜负正是在那里决定的,而不是在模型架构中。
我数不清有多少次治理讨论直接略过了这一点。各计划会审计他们的模型。他们却几乎从不审计围绕模型的工作流政策——阈值、推翻规则、纪律结构。正是这套政策决定了你的临床医生究竟是一位决策者,还是一块实际上什么都挡不住的责任挡箭牌。
我们为何先造错了东西
我的团队起步时,做了那件显而易见的事。我们造了监控系统。
在白板上,这很合理。市场上满是 AI 可观测性产品——Fiddler 提供 SHAP 和 LIME 可解释性,并带有漂移与偏见检测;IBM 的 Watsonx.governance 有用于公平性的 OpenScale;Credo AI 和 Holistic AI 出售策略包,以及能自动收集证据的合规仪表盘。整个品类的逻辑是:你有模型在生产环境中运行,你外挂一层来监视它们,于是你就有了治理。于是我们造了一层,用来监视某个试点计划的使用管理 AI,并产出了漂亮的公平性指标。
然后,该计划的一位医疗主管——一位在自己所在的 UM 委员会里坐了多年的人——看着我们的仪表盘,问了那个把我们打回起点重新设计的问题。“这告诉我模型的表现是一致的。它并没有告诉我这个模型究竟该不该做出这个决定。nH Predict 当年也很一致。”
她说得对,而且这话很扎心。我们造了一件极其精密的仪器,用来测量一件从根本上就有缺陷的东西。nH Predict 失败,并不是因为它没被监控。它失败,是因为它把诊断分组的平均值置于个体临床指标——血氧、照护者可及性、合并症相互作用——之上,而在这一领域,个体差异本身就是医疗必要性的定义所在。更严密地监控那个模型,只会产出一份整洁的记录,记录着一套系统在可靠地做着错误的事。那90%的推翻率本会被漂亮地记录在案。
那次失败,为我们接下来构建的一切付了学费。可观测性告诉你模型是否稳定。它并不告诉你决定是否站得住脚。这是两个不同的问题,而对我所在意的那类买家来说,整个治理平台品类都在解决第一个问题,却把它当作第二个来叫卖。
Medicare Advantage AI 治理究竟必须做到什么?

于是我们推翻了监控这个前提,从法庭上唯一重要的问题出发:你能为针对这个具体的人的这一具体拒赔辩护吗?
这一重新定义彻底改变了构建方式。你不再是在给一个模型装配仪表——你是在设计一个决定,使得多年以后,在一纸证据开示令之下,它能自我重建。对于一家 Medicare Advantage 计划而言,这意味着三件事必须同时为真,而让它们成真,正是 Veriprajna 在veriprajna.com/solutions/medicare-advantage-ai-governance上所做的工作。
第一,每个决定都必须自带解释——不是一个全局的公平性分数,而是一份逐决策的记录,说明模型权衡了哪些临床因素、又忽略了哪些,用临床医生和法官都能读懂的语言写成。这是所有人都低估的部分,也是我不得不带来坏消息的地方。大多数计划所运行的传统理赔平台——Facets、QNXT——从设计之初就从未打算产出逐决策的特征归因记录。它们存储的是结果,而非推理过程。因此,在 Medicare Advantage 技术栈上实现真正的可解释性,并不是从货架上挑一个更好的模型那么简单。它是一层中间件:一层捕获模型的输入、权重以及临床推翻路径,并把它们写入一份能经受证据开示考验的日志。那是不光鲜的集成工作,而它正是这份工作的大部分。
更难的要求在于,合规架构必须与同时到来的各项法规一一对应——这就把我引向了一个陷阱,我曾眼看着一家老练的计划径直踩了进去。
那个看似干净、实则不然的指标

CMS-0057-F,即事前授权最终规则,从2026年1月起开始发力——加急请求72小时办结,标准请求7天办结,除欺诈外不得重新审查已批准的住院收治。随后在2026年3月31日,第一个公开报告截止期限到来:各计划必须在合同层级报告八项事前授权指标,包括拒赔率、办结时长以及申诉推翻率。
真正重要的细节,是那种只有你读过《联邦公报》(Federal Register)的更正条目、而不只是标题时,才会注意到的那类东西。2025年6月,CMS 暂停了计划层级的细分数据,以及对 UM 委员会的健康公平专业能力要求。仍然公开的是聚合的、合同层级的指标。因此,一家计划可以公布一个相当体面的、合同层级的申诉推翻率,看起来干干净净——而与此同时,它的个别决策日志——也就是一份Lokken式证据开示令会径直探入的那些——却讲述着一个截然不同的故事。
公开指标是你选择展示的部分。决策日志是法院直接取走的部分。治理必须在第二样上取胜,而不是第一样。
我曾与一些高管面对面而坐,他们指着自己3月31日的申报,以此证明他们已然合规。这份申报是必要的。但它不是一道辩护。原告律师们并不在读你的聚合仪表盘;他们在传唤某一位会员被拒赔背后的那份记录。
再有就是2027年1月1日,届时 HL7 FHIR 事前授权 API——CRD、DTR 与 PAS——将成为强制要求,为每一个 PA 决定生成一条完整的电子交易轨迹。那条轨迹要么是你最好的证据,要么是你最糟的证据,这完全取决于推理过程是否在决定作出的当下被捕获。你事后无法补填。我此刻手上就有一张针对某个 QNXT 实例的集成工单,它本质上就是在赌一家计划最终会落入这两种未来中的哪一种。
没有任何单一平台是为之打造的那张拼凑之网
而且它还必须挺过一张没有任何现成产品能覆盖的监管地图。当我第一次把一家跨州客户的各项义务铺排在同一张电子表格上时,各列之间开始互相矛盾——而这是有意为之。这些要求是被刻意设计成互不一致的。
《得克萨斯负责任 AI 治理法案》于2026年1月生效,赋予了宽泛的民事调查传唤权——而早在2024年9月,得州就已通过和解首例医疗生成式 AI 调查(针对 Pieces Technologies,起因是夸大准确性宣称)而亮出了底牌。宾夕法尼亚州则走了另一条路,其立法要求在任何 AI 驱动的拒赔之前必须经过人工提供方审查,强制披露是否在使用 AI,并要求提交年度合规声明。一家跨州的 Medicare Advantage 机构如今面对的是一张拼凑之网,其中每个州都想要不同的透明度、审计与披露控制。而对任何有全球业务的计划而言,欧盟《AI 法案》依据附件三(Annex III)将医疗 AI 归为高风险,全面合规须在2027年8月前完成,罚款可高达全球年营业额的6%。
这正是大型咨询公司会掉进去的那道裂缝。德勤和埃森哲会部署一个打包好的平台——一个 Credo AI 或一个 IBM Watsonx——然后称之为治理。但一个打包平台并不了解你特定的 Facets 配置,它也无法把得州的调查传唤、宾州的拒赔前审查强制要求与欧盟的风险管理档案要求相互调和。理赔系统供应商的处境则更糟:维护 Facets 和 QNXT 的,正是那些同时向它们出售 AI 附加组件的公司,所以它们并不怎么有动力去揭示自家平台中的治理漏洞。在那片格局里,没有人在构建买家真正需要的那一样东西——一套逐个决策地、同时对应到适用于他们的每一项法规的技术控制。
一家计划为什么不能干脆买一套可解释性软件?
人们问过我一个合理的问题:既然可解释性和偏见监控早已存在,一家计划为什么不能干脆买下 Fiddler,或搭起因果 AI,然后就此了事?
有两个原因。监控厂商在他们所做的事情上确实很出色——但他们的全部前提是:生产环境中的那个模型才是值得治理的东西。当模型的决策架构本身就是那个缺陷时——正如 nH Predict 的情形——更仔细地盯着它,只会给你一段更高分辨率的伤害录像。因果 AI——这里最可信的名字是 causaLens——在学术上是正确的答案,它建模的是因果而非相关,但它在商业上尚不成熟,而且主要面向金融服务;针对承保决定的医疗专用因果模型至今大体仍处于研究阶段。而像 Cohere Health 这样的事前授权自动化厂商,优化的完全是错误的变量。Cohere 能把你的 PA 行政成本削减47%。那是一个真实的数字,也是一项真实的收益。但速度不等于可辩护性。一笔更快、却仍然无法在法庭上重建的拒赔,只是一条更快的路径,通向的正是Lokken案所界定的那种确切责任。
另一个原因是规模,而这是我无法劝一家计划回避的部分。Gartner 预计,到2028年,80%的门诊索赔将通过 AI 赋能的实时裁定来处理。然而据 Censinet 统计,如今只有12%的美国医院拥有正式的 AI 治理框架。自动化承保决定的数量即将成倍增长,其速度远远快于任何人为捍卫这些决定而构建基础设施的速度。而 CMS 并没有礼貌地等待——它的2020付款年度 RADV 审计已于2026年2月启动,使用 AI 驱动的异常检测来标记缺乏依据的诊断。监管者一边用 AI 审计你的 AI,一边又要求你自己去治理它。
率先行动的计划会把这一切转化为一种优势
我想以我真正相信的东西作结,而不是以一句警告。
我接触过的每一家计划都把治理当作一项成本——一笔部署 AI 的税,一道拖慢人人都想要的那种智能体自动化(agentic automation)的刹车。我理解这种框定。行政经济账从两头看都很残酷:医疗提供方每年要花197亿美元去对抗拒赔,而各计划在每一笔有争议的索赔上也各自承担着成本。诱惑在于:更用力地自动化,并把治理压到规则要求的最低限度。
但这笔账算反了。那些在申诉后被推翻的拒赔从来都不是成本节约——它们是计划被记作收入的负债,而且将在法庭上连本带利地偿还。一家计划若能为任何一笔拒赔拿出一份清晰的记录,说明权衡了哪些临床因素,由一位真正拥有表达异议自由的临床医生签署,并对应到每一项适用法规,那么它就不只是避开了诉讼。它还能更快、更有底气地拒赔,因为每一个决定都被打造得足以经受如今已成为常态的审视。我们正是构建了Medicare Advantage AI 治理架构,正是为了这样一家计划。
那位高铁血红蛋白血症患者的家人败下阵来,并不是因为一个算法犯了错。他们暂时输了,是因为这套系统无法解释自己,而环中没有任何一个人有推翻它的自由。把系统构建得能够解释自己,把那个人解放出来、让他能够推翻它,你就不再是在指望那纸证据开示令永远不来。你已经为它做好了准备。


