
Il 90% dei dinieghi IA sulla copertura viene ribaltato in appello. Un tribunale l'ha appena definito una violazione contrattuale.
Una famiglia ha pagato 16.768 dollari di tasca propria per tenere la madre in un letto d'ospedale.
Aveva la metaemoglobinemia — un disturbo del sangue che priva il corpo di ossigeno. L'algoritmo che decideva sulla sua copertura non lo sapeva, o meglio, lo sapeva e non gliene importava. Era stato addestrato a prevedere la durata della degenza a partire dal suo gruppo diagnostico, e il paziente medio di quel gruppo era pronto a tornare a casa. Così il sistema l'ha segnalata per la dimissione secondo una tempistica di popolazione, mentre il suo effettivo livello di ossigeno nel sangue raccontava una storia diversa. La sua famiglia ha trovato i soldi. La maggior parte delle famiglie non può — e la maggior parte non ci prova nemmeno: nel contenzioso UnitedHealth, solo circa lo 0,2% dei beneficiari Medicare ha fatto ricorso contro i propri dinieghi.
Quel caso è al centro di Lokken v. UnitedHealth, la class action su nH Predict, lo strumento di IA usato per proiettare le tempistiche di recupero nella gestione dell'utilizzo di Medicare Advantage. E il numero che dovrebbe gelare ogni dirigente di un piano sanitario è questo: circa il 90% dei dinieghi generati dall'IA in quel contenzioso è stato ribaltato in appello — tra la manciata di iscritti che si è presa la briga di contestarli. Quando l'ho letto per la prima volta, il mio istinto è stato lo stesso della maggior parte degli ingegneri — un tasso di ribaltamento del 90% è un problema di accuratezza del modello, qualcosa che si risolve con dati di addestramento migliori e soglie più rigide. Mi sbagliavo, e il tribunale mi ha spiegato perché. Un giudice federale sta trattando quel 90% non come un difetto tecnico, ma come prova di una violazione contrattuale. Quel singolo riinquadramento è ciò a cui la governance dell'IA in Medicare Advantage deve effettivamente rispondere, ed è il motivo per cui ho finito per costruirci intorno un'azienda.
Un tasso di ribaltamento in appello del 90% non è un parametro di taratura. È una confessione che il sistema non stava affatto decidendo sulla necessità medica, per cominciare.
La causa riguarda una frase nel tuo contratto, non un difetto nel tuo modello
Ciò che mi è servito un tempo imbarazzantemente lungo per capire è che l'esposizione legale in questi casi non risiede nei pesi del modello. Risiede nella tua Evidence of Coverage.
La tua EOC — il contratto che ogni iscritto firma — promette che le decisioni sulla copertura sono prese dal personale dei servizi clinici e dai medici. Questo è l'accordo. Quando ho iniziato a estrarre il testo delle EOC dei piani e ad affiancarlo alle loro effettive code di auto-adjudicazione, il divario c'era quasi sempre, nero su bianco. Il contratto dice che decide un medico. Il flusso di lavoro mostra un algoritmo che valuta la richiesta e un umano che clicca su approva su qualsiasi cosa esso restituisca. Alla controparte legale non serve un data scientist per trovare quel divario. Servono un praticante legale e un evidenziatore.
L'ordine di discovery del marzo 2026 in Lokken (2026 WL 658883) ha reso tutto concreto. Il tribunale ha concesso agli attori l'accesso ai documenti di sviluppo dell'IA, alle specifiche dei dati di addestramento e ai report di validazione. Tengo una copia stampata di quell'ordine con una clausola cerchiata, perché ha cambiato il modo in cui parlo con ogni piano: la tua documentazione sull'IA è ora acquisibile in discovery. Se il tuo modello non è in grado di produrre un registro strutturato delle decisioni, dati di addestramento sotto controllo di versione e risultati di validazione documentati, non puoi ricostruire perché hai negato una richiesta — e non puoi difendere ciò che non puoi ricostruire.
Il momento in cui l'«umano nel ciclo» diventa una finzione
Per un po' ho dato per scontato che i piani citati in giudizio fossero valori anomali sconsiderati che gestivano dinieghi completamente automatizzati. La realtà è più scomoda, ed è il dettaglio con cui ora apro ogni volta che un direttore sanitario mi dice che sono al sicuro perché un clinico firma l'approvazione.
La rottura avviene in un'unica decisione operativa che nessuno al di fuori di quella stanza vede mai. I responsabili di nH Predict hanno ristretto la varianza accettabile rispetto alla proiezione del modello dal 3% fino all'1%. Sulla carta è una modifica di taratura. In pratica ha convertito uno strumento di supporto alle decisioni in un guardiano automatizzato, perché i clinici che si discostavano più di un capello dal numero dell'algoritmo erano ora fuori conformità. Alcuni che hanno annullato le decisioni del sistema hanno subito provvedimenti disciplinari.
Quello è l'istante in cui l'umano nel ciclo smette di essere una salvaguardia e diventa teatro. Una dottoressa il cui posto di lavoro è a rischio se non è d'accordo con il modello non sta esercitando un giudizio clinico — sta apponendo un timbro di gomma. E ogni diniego che passa attraverso una revisione di facciata porta con sé l'intera responsabilità contrattuale e regolamentare di uno automatizzato, perché funzionalmente è esattamente ciò che è.
La banda di varianza è sepolta nei verbali di una riunione di comitato. È lì che la causa si vince o si perde, non nell'architettura del modello.
Non riesco a contare il numero di conversazioni sulla governance che saltano proprio questo punto. I piani sottopongono a verifica il loro modello. Non sottopongono quasi mai a verifica la politica di flusso di lavoro che lo circonda — la soglia, le regole di override, la struttura disciplinare. È quella politica a determinare se il tuo clinico è un decisore o uno scudo di responsabilità che in realtà non protegge nulla.
Perché abbiamo costruito la cosa sbagliata per prima
Quando il mio team ha iniziato, abbiamo fatto la cosa ovvia. Abbiamo costruito il monitoraggio.
Su una lavagna aveva senso. Il mercato è pieno di osservabilità dell'IA — Fiddler offre spiegabilità SHAP e LIME con rilevamento di drift e bias; Watsonx.governance di IBM ha OpenScale per l'equità; Credo AI e Holistic AI vendono pacchetti di policy e cruscotti di conformità che raccolgono automaticamente le prove. La logica dell'intera categoria è: hai modelli in produzione, ci imbulloni sopra uno strato che li osserva, e ora hai la governance. Così abbiamo costruito uno strato che osservava l'IA di gestione dell'utilizzo di un piano pilota e produceva bellissime metriche di equità.
Poi una direttrice medica di quel piano — una persona che era stata per anni nel suo stesso comitato UM — ha guardato il nostro cruscotto e ha posto la domanda che ci ha rimandati al tavolo da disegno. «Questo mi dice che il modello si comporta in modo coerente. Non mi dice che il modello dovrebbe affatto prendere questa decisione. Anche nH Predict era coerente.»
Aveva ragione, e faceva male. Avevamo costruito uno strumento molto preciso per misurare una cosa fondamentalmente difettosa. nH Predict non ha fallito perché non era monitorato. Ha fallito perché pesava le medie del gruppo diagnostico più degli indicatori clinici individuali — ossigeno nel sangue, disponibilità di chi presta assistenza, interazioni tra comorbidità — in un ambito in cui la variazione individuale è la definizione stessa di necessità medica. Monitorare quel modello più da vicino avrebbe prodotto un registro ordinato di un sistema che faceva in modo affidabile la cosa sbagliata. Il tasso di ribaltamento del 90% sarebbe stato splendidamente documentato.
È stato quel fallimento a pagare per tutto ciò che abbiamo costruito dopo. L'osservabilità ti dice se il modello è stabile. Non ti dice se la decisione è difendibile. Sono problemi diversi, e l'intera categoria delle piattaforme di governance stava, per l'acquirente a cui tenevo, risolvendo il primo e chiamandolo il secondo.
Cosa deve effettivamente fare la governance dell'IA in Medicare Advantage?

Così abbiamo demolito la premessa del monitoraggio e siamo partiti dall'unica domanda che conta in un'aula di tribunale: sei in grado di difendere questo specifico diniego a questa specifica persona?
Quel riinquadramento cambia completamente la costruzione. Non stai più strumentando un modello — stai progettando una decisione in modo che, anni dopo, sotto un ordine di discovery, si ricostruisca da sola. Per un piano Medicare Advantage questo significa che tre cose devono essere vere contemporaneamente, e renderle vere è il lavoro che Veriprajna svolge su veriprajna.com/solutions/medicare-advantage-ai-governance.
Primo, ogni decisione deve portare con sé la propria spiegazione — non un punteggio globale di equità, ma un registro per singola decisione di quali fattori clinici il modello ha pesato e quali ha ignorato, in un linguaggio che sia un clinico sia un giudice possano leggere. Questa è la parte che tutti sottovalutano, ed è quella in cui devo dare cattive notizie. Le piattaforme di gestione delle richieste ereditate su cui gira la maggior parte dei piani — Facets, QNXT — non sono mai state progettate per emettere un registro di attribuzione delle caratteristiche per singola decisione. Memorizzano l'esito, non il ragionamento. Quindi una vera spiegabilità su uno stack Medicare Advantage non è questione di scegliere un modello migliore da uno scaffale. È middleware: uno strato che cattura gli input, i pesi e il percorso di override clinico del modello, e li scrive in un registro costruito per sopravvivere alla discovery. È un lavoro di integrazione poco glamour, ed è la maggior parte del lavoro.
Il requisito più difficile è che l'architettura di conformità deve corrispondere alle normative che arrivano nello stesso momento — il che mi porta a una trappola in cui ho visto un piano sofisticato cadere in pieno.
La metrica che sembra pulita e non lo è

CMS-0057-F, la regola finale sull'autorizzazione preventiva, ha iniziato a mordere a gennaio 2026 — 72 ore di tempo di risposta sulle richieste accelerate, sette giorni su quelle standard, nessuna riapertura dei ricoveri ospedalieri approvati salvo per frode. Poi, il 31 marzo 2026, è scattata la prima scadenza di rendicontazione pubblica: i piani dovevano riportare otto metriche di autorizzazione preventiva a livello di contratto, inclusi i tassi di diniego, i tempi di risposta e i tassi di ribaltamento in appello.
Il dettaglio che conta è il genere di cosa che cogli solo se hai letto le Federal Register correzioni, non solo il titolo. A giugno 2025, il CMS ha sospeso le suddivisioni a livello di piano e i requisiti di competenza in equità sanitaria per i comitati UM. Ciò che resta pubblico sono metriche aggregate, a livello di contratto. Così un piano può pubblicare un tasso di ribaltamento in appello a livello di contratto perfettamente rispettabile e apparire pulito — mentre i suoi registri decisionali individuali, quelli che un ordine di discovery in stile Lokken raggiunge dritto, raccontano una storia completamente diversa.
Le metriche pubbliche sono la parte che scegli di mostrare. I registri decisionali sono la parte che un tribunale prende. La governance deve vincere sui secondi, non sulle prime.
Mi sono seduto di fronte a dirigenti che indicavano la loro dichiarazione del 31 marzo come prova di essere in regola. La dichiarazione è necessaria. Non è una difesa. Gli avvocati degli attori non stanno leggendo il tuo cruscotto aggregato; stanno intimando la produzione del registro dietro il diniego di un singolo iscritto.
Poi c'è il 1° gennaio 2027, quando le API di autorizzazione preventiva HL7 FHIR — CRD, DTR e PAS — diventano obbligatorie, creando una traccia completa di transazione elettronica per ogni decisione di PA. Quella traccia è o la tua migliore prova o la tua peggiore, a seconda interamente di se il ragionamento sia stato catturato nel momento in cui la decisione è stata presa. Non puoi riempirla a posteriori. Ho un ticket di integrazione aperto proprio ora contro un'istanza QNXT che è, in sostanza, una scommessa su quale di quei due futuri un piano finirà per abitare.
Il mosaico normativo per cui nessuna singola piattaforma è stata costruita
E deve sopravvivere a una mappa normativa che nessun prodotto preconfezionato copre. La prima volta che ho disposto gli obblighi di un cliente multi-statale su un singolo foglio di calcolo, le colonne hanno smesso di concordare tra loro — ed è così per progettazione. I requisiti sono deliberatamente incoerenti.
Il Texas Responsible AI Governance Act è entrato in vigore a gennaio 2026 con un ampio potere di richiesta investigativa civile — e il Texas aveva già scoperto le sue carte risolvendo la prima indagine su un'IA generativa in ambito sanitario, contro Pieces Technologies, a settembre 2024, per affermazioni gonfiate sull'accuratezza. La Pennsylvania ha preso una direzione diversa, con una legislazione che richiede la revisione da parte di un operatore sanitario umano prima di qualsiasi diniego guidato dall'IA, la divulgazione obbligatoria del fatto che l'IA è persino in uso, e dichiarazioni annuali di conformità. Un'organizzazione Medicare Advantage multi-statale si trova ora di fronte a un mosaico in cui ogni stato vuole controlli diversi di trasparenza, verifica e divulgazione. E per qualsiasi piano con operazioni globali, l'EU AI Act classifica l'IA sanitaria come ad alto rischio ai sensi dell'Allegato III, con piena conformità dovuta ad agosto 2027 e sanzioni fino al 6% del fatturato annuo globale.
Questa è esattamente la cucitura in cui cadono le grandi società di consulenza. Deloitte e Accenture distribuiranno una piattaforma preconfezionata — una Credo AI o un IBM Watsonx — e la chiameranno governance. Ma una piattaforma preconfezionata non conosce la tua specifica configurazione di Facets, e non riconcilia le richieste investigative del Texas con il mandato di revisione pre-diniego della Pennsylvania con il requisito del fascicolo di gestione del rischio dell'UE. I fornitori di sistemi di gestione delle richieste sono posizionati ancora peggio: le stesse aziende che mantengono Facets e QNXT vendono anche gli add-on di IA per essi, quindi non sono esattamente incentivate a far emergere le lacune di governance nelle proprie piattaforme. Nessuno in quel panorama stava costruendo l'unica cosa di cui l'acquirente aveva bisogno — controlli tecnici mappati, decisione per decisione, a ogni normativa che si applica a loro tutte in una volta.
Perché un piano non può semplicemente comprare un software di spiegabilità?
Le persone mi pongono una domanda legittima: se la spiegabilità e il monitoraggio del bias esistono già, perché un piano non può semplicemente comprare Fiddler o mettere in piedi un'IA causale e farla finita?
Due ragioni. I fornitori di monitoraggio sono genuinamente bravi in ciò che fanno — ma la loro intera premessa è che il modello in produzione sia la cosa che vale la pena governare. Quando l'architettura decisionale del modello è il difetto, come lo era con nH Predict, osservarlo più attentamente ti dà solo una registrazione ad alta risoluzione del danno. L'IA causale — causaLens è il nome più credibile qui — è la risposta accademicamente corretta, modellando la causa invece della correlazione, ma è commercialmente immatura e rivolta soprattutto ai servizi finanziari; i modelli causali specifici per la sanità applicati alle decisioni di copertura sono ancora in gran parte a livello di ricerca. E i fornitori di automazione dell'autorizzazione preventiva come Cohere Health stanno ottimizzando del tutto la variabile sbagliata. Cohere ti taglierà il costo amministrativo della PA del 47%. È un numero reale e un beneficio reale. Ma la velocità non è difendibilità. Un diniego più veloce che comunque non puoi ricostruire in tribunale è un percorso più veloce verso la esatta responsabilità che Lokken ha definito.
L'altra ragione è la scala, ed è la parte da cui non riesco a dissuadere un piano. Gartner prevede che l'80% delle richieste ambulatoriali sarà elaborato tramite adjudicazione in tempo reale abilitata dall'IA entro il 2028. Eppure solo il 12% degli ospedali statunitensi ha oggi un quadro formale di governance dell'IA, secondo il conteggio di Censinet. Il volume delle decisioni di copertura automatizzate è sul punto di moltiplicarsi molto più velocemente di quanto chiunque stia costruendo l'infrastruttura per difenderle. E il CMS non aspetta educatamente — le sue verifiche RADV dell'Anno di Pagamento 2020 sono iniziate a febbraio 2026 usando il rilevamento delle anomalie basato sull'IA per segnalare diagnosi non supportate. Il regolatore sta verificando la tua IA con l'IA mentre ti richiede di governarla tu stesso.
I piani che si muovono per primi trasformano questo in un vantaggio
Voglio chiudere sulla cosa in cui credo davvero, non su un avvertimento.
Ogni piano con cui parlo tratta la governance come un costo — una tassa sull'implementazione dell'IA, un freno all'automazione agentica che tutti vogliono. Capisco l'inquadramento. Le economie amministrative sono brutali da entrambi i lati: gli operatori sanitari spendono 19,7 miliardi di dollari all'anno per combattere i dinieghi, e i piani sostengono il proprio costo su ogni richiesta contestata. La tentazione è automatizzare più duramente e governare il meno possibile secondo quanto la regola richiede.
Ma quei conti girano al contrario. I dinieghi che vengono ribaltati in appello non sono mai stati risparmi di costo — erano responsabilità che il piano ha contabilizzato come ricavo e che ripagherà con gli interessi in tribunale. Un piano che è in grado di produrre, per qualsiasi diniego, un registro pulito di quali fattori clinici sono stati pesati, firmato da un clinico che aveva genuinamente la libertà di dissentire, mappato a ogni normativa che si applica, non si limita a evitare la causa. Può negare più velocemente e con più fiducia, perché ogni decisione è costruita per sopravvivere allo scrutinio che ora arriva come routine. Abbiamo costruito l'architettura di governance dell'IA per Medicare Advantage esattamente per quel piano.
La famiglia del paziente con metaemoglobinemia non ha perso perché un algoritmo ha commesso un errore. Ha perso, temporaneamente, perché il sistema non era in grado di spiegarsi e nessun umano nel ciclo era libero di ribaltare la decisione. Costruisci il sistema in modo che possa spiegarsi, e libera l'umano di poter ribaltare la decisione, e non stai più sperando che l'ordine di discovery non arrivi mai. Sei pronto per esso.


