Motore di ragionamento per l'eleggibilità agli studi clinici

Motore di ragionamento per l'eleggibilità agli studi clinici

Un modello di matching dei pazienti legge una nota come testo, così confonde un catetere venoso centrale con un cateterismo cardiaco ed esclude un paziente che era eleggibile. TrialProof lascia che un LLM legga solo la nota, risolve il significato attraverso un grafo di conoscenza SNOMED-CT e calcola ELIGIBLE, EXCLUDED o NEEDS-REVIEW in codice deterministico che un LLM non può sovrascrivere. Ogni verdetto porta una traccia di ragionamento che un regolatore può depositare.

100%

Accuratezza delle decisioni sul gold set etichettato

vs 53.8% per la baseline lessicale equa (13 casi)

0 vs 3

Pazienti eleggibili persi

TrialProof ne perde 0 dove la baseline ne perde 3

100% vs 0%

Copertura delle tracce di ragionamento

Ogni verdetto tracciato; identico a livello di byte a ogni riesecuzione

Questa è una demo eseguibile su un gold set fisso ed etichettato. Tutti i pazienti, le note e i protocolli sono sintetici, l'ontologia è un sottografo SNOMED-CT curato di 24 concetti e i connettori come l'ingestione FHIR live sono simulati.

Il paziente eleggibile che il tuo matcher scarta

La modalità di fallimento dietro le esclusioni indebite nel matching AI dei pazienti.

L'AI di matching dei pazienti legge le note cliniche come testo, così confonde parole che si assomigliano ma significano cose diverse dal punto di vista medico. Il fallimento canonico è concreto. Uno studio di Fase III su anticoagulanti esclude il cateterismo cardiaco; la nota di un paziente indica il posizionamento di un catetere venoso centrale. Un matcher di similarità vede due procedure cardiovascolari con catetere, assegna un punteggio alto ed esclude un paziente che era eleggibile. Valutazioni pubblicate confermano che i modelli di AI commettono esattamente questo errore di cateterismo (Fierce Biotech, 2025).

La stessa classe di errore è più ampia di una sola procedura. Copre la negazione, dove nessuna evidenza di diabete viene abbinata come diabete. Copre l'anamnesi familiare attribuita al paziente. E copre le clausole di eccezione, come a meno che non sia stato completato più di 12 mesi prima della randomizzazione, che un punteggio di similarità non può rappresentare affatto. Un modello di base migliore non elimina nessuno di questi, perché non sono problemi di linguaggio. Sono problemi di logica.

Il costo non è accademico. Il ritardo di arruolamento vale 800,000 dollars al giorno in vendite di prescrizione perse per ogni giorno in cui uno studio slitta (Tufts CSDD Impact Report, 2024), salendo a 840,000 dollars al giorno in oncologia e 1.4 million dollars al giorno negli studi cardiovascolari (Tufts CSDD). L'80% degli studi manca le tempistiche di arruolamento (industry consensus, 2025), lo screen failure medio costa 1,200 dollars (Antidote.me, 2025) e le procedure degli studi sono diventate il 139% più complesse dal 2005 (IQVIA, 2026). Di fronte a numeri come questi, un paziente eleggibile scartato per errore allo screening non è un errore di arrotondamento.

Come funziona TrialProof

Gli agenti consigliano sull'estrazione. Il codice deterministico decide l'eleggibilità. Questo è neuro-simbolico: un LLM legge la prosa, la logica simbolica governa il paziente.

Ogni paziente viene valutato rispetto a ogni protocollo in cinque fasi, trasmesse in diretta all'interfaccia. Il confine importante è che una sola fase è probabilistica, e non decide mai nulla.

1. Lettura della cartella

Carica il record paziente sintetico in forma FHIR, la sua nota in testo libero, i criteri dello studio e la data di randomizzazione.

2. Estrazione dei fatti (l'unico passo probabilistico, solo consultivo)

Un LLM sostituibile dal provider propone fatti candidati, ciascuno con uno span verbatim della nota, un SCTID candidato tratto da un vocabolario chiuso e un livello di confidenza. Consiglia; non decide. Le osservazioni codificate che arrivano come FHIR attendibile non passano mai dall'estrattore. Quando si usa il fallback del lessico offline, la console live lo dichiara invece di nasconderlo.

3. Verifica dei fatti (verificatore avversariale)

Ogni fatto proposto è messo in discussione rispetto alla nota letterale con tre controlli: span-present (che intercetta un'entità allucinata), negazione e soggetto (anamnesi familiare versus paziente). I fatti rifiutati sono contrassegnati REJECTED con il controllo che è scattato e il motivo, e non raggiungono mai la decisione.

4. Assemblaggio delle evidenze

L'insieme esatto di fatti verificati che entra nel motore logico, contrassegnato come FHIR-codificato versus testo libero.

5. Calcolo dei verdetti (Python deterministico, fuori dal framework degli agenti)

Un motore di logica deontica valuta i criteri di divieto, eccezione temporale, unless controllato e requisito tramite sussunzione is-a SNOMED e calcolo sulle date, ed emette ELIGIBLE, EXCLUDED o NEEDS-REVIEW con una traccia completa. Un LLM non può sovrascrivere questo gate.

Le fasi deterministiche girano davvero in decine di microsecondi per criterio, mentre il modello che legge la nota impiega secondi. Quel contrasto è il punto, non una pretesa di screening istantaneo: la parte lenta e fallibile è confinata alla lettura, e la decisione che questa alimenta è veloce, economica e riproducibile.

Il confronto nella demo è una baseline lessicale equa, e lo è di proposito. È similarità coseno TF-IDF a livello di entità, un vero metodo di similarità vettoriale, con un setup generoso di risoluzione pulita da entità a concetto, e la sua soglia di decisione convalidata in cross-validation a proprio vantaggio (t = 0.6932). Non chiama mai l'LLM. I suoi unici handicap sono l'assenza di gerarchia, di negazione, di logica temporale e di astensione, e questa è l'intera tesi. Non è stata tarata per fallire.

Il ragionamento, svolto da un capo all'altro

Il paziente sintetico P-074 e la sua coorte, rispetto ai protocolli sintetici ONC-204 e ANTI-3. Ogni immagine sotto è uno screenshot dell'app TrialProof in esecuzione.

Una linea centrale non è un cateterismo cardiaco, e solo una gerarchia lo sa

La nota di terapia intensiva di P-074 recita posizionamento di catetere venoso centrale per accesso alla terapia EV. Rispetto al criterio EXCL-CARDCATH di ANTI-3 (nessun cateterismo cardiaco precedente), un matcher di similarità vede due procedure cardiovascolari con catetere. TrialProof interroga invece l'ontologia: Central venous catheterization (392230005) è un discendente is-a di Cardiac catheterization (41976001)? Non lo è. I due concetti stanno su rami diversi della gerarchia SNOMED-CT, quindi non esiste un percorso di sussunzione, e il verdetto è ELIGIBLE con una traccia in tre passi che nomina entrambi gli SCTID. Entrambi i codici sono reali e verificabili su qualsiasi browser SNOMED pubblico. Anche la baseline lessicale equa restituisce ELIGIBLE qui, ma a una similarità nuda di 0.437, senza traccia di ragionamento e senza nulla che un regolatore possa depositare.

Traccia di ragionamento TrialProof per EXCL-CARDCATH che mostra che Central venous catheterization 392230005 is-NOT-a Cardiac catheterization 41976001, su un ramo diverso della gerarchia, quindi il verdetto è ELIGIBLE, accanto alla similarità nuda della baseline di 0.437 senza provenienza.
La traccia del cateterismo cardiaco: un controllo is-a su SCTID reali decide ELIGIBLE, dove la baseline offre una similarità nuda di 0.437 e nessuna provenienza.

L'ontologia che il motore interroga davvero

Il motore non interroga tutto SNOMED-CT. Percorre un sottografo curato di 24 concetti con 22 relazioni is-a. I concetti con un SCTID reale sono disegnati a tratto continuo; i 9 curati per la demo senza SCTID pubblico sono prefissati CUR- e disegnati a tratteggio, anziché spacciati per codici reali. I fatti verificati sono verdi, i concetti dei criteri sono contornati e i percorsi is-a percorsi sono in grassetto. I due cateterismi stanno visibilmente su rami diversi, ed è esattamente per questo che una similarità di stringa o vettoriale non può sostituire la sussunzione.

Il sottografo SNOMED-CT curato di 24 concetti con 22 relazioni is-a, che mostra Cardiac catheterization e Central venous catheterization su rami diversi, SCTID reali disegnati a tratto continuo e concetti CUR- curati per la demo disegnati a tratteggio.
Il sottografo SNOMED-CT, 24 concetti e 22 relazioni is-a, con i due cateterismi su rami distinti.

Il paziente eleggibile che la baseline scarta

La stessa nota dice Nessuna evidenza di diabete. Rispetto a EXCL-DM di ONC-204 (nessuna diagnosi di diabete mellito), la baseline vettoriale abbina il token diabetes a similarità 1.0 e restituisce EXCLUDED, perché non ha un modello della negazione. Il verificatore di TrialProof rimuove la menzione negata prima che possa raggiungere la decisione, quindi il verdetto è ELIGIBLE. Questo è il paziente eleggibile che un matcher di similarità scarta, e sul gold set è uno dei tre che la baseline perde.

La traccia di ragionamento EXCL-DM per una nota che dice Nessuna evidenza di diabete: la baseline abbina diabetes a similarità 1.0 e restituisce EXCLUDED, mentre TrialProof rimuove la menzione negata e restituisce ELIGIBLE.
Negazione: la baseline esclude a similarità 1.0; TrialProof rimuove la menzione negata e mantiene il paziente eleggibile.

Un verificatore che mette in discussione l'estrattore

Per P-106 l'estrattore propone un fatto carboplatin che non ha alcuno span di supporto nella nota, un'allucinazione deliberatamente inserita. Il verificatore avversariale esegue span-present, negazione e soggetto su ogni fatto proposto; il fatto carboplatin fallisce span-present (span not found in note) e viene contrassegnato REJECTED, quindi non raggiunge mai la decisione. Sul gold set il verificatore ha rifiutato 7 istanze di fatto (3 fatti errati distinti: una menzione negata di diabete, un'attribuzione di carcinoma mammario da anamnesi familiare e questo carboplatin allucinato) su 4 delle 13 esecuzioni di caso valutate. Gli agenti consigliano sull'estrazione; il codice deterministico decide l'eleggibilità.

Il pannello verify-facts per P-106 che mostra un fatto carboplatin contrassegnato REJECTED, controllo fallito span-present, motivo span not found in note, così l'entità allucinata non raggiunge mai la decisione di eleggibilità.
Il verificatore rifiuta un carboplatin allucinato su span-present prima che possa raggiungere una decisione.

Un'eccezione che un punteggio di similarità non può rappresentare

P-101 ha completato carboplatin e pemetrexed adiuvanti, ultima infusione 03/2025. EXCL-PLAT di ONC-204 vieta la terapia precedente a base di platino a meno che non sia stata somministrata come adiuvante o neoadiuvante e completata più di 12 mesi prima della randomizzazione (2026-04-15). Il motore conferma che Carboplatin (386905003) is-a Platinum-containing antineoplastic agent, calcola l'intervallo a 13 mesi, soddisfa l'eccezione e restituisce ELIGIBLE con una traccia in quattro passi. Quando la stessa clausola è testata su un paziente con intento palliativo, l'eccezione non si applica e il verdetto passa a EXCLUDED. Stesso criterio, verdetti opposti, entrambi corretti, perché è il motore logico e non una soglia.

La traccia di ragionamento EXCL-PLAT per P-101 che mostra Carboplatin 386905003 is-a Platinum-containing antineoplastic agent, intento adiuvante, intervallo di 13 mesi maggiore di 12, quindi l'eccezione è soddisfatta e il verdetto è ELIGIBLE.
Eccezione temporale soddisfatta: platino adiuvante completato 13 mesi prima della randomizzazione, calcolato con il calcolo sulle date.

Il numero a cui tiene davvero un responsabile delle clinical operations

Su un gold set fisso di 13 casi etichettati tratti da 7 pazienti sintetici su 2 protocolli sintetici, valutato rispetto alla baseline lessicale convalidata in cross-validation a t = 0.6932, TrialProof ottiene il 100% di accuratezza delle decisioni contro il 53.8% della baseline, perde 0 pazienti eleggibili dove la baseline ne perde 3 e porta una traccia di ragionamento riproducibile sul 100% delle decisioni contro lo 0% della baseline. Si astiene in sicurezza due volte con NEEDS-REVIEW dove la baseline indovina, e rieseguire tutti i 13 casi produce verdetti e tracce identici a livello di byte (13 su 13). Attribuiamo ogni cifra a questo gold set etichettato, mai come pretesa open-world.

Le tessere di benchmark del gold set: accuratezza delle decisioni 100% versus 53.8% della baseline, recall dei pazienti eleggibili 100% versus 66.7%, pazienti eleggibili persi 0 versus 3 e copertura delle tracce verificabili 100% versus 0%, con una nota di riproducibilità: rieseguire 13 casi produce verdetti identici a livello di byte.
Il gold set etichettato di 13 casi: accuratezza 100% vs 53.8%, 0 vs 3 pazienti eleggibili persi, copertura delle tracce 100% vs 0%, identico a livello di byte a ogni riesecuzione.

Similarità vettoriale versus un motore di ragionamento

Lo stesso confronto che la demo valuta, dimensione per dimensione.

Dimensione Baseline lessicale equa TrialProof
Chi decide l'eleggibilità Un punteggio di similarità sopra una soglia Un motore deterministico di logica deontica, fuori dagli agenti
Gerarchia / is-a Nessuna, solo prossimità di token Sussunzione is-a SNOMED-CT
Negazione (nessuna evidenza di diabete) Abbinata come presente Rimossa dal verificatore
Attribuzione dell'anamnesi familiare Attribuita al paziente Rifiutata dal controllo sul soggetto
Clausole di eccezione temporale Non rappresentabili Calcolo sulle date rispetto alla data di randomizzazione
Lab o vitale mancante Indovina, non si astiene mai NEEDS-REVIEW, indicando ciò che manca
Traccia di ragionamento Nessuna, un nudo numero di similarità Traccia completa, esportata come CDISC SDTM IE
Riproducibilità Non applicabile Identico a livello di byte a ogni riesecuzione (13 su 13)

Cosa questa demo non fa

  • ✓ Non pretende di essere accurata al 100% in senso universale. La cifra del 100% è l'accuratezza delle decisioni su un gold set etichettato fisso di 13 casi, mai una garanzia open-world e mai una promessa di essere nel giusto su ogni cartella.
  • ✓ Non presenta i suoi pazienti come reali. Tutti i pazienti, le note e i protocolli sono sintetici, senza PHI, senza EHR live e senza uno studio reale. P-074 e P-101–P-106, ONC-204 e ANTI-3 sono fixture fabbricate.
  • ✓ Non usa SNOMED-CT per intero. L'ontologia è un sottografo curato di 24 concetti (15 SCTID reali, 9 curati e disegnati a tratteggio). SNOMED-CT completo, MedDRA e LOINC sono il percorso di produzione differito.
  • ✓ Non usa connettori live. L'ingestione FHIR R4 da EHR, lo store a grafo e l'LLM clinico sono simulati o sostituibili dal provider. Epic App Orchard e Oracle live FHIR, i connettori CTMS e l'hardening SOC 2 o HIPAA BAA sono differiti.
  • ✓ Non è FDA-cleared, CDS-exempt, certificata HIPAA o certificata SOC 2. Le linee guida FDA Clinical Decision Support del gennaio 2026 sono il nostro allineamento e la nostra direzione, non una clearance. Questo non è un consiglio medico e non prende decisioni cliniche.
  • ✓ Non include clienti, sponsor, CRO, progetti pilota, testimonianze o cifre di ROI. Non ne esistono. Questa è una demo che prova il meccanismo, non un deployment.

Domande che i potenziali clienti fanno davvero

In cosa è diverso dal matching dei pazienti di Deep 6, Tempus o IQVIA?

TrialProof non è una rete di dati né una piattaforma cloud di matching, e non è un clone di quegli strumenti. È il livello di ragionamento deterministico e di provenienza che a quelli manca: la parte che rende il verdetto di eleggibilità calcolabile, verificabile e depositabile. Una piattaforma di matching ti consegna una lista ordinata con un punteggio; TrialProof ti consegna ELIGIBLE, EXCLUDED o NEEDS-REVIEW con gli ID di concetto SNOMED e l'arco del grafo che l'ha deciso. È pensato per stare accanto a una pipeline di matching, non per sostituire la rete di dati sotto di essa.

Perché l'AI di matching dei pazienti esclude pazienti eleggibili?

Perché legge una nota clinica come testo e valuta la similarità, così confonde parole che si assomigliano ma significano cose diverse dal punto di vista medico. Una nota che indica il posizionamento di un catetere venoso centrale ottiene un punteggio alto rispetto a uno studio che esclude il cateterismo cardiaco, e il paziente viene escluso per errore. Lo stesso fallimento copre la negazione (nessuna evidenza di diabete abbinata come diabete), l'anamnesi familiare attribuita al paziente e le clausole di eccezione che un punteggio di similarità non può rappresentare affatto. Valutazioni pubblicate confermano che i modelli di AI commettono esattamente questo errore di cateterismo (Fierce Biotech, 2025).

Posso ottenere un audit trail che un regolatore possa depositare per ogni decisione di eleggibilità?

Sì. Ogni decisione viene esportata come record CDISC SDTM IE in JSON e CSV, una riga per paziente e criterio, con il criterio, il verdetto e la traccia di ragionamento deterministica completa che nomina gli SCTID e l'operazione deontica. Dove un fatto ha fatto match, la riga porta anche il percorso is-a e, per i fatti derivati dalla nota, lo span verbatim. Sul gold set di 13 casi, il 100% delle decisioni TrialProof porta una traccia riproducibile e la baseline ne porta lo 0%, e rieseguire il set produce un output identico a livello di byte (13 su 13).

Usa codici SNOMED reali o inventati?

Ogni concetto che la demo cita per una decisione porta un SCTID reale, verificabile su qualsiasi browser SNOMED pubblico: Central venous catheterization è 392230005 e Cardiac catheterization è 41976001, e stanno su rami diversi, ed è per questo che nessun percorso di sussunzione li collega. Il motore interroga un sottografo curato di 24 concetti con 22 relazioni is-a, non SNOMED-CT per intero. I 9 concetti curati per la demo senza SCTID pubblico sono prefissati CUR- e disegnati a tratteggio, anziché spacciati per codici reali. SNOMED-CT completo, MedDRA e LOINC sono il percorso di produzione differito.

I dati dei pazienti sono reali, e questo è conforme a HIPAA?

Tutti i dati sono sintetici. Non c'è PHI reale, nessun EHR live e nessuno studio reale; i pazienti, le note e i protocolli sono fixture fabbricate. Questa è una demo eseguibile che prova il meccanismo, non una pipeline in produzione, quindi non è certificata HIPAA, certificata SOC 2, FDA-cleared o CDS-exempt, e non prende decisioni cliniche. Le linee guida FDA Clinical Decision Support del gennaio 2026 sono il quadro rilevante per un ausilio di matching con human-in-the-loop, e sono la nostra direzione, non una clearance che deteniamo.

Un LLM migliore non risolverebbe semplicemente questo?

No, perché questi non sono problemi di linguaggio, sono problemi di logica. Un punteggio di similarità non può rappresentare is-a, non può rappresentare not e non può rappresentare a meno che non sia stato completato più di dodici mesi prima della randomizzazione, e nessuna quantità di prompting o di contesto li aggiunge. Così lasciamo al modello fare l'unica cosa in cui è davvero bravo, leggere prosa disordinata e proporre fatti con lo span da cui li ha letti, poi un verificatore avversariale scarta ciò che la nota non supporta, e il codice deterministico su un'ontologia medica calcola il verdetto. L'LLM non può sovrascrivere quel gate, ed è questo che fa sì che la stessa cartella produca la stessa risposta a ogni esecuzione.

Cosa significa davvero la cifra di accuratezza del 100%?

È il 100% di accuratezza delle decisioni su un gold set etichettato fisso di 13 casi, tratti da 7 pazienti sintetici su 2 protocolli sintetici, valutato rispetto a una baseline lessicale equa la cui soglia è stata convalidata in cross-validation a proprio vantaggio (t = 0.6932). Non è mai una pretesa universale o open-world, e non è la stessa cosa che questo prodotto sia nel giusto su ogni cartella possibile. Su quello stesso set TrialProof perde 0 pazienti eleggibili dove la baseline ne perde 3, e si astiene in sicurezza due volte con NEEDS-REVIEW anziché indovinare.

Ricerca tecnica

La ricerca dietro questa demo — l'architettura, il disegno di verifica e il blueprint enterprise.

Abbinare i pazienti agli studi senza una traccia che un regolatore possa depositare?

Il livello di ragionamento deterministico e di provenienza è la parte difficile. Lo costruiamo noi.

Se il tuo team sta valutando come mettere una decisione di eleggibilità di fronte a un regolatore senza chiedergli di fidarsi di un punteggio di similarità, ci farebbe davvero piacere sentire come ci state pensando. Il problema è di tutto il settore e lo saranno anche le risposte.

Assessment del ragionamento di eleggibilità

  • ✓ Mappa dove il tuo matcher dei pazienti può escludere un paziente eleggibile
  • ✓ Separa ciò che l'LLM deve estrarre da ciò che il codice deve decidere
  • ✓ Definisci l'ontologia, la negazione e le regole temporali di cui i tuoi protocolli hanno bisogno
  • ✓ Specifica la traccia CDISC SDTM IE che il tuo team regolatorio può depositare

Costruisci il livello di ragionamento

  • ✓ Un motore deterministico di logica deontica sulla tua ontologia reale
  • ✓ Un verificatore avversariale per negazione, soggetto e fatti allucinati
  • ✓ Sussunzione SNOMED-CT più calcolo sulle date, riproducibile a ogni riesecuzione
  • ✓ Estrazione sostituibile dal provider, con il modello che non sovrascrive mai un verdetto
Social

Pubblicato anche su