Motore di ragionamento per l'eleggibilità agli studi clinici
Un modello di matching dei pazienti legge una nota come testo, così confonde un catetere venoso centrale con un cateterismo cardiaco ed esclude un paziente che era eleggibile. TrialProof lascia che un LLM legga solo la nota, risolve il significato attraverso un grafo di conoscenza SNOMED-CT e calcola ELIGIBLE, EXCLUDED o NEEDS-REVIEW in codice deterministico che un LLM non può sovrascrivere. Ogni verdetto porta una traccia di ragionamento che un regolatore può depositare.
100%
Accuratezza delle decisioni sul gold set etichettato
vs 53.8% per la baseline lessicale equa (13 casi)
0 vs 3
Pazienti eleggibili persi
TrialProof ne perde 0 dove la baseline ne perde 3
100% vs 0%
Copertura delle tracce di ragionamento
Ogni verdetto tracciato; identico a livello di byte a ogni riesecuzione
Questa è una demo eseguibile su un gold set fisso ed etichettato. Tutti i pazienti, le note e i protocolli sono sintetici, l'ontologia è un sottografo SNOMED-CT curato di 24 concetti e i connettori come l'ingestione FHIR live sono simulati.
La modalità di fallimento dietro le esclusioni indebite nel matching AI dei pazienti.
L'AI di matching dei pazienti legge le note cliniche come testo, così confonde parole che si assomigliano ma significano cose diverse dal punto di vista medico. Il fallimento canonico è concreto. Uno studio di Fase III su anticoagulanti esclude il cateterismo cardiaco; la nota di un paziente indica il posizionamento di un catetere venoso centrale. Un matcher di similarità vede due procedure cardiovascolari con catetere, assegna un punteggio alto ed esclude un paziente che era eleggibile. Valutazioni pubblicate confermano che i modelli di AI commettono esattamente questo errore di cateterismo (Fierce Biotech, 2025).
La stessa classe di errore è più ampia di una sola procedura. Copre la negazione, dove nessuna evidenza di diabete viene abbinata come diabete. Copre l'anamnesi familiare attribuita al paziente. E copre le clausole di eccezione, come a meno che non sia stato completato più di 12 mesi prima della randomizzazione, che un punteggio di similarità non può rappresentare affatto. Un modello di base migliore non elimina nessuno di questi, perché non sono problemi di linguaggio. Sono problemi di logica.
Il costo non è accademico. Il ritardo di arruolamento vale 800,000 dollars al giorno in vendite di prescrizione perse per ogni giorno in cui uno studio slitta (Tufts CSDD Impact Report, 2024), salendo a 840,000 dollars al giorno in oncologia e 1.4 million dollars al giorno negli studi cardiovascolari (Tufts CSDD). L'80% degli studi manca le tempistiche di arruolamento (industry consensus, 2025), lo screen failure medio costa 1,200 dollars (Antidote.me, 2025) e le procedure degli studi sono diventate il 139% più complesse dal 2005 (IQVIA, 2026). Di fronte a numeri come questi, un paziente eleggibile scartato per errore allo screening non è un errore di arrotondamento.
Gli agenti consigliano sull'estrazione. Il codice deterministico decide l'eleggibilità. Questo è neuro-simbolico: un LLM legge la prosa, la logica simbolica governa il paziente.
Ogni paziente viene valutato rispetto a ogni protocollo in cinque fasi, trasmesse in diretta all'interfaccia. Il confine importante è che una sola fase è probabilistica, e non decide mai nulla.
Carica il record paziente sintetico in forma FHIR, la sua nota in testo libero, i criteri dello studio e la data di randomizzazione.
Un LLM sostituibile dal provider propone fatti candidati, ciascuno con uno span verbatim della nota, un SCTID candidato tratto da un vocabolario chiuso e un livello di confidenza. Consiglia; non decide. Le osservazioni codificate che arrivano come FHIR attendibile non passano mai dall'estrattore. Quando si usa il fallback del lessico offline, la console live lo dichiara invece di nasconderlo.
Ogni fatto proposto è messo in discussione rispetto alla nota letterale con tre controlli: span-present (che intercetta un'entità allucinata), negazione e soggetto (anamnesi familiare versus paziente). I fatti rifiutati sono contrassegnati REJECTED con il controllo che è scattato e il motivo, e non raggiungono mai la decisione.
L'insieme esatto di fatti verificati che entra nel motore logico, contrassegnato come FHIR-codificato versus testo libero.
Un motore di logica deontica valuta i criteri di divieto, eccezione temporale, unless controllato e requisito tramite sussunzione is-a SNOMED e calcolo sulle date, ed emette ELIGIBLE, EXCLUDED o NEEDS-REVIEW con una traccia completa. Un LLM non può sovrascrivere questo gate.
Le fasi deterministiche girano davvero in decine di microsecondi per criterio, mentre il modello che legge la nota impiega secondi. Quel contrasto è il punto, non una pretesa di screening istantaneo: la parte lenta e fallibile è confinata alla lettura, e la decisione che questa alimenta è veloce, economica e riproducibile.
Il confronto nella demo è una baseline lessicale equa, e lo è di proposito. È similarità coseno TF-IDF a livello di entità, un vero metodo di similarità vettoriale, con un setup generoso di risoluzione pulita da entità a concetto, e la sua soglia di decisione convalidata in cross-validation a proprio vantaggio (t = 0.6932). Non chiama mai l'LLM. I suoi unici handicap sono l'assenza di gerarchia, di negazione, di logica temporale e di astensione, e questa è l'intera tesi. Non è stata tarata per fallire.
Il paziente sintetico P-074 e la sua coorte, rispetto ai protocolli sintetici ONC-204 e ANTI-3. Ogni immagine sotto è uno screenshot dell'app TrialProof in esecuzione.
La nota di terapia intensiva di P-074 recita posizionamento di catetere venoso centrale per accesso alla terapia EV. Rispetto al criterio EXCL-CARDCATH di ANTI-3 (nessun cateterismo cardiaco precedente), un matcher di similarità vede due procedure cardiovascolari con catetere. TrialProof interroga invece l'ontologia: Central venous catheterization (392230005) è un discendente is-a di Cardiac catheterization (41976001)? Non lo è. I due concetti stanno su rami diversi della gerarchia SNOMED-CT, quindi non esiste un percorso di sussunzione, e il verdetto è ELIGIBLE con una traccia in tre passi che nomina entrambi gli SCTID. Entrambi i codici sono reali e verificabili su qualsiasi browser SNOMED pubblico. Anche la baseline lessicale equa restituisce ELIGIBLE qui, ma a una similarità nuda di 0.437, senza traccia di ragionamento e senza nulla che un regolatore possa depositare.
Il motore non interroga tutto SNOMED-CT. Percorre un sottografo curato di 24 concetti con 22 relazioni is-a. I concetti con un SCTID reale sono disegnati a tratto continuo; i 9 curati per la demo senza SCTID pubblico sono prefissati CUR- e disegnati a tratteggio, anziché spacciati per codici reali. I fatti verificati sono verdi, i concetti dei criteri sono contornati e i percorsi is-a percorsi sono in grassetto. I due cateterismi stanno visibilmente su rami diversi, ed è esattamente per questo che una similarità di stringa o vettoriale non può sostituire la sussunzione.
La stessa nota dice Nessuna evidenza di diabete. Rispetto a EXCL-DM di ONC-204 (nessuna diagnosi di diabete mellito), la baseline vettoriale abbina il token diabetes a similarità 1.0 e restituisce EXCLUDED, perché non ha un modello della negazione. Il verificatore di TrialProof rimuove la menzione negata prima che possa raggiungere la decisione, quindi il verdetto è ELIGIBLE. Questo è il paziente eleggibile che un matcher di similarità scarta, e sul gold set è uno dei tre che la baseline perde.
Per P-106 l'estrattore propone un fatto carboplatin che non ha alcuno span di supporto nella nota, un'allucinazione deliberatamente inserita. Il verificatore avversariale esegue span-present, negazione e soggetto su ogni fatto proposto; il fatto carboplatin fallisce span-present (span not found in note) e viene contrassegnato REJECTED, quindi non raggiunge mai la decisione. Sul gold set il verificatore ha rifiutato 7 istanze di fatto (3 fatti errati distinti: una menzione negata di diabete, un'attribuzione di carcinoma mammario da anamnesi familiare e questo carboplatin allucinato) su 4 delle 13 esecuzioni di caso valutate. Gli agenti consigliano sull'estrazione; il codice deterministico decide l'eleggibilità.
P-101 ha completato carboplatin e pemetrexed adiuvanti, ultima infusione 03/2025. EXCL-PLAT di ONC-204 vieta la terapia precedente a base di platino a meno che non sia stata somministrata come adiuvante o neoadiuvante e completata più di 12 mesi prima della randomizzazione (2026-04-15). Il motore conferma che Carboplatin (386905003) is-a Platinum-containing antineoplastic agent, calcola l'intervallo a 13 mesi, soddisfa l'eccezione e restituisce ELIGIBLE con una traccia in quattro passi. Quando la stessa clausola è testata su un paziente con intento palliativo, l'eccezione non si applica e il verdetto passa a EXCLUDED. Stesso criterio, verdetti opposti, entrambi corretti, perché è il motore logico e non una soglia.
Su un gold set fisso di 13 casi etichettati tratti da 7 pazienti sintetici su 2 protocolli sintetici, valutato rispetto alla baseline lessicale convalidata in cross-validation a t = 0.6932, TrialProof ottiene il 100% di accuratezza delle decisioni contro il 53.8% della baseline, perde 0 pazienti eleggibili dove la baseline ne perde 3 e porta una traccia di ragionamento riproducibile sul 100% delle decisioni contro lo 0% della baseline. Si astiene in sicurezza due volte con NEEDS-REVIEW dove la baseline indovina, e rieseguire tutti i 13 casi produce verdetti e tracce identici a livello di byte (13 su 13). Attribuiamo ogni cifra a questo gold set etichettato, mai come pretesa open-world.
Lo stesso confronto che la demo valuta, dimensione per dimensione.
| Dimensione | Baseline lessicale equa | TrialProof |
|---|---|---|
| Chi decide l'eleggibilità | Un punteggio di similarità sopra una soglia | Un motore deterministico di logica deontica, fuori dagli agenti |
| Gerarchia / is-a | Nessuna, solo prossimità di token | Sussunzione is-a SNOMED-CT |
| Negazione (nessuna evidenza di diabete) | Abbinata come presente | Rimossa dal verificatore |
| Attribuzione dell'anamnesi familiare | Attribuita al paziente | Rifiutata dal controllo sul soggetto |
| Clausole di eccezione temporale | Non rappresentabili | Calcolo sulle date rispetto alla data di randomizzazione |
| Lab o vitale mancante | Indovina, non si astiene mai | NEEDS-REVIEW, indicando ciò che manca |
| Traccia di ragionamento | Nessuna, un nudo numero di similarità | Traccia completa, esportata come CDISC SDTM IE |
| Riproducibilità | Non applicabile | Identico a livello di byte a ogni riesecuzione (13 su 13) |
TrialProof non è una rete di dati né una piattaforma cloud di matching, e non è un clone di quegli strumenti. È il livello di ragionamento deterministico e di provenienza che a quelli manca: la parte che rende il verdetto di eleggibilità calcolabile, verificabile e depositabile. Una piattaforma di matching ti consegna una lista ordinata con un punteggio; TrialProof ti consegna ELIGIBLE, EXCLUDED o NEEDS-REVIEW con gli ID di concetto SNOMED e l'arco del grafo che l'ha deciso. È pensato per stare accanto a una pipeline di matching, non per sostituire la rete di dati sotto di essa.
Perché legge una nota clinica come testo e valuta la similarità, così confonde parole che si assomigliano ma significano cose diverse dal punto di vista medico. Una nota che indica il posizionamento di un catetere venoso centrale ottiene un punteggio alto rispetto a uno studio che esclude il cateterismo cardiaco, e il paziente viene escluso per errore. Lo stesso fallimento copre la negazione (nessuna evidenza di diabete abbinata come diabete), l'anamnesi familiare attribuita al paziente e le clausole di eccezione che un punteggio di similarità non può rappresentare affatto. Valutazioni pubblicate confermano che i modelli di AI commettono esattamente questo errore di cateterismo (Fierce Biotech, 2025).
Sì. Ogni decisione viene esportata come record CDISC SDTM IE in JSON e CSV, una riga per paziente e criterio, con il criterio, il verdetto e la traccia di ragionamento deterministica completa che nomina gli SCTID e l'operazione deontica. Dove un fatto ha fatto match, la riga porta anche il percorso is-a e, per i fatti derivati dalla nota, lo span verbatim. Sul gold set di 13 casi, il 100% delle decisioni TrialProof porta una traccia riproducibile e la baseline ne porta lo 0%, e rieseguire il set produce un output identico a livello di byte (13 su 13).
Ogni concetto che la demo cita per una decisione porta un SCTID reale, verificabile su qualsiasi browser SNOMED pubblico: Central venous catheterization è 392230005 e Cardiac catheterization è 41976001, e stanno su rami diversi, ed è per questo che nessun percorso di sussunzione li collega. Il motore interroga un sottografo curato di 24 concetti con 22 relazioni is-a, non SNOMED-CT per intero. I 9 concetti curati per la demo senza SCTID pubblico sono prefissati CUR- e disegnati a tratteggio, anziché spacciati per codici reali. SNOMED-CT completo, MedDRA e LOINC sono il percorso di produzione differito.
Tutti i dati sono sintetici. Non c'è PHI reale, nessun EHR live e nessuno studio reale; i pazienti, le note e i protocolli sono fixture fabbricate. Questa è una demo eseguibile che prova il meccanismo, non una pipeline in produzione, quindi non è certificata HIPAA, certificata SOC 2, FDA-cleared o CDS-exempt, e non prende decisioni cliniche. Le linee guida FDA Clinical Decision Support del gennaio 2026 sono il quadro rilevante per un ausilio di matching con human-in-the-loop, e sono la nostra direzione, non una clearance che deteniamo.
No, perché questi non sono problemi di linguaggio, sono problemi di logica. Un punteggio di similarità non può rappresentare is-a, non può rappresentare not e non può rappresentare a meno che non sia stato completato più di dodici mesi prima della randomizzazione, e nessuna quantità di prompting o di contesto li aggiunge. Così lasciamo al modello fare l'unica cosa in cui è davvero bravo, leggere prosa disordinata e proporre fatti con lo span da cui li ha letti, poi un verificatore avversariale scarta ciò che la nota non supporta, e il codice deterministico su un'ontologia medica calcola il verdetto. L'LLM non può sovrascrivere quel gate, ed è questo che fa sì che la stessa cartella produca la stessa risposta a ogni esecuzione.
È il 100% di accuratezza delle decisioni su un gold set etichettato fisso di 13 casi, tratti da 7 pazienti sintetici su 2 protocolli sintetici, valutato rispetto a una baseline lessicale equa la cui soglia è stata convalidata in cross-validation a proprio vantaggio (t = 0.6932). Non è mai una pretesa universale o open-world, e non è la stessa cosa che questo prodotto sia nel giusto su ogni cartella possibile. Su quello stesso set TrialProof perde 0 pazienti eleggibili dove la baseline ne perde 3, e si astiene in sicurezza due volte con NEEDS-REVIEW anziché indovinare.
La ricerca dietro questa demo — l'architettura, il disegno di verifica e il blueprint enterprise.
Soluzione completa
Esplora la soluzione Clinical Trial Recruitment AI →Il livello di ragionamento deterministico e di provenienza è la parte difficile. Lo costruiamo noi.
Se il tuo team sta valutando come mettere una decisione di eleggibilità di fronte a un regolatore senza chiedergli di fidarsi di un punteggio di similarità, ci farebbe davvero piacere sentire come ci state pensando. Il problema è di tutto il settore e lo saranno anche le risposte.