Motor de raciocínio de elegibilidade para ensaios clínicos
Um modelo de pareamento de pacientes lê a nota como texto, então confunde um cateter venoso central com um cateterismo cardíaco e exclui um paciente que era elegível. O TrialProof deixa um LLM apenas ler a nota, resolve o significado por meio de um grafo de conhecimento SNOMED-CT e computa ELIGIBLE, EXCLUDED ou NEEDS-REVIEW em código determinístico que um LLM não pode sobrescrever. Cada veredito carrega uma trilha de raciocínio que um regulador pode protocolar.
100%
Acurácia de decisão no conjunto-ouro rotulado
vs 53.8% da linha de base lexical justa (13 casos)
0 vs 3
Pacientes elegíveis perdidos
O TrialProof perde 0 onde a linha de base perde 3
100% vs 0%
Cobertura da trilha de raciocínio
Cada veredito rastreado; idêntico em bytes na reexecução
Esta é uma demonstração executável em um conjunto-ouro rotulado e fixo. Todos os pacientes, notas e protocolos são sintéticos, a ontologia é um subgrafo SNOMED-CT curado de 24 conceitos, e conectores como ingestão FHIR ao vivo são simulados.
O modo de falha por trás das exclusões indevidas no pareamento de pacientes com IA.
A IA de pareamento de pacientes lê notas clínicas como texto, então confunde palavras que se parecem mas significam coisas diferentes medicamente. A falha canônica é concreta. Um ensaio de anticoagulante de Fase III exclui cateterismo cardíaco; a nota de um paciente diz colocação de cateter venoso central. Um pareador por similaridade vê dois procedimentos cardiovasculares com cateter, pontua alto e exclui um paciente que era elegível. Avaliações publicadas confirmam que modelos de IA cometem exatamente este erro de cateterismo (Fierce Biotech, 2025).
A mesma classe de erro é mais ampla do que um procedimento. Cobre a negação, em que nenhuma evidência de diabetes é pareada como diabetes. Cobre histórico familiar atribuído ao paciente. E cobre cláusulas de exceção, como a menos que concluído mais de 12 meses antes da randomização, que uma pontuação de similaridade não consegue representar de forma alguma. Um modelo-base melhor não remove nenhuma dessas, porque não são problemas de linguagem. São problemas de lógica.
O custo não é acadêmico. O atraso de recrutamento chega a 800,000 dólares por dia em vendas de prescrição perdidas para cada dia que um ensaio atrasa (Tufts CSDD Impact Report, 2024), subindo para 840,000 dólares por dia em oncologia e 1.4 milhão de dólares por dia em ensaios cardiovasculares (Tufts CSDD). 80% dos ensaios perdem seus prazos de recrutamento (consenso da indústria, 2025), a falha de triagem média custa 1,200 dólares (Antidote.me, 2025), e os procedimentos dos ensaios ficaram 139% mais complexos desde 2005 (IQVIA, 2026). Diante de números como esses, um paciente elegível indevidamente triado para fora não é um erro de arredondamento.
Os agentes aconselham na extração. Código determinístico decide a elegibilidade. Isto é neuro-simbólico: um LLM lê a prosa, a lógica simbólica rege o paciente.
Cada paciente é executado contra cada protocolo em cinco estágios, transmitidos ao vivo para a interface. O limite importante é que apenas um estágio é probabilístico, e ele nunca decide nada.
Carrega o registro sintético do paciente no formato FHIR, sua nota em texto livre, os critérios do ensaio e a data de randomização.
Um LLM substituível por provedor propõe fatos candidatos, cada um com um trecho literal da nota, um SCTID candidato extraído de um vocabulário fechado e uma confiança. Ele aconselha; não decide. Observações codificadas que chegam como FHIR confiável nunca passam pelo extrator. Quando o fallback de léxico offline é usado, o console ao vivo diz isso em vez de esconder.
Cada fato proposto é contestado contra a nota literal com três checagens: span-present (que captura uma entidade alucinada), negação e sujeito (histórico familiar versus paciente). Fatos rejeitados são marcados REJECTED com a checagem que disparou e o motivo, e nunca chegam à decisão.
O conjunto exato de fatos verificados que entra no motor de lógica, marcado FHIR-codificado versus texto livre.
Um motor de lógica deôntica avalia critérios de proibição, exceção temporal, controlled-unless e requisito via subsunção is-a SNOMED e matemática de datas, e emite ELIGIBLE, EXCLUDED ou NEEDS-REVIEW com uma trilha completa. Um LLM não pode sobrescrever este portão.
Os estágios determinísticos de fato rodam em dezenas de microssegundos por critério, enquanto o modelo que lê a nota leva segundos. Esse contraste é o ponto, não uma alegação de triagem instantânea: a parte lenta e falível fica confinada à leitura, e a decisão que ela alimenta é rápida, barata e reproduzível.
A comparação na demonstração é uma linha de base lexical justa, e deliberadamente. É similaridade de cosseno TF-IDF em nível de entidade, um método real de similaridade vetorial, com uma configuração generosa de resolução limpa entidade-para-conceito, e seu limiar de decisão validado cruzadamente em seu próprio favor (t = 0.6932). Nunca chama o LLM. Suas únicas desvantagens são a hierarquia, a negação, a lógica temporal e a abstenção ausentes, que é a tese inteira. Não foi ajustada para falhar.
Paciente sintético P-074 e sua coorte, contra os protocolos sintéticos ONC-204 e ANTI-3. Cada imagem abaixo é uma captura de tela do aplicativo TrialProof em execução.
A nota de UTI de P-074 registra colocação de cateter venoso central para acesso de medicação IV. Contra o critério EXCL-CARDCATH do ANTI-3 (sem cateterismo cardíaco prévio), um pareador por similaridade vê dois procedimentos cardiovasculares com cateter. O TrialProof pergunta à ontologia: o Cateterismo venoso central (392230005) é um descendente is-a de Cateterismo cardíaco (41976001)? Não é. Os dois conceitos estão em ramos diferentes da hierarquia SNOMED-CT, então nenhum caminho de subsunção existe, e o veredito é ELIGIBLE com uma trilha de três passos nomeando ambos os SCTIDs. Ambos os códigos são reais e verificáveis em qualquer navegador SNOMED público. A linha de base lexical justa também retorna ELIGIBLE aqui, mas com uma similaridade nua de 0.437, sem trilha de raciocínio e sem nada que um regulador pudesse protocolar.
O motor não consulta todo o SNOMED-CT. Ele percorre um subgrafo curado de 24 conceitos com 22 relações is-a. Conceitos com um SCTID real são desenhados sólidos; os 9 curados para a demonstração sem SCTID público são prefixados CUR- e desenhados tracejados em vez de passados como códigos reais. Fatos verificados são verdes, conceitos de critério são contornados, e os caminhos is-a percorridos estão em negrito. Os dois cateterismos visivelmente vivem em ramos diferentes, que é exatamente por que uma similaridade de string ou vetorial não pode substituir a subsunção.
A mesma nota diz Nenhuma evidência de diabetes. Contra o EXCL-DM do ONC-204 (sem diagnóstico de diabetes mellitus), a linha de base vetorial casa o token diabetes com similaridade 1.0 e retorna EXCLUDED, porque não tem modelo de negação. O verificador do TrialProof remove a menção negada antes que ela possa chegar à decisão, então o veredito é ELIGIBLE. Este é o paciente elegível que um pareador por similaridade descarta, e no conjunto-ouro é um dos três que a linha de base perde.
Para P-106 o extrator propõe um fato de carboplatina que não tem trecho de suporte na nota, uma alucinação plantada. O verificador adversarial executa span-present, negação e sujeito em cada fato proposto; o fato de carboplatina falha span-present (trecho não encontrado na nota) e é marcado REJECTED, então nunca chega à decisão. No conjunto-ouro o verificador rejeitou 7 instâncias de fato (3 fatos ruins distintos: uma menção negada de diabetes, uma atribuição de câncer de mama por histórico familiar, e esta carboplatina alucinada) em 4 das 13 execuções de caso pontuadas. Os agentes aconselham na extração; código determinístico decide a elegibilidade.
P-101 completou carboplatina e pemetrexede adjuvantes, última infusão em 03/2025. O EXCL-PLAT do ONC-204 proíbe terapia prévia com platina a menos que administrada como adjuvante ou neoadjuvante e concluída mais de 12 meses antes da randomização (2026-04-15). O motor confirma que Carboplatina (386905003) is-a Agente antineoplásico contendo platina, computa o intervalo em 13 meses, satisfaz a exceção e retorna ELIGIBLE com uma trilha de quatro passos. Quando a mesma cláusula é testada em um paciente de intenção paliativa, a exceção não se aplica e o veredito vira EXCLUDED. Mesmo critério, vereditos opostos, ambos corretos, porque é o motor de lógica e não um limiar.
Em um conjunto-ouro fixo de 13 casos rotulados extraídos de 7 pacientes sintéticos em 2 protocolos sintéticos, pontuado contra a linha de base lexical validada cruzadamente em t = 0.6932, o TrialProof marca 100% de acurácia de decisão contra 53.8% da linha de base, perde 0 pacientes elegíveis onde a linha de base perde 3, e carrega uma trilha de raciocínio reproduzível em 100% das decisões contra 0% da linha de base. Ele se abstém com segurança duas vezes com NEEDS-REVIEW onde a linha de base adivinha, e reexecutar todos os 13 casos produz vereditos e trilhas idênticos em bytes (13 de 13). Atribuímos cada número a este conjunto-ouro rotulado, nunca como uma alegação de mundo aberto.
A mesma comparação que a demonstração pontua, dimensão por dimensão.
| Dimensão | Linha de base lexical justa | TrialProof |
|---|---|---|
| Quem decide a elegibilidade | Uma pontuação de similaridade acima de um limiar | Um motor de lógica deôntica determinístico, fora dos agentes |
| Hierarquia / is-a | Nenhuma, apenas proximidade de tokens | Subsunção is-a SNOMED-CT |
| Negação (nenhuma evidência de diabetes) | Pareado como presente | Removido pelo verificador |
| Atribuição de histórico familiar | Atribuído ao paciente | Rejeitado na checagem de sujeito |
| Cláusulas de exceção temporal | Não representável | Matemática de datas sobre a data de randomização |
| Laboratório ou sinal vital ausente | Adivinha, nunca se abstém | NEEDS-REVIEW, nomeando o que está faltando |
| Trilha de raciocínio | Nenhuma, um número nu de similaridade | Trilha completa, exportada como CDISC SDTM IE |
| Reprodutibilidade | Não aplicável | Idêntico em bytes na reexecução (13 de 13) |
O TrialProof não é uma rede de dados nem uma plataforma de pareamento em nuvem, e não é um clone dessas ferramentas. É a camada de raciocínio determinístico e proveniência que elas não têm: a parte que torna o veredito de elegibilidade computável, verificável e protocolável. Uma plataforma de pareamento entrega uma lista ranqueada com uma pontuação; o TrialProof entrega ELIGIBLE, EXCLUDED ou NEEDS-REVIEW com os IDs de conceito SNOMED e a aresta do grafo que decidiu. Ele foi feito para ficar ao lado de um pipeline de pareamento, não para substituir a rede de dados por baixo.
Porque lê uma nota clínica como texto e pontua similaridade, então confunde palavras que se parecem mas significam coisas diferentes medicamente. Uma nota que diz colocação de cateter venoso central pontua alto contra um ensaio que exclui cateterismo cardíaco, e o paciente é excluído indevidamente. A mesma falha cobre negação (nenhuma evidência de diabetes pareada como diabetes), histórico familiar atribuído ao paciente, e cláusulas de exceção que uma pontuação de similaridade não consegue representar de forma alguma. Avaliações publicadas confirmam que modelos de IA cometem exatamente este erro de cateterismo (Fierce Biotech, 2025).
Sim. Cada decisão é exportada como um registro CDISC SDTM IE em JSON e CSV, uma linha por paciente e critério, carregando o critério, o veredito e a trilha de raciocínio determinístico completa que nomeia os SCTIDs e a operação deôntica. Onde um fato casou, a linha também carrega o caminho is-a e, para fatos derivados da nota, o trecho literal. No conjunto-ouro de 13 casos, 100% das decisões do TrialProof carregam uma trilha reproduzível e a linha de base carrega 0%, e reexecutar o conjunto produz saída idêntica em bytes (13 de 13).
Cada conceito que a demonstração cita para uma decisão carrega um SCTID real, verificável em qualquer navegador SNOMED público: Cateterismo venoso central é 392230005 e Cateterismo cardíaco é 41976001, e eles estão em ramos diferentes, por isso nenhum caminho de subsunção os conecta. O motor consulta um subgrafo curado de 24 conceitos com 22 relações is-a, não o SNOMED-CT completo. Os 9 conceitos curados para a demonstração sem SCTID público são prefixados CUR- e desenhados tracejados em vez de passados como códigos reais. SNOMED-CT completo, MedDRA e LOINC são o caminho de produção adiado.
Todos os dados são sintéticos. Não há PHI real, nem EHR ao vivo, nem ensaio real; os pacientes, notas e protocolos são fixtures fabricados. Esta é uma demonstração executável que prova o mecanismo, não um pipeline implantado, então não é certificada HIPAA, certificada SOC 2, FDA-cleared nem CDS-exempt, e não toma decisões clínicas. O guia de Clinical Decision Support da FDA de janeiro de 2026 é o framework relevante para um auxílio de pareamento com humano no loop, e é a nossa direção, não uma aprovação que detemos.
Não, porque estes não são problemas de linguagem, são problemas de lógica. Uma pontuação de similaridade não consegue representar is-a, não consegue representar não, e não consegue representar a menos que concluído mais de doze meses antes da randomização, e nenhuma quantidade de prompting ou contexto os acrescenta. Então deixamos o modelo fazer a única coisa em que ele é genuinamente bom, ler prosa bagunçada e propor fatos com o trecho de onde os leu, depois um verificador adversarial descarta o que a nota não sustenta, e código determinístico sobre uma ontologia médica computa o veredito. O LLM não pode sobrescrever esse portão, que é o que faz o mesmo prontuário produzir a mesma resposta em toda execução.
É 100% de acurácia de decisão em um conjunto-ouro rotulado e fixo de 13 casos, extraído de 7 pacientes sintéticos em 2 protocolos sintéticos, pontuado contra uma linha de base lexical justa cujo limiar foi validado cruzadamente em seu próprio favor (t = 0.6932). Nunca é uma alegação universal ou de mundo aberto, e não é o mesmo que este produto acertar em todo prontuário possível. No mesmo conjunto o TrialProof perde 0 pacientes elegíveis onde a linha de base perde 3, e se abstém com segurança duas vezes com NEEDS-REVIEW em vez de adivinhar.
A pesquisa por trás desta demonstração — a arquitetura, o desenho de verificação e o blueprint empresarial.
Solução completa
Explore a solução Clinical Trial Recruitment AI →A camada de raciocínio determinístico e proveniência é a parte difícil. Nós a construímos.
Se a sua equipe está avaliando como colocar uma decisão de elegibilidade diante de um regulador sem pedir que confie em uma pontuação de similaridade, gostaríamos genuinamente de ouvir como vocês estão pensando nisso. O problema é de toda a indústria e as respostas também serão.