Motor de raciocínio de elegibilidade para ensaios clínicos

Motor de raciocínio de elegibilidade para ensaios clínicos

Um modelo de pareamento de pacientes lê a nota como texto, então confunde um cateter venoso central com um cateterismo cardíaco e exclui um paciente que era elegível. O TrialProof deixa um LLM apenas ler a nota, resolve o significado por meio de um grafo de conhecimento SNOMED-CT e computa ELIGIBLE, EXCLUDED ou NEEDS-REVIEW em código determinístico que um LLM não pode sobrescrever. Cada veredito carrega uma trilha de raciocínio que um regulador pode protocolar.

100%

Acurácia de decisão no conjunto-ouro rotulado

vs 53.8% da linha de base lexical justa (13 casos)

0 vs 3

Pacientes elegíveis perdidos

O TrialProof perde 0 onde a linha de base perde 3

100% vs 0%

Cobertura da trilha de raciocínio

Cada veredito rastreado; idêntico em bytes na reexecução

Esta é uma demonstração executável em um conjunto-ouro rotulado e fixo. Todos os pacientes, notas e protocolos são sintéticos, a ontologia é um subgrafo SNOMED-CT curado de 24 conceitos, e conectores como ingestão FHIR ao vivo são simulados.

O paciente elegível que o seu pareador descarta

O modo de falha por trás das exclusões indevidas no pareamento de pacientes com IA.

A IA de pareamento de pacientes lê notas clínicas como texto, então confunde palavras que se parecem mas significam coisas diferentes medicamente. A falha canônica é concreta. Um ensaio de anticoagulante de Fase III exclui cateterismo cardíaco; a nota de um paciente diz colocação de cateter venoso central. Um pareador por similaridade vê dois procedimentos cardiovasculares com cateter, pontua alto e exclui um paciente que era elegível. Avaliações publicadas confirmam que modelos de IA cometem exatamente este erro de cateterismo (Fierce Biotech, 2025).

A mesma classe de erro é mais ampla do que um procedimento. Cobre a negação, em que nenhuma evidência de diabetes é pareada como diabetes. Cobre histórico familiar atribuído ao paciente. E cobre cláusulas de exceção, como a menos que concluído mais de 12 meses antes da randomização, que uma pontuação de similaridade não consegue representar de forma alguma. Um modelo-base melhor não remove nenhuma dessas, porque não são problemas de linguagem. São problemas de lógica.

O custo não é acadêmico. O atraso de recrutamento chega a 800,000 dólares por dia em vendas de prescrição perdidas para cada dia que um ensaio atrasa (Tufts CSDD Impact Report, 2024), subindo para 840,000 dólares por dia em oncologia e 1.4 milhão de dólares por dia em ensaios cardiovasculares (Tufts CSDD). 80% dos ensaios perdem seus prazos de recrutamento (consenso da indústria, 2025), a falha de triagem média custa 1,200 dólares (Antidote.me, 2025), e os procedimentos dos ensaios ficaram 139% mais complexos desde 2005 (IQVIA, 2026). Diante de números como esses, um paciente elegível indevidamente triado para fora não é um erro de arredondamento.

Como o TrialProof funciona

Os agentes aconselham na extração. Código determinístico decide a elegibilidade. Isto é neuro-simbólico: um LLM lê a prosa, a lógica simbólica rege o paciente.

Cada paciente é executado contra cada protocolo em cinco estágios, transmitidos ao vivo para a interface. O limite importante é que apenas um estágio é probabilístico, e ele nunca decide nada.

1. Ler o prontuário

Carrega o registro sintético do paciente no formato FHIR, sua nota em texto livre, os critérios do ensaio e a data de randomização.

2. Extrair fatos (o único passo probabilístico, apenas consultivo)

Um LLM substituível por provedor propõe fatos candidatos, cada um com um trecho literal da nota, um SCTID candidato extraído de um vocabulário fechado e uma confiança. Ele aconselha; não decide. Observações codificadas que chegam como FHIR confiável nunca passam pelo extrator. Quando o fallback de léxico offline é usado, o console ao vivo diz isso em vez de esconder.

3. Verificar fatos (verificador adversarial)

Cada fato proposto é contestado contra a nota literal com três checagens: span-present (que captura uma entidade alucinada), negação e sujeito (histórico familiar versus paciente). Fatos rejeitados são marcados REJECTED com a checagem que disparou e o motivo, e nunca chegam à decisão.

4. Montar evidências

O conjunto exato de fatos verificados que entra no motor de lógica, marcado FHIR-codificado versus texto livre.

5. Computar vereditos (Python determinístico, fora do framework de agentes)

Um motor de lógica deôntica avalia critérios de proibição, exceção temporal, controlled-unless e requisito via subsunção is-a SNOMED e matemática de datas, e emite ELIGIBLE, EXCLUDED ou NEEDS-REVIEW com uma trilha completa. Um LLM não pode sobrescrever este portão.

Os estágios determinísticos de fato rodam em dezenas de microssegundos por critério, enquanto o modelo que lê a nota leva segundos. Esse contraste é o ponto, não uma alegação de triagem instantânea: a parte lenta e falível fica confinada à leitura, e a decisão que ela alimenta é rápida, barata e reproduzível.

A comparação na demonstração é uma linha de base lexical justa, e deliberadamente. É similaridade de cosseno TF-IDF em nível de entidade, um método real de similaridade vetorial, com uma configuração generosa de resolução limpa entidade-para-conceito, e seu limiar de decisão validado cruzadamente em seu próprio favor (t = 0.6932). Nunca chama o LLM. Suas únicas desvantagens são a hierarquia, a negação, a lógica temporal e a abstenção ausentes, que é a tese inteira. Não foi ajustada para falhar.

O raciocínio, trabalhado de ponta a ponta

Paciente sintético P-074 e sua coorte, contra os protocolos sintéticos ONC-204 e ANTI-3. Cada imagem abaixo é uma captura de tela do aplicativo TrialProof em execução.

Uma linha central não é um cateterismo cardíaco, e só uma hierarquia sabe disso

A nota de UTI de P-074 registra colocação de cateter venoso central para acesso de medicação IV. Contra o critério EXCL-CARDCATH do ANTI-3 (sem cateterismo cardíaco prévio), um pareador por similaridade vê dois procedimentos cardiovasculares com cateter. O TrialProof pergunta à ontologia: o Cateterismo venoso central (392230005) é um descendente is-a de Cateterismo cardíaco (41976001)? Não é. Os dois conceitos estão em ramos diferentes da hierarquia SNOMED-CT, então nenhum caminho de subsunção existe, e o veredito é ELIGIBLE com uma trilha de três passos nomeando ambos os SCTIDs. Ambos os códigos são reais e verificáveis em qualquer navegador SNOMED público. A linha de base lexical justa também retorna ELIGIBLE aqui, mas com uma similaridade nua de 0.437, sem trilha de raciocínio e sem nada que um regulador pudesse protocolar.

Trilha de raciocínio do TrialProof para EXCL-CARDCATH mostrando que Cateterismo venoso central 392230005 is-NOT-a Cateterismo cardíaco 41976001 em um ramo diferente da hierarquia, então o veredito é ELIGIBLE, ao lado da similaridade nua de 0.437 da linha de base, sem proveniência.
A trilha do cateterismo cardíaco: uma checagem is-a em SCTIDs reais decide ELIGIBLE, onde a linha de base oferece uma similaridade nua de 0.437 e nenhuma proveniência.

A ontologia que o motor de fato consulta

O motor não consulta todo o SNOMED-CT. Ele percorre um subgrafo curado de 24 conceitos com 22 relações is-a. Conceitos com um SCTID real são desenhados sólidos; os 9 curados para a demonstração sem SCTID público são prefixados CUR- e desenhados tracejados em vez de passados como códigos reais. Fatos verificados são verdes, conceitos de critério são contornados, e os caminhos is-a percorridos estão em negrito. Os dois cateterismos visivelmente vivem em ramos diferentes, que é exatamente por que uma similaridade de string ou vetorial não pode substituir a subsunção.

O subgrafo SNOMED-CT curado de 24 conceitos com 22 relações is-a, mostrando Cateterismo cardíaco e Cateterismo venoso central em ramos diferentes, SCTIDs reais desenhados sólidos e conceitos CUR- curados para a demo desenhados tracejados.
O subgrafo SNOMED-CT, 24 conceitos e 22 relações is-a, com os dois cateterismos em ramos separados.

O paciente elegível que a linha de base descarta

A mesma nota diz Nenhuma evidência de diabetes. Contra o EXCL-DM do ONC-204 (sem diagnóstico de diabetes mellitus), a linha de base vetorial casa o token diabetes com similaridade 1.0 e retorna EXCLUDED, porque não tem modelo de negação. O verificador do TrialProof remove a menção negada antes que ela possa chegar à decisão, então o veredito é ELIGIBLE. Este é o paciente elegível que um pareador por similaridade descarta, e no conjunto-ouro é um dos três que a linha de base perde.

A trilha de raciocínio EXCL-DM para uma nota que diz Nenhuma evidência de diabetes: a linha de base casa diabetes com similaridade 1.0 e retorna EXCLUDED, enquanto o TrialProof remove a menção negada e retorna ELIGIBLE.
Negação: a linha de base exclui com similaridade 1.0; o TrialProof remove a menção negada e mantém o paciente elegível.

Um verificador que contesta o extrator

Para P-106 o extrator propõe um fato de carboplatina que não tem trecho de suporte na nota, uma alucinação plantada. O verificador adversarial executa span-present, negação e sujeito em cada fato proposto; o fato de carboplatina falha span-present (trecho não encontrado na nota) e é marcado REJECTED, então nunca chega à decisão. No conjunto-ouro o verificador rejeitou 7 instâncias de fato (3 fatos ruins distintos: uma menção negada de diabetes, uma atribuição de câncer de mama por histórico familiar, e esta carboplatina alucinada) em 4 das 13 execuções de caso pontuadas. Os agentes aconselham na extração; código determinístico decide a elegibilidade.

O painel de verificação de fatos para P-106 mostrando um fato de carboplatina marcado REJECTED, checagem falha span-present, motivo trecho não encontrado na nota, então a entidade alucinada nunca chega à decisão de elegibilidade.
O verificador rejeita uma carboplatina alucinada em span-present antes que ela possa chegar a uma decisão.

Uma exceção que uma pontuação de similaridade não consegue representar

P-101 completou carboplatina e pemetrexede adjuvantes, última infusão em 03/2025. O EXCL-PLAT do ONC-204 proíbe terapia prévia com platina a menos que administrada como adjuvante ou neoadjuvante e concluída mais de 12 meses antes da randomização (2026-04-15). O motor confirma que Carboplatina (386905003) is-a Agente antineoplásico contendo platina, computa o intervalo em 13 meses, satisfaz a exceção e retorna ELIGIBLE com uma trilha de quatro passos. Quando a mesma cláusula é testada em um paciente de intenção paliativa, a exceção não se aplica e o veredito vira EXCLUDED. Mesmo critério, vereditos opostos, ambos corretos, porque é o motor de lógica e não um limiar.

A trilha de raciocínio EXCL-PLAT para P-101 mostrando Carboplatina 386905003 is-a Agente antineoplásico contendo platina, intenção adjuvante, intervalo de 13 meses maior que 12, então a exceção é satisfeita e o veredito é ELIGIBLE.
Exceção temporal satisfeita: platina adjuvante concluída 13 meses antes da randomização, computada por matemática de datas.

O número com o qual um líder de operações clínicas realmente se importa

Em um conjunto-ouro fixo de 13 casos rotulados extraídos de 7 pacientes sintéticos em 2 protocolos sintéticos, pontuado contra a linha de base lexical validada cruzadamente em t = 0.6932, o TrialProof marca 100% de acurácia de decisão contra 53.8% da linha de base, perde 0 pacientes elegíveis onde a linha de base perde 3, e carrega uma trilha de raciocínio reproduzível em 100% das decisões contra 0% da linha de base. Ele se abstém com segurança duas vezes com NEEDS-REVIEW onde a linha de base adivinha, e reexecutar todos os 13 casos produz vereditos e trilhas idênticos em bytes (13 de 13). Atribuímos cada número a este conjunto-ouro rotulado, nunca como uma alegação de mundo aberto.

Os tiles de benchmark do conjunto-ouro: acurácia de decisão 100% versus 53.8% da linha de base, recall de pacientes elegíveis 100% versus 66.7%, pacientes elegíveis perdidos 0 versus 3, e cobertura de trilha auditável 100% versus 0%, com uma nota de reprodutibilidade de que reexecutar 13 casos produz vereditos idênticos em bytes.
O conjunto-ouro rotulado de 13 casos: 100% vs 53.8% de acurácia, 0 vs 3 pacientes elegíveis perdidos, 100% vs 0% de cobertura de trilha, idêntico em bytes na reexecução.

Similaridade vetorial versus um motor de raciocínio

A mesma comparação que a demonstração pontua, dimensão por dimensão.

Dimensão Linha de base lexical justa TrialProof
Quem decide a elegibilidade Uma pontuação de similaridade acima de um limiar Um motor de lógica deôntica determinístico, fora dos agentes
Hierarquia / is-a Nenhuma, apenas proximidade de tokens Subsunção is-a SNOMED-CT
Negação (nenhuma evidência de diabetes) Pareado como presente Removido pelo verificador
Atribuição de histórico familiar Atribuído ao paciente Rejeitado na checagem de sujeito
Cláusulas de exceção temporal Não representável Matemática de datas sobre a data de randomização
Laboratório ou sinal vital ausente Adivinha, nunca se abstém NEEDS-REVIEW, nomeando o que está faltando
Trilha de raciocínio Nenhuma, um número nu de similaridade Trilha completa, exportada como CDISC SDTM IE
Reprodutibilidade Não aplicável Idêntico em bytes na reexecução (13 de 13)

O que esta demonstração não faz

  • ✓ Ela não alega ser 100% acurada universalmente. O índice de 100% é acurácia de decisão em um conjunto-ouro rotulado e fixo de 13 casos, nunca uma garantia de mundo aberto e nunca uma promessa de acertar em todo prontuário.
  • ✓ Ela não apresenta seus pacientes como reais. Todos os pacientes, notas e protocolos são sintéticos, sem PHI, sem EHR ao vivo e sem ensaio real. P-074, P-101 até P-106, ONC-204 e ANTI-3 são fixtures fabricados.
  • ✓ Ela não usa o SNOMED-CT completo. A ontologia é um subgrafo curado de 24 conceitos (15 SCTIDs reais, 9 curados e desenhados tracejados). SNOMED-CT completo, MedDRA e LOINC são o caminho de produção adiado.
  • ✓ Ela não usa conectores ao vivo. A ingestão FHIR R4 de EHR, o armazenamento em grafo e o LLM clínico são simulados ou substituíveis por provedor. Epic App Orchard e FHIR ao vivo da Oracle, conectores de CTMS e o endurecimento SOC 2 ou HIPAA BAA estão adiados.
  • ✓ Ela não é FDA-cleared, CDS-exempt, certificada HIPAA nem certificada SOC 2. O guia de Clinical Decision Support da FDA de janeiro de 2026 é nosso alinhamento e direção, não uma aprovação. Isto não é aconselhamento médico e não toma decisões clínicas.
  • ✓ Ela não traz clientes, patrocinadores, CROs, pilotos, depoimentos nem números de ROI. Nenhum existe. Esta é uma demonstração que prova o mecanismo, não uma implantação.

Perguntas que os compradores realmente fazem

Como isso é diferente do pareamento de pacientes da Deep 6, Tempus ou IQVIA?

O TrialProof não é uma rede de dados nem uma plataforma de pareamento em nuvem, e não é um clone dessas ferramentas. É a camada de raciocínio determinístico e proveniência que elas não têm: a parte que torna o veredito de elegibilidade computável, verificável e protocolável. Uma plataforma de pareamento entrega uma lista ranqueada com uma pontuação; o TrialProof entrega ELIGIBLE, EXCLUDED ou NEEDS-REVIEW com os IDs de conceito SNOMED e a aresta do grafo que decidiu. Ele foi feito para ficar ao lado de um pipeline de pareamento, não para substituir a rede de dados por baixo.

Por que a IA de pareamento de pacientes exclui pacientes elegíveis?

Porque lê uma nota clínica como texto e pontua similaridade, então confunde palavras que se parecem mas significam coisas diferentes medicamente. Uma nota que diz colocação de cateter venoso central pontua alto contra um ensaio que exclui cateterismo cardíaco, e o paciente é excluído indevidamente. A mesma falha cobre negação (nenhuma evidência de diabetes pareada como diabetes), histórico familiar atribuído ao paciente, e cláusulas de exceção que uma pontuação de similaridade não consegue representar de forma alguma. Avaliações publicadas confirmam que modelos de IA cometem exatamente este erro de cateterismo (Fierce Biotech, 2025).

Posso obter uma trilha de auditoria que um regulador possa protocolar para cada decisão de elegibilidade?

Sim. Cada decisão é exportada como um registro CDISC SDTM IE em JSON e CSV, uma linha por paciente e critério, carregando o critério, o veredito e a trilha de raciocínio determinístico completa que nomeia os SCTIDs e a operação deôntica. Onde um fato casou, a linha também carrega o caminho is-a e, para fatos derivados da nota, o trecho literal. No conjunto-ouro de 13 casos, 100% das decisões do TrialProof carregam uma trilha reproduzível e a linha de base carrega 0%, e reexecutar o conjunto produz saída idêntica em bytes (13 de 13).

Ele usa códigos SNOMED reais ou inventados?

Cada conceito que a demonstração cita para uma decisão carrega um SCTID real, verificável em qualquer navegador SNOMED público: Cateterismo venoso central é 392230005 e Cateterismo cardíaco é 41976001, e eles estão em ramos diferentes, por isso nenhum caminho de subsunção os conecta. O motor consulta um subgrafo curado de 24 conceitos com 22 relações is-a, não o SNOMED-CT completo. Os 9 conceitos curados para a demonstração sem SCTID público são prefixados CUR- e desenhados tracejados em vez de passados como códigos reais. SNOMED-CT completo, MedDRA e LOINC são o caminho de produção adiado.

Os dados dos pacientes são reais, e isto é compatível com a HIPAA?

Todos os dados são sintéticos. Não há PHI real, nem EHR ao vivo, nem ensaio real; os pacientes, notas e protocolos são fixtures fabricados. Esta é uma demonstração executável que prova o mecanismo, não um pipeline implantado, então não é certificada HIPAA, certificada SOC 2, FDA-cleared nem CDS-exempt, e não toma decisões clínicas. O guia de Clinical Decision Support da FDA de janeiro de 2026 é o framework relevante para um auxílio de pareamento com humano no loop, e é a nossa direção, não uma aprovação que detemos.

Um LLM melhor não resolveria isso?

Não, porque estes não são problemas de linguagem, são problemas de lógica. Uma pontuação de similaridade não consegue representar is-a, não consegue representar não, e não consegue representar a menos que concluído mais de doze meses antes da randomização, e nenhuma quantidade de prompting ou contexto os acrescenta. Então deixamos o modelo fazer a única coisa em que ele é genuinamente bom, ler prosa bagunçada e propor fatos com o trecho de onde os leu, depois um verificador adversarial descarta o que a nota não sustenta, e código determinístico sobre uma ontologia médica computa o veredito. O LLM não pode sobrescrever esse portão, que é o que faz o mesmo prontuário produzir a mesma resposta em toda execução.

O que o índice de 100% de acurácia realmente significa?

É 100% de acurácia de decisão em um conjunto-ouro rotulado e fixo de 13 casos, extraído de 7 pacientes sintéticos em 2 protocolos sintéticos, pontuado contra uma linha de base lexical justa cujo limiar foi validado cruzadamente em seu próprio favor (t = 0.6932). Nunca é uma alegação universal ou de mundo aberto, e não é o mesmo que este produto acertar em todo prontuário possível. No mesmo conjunto o TrialProof perde 0 pacientes elegíveis onde a linha de base perde 3, e se abstém com segurança duas vezes com NEEDS-REVIEW em vez de adivinhar.

Pesquisa técnica

A pesquisa por trás desta demonstração — a arquitetura, o desenho de verificação e o blueprint empresarial.

Pareando pacientes a ensaios sem uma trilha que um regulador possa protocolar?

A camada de raciocínio determinístico e proveniência é a parte difícil. Nós a construímos.

Se a sua equipe está avaliando como colocar uma decisão de elegibilidade diante de um regulador sem pedir que confie em uma pontuação de similaridade, gostaríamos genuinamente de ouvir como vocês estão pensando nisso. O problema é de toda a indústria e as respostas também serão.

Avaliação de raciocínio de elegibilidade

  • ✓ Mapear onde o seu pareador de pacientes pode excluir um paciente elegível
  • ✓ Separar o que o LLM deve extrair do que o código deve decidir
  • ✓ Definir a ontologia, a negação e as regras temporais que os seus protocolos precisam
  • ✓ Especificar a trilha CDISC SDTM IE que a sua equipe regulatória pode protocolar

Construir a camada de raciocínio

  • ✓ Um motor de lógica deôntica determinístico sobre a sua ontologia real
  • ✓ Um verificador adversarial para negação, sujeito e fatos alucinados
  • ✓ Subsunção SNOMED-CT mais matemática de datas, reproduzível em cada reexecução
  • ✓ Extração substituível por provedor, com o modelo nunca sobrescrevendo um veredito
Redes sociais

Também publicado em