מנוע הנמקה לזכאות בניסויים קליניים
מודל להתאמת מטופלים קורא הערה כטקסט, ולכן הוא מבלבל בין צנתר ורידי מרכזי לצנתור לב ופוסל מטופל שהיה זכאי. TrialProof מאפשר ל-LLM רק לקרוא את ההערה, מפרש משמעות דרך גרף ידע של SNOMED-CT, ומחשב ELIGIBLE, EXCLUDED או NEEDS-REVIEW בקוד דטרמיניסטי ש-LLM אינו יכול לדרוס. כל הכרעה נושאת עקבות הנמקה שרגולטור יכול להגיש.
100%
דיוק החלטה על סט הזהב המתויג
מול 53.8% לבסיס הלקסיקלי ההוגן (13 מקרים)
0 מול 3
מטופלים זכאים שאבדו
TrialProof מאבד 0 במקום שהבסיס מאבד 3
100% מול 0%
כיסוי עקבות-הנמקה
כל הכרעה מעוקבת; זהה-בתים בהרצה חוזרת
זו הדגמה ניתנת-להרצה על סט זהב קבוע ומתויג. כל המטופלים, ההערות והפרוטוקולים הם סינתטיים, האונטולוגיה היא תת-גרף מאוצר של 24 מושגי SNOMED-CT, ומחברים כגון קליטת FHIR חיה מדומים.
מצב הכשל מאחורי פסילות שגויות בהתאמת מטופלים ב-AI.
AI להתאמת מטופלים קורא הערות קליניות כטקסט, ולכן הוא מבלבל מילים שנראות דומות אך משמעותן שונה רפואית. הכשל הקנוני הוא קונקרטי. ניסוי נוגד-קרישה בשלב III פוסל צנתור לב; בהערת המטופל כתוב החדרת צנתר ורידי מרכזי. מתאם דמיון רואה שני הליכי צנתר קרדיווסקולריים, נותן ציון גבוה, ופוסל מטופל שהיה זכאי. הערכות שפורסמו מאשרות שמודלי AI עושים בדיוק את שגיאת הצנתור הזו (Fierce Biotech, 2025).
אותה מחלקת שגיאה רחבה יותר מהליך אחד. היא מכסה שלילה, שבה אין עדות לסוכרת מותאמת כסוכרת. היא מכסה היסטוריה משפחתית שמיוחסת למטופל. והיא מכסה סעיפי חריג, כגון אלא אם הושלם יותר מ-12 חודשים לפני ההקצאה האקראית, שציון דמיון אינו יכול לייצג כלל. מודל בסיס טוב יותר אינו מסיר אף אחד מאלה, כי אלה אינן בעיות שפה. אלה בעיות לוגיקה.
העלות אינה אקדמית. עיכוב גיוס רץ ב-800,000 דולר ליום במכירות מרשם אבודות לכל יום שניסוי מחליק (Tufts CSDD Impact Report, 2024), ועולה ל-840,000 דולר ליום באונקולוגיה ו-1.4 מיליון דולר ליום בניסויים קרדיווסקולריים (Tufts CSDD). 80% מהניסויים מחמיצים את לוחות הזמנים לגיוס (קונצנזוס תעשייה, 2025), כשל סינון ממוצע עולה 1,200 דולר (Antidote.me, 2025), והליכי ניסוי גדלו ב-139% במורכבות מאז 2005 (IQVIA, 2026). מול מספרים כאלה, מטופל זכאי שנפסל בטעות אינו שגיאת עיגול.
הסוכנים מייעצים על החילוץ. קוד דטרמיניסטי מחליט על הזכאות. זה נוירו-סימבולי: LLM קורא את הפרוזה, לוגיקה סימבולית חלה על המטופל.
כל מטופל רץ מול כל פרוטוקול בחמישה שלבים, בסטרימינג חי לממשק. הגבול החשוב הוא שרק שלב אחד הוא הסתברותי, והוא לעולם אינו מחליט דבר.
טוען את רשומת המטופל הסינתטית בצורת FHIR, את ההערה בטקסט חופשי, את קריטריוני הניסוי, ואת תאריך ההקצאה האקראית.
LLM שניתן להחלפת-ספק מציע עובדות מועמדות, כל אחת עם מקטע הערה מילולי, SCTID מועמד השאוב מאוצר מילים סגור, וביטחון. הוא מייעץ; הוא אינו מחליט. תצפיות מקודדות שמגיעות כ-FHIR מהימן לעולם אינן עוברות דרך המחלץ. כשמשתמשים בגיבוי הלקסיקון הלא-מקוון, הקונסולה החיה אומרת זאת במקום להסתיר זאת.
כל עובדה מוצעת מאותגרת מול ההערה המילולית בשלוש בדיקות: span-present (שתופסת ישות מוזמנת), שלילה, ונושא (היסטוריה משפחתית מול מטופל). עובדות שנדחו מסומנות REJECTED עם הבדיקה שקפצה והסיבה, ולעולם אינן מגיעות להחלטה.
סט העובדות המאומת המדויק שנכנס למנוע הלוגיקה, מסומן coded-FHIR מול טקסט-חופשי.
מנוע לוגיקה דאונטית מעריך קריטריוני איסור, חריג-זמני, controlled-unless, ודרישה דרך הכלה is-a של SNOMED וחשבון תאריכים, ופולט ELIGIBLE, EXCLUDED או NEEDS-REVIEW עם עקבות מלאים. LLM אינו יכול לדרוס שער זה.
השלבים הדטרמיניסטיים באמת רצים בעשרות מיקרושניות לקריטריון, בעוד שהמודל שקורא את ההערה לוקח שניות. הניגוד הזה הוא הנקודה, לא טענה של סינון מיידי: החלק האיטי והנתון-לשגיאה מוגבל לקריאה, וההחלטה שהוא מזין היא מהירה, זולה, וניתנת-לשחזור.
ההשוואה בהדגמה היא בסיס לקסיקלי הוגן, ובכוונה. זה דמיון קוסינוס TF-IDF ברמת-ישות, שיטת דמיון-וקטור אמיתית, שקיבלה הגדרה נדיבה עם רזולוציית ישות-למושג נקייה, וסף ההחלטה שלה אומת-הצלבה לטובתה (t = 0.6932). הוא לעולם אינו קורא ל-LLM. המגבלות היחידות שלו הן ההיררכיה, השלילה, הזמניות ולוגיקת ההימנעות החסרות, וזה כל התזה. הוא לא כוונן להיכשל.
מטופל סינתטי P-074 והקבוצה שלו, מול הפרוטוקולים הסינתטיים ONC-204 ו-ANTI-3. כל תמונה למטה היא צילום מסך של אפליקציית TrialProof הרצה.
בהערת ה-ICU של P-074 כתוב החדרת צנתר ורידי מרכזי לגישה לתרופות IV. מול קריטריון EXCL-CARDCATH של ANTI-3 (אין צנתור לב קודם), מתאם דמיון רואה שני הליכי צנתר קרדיווסקולריים. TrialProof שואל את האונטולוגיה במקום: האם Central venous catheterization (392230005) הוא צאצא is-a של Cardiac catheterization (41976001)? הוא אינו. שני המושגים יושבים על ענפים שונים של היררכיית SNOMED-CT, ולכן אין נתיב הכלה, וההכרעה היא ELIGIBLE עם עקבות תלת-שלביים שנוקבים בשני ה-SCTID. שני הקודים אמיתיים וניתנים לבדיקה בכל דפדפן SNOMED ציבורי. הבסיס הלקסיקלי ההוגן גם מחזיר ELIGIBLE כאן, אך בדמיון חשוף של 0.437 ללא עקבות הנמקה וללא דבר שרגולטור יכול להגיש.
המנוע אינו שואל את כל SNOMED-CT. הוא הולך בתת-גרף מאוצר של 24 מושגים עם 22 יחסי is-a. מושגים עם SCTID אמיתי מצוירים בקו מלא; 9 המאוצרים להדגמה ללא SCTID ציבורי מקבלים קידומת CUR- ומצוירים בקו מקווקו במקום להיות מוצגים כקודים אמיתיים. עובדות מאומתות בירוק, מושגי קריטריון במסגרת, ונתיבי is-a שעברו בולטים. שני הצנתורים חיים באופן נראה על ענפים שונים, וזה בדיוק מדוע דמיון מחרוזת או וקטור אינו יכול לעמוד במקום הכלה.
אותה הערה אומרת No evidence of diabetes. מול EXCL-DM של ONC-204 (אין אבחנה של diabetes mellitus), הבסיס הווקטורי מתאים את האסימון diabetes בדמיון 1.0 ומחזיר EXCLUDED, כי אין לו מודל של שלילה. המאמת של TrialProof מסיר את האזכור השלילי לפני שהוא יכול להגיע להחלטה, ולכן ההכרעה היא ELIGIBLE. זה המטופל הזכאי שמתאם דמיון זורק, ועל סט הזהב זה אחד משלושת שהבסיס מאבד.
עבור P-106 המחלץ מציע עובדת carboplatin שאין לה מקטע תומך בהערה, הזייה נטועה. המאמת היריב מריץ span-present, שלילה ונושא על כל עובדה מוצעת; עובדת ה-carboplatin נכשלת ב-span-present (span not found in note) ומסומנת REJECTED, כך שהיא לעולם אינה מגיעה להחלטה. על פני סט הזהב המאמת דחה 7 מופעי עובדה (3 עובדות רעות נבדלות: אזכור סוכרת שלילי, ייחוס סרטן-שד להיסטוריה-משפחתית, ו-carboplatin מוזמן זה) ב-4 מתוך 13 הרצות-המקרה המנוקדות. הסוכנים מייעצים על החילוץ; קוד דטרמיניסטי מחליט על הזכאות.
P-101 השלים carboplatin ו-pemetrexed אדג'ובנטיים, עירוי אחרון 03/2025. EXCL-PLAT של ONC-204 אוסר טיפול פלטינה קודם אלא אם ניתן כאדג'ובנטי או ניאו-אדג'ובנטי והושלם יותר מ-12 חודשים לפני ההקצאה האקראית (2026-04-15). המנוע מאשר ש-Carboplatin (386905003) is-a Platinum-containing antineoplastic agent, מחשב את המרווח ל-13 חודשים, מקיים את החריג, ומחזיר ELIGIBLE עם עקבות ארבעה-שלבים. כשאותו סעיף נבדק על מטופל בכוונה פליאטיבית, החריג אינו חל וההכרעה מתהפכת ל-EXCLUDED. אותו קריטריון, הכרעות הפוכות, שתיהן נכונות, כי זה מנוע הלוגיקה ולא סף.
על סט זהב קבוע של 13 מקרים מתויגים השאובים מ-7 מטופלים סינתטיים על פני 2 פרוטוקולים סינתטיים, שנוקדו מול הבסיס הלקסיקלי מאומת-ההצלבה ב-t = 0.6932, TrialProof משיג 100% דיוק החלטה מול 53.8% של הבסיס, מאבד 0 מטופלים זכאים במקום שהבסיס מאבד 3, ונושא עקבות הנמקה ניתנים-לשחזור ב-100% מההחלטות מול 0% של הבסיס. הוא נמנע בבטחה פעמיים עם NEEDS-REVIEW במקום שהבסיס מנחש, והרצה חוזרת של כל 13 המקרים מניבה הכרעות ועקבות זהים-בתים (13 מתוך 13). אנחנו מייחסים כל נתון לסט הזהב המתויג הזה, לעולם לא כטענה בעולם-פתוח.
אותה השוואה שההדגמה מנקדת, ממד אחר ממד.
| ממד | בסיס לקסיקלי הוגן | TrialProof |
|---|---|---|
| מי מחליט על הזכאות | ציון דמיון מעל סף | מנוע לוגיקה דאונטית דטרמיניסטי, מחוץ לסוכנים |
| היררכיה / is-a | אין, קרבת אסימונים בלבד | הכלה is-a של SNOMED-CT |
| שלילה (אין עדות לסוכרת) | מותאם כקיים | מוסר על ידי המאמת |
| ייחוס היסטוריה משפחתית | מיוחס למטופל | נדחה בבדיקת הנושא |
| סעיפי חריג זמני | לא ניתן לייצוג | חשבון תאריכים על תאריך ההקצאה האקראית |
| מעבדה או סימן חיוני חסרים | מנחש, לעולם אינו נמנע | NEEDS-REVIEW, נוקב במה שחסר |
| עקבות הנמקה | אין, מספר דמיון חשוף | עקבות מלאים, מיוצאים כ-CDISC SDTM IE |
| שחזוריות | לא ישים | זהה-בתים בהרצה חוזרת (13 מתוך 13) |
TrialProof אינו רשת נתונים או פלטפורמת התאמה בענן, ואינו שיבוט של הכלים האלה. זו שכבת ההנמקה הדטרמיניסטית ומעקב-המקור שהם חסרים: החלק שהופך את הכרעת הזכאות לניתנת-לחישוב, ניתנת-לבדיקה, וניתנת-להגשה. פלטפורמת התאמה מוסרת לכם רשימה מדורגת עם ציון; TrialProof מוסר לכם ELIGIBLE, EXCLUDED או NEEDS-REVIEW עם מזהי מושג SNOMED וקשת הגרף שהחליטה. הוא נועד לשבת לצד צינור התאמה, לא להחליף את רשת הנתונים שתחתיו.
כי הוא קורא הערה קלינית כטקסט ומנקד דמיון, ולכן הוא מבלבל מילים שנראות דומות אך משמעותן שונה רפואית. הערה שאומרת החדרת צנתר ורידי מרכזי מקבלת ציון גבוה מול ניסוי שפוסל צנתור לב, והמטופל נפסל בטעות. אותו כשל מכסה שלילה (אין עדות לסוכרת מותאמת כסוכרת), היסטוריה משפחתית שמיוחסת למטופל, וסעיפי חריג שציון דמיון אינו יכול לייצג כלל. הערכות שפורסמו מאשרות שמודלי AI עושים בדיוק את שגיאת הצנתור הזו (Fierce Biotech, 2025).
כן. כל החלטה מיוצאת כרשומת CDISC SDTM IE ב-JSON וב-CSV, שורה אחת למטופל ולקריטריון, הנושאת את הקריטריון, את ההכרעה, ואת עקבות ההנמקה הדטרמיניסטיים המלאים שנוקבים ב-SCTID ובפעולה הדאונטית. במקום שעובדה הותאמה, השורה נושאת גם את נתיב ה-is-a, ועבור עובדות שמקורן בהערה — את המקטע המילולי. על סט הזהב בן 13 המקרים, 100% מהחלטות TrialProof נושאות עקבות ניתנים-לשחזור והבסיס נושא 0%, והרצה חוזרת של הסט מייצרת פלט זהה-בתים (13 מתוך 13).
כל מושג שההדגמה מצטטת להחלטה נושא SCTID אמיתי, ניתן לבדיקה בכל דפדפן SNOMED ציבורי: Central venous catheterization הוא 392230005 ו-Cardiac catheterization הוא 41976001, והם יושבים על ענפים שונים, ולכן אין נתיב הכלה שמחבר ביניהם. המנוע שואל תת-גרף מאוצר של 24 מושגים עם 22 יחסי is-a, לא את SNOMED-CT המלא. 9 המושגים שאוצרו להדגמה ללא SCTID ציבורי מקבלים קידומת CUR- ומצוירים בקו מקווקו במקום להיות מוצגים כקודים אמיתיים. SNOMED-CT מלא, MedDRA ו-LOINC הם נתיב הייצור המושהה.
כל הנתונים סינתטיים. אין PHI אמיתי, אין EHR חי, ואין ניסוי אמיתי; המטופלים, ההערות והפרוטוקולים הם מתקנים בדויים. זו הדגמה ניתנת-להרצה שמוכיחה את המנגנון, לא צינור פרוס, ולכן היא אינה מוסמכת-HIPAA, מוסמכת SOC 2, מאושרת-FDA או פטורה-CDS, ואינה מקבלת החלטות קליניות. הנחיית Clinical Decision Support של ה-FDA מינואר 2026 היא המסגרת הרלוונטית לעזר התאמה עם אדם-בלולאה, והיא הכיוון שלנו, לא אישור שאנחנו מחזיקים.
לא, כי אלה אינן בעיות שפה, אלה בעיות לוגיקה. ציון דמיון אינו יכול לייצג is-a, אינו יכול לייצג לא, ואינו יכול לייצג אלא אם הושלם יותר משנים-עשר חודשים לפני ההקצאה האקראית, ושום כמות של פרומפטינג או הקשר אינה מוסיפה אותם. לכן אנחנו נותנים למודל לעשות את הדבר האחד שהוא באמת טוב בו, לקרוא פרוזה מבולגנת ולהציע עובדות עם המקטע שממנו קרא אותן, ואז מאמת יריב זורק מה שההערה אינה תומכת בו, וקוד דטרמיניסטי על אונטולוגיה רפואית מחשב את ההכרעה. ה-LLM אינו יכול לדרוס את השער הזה, וזה מה שגורם לאותו תיק לייצר את אותה תשובה בכל הרצה.
זה 100% דיוק החלטה על סט זהב קבוע ומתויג בן 13 מקרים, השאוב מ-7 מטופלים סינתטיים על פני 2 פרוטוקולים סינתטיים, שנוקד מול בסיס לקסיקלי הוגן שספו אומת-הצלבה לטובתו (t = 0.6932). זו לעולם לא טענה אוניברסלית או בעולם-פתוח, ואינה זהה לכך שהמוצר הזה צודק בכל תיק אפשרי. על אותו סט TrialProof מאבד 0 מטופלים זכאים במקום שהבסיס מאבד 3, ונמנע בבטחה פעמיים עם NEEDS-REVIEW במקום לנחש.
המחקר מאחורי הדגמה זו — הארכיטקטורה, עיצוב האימות, והתכנון הארגוני.
שכבת ההנמקה הדטרמיניסטית ומעקב-המקור היא החלק הקשה. אנחנו בונים אותה.
אם הצוות שלכם שוקל איך לשים החלטת זכאות מול רגולטור בלי לבקש מהם לבטוח בציון דמיון, נשמח באמת לשמוע איך אתם חושבים על זה. הבעיה היא רוחבית-לתעשייה וגם התשובות יהיו.