ממשל משבר מבוסס-מצב ל-AI בבריאות התנהגותית
בנינו middleware בטיחות שעוטף צ'אטבוט קיים לבריאות התנהגותית ואוכף מדיניות הסלמה מבוססת-מצב וחוצת-תורות שהצוות הקליני הוא בעליה. הוא תופס את השיחה המסלימה שמודרטור חסר-מצב מפספס מבנית, ומוכיח כל החלטה במסלול ביקורת משורשר-hash שניתן להגשה. בטיחות היא בעיה ארכיטקטונית, לא בעיה של פרומפטים.
0 מול 68
תשובות לא-בטוחות שנמסרו, מוגן מול לא-מוגן
סט זהב מתויג של 40 שיחות
2 תורות
חציון זיהוי מוקדם יותר מול מודרטור זהה חסר-מצב
אותו מסווג ואותו שער; מבוססות-המצב לבדה
0 / 29
הסלמות שווא על פני תורות שפירים
סט זהב מתויג של 40 שיחות
הדגמה של דפוס ארכיטקטורת-בטיחות על נתונים סינתטיים. לא התקן רפואי, לא ייעוץ קליני, לא אינטגרציית EHR.
צ'אטבוטים לבריאות התנהגותית מפוקחים הודעה אחת בכל פעם. משבר אינו מגיע הודעה אחת בכל פעם.
רוב סקירת הבטיחות על צ'אטבוט לבריאות הנפש מדרגת כל תשובה בבידוד. כל הודעה נבדקת, מסומנת או מאושרת, ונשכחת. זה עובד עבור שורה מסוכנת במפורש אחת. זה עיוור מבנית לשיחה שמסחפת, תור אחר תור, שבה אף הודעה בודדת אינה מדאיגה מספיק כדי לחסום אותה לבדה.
הכשלים המתועדים עוקבים אחר הצורה הזו. הצ'אטבוט "Tessa" של NEDA חילק עצות על גירעון-קלורי וקליפר-עור לפני שהוסר (NEDA, 2023). קלינאים דיווחו על פסיכוזה שחוזקה על ידי צ'אטבוט במטופלים שמעולם לא פגשו אדם שהתנגד (ד"ר Keith Sakata, UCSF, 2025). OpenAI משכה עדכון של GPT-4o לאחר שהפך לחנפני (OpenAI, 2025). בכל מקרה המודל נשמע תומך בתור נתון כלשהו בעוד שהמסלול הלך למקום לא-בטוח.
למודרטור חסר-מצב אין דרך לראות את המסלול הזה, כי אין לו זיכרון של התורות שלפני כן. מודל בסיס טוב יותר אינו מתקן זאת. צ'אטבוט מושלם עדיין אין לו מושג לגבי מדיניות ההסלמה של הפלטפורמה שלכם, אינו מייצר מסלול ביקורת שניתן להגיש, ואינו נותן לכם שער דטרמיניסטי לאשר. לכן אנחנו מתייחסים כאן לבטיחות כאל בעיה ארכיטקטונית, ולכן ההדגמה משווה שתי ערימות שמריצות את אותו מודל זהה.
מודלים ייעוציים מזינים שער דטרמיניסטי. השער מקבל את ההחלטה, וההחלטה היא קוד שניתן לקרוא.
כל תור של המטופל רץ דרך צינור קבוע. ההודעה מנוקה מ-PII ומחושבת ל-hash, מסווג C-SSRS מדרג את חומרתה על מבנה Columbia ומחזיר רמה, ביטחון, ו-ABSTAIN כשאינו יכול להצדיק חומרה. מנטר מסלול מבוסס-מצב צובר אז סיכון על פני תורות. זו יכולת הליבה, וזה הדבר האחד שאין למודרטור לפי-הודעה: הוא רואה את הדפוס, לא את השורה הבודדת, ומייצר סיכון אפקטיבי וטווח (BENIGN, WATCH, CONCERN, HIGH, CRITICAL) עם סיבה מנוסחת כגון "הפרעת אכילה מתמשכת, שיפוע עולה."
לפני שתשובה מועמדת כלשהי מגיעה למטופל, פאנל מאמת רב-מבקרים בודק אותה: מבקר חנפנות וטון, מתאם דפוסים-אסורים, ובודק טענות-קליניות. מבקר שסומן כופה על השער לפחות רמת מינימום מוגדרת, לא משנה כמה עדינה התשובה נשמעת.
ההחלטה עצמה היא שער מדיניות דטרמיניסטי בן 5 רמות, והיא Python, לא LLM: L1 CONTINUE, L2 RESTRICT, L3 SUBSTITUTE_SCRIPT, L4 HUMAN_HANDOFF, L5 CRISIS_PROTOCOL. כשהשער חוסם תשובה הוא מחליף באחד מספריית תסריטים כתובים-קלינאי שמקובצת לפי רמה ומשפחה, ורושם את מזהה התסריט. הוא לעולם אינו מאלתר שפת משבר. כל תור נכתב אז כרשומת sha256 משורשרת לקודמת לה.
הספים, המינימומים שנכפים-על-ידי-המאמת, וספריית 12-התסריטים מוגדרים על ידי ועדת הבטיחות הקלינית תחת גרסת מדיניות 2026.04-clinical-v1. ההנדסה אוכפת בדיוק זאת, ואינה משנה אותה. היסטוריית מטופל, שנשלפת דרך דגל FHIR מדומה, יכולה להוריד סף כך שהשכבה מסלימה מוקדם יותר עבור מטופל פגיע יותר. כשביטחון המסווג נמוך, הוא נמנע ומנתב לסקירה אנושית במקום לנחש חומרה.
תרחיש הגיבור כברירת מחדל הוא היסחפות הפרעת-אכילה: שישה תורות, כל אחד מהם בנפרד שאלת Wellness רגילה.
השיחה נפתחת בשאלות תמימות על אכילה בריאה יותר וספירת קלוריות. למודרטור לפי-הודעה אין מה לחסום, והבסיס חסר-המצב בהדגמה נשאר ירוק, קורא WATCH ו-"לא רואה דבר, אין זיכרון" תור אחר תור. השכבה מבוססת-המצב, שצופה במסלול, חוצה ל-CONCERN בתור 3. היא חוסמת את תשובת הצ'אטבוט ומחליפה בתסריט עיגון כתוב-קלינאי שמצביע ל-NEDA Helpline. זה שני תורות לפני ההודעה המסוכנת במפורש הראשונה.
בתורות האחרונים ההודעות הופכות למסוכנות במפורש. הערימה הלא-מוגנת משמאל מוסרת את התשובה המזיקה, המוצגת כמחוקה ומסומנת כנמסרה למטופל וכלא-בטוחה. מימין, פאנל המאמת מיירט את התשובה, תופס את הטון החנפני ואת הדפוס האסור, והשער מסלים ל-L4 העברה לאדם, ומזמן חבר צוות-טיפול עם הקשר מלא. אנחנו מתארים את התפיסה, לא את התוכן המזיק עצמו.
תוצאת המפגש הופכת את הפער למוחשי, והוא מיוחס למבוססות-מצב לבדה כי שתי הערימות השתמשו באותו מסווג ובאותו שער. ההבדל היחיד היה זיכרון חוצה-תורות.
רתמת המדד מדרגת סט זהב מתויג של 40 שיחות ו-177 תורות, שנוצר דטרמיניסטית מ-8 שיחות קנוניות שנכתבו-ביד בתוספת פרפרזה משמרת-תווית ווריאנטים של בקרה-שפירה. על הסט הזה הערימה המוגנת מסרה 0 תשובות לא-בטוחות במקום שבו ערימה לא-מוגנת מסרה 68. הזיהוי רץ בחציון של 2 תורות מוקדם יותר מהמודרטור הזהה חסר-המצב, וב-2 שיחות המודרטור חסר-המצב לא הסלים כלל. היו 0 הסלמות שווא על פני 29 תורות שפירים, דיוק רמת C-SSRS היה 94.3% בהתאמה מדויקת ו-97.2% בתוך רמה אחת, והשכבה נמנעה וניתבה לאדם פעם אחת. המספרים האלה מוגבלים לסט הזהב הסינתטי הזה, לא ערובה בעולם-פתוח.
כל שיחה מציגה דוח אירוע בטיחות. כל תור הוא רשומת sha256 משורשרת לקודמת, כך שעריכת שדה כלשהו שוברת כל hash מאוחר יותר והחבלה ניכרת. הדוח מציג את רמת המסווג, את הסיכון חוצה-התורות, את ממצאי המאמת, את החלטת השער ואת הסיבה לה, את מזהה התסריט שהוחלף, ואת שרשרת ה-hash, עם השרשרת מאומתת כשלמה. הוא בנוי להגשה: ראיות ניטור פוסט-שיווקי של ה-FDA, הגנה משפטית, חיתום ביטוחי.
אותה משימה, הבדל מבני אחד: זיכרון על פני תורות ומדיניות שמישהו יכול להיות בעליה.
| יכולת | מודרטור חסר-מצב לפי-הודעה | שכבת בטיחות AI קלינית |
|---|---|---|
| מדרג הודעה בודדת | כן | כן |
| רואה את המסלול חוצה-התורות | לא, אין לו זיכרון | כן, צובר סיכון מבוסס-מצב |
| בודק את התשובה המועמדת לפני המסירה | לא | כן, פאנל מאמת רב-מבקרים |
| מי בעל מדיניות ההסלמה | משתמע במודל או בפרומפט | הצוות הקליני, שער בן 5 רמות |
| מה מקבל את ההחלטה | מודל או פרומפט | קוד דטרמיניסטי מחוץ ל-LLM |
| שפת משבר כשהוא חוסם | נוצרת-על-ידי-המודל, מאולתרת | ספריית תסריטים מאושרת-קלינאי |
| ביקורת בנויה להגשה | אין | דוח אירוע בטיחות משורשר-hash |
לא. זה middleware שעוטף את הצ'אטבוט הקיים ולעולם אינו משנה את המודל. הוא מוסיף צובר סיכון מבוסס-מצב חוצה-תורות, פאנל מאמת רב-מבקרים, ושער הסלמה דטרמיניסטי סביב המודל, ומחליף בתסריט כתוב-קלינאי כשהוא חוסם תשובה. הנקודה היא ממשל מבוסס-מצב וקבלה ניתנת-להגשה, לא מודל אחר.
מודרטור לפי-הודעה מדרג כל תשובה בבידוד ואין לו זיכרון, ולכן הוא מפספס משבר שנבנה על פני תורות. על סט זהב מתויג של 40 שיחות השכבה מבוססת-המצב הסלימה בחציון של 2 תורות מוקדם יותר ממודרטור זהה חסר-מצב שהשתמש באותו מסווג ובאותו שער. בשתיים מאותן שיחות המודרטור חסר-המצב לא הסלים כלל.
לא. המסווג ופאנל המאמת הם ייעוציים, אך החלטת ההסלמה בת 5 הרמות והביקורת הם Python דטרמיניסטי מחוץ לכל LLM. מבקר יכול לקרוא את השער; הוא אינו יכול לחקור פרומפט בחקירה נגדית. סוכנים מייעצים, קוד מחליט.
כל תור הוא רשומת sha256 משורשרת לקודמת, כך שעריכת שדה כלשהו שוברת כל hash מאוחר יותר והחבלה ניכרת. התוצאה היא דוח אירוע בטיחות ניתן-להגשה ב-JSON וב-HTML, ממוסגר לניטור פוסט-שיווקי של ה-FDA, הגנה משפטית, וחיתום ביטוחי. בהדגמה הדוח מציג את השרשרת שלמה.
צ'אטבוט מושלם עדיין אין לו מושג לגבי מדיניות ההסלמה של הפלטפורמה שלכם, אינו מייצר מסלול ביקורת, אינו נותן לכם שער דטרמיניסטי לאשר, ואינו מציע הגנה כשהוא נפרץ ב-jailbreak. הערך העמיד הוא הממשל מבוסס-המצב בתוספת הקבלה הניתנת-להגשה, לא שיעור-שגיאת-מודל נמוך יותר. לכן ההדגמה משווה מול מסווג ושער זהים ומייחסת את השיפור למבוססות-מצב לבדה.
לא. זו הדגמה של דפוס ארכיטקטורת-בטיחות, לא התקן רפואי, והיא אינה מאושרת-FDA או מוסמכת-HIPAA. כל שיחה היא סינתטית, מתאם ה-FHIR הוא stub, והמסווג הוא מסווג לקסיקון דטרמיניסטי שעומד במקום מודל ייצור in-VPC. כל מספרי ההוכחה מוגבלים לסט זהב מתויג של 40 שיחות של נתונים סינתטיים.
המחקר מאחורי הדגמה זו — הארכיטקטורה, עיצוב האימות, והתכנון הארגוני.
ממשל מבוסס-מצב, מדיניות שהצוות הקליני הוא בעליה, וביקורת שניתן להגיש.
אם הצוות שלכם עובד על האופן שבו הופכים צ'אטבוט לבריאות התנהגותית לניתן-להגנה לסקירה ארגונית, של גורם משלם או רגולטורית, נשמח באמת לשמוע איך אתם חושבים על זה. הבעיה היא רוחבית-לתעשייה וגם התשובות יהיו.