לאחראי סיכונים וציות4 דק׳ קריאה

הודעות מטופלים שנוסחו על ידי בינה מלאכותית הציגו 7% שיעור פגיעה חמורה

רופאים החמיצו שני שלישים משגיאות הבינה המלאכותית המסוכנות בהודעות מטופלים — ומערכת הבריאות שלכם עלולה לשאת באחריות.

הבעיה

בינה מלאכותית ניסחה תגובה למטופל שתיאר תסמין מסכן חיים. במקום להורות למטופל לגשת לחדר המיון, היא שלחה מענה שגרתי ורגוע. הודעה בודדת זו סווגה מאוחר יותר ככזו המהווה סיכון ישיר למוות.

זה לא היה כשל שולי. במחקר מאפריל 2024 שפורסם ב-The Lancet Digital Health, חוקרים מ-Harvard Medical School,‏ Yale ואוניברסיטת ויסקונסין (University of Wisconsin) בדקו את יכולתו של GPT-4 לנסח הודעות בפורטל מטופלים. הם הריצו 156 שיחות מטופל מדומות דרך הבינה המלאכותית בתוך מערכת רשומות רפואיות אלקטרוניות מדומה. התוצאות היו מדאיגות: 7.1% מהטיוטות שנוצרו על ידי בינה מלאכותית היוו סיכון לפגיעה חמורה במטופלים. ו-0.6% — הודעה אחת בסימולציה — נשאה סיכון ישיר למוות.

אבל הנה החלק שאמור להדיר שינה מעיניכם. עשרים רופאים ראשוניים פעילים בדקו את אותן טיוטות בינה מלאכותית. הם החמיצו בממוצע שני שלישים מהשגיאות המסוכנות. רק רופא אחד מתוך עשרים זיהה את כל ארבע ההודעות הפגומות בכוונה. בין 35% ל-45% מהטיוטות השגויות נשלחו למטופלים ללא כל עריכה. הרופאים בטחו בבינה המלאכותית. תשעים אחוזים אמרו שהם בוטחים בביצועי הכלי. שמונים אחוזים אמרו שהוא הפחית את העומס המנטלי שלהם. הבינה המלאכותית כתבה היטב, נשמעה אמפתית ופגעה בנימה הנכונה. היא רק טעתה ברפואה — והרופאים לא הבחינו בכך.

אם מערכת הבריאות שלכם משתמשת בבינה מלאכותית כדי לנסח תקשורת עם מטופלים, זהו פרופיל הסיכון שלכם כרגע.

מדוע זה חשוב לעסק שלכם

החשיפה הפיננסית והמשפטית כאן אינה תאורטית. היא מדידה והולכת וגדלה.

הצעת חוק 3030 של האספה הכללית של קליפורניה (AB 3030) נכנסה לתוקף ב-1 בינואר 2025. היא מחייבת כל מתקן בריאות, מרפאה ומרפאת רופאים להודיע למטופלים בכל פעם שנעשה שימוש בבינה מלאכותית גנרטיבית להעברת מידע קליני. המשמעות היא הצהרות פטור בכתב בראש הודעות דוא"ל, הצהרות פטור בעל פה בתחילתן ובסופן של שיחות טלפון, והצהרות פטור מתמשכות לאורך אינטראקציות וידאו וצ'אט. אם לא תצייתו, מתקניכם צפויים לקנסות ולצעדים נגד רישיונותיהם. הרופאים האישיים שלכם עומדים בפני צעדים משמעתיים נגד רישיונות הרפואה שלהם.

AB 3030 אכן כולל פטור: אם מטפל מורשה "קורא ובודק" את פלט הבינה המלאכותית, אינכם מחויבים לחשוף זאת. אך שימו לב לנתוני המחקר מ-Lancet:

  • 7.1% מהטיוטות שנוצרו על ידי בינה מלאכותית היוו סיכון לפגיעה חמורה
  • 66.6% מאותן טיוטות מסוכנות הוחמצו על ידי הרופאים הבודקים
  • 35%–45% מהטיוטות השגויות נשלחו ללא כל עריכה
  • 90% מהרופאים דיווחו כי הם בוטחים בביצועי כלי הבינה המלאכותית

פטור זה מניח שביקורת אנושית אכן עובדת. הראיות מראות שלעתים קרובות זה אינו המצב. אם מטופל נפגע מהודעה שנוסחה על ידי בינה מלאכותית והרופא שלכם אישר אותה ללא בדיקה משמעותית, אתם עומדים בפני תביעת רשלנות רפואית בתחום שבו סטנדרט הטיפול המקובל מתפתח במהירות. בתי המשפט שואלים כעת האם מטפלים קיבלו המלצות בינה מלאכותית באופן עיוור. הם מכירים בהטיה אלגוריתמית כמקור לפגיעה ממשית במטופלים. ומבטח הרשלנות הרפואית שלכם עשוי לדרוש יומני ביקורת מתועדים המציגים את גרסת המודל, שלבי ההיסק, והעריכות הספציפיות של הרופא.

מוצרי ביטוח חדשים מכסים כעת תביעות בגין הזיות של בינה מלאכותית — אך הם מגיעים עם תקרות כיסוי נמוכות ודרישות תיעוד ופיקוח קפדניות. אם לא תוכלו להציג תיעוד זה, הכיסוי הביטוחי שלכם עלול שלא לעמוד בתוקף.

מה באמת קורה מתחת למכסה המנוע

רוב כלי הבינה המלאכותית בתחום הבריאות כיום הם מה שהתעשייה מכנה "מעטפות LLM"‏ (LLM wrappers). חשבו עליהם כעל מעטפת תוכנה דקה סביב בינה מלאכותית לשימוש כללי כמו GPT-4 או Google Gemini. מערכת הרשומות הרפואיות האלקטרוניות שלכם שולחת את הודעת המטופל לבינה המלאכותית, והבינה המלאכותית מחזירה טיוטה. זוהי למעשה המערכת כולה.

הנה הסיבה שזה מסוכן. מודלים אלה חוזים את המילה הבאה במשפט על סמך דפוסים סטטיסטיים. הם אינם מבצעים היסק רפואי. הם אינם בודקים אינטראקציות בין תרופות. הם אינם מעריכים האם תסמין של מטופל הוא מטרד של יום שלישי בבוקר או מצב חירום של מוצאי שבת. מחקר ה-Lancet מצא שהכשלים הקריטיים ביותר של הבינה המלאכותית נבעו מחוסר יכולתה להעריך עד כמה מצבו של המטופל היה דחוף.

תארו לעצמכם עובד שכותב תזכירים על ידי העתקת ביטויים מאלפי תזכירים ישנים. הדקדוק מושלם. הנימה מקצועית. אך לעובד אין שמץ של מושג מה המילים באמת אומרות. כך בינה מלאכותית לשימוש כללי מטפלת בהודעות המטופלים שלכם.

למודלים אלה יש גם מגבלות עדכניות ידע (knowledge cutoffs) — תאריכים קבועים שמעבר להם הם אינם יודעים דבר. הם אינם יכולים להסתמך על תוצאות המעבדה העדכניות ביותר של המטופל שלכם או על ההנחיות הקליניות החדשות ביותר, אלא אם כן מישהו בונה את החיבור הזה. לעתים קרובות הם אינם מסוגלים לעבד דימות, אותות אק"ג (ECG) או נתונים גנומיים. וללא הסכם שותף עסקי ספציפי תחת HIPAA‏ (HIPAA Business Associate Agreement) ופרוטוקולים להסוואת נתונים, שליחת נתוני מטופלים דרך ממשק API של בינה מלאכותית לשימוש כללי יוצרת סיכון פרטיות חמור. התקפות הזרקת פרומפט יריבות (prompt injection) עלולות להערים על מודלים אלה ולגרום להם לחשוף מידע רגיש על מטופלים.

התוצאה: הבינה המלאכותית שלכם נשמעת מלאת ביטחון. הרופאים שלכם בוטחים בה. ואף אחד אינו מבחין בשגיאות עד שמטופל נפגע.

מה עובד (ומה לא)

ראשית, הנה שלוש גישות שאינן פותרות את הבעיה הזו:

"פשוט להכשיר רופאים להיות זהירים יותר." הטיית אוטומציה (automation bias) היא אפקט פסיכולוגי מתועד היטב. כאשר בינה מלאכותית מייצרת טקסט מלוטש ואמפתי, אפילו קלינאים מנוסים מורידים את מגננותיהם. מחקר ה-Lancet הוכיח זאת במובהקות סטטיסטית (p < 0.001).

"לבצע כוונון עדין למודל בינה מלאכותית רפואי." מחקרים מראים שמודלים רפואיים ייעודיים כמו MedGemma השיגו דיוק של 28%–61% בלבד בחלק ממבחני ההזיות. כוונון עדין לתחום (domain fine-tuning) לבדו אינו מתקן את פער ההיסק הבסיסי.

"להוסיף הצהרת פטור ולהמשיך הלאה." עמידה בדרישות AB 3030 היא הכרחית אך אינה מספקת. הצהרת פטור אינה מונעת פגיעה. היא רק אומרת למטופל את מי להאשים.

הנה מה שבאמת עובד — ארכיטקטורה מעוגנת (grounded architecture) הבנויה בשלושה שלבים:

שלב 1: לאחזר לפני שמייצרים. לפני שהבינה המלאכותית שלכם כותבת מילה אחת, עליה למשוך את חומר המקור הרלוונטי. תהליך זה נקרא יצירה מועשרת באחזור (RAG - Retrieval-Augmented Generation) — טכניקה שבה מזינים לבינה המלאכותית מסמכים מאומתים כגון רישומים קליניים של המטופל, הנחיות טיפול עדכניות ופרוטוקולים מוסדיים. לאחר מכן הבינה המלאכותית מייצרת את תגובתה בהתבסס אך ורק על המידע שאוחזר, ולא על נתוני האימון הכלליים שלה.

שלב 2: לבנות את הידע שלכם כמבנה גרף. גרף ידע רפואי (Medical Knowledge Graph) ממפה מושגים קליניים כקשרים מקושרים — תרופה מקושרת להתוויות הנגד שלה, המקושרות למצבים רפואיים ספציפיים של מטופלים. מערכות כמו MediGRAF משתמשות במסדי נתוני גרף כדי לתרגם שאלות בשפה פשוטה לשאילתות מדויקות. הדבר משיג שיעור היזכרות (recall) של 100% בשאילתות קליניות עובדתיות מכיוון שהמערכת חוצה קשרים מאומתים, ולא ניחושים סטטיסטיים.

שלב 3: לצטט כל טענה. כל קביעה בפלט הבינה המלאכותית צריכה להפנות בחזרה למסמך המקור שלה. הרופא הבודק שלכם אינו צריך לנחש האם הבינה המלאכותית צודקת. הוא יכול לאמת כל טענה מול המקור המצוטט בתוך שניות. הדבר הופך בדיקה פסיבית לאימות פעיל.

יתרון שובל הביקורת (audit trail) הוא מה שהופך גישה זו לברת-הגנה. כל טיוטה שנוצרת על ידי בינה מלאכותית נושאת תיעוד של אילו מסמכים אוחזרו, באילו נתיבים בגרף הידע עברו, ואיזה מקור תומך בכל קביעה. כאשר צוות הציות שלכם, המבטח שלכם, או עורך דינו של התובע שואלים כיצד נוצרה הודעה ספציפית, תוכלו להציג בפניהם את שובל הלוגיקה המלא. זהו ההבדל בין תהליך בר-הגנה לבין חבות משפטית.

עבור תוכניות הציות והבטיחות של בינה מלאכותית בתחום הבריאות שלכם, ארכיטקטורה זו אינה אופציונלית — היא סטנדרט הטיפול המקובל המתפתח. אותם עקרונות חלים על תשתית ה-RAG וגרף הידע שלכם ועל בדיקות התיקוף ותרגילי הצוות האדום שאמורים להעמיד את המערכות שלכם במבחני עומס יומיומיים.

אתם יכולים לקרוא את הניתוח הטכני המלא עבור המפרטים ההנדסיים המפורטים, או לחקור את הגרסה האינטראקטיבית עבור סיור מודרך בארכיטקטורה.

נקודות מפתח

  • מחקר של Lancet מצא כי 7.1% מהודעות המטופלים שנוסחו על ידי בינה מלאכותית היוו סיכון לפגיעה חמורה, והרופאים החמיצו שני שלישים מהשגיאות.
  • חוק AB 3030 של קליפורניה מחייב כעת גילוי נאות למטופלים כאשר בינה מלאכותית מייצרת תקשורת קלינית, עם קנסות וצעדים נגד רישיונות במקרה של אי-ציות.
  • פטור 'הביקורת האנושית' ב-AB 3030 מניח שרופאים תופסים שגיאות בינה מלאכותית — הנתונים מראים שלעתים קרובות הם אינם עושים זאת.
  • מעטפות בינה מלאכותית פשוטות סביב מודלים לשימוש כללי חוזות מילים, לא תוצאות רפואיות, מה שיוצר פער ביטחון מסוכן.
  • מערכות בינה מלאכותית מעוגנות שמאחזרות מקורות קליניים מאומתים ומצטטות כל טענה מעניקות לצוות שלכם תהליך מבוקר ובר-הגנה.

שורה תחתונה

הראיות ברורות: ניסוח הודעות למטופלים באמצעות בינה מלאכותית לשימוש כללי יוצר סיכון מדיד לבטיחות המטופל שביקורת אנושית לבדה אינה יכולה לפתור. מערכת הבריאות שלכם זקוקה לבינה מלאכותית שמאחזרת מקורות קליניים מאומתים, מבצעת היסק באמצעות ידע רפואי מובנה, ומייצרת שובל ציטוטים עבור כל טענה. שאלו את ספק הבינה המלאכותית שלכם: כאשר המערכת שלכם מייצרת הודעה למטופל, האם תוכלו להראות לי בדיוק על אילו מסמכים קליניים היא הסתמכה ומדוע היא בחרה בהמלצה זו על פני חלופות?

שאלות נפוצות

שאלות נפוצות

באיזו תדירות בינה מלאכותית עושה שגיאות מסוכנות בהודעות למטופלים?

מחקר משנת 2024 ב-Lancet Digital Health מצא כי 7.1% מטיוטות הודעות המטופלים שנוצרו על ידי בינה מלאכותית היוו סיכון לפגיעה חמורה, ו-0.6% היוו סיכון ישיר למוות. הרופאים הבודקים החמיצו בממוצע שני שלישים מהשגיאות המסוכנות, ו-35% עד 45% מהטיוטות הפגומות נשלחו למטופלים ללא כל עריכה.

האם קליפורניה מחייבת גילוי נאות כאשר בינה מלאכותית כותבת הודעות למטופלים?

כן. הצעת חוק 3030 של האספה הכללית של קליפורניה (AB 3030), שנכנסה לתוקף ב-1 בינואר 2025, מחייבת מתקני בריאות ורופאים להודיע למטופלים בכל פעם שנעשה שימוש בבינה מלאכותית גנרטיבית להעברת מידע קליני. אי-ציות עלול לגרור קנסות, צעדים נגד רישיונות מתקנים וצעדים משמעתיים נגד רישיונותיהם של רופאים יחידים. קיים פטור אם מטפל מורשה קורא ובודק את פלט הבינה המלאכותית לפני השליחה.

מהי הדרך הבטוחה ביותר להשתמש בבינה מלאכותית לתקשורת עם מטופלים בתחום הבריאות?

הגישה הבטוחה ביותר משתמשת ביצירה מועשרת באחזור (RAG), המחייבת את הבינה המלאכותית להסתמך על מסמכים קליניים מאומתים לפני יצירת תגובה כלשהי. בשילוב עם גרפי ידע רפואיים הממפים אינטראקציות בין תרופות וקשרים קליניים, ומערכות ציטוט המקשרות כל טענה של הבינה המלאכותית למקורה, ארכיטקטורה זו מפחיתה הזיות ומעניקה לרופאים שובל בר-אימות עבור כל הודעה. תרגילי צוות אדום יריבים יומיומיים צריכים לבדוק את המערכת לאיתור שגיאות, דליפת נתונים ואי-דיוקים קליניים.

בנו את ה-AI שלכם בביטחון.

שותפו עם צוות בעל ניסיון עמוק בבניית הדור הבא של AI ארגוני. אנו נסייע לכם לתכנן, לבנות ולהטמיע אסטרטגיית AI שתוכלו לסמוך עליה.

Veriprajna ייעוץ דיפ-טק מתמחה בבניית מערכות AI קריטיות לבטיחות עבור תחומי הבריאות, הפיננסים והרגולציה. הארכיטקטורות שלנו מאומתות מול פרוטוקולים מבוססים ומלוות בתיעוד ציות מקיף.