
طوّرتُ نظام فحص للذكاء الاصطناعي السريري يعلّق جملة صحيحة تماماً
عثرتُ في مسودة اصطناعية لبوابة المرضى على نسبة صحيحة لـ HbA1c تبلغ 6.8% إلى جانب نصيحة بمواصلة تناول الميتفورمين. ويُظهر السجل الطبي الاصطناعي للمريض نفسه قيمة eGFR تبلغ 28. وعندما جمعتُ بين هذه الحقائق، لم يعد السؤال ما إذا كان الذكاء الاصطناعي قادراً على اقتباس نتيجة مختبرية، بل أصبح: هل يمكن لجملة صحيحة أن تضفي مصداقية زائفة على إجراء يتطلب مراجعة الطبيب؟
لقد بنيت الدليل الإرشادي التفاعلي لـ ChartSieve حول نقطة التوتر تلك. هذا العرض يستند إلى سجلات اصطناعية ثابتة ومخرجات ذكاء اصطناعي محاكاة، وليس انتشاراً سريرياً فعلياً. إنه يتيح لي توضيح مسار فحص شفاف: تصل المسودة، ويتم توثيق الادعاءات بمصادرها، ثم يُفحص الإجراء الموصى به بمقارنته بالسجل، وتقرر بوابة سياسات حتمية ما إذا كان ينبغي تحرير المسودة أو تعليقها أو حظرها. ولا يتم إرسال الرسالة إلى أي مريض.
الجملة التي اجتازت سؤالي الأول
أتتبع مسودة بوابة المرضى ادعاءً تلو الآخر. تتطابق نسبة HbA1c البالغة 6.8% مع السجل الاصطناعي. ويظهر الميتفورمين في قائمة الأدوية. يمكنني إسناد مصدر إلى جانب كل حقيقة، ومع ذلك لا أجد أي سبب، استناداً إلى هذين التطابقين وحدهما، لإيقاف المسودة. غير أن التعليمات الختامية تأمر المريض بمواصلة تناول الدواء. توقفتُ ملياً عند هذا الفعل. فالمصدر الذي يثبت وجود الدواء في السجل لا يمكنه الترخيص بتوصية الاستمرار في تناوله.
أنتقل من العبارات المستندة إلى مصادر إلى أحدث قيمة لوظائف الكلى، وهي eGFR 28. وهنا تتدخل قاعدة CONTRAINDICATION_RENAL المحددة مسبقاً لتعليق المسودة بانتظار مراجعة الطبيب. هذا هو المنعطف التصميمي الذي اعتمدتُه في ChartSieve: فحص الإجراءات الموصى بها بمعزل عن الادعاءات المدعومة بمصادر، ثم إبقاء النتيجتين مرئيتين. أنا لا أعيد تصنيف قيمة HbA1c كقيمة كاذبة لتسهيل تبرير التعليق؛ فالادعاء المخبري يظل صحيحاً على الشاشة بينما ينال الإجراء الموصى به حكماً مغايراً.
كما أُبقي سجل تطور الكرياتينين مرئياً: من 1.4 إلى 1.9 ثم 2.3 mg/dL. يضيف ذلك سياقاً إلى النتيجة الكلوية، لكنه ليس محفزاً مستقلاً للقرار النهائي. أحرص تماماً على هذا التمييز لأنه من السهل جعل المنحنى المقلق بديلاً عن القاعدة الفعلية. أحدث قيمة لـ eGFR هي التي تقود نتيجة القاعدة في هذه الحالة الاصطناعية. ينبغي أن يكون المراجع قادراً على الطعن في الدليل الدقيق والقاعدة التي أدت إلى التعليق، وليس في تفسيري الشخصي لمخطط بياني مثير للقلق.
عندما أنظر إلى شاشة الحالة، فإن التفصيل المجدي ليس مجرد شارة حمراء. فالجملة الأصلية تظل مرئية إلى جانب القرار والنتيجة. يمكنني قراءة المسودة، وادعاء HbA1c، والسبب الكلوي للتعليق في شاشة واحدة. هذا هو الفارق بين تحذير عام وقرار قابل للتدقيق. وسيظل يتعين على الطبيب تقييم السياق الواقعي؛ فهذا العرض التجريبي لا يحل محل ذلك التقدير ولا يؤكد تصرف الطبيب.

الادعاء الموثق والإجراء المعلق
يمكنني الإشارة مباشرة إلى eGFR 28 في السجل الاصطناعي الثابت، ولهذا يبدو التعليق المحدد مسبقاً حاسماً وواضحاً. أما قاعدة الإنتاج الحقيقية، فسيتعين عليها أولاً تحديد أي نتيجة كلوية يجب اعتمادها. ماذا لو تعارضت نتيجتان، أو تعذّر الوصول إلى أحدث قيمة، أو لم تكن الزيارة السريرية واضحة؟ ChartSieve لا يحسم هذه التساؤلات. اختيار قيمة السجل هو في حد ذاته قرار أمان. يمكن للقاعدة أن تكون مصاغة بدقة برمجية بالغة بينما تكون الأدلة المدخلة إليها ناقصة أو متنازعاً عليها.
أود أن يكون هذا الاختيار معروضاً للمراجع أيضاً. فالنتيجة المختارة، وتوقيتها، وأي سياق مفقود يجب أن تكون مرئية قبل أن يتخذ أي شخص إجراءً بناءً على التعليق. وإلا، فقد تتحول قاعدة محددة جيداً إلى جدل حول مدخلات خفية، ويضطر المكلف بمراجعة المسودة إلى إعادة البحث في السجل من البداية.
اخترتُ عرض سجل الكرياتينين إلى جانب أحدث قيمة لـ eGFR حتى يرى المراجع السياق دون الخلط بينه وبين المحفز الفعلي. هذا التمييز يجب أن يصمد أثناء صيانة القواعد. من يمتلك القاعدة الكلوية، وأي إرشادات سريرية وسياسات محلية تحكمها، وكيف يُختبر التغيير قبل أن يؤثر على المسودات؟ يعتمد العرض على مجموعة قواعد أولية منتقاة، ولا يوفر قاعدة معرفة سريرية خاضعة للصيانة المستمرة أو مساراً للإجابة عن أسئلة المسؤولية.
لقد بنيتُ لوحة الحالة بحيث يمكن تحديد موضع الخلاف بدقة. قائمة الأدوية تؤكد حقيقة أن المريض يتناول الميتفورمين. أما قاعدة CONTRAINDICATION_RENAL المنفصلة فتعلّق توصية الاستمرار في تناوله في ضوء قيمة eGFR البالغة 28. يمكن للمراجع الاعتراض على اختيار المصدر أو القاعدة أو تفسير التعليمات، دون الحاجة إلى التظاهر بأن ادعاء HbA1c كان باطلاً. هذه أوجه خلاف مختلفة تماماً، وسيحتاج أي مسار عمل حقيقي إلى وسيلة لتسجيل أي منها قد وقع.
سأسأل فريق الرعاية عما ينبغي أن يحدث تالياً إذا اختلف الطبيب مع قرار التعليق. ما المبرر الذي يجب تسجيله؟ من يملك سلطة تحرير المسودة، وما الأدلة التي يجب حفظها؟ يعلم العرض المحتوى للمراجعة، لكنه لا يربط تلك الحالة بطبيب ممارس ولا يوثق تجاوزاً يدوياً (override). هذا التسليم المعلق هو تحديداً النقطة التي يتعين على أي مؤسسة صحية فيها تحديد المسؤولية بوضوح. فشاشة كُتب عليها «معلق» لا يمكنها إخباري بمن قَبِل النصيحة الموجهة للمريض أو عدلها أو رفضها في نهاية المطاف.
أردت أن يكون قرار التعليق قابلاً للفحص
لم أكن أريد للمراجع أن يتلقى مجرد رأي من نموذج لغوي يرى أن المسودة تبدو محفوفة بالمخاطر. في العرض التوضيحي، يمكن لوكلاء التحقق إضافة تنبيهات تتعلق بالتوثيق والإنصاف والفريق الأحمر (red-team). الاتصال المباشر بالمزود اختياري والردود يمكن تخزينها مؤقتاً؛ وفي حال غيابه، يُستخدم نص استشاري حتمي. هذه الإرشادات تثري منظور المراجع، لكنها لا تحدد القرار النهائي ولا تتجاوزه. وتعيد بوابة السياسات الحتمية إحدى النتائج التالية: RELEASE أو HOLD_FOR_REVIEW أو BLOCK.
هذا الحد بالغ الأهمية في هذه الحالة. فحتى لو كان التنبيه الاستشاري بليغاً ومقنعاً ولكن نتيجة القاعدة تقضي بالتعليق، تظل المسودة معلقة في سير العمل المحاكى. وإذا غاب التنبيه أو افتقر إلى الإقناع، تظل القاعدة ذاتها قابلة للتقييم. سلطة البوابة صريحة، وليست مدسوسة في فقرة منمقة صاغها نموذج آخر. يمكنني أن أختلف مع كيفية تصميم القاعدة الأولية وأظل مع ذلك مدركاً بدقة أي جزء من النظام اتخذ القرار. هذا أكثر فائدة للحوكمة بكثير من درجة ثقة غامضة ومبهمة.
يمنحني إيصال الأمان (Safety Receipt) طريقة أخرى لفحص قرار التعليق. فبالنسبة لحالة الميتفورمين، يتضمن سجل العرض النتيجة النهائية، والمصادر المتاحة للادعاءات، والنتيجة الكلوية، والإرشادات الاستشارية، وطابعاً زمنياً، وخلاصة SHA-256 معروضة في 16 حرفاً ست عشرياً. يمكنني تتبع الأدلة التي رافقت القرار. الخلاصة مقتطعة في الإيصال المعروض؛ وسيتطلب تصميم النزاهة والحفظ في بيئة الإنتاج الفعلي أكثر من هذا السجل. تجعل الحقول المرئية هذا التصرف المحدد مسبقاً قابلاً للتدقيق.

أقرأ هذا الإيصال بصورة عكسية بدءاً من حكم التعليق. أبحث أولاً عن نتيجة القاعدة التي تسببت في التعليق؛ ثم أبحث عن مصادر الادعاءات التي ظلت صحيحة. هذا الترتيب يمنعني من التعامل مع الحكم كإدانة لكل جملة في المسودة. كما يمنح المراجع نقطة ارتكاز محددة للاعتراض. فيمكنه الطعن في القاعدة الأولية، أو القيمة الكلوية المختارة، أو تفسير تعليمات الدواء. هذه اعتراضات متباينة، والإيصال يبقي الحقول ذات الصلة متقاربة بما يكفي للتمييز بينها. وبطاقة الخطر الموحدة كانت ستجبر المراجع على إعادة بناء سلسلة الاستدلال تلك بمفرده.
أتجنب أيضاً نسج قصة يُفهم منها أن المسودة المعلقة قد روجعت بالفعل من قِبل طبيب. فالواجهة تكتفي بتمييزها للمراجعة، ولا توثق إجراءً فعلياً لفريق الرعاية. قد يبدو هذا فارقاً لغوياً ضئيلاً، إلى أن يجد ادعاء «تمت مراجعته من قبل طبيب» طريقه إلى سجل موجه للمريض أو لجهات التدقيق. ينبغي لأي سير عمل أمان أن يكون دقيقاً بشأن ما حدث فعلاً وما هو معلق ببساطة. تكمن قيمة الإيصال في هذا العرض في كونه يجعل القرار المحاكى وأدلته قابلة للفحص، لا في كونه يثبت حدوث تسليم سريري حقيقي.
خط الأساس الذي جعلني أتوقف
أعود إلى مسودة الميتفورمين عند فحص معيار القياس. إذا تفقدتُ القيمة المخبرية المذكورة فقط، فإن نسبة 6.8% تتطابق مع السجل. وإذا فحصتُ الإجراء الموصى به مقابل أحدث قيمة كلوية، فإن eGFR 28 يطلق التعليق المحدد مسبقاً. أردتُ لمجموعة اختبارات الانحدار أن تجعل هذا التحول في طبيعة السؤال مرئياً خارج حدود شاشة واحدة، مع التزام الصدق بشأن مدى صغر الاختبار وطبيعته المصطنعة.
تحتوي المجموعة على 34 مصنفاً اصطناعياً ثابتاً: 12 مصنفة كآمنة و22 مصنفة كغير آمنة. نجح جدار الحماية الحتمي لـ ChartSieve في تعليق أو حظر جميع المصنفات غير الآمنة البالغ عددها 22، ولم يعلق أو يحظر أي مصنف من المصنفات الـ 12 الآمنة. خط الأساس المقارن يطابق القيم المخبرية بالسجل ويحرر قرارات دعم القرار السريري؛ وقد رصد 4 فقط من أصل 22 مصنفاً غير آمن وتجاهل 18. يجيب مطابِق القيم المخبرية عن سؤال أضيق مقارنة بفحص القاعدة المسبق هذا. وتوضح شاشة الميتفورمين السبب: فالرقم الدقيق والتعليمات التي علقتها القاعدة يظهران في المسودة نفسها.

ما زلت بحاجة لمعرفة من يراجع تعريفات القواعد، وكيف تُسجل الخلافات، وما الأخطاء التي تستبعدها المجموعة المصنفة، وماذا يحدث عند فقدان الأدلة اللازمة لتطبيق قاعدة ما. يمنح العرض تلك التساؤلات مجسماً ملموساً: مسودة قابلة للفحص، وسجل اصطناعي، ونتيجة قاعدة، وقرار تصرف. تُظهر الحالات الـ 18 التي أهملها خط أساس مطابقة المختبر القيمة الإضافية لفحوصات الأمان الأوسع نطاقاً لهذه المجموعة الثابتة؛ لكنها لا تخبرني بكيفية أدائها في حالات سريرية جديدة. فالأمثلة مبرمجة بأنماط معروفة، وخط الأساس يمثل مقارنة ضيقة عمداً، وليس منتجاً لمورد منافس.
ما أود طرحه أمام فريق الرعاية
سأبدأ النقاش من شاشة الميتفورمين وليس بطاقة النتائج. فهي تمنح مسؤول المعلوماتية السريرية شيئاً محدداً للطعن فيه. هل أحدث قيمة لـ eGFR هي المحفز المناسب في قاعدة مستمرة؟ ما الاستثناءات والبيانات المفقودة المؤثرة؟ ما الذي يجب أن يراه المراجع، وما الذي ينبغي للنظام تسجيله عند تجاوز التعليق؟ تلك قرارات تخص الحوكمة السريرية، وليست فقرة تسويقية أو رداً من نموذج غير خاضع للمساءلة.
وإذا كنت تفضل مشاهدة النظام بدلاً من قراءة وصفي له، فإليك العرض الكامل يعمل من البداية إلى النهاية.
إن التحليل الكامل لعرض أمان الذكاء الاصطناعي السريري يوضح الحالة ومسار الفحص. وأعود إلى مشهد بارز فيه: قيمة مخبرية صحيحة بجوار تعليمات دوائية معلقة. كلا الحقيقتين تستحقان أن تظلا مرئيتين. إن إخفاء الادعاء الصحيح سيجعل المسودة تبدو معيبة بشكل صارخ؛ وإخفاء النتيجة الكلوية سيجعلها تبدو جاهزة للإرسال. ويبدأ التحدي الحقيقي عندما تبقي الواجهة كليهما على الشاشة وتطلب من شخص ما تحمل مسؤولية الإجراء الواقع بينهما.



