يوضح مثال المحفظة الاصطناعية سبب حاجة مراجعة ادعاءات الذكاء الاصطناعي إلى أدلة الاستخدام التشغيلي والصياغة الدقيقة والأسئلة المفتوحة.
الذكاء الاصطناعيإدارة المنتجاتRisk Management

ما يتركه وجود نموذج الذكاء الاصطناعي دون إثبات

Ashutosh SinghalAshutosh Singhal29 يوليو 20266 min

يمكن لفريق أن يُصدر بطاقة نموذج ومع ذلك يترك ادعاءه التسويقي دون إجابة. قد توثق البطاقة أن النموذج موجود بالفعل. ولكن الجملة التي تصف العمل بأنه «مدفوع بالذكاء الاصطناعي» تقدم التزاماً إضافياً بشأن دور النموذج في العمل الفعلي. أريد لمراجعة تلك الجملة أن تصل إلى السجل التشغيلي قبل أن يتعامل أي شخص مع مجرد وجود التقنية على أنه دعم كافٍ.

إفصاح: تمت صياغة هذا المقال باستخدام الذكاء الاصطناعي التوليدي.

يقف هذا الموقف التصميمي وراء ClaimLens، وهو عرضنا التوضيحي المحلي لربط ادعاءات الذكاء الاصطناعي بالسجلات الفنية المقدمة. المثال هنا هو Nimbus Capital AI، وهي شركة اصطناعية ذات إفصاحات وسجلات اصطناعية. إنه يوضح مشكلة مراجعة؛ ولا يحدد كيفية عمل أي شركة استثمار فعلية أو ما إذا كان الإفصاح متوافقاً مع القانون.

المسافة بين كونه منشوراً وكونه يقود العمل

تقول Nimbus: «نحن نستخدم تحسين المحفظة المدفوع بالذكاء الاصطناعي عبر جميع الحسابات المدارة وفق تقدير تقديري». يقول سجل النموذج المقدم إن نموذج التحسين منشور بالفعل. بينما يقول سجله التشغيلي إن مخرجات النموذج أثرت في 1.5% فقط من قرارات التخصيص. يُسند ClaimLens إلى هذا الادعاء حكم «Needs proof» بموجب قاعدته المهيأة للتأثير التشغيلي المنخفض.

سجل ClaimLens يُظهر ادعاء تحسين المحفظة الاصطناعية مصنفاً كـ Needs proof إلى جانب أحكام الادعاءات الأخرى
يظل ادعاء المحفظة الاصطناعية مرئياً مع قرار «Needs proof» الخاص به. وتحتفظ الصفوف الأخرى بنتائجها الخاصة؛ وهذه التصنيفات هي أحكام تجريبية مهيأة، وليست تصريحاً قانونياً.

يجيب سجل الوجود عن سؤال مفيد: هناك نموذج للتحقيق بشأنه. بينما يجيب سجل التشغيل عن سؤال مختلف: كم مرة أثرت مخرجاته في قرارات التخصيص المسجلة. ولا ينبغي لأي من الحقيقتين أن تختفي لأن الأخرى غير مريحة.

تمتد الجملة إلى أبعد من تلك السجلات. عبارة «مدفوع بالذكاء الاصطناعي» توحي بدور حاسم في توجيه العمل. وعبارة «عبر جميع الحسابات» تقدم اتساعاً في النطاق. والنموذج المنشور، في حد ذاته، لا يفسر أيًا من الالتزامين. يمنح رقم 1.5% المراجع سبباً ملموساً للتساؤل عن كيفية مشاركة النموذج في العملية وكيفية توزيع هذه المشاركة عبر الحسابات.

أفضل مراجعة تُبقي هذه الفجوة صريحة ومكشوفة. فالموافقة على الصياغة الفضفاضة لمجرد وجود النموذج ستسمح لدليل ضيق بحمل وعد أكبر بكثير. وإعلان عدم استخدام الذكاء الاصطناعي على الإطلاق من شأنه أن يهمل الدليل على أن النموذج موجود ويؤثر أحياناً في القرارات. تصنيف «Needs proof» يحفظ السؤال الذي تركته السجلات المقدمة مفتوحاً.

النسبة المئوية المنخفضة لا تزال بحاجة إلى تفسير

الجزء الأصعب هو تحديد ما يجب طلبه بعد ذلك. فالحصة الصغيرة من القرارات لا تفسر، في حد ذاتها، أهمية تلك القرارات.

تأمل سير عمل افتراضي يتعامل فيه النموذج مع عدد صغير من التخصيصات ذات العواقب الاستثنائية. إن مجرد إحصاء عدد القرارات قد يقلل من شأن دوره الاقتصادي. وفي سير عمل افتراضي آخر، يُنتج النموذج توصية بشأن كل حساب، لكن الموظفين يرفضونها عادةً. وسجلٌّ يحصي التوصيات المقبولة فقط سيصف نشاطاً مختلفاً تماماً عن سجل يحصي جميع التوصيات التي تمت مراجعتها. لم يثبت أي من الاحتمالين لشركة Nimbus. وهما يوضحان سبب أهمية معنى «أثر في» قبل استخدام نسبته المئوية لتثبيت الصياغة.

يمكن للمراجع أن يسأل عن الحدث الذي يجعل السجل يحسب قراراً ما، وما هي الحسابات والفترة التي يغطيها، وما إذا كان الدور المدعى يتعلق بالتوصيات، أو التغييرات المقبولة، أو سلطة القرار النهائية. وإذا كانت هذه التعريفات مفقودة، فلن يؤدي جمع بطاقة نموذج أخرى إلى سد الفجوة. فالدعم المفقود يتعلق بالاستخدام التشغيلي.

هنا أضع حداً فاصلاً حول قرار العرض التجريبي. يطبق ClaimLens قواعد مختارة على السجلات المقدمة. وهو لا يوثق صحة تلك السجلات أو يثبت أن طريقة التسجيل تلتقط الدور الذي قد يستنتجه القارئ من الجملة. يمكن لنتيجة «Needs proof» المهيأة أن تنظم مسار التحقيق. ومع ذلك، فإن القياس الأساسي يظل بحاجة إلى فحص دقيق.

وينطبق نفس الحذر عندما تعيد القاعدة نتيجة مدعومة. إن التطابق بين جملة وسجل مقدم هو سبب لفحص مدى ملاءمتهما معاً. ولكنه لا يثبت أن السجل كامل أو ممثل أو تم التحقق منه بشكل مستقل. ويجب على نظام المراجعة أن يجعل هذا التمييز سهل الحفظ عندما تنتقل مخرجاته إلى نقاش حول النشر.

ثلاثة مسارات للتعامل مع الفجوة

بالنسبة لأي فريق يواجه فجوة مماثلة، يمكن أن تتغير كل من الصياغة والأدلة. ويعتمد الاختيار على أي جزء من الادعاء يمكن للفريق الدفاع عنه.

المسار الأول هو تضييق الجملة لتقتصر على النشاط الموثق بالفعل. إن الإقرار بأن النموذج منشور يُعد التزاماً أصغر من القول بأنه يقود تحسين المحفظة عبر جميع الحسابات. وقد يكون هذا تصحيحاً مفيداً إذا كان النشر هو الحقيقة الجديرة بالتواصل. لكنه يتخلى أيضاً عن الادعاء الأكبر حول الدور التشغيلي للنموذج. واستبدال «مدفوع بالذكاء الاصطناعي» بصفة فضفاضة أخرى سيترك السؤال الأصلي دون حل.

المسار الثاني هو إثبات الدور التشغيلي بشكل أكثر دقة. قد يتطلب ذلك سجلات تميز بين التوصيات المقدمة، والتوصيات التي تم النظر فيها، والقرارات التي تم تعديلها، إلى جانب نطاق تغطيتها وتعريفاتها. وهذا يتطلب جهداً أكبر بكثير من مجرد العثور على دليل على وجود النموذج. ويكون هذا الجهد مبرراً عندما يكون دور النموذج محورياً لما يريد الفريق إيصاله للقراء. وقد يكشف أيضاً أن الصياغة الأصلية بحاجة إلى مراجعة حتى بعد تحسين الأدلة.

المسار الثالث هو حجب الادعاء الأوسع طالما بقي السؤال مفتوحاً. وهذا يضحي برسالة تسويقية قد يرغب الفريق في استخدامها. وأنا أؤيد تحمل هذه التكلفة عندما يعتمد الوعد المركزي للجملة على دور تشغيلي لا يستطيع أحد حتى الآن وصفه بدعم كافٍ. التصنيف غير المحسوم مفيد داخلياً فقط إذا تولى شخص ما المتابعة؛ وهو ليس بديلاً عن اتخاذ قرار بشأن الجملة العامة.

هذه خيارات تحريرية ومراجعة، وليست صياغات يوصي بها ClaimLens تلقائياً أو يعتمدها قانونياً. قيمتها تكمن في أنها تربط الأدلة غير المحسومة بإجراء ملموس تالٍ. يمكن للفريق تغيير الوعد، أو تحسين دعمه، أو حجبه.

حفظ الاختلاف دون فقدان القرار

يحتوي مثال المحفظة أيضاً على خلاف في التقييم. في العرض التجريبي المسجل، يصف مقيّم الذكاء الاصطناعي المخزن الادعاء بأنه متناقض، بينما تحتفظ البوابة المهيأة بتصنيف «Needs proof». هذه النصيحة هي إعادة تشغيل مسجلة مسبقاً، وليست تقييماً جديداً للنموذج. والمقيّم لا يغير قرار البوابة.

أريد أن تكون كلتا النتيجتين متاحتين للمراجع لأن الخلاف يكشف عن تقدير نوعي: إلى أي مدى يأخذنا هذا السجل التشغيلي؟ فوصف الادعاء بأنه متناقض يعبر عن استنتاج أقوى من القول بأن دعمه غير كافٍ. والشخص الذي يراجع الجملة بحاجة إلى رؤية هذا التمييز وفحص سببه. وإخفاء الرأي الاستشاري من شأنه أن يزيل اعتراضاً جديراً بالاعتبار. كما أن استبدال القرار المسجل بالرأي الأكثر صرامة في ظاهره من شأنه أن يحجب كيفية التوصل إلى النتيجة.

إن الدليل التوضيحي لـ ClaimLens يوضح سير العمل هذا من الادعاء إلى السجل الفني. وحدته المفيدة هي الجملة إلى جانب الدعم المقدم، والقرار المسجل، والسبب. هذا المزيج يمنح التسويق والهندسة والمراجع موضوعاً مشتركاً للنقاش.

إليك الجولة الإرشادية للمؤسس حول المراجعة الاصطناعية عبر ClaimLens.

معياري للنقاش محدد وصارم: تحديد الحقيقة التشغيلية التي تجعل الصياغة قابلة للدفاع عنها. إذا كان بإمكان الفريق فقط إثبات وجود نموذج، فهذا هو الحد الأقصى للادعاء الذي دعمه. والوعد الأكبر يكتسب مشروعيته ومكانه فقط عندما تشرح الأدلة الدور الأكبر.

أبحاث ذات صلة

منشور أيضًا على

المزيد من المقالات

ادعاء ذكاء اصطناعي في تقرير سنوي مُبرَز فوق فجوة فارغة، منفصلًا عن مخطط النظام في الأسفل.
الذكاء الاصطناعيالامتثال

إحدى عشرة كلمة في تقرير سنوي قد تُصبح الآن احتيالًا على الأوراق المالية

ما تعلّمته من بناء إثبات ادعاءات الذكاء الاصطناعي: هيئة الأوراق المالية والبورصات (SEC)، ولجنة التجارة الفيدرالية (FTC)، والمدّعون العامون في الولايات ينفّذون الخطة نفسها، ولا أحد تقريبًا يملك الدليل.

Jun 6, 202612 min read
صورة تحريرية تجسّد التوتر بين ادعاءات التسويق المصقولة للذكاء الاصطناعي وآلة الإنفاذ التنظيمي التي تدقّق فيها الآن.
الذكاء الاصطناعيالتكنولوجيا

غرامة الـ400,000 دولار التي ينبغي أن تُرعب كل شركة ذكاء اصطناعي — وما الذي أبنيه بدلًا من ذلك

كيف كشفت أول حملة إنفاذ لهيئة الأوراق المالية والبورصات ضد الغسل بالذكاء الاصطناعي عن أزمة تقنية لا يستطيع معظم الذكاء الاصطناعي المؤسسي النجاة منها

Apr 2, 202614 min read
صورة تحريرية توحي بانهيار مؤسسة إعلامية عريقة عبر هويات مزيفة مولّدة بالذكاء الاصطناعي — غلاف مجلة يتلاشى إلى ملفات مؤلفين ملفّقة.
الذكاء الاصطناعيالتكنولوجيا

لم تكن مشكلة Sports Illustrated في الذكاء الاصطناعي. كانت مشكلتها في معمارية الحقيقة

كيف علّمتني التواقيع المزيفة والنماذج التي تهلوس وانهيار سهم بنسبة 27% أن مستقبل الذكاء الاصطناعي المؤسسي لا يكمن في مطالبات أفضل — بل في بناء أنظمة لا تستطيع الكذب.

Feb 7, 202614 min read

ابنِ ذكاءك الاصطناعي بثقة.

تعاون مع فريق يمتلك خبرة عميقة في بناء الجيل القادم من الذكاء الاصطناعي للمؤسسات. دعنا نساعدك على تصميم استراتيجية ذكاء اصطناعي جديرة بثقتك وبنائها وتطبيقها.

Veriprajna استشارات التقنيات العميقة متخصصة في بناء أنظمة الذكاء الاصطناعي الحرجة للسلامة في مجالات الرعاية الصحية والتمويل والقطاعات التنظيمية. تُقيَّم بنياتنا المعمارية وفق البروتوكولات المعتمدة مع توثيق شامل للامتثال.