لوحة تحكم Crucible Model Vetting Firewall تعرض تقييم المرشح مع نتائج allow وreview وquarantine.
الذكاء الاصطناعيالأمن السيبرانيهندسة البرمجيات

قبول النماذج يتطلب حالة غير محسومة

Ashutosh SinghalAshutosh Singhal9 أغسطس 20267 min

يجب أن يحدد قرار قبول نموذج الذكاء الاصطناعي الأدلة التي تسمح للعنصر البرمجي بالمضي قدمًا. عندما لا ينتج عن عملية التحميل أي حدث محظور ولكن الفحص الثابت يظل يحدد عنصرًا عامًا خطيرًا، فإن الموافقة تختزل نتيجتين مختلفتين في إجابة واحدة مطمئنة. أريد أن تبقى النتيجة غير المحسومة قائمة بعد اتخاذ القرار، مع تقديم بيان واضح بما لا يزال يتعين إثباته.

لقد قمنا ببناء Crucible، وهو عرضنا التوضيحي المحلي لجدار حماية فحص النماذج Model Vetting Firewall، حول هذا التمييز. وهو يستخدم عناصر برمجية اصطناعية، بما في ذلك ملف لا يضع ماسح التوقيعات علامة تحذير عليه ولكنه يحاول عند التحميل إجراء عملية على قاعدة بيانات، وملف آخر يحتوي على فرع مشروط يظل غير منفذ. يوضح المثال الأول سبب أهمية المحاولة الملاحظة. بينما يكشف الثاني عن مشكلة التصميم الأكثر صعوبة: اتخاذ قرار بشأن ما يجب فعله عندما تتعارض الفحوصات المتاحة دون التظاهر بأن الخلاف قد حُسم.

الأدلة تغير القرار

في مثال قاعدة البيانات الاصطناعية، لا يضع PickleScan علامة تحذير على العنصر البرمجي. وأثناء التحميل، يسجل خطاف تدقيق CPython المكوّن عملية قاعدة بيانات SQLite جرت محاولتها ويحظرها. يعيد مسار المعالجة المحلي QUARANTINE ولا يصدر أي توقيع. لم تنجح عملية قاعدة البيانات؛ والدليل المفيد هو الأثر الذي جرت محاولته وحظره المسجل.

يمنح ذلك قرار القبول سببًا لا يمكن لنتيجة الفحص النظيفة أن تقدمه. يمكن للفريق الإشارة إلى العملية المحظورة بدلاً من مطالبة تصنيف الماسح بالإجابة عن كل سؤال حول التحميل. يظل الماسح مفيدًا كأداة مقارنة، لكن غياب علامة التحذير لا يلغي محاولة محظورة تمت ملاحظتها.

Crucible يوضح محاولة SQLite اصطناعية محظورة، وحكم QUARANTINE ونتيجة PickleScan غير محذرة
في هذا الاختبار الاصطناعي المحلي، لم يضع PickleScan علامة على العنصر البرمجي، بينما سجل خطاف التدقيق المكوّن عمليته التي حاول إجراءها على SQLite وحظرها. تعني شارة «NO CODE SURFACE» الثابتة أنه لم يتم العثور على أي عنصر عام مدرج في القائمة المحظورة المكوّنة؛ ومع ذلك لا يزال `_sqlite3.connect` موجودًا. تصف لوحة النتائج المجموعة الاصطناعية الثابتة، وليس أداء نماذج غير معروفة.

أفضل هذا الفصل لأنه يجعل القرار قابلاً للتفتيش. يجب أن يكون المراجع قادرًا على تتبع العلاقة بين النتيجة والمحصلة. عبارة «حظر الخطاف المكوّن محاولة عملية قاعدة البيانات هذه» هي بيان محدد النطاق. إنها تحدد الدليل والآلية وسبب الحكم المحلي. أما علامة الأمان الفضفاضة فستترك تلك العلاقات خفية.

تخلق الملاحظة أيضًا حدود ثقة خاصة بها. هنا، يحاول عامل المعالجة التحميل داخل عملية فرعية من Python ويراقب أحداث التدقيق المكوّنة. هذا قياس توضيحي، مع فصل العمليات، وليس احتواءً على مستوى نظام التشغيل أو الحاويات. وسيتطلب التصميم الإنتاجي تحديد كيفية عزل عامل الملاحظة نفسه قبل الوثوق به في التعامل مع عناصر برمجية غير موثوقة. إن إضافة أدلة سلوكية لا تسقط الالتزام بفحص البيئة التي تجمعها.

التحميل الهادئ يترك سؤالاً أصعب

يصل التجهيز الاصطناعي المشروط إلى نتيجة مختلفة. يجد الفحص الثابت builtins.eval، وهو عنصر عام مدرج في قائمة العناصر الخطرة المكونة في العرض التوضيحي. ولا تسجل عملية التحميل الملاحظة أي حدث خطير تم حظره لأن الفرع المشروط لم يتم تنفيذه في هذه البيئة. يوجه مسار المعالجة العنصر البرمجي إلى REVIEW، دون أي توقيع. ولم يكتمل أي تحقيق بشري من خلال هذا المسار.

Crucible يوضح REVIEW لتجهيز مشروط اصطناعي مع العثور على builtins.eval فحصًا ثابتًا وعدم ملاحظة أي عملية خطيرة أثناء التحميل
يكتشف الفحص الثابت `builtins.eval`، في حين أن السلوك المشروط لا يتم تنفيذه في هذا التحميل الملاحظ. يحتفظ REVIEW بالنتيجة غير المحسومة؛ ولا يثبت اكتمال المراجعة البشرية. هذا مثال اصطناعي محلي يتضمن فحوصات مكوّنة حديثًا واستشارات Codex مخزنة مؤقتًا.

هناك ثلاث استجابات معقولة يمكن أخذها في الاعتبار، وتكلف كل منها شيئًا مختلفًا. تقبل الموافقة حالة عدم اليقين. يتجنب الرفض استخدام هذا العنصر البرمجي ولكنه قد يستبعد أمرًا يمكن لتحقيق أضيق نطاقًا تفسيره. تؤخر المراجعة الإضافية القرار وتتطلب من شخص ما تحديد الأدلة الإضافية التي قد تغيره.

في هذه الحالة، أفضل المراجعة لأن عدم اليقين محدد. هناك مبعث قلق ثابت تم تحديده وفجوة محددة في الملاحظة. لا يفسر التشغيل الهادئ سبب وجود العنصر العام الخطر أو ما يحدث إذا تم الوصول إلى الفرع. والموافقة تتطلب قبول تلك الفجوة. قد يكون الرفض الفوري سياسة تنظيمية معقولة، لكنه سيكون خيارًا لاستبعاد العنصر البرمجي بناءً على أدلة ثابتة غير محسومة، وليس دليلاً على حدوث أثر محظور.

يكتسب هذا التمييز أهمية بالغة عندما يكتب الفريق سياسة القبول الخاصة به. لا ينبغي أن يتحول الفشل في ملاحظة أثر ما ضمنيًا إلى نتيجة مفادها أن الأثر لا يمكن أن يحدث. وبالمثل، لا ينبغي أن تتحول الشبهة ضمنيًا إلى دليل على هجوم ناجح. يوفر REVIEW مساحة للاحتفاظ بكلا الأمرين بينما تختار المؤسسة حجم عدم اليقين الذي يمكنها قبوله.

REVIEW يحتاج إلى معيار خروج

يمكن أن تتحول حالة المراجعة بمفردها إلى منطقة تعليق مكلفة. ولا تستحق مكانتها إلا عندما يوضح السجل السؤال غير المحسوم والقرار التالي الذي يجب على شخص ما اتخاذه. في هذا المثال، يتعلق السؤال بالعنصر العام الثابت والفرع غير المنفذ. فتكرار التحميل الهادئ نفسه دون تغيير ما يتم التحقيق فيه سيضيف ملاحظة أخرى دون الإجابة عن ذلك السؤال.

في عملية مؤسسية افتراضية، قد يقوم الفريق بفحص الفرع، أو طلب تفسير موثوق من مورد العنصر البرمجي، أو اختيار عنصر بديل ذي مسار تحميل أكثر قابلية للتفتيش. هذه استجابات مقترحة، وليست مسارات عمل يكملها هذا العرض التوضيحي. فلكل منها تكلفة: يتطلب الفحص الأعمق خبرة، وتتطلب أدلة المورد التحقق الخاص بها، وقد يضحي الاستبدال بوظائف مطلوبة. يعتمد الاختيار على الأدلة التي يمكن للفريق الحصول عليها وما يسمح به عدم اليقين في سياسته.

أريد أن يكون هذا الاختيار صريحًا. إذا لم يتمكن أي تحقيق متاح من حل مبعث القلق ضمن قيود الفريق، فقد يكون رفض العنصر البرمجي هو النهاية المناسبة للمراجعة. لا ينبغي لـ REVIEW أن يعد بأن كل ملف سينال الموافقة في النهاية. فالغرض منه هو منع اختفاء سؤال غير محسوم داخل حكم، وجعل القرار النهائي خاضعًا للمساءلة وفق سياسة معلنة.

ينطبق الانضباط نفسه على تفسيرات الذكاء الاصطناعي. في العرض التوضيحي، يمكن لاستشارة مشتركة بين المحلل والمتحدي أن تضيف الحذر وتنقل نتيجة ALLOW الأساسية إلى REVIEW؛ ولا يمكنها إزالة QUARANTINE. يستخدم العرض التقديمي المسجل استشارات Codex المخزنة مؤقتًا إلى جانب الفحوصات المكوّنة الحديثة. يوضح أحد السجلات المرجعية الاصطناعية خطر معاملة السرد كسلطة: توصي استشارته بالتوقيع والترقية، في حين أن النتيجة الهيكلية النهائية هي REVIEW ولا يتم إصدار أي توقيع.

لذلك يجب على مستهلك القبول قراءة الحكم الهيكلي وسبب البوابة وحقل التوقيع الفعلي. يمكن للنص التوضيحي المفيد أن يشرح القرار، ولكن يجب ألا يتحول النص إلى إذن ثانٍ متعارض لتمرير العنصر البرمجي. إن عملية المراجعة التي تثق بجملة التوصية على حساب البوابة النهائية قد فقدت التمييز الذي كان من المفترض أن تحافظ عليه.

للموافقة حدود أيضًا

يتلقى قاموس الأوزان النظيفة الاصطناعي ALLOW وتوقيعًا على اسم النموذج وتجزئة العنصر البرمجي وحمولة المخزون باستخدام مفتاح تطوير محلي. يظل مصدر بيانات التدريب وسجل الضبط الدقيق UNKNOWN. يتلقى ALLOW فقط هذا التوقيع؛ بينما لا يتلقاه REVIEW وQUARANTINE.

هذا مهم للخروج من المراجعة بقدر أهميته للمسار النظيف. فحسم مبعث قلق أثناء التحميل لا يثبت في حد ذاته سجل التدريب. يمكن للتوقيع مصادقة الحمولة المحلية المحددة بالنسبة لمفتاحها بينما يظل السؤال السابق دون إجابة. يجب على الفريق أن يسأل بشكل منفصل عما إذا كانت أدلة القبول كافية لقرار التحميل وما إذا كان المصدر المفقود مقبولاً للاستخدام المقصود. لا ينبغي لفحص معتمد واحد أن يحسم سؤالاً لم يفحصه أبدًا.

يوضح دليل Crucible التوضيحي هذه الأمثلة المحلية وأدلتها. يظل تكامل السجل، وفرض قبول المؤسسات، وحفظ التوقيعات الإنتاجية عملاً يتجاوز هذا العرض التوضيحي. تكمن قيمته في حدود القرار التي يجعلها مرئية، بدلاً من الادعاء بأن التنفيذ المحلي يوفر جميع عناصر التحكم التي قد تحتاجها المؤسسة.

إليكم فيديو المؤسس الذي يوضح العرض التوضيحي المحلي لفحص النماذج الاصطناعية.

بالنسبة لفريق المنصة الذي يقيم تصميم القبول، سأبدأ بالحالة التي لا تتوافق أدلتها بدقة. اسأل عما يبقي النتيجة غير المحسومة مرئية، ومن يقرر ما إذا كان إجراء مزيد من التحقيق يستحق تكلفته، وما هي الأدلة التي يمكن أن تغير النتيجة. من السهل وصف المسار النظيف. أما المسار غير المحسوم فيكشف عما إذا كان النظام يحتفظ بعدم اليقين لفترة كافية لاتخاذ قرار مسؤول.

أبحاث ذات صلة

أمن سلسلة توريد الذكاء الاصطناعي وسلامة النماذج | Veriprajnaصفحة الحل
الدفاع ضد الذكاء الاصطناعي المعادي: دمج متعدد الأطياف والدرع المعرفيورقة بيضاء تفاعلية
أمن سلسلة توريد الذكاء الاصطناعي للمؤسسات | Veriprajnaورقة بيضاء تفاعلية
الذكاء الاصطناعي القابل للتحقق — الدفاع ضد تسميم النماذج في المؤسسات | Veriprajnaورقة بيضاء تفاعلية
بنية أمان الذكاء الاصطناعي السيادي للمؤسسات | Veriprajnaورقة بيضاء تفاعلية
الدرع المعرفي: هندسة المتانة في عصر الذكاء الاصطناعي العدائيتحليل تقني معمّق
الحتمية المعمارية لسلامة سلسلة توريد الذكاء الاصطناعي: تأمين دورة حياة التعلم الآلي ضد النماذج الخبيثة وعمليات النشر الظليةتحليل تقني معمّق
معمارية الذكاء القابل للتحقق: حماية المؤسسة من تسميم النماذج وتلوث سلسلة التوريد وهشاشة أغلفة واجهات برمجة التطبيقاتتحليل تقني معمّق
المعماري السيادي: الإبحار في انهيار اقتصاد أغلفة الذكاء الاصطناعي عبر المناعة التقنية العميقةتحليل تقني معمّق

منشور أيضًا على

المزيد من المقالات

ملف نموذج ذكاء اصطناعي يبدو بريئًا وقد فُتح ليكشف شيفرة قيد التشغيل تمدّ اتصالًا إلى مضيف خارجي.
الذكاء الاصطناعيالأمن السيبراني

نماذج الذكاء الاصطناعي لديك شيفرة قابلة للتنفيذ. ومعظم الشركات تعاملها كجداول بيانات.

ما تعلّمته وأنا أبني أمن سلسلة توريد الذكاء الاصطناعي بعد أن رأيت نموذجًا "يبدو عاديًا" يفتح reverse shell في اللحظة التي حُمِّل فيها.

Jun 17, 202614 min read
غلاف تحريري يصوّر الخطر الخفي في ملفات نماذج الذكاء الاصطناعي — ملف نموذج يبدو ملف بيانات غير ضار لكنه يخفي شيفرة هجوم قابلة للتنفيذ، مجسِّدًا الاستعارة الجوهرية للمقال.
الذكاء الاصطناعيالأمن السيبراني

النموذج الذي نزّلته للتو قد يستولي على شبكتك — ما تعلّمته من بناء دفاعات ضد هجمات سلسلة توريد الذكاء الاصطناعي

لماذا لا يكمن أكبر تهديد لذكاء المؤسسات الاصطناعي في الهلوسة، بل في الأوزان المسمومة القابعة على مرأى من الجميع في المستودعات العامة.

Apr 25, 202611 min read
صورة تحريرية لافتة تُظهر حصان طروادة مبنيًا من أيقونات ملفات نماذج الذكاء الاصطناعي ومقتطفات شيفرة، يقبع داخل واجهة مستودع برمجيات، لتنقل الفكرة الجوهرية: نماذج الذكاء الاصطناعي أدوات تنفيذية غير موثوقة تختبئ في فضاءات موثوقة.
الذكاء الاصطناعيالأمن السيبراني

عثرتُ على نماذج ذكاء اصطناعي بأبواب خلفية على Hugging Face — وكذلك فعل كل من كلّف نفسه عناء البحث

سلسلة توريد الذكاء الاصطناعي هي الحلقة الأضعف في منظومتك التقنية، ولا أحد تقريبًا يؤمّنها.

Apr 23, 202614 min read
صورة معبّرة تجسّد تصادم مساعدي الذكاء الاصطناعي مع الاختراقات الأمنية: واجهة محرّر أكواد تظهر فيها فقاعة دردشة ودّية لذكاء اصطناعي بسطح متشقّق ومتصدّع يكشف عن أوامر مدمّرة تحته.
الذكاء الاصطناعيالأمن السيبراني

اختراقات أمن الذكاء الاصطناعي في 2025 كشفت كذبة بتريليون دولار — وأنا بنيتُ البديل

كيف أثبتت ثلاث ثغرات كارثية في GitHub Copilot وMicrosoft Bing وAmazon Q أن اقتصاد "أغلفة الذكاء الاصطناعي" بأكمله كان بيتًا من ورق — ولماذا لا يكون الحل غلافًا أفضل.

Apr 21, 202613 min read
صورة معبّرة توضّح الفكرة الجوهرية للمقال — تصنيف خاطئ واثق من الذكاء الاصطناعي تتحداه عدة طرائق استشعار.
الذكاء الاصطناعيالتعلم الآلي

ملصق بـ5 دولارات هزم ذكاءنا الاصطناعي. إليك كيف جعلناه يرى الحقيقة.

ما علّمني إياه بناء أنظمة ذكاء اصطناعي مقاومة للهجمات العدائية عن الفرق بين ذكاء اصطناعي يتنبّأ وذكاء حقيقي يفهم.

Feb 9, 202614 min read

ابنِ ذكاءك الاصطناعي بثقة.

تعاون مع فريق يمتلك خبرة عميقة في بناء الجيل القادم من الذكاء الاصطناعي للمؤسسات. دعنا نساعدك على تصميم استراتيجية ذكاء اصطناعي جديرة بثقتك وبنائها وتطبيقها.

Veriprajna استشارات التقنيات العميقة متخصصة في بناء أنظمة الذكاء الاصطناعي الحرجة للسلامة في مجالات الرعاية الصحية والتمويل والقطاعات التنظيمية. تُقيَّم بنياتنا المعمارية وفق البروتوكولات المعتمدة مع توثيق شامل للامتثال.