تأمين دورة حياة تعلم الآلة ضد النماذج الخبيثة وعمليات النشر الخفية
كشف اكتشاف أكثر من 100 نموذج ملغم بأبواب خلفية على منصة Hugging Face عما كان مهندسو الذكاء الاصطناعي العميق يعرفونه بالفعل: سلسلة توريد تعلم الآلة هي المكون الأكثر عرضة للخطر والأقل خضوعاً للحوكمة في البنية التحتية للمؤسسات. تقدم هذه الورقة البيضاء المخطط الهندسي لمرونة الذكاء الاصطناعي القابلة للتحقق تشفيرياً والمدعومة بالعتاد الصلب.
بينما يسعى السوق وراء خدمات تغليف النماذج اللغوية الكبيرة، تتفاقم ثغرة نظامية في الأساس. إن أوزان نماذج الذكاء الاصطناعي عبارة عن كتل ثنائية معتمة يختبئ فيها السلوك الخبيث بين ملايين المعلمات – وهي غير مرئية لمراجعات الأكواد التقليدية.
النماذج الموجودة على المراكز العامة لا تعاني فقط من خلل وظيفي – بل تم تسليحها. تتيح تسلسلات Pickle تنفيذ تعليمات برمجية عشوائية في اللحظة التي يقوم فيها المطور بتشغيل torch.load()، مما ينشئ قنوات اتصال عكسية (Reverse Shells) مع بنية تحتية يتحكم فيها المهاجم.
يحدث 90% من استخدام الذكاء الاصطناعي في المؤسسات خارج نطاق رقابة تكنولوجيا المعلومات. يقوم المطورون بسحب نماذج غير مدققة من المستودعات العامة، ولصق أكواد مملوكة في أدوات عامة، وتجاوز تحليل تكوين البرمجيات (SCA) – مما يخلق أبواباً خلفية مستمرة وغير مرئية.
على الرغم من توجيهات معيار NIST AI 100-2، تمتلك 17% فقط من المؤسسات ضوابط آلية لأمن الذكاء الاصطناعي. الفجوة بين وثائق السياسات والأمن التشغيلي هي المساحة التي يزدهر فيها المهاجمون – مستغلين شعور الصناعة الزائف بالجاهزية.
ليست كل صيغ التسلسل متساوية. أدى اعتماد الصناعة على Pickle إلى إنشاء ثغرة آلة افتراضية قائمة على المكدس. الصيغ الأحدث تقلل المخاطر – لكن أياً منها ليس محصناً تماماً. انقر فوق كل صيغة للاستكشاف.
تنفذ صيغة Pickle آلة افتراضية قائمة على المكدس يمكنها تنفيذ دوال بايثون عشوائية أثناء إلغاء التسلسل. يمكن حقن دوال مثل os.system() أو subprocess.run() مباشرة في عملية فك التسلسل.
هذه هي الصيغة الأكثر شيوعاً لنماذج PyTorch وscikit-learn القديمة. المرونة التي جعلت Pickle شائعة هي تحديداً ما يجعلها ثغرة أمنية حرجة.
إطار عمل من خمس مراحل لنمذجة كيفية استهداف المهاجمين لأنظمة تعلم الآلة. انقر على كل مرحلة لفهم آليات التهديد والتدابير الهندسية المضادة المطلوبة.
يقوم المهاجمون بفحص مستودعات النماذج العامة وتكوينات CI/CD وشبكات التبعيات لتحديد نقاط الدخول. يقومون بتحليل أطر العمل التي تستخدمها المؤسسات، والنماذج التي يتم تنزيلها، وصيغ التسلسل المتوقعة في خطوط الأنابيب.
تحديد المؤسسات التي تقوم بتنزيل أنواع معينة من النماذج لإنشاء حمولات مستهدفة لأطر العمل والصيغ الخاصة بها.
تحليل ملفات requirements.txt وصور Docker المنشورة للعثور على إصدارات أطر العمل المعرضة للاستغلال.
سجل أصول ذكاء اصطناعي مركزي مع مركز نماذج خاص. يتم تسجيل جميع تنزيلات النماذج الخارجية وتحديد إصداراتها وتوجيهها عبر خط أنابيب تدقيق آلي.
يزرع تسميم البيانات أبواباً خلفية كامنة تكون غير مرئية لاختبارات الأداء القياسية و مقاومة للتخفيف بالبيانات النظيفة. يمكن لما لا يتجاوز 250 وثيقة مسمومة أن تعرض نموذجاً بحجم 13 مليار معلمة للخطر بشكل دائم. ينشط هؤلاء «العملاء النائمون» فقط عند مواجهة رمز مميز محدد كمحفز.
بمجرد ظهور 50-100 تكرار للمحفز أثناء التدريب، يتم ترميز الباب الخلفي بشكل دائم في مساحة الأوزان. إضافة ملايين العينات النظيفة لا يلغي الارتباط المكتسب بين المحفز والاستجابة.
تصور كيف يتفاعل حجم مجموعة التدريب ونسبة التسميم
معدل نجاح الباب الخلفي المحاكى حسب عدد العينات المسمومة (بناءً على عتبات الأبحاث المنشورة)
إن حوكمة أصول الذكاء الاصطناعي تمر بأزمة حقيقية. تمثل الفجوة بين السياسة والأمن التشغيلي عاصفة متكاملة من الضعف وفشل الامتثال والمخاطر التنافسية.
معدلات تنفيذ ضوابط NIST AI 100-2 عبر المؤسسات، 2025
تقدير مدى انكشاف مؤسستك الناتج عن الاستخدام غير الخاضع للإدارة للذكاء الاصطناعي
«تساوي العديد من المؤسسات بين امتلاك وثيقة سياسات وامتلاك أمن تشغيلي حقيقي. ومع ذلك، بدون فرض آلي وحواجز تقنية، سيستمر الموظفون في تفضيل الراحة على الأمان. السياسة ليست حماية.»
— الورقة البيضاء لأمن الذكاء الاصطناعي من Veriprajna، 2025
التعامل مع نماذج الذكاء الاصطناعي كرموز تنفيذية قد تكون خبيثة. بنية «الأمان حسب التصميم» عبر كامل سلسلة توريد تعلم الآلة.
تتتبع قوائم SBOM التقليدية المكتبات البرمجية. يتطلب الذكاء الاصطناعي قائمة ML-BOM توثق أصل النموذج وسلالة مجموعات البيانات ومنهجية التدريب – مدعومة بملفات تعريف الذكاء الاصطناعي CycloneDX وSPDX 3.0.
تعد أوزان النماذج ملكية فكرية ومخرجات ثنائية عالية المخاطر في آن واحد. لم تعد البنية التحتية للمفاتيح العامة (PKI) لنماذج تعلم الآلة خياراً ثانوياً – فالتوقيعات المدعومة بوحدات HSM تضمن وصول النماذج المعتمدة فقط إلى بيئة الإنتاج.
التحليل الثابت هو خط الدفاع الأول. يقوم التحليل العميق للكود ببناء مخطط برمجي يرسم تدفق المدخلات عبر مشغلات النماذج اللغوية الكبيرة إلى أوامر النظام. يكتشف الرصد أثناء التشغيل تنشيط هجمات التسميم في بيئة الإنتاج.
للقطاعات المالية والرعاية الصحية والدفاع: بيئات التنفيذ الموثوقة (TEEs) المدعومة بالعتاد تحمي البيانات أثناء الاستخدام. يتم فك تشفير أوزان النماذج والمطالبات فقط داخل جيوب معزولة – وهي غير مرئية حتى لمسؤولي السحابة ذوي صلاحيات الجذر (Root).
التصديق المتبادل: يتحقق موفر النموذج من وجود بيئة TEE حقيقية، ويتحقق المستخدم النهائي من البرامج المعتمدة. أساس الثقة المعدومة (Zero Trust).
من استقبال النموذج إلى الاستدلال في بيئة الإنتاج، تخضع كل مرحلة للتحقق التشفيري والمراقبة السلوكية والعزل القائم على الثقة المعدومة.
توجيه جميع النماذج الخارجية إلى حجر صحي معزول. لا يوجد مسار مباشر من المستودعات العامة إلى الإنتاج.
فحص عميق للرمز الثنائي (Bytecode). التحقق من الصيغة. تحليل رموز تشغيل Pickle. التحويل إلى SafeTensors.
اختبار ديناميكي في حاويات معزولة. مراقبة حركة البيانات الصادرة، واستدعاءات النظام، والمخرجات الشاذة.
توقيع مدعوم بوحدة HSM. إنشاء قائمة ML-BOM. التسجيل في سجل أصول الذكاء الاصطناعي للمؤسسة.
وحدة تحكم بالقبول + بيئة TEE + طبقة حواجز حماية + تحقق مستمر من المخرجات.
يتم بناء أنظمة الذكاء الاصطناعي ونشرها عبر نفس خطوط أنابيب CI/CD المستهدفة بهجمات سلاسل توريد البرمجيات مفتوحة المصدر. إذا كان النموذج آمناً ولكن بيئة تشغيل بايثون الخاصة به مخترقة، فإن النظام بأكمله مخترق. وإذا كانت صورة حاوية التدريب ملوثة، فإن الأوزان غير موثوقة.
إن أي فصل وهمي بين «أصول البرمجيات» و«أصول الذكاء الاصطناعي» هو ثغرة خطيرة سيستغلها المهاجمون.
تنفذ صيغة تسلسل Pickle في بايثون – المستخدمة في PyTorch وscikit-learn – آلة افتراضية قائمة على المكدس يمكنها تنفيذ تعليمات برمجية عشوائية أثناء إلغاء التسلسل. من خلال التلاعب بدالة __reduce__، يحقن المهاجمون قنوات اتصال عكسية تنشط فور قيام المطور بتشغيل torch.load(). وجد باحثو JFrog أكثر من 100 نموذج ملغم بهذه الطريقة على Hugging Face. تحتوي الماسحات الثابتة مثل PickleScan على معدل إيجابيات كاذبة يبلغ 96% مع 3 ثغرات تجاوز يوم الصفر معروفة، مما يجعل الاكتشاف غير موثوق.
ما لا يتجاوز 250 وثيقة مسمومة – تمثل 0.00016% فقط من مجموعة التدريب – يمكن أن تخترق بشكل دائم نموذجاً يحتوي على 13 مليار معلمة. بمجرد ظهور ما يقارب 50 تكراراً للمحفز أثناء التدريب، يتم تشفير الباب الخلفي بشكل دائم في مساحة الأوزان. إضافة ملايين العينات النظيفة بعد ذلك لا يمحو الارتباط المكتسب بين المحفز والاستجابة. تجتاز هذه «الخلايا النائمة» جميع الاختبارات المعيارية القياسية ولا تنشط إلا عند مواجهة رمز المحفز المحدد.
توسع قائمة ML-BOM (قائمة مواد تعلم الآلة) قوائم SBOM التقليدية لتشمل أصل النموذج، وسلالة البيانات، ومنهجية التدريب، وتبعيات أطر العمل، والإقرارات التشفيرية – مدعومة بملفات تعريف CycloneDX وSPDX 3.0 AI. تتيح المعالجة السريعة للثغرات الأمنية عند اكتشاف ثغرات CVE في PyTorch أو التبعيات الأخرى. مقترنة بتوقيع النماذج تشفيرياً بدعم من وحدات HSM، فإنها تضمن أن النماذج المصرح بها فقط ذات التوقيعات الصالحة هي التي تصل إلى الإنتاج، بينما يرفض محرك الاستدلال تحميل أي نموذج يحمل توقيعاً غير صالح.
الفرق بين «الاعتماد على الحظ» والمرونة القابلة للإثبات يكمن في قرار معماري واحد.
تهندس Veriprajna الانتقال من الذكاء الاصطناعي الخفي الهش إلى منظومة ذكاء اصطناعي عميق مؤمنة تشفيرياً ومدعومة بالعتاد – مما يجعل نشر الذكاء الاصطناعي متوقعاً وقابلاً للتدقيق وموثوقاً.
تقرير هندسي كامل: تصنيف هجمات التسلسل، دفاعات سلسلة قتل الذكاء الاصطناعي، مواصفات ML-BOM، بنية التوقيع التشفيري، أنماط نشر الحوسبة السرية، دليل تنفيذ NIST AI 100-2.