يوضح مثال تجاري اصطناعي كيفية الاحتفاظ بالادعاءات المدعومة والتعامل مع الخصائص المجهولة وفصل فحص الكتالوج عن التغطية.
التجارة الإلكترونيةالذكاء الاصطناعيإدارة المنتجات

عندما تكون إجابة التسوق بالذكاء الاصطناعي صحيحة جزئياً فقط

Ashutosh SinghalAshutosh Singhal5 أغسطس 20267 min

يمكن لإجابة التسوق بالذكاء الاصطناعي أن تصيب في تحديد معدل تحديث المنتج بدقة، بينما تعد بمعيار لا يدعمه المنتج على الإطلاق. إن قبول الإجابة بأكملها يبقي على الخطأ، ورفضها كلياً يهدر التفاصيل المفيدة. لذا أفضل حد تحقق قادراً على اتخاذ تلك القرارات بشكل منفصل وتفسير كل منها بدقة.

لهذا التفضيل نتيجة عملية لفرق التجارة: يجب أن تكتسب الإجابة الثقة على مستوى ادعاءاتها القابلة للفحص. فالجملة السلسة وسيلة ملائمة للتواصل، لكنها تضم ادعاءات قد تختلف في علاقتها بكتالوج المنتجات. وتتمثل مهمة المراجعة في فصل تلك العلاقات قبل صياغة الإجابة التي يراها المشتري.

يجعل نموذجنا التجريبي Vouchmark هذا الحد قابلاً للفحص باستخدام منتجات اصطناعية وإجابات معدة وسجلات كتالوج محلية. فهو يحيط المسودات المقدمة بدلاً من تشغيل مساعد تسوق أو متجر كامل. والمثال الأكثر فائدة فيه هو إجابة حول جهاز تلفزيون تتطلب تصحيحاً طفيفاً، تليها إجابة حول سترة يكون التصحيح فيها غير مبرر.

الحفاظ على ما يدعمه الكتالوج

في حالة التلفزيون الاصطناعي، تذكر مسودة أن Vega OLED يدعم HDR10+ ومعدل تحديث قدره 120Hz. وهاتان مواصفتان متمايزتان تماماً. فمعيارا HDR10 و HDR10+ مختلفان، وبالتالي لا يمكن التعامل مع الحرف الإضافي كاختلاف صياغة غير ضار في هذه المقارنة.

يحتوي كتالوج الاختبار على HDR10 و 120Hz. وتقوم بوابة Python بتصحيح الادعاء الأول وتمرير الثاني. وبالتالي تحتفظ الإجابة المعروضة بمعدل التحديث مع جعل تصحيح المعيار صريحاً وواضحاً.

تعد هذه النتيجة أكثر فائدة بكثير من استبدال المسودة برفض عام. فالكتالوج قادر على الإجابة عن السؤال؛ ولكنه لا يستطيع فقط دعم كلا الجزأين في الإجابة المقترحة. كما أنها أكثر مسؤولية وخضوعاً للمساءلة من مطالبة النموذج بإعادة صياغة تبدو أفضل دون حفظ الادعاء الذي فشل. وللتصحيح أساس محدد: المعيار المزعوم يختلف عن قيمة الكتالوج.

مربع حوار فحص الادعاءات في Vouchmark يوضح الادعاء HDR10+ وقيمة HDR10 في الكتالوج وحكم تم التصحيح
تكشف مقارنة التلفزيون الاصطناعية عن الادعاء والقيمة البديلة والقرار المتخذ. والمصدر المعروض هو بيانات وصفية لبيئة الاختبار، وليس وثيقة مصنّع موثقة رسمياً.

بالنسبة لفريق يقيم هذا النوع من التصميم، فإن الاحتفاظ بالمعلومات يستحق اختباراً مخصصاً بحد ذاته. فالنظام الذي يحجب كل إجابة قد يتجنب تقديم العديد من التفاصيل غير المدعومة مع تقديم القليل جداً من معلومات المنتج. والسؤال الجوهري هو ما إذا كان بإمكانه إزالة ادعاء غير مدعوم دون استبعاد الادعاءات المجاورة التي تدعمها السجلات المتاحة.

توفر سيناريوهات Vouchmark المعدة الادعاءات الفردية مسبقاً. وهي لا تثبت أن النموذج استخرج كل ادعاء من النص الأصلي بمفرده. إن مثال التلفزيون يرسخ سلوك قرار الكتالوج هذا، بعد توفير التفكيك مسبقاً.

الخاصية المجهولة لا يمكنها تقديم تصحيح

تكشف سترة Summit Ridge الاصطناعية عن مشكلة مختلفة تماماً. إذ تعد مسودتها بأن السترة مقاومة للماء بالكامل. وحقل تقييم مقاومة الماء في الكتالوج مجهول، دون وجود أي تصنيف من المصنّع محفوظ في بيئة الاختبار.

تمتنع البوابة عن البت. وتصرح بأن السجل المتاح لا يمكنه دعم ادعاء مقاومة الماء. وهي لا تستبدل المسودة بادعاء يفيد بأن السترة ليست مقاومة للماء.

لهذا التمييز أهمية بالغة لأن الكتالوج لا ينطق بحكم حول الخاصية المتنازع عليها. والتقييم الغائب لا يمكن أن يبرر أياً من طرفي الادعاء. وإذا حول النظام كل ادعاء غير مدعوم إلى نقيضه، فإنه يصطنع إجابة جديدة تحت ستار التصحيح.

هناك بديل مغرٍ: استخدام خاصية قريبة للحفاظ على فائدة الإجابة. فسجل السترة يتضمن وصفاً مستنتجاً لمقاومة رذاذ الماء مرتبطاً بطبقة طلاء. لكن مقاومة الرذاذ والتقييم المؤكد لمقاومة الماء ادعاءان مختلفان. وهذا السيناريو المعد لا يقدم الوصف المستنتج كبديل عن التقييم المفقود.

أريد لهذا الفصل أن يصمد أمام ضغوط تقديم إجابة منمقة تبدو مكتملة. وفي ظل هذه الظروف، يفضل تقديم بيان مقيد لأنه يحدد الخاصية غير المحسومة دون تغيير سؤال المتسوق ضمناً. والتكلفة حقيقية: فالمتسوق لا يزال يفتقر إلى التقييم الذي طلبه. وفي تصميم بيئات الإنتاج، يتطلب سد تلك الفجوة مصدراً مناسباً أو عملية مراجعة منفصلة؛ والنموذج التجريبي لا يوفر أياً منهما.

لذلك، تميز مراجعة الكتالوج المفيدة بين مهمتي إصلاح. فالتناقض يطلب من الفريق التوفيق بين قيم متعارضة، بينما المجهول يطلب من الفريق إثبات حقيقة مفقودة. وإرسال الاثنين معاً إلى قائمة انتظار تحمل تصنيف «إجابة خاطئة» يخفي طبيعة العمل المتبقي وما يمكن للمساعد قوله بأمان في هذه الأثناء.

مطابقة الكتالوج لها حدود صلاحية وسلطة

إن القرارات على مستوى الادعاء تجعل الإجابة أسهل فحصاً، لكنها لا تجعل الكتالوج معصوماً عن الخطأ.

تحدد تسمية المصدر الظاهرة في حوار التلفزيون مرجعاً معداً لبيئة الاختبار. وهي مفيدة لتتبع القرار الموضح، لكنها ليست دليلاً على أن Vouchmark جلب وثيقة مصنّع واعتمدها رسمياً. كما يتيح النموذج التجريبي للخصائص المصنفة بأنها مستنتجة المرور عبر مسار المقارنة نفسه المخصص للخصائص المصنفة بأنها مؤكدة. ويمكن لنص الإخراج أن يصف هذه المطابقة بأنها «متحقق منها» بينما يحتفظ إيصال التدقيق بتصنيف «مستنتجة».

يكشف هذا عن خيار سياساتي يجب على فريق التجارة اتخاذه بوضوح. فإذا كانت الخصائص المستنتجة مقبولة لإجابة معينة، فيجب أن يحافظ التوصيف المعروض على تلك الحالة. وإذا كانت متطلبات العمل تشترط تأكيداً مباشراً لتلك الخاصية، فإن مطابقة قيمة كتالوج مستنتجة لا ينبغي أن تكون كافية لتقديمها على أنها مؤكدة. يوضح Vouchmark آليات المقارنة؛ لكنه لا يحسم سياسة أدلة الإنتاج تلك.

أنا أؤيد إبقاء حالة الدليل مرئية عند النقطة التي يستخدم فيها الادعاء تماماً. وإلا فإن الاستنتاج قد يكتسب سلطة ظاهرية بمجرد مروره عبر مكون آخر. فالمقارنة الصحيحة والمصدر الموثوق متطلبان مترابطان، لكن لا يمكن لأحدهما أن يحل محل الآخر.

ويحد المنطق نفسه مما يمكن أن يثبته إيصال التدقيق. إذ يحتفظ سجل Vouchmark القابل للقراءة بالمسودة والإجابة المعروضة وقرارات الادعاءات والمراجع معاً. وهذا يدعم فحص أسباب تغير الإجابة. ومع ذلك، فإن طابعه الزمني ومعرفه المشتق من التجزئة لا ينشئان سجلاً موقعاً أو غير قابل للتغيير أو محفوظاً بشكل مستقل. وأي فريق إنتاج يحتاج إلى تلك الخصائص لديه عمل إضافي يتعين عليه إنجازه يتجاوز مجرد تصدير التفسير.

فحص البوابة والتغطية بشكل منفصل

ينتج التقييم الاصطناعي الثابت والمصنف للنموذج التجريبي الحكم المتوقع لجميع حالات الادعاءات الـ 60 المفككة مسبقاً. وتعد هذه النتيجة فحصاً للقواعد المحددة مقابل التصنيفات المزودة لها. وهي لا تقيس مدى اكتمال تفكيك الإجابة الحرة لمساعد التسوق، كما أنها لا تحدد الأداء على حركة مرور المتسوقين الحقيقية.

ويوضح مثال افتراضي عادي هذا التمييز بجلاء. لنفترض أن مسودة تذكر أن حاسوباً محمولاً يحتوي على سعة الذاكرة المذكورة وأنه مثالي لتحرير الفيديو طوال اليوم. قد يتلقى أداة التحقق ادعاء الذاكرة ويمرره بشكل صحيح. لكن وعود الملاءمة وقوة التحمل قد تظل خارج المجموعة المستخرجة. وحتى مع اتخاذ قرارات مثالية بشأن الادعاء المقدم، فإن الأجزاء الجوهرية من الإجابة ستظل غير مفحوصة.

يمتلك Vouchmark قاعدة اكتمال حتمية ضيقة توضح إحدى الطرق لإظهار حالات الإغفال. ففي سيناريو الحاسوب المحمول المخصص للألعاب، تحتوي الادعاءات المقدمة على الذاكرة فقط. وتضيف قاعدة مهيأة ادعاءً بوجود بطاقة رسوميات مخصصة، وهو ما يناقضه الكتالوج بعد ذلك. وتعد هذه المطابقة تفسيراً تجريبياً مختاراً للصياغة، وليست تعريفاً شاملاً لملاءمة الألعاب أو كشفاً شاملاً للوعود الضمنية.

إن الأثر المترتب على التقييم محدد للغاية. يحتاج الفريق إلى أدلة حول القرارات المتخذة بشأن الادعاءات المقدمة، وأدلة منفصلة حول الادعاءات التي تصل إلى طبقة القرار تلك. واختبار المسودة الكاملة مقابل مجموعة ادعاءات معدة بشكل مستقل سيساعد في فحص الجانب الأخير. كما سيكشف عما إذا كانت الصياغة التي تبدو مفيدة في ظاهرها تضيف وعوداً لا تستطيع قواعد المقارنة تمثيلها.

هناك موازنة ومفاضلة هنا. فقصر النص المقدم على قوالب متجذرة في الكتالوج يمكن أن يضيق ما يتعين على النظام فحصه، وذلك على حساب النطاق التعبيري. والسماح بنثر أكثر ثراءً يمكن أن يحسن التفسير مع زيادة مجموعة الوعود الصريحة والضمنية التي تحتاج إلى تغطية. ولا يمكن لاختبار مرجعي ذي بوابة نقية أن يختار بين تلك التصاميم بمفرده.

يوضح دليل Vouchmark التوضيحي الأمثلة الاصطناعية وسجل القرارات. وبالنسبة لفريق التجارة، فإن نتاج المراجعة الأكثر أهمية هو الحد المحيط بالإجابة المقترحة: ما الادعاءات التي تم تحديدها، وما الدليل الذي استند إليه كل منها، وما الذي ظل دون حسم.

إليكم الجولة الإرشادية للمؤسس حول قرارات الكتالوج هذه في Vouchmark.

إنني أحكم على طبقة التحقق من خلال قدرتها على الحفاظ على التفاصيل المفيدة للإجابة مع إظهار الأجزاء غير المحسومة بوضوح. ويجب أن تتطلب الموافقة على إجابة كاملة وجود سبب للاعتقاد بأن ادعاءاتها الجوهرية قد وصلت إلى البوابة، إلى جانب سياسة واضحة لجودة الأدلة التي تدعمها. وحتى ذلك الحين، فإن الحكم الدقيق ليس سوى نتيجة تخص ادعاءً مقدماً، بينما تظل بقية الإجابة بحاجة إلى بيان وتبرير.

أبحاث ذات صلة

منشور أيضًا على

ابنِ ذكاءك الاصطناعي بثقة.

تعاون مع فريق يمتلك خبرة عميقة في بناء الجيل القادم من الذكاء الاصطناعي للمؤسسات. دعنا نساعدك على تصميم استراتيجية ذكاء اصطناعي جديرة بثقتك وبنائها وتطبيقها.

Veriprajna استشارات التقنيات العميقة متخصصة في بناء أنظمة الذكاء الاصطناعي الحرجة للسلامة في مجالات الرعاية الصحية والتمويل والقطاعات التنظيمية. تُقيَّم بنياتنا المعمارية وفق البروتوكولات المعتمدة مع توثيق شامل للامتثال.