الرؤية الحاسوبية المقيدة بالفيزياء
تحت أضواء الكاشفات، يمكن لرأس أصلع لامع أن يسجل تصنيف «كرة» بثقة 98%، وتتحول الكاميرا التي تتبع أعلى مستوى ثقة بعيداً عن أرض الملعب. يُعد Plumbline طبقة بوابات فيزيائية حتمية تستقر بعد كاشفك وترفض الاكتشاف الذي تحظره الفيزياء، مع البقاء مقفلة بثبات على الكرة الحقيقية.
إنها طبقة التحقق الفاصلة بين كاشفك ونظام اتخاذ الإجراءات لديك. شغّلها، ثم اقرأ السبب الفيزيائي الذي سجلته لكل قرار.
جولة توضيحية مصحوبة بالسرد للوحة معلومات Plumbline أثناء التشغيل (3:58).
97.7%
الوقت على الهدف، البوابة الفيزيائية
المعيار الاصطناعي، البذرة 7
82.3σ
أسوأ كائن منتحل، رُفض متجاوزاً خط 5σ
تدقيق bald_linesman، 44 إطاراً
68.3%
الوقت على الهدف، مقطع بث حقيقي
نموذج YOLO11x الحقيقي، 240 إطاراً، فضاء الصورة
يتم الفصل بين نطاقي المعيارين بدقة في جميع أنحاء هذه الصفحة. فالرقم الاصطناعي يمثل الحد الأقصى المضبوط مقابل حقيقة أرضية معلومة؛ أما رقم اللقطات الحقيقية فهو أدنى بصدق على الفيديو الحقيقي الصعب.
الفشل هنا هو فشل فيزيائي، وليس فشلاً في الكشف.
كاشف الكائنات مستقل عن الإطارات. فهو يُقيّم كل صورة بناءً على الملمس والشكل دون أي إدراك للمكان الذي يمكن أن يتواجد فيه كائن حقيقي فيزيائياً في الإطار التالي. وتحت أضواء كاشفات الاستاد، يلمع الرأس الأصلع مثل الكرة، فيُصدر الكاشف تصنيف «كرة» بثقة 98% على الرأس بينما تسجل الكرة الفعلية درجة ثقة أدنى، وتتتبع الكاميرا التي تتبع أعلى مستوى ثقة الرأس بدلاً من مجريات المباراة.
هذا أمر موثق وليس مجرد افتراض نظري. ففي أكتوبر 2020 في نادي إنفرنيس كاليدونيان ثيسل (Inverness Caledonian Thistle)، تتبعت كاميرا Pixellot الآلية رأس حكم الراية الأصلع بدلاً من الكرة لمباراة كاملة (صفحة حلول Veriprajna WP43، عام 2026). كما أنه ليس فشلاً عارضاً تستبعده النماذج الأفضل من تلقاء نفسها: إذ يخلص معيار التتبع الخاص بـ SoccerNet إلى أن تتبع الكائنات المتعددة في كرة القدم «بعيد كل البعد عن الحل»، مع عدم دمج أي تتبع مدرك للفيزياء في أساليب القياس المعياري حتى الآن، وهي فجوة واضحة (أبحاث Veriprajna WP43، عام 2026).
والسبب في أن هذه المشكلة لا تتلاشى مع تحسن أجهزة الكشف هو أن الاكتشاف المستحيل فيزيائياً يظل خاطئاً عند أي مستوى من دقة الكاشف. فـ «الكرة» التي تستقر على ارتفاع ثابت قدره 1.7 م وتتحرك بسرعة 3 ميل/الساعة ليست كرة مهما بلغت ثقة النموذج. وبالنسبة لفريق يتحمل المسؤولية القانونية عن قرار بصري آلي، فإن الحالات الحدية هي مكمن التكلفة الحقيقية: حيث يُقدّرها تقرير قطاعي بأنها تمثل «80% من وقت الهندسة، و90% من تكاليف الدعم، و100% من التعرض للمسؤولية» (أبحاث Veriprajna WP43، عام 2026).
يعمل Plumbline في مرحلة لاحقة للكاشف. حيث يأخذ كل اكتشاف مرشح ويتساءل عما إذا كانت الفيزياء تسمح به، ثم يوجه الإطار إما للقبول (accept)، أو المراجعة (review)، أو المتابعة التقديرية بالقصور الذاتي (coast)، ويسجل السبب كتابةً.
يتنبأ مرشح كالمان/UKF (نموذج عملية القذيفة بالإضافة إلى نموذج قياس الثقب غير الخطي) بالمكان الذي يمكن أن تتواجد فيه كرة حقيقية. ويتحول ابتكار كل مرشح إلى مقياس Mahalanobis للمسافة. تُوفَّر العتبات كتهيئة: القبول تحت 3σ، والرفض فوق 5σ، وتمييز 3 إلى 5σ كـ REVIEW. وفي أسوأ إطار من مشهد حكم الراية الأصلع، سجل الكائن المنتحل 82.3σ.
تقارن البوابة سرعة البكسل التي يتنبأ بها المسار بالتدفق البصري المحلي للمرشح، وترفض عند حدوث عدم تطابق في الاتجاه أو المقدار (النطاق المشحون: نسبة التدفق في [0.35, 3.0]، وجيب التمام 0.3 على الأقل). وأي «كرة» تستقر دون حركة تقريباً في منتصف اللعب تفشل فيها.
يُعطي نموذج الثقب حجم البكسل الذي يمكن أن تشغله كرة بقطر 22 سم عند العمق الضمني للمرشح، وترفض البوابة الأحجام المستحيلة (هامش تحمل نسبة الحجم 1.8x في المسار الاصطناعي، و1.5x في مسار فضاء الصورة للقطات الحقيقية). فالرأس الذي يبلغ حجمه نحو 50 بكسل لا يمكن أن يكون كرة بقطر 22 سم على بعد حوالي 12 متراً، والتي تشغل نحو 22 بكسل.
ثم تقرر بوابة سياسة حتمية، باستخدام نفس ملف gates.py دون تغيير في كلا مساري الإدخال. وهي تقبل فقط عندما تجتاز جميع البوابات. وتُميز المرشح الحدي (3 إلى 5σ دون فشل حاسم) كـ REVIEW، ويواصل المسار تقدمه بالقصور الذاتي بناءً على التنبؤ، مع تصعيده بدلاً من التظاهر بالثقة الزائفة. كما تدخل في حالة COAST (تنبؤ فقط) عند رفض كل مرشح، على سبيل المثال أثناء احتجاب وجيز، وتُعيد التقاط الكرة عند ظهورها من جديد. وتُعد هذه العتبات مجرد إعدادات تهيئة، ولا يحددها أي نموذج.
يُكتب كل قرار في سجل تدقيق مخصص لكل قرار. يحمل الرأس البذرة، والسيناريو، ومعرف الكاشف، وعتبات البوابات. ويسرد كل إطار كل مرشح مع فئته ومستوى ثقته، والحكم الرقمي لكل بوابة مع سببها باللغة الإنجليزية البسيطة، والإجراء النهائي، والمسار المقفل. كما يحول راوٍ تدقيقي اختياري تلك البيانات المقاسة عن بُعد إلى ملخص حادث باللغة الإنجليزية البسيطة لغرض التصدير، لكنه ذو طابع استشاري فقط، ولا يتدخل مطلقاً في مسار القبول أو الرفض، ويتحول تلقائياً إلى ملخص حتمي مبني على قالب جاهز في حال عدم وجود مفتاح نموذج أو جسر ربط، حتى يعمل العرض التجريبي دون اتصال بالإنترنت تماماً.
تُطبّق سياسة البوابات الثلاث ذاتها على نوعين من المدخلات، وهذا هو جوهر الأمر. ففي المشاهد الاصطناعية، تستخدم مرشح كالمان غير المعطر (Unscented Kalman Filter) في فضاء العالم الحقيقي. أما في مقطع البث الحقيقي، فإنها تعمل في مستوى الصورة باستخدام مرشح كالمان ثنائي الأبعاد (kf2d)، لأن مقطعاً واحداً غير معاير لا يوفر عمقاً مترياً، واختلاق مرشح ثلاثي الأبعاد سيكون أمراً مضللاً. وتُعاد الاستفادة من البوابات دون أي تغيير؛ والمرشح وحده هو الذي يتغير بصدق. وهذا هو ما يجعل هذه الطبقة مستقلة عن نوع الكاشف: فالقيمة تكمن في البوابات، وليس في الكاشف.
لقطات الشاشة أدناه مأخوذة من لوحة معلومات Plumbline الفعلية أثناء تشغيلها. ويُعد منتحل الرأس الأصلع إعادة تمثيل أدرجها المؤلف للحادثة الموثقة لعام 2020، وهو أمر مُوضح بجلاء في التطبيق.
على مدار المشهد المكون من 44 إطاراً، يُصدر الكاشف المحاكى 18 اكتشافاً خاطئاً عالي الثقة لـ «كرة» على رأس حكم الراية، بمستوى ثقة يصل إلى 98%. وترفض البوابات الثلاث جميع هذه الاكتشافات الـ 18. ويسجل أسوأ كائن منتحل منفرد 82.3σ على البوابة الكينماتيكية، متجاوزاً بكثير خط الرفض البالغ 5σ، بينما تجتاز الكرة الحقيقية، بثقة تقارب 87% وقيمة 0.4σ، البوابات الثلاث جميعاً وتبقى مقفلة التتبع. وفي هذا السيناريو الفردي، حافظت الطبقة الفيزيائية على البقاء على الهدف بنسبة 97.7% من الوقت مع تبديل واحد لمعرّف الهوية (ID switch)، مقابل 59.1% لتتبع أعلى ثقة و20.5% لرفع عتبة الثقة (المجموع الإجمالي الاصطناعي للسيناريوهات الثلاثة موجود في جدول المقارنة أدناه).
عندما يمر لاعب لفترة وجيزة قاطعاً مسار الكرة، يفقدها المتتبع الساذج أو يمسك باللاعب. أما المتتبع الفيزيائي فيدخل في وضع COAST ويعتمد على التنبؤ عبر هذه الفجوة، ثم يُعيد التقاط الكرة فور ظهورها من جديد. إنه لا يختلق أبداً أي اكتشاف لملء الفراغ؛ بل يتنبأ، ويُميز الحالة، وينتظر.
في مقطع بث حقيقي مكون من 240 إطاراً، تُغذي اكتشافات YOLO11x الحقيقية البوابات الثلاث ذاتها العاملة في فضاء الصورة. وحافظت البوابات على تتبع الكرة في 68.3% من الإطارات مقابل 43.8% للمتتبع الساذج و30.0% لمتتبع رفع عتبة الثقة، مع 4 تبديلات فقط لمعرّف الهوية مقابل 7، ومتوسط خطأ قدره 26.2 بكسل مقابل 193.0 بكسل. وهذا الرقم أدنى بصدق من السقف الاصطناعي لأن اللقطات الحقيقية أكثر صعوبة. والاتجاه العام—وهو تفوق الفيزياء على كلا خطَّي الأساس—يصمد في الاكتشافات الحقيقية، وليس فقط في المحاكاة.
يكشف سجل القرارات المصدّر المسار بأكمله: البذرة، والسيناريو، ومعرف الكاشف، والعتبات في الجزء العلوي، يليه سجل لكل إطار لفئة كل مرشح ومستوى ثقته، والحكم الرقمي لكل بوابة مع سببها باللغة الإنجليزية البسيطة، والإجراء النهائي، والمسار المقفل، ختاماً بلوحة النتائج. وبالنسبة لفريق يتحمل المسؤولية القانونية عن قرار بصري آلي، فإن هذا يُعد أثراً قابلاً للتوثيق والأرشفة يوضح سبب الوثوق بكل اكتشاف أو رفضه.
هذه مقاييس لجودة التتبع، وهي مستقلة عن جودة الكاشف. ولا تمثل مطلقاً معدل خطأ للنموذج ولا ضماناً للعالم المفتوح. والمجموعتان أدناه تقعان ضمن نطاقين مختلفين ولا يتم الخلط بينهما.
| المتتبع | الوقت على الهدف | تبديلات معرّف الهوية | متوسط الخطأ (بكسل) | الفقد في المجموعة النظيفة |
|---|---|---|---|---|
| فيزياء Veriprajna | 97.7% | 3 | 2.7 | 2.3% |
| B1: تتبع أعلى مستوى ثقة | 80.3% | 4 | 63.0 | 0.0% |
| B2: رفع عتبة الثقة | 40.2% | 29 | 115.0 | 43.2% |
| المتتبع | الوقت على الهدف | تبديلات معرّف الهوية | متوسط الخطأ (بكسل) |
|---|---|---|---|
| فيزياء Veriprajna | 68.3% | 4 | 26.2 |
| B1: تتبع أعلى مستوى ثقة | 43.8% | 7 | 193.0 |
| B2: رفع عتبة الثقة | 30.0% | 1 | 245.1 |
الرقم الذي يحمل جوهر الأطروحة هو نتيجة التعامد. ففي المجموعة النظيفة الاصطناعية، يؤدي رفع عتبة الثقة (B2) إلى إسقاط 43.2% من الكرات الحقيقية منخفضة الثقة، بينما تحافظ الفيزياء على نسبة الفقد في المجموعة النظيفة عند 2.3%، وهو ما يمثل زمن كمون للالتقاط مدته إطار واحد وليس نتيجة سلبية كاذبة. إن رفع مقبض الثقة يستبدل خطأً بآخر، بينما تعمل الفيزياء بشكل متعامد معه. (أما التبديل الفردي لمعرّف الهوية في اللقطات الحقيقية لـ B2، فهو أثر جانبي لكونه بالكاد يتتبع أي شيء بنسبة 30% فقط على الهدف، وليس فوزاً).
كلا. يستقر Plumbline في مرحلة لاحقة لأي كاشف تقوم بتشغيله بالفعل، ويقرر أي من اكتشافاته المرشحة يمكن الوثوق بها. وفي العرض التجريبي، يعمل كود البوابات نفسه على كاشف محاكى بنظام الصندوق الأسود للمشاهد الاصطناعية، وعلى اكتشافات YOLO11x الحقيقية لمقطع البث. ونحن لا نتدخل في جودة مخرجات الكاشف؛ فالمنتج هو طبقة البوابات الحتمية المحيطة به، ومن ثم تظل القيمة قائمة حتى مع تحسن الكاشف الأساسي.
لأن ذلك هو المقبض الخاطئ. ففي المجموعة النظيفة الاصطناعية، يؤدي رفع عتبة الثقة إلى إسقاط 43.2% من الكرات الحقيقية منخفضة الثقة بينما يستمر في التقاط الكائن المنتحل عالي الثقة. وتعمل البوابات الفيزيائية بشكل متعامد مع الثقة: إذ حافظت على نسبة الفقد في المجموعة النظيفة عند 2.3%، وهو زمن كمون التقاط لإطار واحد بدلاً من إسقاط الكرة. ولا يمكنك فصل الكرة الحقيقية عن الكائن المنتحل بالدرجة وحدها عندما يسجل المنتحل درجة أعلى.
كلاهما، ونحن نفصل بينهما بوضوح تام. ففي تشغيل اصطناعي مضبوط بحقيقة أرضية معلومة (البذرة 7)، حافظت الطبقة الفيزيائية على البقاء على الهدف بنسبة 97.7% من الوقت مقابل 80.3% لتتبع أعلى ثقة و40.2% لرفع عتبة الثقة. وفي مقطع بث حقيقي مكون من 240 إطاراً باكتشافات YOLO11x الحقيقية، حافظت البوابات نفسها على الكرة في 68.3% من الإطارات مقابل 43.8% و30.0%. والرقم الخاص باللقطات الحقيقية أدنى بصدق لأن الفيديو الحقيقي أكثر صعوبة، ونحن لا نستشهد مطلقاً بالرقم الاصطناعي كنتيجة من العالم الحقيقي.
البوابات الثلاث هي كود برمجي خالص بلغة Python باستخدام مكتبتي numpy وscipy خارج أي نموذج: بوابة كينماتيكية بمرشح كالمان/UKF (القبول تحت 3 سيغما، والرفض فوق 5 سيغما)، وبوابة اتساق التدفق البصري، وبوابة المنظور الهندسي. ومن ثم فإن الثقة لا تعتمد على التقرير الذاتي لأي نموذج. ويوجد راوٍ تدقيقي اختياري يحول البيانات المقاسة للبوابات إلى ملخص باللغة الإنجليزية البسيطة، لكنه استشاري فقط ولا يقع أبداً في مسار القبول أو الرفض، ويتحول تلقائياً إلى ملخص حتمي مبني على قالب جاهز في حال عدم توفر مفتاح.
نعم. فكل قرار يحمل سبباً فيزيائياً موثقاً في السجل. ويسجل سجل القرارات المصدّر البذرة، والسيناريو، ومعرف الكاشف، وعتبات البوابات في الرأس، ثم يسرد لكل إطار كل مرشح مع فئته ومستوى ثقته، والحكم الرقمي لكل بوابة وسببها باللغة الإنجليزية البسيطة (على سبيل المثال، ماهالانوبيس 82 سيغما فوق خط 5 سيغما، مستحيل كينماتيكياً)، والإجراء النهائي، والمسار المقفل. ويتم تصديره بتنسيق JSON أو HTML.
كلا للأمرين معاً. هذا عرض تجريبي قابل للتشغيل يثبت آلية البوابات، وليس خط أنابيب منشوراً. وخطوط الأساس التي تفوقنا عليها هي فئة أنماط الفشل الساذجة فيزيائياً (تتبع أعلى ثقة، ورفع العتبة)، وليست أي مورّد محدد بالاسم. ونحن لا ندّعي التفوق في التتبع على أي منتج مطروح في السوق، كما أن مورّدي الكاميرات المعروفين قد أصلحوا بالفعل حالة حكم الراية الأصلع المحددة لعام 2020 في برامج ثابتة لاحقة. ومنتحل الرأس الأصلع في العرض التجريبي هو إعادة تمثيل أدرجها المؤلف لتلك الحادثة الموثقة، وليس ضوضاء كاشف طبيعية التُقطت مباشرة.
البحث الكامن وراء هذا العرض التجريبي — الهندسة المعمارية، وتصميم التحقق، والمخطط المؤسسي الشامل.
الحل الكامل
استكشف حل الرؤية الحاسوبية المقيدة بالفيزياء →إذا كان القرار البصري الآلي يترتب عليه مسؤولية قانونية في مجالك، فإن نمط الفشل ينبع من الفيزياء، وليس من مستوى الثقة.
لقد بنينا Plumbline لنوضح أن طبقة البوابات الحتمية يمكنها رفض الاكتشاف المستحيل فيزيائياً وترك سبب موثق قابل للأرشفة لذلك. ويمكن للإطار نفسه أن يستوعب مجموعة مختلفة من القوانين الفيزيائية: كبوابة اختلاف المنظر لمصنع أشباه موصلات، أو بوابة انعكاس لخط إنتاج. أخبرنا بالقيد الذي يستمر كاشفك في انتهاكه وسنعمل معاً لتحديد ما إذا كانت طبقة البوابات مناسبة لاحتياجاتك.