لا يستطيع LLM مراقبة مواقفه الضريبية بنفسه. بنيت طبقة حتمية تتحقق من المواقف المصوغة بالذكاء الاصطناعي مقابل النص التشريعي المرمَّز، لا النموذج.
Tax TechnologyArtificial IntelligenceCompliance

حاولت جعل LLM يلتقط أخطاءه الضريبية بنفسه. لم يستطع، واتضح أن ذلك هو العمل كله.

Ashutosh SinghalAshutosh Singhal19 يونيو 202613 min

كان الادعاء سليماً نحوياً تماماً. وتلك كانت المشكلة.

ما زلت أتذكر أول موقف جعلني أتوقف وأضع قهوتي جانباً. صاغ ذكاء اصطناعي سطراً عن خصم الفائدة الجديد على قرض السيارة بموجب OBBBA، وجاء فيه: "خصم الفائدة الجديد على قرض السيارة بموجب OBBBA هو خصم فوق الخط يُخفِّض الدخل الإجمالي المعدَّل (AGI) للعميل." كانت الجملة نظيفة. وكانت واثقة. وكانت مُنسَّقة مثل كل موقف قابل للدفاع قرأته في حياتي. وكانت خاطئة بالطريقة الدقيقة التي تُكلِّف شخصاً حقيقياً مالاً حقيقياً.

خصم فائدة قرض مركبة الركاب المؤهَّلة (QPVLI) هو خصم تحت الخط بموجب §63(b)(7). وهو لا يُخفِّض الدخل الإجمالي المعدَّل. وضعه فوق الخط ليس خطأ إملائياً تلتقطه عند إعادة القراءة. إنه يُحرِّك AGI بهدوء، وAGI هو الرقم الذي تعتمد عليه نصف بنود الإقرار. وما فاجأني لم يكن أن نموذجاً أخطأ قليلاً في نص تشريعي. بل كم جيدة بدت الإجابة الخاطئة.

الاستشهاد المختلَق سهل الالتقاط. أما سوء التصنيف الواثق، المكتوب بلغة ضريبية إنجليزية مثالية، فهو الذي يُقدَّم في الإقرار.

تلك كانت اللحظة التي اتضحت لي فيها المشكلة الفعلية. قضت الصناعة ثلاث سنوات في أتمتة صياغة العمل الضريبي، وأبلت بلاءً حسناً حقاً. Thomson Reuters تُعدّ إقرارات 1040 تلقائياً. وCCH Axcess تصوغ رؤى استشارية عبر آلاف المكاتب. وBlue J تجيب عن أسئلة البحث بلغة بسيطة. إعداد الإقرارات في طريقه إلى الحل. لكن الخطوة بعد الإعداد، تلك التي يجب على أحدٍ أن يقرر فيها ما إذا كان الموقف قابلاً للدفاع فعلاً بموجب النص التشريعي، سُلِّمت إلى النموذج الاحتمالي نفسه الذي صاغها. وبموجب IRC §6662، تقع غرامة الدقة المرتبطة بنسبة 20% على الإنسان الذي وقّع الإقرار، لا على الخوارزمية التي كتبته.

قضيت أسبوعاً أحاول جعل النموذج يقيّم واجبه بنفسه.

كان غريزتي الأولى هي الغريزة الواضحة، وأريد أن أكون صادقاً بأنني طاردتُها أطول مما كان ينبغي. إذا كان النموذج يستطيع صياغة الموقف، فلا بد أن مُطالبة جيدة بما يكفي تجعله يتحقق من الموقف. فجرّبت. أعطيته النص التشريعي. أعطيته قاعدة QPVLI مفصَّلة. طلبت منه تدقيق مخرجاته والإبلاغ عن أي شيء يضع خصماً على السطر الخطأ.

التقط بعضها. وفوّت أخرى. وكانت حالات الفوات من النوع المخيف، لأنه حين أخطأ في التدقيق أخطأ بنفس الطلاقة الواثقة التي صاغ بها. مرّ الفحص الذاتي عبر الأوزان نفسها التي أنتجت الخطأ أصلاً. مطالبة نموذج بأن يراقب نفسه هي مطالبة الشيء الذي ارتكب الخطأ بأن يكون أيضاً الشيء الذي يلاحظ الخطأ، مستخدماً الاستدلال ذاته الذي أنشأه.

أتذكر أنني شرحت هذا لزميل وسمعت نفسي أقوله بصوت عالٍ: "لا يمكننا الوثوق بـ LLM لمراقبة LLM." تلك الجملة هي اللحظة التي انقلب فيها التصميم بالنسبة لي. كنت أحاول جعل النموذج أدق. أما الجواب الحقيقي فكان التوقف عن الوثوق بالنموذج ليكون الحكم أصلاً.

لا يمكنك جعل نظام احتمالي حتمياً بأن تطلب منه بلطف. تنقل الحكم إلى خارجه.

التمييز الذي استغرق مني وقتاً أطول مما ينبغي لاستيعابه هو أن الصياغة والتحقق ليسا المهمة نفسها وقد صارت أسهل أو أصعب. إنهما مشكلتان مختلفتان. الصياغة تكافئ الطلاقة والتغطية والمعقولية، وهذا بالضبط ما بُني من أجله نموذج اللغة. أما التحقق فيكافئ أن تكون على حق بشكل قابل للإثبات بشأن قاعدة محددة واحدة، وأن تستطيع إظهار عملك لفاحص لم يكن في الغرفة. تلك أمزجة متضادة. توقفت عن محاولة جعل نظام واحد يقوم بالأمرين.

ماذا يعني فعلاً "الوكيل ينصح، والرمز يقرر"؟

أريد أن أكون دقيقاً بشأن البنية التي استقررت عليها، لأن العبارة قد تبدو تسويقية حتى ترى أين يُرسَم الخط. في StatuteGuard، العرض التوضيحي الذي بنيتُه، يقوم نموذج اللغة بمهمة واحدة بالضبط: يقرأ لغة ضريبية طبيعية فوضوية ويقترح ادعاءً منظَّماً مُنَمَّطاً. تلك هي الخطوة العصبية الوحيدة. وهو بارع حقاً في ذلك، وحين لا يكون متأكداً يمتنع ويُصعَّد الموقف إلى إنسان بدل أن يحصل على حكم مُخمَّن.

كل ما بعد ذلك رمز. يُقرَّر الحكم بواسطة محرك سياسات حتمي، OPA/Rego حقيقي مع توأم مطابق بلغة Python النقية، يشغّل قواعد كتبتُها مقابل القانون الأساسي. استخراج عصبي، تحقق رمزي. النموذج ينصح. الرمز يقرر. والفرق ليس أكاديمياً، لأن الرمز لا يمكن إقناعه بالتخلي عن جوابه بفقرة مكتوبة جيداً.

الجزء الذي لم أتوقع أن أهتم به بهذا القدر هو قابلية القراءة. السياسات ليست صندوقاً أسود أطلب منك الوثوق به. إنها جداول قرار ومصدر Rego يمكنك فتحه والتحقق منه مقابل النص التشريعي بنفسك.

لوحة قواعد السياسة تعرض جداول قرار قابلة للقراءة لـ §280A و§30D إلى جانب مصدر OPA/Rego الحقيقي
قواعد المركبات النظيفة بموجب §30D مرمَّزة كجدول قابل للقراءة (سقف MSRP للسيارة $55,000، وللسيارات الرياضية متعددة الاستخدامات/الشاحنات/الحافلات الصغيرة $80,000؛ سقف AGI المعدَّل للأعزب $150,000، ولرب الأسرة $225,000، وللمتزوجين مقدِّمين معاً $300,000) مع مصدر OPA/Rego الحقيقي أسفله. يمكنك قراءة السياسة والتأكد من أنها تطابق النص التشريعي.

تلك اللقطة هي الأطروحة كلها في لوحة واحدة. ينبغي أن يستطيع رئيس الضرائب الجلوس مع شريك الامتثال، وفتح القاعدة، والتأكد منها مقابل §30D قبل الوثوق بحكم واحد. حين يكون المنطق فقرة من استدلال النموذج، لا تستطيع فعل ذلك. وحين تكون قاعدة يمكنك قراءتها، تستطيع.

فماذا يحدث حين يقول الرمز لا؟

في أول مرة مرّرت فيها موقف قرض السيارة بموجب OBBBA عبر البوابة المكتملة، ابتسمت فعلاً. كان النموذج قد صاغ ادعاء "فوق الخط، يُخفِّض AGI" تماماً كما فعل من قبل. لكن هذه المرة نظر المحرك الحتمي إلى الادعاء المستخرَج، وطابقه مع قاعدة §63(b)(7) المرمَّزة، وأعاد حكماً قاطعاً: BLOCK. لا تُقدِّم الإقرار.

StatuteGuard يُعيد حكم BLOCK على موقف قرض السيارة بموجب OBBBA مع لافتة عدم التقديم وتسلسل الآثار اللاحقة الخماسي مُعلَّماً بالأحمر
موقف QPVLI بموجب OBBBA يُعيد BLOCK ("محظور. البيان المصوغ يتعارض مع النص التشريعي المرمَّز؛ لا تُقدِّم الإقرار كما كُتب.")، مع تسلسل الآثار اللاحقة الخماسي (AGI، ضريبة الولاية المرتبطة بـ AGI، علاوة قسط Medicare IRMAA، أرضية خصم النفقات الطبية بنسبة 7.5%، وسداد قروض الطلاب المرتبط بالدخل IDR) كلها مُعلَّمة.

ما أجده مقنعاً في هذا العرض، وما آمل أن يجده قارئ ضريبي مقنعاً، هو التسلسل. المحرك لا يقول فقط "السطر الخطأ". إنه يُريك خمسة مواضع لاحقة سيُفسدها تخفيض AGI زائف: الدخل الإجمالي المعدَّل نفسه، وضريبة دخل الولاية المرتبطة بـ AGI، وعلاوة قسط Medicare IRMAA، وأرضية خصم النفقات الطبية بنسبة 7.5%، وسداد قروض الطلاب المرتبط بالدخل. خصم واحد مُصنَّف خطأً ليس خطأً واحداً. إنه نصف قطر انفجار صغير، واللوحة تجعل نصف القطر مرئياً.

ثم يُحرِّك السبب، وهو الجزء الأكثر تعلقاً به لدي. يسير على سلسلة الاستشهاد عبر رسم بياني للمراجع المتقاطعة في IRC، عقدةً بعقدة، بحيث لا يكون "لا" أبداً ادعاءً عارياً.

سلسلة الاستشهاد التشريعي المتحركة تعبر رسم IRC من §163(h)(1) عبر §63(b)(7) مع إظهار قاعدة الوضع تحت الخط
سلسلة الاستشهاد الحية: §163(h)(1) إلى §163(h)(4)(A) إلى §163(h)(4)(B) إلى §63(b)(7) إلى §62/§63. اختيار عقدة §63(b)(7) يُظهر قاعدة الوضع: يُسمح بـ QPVLI في حساب الدخل الخاضع للضريبة من AGI، وهو خصم تحت الخط، مؤكَّد بقاعدة فائدة قرض السيارة في السجل الفيدرالي (يناير 2026).

إليك التفصيل الذي أعود إليه باستمرار، لأنه هو الذي يُثبت أن هذه ليست مشكلة لعبة. وفقاً لملف README الخاص بالعرض نفسه، خطأ تصنيف "فوق الخط" ليس شيئاً اخترعتُه لأصنع شريراً. إنه خطأ إجماع موثَّق نشره التوجيه السائد لإعداد الضرائب، بما في ذلك موقع H&R Block. إجابة خاطئة معقولة، مكتوبة جيداً، ومتكررة على نطاق واسع هي بالضبط نمط الإخفاق الذي وُجدت البوابة الحتمية من أجله. ثقة الجمهور لا تجعل الخصم ينتقل إلى AGI. النص التشريعي هو من يقرر ذلك، والآن يقرره الرمز أيضاً.

أخطر خطأ ضريبي ليس ذلك الذي يبدو خاطئاً. بل ذلك الذي يبدو صحيحاً، ويبدو صوته صحيحاً، ويظهر في توجيه ثلاثة مورّدين.

إن أردت الجلوس مع أيٍّ من هذا، فالعرض التشغيلي على veriprajna.com/ar/demos/tax-compliance-ai. يمكنك لصق موقفك الخاص ومراقبة البوابة وهي تقرر.

الميزة التي كدت أخطئ فيها: معرفة متى أقول "لا أعرف"

عليّ أن أعترف بالخطأ الذي كدت أدمجه، لأنه الخطأ الذي يريد كل مهندس يبني أداة تحقق ارتكابه. كانت غريزتي المبكرة جعل الآلة تجيب عن كل شيء. بدت التغطية كأنها الهدف. أداة تُعيد حكماً على كل موقف تبدو أكثر اكتمالاً من أداة تهز كتفيها أحياناً.

تلك الغريزة خاطئة، وموقف محدد علّمني لماذا. انظر إلى خصم المكتب المنزلي بموجب §280A. ما إذا كانت غرفة نوم فائضة تُستخدم "بانتظام وحصرياً" كمكان عمل رئيسي هو اختبار وقائع وظروف. لا توجد قاعدة نظيفة لترميزها، لأن الجواب يعتمد على كيف يستخدم شخص حقيقي غرفة حقيقية فعلاً. لو أجبرتُ المحرك الحتمي على الحكم فيه، لكنت أفعل بالضبط ما بنيتُ هذا لمنعه: تصنيع حكم واثق حيث الجواب الصادق هو "يحتاج إنسان إلى النظر في هذا."

StatuteGuard يوجّه موقف المكتب المنزلي بموجب §280A إلى NEEDS HUMAN REVIEW لأن الاستخدام المنتظم والحصري اختبار وقائع وظروف
موقف المكتب المنزلي بموجب §280A (غرفة نوم فائضة تُستخدم لأعمال الاستشارة، مع حصرية غير مثبتة) يُوجَّه إلى NEEDS HUMAN REVIEW. تُصعَّد المنطقة الرمادية بدل حلّها، لأن الاستخدام المنتظم والحصري اختبار وقائع وظروف خارج التغطية الحتمية.

إذن للبوابة أربعة أحكام، لا حكمين. PASS حين يكون الموقف قابلاً للدفاع. BLOCK حين يتعارض مع النص التشريعي المرمَّز. NEEDS-REVIEW حين تكون منطقة رمادية حقيقية. OUT-OF-COVERAGE حين يكون الحكم ببساطة غير مرمَّز في هذه النسخة. الأخيران يعنيان الشيء الصادق نفسه: شخص يقرر هذا، لا الآلة. بناء مسار التصعيد بدا كالاعتراف بحد. وهو في الواقع أهم ميزة في المنتج، لأن طبقة تحقق لا تقول أبداً "لا أعرف" ليست سوى نموذج ثانٍ يخادع بخطوات إضافية.

الأرقام، وما لا تدّعيه بالضبط

أنا حذر مع المعيار المرجعي، أكثر حذراً مما يريده مسوّق مني، لأن الطريقة التي تُذكر بها هذه الأرقام عادةً كذبة. شغّلت المحرك الحتمي مقابل مجموعة ذهبية مُسمَّاة من 42 موقفاً مُصنَّفاً مسبقاً (14 نظيفاً، و16 خطأً، و12 للتصعيد) وقِستُ ما الطبقة تفعله.

لوحة نتائج المعيار الذهبي تُظهر تغطية حتمية بنسبة 71.4%، ودقة بوابة 100%، والتقاط أخطاء 100%، وتصعيداً صحيحاً 100% عبر 42 موقفاً
المعيار الذهبي: تغطية حتمية 71.4%، ودقة بوابة 100% (صفر حظر خاطئ)، واكتمال التقاط الأخطاء 100%، و100% من المناطق الرمادية صُعِّدت بشكل صحيح، مُتحقَّق عبر المواقف الـ42 المُسمَّاة، ومُقيَّم محلياً.

على تلك المجموعة الذهبية من 42 حالة: تغطية حتمية 71.4%، أي أن المحرك حلّ تلك الحصة إلى PASS أو BLOCK بنفسه وصعَّد الباقي بشكل صحيح. دقة بوابة 100%، أي أنه لم يُحظر أي موقف صحيح خطأً. اكتمال التقاط الأخطاء 100% على الأحكام المرمَّزة. و100% من المناطق الرمادية صُعِّدت بشكل صحيح. بلغ معدل الإنتاجية عشرات الآلاف من المواقف في الثانية (حوالي 58,000 في التشغيل الذي التقطتُه، رغم أن ذلك يعتمد على الجهاز)، لأن التحقق بنية تحتية، لا استدعاء نموذج.

والآن الجزء الذي أصرّ عليه. تلك الأرقام صحيحة على تلك المجموعة الذهبية، لا كضمان في العالم المفتوح. لن أخبرك أن StatuteGuard "دقيق بنسبة 100%"، لأن تلك الجملة غير صادقة في اللحظة التي تغادر فيها المجموعة المُسمَّاة. ما سأخبرك به أدق، وأعتقد أنه أبقى: لأن الحكم رمز حتمي، فسلوكه على الأحكام المرمَّزة قابل للتكرار والإثبات، لا احتمالاً يتغيّر. حتى إنني راجعت كل حكم من الأحكام الـ42 مقابل OPA 1.17.1 والتوأم بلغة Python النقية، وتطابقت تماماً. هذا هو الادعاء الذي أستطيع الوقوف خلفه. إنه يصف الطبقة، لا النموذج.

"دقة 100%" رقم تسويقي. "قابل للتكرار على الأحكام المرمَّزة، مع تصعيد صادق في كل ما عداها" رقم هندسي. أفضّل شحن الثاني.

ولهذا لا يشيخ هذا الأمر. نموذج أساس أفضل العام القادم ما زال لا يستطيع أن يُثبت لفاحص أي حكم تشريعي أيّد أي موقف. التغطية ودقة البوابة ومسار تدقيق قابل للتقديم خصائص لطبقة التحقق. ليست معدل خطأ نموذج يتقلص مع تحسّن النماذج.

الأثر الذي لم أكن أعرف أنني أبنيه حتى طلبه فاحص

لم أشرع في بناء وثيقة امتثال، لكن كلما تحدثت إلى مزيد من مختصي الضرائب، انتهى الحديث في المكان نفسه: "حسناً، التقط الخطأ، لكن ماذا أُسلِّم لـ IRS؟" لذا يكتب كل حكم الآن سجلاً قابلاً للتقديم للعناية الواجبة بموجب §6662، ورقة عمل قابلة للطباعة توثّق أن الموقف تحقّق منه مقابل النص التشريعي قبل التقديم. ورقة عمل المصدر، والحكم، والمصدر الأساسي، والادعاء المستخرَج، وسرد التحديد، وسلسلة الاستشهاد الكاملة. إنه الدليل على أن موقفاً ذا سبب معقول وعناية واجبة اتُّخذ فعلاً، وهذا يهم مباشرة بموجب مراجعات AICPA SSTS السارية في يناير 2024.

هناك سبب آخر لاهتمامي بمكان تشغيل هذا، وأصبح ملموساً بعد حكم Heppner (SDNY، فبراير 2026)، الذي أثار سؤالاً عن التنازل عن الامتياز بشأن تغذية أبحاث العميل في أداة ذكاء اصطناعي عامة. يعمل StatuteGuard محلياً بالكامل بلا مفتاح API افتراضياً. لا موقف ولا بيانات عميل تغادر المحيط. بعد Heppner، بنية مغلقة ومحلية وقابلة للتدقيق ليست مجرد أمر لطيف في مراجعة أمنية. إنها ذات أهمية قانونية. لم أصمّم وضع المحلية أولاً من أجل ذلك الحكم. لكن الحكم هو سبب قيادتي به الآن.

لسياق الرهانات، تتجاوز تكاليف امتثال الضرائب للأعمال الأمريكية $126 مليار دولار سنوياً (بحث حل WP1، 2026)، وغرامة IRC §6662 هي 20% من النقص، مع تعرض احتيال §6663 يصل إلى 75%. حين تُؤتمت الصياغة وتكون الغرامة شخصية، فإن خطوة التحقق هي ما ينبغي أن يُبقي رئيس الضرائب مستيقظاً ليلاً.

ما أؤمن به فعلاً الآن

بدأت هذا وأنا أظن أنني أبني ذكاءً اصطناعياً ضريبياً أفضل، وأريد أن أنهي بالقول بصراحة إنني كنت مخطئاً بشأن ماهية المشكلة. ذكاؤك الاصطناعي الضريبي ليس لديه مشكلة دقة. لديه مشكلة تحقق، ونموذج أفضل لن يحلّها، لأن غرامة الـ20% تقع على توقيعك، لا على أوزانه. إضفاء الطابع الشخصي وأتمتة صياغة العمل الضريبي تقدّم حقيقي. وهو أيضاً ليس الشيء نفسه كإثبات أن موقفاً قابل للدفاع، والصناعة كانت تعامل الاثنين بهدوء وكأنهما الشيء نفسه.

العرض يعيش على veriprajna.com/ar/demos/tax-compliance-ai إن أردت محاولة كسر البوابة. وأودّ حقاً أن تفعل.

وإن فضّلت مشاهدة البوابة وهي تقرر على قراءة وصفي لها، فإليك الأمر كله يعمل من البداية إلى النهاية.

إذن هذا هو السؤال الذي أظل أطرحه على قادة الضرائب، وليس لدي جواب مريح عنه بعد. حين يصوغ ذكاء اصطناعي موقفاً وتوقّع أنت الإقرار، ما هو الأثر الذي يُثبت أن أنت تحقّقتَ منه، لا أنك وثقتَ به؟ إذا كان الجواب الصادق "لا شيء، وثقتُ بالنموذج"، فالنموذج ليس مساعدك. إنه شريكك في التوقيع، ولا يمكن استدعاؤه إلى التدقيق.

أبحاث ذات صلة

منشور أيضًا على

ابنِ ذكاءك الاصطناعي بثقة.

تعاون مع فريق يمتلك خبرة عميقة في بناء الجيل القادم من الذكاء الاصطناعي للمؤسسات. دعنا نساعدك على تصميم استراتيجية ذكاء اصطناعي جديرة بثقتك وبنائها وتطبيقها.

Veriprajna استشارات التقنيات العميقة متخصصة في بناء أنظمة الذكاء الاصطناعي الحرجة للسلامة في مجالات الرعاية الصحية والتمويل والقطاعات التنظيمية. تُقيَّم بنياتنا المعمارية وفق البروتوكولات المعتمدة مع توثيق شامل للامتثال.