المشكلة
عندما دققت Veriprajna نماذج ChatGPT وClaude وGemini بشأن مسألة ضريبية محددة حول الخصم الضريبي الجديد لفائدة قروض السيارات، أخطأت جميع النماذج. ليس في بعض الأحيان، بل في كل مرة دون استثناء. أخبر كل نموذج ذكاء اصطناعي المستخدمين بثقة تامة أن الخصم الجديد بموجب قانون One Big Beautiful Bill Act (OBBBA) سيخفض الدخل الإجمالي المعدل (AGI) لديهم. تلك الإجابة غير صحيحة قانونياً. فالخصم يخفض الدخل الخاضع للضريبة (Taxable Income)، وليس الدخل الإجمالي المعدل (AGI). وهذان أمران مختلفان تماماً في قانون الضرائب.
لم يكن هذا خللاً عشوائياً، بل كان فشلاً متوقعاً متجذراً في كيفية تعلم أنظمة الذكاء الاصطناعي هذه. لقد قرأت آلاف المنشورات على المدونات والمقالات المحسّنة لمحركات البحث (SEO) التي بسطت القانون بشكل مفرط. في حين ظهر النص القانوني الفعلي ربما مرة أو مرتين في بيانات تدريبها، ظهرت مقالات المدونات آلاف المرات. ونتيجة لذلك، تعلم الذكاء الاصطناعي النسخة الشائعة — والخاطئة — من القاعدة.
تطلق الورقة التقنية على هذه الظاهرة اسم "خطأ الإجماع" (Consensus Error). لا يكمن السبب في افتقار الذكاء الاصطناعي إلى المعلومات، بل في أنه اختار إجابة الحشود بدلاً من إجابة القانون. وعندما يعتمد فريقك المالي على ذلك الذكاء الاصطناعي، فإن شركتك ترث خطأ الحشود. ومصلحة الضرائب الأمريكية (IRS) لا تقبل حجة "الصواب على الأرجح" كدفاع.
لماذا يهم هذا أعمالك
ليست هذه مشكلة ذكاء اصطناعي مجردة، بل إنها تمس أرباحك الصافية، وتعرضك للتدقيق الضريبي، والتزامات الامتثال الخاصة بك بشكل مباشر.
يبلغ الحد الأقصى لخصم قروض السيارات بموجب قانون OBBBA ما قيمته $10,000 سنوياً ويُلغى تدريجياً عند مستويات دخل محددة. ينخفض الخصم بمقدار $200 لكل $1,000 يكسبها مقدم الإقرار الفردي فوق $100,000، ويختفي تماماً عند $150,000. وبالنسبة لمقدمي الإقرارات المشتركة، يبدأ الإلغاء التدريجي عند $200,000 وينتهي عند $250,000. وعندما يخطئ الذكاء الاصطناعي في التمييز بين الدخل الإجمالي المعدل (AGI) والدخل الخاضع للضريبة، تتوالى الأضرار التابعة بشكل متتابع:
- نقص في سداد الضرائب الفيدرالية. إذا صنفت أنظمتك هذا الخصم على أنه خصم فوق الخط (above-the-line deduction)، فستقدم تقريراً بدخل إجمالي معدل (AGI) أقل مما تتوقعه مصلحة الضرائب الأمريكية (IRS). وهذا مسار مباشر لفرض العقوبات والغرامات.
- مخاطر التدقيق الضريبي على مستوى الولايات. تربط ولايات مثل أريزونا حساباتها الضريبية بالدخل الإجمالي المعدل (AGI) الفيدرالي. ويعني الدخل الإجمالي المعدل الخاطئ ضرائب غير صحيحة على مستوى الولاية في كل ولاية ترتبط ضريبتها بالدخل الإجمالي المعدل.
- أخطاء في أقساط الرعاية الصحية (Medicare). قد يواجه المتقاعدون الذين يعتمدون على مشورة الذكاء الاصطناعي رسوم IRMAA إضافية غير متوقعة لأن الذكاء الاصطناعي وعد بأقساط أقل لم تتحقق على الإطلاق.
- رفض الخصومات الطبية. يعتمد الحد الأدنى لخصومات النفقات الطبية على الدخل الإجمالي المعدل (AGI). ويعني خفض الدخل الإجمالي المعدل زيفاً المطالبة بخصومات لست مؤهلاً للحصول عليها.
- إخفاقات تقارير المقرضين. استحدث قانون OBBBA المادة 6050AA، التي تلزم المقرضين بتقديم إقرارات معلومات لأي قرض يولد $600 أو أكثر من الفوائد المؤهلة. وتغفل أنظمة الذكاء الاصطناعي التي تركز فقط على فائدة المقترض التزام المقرض بتقديم التقارير بشكل روتيني. وتلك فجوة امتثال منهجية بموجب المادتين 6721/6722 من قانون الإيرادات الداخلية (IRC §§ 6721/6722).
لا يرغب مجلس إدارتك في معرفة هذه الأخطاء من خلال إشعار صادر عن مصلحة الضرائب الأمريكية.
ما يحدث فعلياً وراء الكواليس
لفهم سبب استمرار حدوث ذلك، فكر في كيفية عمل نماذج الذكاء الاصطناعي في الواقع. فالنموذج اللغوي الكبير (LLM) لا "يعرف" قانون الضرائب بالطريقة التي يعرفه بها المحاسب القانوني المعتمد (CPA). بل يتنبأ بالكلمة التالية في الجملة بناءً على الأنماط التي استوعبها أثناء التدريب؛ إنه محرك إكمال تلقائي شديد التطور.
إليك هذا التشبيه: تخيل أنك طرحت سؤالاً ضريبياً على غرفة تضم 1,000 شخص. تسعمائة منهم قرأوا نفس المنشور المبسط للغاية على إحدى المدونات، ومائة منهم قرأوا النص القانوني الفعلي. وعندما تصوت الغرفة، تفوز الإجابة الخاطئة بنتيجة 900 إلى 100. هذا بالضبط ما يحدث داخل النموذج اللغوي الكبير (LLM)؛ إذ يمنح النموذج الإجابة الشائعة وزناً أكبر من الإجابة الصحيحة لأنه صادف النسخة الشائعة بعدد مرات أكثر بكثير.
هذا هو نمط الفشل الذي تسميه أبحاث Veriprajna "خطأ الإجماع" (Consensus Error). وإذا كانت مقالات المدونات على الإنترنت خاطئة بنسبة 90% حول فارق دقيق في الضرائب — وهو أمر شائع في التشريعات الجديدة — فإن النموذج محكوم عليه رياضياً بإنتاج الإجابة الخاطئة. ولا يمكن لأي قدر من الهندسة الذكية للمطالبات أن يصحح ذلك؛ فالرياضيات تعمل ضدك.
حتى تقنية التوليد المعزز بالاسترجاع (RAG) — وهي تقنية تزود فيها الذكاء الاصطناعي بوثائق المصدر الفعلية — تقصر عن تحقيق الهدف هنا. في الاختبارات، أعطت النماذج إجابات خاطئة حتى عندما زُوِّدت بالنص الكامل لقانون OBBBA. والسبب؟ ينص القانون على: "تُعدَّل المادة 163(h) بإدراج..." وهو لا يُقرأ مثل مقال في مدونة. ولا يزال يتعين على الذكاء الاصطناعي تفسيره. وعندما تكون أوزانه الداخلية مدربة على ملايين الأمثلة الخاطئة، فإنه يقرأ الوثيقة الصحيحة ويستخلص النتيجة الخاطئة؛ فهو يتصرف كقارئ منحاز يؤكد ما "يعتقده" مسبقاً.
والأسوأ من ذلك أنك لا تستطيع رؤية مسار الاستدلال؛ إذ يوضح لك نظام RAG الوثيقة التي استرجعها، لكنه لا يوضح لك المسار المنطقي من تلك الوثيقة إلى الإجابة. يمكن لفريق الامتثال لديك التحقق من المصدر، ولكن ليس من الاستدلال، وتلك نقطة عمياء وصندوق أسود في الموضع الذي يجب أن يتوفر فيه مسار تدقيقك.
ما ينجح (وما لا ينجح)
لنبدأ بما قد يحاول فريقك تطبيقه بالفعل — ولماذا لا يُعد ذلك كافياً.
هندسة المطالبات: إن توجيه الذكاء الاصطناعي إلى "التفكير خطوة بخطوة" أو "التصرف كمدقق ضرائب أول" لا يضيف قدرات استدلال غير موجودة في النموذج. فهو يعمل وفق الأوزان المنحازة ذاتها بغض النظر عن طريقة صياغتك للسؤال.
نماذج أكبر أو نوافذ سياق أوسع: إن النموذج الأكبر حجماً والمدرب على الإنترنت نفسه يستوعب قدراً أكبر من المحتوى الخاطئ عينه. وزيادة البيانات لا تصحح نسبة المصادر الخاطئة إلى الصحيحة.
خطوط أنابيب RAG القياسية: يساعد تزويد الذكاء الاصطناعي بوثائق رسمية في الاسترجاع، لكن النموذج لا يزال بحاجة إلى الاستدلال بشأن ما يقرأه. يجد البحث المتجه فقرات حول قروض السيارات ولكنه قد لا يسترجع أبداً تعريف الدخل الإجمالي المعدل (AGI) في المادة 62 — لأن تلك المادة لا تذكر قروض السيارات. وفي قانون الضرائب، فإن ما يغفله النص القانوني يماثل في الأهمية ما يتضمنه؛ والبحث المتجه لا يمكنه العثور على الغياب أو الاستبعاد.
أما ما ينجح حقاً فهو البنية العصبية الرمزية (neuro-symbolic) — وهو نظام يفصل بين فهم اللغة والاستدلال القانوني. وإليك كيفية عمله في ثلاث خطوات:
يقرأ الذكاء الاصطناعي مدخلاتك (الطبقة العصبية). تقوم برفع فاتورة أو وثيقة قرض أو كتابة سؤال. يستخرج الذكاء الاصطناعي حقائق مهيكلة: نوع المركبة، وتاريخ الشراء، وموقع التجميع، ومبلغ القرض. وهو يتعامل مع البيانات غير المنظمة في العالم الحقيقي، لكنه لا يبت أبداً فيما إذا كان الخصم صالحاً أم لا.
يطبق محرك المنطق القانون (الطبقة الرمزية). تُمرر الحقائق المهيكلة إلى محرك قواعد مبني على النص القانوني المبرمج والمشفر فعلياً. يستخدم هذا المحرك لغات مثل Catala — المصممة خصيصاً لترجمة التشريعات إلى كود برمجي قابل للتنفيذ — ويجري عمليات تحقق حتمية قطعية. هل جرى تجميع المركبة في الولايات المتحدة؟ هل الدخل أقل من عتبة الإلغاء التدريجي؟ لا تملك هذه الطبقة أي وصول إلى منشورات المدونات؛ فهي تعرف القانون فقط ككود برمجي.
يشرح الذكاء الاصطناعي النتيجة (الطبقة العصبية). يعيد محرك المنطق حكماً قاطعاً: مسموح (ALLOWED) أو مرفوض (DENIED)، مع مرجع القاعدة المحدد. ثم يترجم الذكاء الاصطناعي ذلك إلى شرح واضح وقابل للقراءة لفريقك.
الفارق الجوهري: لا يبت الذكاء الاصطناعي أبداً في المسألة القانونية. بل يترجم اللغة البشرية إلى بيانات مهيكلة، ويترجم مخرجات المنطق مرة أخرى إلى لغة بشرية. أما القانون نفسه فيعمل ككود برمجي حتمي وقاطع.
يمنحك هذا شيئاً لا يستطيع أي روبوت محادثة تقديمه: مسار تدقيق حتمي. فعندما يسأل مدقق حساباتك: "لماذا سمح النظام بهذا الخصم؟"، لا تكون الإجابة "لأن الاحتمالات الإحصائية رجحت ذلك". بل هو مسار قابل للتتبع: التحقق من تاريخ القرض، وتأكيد نوع المركبة، وتأكيد موقع التجميع، والتحقق من أن الدخل أقل من عتبة $100,000، ومرجع القاعدة IRC § 163(h)(4). يمكن تقديم هذا المسار مباشرة إلى فاحص مصلحة الضرائب الأمريكية (IRS) أو لجنة التدقيق الداخلي لديك. وهو يحول ذكاءك الاصطناعي من صندوق أسود إلى ما تطلق عليه الأبحاث اسم "صندوق زجاجي" (Glass Box).
أبرز النقاط
- فشلت نماذج ChatGPT وClaude وGemini جميعها في نفس اختبار الامتثال الضريبي — حيث خلطت بين السطر الذي ينطبق عليه الخصم الجديد في الإقرار الضريبي.
- يعني "خطأ الإجماع" (Consensus Error) أن الذكاء الاصطناعي يتعلم الإجابة الشائعة من المدونات بدلاً من الإجابة الصحيحة من النص القانوني، وتجعل الحسابات الرياضية هذا الأمر حتمياً تقريباً في التشريعات الجديدة.
- لا تحل تقنية RAG (تزويد الذكاء الاصطناعي بالوثائق الصحيحة) المشكلة لأن الذكاء الاصطناعي لا يزال يستدل بأوزان داخلية منحازة مدربة على محتوى خاطئ.
- يفصل النهج العصبي الرمزي فهم اللغة عن المنطق القانوني، بحيث لا يبت الذكاء الاصطناعي أبداً في المسألة القانونية — بل يقوم الكود الحتمي بذلك.
- والنتيجة هي مسار منطقي قابل للتدقيق يمكن لفريق الامتثال تقديمه مباشرة إلى الجهات التنظيمية، مستبدلاً الصندوق الأسود بصندوق زجاجي (Glass Box).
الخلاصة
نماذج الذكاء الاصطناعي القياسية ليست مؤهلة معمارياً للقيام بأعمال الامتثال الضريبي الموثوقة؛ فهي تتعلم من الإنترنت، والإنترنت يخطئ في الفروق الضريبية الدقيقة على نطاق واسع. ولا يكمن الحل في صياغة مطالبات أفضل — بل في نظام يشغل القانون ككود برمجي وينتج مسار تدقيق منطقي يمكن التحقق منه لكل إجابة. اسأل مورد الذكاء الاصطناعي لديك: عندما يصنف نظامك خصماً على أنه فوق الخط مقابل تحت الخط، هل يمكنه أن يوضح لمدققي الحسابات لديّ المسار المنطقي القانوني الدقيق الذي اتبعه؟