למנהלי כספים (CFO)4 דק׳ קריאה

האם ניתן לתת אמון בבינה מלאכותית לצורך ציות בדיני מס? עדיין לא.

מודלי AI מובילים נכשלו בכל מבחן ציות מס שהרצנו — ורשות המסים האמריקאית אינה מעגלת פינות.

הבעיה

כאשר Veriprajna ביצעה ביקורת על ChatGPT, Claude ו-Gemini בשאלה ספציפית בדיני מס בנוגע לניכוי הריבית החדש על הלוואות רכב, כל אחד מהמודלים טעה. לא בחלק מהמקרים, אלא בכל פעם מחדש. כל בינה מלאכותית אמרה למשתמשים בביטחון מלא כי הניכוי החדש במסגרת חוק One Big Beautiful Bill Act (OBBBA) יקטין את ההכנסה ברוטו המתואמת שלהם (AGI). תשובה זו שגויה מבחינה משפטית. הניכוי מקטין את ההכנסה החייבת במס (Taxable Income), ולא את ה-AGI. אלה שני מושגים שונים לחלוטין בקוד המס.

לא היה זה כשל מקרי, אלא כשלון צפוי מראש המוטמע באופן שבו מערכות AI אלו לומדות. הן קראו אלפי פוסטים בבלוגים ומאמרים מותאמים למנועי חיפוש (SEO) שפישטו את החוק יתר על המידה. לשון החוק בפועל הופיעה אולי פעם או פעמיים בנתוני האימון שלהן, בעוד שהבלוגים הופיעו אלפי פעמים. לפיכך, הבינה המלאכותית למדה את הגרסה הפופולרית — והשגויה — של הכלל.

המסמך הטכני מכנה זאת "שגיאת קונצנזוס" (Consensus Error). אין זה אומר שלבינה המלאכותית חסר מידע, אלא שהיא בחרה בתשובת ההמון על פני תשובת החוק. כאשר צוות הכספים שלכם מסתמך על אותה בינה מלאכותית, החברה שלכם יורשת את טעות ההמון. ורשות המסים האמריקאית (IRS) אינה מקבלת את הטענה "כנראה נכון" כקו הגנה.

מדוע זה חשוב לעסק שלכם

אין זו בעיית AI מופשטת. היא פוגעת ישירות בשורת הרווח שלכם, בחשיפה שלכם לביקורת ובהתחייבויות הציות שלכם.

תקרת ניכוי הלוואות הרכב במסגרת OBBBA עומדת על $10,000 בשנה ומבוטלת בהדרגה ברמות הכנסה מסוימות. הניכוי פוחת ב-$200 על כל $1,000 שמגיש דוח יחיד מרוויח מעל $100,000, ונעלם לחלוטין ב-$150,000. עבור מגישי דוחות משותפים, הביטול ההדרגתי מתחיל ב-$200,000 ומסתיים ב-$250,000. כאשר ה-AI טועה בהבחנה שבין AGI לבין הכנסה חייבת במס, הנזק המשני מתפשט בשרשרת:

  • תת-תשלום של מס פדרלי. אם המערכות שלכם יסווגו זאת כניכוי מעל הקו (above-the-line deduction), תדווחו על AGI נמוך יותר ממה שרשות המסים (IRS) מצפה. זוהי דרך ישירה לקנסות ועיצומים.
  • סיכון לביקורת ברמת המדינה. מדינות כמו אריזונה מצמידות את חישובי המס שלהן ל-AGI הפדרלי. AGI שגוי פירושו מסי מדינה שגויים בכל מדינה המוצמדת ל-AGI.
  • שגיאות בפרמיות ביטוח הבריאות (Medicare). גמלאים המסתמכים על ייעוץ AI עלולים לעמוד בפני תוספות IRMAA בלתי צפויות, משום שה-AI הבטיחה פרמיות נמוכות יותר שאינן מתממשות בפועל.
  • פסילת ניכויי הוצאות רפואיות. סף הזכאות לניכויי הוצאות רפואיות תלוי ב-AGI. הפחתה שגויה של ה-AGI גורמת לתביעת ניכויים שאינכם זכאים להם.
  • כשלי דיווח של מלווים. חוק OBBBA יצר את סעיף 6050AA, המחייב מלווים להגיש דוחות מידע עבור כל הלוואה המניבה $600 או יותר בריבית מזכה. מערכות AI המתמקדות אך ורק בהטבת הלווה מחמיצות באופן שגרתי את חובת הדיווח של המלווה. זהו פער ציות שיטתי לפי סעיפי IRC §§ 6721/6722.

הדירקטוריון שלכם אינו מעוניין ללמוד על שגיאות אלו מתוך הודעה של ה-IRS.

מה באמת קורה מתחת למכסה המנוע

כדי להבין מדוע הדבר ממשיך להתרחש, חשבו על האופן שבו מודלי AI פועלים באמת. מודל שפה גדול (LLM) אינו "יודע" את דיני המס כפי שרואה החשבון המוסמך (CPA) שלכם יודע. הוא חוזה את המילה הבאה במשפט על בסיס דפוסים שקלט במהלך האימון; זהו מנוע השלמה אוטומטית מתוחכם ביותר.

הנה האנלוגיה: תארו לעצמכם שאתם מציגים שאלת מס בפני חדר ובו 1,000 אנשים. תשע מאות מהם קראו את אותו פוסט בלוג פשטני. מאה מהם קראו בפועל את לשון החוק. כאשר החדר מצביע, התשובה השגויה מנצחת ברוב של 900 מול 100. זה בדיוק מה שקורה בתוך LLM. המודל מעניק משקל כבד יותר לתשובה הפופולרית מאשר לתשובה הנכונה משום שהוא נתקל בגרסה הפופולרית בתדירות גבוהה בהרבה.

זהו דפוס הכשל שמחקרה של Veriprajna מכנה "שגיאת קונצנזוס" (Consensus Error). אם עולם הבלוגים שוגה ב-90% מהמקרים לגבי דקויות מס ספציפיות — תופעה נפוצה בחקיקה חדשה — המודל נידון מתמטית לייצר את התשובה השגויה. שום הנדסת פרומפטים מתוחכמת לא תתקן זאת; המתמטיקה פועלת נגדכם.

אפילו יצירה מועשרת באחזור (RAG) — טכניקה שבה מזינים ל-AI את מסמכי המקור בפועל — אינה מספקת כאן פתרון. בבדיקות, מודלים שקיבלו את הטקסט המלא של ה-OBBBA עדיין הפיקו תשובה שגויה. מדוע? החוק מציין: "סעיף 163(h) מתוקן על ידי הוספת..." הוא אינו נקרא כמו פוסט בבלוג. ה-AI עדיין נדרשת לפרש אותו. וכאשר המשקולות הפנימיות שלה אומנו על מיליוני דוגמאות שגויות, היא קוראת את המסמך הנכון ומסיקה את המסקנה השגויה; היא פועלת כקוראת מוטה, המאששת את מה שהיא כבר "מאמינה" בו.

גרוע מכך, אינכם יכולים לראות את מהלך ההסקה. מערכת RAG מראה לכם איזה מסמך היא אחזרה, אך אינה מציגה את הנתיב הלוגי מאותו מסמך אל התשובה. צוות הציות שלכם יכול לאמת את המקור, אך לא את ההסקה הלוגית. זוהי קופסה שחורה במקום שבו אמור להימצא שובל הביקורת שלכם.

מה עובד (ומה לא)

נתחיל במה שהצוות שלכם עשוי כבר לנסות — ומדוע אין בכך די.

הנדסת פרומפטים: ההנחיה ל-AI "לחשוב צעד-אחר-צעד" או "לפעול כמבקר מס בכיר" אינה מוסיפה יכולות הסקה שאינן קיימות במודל. הוא פועל במסגרת אותן משקולות מוטות, ללא קשר לאופן שבו תנסחו את השאלה.

מודלים גדולים יותר או חלונות הקשר רחבים יותר: מודל גדול יותר שאומן על אותו אינטרנט קולט יותר מאותו תוכן שגוי. תוספת נתונים אינה מתקנת את היחס שבין מקורות שגויים לנכונים.

צינורות RAG סטנדרטיים: הזנת מסמכים רשמיים ל-AI מסייעת באחזור, אך המודל עדיין נדרש להסיק מסקנות לגבי מה שהוא קורא. חיפוש וקטורי מוצא פסקאות על הלוואות רכב, אך עשוי שלא לאחזר לעולם את הגדרת ה-AGI בסעיף 62 — משום שאותו סעיף אינו מזכיר הלוואות רכב. בדיני מס, מה שהחוק משמיט חשוב באותה מידה כמו מה שהוא כולל; וחיפוש וקטורי אינו מסוגל למצוא היעדרות או אי-קיום של הוראה.

מה שבאמת עובד הוא ארכיטקטורה נוירו-סימבולית (neuro-symbolic) — מערכת המפרידה בין הבנת שפה לבין הסקה משפטית. הנה כיצד היא פועלת בשלושה שלבים:

  1. ה-AI קוראת את הקלט שלכם (השכבה הנוירונלית). אתם מעלים חשבונית, מסמך הלוואה או מקלידים שאלה. ה-AI מחלצת עובדות מובנות: סוג הרכב, תאריך הרכישה, מיקום ההרכבה וסכום ההלוואה. היא מטפלת בנתונים הבלתי מובנים מהעולם האמיתי, אך לעולם אינה מכריעה בשאלה האם הניכוי תקף.

  2. מנוע לוגי מיישם את החוק (השכבה הסימבולית). העובדות המובנות מועברות למנוע חוקים הבנוי על גבי לשון החוק המקודדת בפועל. מנוע זה משתמש בשפות כמו Catala — שתוכננה במיוחד לתרגום חקיקה לקוד בר-ביצוע — ומריץ בדיקות דטרמיניסטיות. האם הרכב הורכב בארה"ב? האם ההכנסה נמוכה מסף הביטול ההדרגתי? לשכבה זו אין כל גישה לפוסטים בבלוגים; היא מכירה אך ורק את החוק כקוד.

  3. ה-AI מסבירה את התוצאה (השכבה הנוירונלית). מנוע הלוגיקה מחזיר פסק דין: מאושר (ALLOWED) או נדחה (DENIED), בצירוף הפניה לכלל הספציפי. לאחר מכן, ה-AI מתרגמת זאת להסבר ברור וקריא עבור הצוות שלכם.

ההבדל המכריע: ה-AI לעולם אינה מכריעה בשאלה המשפטית. היא מתרגמת שפה אנושית לנתונים מובנים ומתרגמת את פלטי הלוגיקה בחזרה לשפה אנושית. החוק עצמו פועל כקוד דטרמיניסטי מובהק.

זה מעניק לכם משהו שאף צ'אטבוט אינו יכול לספק: שובל ביקורת דטרמיניסטי. כאשר המבקר שלכם שואל "מדוע המערכת אישרה את הניכוי הזה?", התשובה אינה "כי ההסתברות אמרה כך". זהו נתיב שניתן להתחקות אחריו: תאריך ההלוואה אומת, סוג הרכב אושר, מיקום ההרכבה אושר, הכנסה מתחת לסף $100,000 אומתה, הפניה לכלל IRC § 163(h)(4). שובל זה יכול לעבור ישירות לבוחן של ה-IRS או לוועדת הביקורת הפנימית שלכם. הוא הופך את הבינה המלאכותית שלכם מקופסה שחורה למה שהמחקר מכנה "קופסה שקופה" (Glass Box).

נקודות מפתח

  • ChatGPT, Claude ו-Gemini נכשלו כולם באותו מבחן ציות מס — כאשר התבלבלו בשאלה לאיזו שורה בדוח המס שייך הניכוי החדש.
  • "שגיאת קונצנזוס" (Consensus Error) פירושה שה-AI לומדת את התשובה הפופולרית מבלוגים במקום את התשובה הנכונה מלשון החוק, והמתמטיקה הופכת זאת לבלתי נמנע כמעט בחקיקה חדשה.
  • טכניקת RAG (הזנת המסמכים הנכונים ל-AI) אינה פותרת את הבעיה משום שה-AI עדיין מסיקה מסקנות באמצעות משקולות פנימיות מוטות שאומנו על תוכן שגוי.
  • גישה נוירו-סימבולית מפרידה בין הבנת שפה לבין לוגיקה משפטית, כך שה-AI לעולם אינה מכריעה בשאלה המשפטית — קוד דטרמיניסטי עושה זאת.
  • התוצאה היא שובל לוגי בר-ביקורת שצוות הציות שלכם יכול להגיש ישירות לרגולטורים, המחליף את הקופסה השחורה בקופסה שקופה (Glass Box).

שורה תחתונה

מודלי AI סטנדרטיים אינם מסוגלים מבחינה ארכיטקטונית לבצע עבודת ציות מס אמינה. הם לומדים מהאינטרנט, והאינטרנט שוגה בדקויות מס בהיקף נרחב. הפתרון אינו פרומפטים טובים יותר — אלא מערכת המריצה את החוק כקוד ומייצרת שובל לוגי בר-ביקורת לכל תשובה. שאלו את ספק ה-AI שלכם: כאשר המערכת שלכם מסווגת ניכוי כמעל הקו לעומת מתחת לקו, האם היא יכולה להציג למבקרים שלי את נתיב הלוגיקה החוקית המדויק שבו הלכה?

שאלות נפוצות

שאלות נפוצות

מדוע ChatGPT טועה בשאלות מס?

ChatGPT ומודלי AI אחרים לומדים מהאינטרנט, שבו פוסטים בבלוגים ומאמרים נוטים לפשט את דיני המס יתר על המידה. כאשר אלפי בלוגים מציינים כלל באופן שגוי ולשון החוק בפועל מופיעה פעמים ספורות בלבד בנתוני האימון, ה-AI לומדת את הגרסה השגויה. תופעה זו מכונה "שגיאת קונצנזוס" (Consensus Error) — התשובה הפופולרית גוברת על התשובה הנכונה משפטית.

האם RAG יכול לתקן הזיות AI בציות מס?

יצירה מועשרת באחזור (RAG) מזינה ל-AI את מסמכי המקור הנכונים, אך היא פותרת רק את בעיית האחזור — ולא את ההסקה. בבדיקות, מודלי AI שקיבלו את הנוסח המלא של חקיקת המס עדיין הפיקו תשובות שגויות מכיוון שהמשקולות הפנימיות שלהם, שאומנו על מיליוני דוגמאות שגויות, היטו את אופן פירוש המסמך הנכון. בנוסף, RAG אינו מסוגל לאתר את מה שהחוק משמיט, דבר שהוא קריטי בדיני מס.

מהי בינה מלאכותית נוירו-סימבולית לתחום הפיננסי?

בינה מלאכותית נוירו-סימבולית משלבת את הבנת השפה של AI מודרני עם מנועי לוגיקה דטרמיניסטיים המריצים את החוק כקוד. ה-AI מטפלת בקלטים בלתי מובנים כמו חשבוניות ושאלות, מחלצת עובדות מובנות, ומעבירה אותן למנוע חוקים המיישם את לשון החוק בפועל. ה-AI מסבירה את התוצאה אך לעולם אינה מכריעה בשאלה המשפטית, ובכך מייצרת שובל ביקורת מלא לכל תשובה.

בנו את ה-AI שלכם בביטחון.

שותפו עם צוות בעל ניסיון עמוק בבניית הדור הבא של AI ארגוני. אנו נסייע לכם לתכנן, לבנות ולהטמיע אסטרטגיית AI שתוכלו לסמוך עליה.

Veriprajna ייעוץ דיפ-טק מתמחה בבניית מערכות AI קריטיות לבטיחות עבור תחומי הבריאות, הפיננסים והרגולציה. הארכיטקטורות שלנו מאומתות מול פרוטוקולים מבוססים ומלוות בתיעוד ציות מקיף.