שכבת הממשל שמעל הצ'אטבוט הממשלתי
תשובה שגויה בדומיין .gov של עיר נושאת את חותם העיר. CivicCite משחרר תשובה לאזרח רק כשהיא נושאת חוק שקיים, בתוקף, שהטענה נגזרת מהטקסט המצוטט, ונקי מקונפליקט. אחרת הוא נמנע, מעביר למחלקה הנכונה, ומתעד רשומה. הסוכנים מייעצים; השער מחליט.
0 / 12
תשובות ששוחררו ללא בסיס סטטוטורי מאומת ובתוקף
יעד על סט הזהב הקבוע של 12 שאילתות
100%
כיסוי רשומת החלטה סטטוטורית
רשומה אחת הניתנת-להגשה לכל שאילתה, שחרור או סירוב
4
תנאי השער, כולם נדרשים לשחרור
קיים, בתוקף, נגזר, נקי מקונפליקט
זו הדגמה ניתנת-להרצה על קורפוס סינתטי-אך-נאמן של 12 הוראות בקוד עירוני. קליטת הקוד העירוני ומחבר ההסלמה ל-311 מדומים; השער הדטרמיניסטי והרשומה פועלים בדיוק כפי שמוצג. אינו ייעוץ משפטי.
מצב הכשל ש-CivicCite נבנה לסגור.
צ'אטבוטים ממשלתיים נותנים לאזרחים תשובות משפטיות בטוחות-בעצמן שהן שגויות, וכל תשובה שגויה נושאת את חותם העיר. הבוט MyCity של NYC, שהושק באוקטובר 2023, תועד על ידי The Markup (מרץ 2024) כאומר לבעלי דירות שהם יכולים לסרב לשוברים של Section 8, לעסקים שהם יכולים לפעול ללא מזומן, ולמעסיקים שהם יכולים לכייס טיפים של עובדים. כל אחת מהתשובות האלה הייתה בלתי חוקית.
הוספת אחזור אינה מתקנת זאת. חוקרים מ-Stanford ומ-JELS (Magesh et al., 2025) מדדו את Lexis+ AI ב-17 אחוזים ואת Westlaw AI-Assisted Research ב-33 אחוזים הזיה. אחזור שולף את החוק; הגנרציה עדיין קוראת אותו לא נכון או דורסת אותו. המקרה המסוכן אינו ציטוט מומצא. זהו החוק הנכון שצוטט עם מסקנה שגויה, או הוראה שבוטלה שצוטטה כאילו היא עדיין חיה.
החשיפה אמיתית וגדלה. יש 78 הצעות חוק על צ'אטבוטים ב-27 מדינות ב-2026, ה-S7263 של ניו יורק הגיע לרצפת הסנאט ב-26 בפברואר 2026, וחובות הסיכון הגבוה של EU AI Act Annex III הופכות לאכיפות ב-2 באוגוסט 2026 עם קנסות של עד 15 מיליון אירו או 3 אחוזים מהמחזור. ייעוץ משפטי ממשלתי יושב באזור הפונקציה-הקניינית, כך שאין מגן חסינות ריבונית. הדרישה העמידה אינה מודל טוב יותר. זו הוכחה, לרגולטור, שכל תשובה ששוחררה מתחקה לחוק חי.
סוכני LLM מייעצים. קוד דטרמיניסטי מחוץ למסגרת הסוכנים מחליט מה משוחרר. LLM אינו יכול להצביע את עצמו מעבר לשער.
כל שאילתת אזרח רצה משמאל לימין: Decompose, אחר כך Retrieve, אחר כך Draft, אחר כך Verify, אחר כך השער, אחר כך הרשומה. Decompose (LLM, ייעוצי) מפצל את השאילתה לתת-שאלות משפטיות אטומיות. Retrieve (דטרמיניסטי, ללא LLM) צועד בגרף-ידע מאוצר של הקוד העירוני עם חיפוש לקסיקלי וסריקה היררכית של הפניות-צולבות, וכל מועמד נושא את מזהה הציטוט שלו, הטקסט, תאריך התוקף, תאריך הביטול, העונש, והסוכנות. Draft (LLM, מרוסן) מציע טענה בתוספת ציטוט שנשאב רק מהסט שאוחזר, נאכף על ידי מאמת רשימת-היתר ושאילה-חוזרת אחת.
Verify מריץ שלוש בדיקות לכל טענה שנוסחה, והשער משלב אותן עם תנאי שהציטוט-קיים. הוא משחרר תת-תשובה רק כאשר כל הארבע מתקיימות.
מזהה הציטוט שצוין מתייחס להוראה אמיתית בגרף הקוד העירוני. תשובה שנוסחה אינה יכולה להמציא מספר סעיף שאינו בסט שאוחזר.
דטרמיניסטי: להוראה אין תאריך ביטול ויש לה תאריך תוקף ב-as-of או לפניו. הוראה שבוטלה או שעדיין אינה בתוקף לעולם אינה יכולה לגבות תשובה ששוחררה.
בדיקת LLM ייעוצית: האם הטקסט המצוטט באמת תומך בטענה, ומחזירה entailed, contradicted, או neutral? זה תופס את החוק הנכון שצוטט עם מסקנה שגויה.
דטרמיניסטי: הוא קורא קשתות conflicts-with בגרף, בלתי תלוי בפסק ה-entailment, כך ששתי הוראות הסותרות זו את זו אינן מייצרות בשקט תשובה ששוחררה.
שער ההחלטה הסטטוטורי הוא Python דטרמיניסטי שחי מחוץ למסגרת הסוכנים. הוא משחרר תת-תשובה רק אם הציטוט קיים וההוראה בתוקף והטענה נגזרת מהטקסט המצוטט ואין קונפליקט. אחרת הוא מחזיק את תת-התשובה, מסמן אותה מחוץ לכיסוי מאומת, ומנתב אותה למחלקה הנכונה. לכל שאילתה הוא מצטבר לאחת משלוש הכרעות: RELEASED, PARTIAL, או REFUSED and ESCALATED.
לכל שאילתה, שחרור או סירוב, כותב דטרמיניסטי מפיק רשומת החלטה סטטוטורית: תת-השאלות, ארבע הבדיקות ופסקיהן, הציטוט, ההכרעה, ויעד ההסלמה כאשר משהו הוחזק. זהו הארטיפקט שמחלקת משפטים ורגולטור יכולים לפעול לפיו, וזו הסיבה שהמדד העמיד הוא אי-שחרור בר-הוכחה, לא שיעור הזיה.
עדכניות as-of 2026-06-17. כל תמונה למטה היא צילום מסך של האפליקציה הפועלת.
בעל דירה שואל האם הם יכולים לסרב לשוכר שישלם שכר דירה בשובר Section 8. העוזר הסטנדרטי שולח את ה-"כן" הבטוח והבלתי חוקי. גם CivicCite מנסח "כן", אך בדיקת ה-entailment קוראת אותו כ-contradicted על ידי NYC Admin. Code section 8-107(5), שהופך אפליה על בסיס מקור-הכנסה לבלתי חוקית (NYC Commission on Human Rights, קנסות אזרחיים עד 250,000 דולר להפרות במזיד). השער חוסם את הטיוטה ומשחרר במקום זאת את ה-"לא" הנכון הנתמך-בציטוט, מסומן כמאומת, נגזר ובתוקף. הפאנל השמאלי הוא צ'אטבוט אחזור פשוט ללא שער אימות; הפאנל הימני הוא CivicCite שמריץ את הצינור המלא.
כל שלב ניתן ללחיצה לקלט ולפלט הגולמיים שלו. שלב ה-Verify מציג את הטענה שנוסחה ואת מזהה הציטוט הנכנסים, ואת פסק ה-entailment היוצא: entailed, עם הסיבה שמצטטת את שפת ההוראה המדויקת על סירוב להשכיר בגלל מקור הכנסה חוקי הכולל שוברים של דיור Section 8. זו הבדיקה שמפרידה בין החוק הנכון שצוטט עם המסקנה הנכונה לבין החוק הנכון שצוטט עם המסקנה השגויה.
מפעיל משאית-מזון שואל על חניה כל היום במקום חניה ממד תחת כלל חניית הרוכלים הכללי. ההוראה היחידה שהייתה מתייחסת לכך בוטלה, ואין הוראה בתוקף כעת ששולטת בשאלה. בדיקת העדכניות נכשלת, ולכן CivicCite אינו מסנתז תשובה. הוא מחזיק, מנתב את השאלה לקליטה כללית של NYC 311 עם הממצאים החלקיים מצורפים, ומחזיר את ההכרעה REFUSED and ESCALATED. הימנעות כנה מנצחת תשובה שגויה בביטחון.
כל שאילתה, שחרור או סירוב, מפיקה רשומת החלטה סטטוטורית. היא לוכדת את תת-השאלה, את התחום שלה, את הטענה שנוסחה ואת הציטוט, את ארבע הבדיקות עם פסקיהן הבוליאניים, את ההחלטה, את תווית ה-entailment, וכל סיבת החזקה או יעד הסלמה. היא גם נוקבת בסטנדרטים שהיא ממפה אליהם, ממשל NIST AI RMF ורישום מדידה וניטור רציף של FedRAMP ו-StateRAMP, ככיוון יישור ולא כהסמכה.
הקורפוס הוא 12 הוראות על פני 7 כותרים, עדכניות as-of 2026-06-17. צמתי בתוקף ירוקים, צומת אחד שבוטל במכוון אדום ומקווקו, וקשתות הפניה-צולבת מוצגות כך שסריקת האחזור נראית. בהרצה על סט הזהב הקבוע של 12 שאילתות (ארבעת כשלי MyCity המתועדים, מקרה משאית-מזון רב-תחומי, מלכודת שבוטל-בלבד, ומלכודת ללא-כיסוי), האפליקציה מדווחת 0 מתוך 12 תשובות ששוחררו ללא בסיס סטטוטורי מאומת ובתוקף, 100 אחוז כיסוי רשומת-ביקורת, ו-100 אחוז הסכמת הכרעה עם אמת-היסוד המסומנת. אנו מייחסים את הנתונים האלה לסט הזהב המסומן הזה, לעולם לא כהבטחה לעולם-פתוח.
אותו מסך מפוצל שההדגמה משווה מולו, זה לצד זה.
| ממד | צ'אטבוט סטנדרטי (ארכיטקטורת MyCity) | שער ההחלטה הסטטוטורי של CivicCite |
|---|---|---|
| מי מחליט מה משוחרר | ה-LLM שולח את מה שנוסח | שער Python דטרמיניסטי מחוץ לסוכנים |
| חוק נכון, מסקנה שגויה | נשלח בשלמותו | נתפס על ידי בדיקת ה-entailment |
| הוראה שבוטלה שצוטטה | נשלח בשלמותו | נתפס על ידי בדיקת העדכניות |
| אין חוק שמכסה את השאלה | מסנתז תשובה בכל זאת | נמנע ומסלים למחלקה |
| נתיב ביקורת | אין | רשומת החלטה סטטוטורית לכל שאילתה |
| אי-שחרור בר-הוכחה | לא נמדד | 0 מתוך 12 על סט הזהב המסומן |
לא. CivicCite אינו צ'אטבוט ואינו מנוע חיפוש בקוד עירוני. זו שכבת ממשל שיושבת מעל פלטפורמת הצ'אטבוט, החלק שאין לשירותי ה-AI בענן ולספקי ה-GovTech. שער Python דטרמיניסטי מחוץ למסגרת הסוכנים משחרר תשובה לאזרח רק כאשר הציטוט שלה קיים, בתוקף, הטענה נגזרת מהטקסט המצוטט, והוא נקי מקונפליקט. הצ'אטבוט בהדגמה הוא אביזר סינתטי; השער הוא המוצר.
ה-LLM רק מייעץ. הוא מפרק את השאלה ומנסח טענה עם ציטוט שנשאב רק מהסט שאוחזר. אחר כך קוד דטרמיניסטי בודק שהחוק שצוטט קיים, בתוקף נכון לתאריך התוקף, שהטענה נגזרת מהטקסט המצוטט, ואינו נושא קונפליקט, והשער משחרר רק אם כל הארבע מתקיימות. בשאילתת שובר Section 8 האמיתית של MyCity, ה-"כן" שנוסח נתפס על ידי בדיקת ה-entailment כ-contradicted על ידי NYC Admin. Code section 8-107(5), והשער משחרר במקום זאת את ה-"לא" הנכון הנתמך-בציטוט.
אחזור משפר את הטיוטה, אך אינו יכול להוכיח שהתשובה בטוחה לשחרור. חוקרים מ-Stanford ומ-JELS (Magesh et al., 2025) מדדו AI משפטי מגובה-אחזור שעדיין מזייה, ב-17 אחוזים עבור Lexis+ AI ו-33 אחוזים עבור Westlaw AI-Assisted Research. גם עם מודל מושלם, ממשלה חייבת להוכיח לרגולטור שכל תשובה ששוחררה מתחקה לחוק חי. ההוכחה הזו היא תכונה של שער דטרמיניסטי ורשומה הניתנת-להגשה, לא של כותב חזק יותר.
כל שאילתה מפיקה רשומת החלטה סטטוטורית, שחרור או סירוב, כך שכיסוי הביקורת על סט הזהב הוא 100 אחוז. כל רשומה לוכדת את תת-השאלות, ארבע הבדיקות עם פסקיהן, הציטוט, ההכרעה, ולאן הוסלם חלק שלא נענה. הכותרת שרגולטור יכול לפעול לפיה אינה אחוז הזיה. זה שתשובות ששוחררו ללא בסיס סטטוטורי מאומת ובתוקף יכולות להיות מוצגות כאפס, מגובות ברשומה לכל אינטראקציה.
זה אינו מוסמך, ואיננו טוענים שכן. המסגור הרגולטורי הוא יישור וכיוון, לא הסמכה. רשומת ההחלטה הסטטוטורית מתוכננת למפות לתיעוד NIST AI RMF ולרישום ניטור-רציף של FedRAMP ו-StateRAMP, כך שהארטיפקט שצוות ציות צריך מיוצר כברירת מחדל. גבול ההרשאה של FedRAMP או StateRAMP נורש מסביבת האירוח והוא מחוץ להיקף של הדגמה מקומית.
זו הדגמה ניתנת-להרצה שמוכיחה את המנגנון, לא פריסה, ואינה ייעוץ משפטי. הקורפוס הוא גרף הדגמה סינתטי-אך-נאמן של 12 הוראות: הטקסט האופרטיבי מפורפרז מהוראות אמיתיות שמפנים אליהן ב-NYC Administrative Code, ב-NY Labor Law וב-NYC Health Code, עם תוויות, סוכנויות, עונשים ותאריכים ריאליסטיים. קליטת הקוד העירוני ומחבר ההסלמה ל-311 מדומים; הבדיקות הדטרמיניסטיות, השער והרשומה פועלים בדיוק כפי שמוצג.
המחקר מאחורי ההדגמה הזו — הארכיטקטורה, עיצוב האימות, והבלופרינט הארגוני.
ההוכחה שכל תשובה מתחקה לחוק חי היא החלק הקשה. אנחנו בונים אותה.
אם הסוכנות שלכם שוקלת איך לתת לאזרחים תשובות AI בלי לשלוח תשובה שגויה תחת שם העיר, נשמח באמת לשמוע איך אתם ומחלקת המשפטים שלכם חושבים על זה. הבעיה מתפשטת בין מדינות, וגם התשובות יתפשטו.