Perché un modello migliore non renderà le memorie legali AI sicure da depositare, e cosa ho imparato costruendo uno strato di verifica la cui migliore funzione è l'astensione onesta.
Legal TechArtificial IntelligenceAI Governance

I casi erano reali. Non potevo comunque lasciare che l'AI li garantisse.

Ashutosh SinghalAshutosh Singhal20 giugno 202615 min

La prima volta che ho visto il mio stesso strumento rifiutarsi di benedire tre casi reali della Corte Suprema, ero sicuro che fosse rotto.

Stavo eseguendo una memoria di esempio che avevo etichettato «Precedente travisato». Citava Erie Railroad v. Tompkins, 304 U.S. 64, per l'esistenza di un corpo uniforme di common law federale, il che è quasi l'opposto di ciò che Erie aveva effettivamente stabilito. Si appoggiava a Celotex Corp. v. Catrett, 477 U.S. 317, e Baker v. Carr, 369 U.S. 186, per proposizioni che le opinioni non sostengono. Ognuno di quei casi è reale. Mi aspettavo che il mio controllo di supporto li accendesse di rosso, li marchiasse Non supportato, e chiudesse la questione. Invece tutti e tre tornarono con un verdetto più sobrio: Da revisionare. Il mio primo istinto fu che il modello linguistico avesse fallito la parte facile.

Mi ci volle una serata imbarazzantemente lunga per capire che l'istinto era il bug, ed era in me, non nel sistema.

Console di attività live di CiteGuard che mostra le fasi della pipeline deterministica che si accendono, con la citazione Erie Railroad instradata a Da revisionare e la nota che il modello consiglia mentre il gate deterministico e un umano decidono.
La memoria Precedente travisato a metà esecuzione. La console mostra le fasi (estrazione, ancoraggio alla giurisprudenza, controllo di supporto, gate di policy, certificato) e il controllo di supporto su Erie che instrada a Da revisionare con la riga «il modello consiglia, il gate deterministico più l'umano decidono». Non ha bluffato un verdetto rosso su un caso reale che non poteva smentire dal testo dell'opinione.

Un «Non supportato» stampato con sicurezza su un travisamento sottile di Erie sarebbe stato un bluff. L'opinione è lunga, l'uso scorretto è questione di giudizio giuridico, e il modello non può stabilire il negativo da un estratto con la certezza che un verdetto rosso implica. La mossa onesta, quella che avevo costruito accidentalmente e poi quasi eliminato nel codice per frustrazione, era instradarla a un umano con il contesto contraddittorio allegato. L'astensione non era il fallimento. L'astensione era il senso di tutto. Se volete vederla decidere di persona, vive qui: veriprajna.com/it/demos/verifica-e-governance-delle-citazioni-nell-ai-legale.

Questo è un saggio sull'assunzione da cui sono partito, che quasi tutti coloro che costruiscono AI legale in questo momento condividono, e sul modo lento e specifico in cui costruire la demo l'ha smontata. L'assunzione è che il problema delle allucinazioni si risolva con un modello migliore. Non ci credo più, e non perché dubiti che i modelli migliorino.

La settimana in cui ho cercato di far sorvegliare un modello da un altro

Ho passato circa una settimana a cercare di far sì che un modello linguistico fosse il giudice affidabile di un altro modello linguistico, e voglio essere onesto: non ha funzionato.

L'impostazione sembrava ragionevole. Un modello redige una memoria, da Harvey o Lexis Protégé o da un modello open-source, non importa quale. Poi un secondo modello legge ogni citazione rispetto al caso a cui punta e decide se l'opinione sostiene la tesi. Due modelli, un controllo ordinato, il tipo di architettura che sopravvive a una design review. Mi aspettavo davvero che il passo del giudizio fosse la parte facile. È stata la parte che non stava ferma.

Il fallimento non era rumoroso, ed è proprio questo che lo rendeva pericoloso. Facevo passare la stessa memoria nel controllo di supporto tre volte e ottenevo due «Da revisionare» e un via libera sicuro, senza alcun cambiamento all'input. Sulla Bell Atlantic Corp. v. Twombly citazione, 550 U.S. 544, un caso reale, il modello a volte decideva che l'opinione stabiliva nettamente la proposizione citata e a volte decideva che non proprio. Entrambe le letture erano difendibili. Quello era esattamente il problema. Un giudizio che non puoi riprodurre non è un giudizio. È una seconda opinione che indossa una toga.

Chiedevo a un sistema probabilistico di essere il gate deterministico su un altro sistema probabilistico, e chiamavo il risultato verifica.

Quella non è verifica. Quello equivale a due modelli che concordano — una cosa più debole e molto più instabile. Se il motivo per cui serve un controllo è che l'output del primo modello non può essere preso per buono a prima vista, l'output del secondo modello non può essere ciò di cui ti fidi per controllarlo. Avevo costruito una sala degli specchi e stavo per metterci sopra un adesivo di conformità. Il tribunale dall'altra parte non si cura di quanto fossero sicuri l'uno o l'altro modello. Si cura se il caso esiste e se dice ciò che hai affermato. Quelle sono due domande, e le avevo trattate come una sola.

Cos'è più pericoloso, un caso fabbricato o uno reale usato male?

Ciò che mi ha sorpreso mentre costruivo questo è stato capire che i due fallimenti richiedono macchinari completamente diversi, e l'industria per lo più ne commercializza soprattutto uno.

Una citazione fabbricata è, stranamente, il fallimento amichevole. Halstead v. Ferngate Holdings, 823 U.S. 1199, compare in una delle memorie di esempio, citata con totale scioltezza per la proposizione che i danni punitivi sono categoricamente preclusi. Non esiste. Gli United States Reports non hanno un volume 823. Puoi provarlo con certezza, non chiedendo a un modello cosa ne pensa, ma interrogando la giurisprudenza reale e ottenendo un lookup a zero risultati. Quella è aritmetica contro un'autorità, non giudizio. È il tipo di cosa che il codice dovrebbe decidere, e decidere sempre allo stesso modo.

Tabellone di verifica CiteGuard per la memoria Mixed Motion che mostra una citazione Verificata, una Fabbricata e due da revisionare, tra cui Miranda verificata in verde, il fabbricato 823 U.S. 1199 intercettato in rosso, e Brown v. Board segnato fuori copertura.
Una memoria, quattro esiti onesti uno accanto all'altro. Miranda v. Arizona, 384 U.S. 436, passa al verde perché il testo dell'opinione stabilisce la sua statuizione. Halstead, 823 U.S. 1199, è intercettato in rosso come fabbricato da un lookup live a zero risultati. Brown v. Board, 347 U.S. 483, è un caso reale non nel sottoinsieme in cache, quindi è segnato Fuori copertura anziché falsamente verificato. Il gate legge Non depositare.

Il fallimento pericoloso è il caso reale citato per la cosa sbagliata. Erie è una citazione reale, famosa, formattata correttamente. Ogni filtro di fabbricazione al mondo la lascia passare, proprio perché non è fabbricata. Il volume esiste, la pagina esiste, l'opinione esiste. Ciò che è sbagliato è il rapporto tra il caso citato e la frase davanti a esso, e quel rapporto è una questione di lettura giuridica, non di esistenza. Un controllo di corrispondenza delle fonti tratta «questo caso è reale» e «questo caso sostiene la mia tesi» come lo stesso fatto. Non sono nemmeno vicini.

Così i numeri che la gente cita sull'AI legale iniziano ad avere senso. Anche gli strumenti costruiti apposta allucinano a tassi che dovrebbero gelarti: Westlaw Precision al 33 percento e Lexis+ al 17 percento nello studio Stanford RegLab pubblicato sul Journal of Empirical Legal Studies, 2025. Entro l'inizio del 2026 c'erano 1.222 casi giudiziari documentati che coinvolgevano citazioni allucinate dall'AI, e i tribunali hanno iniziato a sanzionare, inclusa una penale di 30.000 dollari dalla Sixth Circuit nel marzo 2026. Le fabbricazioni sono i fallimenti che almeno puoi immaginare di intercettare. La citazione reale ma travisata è quella che sembra diligenza fino al momento in cui un giudice legge l'opinione che hai citato e scopre che dice l'opposto.

Un caso fabbricato è una menzogna che puoi smentire. Un caso reale citato per la statuizione sbagliata è una menzogna che passa ogni test costruito per intercettare il primo tipo.

Perché ho diviso il motore in due

Ho smesso di cercare di far fare a un solo sistema entrambi i lavori la sera in cui ho accettato che erano lavori diversi.

Il controllo di esistenza e l'intercettazione delle fabbricazioni diventarono Python deterministico in esecuzione contro la giurisprudenza reale. Niente prompt, niente temperature, niente «as an AI language model». Prendi la citazione, cercala in un'autorità indipendente, e se il caso è genuinamente assente, è fabbricato, dimostrabilmente, e non può mai passare il gate. Quell'ultima clausola è l'unica garanzia che sono disposto a dichiarare in modo netto, perché è un invariante unit-tested piuttosto che una speranza: zero citazioni fabbricate possono passare il gate di policy. C'è un test chiamato esattamente così, ed è parte degli 8 su 8 che passano sulla demo costruita.

Pannello CiteGuard Ground-Truth Corpus che elenca decisioni reali della Corte Suprema curate da CourtListener, tra cui Ashcroft v. Iqbal, Terry v. Ohio, Whitman v. American Trucking e Chevron, con una nota che i controlli di esistenza e fabbricazione interrogano anche CourtListener live.
L'autorità indipendente su cui poggia l'intero sistema. Venti decisioni reali curate da CourtListener, il database pubblico di giurisprudenza, e i controlli di esistenza e fabbricazione interrogano anche CourtListener live al momento della richiesta. Il verificatore fonda ogni tesi su qualcosa fuori dal modello che ha scritto la memoria. Quell'indipendenza è ciò che rende il verdetto di fabbricazione un fatto invece di un'opinione.

Il controllo di supporto è rimasto un singolo passo di modello linguistico, perché giudicare se un'opinione reale sostiene una proposizione è genuinamente un compito di lettura, e il modello è un buon lettore. Ma gli ho dato il permesso esplicito di astenersi, e ho smesso di trattare l'astensione come un bug. Quando non riesce a fondare la tesi nel testo dell'opinione, instrada a un umano invece di indovinare. Il modello consiglia. Il gate deterministico e l'avvocato decidono. Mi sono ritrovato a dire due cose di continuo mentre costruivo questo. Una è gli agenti consigliano, il codice decide. L'altra è che non lascerò che un LLM sia il giudice finale di un LLM.

Voglio essere preciso sulla separazione, perché la tentazione è sfumarlo in una promessa più grande di quanto sia. Le parti deterministiche — esistenza, fabbricazione, fuori copertura e il gate — sono esatte e riproducibili. Il controllo di supporto no. È non deterministico, e per progettazione passa una citazione al verde solo quando il testo dell'opinione stabilisce chiaramente la statuizione, nel modo in cui Miranda v. Arizona, 384 U.S. 436, fa sugli avvertimenti di interrogatorio in custodia, e altrimenti manda la citazione in revisione. Quali citazioni reali specifiche passino al verde e quali vengano instradate a un umano può variare da esecuzione a esecuzione. Non è un difetto grezzo che sto nascondendo. È la forma onesta del problema, e fingere altrimenti è esattamente la mossa contro cui sto cercando di costruire.

Cosa «8 su 8» è davvero autorizzato a significare

Mi impongo una regola sui numeri, perché l'azienda che sto costruendo si chiama Veriprajna, che significa vera saggezza, e un nome del genere è una sfida permanente a esagerare le pretese.

Ci sono numeri di prova nella demo e significano cose circoscritte. 8 su 8 test unitari offline passano, incluso quello che prova che nessuna citazione fabbricata può superare il gate e quello che prova che un'autorità irraggiungibile è trattata come non provata piuttosto che fabbricata. Ci sono 20 casi reali in cache da CourtListener come ground truth locale. Descrivono l'ambito della demo costruita. Non sono una pretesa sulla vostra memoria o sul mondo aperto. La garanzia di fabbricazione è autorevole perché interroga la giurisprudenza live e un caso mancante è un fatto. L'aggiudicazione del controllo di supporto è dimostrata su piccola scala su casi reali, e non la gonfierò in una cifra di accuratezza universale, perché non lo è.

Ecco la riga che rifiuto di abbreviare, anche se una versione più corta venderebbe meglio. Una memoria senza citazioni fabbricate non è automaticamente sicura da depositare. Quando anche una sola citazione reale ha ancora bisogno di un umano per confermare che sia usata correttamente, il gate tiene il deposito a Non pronto al deposito, ed è giusto così. Ho visto persone volere l'opposto, volere che una memoria dall'aspetto pulito guadagni da sola il via libera verde. È esattamente l'istinto che fa sanzionare un avvocato.

Certificato CiteGuard di verifica delle citazioni per una memoria personalizzata, che mostra Terry v. Ohio e Strickland v. Washington instradati a Da revisionare e la citazione 921 U.S. 77 segnata Fabbricata, con un banner Non pronto al deposito e un pulsante Esporta certificato.
Il certificato di audit firmato che produce il gate. Su questa memoria personalizzata, Terry v. Ohio, 392 U.S. 1, e Strickland v. Washington, 466 U.S. 668, sono casi reali instradati a Da revisionare, e 921 U.S. 77 è intercettato come fabbricato. Il banner legge Non pronto al deposito, e il certificato registra ogni verdetto, la fonte CourtListener, il modello o la parola «deterministico», e un timestamp UTC. È l'evidenza che un standing order chiede.

Quel certificato conta per me più di qualsiasi percentuale di accuratezza, ed è per questo che i pezzi deterministici e non deterministici devono restare separati. La riproducibilità è ciò che rende una decisione certificabile. Posso passarti la ricevuta. Questa citazione è stata controllata contro CourtListener, il volume non esiste, verdetto fabbricato, il gate trattiene. Puoi rieseguirla e ottenere il risultato identico. Un giudice LLM, anche uno buono, non può prometterti quello, e io ho vissuto la serata di tre esecuzioni e tre risposte diverse. Non sto costruendo un record di conformità sopra un lancio di moneta.

Dirò anche chiaramente, perché lo standard a cui mi attengo lo richiede, che questo è uno strato di verifica e non uno strumento di ricerca. Non redige memorie né trova casi. Non compete con Harvey o Westlaw o Lexis. Sta intorno a qualunque cosa producano e dice all'avvocato cosa è sicuro depositare e esattamente cosa ha bisogno di un umano. Il grounding a testo pieno oltre lo snippet pubblico dell'opinione richiede un token gratuito CourtListener, il connettore di gestione documentale nella demo è un mock, e alcune funzioni come un certificato PDF sono differite. Ciò che è reale è il meccanismo: i controlli, l'astensione, il gate deterministico e la traccia di audit, tutti in esecuzione contro la giurisprudenza reale.

L'astensione non è solo il modello che schiva la chiamata difficile?

Ricevo qualche versione di questa domanda in quasi ogni conversazione, di solito da un ingegnere, e la mia risposta è diventata più corta e più certa nel tempo.

No. L'astensione è la chiamata difficile, fatta onestamente, e rifiutare di farla è la vera schivata. L'alternativa seducente è un sistema che restituisce sempre un verdetto netto, verde o rosso, su ogni citazione. Fa una demo bellissima. Sta anche mentendo, perché alcune citazioni genuinamente non possono essere aggiudicate dal testo disponibile con confidenza, e un sistema che non lo dice mai sta fabbricando una certezza che non ha. La cosa più preziosa che un'AI ad alto rischio può fare è dirti dove il suo stesso giudizio si esaurisce. In un dominio in cui essere in errore con sicurezza fa sanzionare il tuo cliente, un «non sono sicuro, un umano deve guardare» calibrato vale più di un'indovinazione fluente.

È per questo che penso che il lavoro sopravviva alla generazione attuale di modelli. L'industria continua a promettere di risolvere il problema delle allucinazioni con il prossimo modello. Concedete tutto: contesto più ampio, training più pulito, un tasso di fabbricazione più basso. Un modello perfetto che non inventa mai un caso citerà comunque allegramente uno reale per una proposizione che non sostiene, perché dall'interno della bozza quella frase suona vera ed è esattamente ciò che avete chiesto. Il divario tra «questo caso esiste» e «questo caso sostiene la mia tesi» non è un divario che lo scale chiude. È una questione di governance, e la governance è una proprietà del sistema che costruisci intorno al modello, non una capacità che aspetti che il modello sviluppi.

Un tribunale non si cura di quanto fosse sicuro il tuo modello. Si cura se la citazione esiste e dice ciò che hai affermato. Quello non è un problema di modello più grande. È un problema di costruire lo strato giusto.

I regolatori lo vedono già così, ed è qualcosa su cui vale la pena soffermarsi. L'ABA Formal Opinion 512 e più di 300 standing order giudiziari ora richiedono agli avvocati di verificare l'output AI prima del deposito, e meno del 20 percento degli studi ha una qualsiasi policy di uso dell'AI. L'obbligo non è «usate uno strumento più intelligente». L'obbligo è «dimostrate di aver controllato». Prova, provenance e astensione onesta non sono cose che un redattore migliore vi dà. Sono cose che vi dà uno strato di verifica, e reggono a qualsiasi qualità del modello, che è precisamente perché penso che siano la parte durevole.

La domanda che mi pongo prima di depositare

Ho scoperto che la cosa che questa costruzione ha cambiato in me era più piccola della tesi, ed è durata più a lungo.

Ho smesso di chiedere se una tesi scritta dall'AI è vera, perché spesso posso rispondere a quello e risulta non essere abbastanza. La Erie citazione stava, in un senso stretto, puntando a un caso reale. La domanda più difficile, quella che ora mi faccio prima che qualsiasi cosa redatta dall'AI lasci le mie mani, è se posso provare, proprio ora, che questa esatta fonte sostiene questa esatta tesi, e se quella prova sopravviverebbe a qualcuno che volesse farla fallire davanti a un giudice.

Quella è una domanda di governance, non una domanda di modello. Non diventa più facile man mano che il modello migliora, perché ciò che viene chiesto non è «il modello può scrivere una frase migliore» ma «puoi stare dietro a questa». E la risposta più utile che il mio stesso sistema mi dà mai non è il segno di spunta verde. È il momento in cui trattiene un caso reale a Da revisionare e mi costringe, una persona, ad andare a leggere l'opinione. Se volete vedere dove sono arrivato, è qui ancora una volta: veriprajna.com/it/demos/verifica-e-governance-delle-citazioni-nell-ai-legale.

E se preferite guardarlo piuttosto che leggermi descriverlo, ecco l'intera cosa in esecuzione da capo a coda, con la mia voce.

Quindi la domanda che vi lascerei è quella che ha riorganizzato l'intera costruzione. Quando l'AI vi passa qualcosa di sicuro e pulito, avete uno strato disposto a dire «non sono sicuro, un umano deve guardare»? Perché la confidenza è a buon mercato, e nel lavoro che porta davvero rischio, l'astensione dimostrabile è il prodotto.

Ricerca correlata

Pubblicato anche su

Costruisci la tua IA con fiducia.

Collabora con un team che vanta una profonda esperienza nella creazione della prossima generazione di IA aziendale. Lascia che ti aiutiamo a progettare, sviluppare e implementare una strategia di IA di cui ti puoi fidare.

Veriprajna società di consulenza Deep Tech è specializzata nella creazione di sistemi di IA safety-critical per i settori sanitario, finanziario e regolamentato. Le nostre architetture sono validate rispetto a protocolli consolidati con una documentazione di conformità completa.