
판례는 실재했다. 그래도 AI가 보증하게 둘 수 없었다.
내가 만든 도구가 실제 대법원 판례 세 건에 대해 승인을 거부하는 모습을 처음 보았을 때, 나는 확실히 고장났다고 생각했다.
나는 "Misapplied Precedent"라고 라벨을 붙인 샘플 브리프를 실행하고 있었다. 그 브리프는 Erie Railroad v. Tompkins, 304 U.S. 64를 통일된 연방 보통법 체계의 존재를 뒷받침한다고 인용했는데, 이는 거의 정반대에 해당하는 Erie의 실제 판시이다. 또한 의존한 것은 Celotex Corp. v. Catrett, 477 U.S. 317과 Baker v. Carr, 369 U.S. 186이며, 의견서가 뒷받침하지 않는 명제를 위해 썼다. 그 판례들은 모두 실재한다. 나는 지원 검증이 그것들을 빨간색으로 표시하고 미지원이라는 도장을 찍어 일을 끝내리라 기대했다. 그런데 세 건 모두 더 조용한 판정으로 돌아왔다: 검토 필요. 첫 번째 본능은 언어 모델이 쉬운 부분에서 실패했다고 여기는 것이었다.
그 본능이 바로 버그였고, 버그는 시스템이 아니라 내 안에 있었다는 사실을 이해하기까지 부끄러울 정도로 긴 저녁이 걸렸다.

자신만만한 "미지원" 도장이 미묘하게 잘못 읽은 Erie에 찍혔다면 그건 허세였을 것이다. 의견서는 길고, 오용 여부는 법적 판단의 문제이며, 모델은 빨간 판정이 암시하는 확신으로 스니펫만으로 부정을 확정할 수 없다. 정직한 선택은—내가 우연히 만들어 두고는 좌절감에 거의 코드에서 지워 버릴 뻔한—모순되는 맥락을 붙여 사람에게 넘기는 것이었다. 기권이 실패가 아니었다. 기권이 바로 전부였다. 스스로 결정하는 모습을 보고 싶다면 여기에 있다: veriprajna.com/ko/demos/legal-ai-citation-verification.
이 에세이는 내가 처음에 품었던 가정—지금 법률 AI를 만드는 거의 모두가 공유하는—과, 데모를 만들며 그 가정이 느리게, 구체적으로 무너진 방식에 대한 것이다. 그 가정은 환각 문제가 더 나은 모델로 해결된다는 것이다. 나는 더 이상 그렇게 믿지 않으며, 모델이 개선될 것을 의심해서가 아니다.
한 모델로 다른 모델을 감시하려 했던 그 주
나는 언어 모델이 다른 언어 모델의 신뢰할 수 있는 판사가 되게 하려는 데 약 일주일을 썼고, 솔직히 말하면 되지 않았다.
설정은 합리적으로 보였다. 어떤 모델이—Harvey든 Lexis Protégé든 오픈소스든, 어느 쪽이든 상관없다—브리프를 초안하고, 두 번째 모델이 각 인용을 가리키는 판례와 대조해 읽어 의견서가 주장을 뒷받침하는지 판정한다. 모델 둘, 깔끔한 검증, 설계 리뷰를 통과할 법한 아키텍처. 나는 판정 단계가 쉬운 부분일 거라 진심으로 기대했다. 그런데 바로 그 부분이 고정되지 않았다.
실패는 시끄럽지 않았고, 그래서 더 위험했다. 같은 브리프를 지원 검증에 세 번 돌리면 두 번은 "검토 필요", 한 번은 확신에 찬 통과가 나왔고, 입력은 바뀌지 않았다. Bell Atlantic Corp. v. Twombly 인용, 550 U.S. 544—실제 판례—에 대해 모델은 때로 의견서가 인용된 명제를 분명히 확립했다고 보고, 때로 그렇지 않다고 보았다. 두 읽기 모두 방어 가능했다. 그게 바로 문제였다. 재현할 수 없는 판정은 판정이 아니다. 법복을 입은 두 번째 의견일 뿐이다.
나는 확률적 시스템에게 다른 확률적 시스템의 결정론적 게이트가 되라고 요구하면서, 그 결과를 검증이라 부르고 있었다.
그건 검증이 아니다. 그건 두 모델이 동의하는 것이고, 더 약하고 훨씬 더 불안정한 것이다. 확인이 필요한 이유가 첫 모델의 출력을 액면 그대로 믿을 수 없어서라면, 두 번째 모델의 출력을 그걸 확인할 근거로 믿을 수는 없다. 나는 거울의 방을 지어 놓고 곧 컴플라이언스 스티커를 붙이려 하고 있었다. 맞은편 법원은 어느 모델이 얼마나 확신했는지 신경 쓰지 않는다. 신경 쓰는 것은 그 판례가 존재하는가, 그리고 당신이 주장한 바를 말하는가다. 그것은 두 가지 질문인데, 나는 하나로 다루고 있었다.
어느 쪽이 더 위험한가, 조작된 판례인가 잘못 쓰인 실제 판례인가?
이것을 만들며 놀란 점은, 두 실패가 완전히 다른 장치를 필요로 하는데 업계는 대개 그중 하나만 출시한다는 사실을 깨달은 것이었다.
조작된 인용은, 묘하게도, 친절한 실패다. Halstead v. Ferngate Holdings, 823 U.S. 1199가 샘플 브리프 중 하나에 등장하며, 징벌적 손해배상이 범주적으로 금지된다는 명제를 아주 유창하게 뒷받침한다고 인용된다. 존재하지 않는다. United States Reports에는 823권이 없다. 모델에게 어떻게 생각하는지 묻는 게 아니라, 실제 판례법을 조회해 제로 결과 룩업을 받으면 확신으로 증명할 수 있다. 그건 권위에 대한 산술이지 판단이 아니다. 코드가 결정해야 하고, 매번 같은 방식으로 결정해야 하는 종류의 일이다.

위험한 실패는 잘못된 명제를 위해 인용된 실제 판례다. Erie는 실재하고, 유명하며, 형식이 올바른 인용이다. 세상의 모든 조작 필터가 통과시키는데, 바로 조작이 아니기 때문이다. 권은 있고, 페이지는 있고, 의견서는 있다. 잘못된 것은 인용된 판례와 그 앞 문장 사이의 관계이며, 그 관계는 존재의 문제가 아니라 법률 독해의 문제다. 출처 매칭 검사는 "이 판례는 실재한다"와 "이 판례가 내 주장을 뒷받침한다"를 같은 사실로 취급한다. 둘은 전혀 가깝지 않다.
그래서 사람들이 법률 AI에 대해 인용하는 수치가 이해가 되기 시작한다. 목적 특화 도구조차 당신을 멈춰 세울 비율로 환각한다: Westlaw Precision 33퍼센트, Lexis+ 17퍼센트—Stanford RegLab 연구가 발표한 저널은 Journal of Empirical Legal Studies, 2025. 2026년 초까지 AI 환각 인용과 관련된 문서화된 법원 사건은 1,222건이었고, 법원은 제재를 시작했으며 그중에는 2026년 3월 제6순회법원의 3만 달러 벌금도 있다. 조작은 적어도 잡을 수 있다고 상상할 수 있는 실패다. 실재하지만 잘못 적용된 인용은, 판사가 당신이 인용한 의견서를 읽어 정반대를 말할 때까지 성실해 보이는 바로 그것이다.
조작된 판례는 반증할 수 있는 거짓말이다. 잘못된 판시를 위해 인용된 실제 판례는, 전자를 잡도록 만든 모든 검사를 통과하는 거짓말이다.
엔진을 둘로 나눈 이유
두 일이 다른 일이라는 것을 받아들인 저녁, 나는 한 시스템이 둘 다 하게 만들려는 시도를 그만두었다.
존재 확인과 조작 탐지는 실제 판례법에 대해 돌아가는 결정론적 Python이 되었다. 프롬프트도, temperature도, "AI 언어 모델로서"도 없다. 인용을 받아 독립 권위에서 조회하고, 판례가 정말로 없으면 조작이며, 증명 가능하고, 절대 게이트를 통과할 수 없다. 마지막 절이 내가 단언할 의향이 있는 유일한 보장인데, 희망이 아니라 단위 테스트된 불변식이기 때문이다: 조작된 인용은 정책 게이트를 하나도 통과할 수 없다. 정확히 그것을 위한 이름의 테스트가 있고, 빌드된 데모에서 통과하는 8개 중 8개의 일부다.

지원 검증은 단일 언어 모델 단계로 남겼다. 실제 의견서가 명제를 뒷받침하는지 판단하는 일은 진정으로 독해 과제이고, 모델은 좋은 독자이기 때문이다. 하지만 기권할 명시적 권한을 주었고, 기권을 버그로 취급하는 것을 그만두었다. 의견서 텍스트에 주장을 그라운딩할 수 없으면 추측 대신 사람에게 넘긴다. 모델은 조언한다. 결정론적 게이트와 변호사가 결정한다. 이것을 만들며 나는 두 가지를 끊임없이 말하게 되었다. 하나는 에이전트는 조언하고, 코드가 결정한다. 다른 하나는 LLM이 LLM의 최종 판사가 되게 두지 않겠다는 것이다.
나는 이 분리를 정확히 말하고 싶다. 더 큰 약속으로 흐리게 만드는 유혹이 있기 때문이다. 결정론적 부분—존재, 조작, 적용 범위 외, 게이트—은 정확하고 재현 가능하다. 지원 검증은 그렇지 않다. 비결정적이며, 설계상 의견서 텍스트가 판시를 명백히 확립할 때만 인용을 녹색으로 통과시키는데—그 방식은 Miranda v. Arizona, 384 U.S. 436가 구금 신문 경고에 대해 보여 주는 것과 같고, 그렇지 않으면 검토로 보낸다. 어떤 실제 인용이 녹색으로 통과하고 어떤 것이 사람에게 가는지는 실행마다 달라질 수 있다. 그것은 내가 숨기는 거친 모서리가 아니다. 문제의 정직한 형태이며, 그렇지 않은 척하는 것이 바로 내가 맞서 구축하려는 움직임이다.
"8개 중 8개"가 실제로 뜻해도 되는 것
나는 숫자에 대한 규칙을 스스로에게 적용한다. 내가 만드는 회사 이름이 Veriprajna—참된 지혜—이고, 그런 이름은 과장을 향한 상시 도전이기 때문이다.
데모에는 증명 숫자가 있고, 그것들은 좁은 의미다. 오프라인 단위 테스트 8개 중 8개 통과, 조작된 인용이 게이트를 통과할 수 없음을 증명하는 것과 도달 불가능한 권위를 조작이 아니라 미증명으로 취급함을 증명하는 것을 포함한다. 실제 판례 20건이 CourtListener에서 캐시되어 로컬 그라운드 트루스다. 그것들은 빌드된 데모의 범위를 기술한다. 당신의 브리프나 열린 세계에 대한 주장이 아니다. 조작 보장은 실시간 판례법을 조회하고 없는 판례가 사실이기 때문에 권위적이다. 지원 검증 판정은 실제 판례에서 소규모로 시연되며, 보편적 정확도 수치로 부풀리지 않을 것이다—그것이 아니기 때문이다.
더 짧은 버전이 더 잘 팔리더라도 내가 줄이기를 거부하는 선이 있다. 조작된 인용이 없는 브리프가 자동으로 제출해도 안전한 것은 아니다. 실제 인용 하나라도 올바르게 쓰였는지 사람이 확인할 필요가 남아 있으면, 게이트는 제출을 제출 준비 미완료로 붙잡아 두고, 그게 옳다. 나는 사람들이 그 반대를 원하는 것을—깨끗해 보이는 브리프가 스스로 녹색불을 얻기를—지켜보았다. 그게 바로 변호사가 제재받는 본능이다.

그 인증서가 어떤 정확도 비율보다 나에게 더 중요하고, 결정론적 조각과 비결정론적 조각이 분리되어 있어야 하는 이유다. 재현성이 결정을 인증 가능하게 만든다. 영수증을 건네줄 수 있다. 이 인용은 CourtListener에 대해 검사했고, 권이 존재하지 않으며, 판정은 허위, 게이트가 붙잡는다. 다시 돌려도 동일한 결과가 나온다. LLM 판사—좋은 것이라도—그걸 약속할 수 없고, 나는 세 번 실행해 세 가지 다른 답을 얻은 저녁을 살았다. 동전 뒤집기 위에 컴플라이언스 기록을 쌓지 않겠다.
또한 분명히 말하겠다. 내가 지키는 기준이 그것을 요구하기 때문이다. 이것은 검증 계층이지 리서치 도구가 아니다. 브리프를 초안하거나 판례를 찾지 않는다. Harvey나 Westlaw나 Lexis와 경쟁하지 않는다. 그것들이 만든 것 주변에 앉아 변호사에게 제출해도 안전한 것과 정확히 무엇이 사람을 필요로 하는지 알려 준다. 공개 의견서 스니펫을 넘는 전문 그라운딩에는 무료 CourtListener 토큰이 필요하고, 데모의 문서 관리 커넥터는 목(mock)이며, PDF 인증서 같은 일부 기능은 미루어져 있다. 실재하는 것은 메커니즘이다: 검사, 기권, 결정론적 게이트, 감사 추적—모두 실제 판례법에 대해 돌아간다.
기권은 모델이 어려운 판정을 피하는 것 아닌가?
거의 모든 대화에서—대개 엔지니어에게서—이런 질문의 어떤 버전을 듣고, 내 답은 시간이 지날수록 더 짧고 더 확실해졌다.
아니다. 기권이 바로 어려운 판정이며, 정직하게 내린 것이고, 그것을 거부하는 것이 진짜 회피다. 매혹적인 대안은 모든 인용에 대해 언제나 선명하게 녹색이든 빨간색이든 판정을 돌려주는 시스템이다. 데모는 아름답다. 그러나 또한 거짓말이다. 어떤 인용은 가용 텍스트만으로 자신 있게 판정할 수 없고, 결코 그렇게 말하지 않는 시스템은 갖지 않은 확신을 제조하기 때문이다. 고위험 AI가 할 수 있는 가장 가치 있는 일은 자신의 판단이 어디서 끝나는지 말해 주는 것이다. 자신만만하게 틀리는 것이 의인을 제재받게 하는 영역에서, 보정된 "확신이 없다, 사람이 봐야 한다"는 유창한 추측보다 더 가치가 있다.
그래서 나는 이 작업이 현재 모델 세대를 넘어 살아남는다고 생각한다. 업계는 다음 모델로 환각 문제를 약속해 없애려 한다. 모두 인정하자—더 큰 컨텍스트, 더 깨끗한 학습, 더 낮은 조작률. 판례를 절대 발명하지 않는 완벽한 모델도 여전히 뒷받침하지 않는 명제에 실재하는 판례를 유쾌하게 인용할 것이다. 초안 안에서 그 문장은 참이고 당신이 요청한 바로 그것으로 읽히기 때문이다. "이 판례는 존재한다"와 "이 판례가 내 주장을 뒷받침한다" 사이의 간극은 규모가 메우는 간극이 아니다. 거버넌스 질문이며, 거버넌스는 모델이 키워 주기를 기다리는 능력이 아니라 모델 주변에 짓는 시스템의 속성이다.
법원은 모델이 얼마나 확신했는지 신경 쓰지 않는다. 인용이 존재하는지, 당신이 주장한 바를 말하는지를 신경 쓴다. 그건 더 큰 모델 문제가 아니다. 올바른 계층을 짓는 문제다.
규제 당국은 이미 이렇게 보고 있으며, 곱씹을 가치가 있다. ABA Formal Opinion 512와 300건이 넘는 사법 상시 명령이 이제 변호사에게 제출 전 AI 출력을 검증할 것을 요구하고, AI 사용 정책이 있는 로펌은 20퍼센트 미만이다. 의무는 "더 똑똑한 도구를 쓰라"가 아니다. 의무는 "확인했음을 증명하라"이다. 증명, 출처, 정직한 기권은 더 나은 초안 작성기가 주지 않는다. 검증 계층이 주는 것이며, 어떤 모델 품질에서도 유지된다—바로 그래서 그것이 내구성 있는 부분이라고 생각한다.
제출 전에 내가 붙잡는 질문
이 구축이 내 안에서 바꾼 것은 테제보다 작았고, 더 오래 남았다.
나는 AI가 쓴 주장이 참인지 묻는 것을 그만두었다. 종종 답할 수 있고, 그것만으로는 충분하지 않다는 것이 드러났기 때문이다. Erie 인용은, 좁은 의미에서, 실제 판례를 가리키고 있었다. 더 어려운 질문—이제 AI가 초안한 것이 내 손을 떠나기 전에 내가 묻는—은, 바로 지금 이 정확한 출처가 이 정확한 주장을 뒷받침함을 증명할 수 있는지, 그리고 그 증명이 판사 앞에서 실패시키려는 사람을 견뎌낼지다.
그건 거버넌스 질문이지 모델 질문이 아니다. 모델이 나아진다고 쉬워지지 않는다. 묻는 것이 "모델이 더 나은 문장을 쓸 수 있는가"가 아니라 "이 문장 뒤에 설 수 있는가"이기 때문이다. 그리고 내 시스템이 나에게 주는 가장 유용한 답은 녹색 체크가 아니다. 실제 판례를 검토 필요에 붙잡아 두고, 나—사람—에게 의견서를 읽게 만드는 순간이다. 내가 어디에 도착했는지 보고 싶다면, 다시 한 번 여기다: veriprajna.com/ko/demos/legal-ai-citation-verification.
내가 설명하는 것을 읽기보다 보고 싶다면, 내 목소리로 처음부터 끝까지 돌아가는 전체가 여기 있다.
그래서 당신에게 남기고 싶은 질문은 전체 구축을 재편한 그것이다. AI가 자신만만하고 깔끔한 것을 건넬 때, "확신이 없다, 사람이 봐야 한다"고 말할 의가 있는 계층이 있는가? 확신은 싸고, 실제 리스크를 지는 일에서 증명 가능한 기권이 제품이기 때문이다.


