
내 뉴스룸 AI가 시장이 한 번도 하지 않은 인용문을 지어냈다. 독자가 보기 전에 그걸 잡는 것이 제품의 전부다.
내가 만든 답변기가 시장의 입에 말을 집어넣는 걸 처음 본 순간, 내가 두려워하던 바로 그 물건을 내가 만들었다는 깨달음과 함께 오는 특유의 한기를 느꼈다.
나는 독자의 평범한 질문을 던졌다. 레예스 시장은 강변 필지에 대해 개발업자들에게 무엇을 약속했나? 그것이 읽고 있던 아카이브, 내가 The Riverbend Ledger라고 부르는 가상의 신문이 합성으로 쌓아 올린 13년치 기록에는, 그런 약속이 없다. 한 기사는 실제로 그 필지가 "안건에 없었다"고 적는다. 그래도 언어 모델은 멈추지 않았다. 따옴표가 들어간, 유창하고 자신만만한 문장을 돌려보냈다. "우리는 개발업자들을 위해 강변 필지를 앞으로 밀어 가기로 한다." 존재하지도 않는 인물인 엘레나 레예스 시장이, 제호 아래 그대로 실어도 될 만큼 깔끔한 문장으로, 한 번도 하지 않은 약속을 한 것처럼 되어 있었다. 나는 그걸 보고, 판단하고, 실패하는 것을 다음에서 붙잡아 두고 싶다. veriprajna.com/ko/demos/conversational-ai-for-publishers.
이 에세이는 내가 처음에 품었고, 지금 뉴스룸용 AI를 만드는 사람들 대부분이 여전히 공유하는 가정과, 이 데모를 만들며 그 가정이 천천히 무너진 과정에 대한 글이다. 그 가정은 날조 문제가 더 나은 모델로 해결된다는 것이다. 나는 더 이상 그렇게 믿지 않는다. 모델이 계속 나아질 것을 의심해서가 아니다.
시작하기 전에 이미 눈앞에 있던 실제 실패가 있었고, 그것은 합성이 아니었다. 2025년 말, 워싱턴 포스트의 "Ask The Post AI"는 인용문을 지어내고, 출처를 잘못 귀속시키며, 논평을 신문의 편집 입장인 양 끼워 넣은 AI 생성 팟캐스트를 출시했다. 이런 일이 늘 그렇듯, 표준 담당 편집자의 슬랙이 유출되면서 드러났다(Semafor, 2025년 12월 11일). 그 망신 밑에 깔린 기술적 실패는 작고 구체적이었다. 빠진 인용 검증 단계. 나는 더 똑똑한 팟캐스트 진행자를 만들고 싶지 않았다. 빠져 있던 그 단계를 만들고 싶었다.
모델이 거짓말을 멈추게 하려 한 그 주
답변기 자체를 신뢰할 수 있게 만들려 약 일주일을 썼고, 솔직히 말하면 그 일주일은 잘못된 선택이었다.
당시에는 논리가 빈틈없어 보였다. 모델이 인용문을 날조하면, 모델을 조이면 된다. 더 나은 그라운딩 프롬프트, 더 낮은 temperature, 검색된 구절만 쓰라는 더 엄한 지시, 모델이 자기 답을 다시 읽고 문장마다 뒷받침되는지 채점하는 자기점검 패스. 나는 그걸 전부 만들었다. 가장자리에서는 도움이 됐고 중심에서는 실패했다. 내가 신경 쓴 실패는 모델이 부주의한 것이 아니었다. 모델이 편집부가 신뢰하는 바로 그 문체로, 자신만만하고 유창하게 틀린 것이었다. 레예스 인용문은 환각처럼 읽히지 않았다. 취재처럼 읽혔다.
자기점검 패스가 그 접근을 내게서 끝내 버린 순간이었다. 날조된 인용문을 쓴 바로 그 모델에게, 그 날조된 인용문이 진짜인지 물어보고 있었고, 의미 있는 비율로 모델은 예, 문제없다고 했다. 당연했다. 그 순간 모델은 아카이브 텍스트에 대한 독립적 접근이 없었다. 있었던 것은 자기 자신뿐이었고, 자기 자신을 감사하는 데 쓸 수 없는 바로 그것이다.
나는 확률적 시스템에게 확률적 시스템의 출력을 인증하라고 시키며, 그 결과를 검증이라 부르고 있었다. 그것은 검증이 아니다. 두 추측이 일치하는 것이다.
그리고 판돈은 학술적이지 않다. 발행사는 인터넷의 흔한 탈출구를 갖지 못하기 때문이다. 자사 아카이브에서 자사 시스템이 생성한 콘텐츠에는 Section 230 방패가 없다. 독자 질문에 당신 이름으로 답하는 순간, 인용문까지 포함해 그 답은 당신 것이다. 명예훼손 원고는 모델이 얼마나 자신 있었는지 묻지 않는다. 인용문이 진짜였는지, 아카이브가 실제로 그렇게 말했는지를 묻는다. 그것은 두 질문인데, 나는 둘을 모델이 풀어야 할 하나의 문제로 취급하고 있었다.
이 모든 것이 상업적으로 중요한 이유는, 발행사들이 원하든 원하지 않든 이 방향으로 밀리고 있기 때문이다. AI Overview는 이제 구글 검색의 48%에 나타난다(theStacc / Search Engine Land, 2026년 3월). 발행사 검색 트래픽은 2025년 11월까지 전년 대비 33% 줄었고, 2029년까지 추가로 약 43% 더 줄어들 것으로 예상된다(Reuters Institute Trends 2026). AI Overview가 링크 위에 뜨자 데일리 메일은 데스크톱 클릭스루가 89% 떨어졌다. 독자가 아카이브를 찾아오던 트래픽은 사라지고 있으니, 독자가 아카이브에 직접 묻게 하려는 압력은 엄청나다. 함정은, 그렇게 하는 순간 가장 정직하게 일어나는 일이 레예스 인용문이라는 것이다.
평범한 위젯이 쓸 수 없는 답
먼저 그 야심에 공정하고 싶다. 뉴스룸이 이걸 원하는 이유는 진짜이고, 검색창으로는 할 수 없기 때문이다.
물어보라. The Standards Desk에게 독자 질문의 어려운 종단적 버전, 2014년부터 2025년까지 도심 밀도 조례에 대한 레예스 시장의 입장은 어떻게 바뀌었나?. 그러면 시간 플래너가 먼저 그 10년을 구간으로 나눈다(2014-2017, 2018-2021, 2022-2025). 각 구간을 검색하고 연대기 서사를 조립한다. 2014년의 "나는 Riverbend의 성격을 타워와 바꾸지 않겠다"에서 2025년의 "다시 해도 그렇게 하겠다"까지 걸어가며, 모든 절에 인라인 [S#] 마커를 달아, 그 뒤에 있는 실제 아카이브 구절로 호버 연결한다. 이것이 평범한 벡터-RAG 위젯이 만들어 낼 수 없는 답이다. 한 번의 조회가 아니기 때문이다. 시간에 걸친 계획된 종합이며, 문장마다 근거가 있다.

그 초록 배너가 유혹적인 부분이고, 내가 플롯을 두 번째로 거의 놓친 지점이다. 파이프라인이 작동하면 아름답게 작동하고, 아름다운 데모는 그걸 만든 엔진을 믿고 싶게 만든다. 하지만 초록 배너가 제품이 아니다. 배너가 초록이 되도록 허용할지 결정하는 것이 제품이다. 종단적 답이 통과한 이유는 모든 주장이 근거했고 모든 인용문이 축어적으로 확인됐기 때문이다. 같은 엔진이 몇 분 전에 쓴 강변 답은 통과하지 못했다. 둘의 차이는 모델 품질이 아니다. 게이트다.
레예스 시장이 한 번도 하지 않은 인용
강변 답으로 자꾸 돌아오는 이유는, 내가 실제로 무엇을 만들고 있었는지 가르쳐 준 답이기 때문이다.
게이트가 여기서 하는 일은 이렇고, 그중 어느 것도 모델이 스스로를 채점하는 일이 아니다. 답은 원자적 주장으로 분해된다. 각 주장은 특정 검색 구절에 대해 그라운딩된다. 인용된 모든 문자열은, 인용하는 출처 텍스트와 글자 단위로 대조된다. 강변 답에서 커버리지는 50%로 나왔다. 두 주장 중 하나가 뒷받침됐고, 그 필지를 앞으로 밀어 가겠다는 인용 구간은 인용된 어떤 출처에서도 축어적으로 발견되지 않았다. 결정론적 정책 게이트가 그 사실을 읽고 답 전체를 HELD FOR STANDARDS-DESK REVIEW로 라우팅했다. 독자에게는 한 번도 보여지지 않았다.

배너 문구는 내게, 아마도 그래야 할 이상으로, 중요하다. "낮은 신뢰도"나 "검토해 주세요"라고 하지 않는다. 보류됨, 독자에게 보여지지 않음이라고 말하고, 그 의미대로다. 독자 위젯은 보류된 초안을 문자 그대로 받지 않기 때문이다. 그것이 레예스 날조와 Ask The Post AI 쪽의 전부다. 포스트의 엔진은 거짓 인용문을 만들었고 독자가 들었다. 내 엔진도 똑같이 거짓 인용문을 만들었지만 독자는 절대 듣지 않는다. 날조와 발행은 별개의 사건이고, 그 사이에 벽을 세웠기 때문이다.

답변기는 가드가 없는 위젯과 정확히 같은 방식으로 날조했다. 결과를 바꾼 유일한 것은 답변기를 신뢰하지 않는 검사였다.
그쯤에서 모델이 날조하지 않게 막으려는 시도를 그만두었다. 할 수 있고, 했고, 할 것이다. 가치는 절대 거짓말하지 않는 모델이 아니었다. 독자가 보기 전에 거짓을 잡는 것이었다. 그것은 "우리 AI는 환각하지 않는다"보다 작고 더 정직한 주장이고, 내가 내세울 의향이 있는 유일한 주장이다. 같은 세션에서 모델이 실패하는 것과 게이트가 붙잡는 것을 봤기 때문이다.
발행 안전이 모델 안에 살 수 없는 이유
나는 초기에 하나의 아키텍처 결정을 내렸고, 그것이 내가 가장 세게 옹호할 결정이다. 발행해도 안전한지 결정하는 부분은 언어 모델 바깥에 완전히 둔다.
파이프라인에는 세 에이전트가 있고, 그것들은 진짜로 유용하다. 시간 플래너, 답변기, 출처 감사기. 제공자를 바꿀 수 있고 기본값은 claude-opus-4-8이다. 그것들은 조언한다. 하지만 축어 인용 규칙—인용된 모든 구간을 인용 출처와 정확히 문자열 매칭하는 것—과 커버리지를 읽고 답을 라우팅하는 정책 게이트는 평범한 Python이다. 프롬프트도, temperature도, 모델의 자기보고도 없다. 만들면서 스스로에게 끊임없이 말한다. 에이전트는 조언하고, 코드가 결정한다. 검사가 필요한 이유가 모델 출력을 액면 그대로 믿을 수 없기 때문이라면, 그 검사는 모델이 자기 자신에 대해 말하는 또 다른 것이어서는 안 된다.
축어 규칙이 의도적으로 결정론적인 이유다. "이 정확한 인용 문자열이 인용하는 구절에 나타났는가"는 판단 호출이 아니다. 출처 텍스트에 대한 산술이고, 실행할 때마다 같은 판정을 돌려준다. 그 재현성이 감사 영수증을 가치 있게 만든다. 클릭 한 번에 답마다 JSON 영수증이 나온다. 질의, 분해된 하위 질문, 날짜와 id가 있는 검색 출처, 발행된 답, 증거 구절이 있는 주장별 판정, 인용별 축어 결과, 게이트 결정과 그 이유, 엔진과 모델, UTC 타임스탬프. 다시 실행하면 동일한 영수증을 얻을 수 있다. 모델 기반 판정자는 아무리 좋아도 그걸 약속할 수 없고, 나는 같은 입력에 세 가지 다른 답이 나오던 버전을 살아 봤다.
무엇이 실재이고 무엇이 연출인지 정확히 말하고 싶다. 정직함이 브랜드이기 때문이다. 전체는 결정론적 스텁이나 키 없는 로컬 Claude 브리지를 통해 오프라인으로 돌아가, 데모가 재현 가능하다. 일부 어려운 부분은 의도적으로 미뤄 두었고, 그렇지 않은 척하지 않겠다. 프로덕션 엔티티 해석은 미리 해석된 픽스처이고, 시간 지식 그래프는 라이브 Neo4j가 아니라 날짜·엔티티 태그와 플래너로 시연되며, CMS 동기화는 Arc XP 픽스처이고, 킬 스위치는 로컬 플래그를 뒷받침한다. 실재하는 것은 메커니즘이다. 그라운딩, 축어 검사, 결정론적 게이트, 그리고 영수증.
"10 out of 10"이 말해도 되는 의미
숫자에는 스스로에게 규칙을 둔다. 회사 이름을 Veriprajna, 참된 지혜라고 붙였고, 그런 이름은 과장하라는 상설 도전장과 같기 때문이다.
벤치마크가 말하는 것과 말하지 않는 것을 정확히 적는다. 라벨링된 10개 질의 평가 세트에서, 모든 질의가 예상 게이트 버킷에 떨어진다. 10 out of 10. 그중 여섯은 사람 손길 없이 발행됐다. 셋은 깔끔히 자동 승인, 셋은 지원되지 않는 문장을 가지친 뒤 나머지가 승인되어 발행됐다. 둘은 스탠더드 데스크 검토로 라우팅됐다. 인용 함정 사례 둘, 안전 밸브가 눈에 보이게 작동한 것이다. 둘은 정직한 "적용 범위 밖" 기권이었다. 검색이 점수 하한 위로 아무것도 통과시키지 못해, 숫자를 날조하기보다 추측을 거부한 경우다. 단위 테스트 13개가 통과한다. 말뭉치는 2014년부터 2025년까지의 합성 기사 200편이다.
그것이 네 버킷에 걸쳐 심어 둔 진정으로 어려운 열 가지 사례에서, 구축된 데모가 낸 숫자다. 열린 세계 정확도 보장이 아니며, 그렇게 부풀리지도 않겠다. 60/20/20 분할은 이 평가 세트의 결과이지, 당신 아카이브에 대한 약속이 아니다. 내가 단호히 말할 한 가지 주장은 결정론적인 것이다. 희망이 아니라 단위 테스트된 불변식이기 때문이다. 검증할 수 없는 인용이나 뒷받침되지 않는 주장이 있는 답은 절대 자동 승인되지 않는다. 발행사가 실제로 살 법한 가드 없는 평범한 벡터-RAG 기준선 대비, 날조된 구간이나 뒷받침되지 않는 주장이 있어 이 게이트가 붙잡은 답이 다섯이었다. 다섯은 작은 숫자다. 제호 아래 잘못된 인용 다섯은 작지 않다.
자신만만한 답은 싸다. 다시 실행해 변호사에게 넘길 수 있는 영수증이 있는, 입증 가능한 답이 당신이 실제로 돈을 내는 전부다.
보류하는 것은 기계가 어려운 결정을 피하는 것 아닌가?
거의 모든 대화에서 이런 질문을 받고, 내 답은 점점 짧아지고 더 확실해졌다.
아니요. 답변을 보류하는 것이 바로 그 어려운 결정이며, 정직하게 내린 것이고, 자신만만한 추측을 내보내는 것이 회피다. 유혹적인 대안은 모든 독자에게 언제나 또렷하고 발행 가능한 답을 돌려주는 위젯이다. 데모가 아름답고 표준 담당 편집자의 하루를 더 어렵게 만들지 않기 때문이다. 그것은 또한 Ask The Post AI 아키텍처이고, 그 실패와 정확히 같은 방식으로 실패한다. "이걸 검증할 수 없으니 보류한다"고 말할 수 없는 시스템은, 갖지 않은 확신을 제조하는 시스템이다. 그리고 뉴스룸이야말로, 무언가를 내지 않을 의지가 스탠더드 데스크의 전부라는 걸 아는 기관이다.

그래서 이 작업이 현재 모델 세대를 넘어 살아남는다고 생각한다. 낙관론자가 약속하는 모든 것을 인정하라. 더 큰 모델, 더 깨끗한 학습, 더 낮은 날조율. 인용문을 절대 지어내지 않는 완벽한 모델도, 진짜 인용문을 엉뚱한 사람이나 엉뚱한 연도에 기꺼이 귀속시킬 것이다. 초안 안에서는 그 문장이 참이고, 물어본 바로 그것처럼 읽히기 때문이다. "제호 아래 발행해도 안전하다"는 모델이 커서 갖추길 기다리는 능력이 아니다. 그 주변에 구축하는 시스템의 거버넌스 속성이며, 레예스 인용문을 발행한 날을 되돌려 주는 Section 230 방패는 없다. 내가 계속 도달하는 불편한 따름정리는, 뉴스룸이 돌릴 수 있는 가장 가치 있는 AI는 이걸 검증할 수 없으니 스탠더드 데스크에 보류한다.고 말할 의지가 있는 부분이라는 것이다. 그것이 결정하고, 날조를 붙잡고, 영수증을 내보내는 것을 보고 싶다면 여기 있다. veriprajna.com/ko/demos/conversational-ai-for-publishers.
내가 설명하는 걸 읽기보다 보고 싶다면, 여기 전체가 처음부터 끝까지 돌아가는 모습이다.
발행사에 남기고 싶은 질문은, 내 전체 구축을 재편한 그 질문이다. 당신 아카이브가 당신 이름으로 독자에게 답하고, 그 답이 유창하고 깔끔하며 누군가를 인용할 때, 독자가 보기 전에 그 인용이 진짜였음을 입증할 의지가 있는 계층이 있는가? 모델은 언제나 확신 있게 들릴 것이다. 확실한 것은 영수증뿐이다.


