수십 년치 신문 1면이 벽처럼 늘어서, 인용 링크로 답하는 채팅 패널로 흘러 들어가는 모습.
Artificial IntelligenceMediaTechnology

당신의 뉴스 아카이브가 자산이다. 구글이 공짜로 빌려 쓰게 두지 마라.

Ashutosh SinghalAshutosh Singhal2026년 5월 9일14 min

지난겨울 함께 앉았던 어느 지역 일간지는 월 400만 명의 독자와 32년치 아카이브를 보유하고 있었는데, 2월 이사회 자료집은 그 방에 있던 누구도 지난 10년간 읽어 본 것 중 최악의 문서였다. 유기적 검색 유입은 전년 대비 41% 감소. 프로그래매틱 광고 단가는 추가로 18% 하락. 2023년 조용히 살림을 지탱해 주던 제휴 매출은 정점의 3분의 1로 무너져 있었다. CFO는 슬라이드를 띄우고, 나를 바라보며, 정말 중요한 유일한 질문을 던졌다: 구글이 정확히 우리에게 무엇을 빚지고 있으며, 어떻게 그 값을 치르게 만들 것인가?

나는 그녀에게 진실을 말해야 했다: 구글은 계약상 그들에게 빚진 것이 없다. 웹을 만든 그 암묵의 거래 — 당신이 우리에게 크롤링을 허락하면, 우리는 당신에게 트래픽을 보낸다 — 는 AI Overviews가 다음 비중에 등장하기 시작한 순간 다시 쓰였다: 전체 구글 검색의 48% (2026년 3월 기준, theStacc / Search Engine Land). AI 요약이 유기적 링크 위에 자리 잡으면 독자는 좀처럼 스크롤하지 않는다; 그런 질의에서 데일리 메일의 데스크톱 클릭률은 25.23%에서 2.79%로 89% 떨어졌다. 콘텐츠는 여전히 읽히고 있다. 다만 발행사가 더 이상 그 대가를 받지 못할 뿐이다. 돌아갈 길은, 나는 확신하건대, 발행사 자신의 아카이브 위에 구축된 대화형 AI다.

그 대화가 바로 Veriprajna의 우리 팀이 이제 발행사를 위한 대화형 AI — 발행사 자신의 뉴스 아카이브 위에서 작동하는 검색 증강 생성 엔진을, 그것을 발행사의 제호 아래 안전하게 내걸 수 있게 해 주는 인용 강제(citation enforcement)와 라이선싱 전략과 함께 구축하는 이유다. 검색 증강 생성, 즉 RAG는 AI가 공개 인터넷에서 주워 담은 무언가가 아니라 오직 당신의 문서에서만 답한다는 뜻일 뿐이다. 그 구분이 결국 게임의 전부로 드러난다. 하지만 나는 우리가 어떻게 거기에 이르렀는지를 짚고 넘어가고 싶다. 우리는 첫 버전을 심하게 잘못 만들었고, 우리가 잘못한 방식이 바로 대부분의 발행사가 곧 잘못하게 될 방식이기 때문이다.

유입(referral) 경제는 끝났다. 라이선싱 경제는 아직 구축되지 않았다.

출혈이 얼마나 심각한지부터 시작하자. 그 규모 자체가 논거이기 때문이다. 발행사로 향하는 구글 검색 트래픽은 대략 다음만큼 감소했다: 2025년 11월까지의 1년간 전 세계적으로 33%. 그리고 로이터 저널리즘 연구소가 설문 조사한 뉴스 경영진이 예상하는 것은 향후 3년에 걸친 추가적인 43% 감소다 — 그중 5분의 1은 75%를 넘는 손실에 대비하고 있다 (로이터 저널리즘 연구소, 저널리즘 트렌드 2026). 개별 사례는 더 나쁘고, 그중 하나는 소송으로 번졌다: 제휴 매출이 정점 대비 3분의 1 넘게 하락한 Penske Media는 2025년 9월 구글을 제소했다 — 이 회사가 발행사들을 AI 학습에 강제로 끌어들인다고 주장하는 첫 대형 반독점 소송이다.

당신의 유통을 구축해 준 검색 엔진이 이제 당신의 가장 큰 경쟁자이며, 편을 바꾸면서 허락을 구하지도 않았다.

그래서 모든 이사회의 본능은 동일하다: 구글이 우리에게 독자를 보내지 않겠다면, 우리는 우리만의 AI를 만들어 그들을 우리 사이트에 붙잡아 두겠다. 옳은 본능이다. 사람들이 다치는 곳은 바로 실행이다.

우리는 뻔한 것을 먼저 만들었다. 그것은 어느 시의원에 관해 환각을 일으켰다.

우리 자신의 흉터에 관해 솔직하게 말하겠다. 내가 직접 얻은 것이니까. 우리가 세운 첫 엔진은 모든 SaaS 벤더가 $60K에서 $120K에 견적을 내고 몇 주 만에 배포하겠다고 하는 바로 그 버전이었다: 아카이브를 가져와, 모든 기사를 청크로 잘게 나누고, 청크를 벡터 임베딩으로 바꾼 뒤, 챗봇이 가장 가까운 매치를 검색하게 한다. 데모는 아름답게 잘 돌아간다. 최근 기사에 관해 물으면, 알맞은 기사를 끌어오고, 그럴듯하게 들린다.

그러다 파일럿 세션에서, 한 편집자가 어떤 독자라도 물었을 법한 질문을 던졌다: 이 시의원과 도심 프로젝트 배후의 개발업자 사이에는 어떤 내력이 있는가? 그것은 멀티홉(multi-hop) 질문이다 — 한 인물을 여러 해에 걸친 수십 개의 기사에 걸쳐 연결한다는 뜻인데, 그 기사들에서 그는 때로는 직함이 붙은 전체 이름으로, 때로는 성(姓)만으로, 그리고 한 번은 오래된 사진 캡션에서 그가 아직 그 자리에 앉기 훨씬 전 그저 "해당 선거구 대표"로만 등장한다. 벡터 검색은 텍스트상 유사한 청크 몇 개를 검색해, 그것들을 매끄러운 문단으로 꿰맞추고, 아카이브가 실제로는 뒷받침하지 않는 관계를 단언했다. 그것은 연결 조직을 지어냈다.

그녀가 그것을 알아챘을 때 나는 편집자의 얼굴을 지켜봤다. 그 표정 — 기계가 방금 자기 신문의 이름으로 사실을 날조했음을 깨닫는 기자의 표정 — 이 바로 내가 이제 모든 것을 막기 위해 구축하는 대상이다. 우리는 자신만만한 거짓말쟁이를 출시했던 것이다.

그 실패가 내가 더 이상 챗 위젯이 제품이라고 믿지 않는 전적인 이유다. 그것은 흩어진 그 이름들이 한 사람이라는 것을 전혀 알지 못한다. 그것에는 시간에 대한 모델이 없다 — 그 남자가 그 자리를 얻기 전 여러 해 동안 평범한 시민이었다는 사실 말이다. 그리고 그것에는 방금 생성한 문장이 실제로 출처에 근거하는지 확인할 메커니즘이 없다. 중요하지 않은 질의에서는 괜찮다. 독자가 실제로 관심을 두는 질의, 즉 종단적 질의, 세월에 걸친 사람과 돈에 관한 질의에서는, 가장 버텨 줘야 할 바로 그 지점에서 무너진다.

왜 RAG가 이것을 그냥 해결해 주지 못했을까?

왜냐하면 "RAG"는 역량이 아니라 범주를 가리키며, 그 작업의 어려운 60%는 아무도 팔지 않는 부분이기 때문이다.

내가 — 그것도 심하게 — 과소평가한 첫 번째는 인제스트(ingestion)였다. 나는 30년치 아카이브가 임베딩만 기다리는 깨끗한 코퍼스일 거라 넘겨짚고 들어갔다. 아니었다. 그것은 세 번의 CMS 이전을 거치며 뭉개진 20년치 HTML, 아무 데도 가리키지 않는 죽은 내부 링크, 그리고 오직 스캔된 마이크로필름으로만 존재하는 2005년 이전 층이었다. 그 스캔본에 평범한 OCR을 돌리자, 헤드라인과 본문 단, 사진 캡션이 하나의 뒤죽박죽 덩어리로 뭉쳐져 돌아왔다. OCR이 페이지 레이아웃을 볼 수 없었기 때문이다. 우리는 레이아웃 인식(layout-aware) 광학 문자 인식 — 단을 감지해 헤드라인을 캡션에서, 캡션을 본문 텍스트에서 분리해 내는 종류 — 을 Amazon Textract와 Azure Document Intelligence 같은 도구로 들여와야 했다. 그것이 전체가 제대로 작동하느냐를 좌우하는 볼품없는 작업이며, 모든 챗봇 벤더가 견적에서 빼놓는 바로 그 항목이다.

두 번째는 그 시의원 문제였는데, 여기에는 이름이 있다: 개체 해소(entity resolution). AI가 한 인물에 관해 추론하려면, 그 인물에 대한 모든 언급 — 모든 바이라인 변형, 모든 경칭, 모든 우회적 지칭 — 이 하나의 노드로 수렴해야 한다. 우리는 진지한 업체들이 하는 방식으로, 즉 지식 그래프로 이를 해결했다: Neo4j 위에 얹은 마이크로소프트의 오픈소스 GraphRAG에, 그래프 데이터 사이언스 라이브러리가 명확화(disambiguation)를 수행하게 하여 "Mr. Musk", "Elon Musk", "the Tesla CEO"가 셋이 아니라 하나의 개체가 되도록 했다. 이 분야의 한 구현체는 1,200만 노드에 이르렀다. 기본 상태로는(out of the box) GraphRAG는 당신의 지역 정치 담당 영역이나 반복 등장하는 쉰 명의 취재원에 대해 아무것도 모른다. 아카이브 특유의 인물을 그것에 가르치는 일은 맞춤 작업이며, "텍스트상 유사한 청크"를 "한 인물의 실제 내력"으로 바꾸는 바로 그 작업이다.

벡터 검색은 비슷하게 들리는 구절을 찾는다. 지식 그래프는 두 구절이 같은 인간에 관한 것임을 안다. 독자는 인간에 관해 묻는다.

세 번째는 시간이었다. 뉴스는 본질적으로 시간적이다 — 서로 다른 사람이 맡는 같은 직책, 회기마다 개정되는 같은 법안, 합병 전후의 같은 회사. 우리는 그래프 엣지에 유효-시작(valid-start)과 유효-종료(valid-end) 타임스탬프를 부여하고, "법안이 통과되었을 때 누가 위원회를 주재했는가" 같은 질문을 시간적 하위 질의로 분해하며, 지난 한 해에 걸쳐 등장한 시간적 RAG(temporal-RAG) 연구(T-GRAG와 VersionRAG 계열의 작업)를 활용한다. 그것이 없으면 엔진은 역사를 하나의 혼란스러운 현재로 납작하게 눌러 버리는데, 이것이 바로 어떤 평범한 시민이 실제로 선출되기 여러 해 전에 공직을 맡았다고 단언하게 되는 정확한 방식이다.

모든 발행사의 RFP에 들어가야 할 문구: 날조된 인용문에 대한 책임은 누구에게 있는가?

내가 어느 슬랙 유출본을 경고성 사례로 우리 팀 앞에서 소리 내어 읽게 만든 순간이 여기 있다.

2024년 11월 워싱턴 포스트는 Ask The Post AI를 출시했다. 2025년 말에는 이를 AI 생성 팟캐스트로 확장했고, 12월에 그 표준 담당 편집자의 내부 메시지가 유출됐다: 그것은 인용문을 지어내고, 출처를 잘못 귀속시키며, 마치 신문사 자체의 편집 입장인 양 논평을 끼워 넣고 있었다. "이것이 애초에 진행되도록 허용되었다는 것 자체가 정말이지 경악스럽다"라고 한 편집자는 썼다 (Semafor, 2025년 12월 11일). 기술적 결함은 작고 구체적이었다 — 인용 검증 단계 하나가 빠진 것. 평판 피해는 전 세계적이었고, 그것도 지구상에서 가장 자원이 풍부한 뉴스룸 중 하나에서 벌어졌다.

나는 그 유출된 메시지를 가까이 둔다. 이 분야 전체에서 구할 수 있는 가장 값싼 교훈이기 때문이다. 포스트에는 엔지니어가 있었다. 그 워크플로에서 그들에게 없었던 것은, 문장 속 모든 주장이 검색된 출처로 추적되지 않는 한 그 문장을 내보내기를 거부하는 강제(enforcement) 계층, 그리고 불안정한 답변을 공개 전에 사람 검토 큐로 보내는 신뢰도 임계값, 나아가 이사회급 질문에 대한 분명한 답이었다: 기계가 인용문을 날조할 때, 책임은 누구에게 있는가? 그런 거버넌스는 포장돼 파는 소프트웨어가 아니다. 그것은 당신의 제호 아래 내걸 수 있는 도구와 전 세계적 망신 사이의 차이다.

이를 Ask FT와 대조해 보라. 파이낸셜 타임스는 이를 Anthropic의 Claude 위에 구축했고, 오직 FT 저널리즘에 엄격히 근거하며 출처 기사로 되돌아가 연결되는 필수 인용을 달았다. 주목할 점은, 그것이 모두가 두려워한 구독 잠식이 아니라 유지율 상승을 만들어 냈다는 것이다. 두 결과의 차이는 모델 품질이 아니다. 그것은 인용 강제를 나중에 덧붙일 기능으로 취급했는가, 아니면 제품 그 자체로 취급했는가의 문제다.

그냥 사거나, FT가 한 것처럼 만들면 안 되는 이유는?

사람들이 끊임없이 이것을 내게 묻는다. 그러니 솔직하게 지형을 펼쳐 보이겠다. 나는 발행사들이 그 잘못된 답들 하나하나에 자금 여력(runway)을 잃는 것을 지켜봐 왔기 때문이다.

SaaS 챗봇 벤더들은 $60K-$120K에 당신의 사이트에 위젯 하나를 떨어뜨려 놓는다. 그것이 무엇을 사 주는지는 이미 말했다: 벡터 임베딩, 개체 해소 없음, 시간적 추론 없음, 인용 검증 없음, 그리고 남의 클라우드에 사는 당신의 아카이브. 그것은 정확히 중요한 그 질의들에서 환각을 일으킨다.

빅5 자체 구축물 — FT, 타임스, 블룸버그, 포스트, 가디언 — 이들은 실재하며 인상적이고, 6명에서 20명 규모의 ML 팀이 12개월에서 24개월에 걸쳐 구축했으며, 7자리 수 비용이 들었다. 1~3명 규모 엔지니어링 팀을 둔 지역 일간지는 그 인력 규모를 복제할 수 없다. 논의 끝. 중견 발행사에게 "FT처럼 만들라"고 말하는 것은 그들에게 없는 장기(臟器)를 키우라고 말하는 것이다.

대형 컨설팅 회사들 — 액센츄어, 딜로이트, IBM — 이들은 분명히 그것을 구축할 것이다, $1.5M에서 $5M 이상에 이르는 계약과 당신의 자금 여력보다 오래가는 디스커버리 단계와 함께. 그들은 우리와 같은 마이크로소프트 GraphRAG와 Neo4j 스택에 손을 뻗은 뒤, 그 위에 파트너급 요율을 얹으며, 발행사 아카이브를 다섯 개나 연이어 구축해 어디에 문제가 숨어 있는지 알 만큼의 경험은 없다.

그 간극 — 작동하지 않는 위젯과 인력을 댈 수 없는 7자리 수 규모 팀 사이의 간극 — 이 바로 중견 발행사가 볼품없는 인제스트, 개체 해소, 인용 강제 작업을 이미 해낸 구축 파트너를 필요로 하는 전적인 이유다. SaaS 구독도 아니고, 디스커버리 발표 자료도 아니다. 그것은 우리가 우리 발행사 실무를 만들어 낸 구체적인 대상이며, 그 전모는 다음에 정리되어 있다: 뉴스 아카이브 위에서 작동하는 대화형 AI에 관한 우리 솔루션 페이지.

대부분의 컨설팅 회사가 틀리는 부분: 당신에게는 하나가 아니라 두 개의 매출 플레이가 필요하다.

세 가지 발행사 매출 플레이 — 유지 엔진, 크롤 포획, 유료 인텔리전스 계층 — 이 하나의 매출 모델로 수렴한다.

내가 똑똑한 발행사조차 저지르는 것을 목격하는 전략적 실수는 이것이다. 그들은 "우리만의 AI를 만든다"와 "우리 콘텐츠를 AI 회사에 라이선싱한다"를 양자택일로 취급한다. 둘 다이며, 각각 다른 돈을 포획한다.

당신 자신의 대화형 엔진은 유지 플레이다 — 그것은 독자가 Perplexity로 이탈하는 대신 당신 사이트에 머물며 당신의 아카이브에 질문하도록 붙잡아 둔다. 하지만 그것은 지금 이 순간 벌어지는 유출, 즉 AI 크롤러가 당신의 콘텐츠를 공짜로 삼켜 가는 문제에 대해서는 아무것도 하지 못한다. 그것을 위해서는 포획 플레이가 필요하며, 그것을 위한 인프라는 이제 막 구축되었다.

Cloudflare는 2026년 1월 Pay Per Crawl을 출시해, 전체 웹 트래픽의 약 20%에 걸쳐 AI 크롤러를 기본 차단하고, 발행사가 크롤러별로 요청당 가격에 Allow, Charge, Block을 설정할 수 있게 했다 — 최초의 인프라 수준 봇 과금이다. Tollbit은 봇 단위로 비슷한 일을 한다; 보스턴 글로브, Vox, Future가 이를 시범 도입했다. 그리고 2026년 3월 News/Media Alliance는 ProRata와 계약을 맺어, 2,200개의 중소 발행사가 집단 라이선싱 풀에 참여할 수 있게 했다. 그 조건은 50/50 매출 배분이며, 귀속(attribution)이 추적되는 AI 답변에 적용되고, 기업용 RAG 활용을 위한 Bria와의 병행 계약도 함께한다. NMA는 지역 일간지가 혼자서는 결코 인력을 댈 수 없는 서류 작업을 처리한다.

크롤러 통행료는 크롤 매출을 포획한다. 그것은 질의 매출에 대해서는 아무것도 하지 못한다. 정직한 답은 통행료와 유지 엔진을 둘 다 운영하는 것이다 — 하나만 고르라고 말하는 사람은 마침 자기가 만든 절반을 당신에게 팔고 있는 것이다.

내가 늘 덧붙이는 단서 하나: 포획 도구 중 어느 것도 AI Overviews가 당신을 요약하는 것을 막지는 못한다. 그것들은 크롤 시점이 아니라 질의 시점에 검색하기 때문이다. 유출과 요약은 별개의 문제다. 하지만 크롤 쪽에서 Tollbit이나 Cloudflare를 운영하고, 라이선싱 쪽에서 ProRata에 참여하며, 유지 쪽에서 자체 엔진을 운영하는 발행사는 마침내 세 개의 부분적 답에서 하나의 비즈니스 모델을 다시 세운 것이다. 그것이 전체 전략이며, 그 네 시스템 — ProRata, Bria, Tollbit, Cloudflare — 을 엔진과 나란히 하나의 일관된 매출 계획으로 꿰매는 것이 우리가 실제로 하는 일의 대부분이다.

그리고 나는 무역·B2B 전문 발행사에게 가장 강하게 밀어붙이는 세 번째 플레이가 있다. 상방이 가장 큰 것이기 때문이다: 엔진은 유지의 해자일 뿐 아니라, 당신이 대가를 매길 수 있는 제품이다. 깊은 버티컬 아카이브 위의 인용 근거 질의 인터페이스 — 당신의 특정 담당 영역에 관한 30년치 법원 제출 서류, 신약 승인, 또는 딜 데이터, 즉 컴플라이언스 담당자나 애널리스트가 질의하려고 좌석 하나를 경비 처리할 종류의 코퍼스 — 는 유료 인텔리전스 계층이며, 나아가 API인데, 경쟁사는 당신의 코퍼스를 소유하지 않았기에 문자 그대로 그것을 생성할 수 없다. 그것이 FT가 고가 영역에서 수천 달러 이상의 프로페셔널 계층으로 취한 수이고, 블룸버그가 평범한 영어를 실적 발표 콜과 리서치 전반에 걸친 자체 질의 언어로 바꾸는 시스템으로 취한 수다. 무역 전문지는 더 좁고 더 깊은 아카이브 위에서 같은 기회를 깔고 앉아 있으면서, 대부분 아직 그것을 알아차리지 못했다.

제대로 작동할 때 이것이 어떤 모습인지

6단계 발행사 RAG 파이프라인: OCR, 개체 해소, 시간적 추론, 하이브리드 검색, 재순위화, 인용 강제.

우리의 시의원 재앙에서 살아남은 엔진은 첫 번째 것과 전혀 닮지 않았다. 그것은 페이지를 존중하는 레이아웃 인식 OCR로 아카이브를 인제스트한다. 그것은 개체를 지식 그래프로 해소하여 한 인물이 흩어진 수십 개 언급이 아니라 하나의 노드가 되게 한다. 그것은 시간에 걸쳐 추론하여 역사가 현재로 납작하게 눌리지 않게 한다. 그것은 하이브리드 검색을 돌린다 — 희소 키워드 매칭(BM25)을 밀집 의미 검색과 나란히 두는데, "Bill 402"에 대한 질의는 어떤 임베딩도 안정적으로 표면화하지 못할 정확한 매치가 필요하기 때문이다 — 그리고 후보들이 모델에 닿기 전에 재순위화하는데, Cohere나 BGE 재순위기가 50~200밀리초의 지연을 대가로 검색 품질을 15~30% 사 준다. 중요한 질의에서라면 나는 매번 감수할 거래다. 그리고 그것은 구조적으로, 인용할 수 없는 주장은 내보내기를 거부하며, 불확실한 것은 독자가 아니라 편집자에게 보낸다.

그것은 또한 발행사가 이미 운영 중인 어떤 CMS에든 볼트처럼 결합되는데, 그 통합은 결코 범용적이지 않다. Arc XP는 콘텐츠 API는 노출하지만 임베딩 훅은 없어서, 그 곁에 나란히 구축해야 한다. WordPress VIP는 커스텀 엔드포인트를 등록할 수 있게 해 준다. Brightspot은 더 유연하다. 학술 발행사가 쓰는 Atypon은 자체 검색이 있어 그 옆에 앉아야 한다. 이 다섯 가지를 모두 겪어 본 구축자는 각각이 어디서 당신과 맞서 싸우는지 안다.

가장 빠르게 이동하는 뉴스룸들은 이미 그 방향을 느끼고 있다 — 산출물에서 38% 줄어든 상품화된 일반 뉴스는 쳐내고, 91% 늘어난 독자적 탐사 보도와 82% 늘어난 맥락적 분석에 노력을 쏟는다 (로이터 저널리즘 연구소). 그 독특한 작업의 아카이브야말로 AI 회사가 생성할 수 없고 경쟁사가 복제할 수 없는 유일한 자산이다. 실수는 요약기들이 그것을 수익화하는 동안, 그것을 서버에 그대로 놔둔 채 공짜로 색인되게 두는 것이다.

그 지역 일간지의 CFO는 구글이 자신에게 무엇을 빚졌는지 물었다. 더 나은 질문, 더 많은 발행사가 먼저 던졌으면 하는 질문은, 다음의 경우에 그들 자신의 아카이브가 얼마의 가치를 지니는가이다 — 즉 그들이 그것을 읽는 엔진을 통제할 때 말이다. 32년치 보도는 지구상 어떤 모델도 학습하지 않은 독점 코퍼스다 — 그리고 그것을 독자가 계속 나누려고 돈을 낼 대화로 바꿀 수 있는 유일한 사람은 그것을 소유한 사람이다. 우리가 그것을 처음부터 끝까지 어떻게 구축하는지는 여기에서 확인할 수 있다. 아카이브는 언제나 자산이었다. 달라진 것은, 당신이 마침내 그것을 거저 내주기를 멈춰야 한다는 점이다.

관련 연구

다른 채널에도 게시됨

확신을 가지고 AI를 구축하세요.

차세대 엔터프라이즈 AI 구축에 깊은 경험을 갖춘 팀과 협업하세요. 신뢰할 수 있는 AI 전략을 설계하고 구축하며 배포할 수 있도록 지원해 드리겠습니다.

Veriprajna 딥테크 컨설팅 은(는) 헬스케어, 금융, 규제 분야를 위한 안전 필수 AI 시스템 구축을 전문으로 합니다. 당사의 아키텍처는 확립된 프로토콜에 따라 검증되며 포괄적인 규정 준수 문서를 갖추고 있습니다.