
AI 쇼핑 어시스턴트는 전환율 4배 — 단 하나를 지어내기 전까지는
데모는 완벽했다. 한 쇼핑객이 우리 AI 쇼핑 어시스턴트에게 영상 편집용으로 노트북 두 대를 비교해 달라고 요청하자, 어시스턴트는 두 대를 실제로 써 본 인내심 있는 판매원처럼 답했다 — RAM, 색 정확도, 발열, 그 모든 것을. 방 안의 모두가 고개를 끄덕였다. 그러다 조용한 파일럿을 시작한 지 몇 주 뒤, 나는 대화 기록 로그를 훑어보다가 바로 그 어시스턴트가 어느 고객에게 노트북이 32GB 메모리를 탑재해 출고됐다고 말하는 것을 목격했다. 그것은 16으로 출고됐다.
시스템의 그 무엇도 이를 문제로 표시하지 않았다. 그 문장은 문법적으로 완벽했고, 자신감 있었으며, 도움이 되는 것처럼 들렸다. 하지만 그것은 틀렸고, 만약 그 고객이 렌더링용으로 그 기기를 샀다가 성능이 버티지 못했다면 곧바로 반품, 별 하나짜리 후기, 그리고 "그들의 AI가 나에게 말했다"로 시작하는 불만 문장이 되어 우리에게 돌아왔을 그런 방식으로 틀렸다. 바로 그 오후, 나는 전자상거래 AI의 진짜 문제를 깨달았다. 위험은 멍청하게 들리는 모델이 아니다. 옳게 들리지만 틀린 모델, 즉 스택의 그 무엇도 그 답을 진실과 대조해 확인하지 않기에 틀린 모델이야말로 위험이다.
잘 읽히는 답과 실제로 참인 답 사이의 그 간극 — 그것을 메우는 일로 이제 우리 팀은 먹고산다. 어떻게 하는지 설명하기 전에, 왜 더 똑똑한 모델이 결코 우리를 구해 주지 못했을지부터 이야기하겠다.
나를 속인 데모
나는 대부분의 엔지니어링 리더가 믿는 것을 믿으며 리테일 AI에 들어왔다. 즉 환각은 모델 품질 문제이고, 모델 품질은 우상향하고 있으니, 두 분기만 기다렸다가 다음 체크포인트로 교체하면 문제는 저절로 풀린다는 믿음이었다.
그 수치들은 그 낙관론을 뒷받침하는 듯하다, 어느 순간 아니게 되기 전까지는. 구글의 최고 성능 모델은 대략 0.7%의 일반 상식 답변에서 환각을 일으킨다. 대부분의 모델은 1~3%에 머문다. 하지만 평균은 일반 상식 전반에 걸쳐 9.2%이며, 한 업계 분석에 따르면 AI 실패의 82%는 충돌이나 시간 초과가 아니라 환각이나 허위 정보다. 그래서 좋은 모델에서조차 자신감 넘치는 제품 주장 100개 중 대략 하나는 지어낸 것이며, 당신은 하루에 그런 주장을 수천 건씩 내보내고 있다.
1%의 환각률은 A학점처럼 들린다. 주당 100만 건의 제품 답변 — 중간 규모 카탈로그의 물량 — 이라면, 그것은 당신 브랜드 이름이 붙은 자신감 넘치는 오답 문장 1만 개를 뜻한다.
모델 품질 이야기가 완전히 놓치는 부분이 바로 이것이다. 틀린 답과 옳은 답은 똑같은 기계에서, 똑같은 유창함과 똑같은 어조, 똑같은 자신감으로 나온다. 모델은 자신이 거짓말하고 있다는 것을 전혀 알지 못한다. "카탈로그와 대조해 검증된 16GB"를 "포럼 게시물에서 패턴 매칭된 32GB"와 구분해 주는 내부 신호는 존재하지 않는다. 그 신호를 원한다면, 모델 바깥에서 그것을 구축해야 한다. 더 똑똑한 체크포인트를 기다린다고 그 신호가 생기지는 않는다. 그저 틀린 답을 더 유창하게 만들 뿐이다.
더 나은 가드레일은 왜 이를 해결하지 못했나?
그래서 우리는 뻔한 방식으로 그 신호를 구축하려 했고, 솔직히 말하면 그 뻔한 방식을 밀어붙인 사람이 바로 나였다.
내 첫 본능은 프롬프트 기반 안전장치에 키워드 필터링을 더하는 것이었다. 시스템 지침에 이렇게 지시하는 것이다. 확인할 수 있는 사양만 언급하고, 의료나 안전 관련 조언은 절대 하지 말며, 위험한 것은 무엇이든 거부하라. 명백히 유해한 용어를 잡아내는 필터를 추가하라. 저렴하고 빠르며, 테스트에서는 빈틈없어 보였다. 나는 출시를 주장했다. 우리는 출시했다.
그것은 검색 계층이 권위 있어 보이는 무언가를 공급하기 전까지는 버텼다. 이런 시스템 대부분이 작동하는 방식은 검색 증강 생성(RAG) — 어시스턴트가 관련 문서(당신의 카탈로그, 때로는 공개 웹)를 가져와 그것을 바탕으로 답을 작성하는 것이다. 아무도 경고해 주지 않는 함정은 검색 계층이 새로운 콘텐츠를 끌어오면, 모델이 그 콘텐츠를 자신의 안전 지침보다 더 권위 있는 것으로 취급한다는 점이다. 아마존의 루퍼스(Rufus)가 공개적인 경고 사례다. 검색이 상충하는 웹 출처를 드러냈고 모델의 학습 데이터가 카탈로그를 덮어썼기 때문에, 루퍼스는 쇼핑객에게 슈퍼볼이 엉뚱한 도시에서 열린다고 말했다. 더 나쁘게는, 평범한 제품 질의를 통해 사용자에게 화염병 제조법을 단계별로 안내하기까지 했다 — 탈옥도, 교묘한 프롬프트도 없이, 그저 모델이 자신의 가드레일보다 신뢰하기로 결정한 검색된 웹 콘텐츠였을 뿐이다.
그것은 내 사고 모델을 무너뜨렸다. 내가 지지했던 가드레일은 벽이 아니었다. 그것은 그와 모순되는 무언가를 읽는 순간 시스템이 기꺼이 무시해 버릴 제안에 불과했다. 키워드 필터링은 조잡한 사례는 잡았지만 의미상 동일한 것들은 그대로 지나쳤다. 나는 누군가 더 자신감 있는 종이를 문 밑으로 밀어 넣을 때마다 열리는 자물쇠를 출시한 셈이었다.
프롬프트 기반 안전장치는 금고에 붙인 포스트잇이다. 모델이 더 권위 있어 보이는 포스트잇을 읽기 전까지만 작동한다.
리테일 AI가 망가지는 세 가지 방식 — 그리고 아무도 기록하지 않는 네 번째

이것을 모델 문제로 취급하기를 멈추자, 실패들은 소수의 구조적 형태로 스스로 정리되었고, 널리 알려진 모든 대형 참사는 그중 하나가 규모만 커진 것에 불과했다.
가장 흔한 형태는 환각으로 지어낸 제품 정보 — 즉 16GB였던 것이 32GB가 되는 문제다. 이는 시스템이 그럴듯한 사양을 생성하고, 쇼핑객이 그것을 보기 전에 그 사양을 실측 기준 기록과 대조하는 것이 아무것도 없기 때문에 발생한다. 그 비용은 추상적이지 않다. 쇼핑객의 46%만이 AI 추천을 전적으로 신뢰한다고 말하며, 89%는 검증한다, 어시스턴트가 자신에게 말해 주는 것을 구매하기 전에 말이다. 지어낸 세부 사항 하나하나가 회의론자의 생각을 확증시켜, 그들을 수동 검색이나 경쟁사로 돌려보낸다.
그다음은 방금 설명한 안전장치 우회다 — 검색이 가드레일을 덮어쓰는 것. 상거래에서 이것은 일반적인 콘텐츠 검열보다 더 첨예하다. "이 보충제가 내 혈액 희석제와 상호작용할까요?"는 콘텐츠 질문이 아니라 제조물 책임 질문이기 때문이다. 그것에 자신 있게, 그러나 틀리게 답하는 어시스턴트는 그 어떤 전환율 상승도 무색하게 만드는 법적 리스크를 만들어 낸 것이다.
세 번째 형태를 나는 거래 무능력이라 부르겠다. AI는 설명은 할 수 있다 — 당신의 반품 정책을. 하지만 처리는 못 한다 — 반품을. AI는 실제로 조회할 수도 없는 주문에 대해 이야기할 수 있다. 루퍼스는 아마존의 반품을 설명할 수는 있었지만 하나도 실행하지 못했다. 클라르나(Klarna)는 훨씬 더 큰 청구서를 받으며 같은 교훈을 얻었다. 그들은 약 700명의 상담원을 AI로 대체했고, 이를 230만 건의 대화에 걸쳐 운영하며, 처음에는 그 부하를 잘 처리했다고 주장했다 — 그러다 정작 중요한 사례들(다단계 해결, 감정적 분쟁, 실제 계정 변경이 필요한 모든 것)에서 서비스 품질이 떨어졌고, CEO는 그 타격을 공개적으로 인정했으며, 2026년에는 사람을 다시 채용하고 있었다. 후회하는 것은 그들만이 아니다. 기업의 55%가 AI 주도로 정리해고를 단행했다가 이제 와서 잘못했다고 말한다.
그리고 오류 로그에는 전혀 나타나지 않는 실패가 있다. 코넬 테크(Cornell Tech)는 여러 영어 방언에 걸쳐 루퍼스를 테스트했고, 아프리카계 미국인 영어, 치카노 영어, 인도 영어에 대해 체계적으로 더 나쁜 답변이 나온다는 것을 발견했다. "이 재킷 세탁기 가능?"이라고 묻는 쇼핑객 — 연결 동사를 생략하는, 완벽히 표준적인 아프리카계 미국인 영어 구문이다 — 은 답이 되지 못하는 답변이나 무관한 제품으로의 안내를 받았다. 당신의 대시보드는 이것을 결코 잡아내지 못할 것이다. 시스템이 오류를 낸 것이 아니라, 그저 조용히 당신 고객의 상당 부분에게 더 나쁜 매장을 제공했기 때문이다. 나는 이제 그 방언들에서의 어시스턴트 답변을 표준 영어와 나란히 놓고 점수를 매기는 평가 그리드를 유지하는데, 다른 그 무엇도 이 격차를 드러내지 못하기 때문이다.
그렇다면 어떻게 답을 참으로 만들 것인가?

가드레일이 실패한 뒤의 전환은, 말로는 거의 민망할 만큼 단순하지만 구축하기는 정말로 어려웠다. 모델에게 신뢰할 만하기를 요구하지 말고, 모델과 고객 사이에 검증 계층을 두어 모든 답변이 나가기 전에 실측 기준과 대조해 확인하라.
구체적으로 이는, 검증된 사양, 가격, 재고, 정책을 권위 있는 기록으로 보유하는 제품 지식 그래프와, 모델의 답변을 가로채 그 안의 확인 가능한 주장을 추출하고 각각을 그 그래프와 대조해 확인하는 미들웨어 계층을 뜻한다. 이것은 변방의 아이디어가 아니다 — 월마트는 자체적인 리테일 그래프(Retail Graph), 즉 제품 지식 그래프를 구축했는데, 바로 그 AI가 생성할 추측이 아니라 답할 실측 기준을 갖도록 하기 위해서였다. 정말로 어려운 부분은 조회가 아니라 개체 명확화다 — 동일한 SKU가 당신의 카탈로그 전반과 로케일 전반에서 서로 다른 표면 형태로 나타나기 때문에, 계층은 먼저 어느 기록을 모델의 주장이 실제로 가리키는지를, 확인에 앞서 판별해야 한다. 이를 잘못하면 엉뚱한 제품과 대조해 검증하게 되는데, 이는 아예 검증하지 않는 것보다 더 나쁘다. 하지만 일단 제대로 되면: 모델이 32GB라고 하는데 그래프가 16이라고 하면, 그 주장은 결코 쇼핑객에게 도달하지 않는다. 모델이 어떤 주장을 검증된 출처에 근거시키지 못하면, 어시스턴트는 더 지어내기보다 덜 말한다. 카탈로그가 이미 아는 사실에 대해 개방된 웹이 더 이상 표를 행사하지 못하므로, 검색 덮어쓰기 문제는 해소된다.
화려하지 않은 전제 조건은 데이터다. 가트너는 2026년까지 조직들이 AI 프로젝트의 60%를 포기할 것으로 전망한다 — AI에 준비된 데이터로 뒷받침되지 않는 프로젝트를 말이다. 그리고 대부분의 리테일 데이터는 준비되어 있지 않다. 내가 열어 본 제품 정보 관리 시스템들은 대개 30~40%의 속성 완전성을 롱테일 SKU에서 보인다. 다섯 개 필드 중 두 개가 비어 있는 카탈로그에는 어시스턴트를 근거시킬 수 없다. 그것은 추측으로 그 구멍을 메울 텐데, 이는 바로 당신이 없애려는 행동이다. 그래서 실제 작업의 상당 부분은 그 데이터를 기계가 소비할 수 있도록 구조화하는 일을, 먼저 단 하나의 답변이라도 검증되기 전에 끝내는 것이다. 우리가 구축하는 계층이 바로 이것이다 — 대규모 언어 모델과 당신의 스토어프론트 사이에 자리하는 검증, 근거화, 컴플라이언스 배관 — 그리고 전체 아키텍처는 veriprajna.com/solutions/ecommerce-ai-accuracy에서 확인할 수 있다.
모델의 임무는 유창한 것이다. 검증 계층의 임무는 옳은 것이다. 이 둘을 뒤섞는 것이 바로 이 모든 시스템이 실패하는 방식이다.
AI가 하는 모든 말은 당신의 책임이다
내가 이 문제에 타협하지 않는 이유는, 챗봇의 실수가 누구의 문제인지 법이 이미 결정했고, 그 답이 바로 당신이기 때문이다.
에어캐나다의 챗봇은 존재하지도 않는 사별 환불 정책을 지어냈다. 항공사가 심판소에서 그 챗봇이 별개의 법적 실체로서 자신의 발언에 책임이 있다고 주장하자, 심판소는 이를 단칼에 기각하고 회사에 손해배상 책임이 있다고 판결했다. 금액은 작다 — 812 캐나다 달러 — 하지만 판례는 엄청나다. 이제 법원은 당신의 AI가 고객에게 하는 모든 말이 당신의 책임이라고 평이한 언어로 말한 것이다. 나는 어느 법무팀이 그 판결문을 한 줄짜리 제목과 아무 논평 없이 돌려 보는 것을 지켜봤는데, 그 함의에는 논평이 필요 없기 때문이다. 어느 쇼피파이(Shopify) 판매자는 8,000달러 넘게 어시스턴트가 제공할 권한도 없는 하와이 무료 배송을 태연히 약속하는 바람에 손해를 봤다고 전해진다. 그 약속은 법적으로 그 판매자의 약속이었다.
이 모든 것 아래에서 규제의 최저선이 높아지고 있다. EU AI법은 2026년 8월 2일에 전면 시행된다. 그리고 이는 EU 고객을 상대하는 모든 기업에 적용된다 — 본사가 다른 곳에 있다고 해서 면제받지는 못한다. 이 법은 AI가 생성한 콘텐츠에 라벨을 붙이고 사용자에게 자신이 AI와 상호작용하고 있음을 알릴 것을 요구하며, 최대 3,500만 유로 또는 전 세계 연간 매출의 7%의 벌금을 부과한다. 미국에서는 FTC가, AI를 이용해 오도하거나 기만하는 것은 AI라는 예외 없이 이미 불법이라고 분명히 밝혔으며, FTC의 소비자 후기 규칙은 기만적인 AI 생성 후기를 금지한다. 여기서 컴플라이언스는 마지막에 덧붙이는 체크박스가 아니다. 투명성과 라벨링은 첫 커밋부터 검증 계층에 속하는 설계 제약이다.
내가 가장 많이 듣는 반론들
사람들은 새로운 에이전틱 커머스 프로토콜이 이 모든 것을 무의미하게 만드는지 나에게 묻는데 — 타당한 질문이다. 에이전트는 이미 대규모로 여기 와 있기 때문이다. 디지털 구매 다섯 건 중 한 건이 이제 AI 에이전트를 통해 이뤄지며, 사이버 위크 2025 한 주에만 대략 670억 달러가 그렇게 움직였다. 구글은 유니버설 커머스 프로토콜(Universal Commerce Protocol)을 2026년 1월 NRF에서 쇼피파이, 엣시, 웨이페어, 타깃, 월마트와 함께 선보였고, OpenAI에는 에이전틱 커머스 프로토콜(Agentic Commerce Protocol)이 있는데, 그 인스턴트 체크아웃 시도가 활성화된 판매자 열두 곳 남짓으로 흐지부지된 뒤에 나온 것이다. 이것들은 실재하며 통합할 가치가 있다. 하지만 자세히 읽어 보면 이들은 발견 우선 — 에이전트가 당신의 제품을 찾아 추천하게 하는 데는 탁월하지만, 지저분한 거래의 뒤끝, 즉 반품, 교환, 보증 청구, 클라르나를 무너뜨린 다단계 해결에 대해서는 거의 아무 말도 하지 않는다. 프로토콜은 현관문을 옮길 뿐, 집을 채워 주지는 않는다.
또 다른 질문은 자체 구축이냐 구매냐이고, 내 솔직한 답은 "아마 둘 다 조금씩이며, 벤더가 당신에게 말한 것과는 다르다"이다. 발견 도구들 — 블룸리치의 루미(Loomi), 알골리아(Algolia), 코비오(Coveo)의 카탈로그 기반 제품 발견 — 은 발견에는 정말로 뛰어나지만, 당신이 깨끗한 데이터를 가져온다고 가정하고 도구 간 검증은 하지 않는다. 대부분의 리테일러는 이런 AI 시스템을 한 번에 서너 개에서 대여섯 개씩 돌리면서, 그것들 사이의 일관성을 확인하는 사람은 아무도 두지 않는다. 바로 그 이음매 — 다중 벤더 오케스트레이션에, 어느 벤더도 팔지 않을 독립적인 검증 계층(각자 자기 스택을 팔고 있기 때문이다) — 이 바로 실패가 사는 곳이다.
그리고 그렇다, 사람들은 검증 단계가 지연 시간을 늘린다고 걱정하는데, 그럴 만하다. 아마존은 100밀리초의 지연마다 매출이 약 1% 감소한다는 것을 측정했다. 그 제약은 실재하며, 공학적 해답이 있는 공학 문제다 — 생성물 전체가 아니라 확인 가능한 소수의 주장만 검증하고, 그래프 조회를 캐싱하며, 빠르게 덜 말하는 쪽으로 실패하라. 이것은 검증을 건너뛸 이유가 아니다. 틀린 100밀리초 답변은 옳은 200밀리초 답변보다 훨씬 더 큰 대가를 치른다.
실제로 4배를 벌어들이는 것은 무엇인가?
나에게 이 모든 것을 시작하게 한 통계는, 지금도 곱씹는 그 전환율 대시보드의 수치다. AI와 상호작용하는 쇼핑객은 12.3%로 전환하는 반면, 3.1%는 그렇지 않은 이들의 수치다. 네 배다. 이 숫자는 실재하며, 그래서 모든 리테일러가 앞다투어 배포에 나서고 있다. 하지만 이는 함정이기도 하다. 같은 비대칭이 반대로도 작동하기 때문이다 — 환각으로 지어낸 사양 하나, 지어낸 정책 하나, 스크린샷으로 찍혀 공유된 안전하지 않은 답변 하나면, 그 4배를 만들어 낸 신뢰는 쌓인 것보다 더 빠르게 증발한다.
이제 모델은 범용재다 — 모두가 같은 몇몇 제공업체로부터 지능을 빌려 쓰고 있으며, 모델은 분기마다 계속 더 유창해질 것이다. 4배를 벌어들인 것은 결코 유창함이 아니었다. 신뢰였다. 그리고 지어낸 사양 하나가 소진하는 것이 바로 그 신뢰다. 첫 어시스턴트를 배포하는 중이든, 지금 이 순간 프로덕션에서 어시스턴트가 환각을 일으키는 것을 조용히 지켜보고 있든, 검증 계층은 건너뛸 수 없는 부분이다 — 그것은 우리가 구축하는 바로 그것이며, 전문가처럼 들리는 어시스턴트와, 감독 없이 당신의 고객과 대화하도록 맡길 수 있는 어시스턴트 사이의 차이다.
앞으로 몇 년간의 상거래에서 승리하는 매장은, 노트북에 32기가바이트 메모리가 있느냐는 질문을 받았을 때 확인하고 — 16이라고 답하는 AI를 가진 곳이다.


