영업 대시보드의 스팸률 선이 빨간 0.3% 임계값을 넘어서고, 청구서와 비밀번호 재설정 이메일이 거부되어 반송되는 모습
Artificial IntelligenceSalesStartups

우리 AI 아웃바운드는 하루 1,000통씩 이메일을 보냈다. 그러다 우리 청구서가 도착하지 않기 시작했다.

Ashutosh SinghalAshutosh Singhal2026년 4월 29일13 min

무언가 잘못되었다는 첫 번째 징후는 영업 지표가 아니었다. 그것은 끝내 도착하지 않은 청구서였다.

한 고객이 왜 청구가 되지 않았느냐고 이메일로 물어왔다. 우리는 며칠 전에 청구서를 보냈다 — 공격적인 AI 아웃바운드 캠페인을 운영하는 데 사용해 온 바로 그 도메인에서 말이다. 청구서는 그들의 스팸 폴더로 간 것이 아니었다. Gmail이 문 앞에서 거부한 것이었다. 그리고 그 실마리를 파헤치기 시작하자, 우리의 비밀번호 재설정 이메일, 거래 확인 메일, 그리고 정당한 트랜잭션 메일의 상당 부분이 그것과 함께 전부 스로틀링되고 있음을 깨달았다.

그 주는 내가 AI SDR 세일즈 피치를 더 이상 믿지 않게 된 주였다. AI 세일즈 인텔리전스라는 발상 자체를 말하는 게 아니다 — 나는 여전히 그것이 아웃바운드가 나아갈 방향이라고 생각한다. 하지만 당시 모든 도구가 팔고 있던 그 구체적인 약속은 달랐다: 더 많은 이메일, 더 많은 개인화, 더 많은 파이프라인, 그저 자율 에이전트 하나만 추가하고 그것이 확장되는 걸 지켜보라는 것. 우리는 정확히 그렇게 했다. 그리고 검증 없는 물량은 만들어낸 것보다 훨씬 더 많은 파이프라인을 파괴했다.

이 글은 무엇이 망가졌는지, 왜 그것이 카피라이팅이 아닌 아키텍처 차원에서 망가졌는지, 그리고 우리가 결국 대신 무엇을 만들었는지에 관한 에세이다. 지금 AI SDR 도구를 평가하고 있거나, 90일 차 무렵에 무너진 배포에서 회복 중이라면, 이 글의 윤곽을 알아볼 수 있으리라 생각한다.

처음 30일은 언제나 훌륭해 보인다

아무도 이 부분에 대해 경고해 주지 않는다: 초기 수치는 정말로 좋다. 그것이 바로 이것을 위험하게 만드는 요소다.

AI SDR 도구는 초기 이메일 응답률을 인간 담당자보다 최대 50%까지 높게 기록할 수 있는데, 이는 대체로 어떤 인간도 따라올 수 없는 물량으로 발송하기 때문이다. 출시하면 대시보드에 불이 들어오고, 약 한 달 동안은 공짜 돈을 찾은 것 같은 기분이 든다. 우리도 그랬다. 팀에게 응답률 차트를 보여주며 다른 모든 사람들이 이걸 얼마나 늦게 알아차렸는지에 대해 은근히 우쭐했던 기억이 난다.

그러다 2차 효과가 복리로 쌓이기 시작하는데, 그것들은 당신이 보고 있는 대시보드에는 나타나지 않는다.

알아차릴 무렵이면, AI가 잡은 미팅은 전환되지 않고 있다. 2026년 업계 데이터에 따르면 AI의 미팅-대-적격-기회 전환율은 약 15%로, 인간 SDR의 25%에 대비된다. 그 격차는 하류로 갈수록 더 벌어진다: 인간 담당자는 2.6배 더 많은 매출을 AI가 잡은 미팅보다 창출하는데, 이는 더 적은 잠재고객을 접촉하면서도 그렇다. AI는 접촉하는 순간 죽어버리는 대화들로 캘린더를 채우고 있었다.

그리고 그것은 무해한 실패다. 비싼 실패는 발신함에서 벌어지고 있었는데, 우리 팀 그 누구도 그곳을 들여다보고 있지 않았다.

일어난 적 없는 마이그레이션을 언급한 이메일

어느 오후, 한 세그먼트의 낮은 응답률을 디버깅하다가, 나는 시스템이 실제로 무엇을 보냈는지 직접 읽어보았다. 설정 과정에서 우리가 승인했던 샘플이 아니라 — 실시간 출력물, 며칠 치를 말이다.

한 이메일은 잠재고객에게 그들의 "최근 Salesforce 마이그레이션"을 자신 있게 축하했다. 우리 인리치먼트가 스크래핑한 그들의 채용 페이지는 세 개의 공개 채용 공고에서 HubSpot을 명시적으로 나열하고 있었다. AI가 그 마이그레이션을 지어낸 것이다. 또 다른 이메일은 한 회사의 "APAC 진출"을 언급했는데 — 내가 재구성해 본 바로는, 오래전에 이미 철회된 2019년 보도자료에서 가져온 것이었다.

문법은 완벽했다. 그것이 상황을 더 나쁘게 만들었다. 오타는 걸러진다. 하지만 자신감 있고 잘 쓰였으며 사실관계가 틀린 문장은 곧장 임원(VP)의 받은편지함으로 항해해 들어가, 당신의 회사를 확인조차 귀찮아하는 회사로 낙인찍는다.

완벽한 문법은 위장이다. 그것이야말로 거짓 문장이 초안과 발송 사이의 모든 인간의 눈을 통과하게 만드는 요소다.

돌아가서 우리 출력물을 더 넓은 벤치마크와 대조해 감사해 보니, 딱 들어맞았다: 단일 패스 언어 모델은 잠재고객 특정 주장의 12~18퍼센트를 틀린다. 그 숫자를 물량과 함께 곱씹어 보라. 하루 1,000통이면, 매일 120~180통의 사실관계가 틀린 메시지가 임원의 받은편지함에 도착한다는 뜻이다 — 그리고 그 중 단 하나도 경보를 울리지 않았는데, 각각이 완벽하게 읽혔기 때문이다.

내가 만든 것은 대규모로 틀리기 위한 극도로 효율적인 기계였다.

왜 더 많은 개인화가 그것을 고치지 못했을까?

이것이 나의 첫 번째 잘못된 직감이었고, 나는 이것을 사내에서 강하게 주장했기 때문에 솔직해지고 싶다: 나는 문제가 우리가 충분히 개인화하지 않았다는 것이라고 생각했다.

데이터는 나를 뒷받침하는 것 같았다. 일반적이고 개인화되지 않은 템플릿은 1~3%로 응답한다. 시그널 기반 개인화 캠페인 — 실제적이고 구체적이며 시의적절한 트리거를 언급하는 아웃리치 — 은 15~25%로 응답한다. 그것은 대략 5배의 개선이며, 발신자 중 약 5%만이 모든 메시지를 개인화한다. 그래서 명백한 수순은 개인화를 더 강하게 밀어붙이는 것이었다: 더 많은 시그널, 더 깊은 리서치, 더 구체적인 훅.

그것은 모든 것을 더 나쁘게 만들었다.

더 많은 개인화는 AI가 말할 구체적인 무언가를 찾기 위해 소스 깊숙이 손을 뻗는다는 뜻이었다 — 그리고 깊이 뻗을수록, 더 많이 지어냈다. 개인화와 검증은 같은 것이 아닌데, 나는 그것들을 마치 같은 것처럼 취급해 왔다. 도구는 구매 시그널을 찾는 데는 탁월하면서도 그 시그널에 대해 쓴 문장이 참인지 확인하는 메커니즘은 전혀 없을 수 있다. 시장의 대부분이 정확히 이런 방식으로 만들어져 있다. 개인화는 제품이고, 검증은 고객의 문제다.

그것이 전환점이었지만, 돌파구처럼 느껴지지는 않았다. 기초가 잘못 부어졌다는 것을 발견한 느낌이었다.

Gmail이 스팸으로 보내는 것조차 멈추면 무슨 일이 벌어질까?

내가 카피 걱정에 바빴던 사이, 도달률의 지반이 우리 모두의 발밑에서 이동하고 있었다.

2025년 11월, Gmail이 규칙을 바꿨는데, 그 변화는 당신을 물기 전까지는 놓치기 쉽다. Gmail은 규정을 준수하지 않는 대량 메일을 스팸 폴더로 라우팅하는 것을 멈추고 SMTP 레벨에서 거부하기 시작했다 — 핸드셰이크 단계에서, 메시지가 수신자의 사서함에 존재하기도 전에 말이다. 당신의 이메일은 더 이상 스팸함에 도착하지 않는다. 아예 도착하지 않는다.

그 아래에서, Google의 RETVec 시스템은 개별 단어 선택이 달라지더라도 수천 개의 메시지에 걸쳐 AI 생성 텍스트 패턴을 탐지하므로, 카피를 돌려쓰는 것으로는 살아남을 수 없다. 그리고 그 임계값은 가혹하다: 0.3%를 초과하는 스팸 불만율은 도메인 평판 손상을 유발하며, 회복에는 발송이 제한된 채 6주에서 12주가 걸린다.

이것을 마케팅 문제에서 회사 문제로 바꿔놓은 세부사항이 여기 있는데, 이것은 우리가 출시하기 전에 누군가 내 앞에 놓아주었기를 바라는 것이다:

도메인 평판은 당신의 캠페인에 국한되지 않는다. 그것은 당신의 도메인에 국한된다. 콜드 아웃리치가 당신의 평판을 태울 때, 당신의 청구서, 비밀번호 재설정, 거래 확인도 함께 탄다.

그것이 바로 끝내 도착하지 않은 청구서다. 나는 우리의 Postmaster Tools 대시보드를 보며 스팸률 선이 저 빨간 0.3% 선을 향해 기어오르는 것을 마치 캠페인 KPI인 것처럼 지켜보고 있었다. 그것은 KPI가 아니었다. 그것은 회사가 보내는 모든 이메일의 건강 상태였다. 우리는 그 선을 넘었고, 이후 한동안 우리의 정당한 트랜잭션 메일이 안전하다고 들었던 아웃바운드와 바로 나란히 스로틀링되었다.

내 실수의 7,400만 달러짜리 버전

내가 이 모든 것을 기꺼이 적어두는 이유는, 훨씬 더 많은 자금을 받은 한 회사가 공개적으로 똑같은 실수를 저지르는 것을 지켜봤고, 그것이 이것은 Veriprajna의 실행 실패가 아니었다는 점을 내게 명확히 해주었기 때문이다. 그것은 하나의 전체 접근 방식의 종착점이었다.

2025년 3월, TechCrunch는 11x.ai가 — a16z와 Benchmark로부터 3억 5천만 달러 밸류에이션에 7,400만 달러를 투자받은 — 실제로 보유하지 않은 고객을 나열해 왔다고 보도했다. ZoomInfo의 로고가 11x 웹사이트에 걸려 있었는데, 정작 ZoomInfo는 단 한 달짜리 트라이얼만 운영했을 뿐이며, 그 기간 동안 제품이 인간 SDR보다 현저히 나쁘게 작동했다고 그들은 말했다. 전직 직원들은 초기 코호트에서 70~80퍼센트의 고객 이탈을 묘사했으며, 제품이 환각을 일으키고 일부 고객에게는 아예 로드되지 않기도 했다고 했다.

그 이탈 수치는 11x만의 이상 현상이 아니다. AI SDR 카테고리 전체가 연간 50~70퍼센트의 이탈률을 보인다. 사람들은 물량 약속을 사고, 내가 부딪힌 벽에 부딪히고, 떠난다. 더 넓은 패턴도 같다: 2025년에 42%의 회사가 자사 AI 이니셔티브 대부분을 포기했는데, 이는 전년의 17%에서 상승한 것이며, Gartner는 에이전틱 AI 프로젝트의 40% 이상이 2027년 말까지 폐기될 것으로 예상한다.

7,400만 달러의 자금도 대규모로 잘못된 정보를 보내는 제품을 덮어 가릴 수는 없다. 그것은 그저 같은 분화구의 더 비싼 버전을 살 뿐이다.

그 이야기를 읽은 순간이, 내가 문제에서 벗어나려고 튜닝하기를 멈추고 다른 전제에서부터 재구축해야 한다는 것을 받아들인 순간이었다.

아무도 깨알 같은 약관을 읽지 않는 법적 책임

정말로 예상하지 못했던 세 번째 실패 모드가 있는데, 그것은 법무 책임자를 벌떡 일어나게 만들어야 할 것이다.

표견대리 원칙에 따라, 당신의 회사를 대신해 행동하는 AI 에이전트는 그것이 말하는 바에 대해 당신을 구속할 수 있다. "100% 가동 시간 보장" 또는 "묻지도 따지지도 않고 전액 환불해 드리겠습니다"라고 입력하는 AI SDR은 집행 가능한 의무를 만들어내고 있을 수 있다. 규제 산업에서는, 그것은 나쁜 거래보다 더 나쁘다 — "우리는 FedRAMP 승인을 받았습니다"라고 환각하거나 컴플라이언스 인증을 지어내는 AI는 연방 조사를 촉발할 수 있다. 이것들은 변호사들이 당신의 속도를 늦추려고 제기하는 가상의 이야기가 아니다; 검증되지 않은 텍스트 생성기가 당신의 회사 목소리로 낯선 이들에게 말하도록 내버려 둔 것의 직접적인 결과다.

그리고 이에 대해 거버넌스를 하는 곳은 거의 없다. 2026년 기준으로, 기업 중 단 7%만이 에이전틱 특화 거버넌스 정책을 마련해 두고 있는데, 이는 GDPR 집행이 이제 EU에서 콜드 아웃리치에 대해 명시적이고 문서화된 동의를 요구함에도 그렇다 — 예전의 "정당한 이익"이라는 어깨 으쓱임을 훨씬 넘어서 말이다. 당신은 통계적으로 그 뒤에 아무런 정책 계층 없이 자율 에이전트가 시장을 향해 진술을 하도록 내버려 두고 있는 것이다.

우리가 대신 만든 것

두 개의 아웃리치 파이프라인: 단일 패스는 거짓 Salesforce 주장을 발송하고; 검증된 파이프라인은 팩트체크 단계에서 그것을 차단한다

이 세 가지 실패 — 환각된 사실, 도메인 붕괴, 법적 노출 — 를 나란히 놓고 보면, 그것들은 하나의 근본 원인을 공유한다. 그 중 어느 것도 카피라이팅 문제가 아니다. 그것들 모두는 동일한 아키텍처적 선택에서 비롯된다: 단일 언어 모델이 무엇이 참인지 결정하는 것과 발송 버튼을 누르는 것을 한 번의 패스로 동시에 하도록 내버려 두는 것.

그래서 우리는 끝단에 검사를 볼트로 조여 붙이기를 멈추고 검증을 아키텍처 그 자체 안으로 옮겼다.

핵심 결정은 팩트체크 단계를 초안과 발송 사이에 두는 것이었다, 그 후가 아니라 — 이메일 안의 모든 잠재고객 특정 주장이 메시지가 큐에 들어가기 전에 그것이 유래했다고 하는 소스 데이터에 대해 검증되는 단계 말이다. AI가 "최근 Salesforce 마이그레이션"이라고 쓰면, 파이프라인은 증거로 되돌아간다; 유일한 시그널이 HubSpot 채용 공고뿐이라면, 그 주장은 발송되지 않는다. 언어 모델은 표현에 있어서는 창의적이도록 허용된다. 하지만 무언가가 참인지 아닌지에 대한 최종 권위자가 되는 것은 허용되지 않는다.

글로 적어 놓으면 당연해 보인다. 하지만 기성품 도구들이 만들어진 방식은 그렇지 않은데, 검증은 비싸고 화려하지 않은 부분이며, 리서치하고 초안을 쓰고 그리고 검사까지 하는 멀티 에이전트 파이프라인은 리서치하고 초안만 쓰는 것보다 엔지니어링하기가 정말로 더 어렵기 때문이다. 이것을 만들려고 시도하는 대부분의 내부 팀은 바로 그 이유로 검증 계층 없는 검색 증강 생성으로 기본 회귀한다 — 어려운 부분은 건너뛰어지는데, 데모는 그것 없이도 괜찮아 보이기 때문이다.

그저 데모만 잘 되는 것이 아니라 실제로 엔터프라이즈에 도움이 되려면 몇 가지 다른 것들도 참이어야 했다:

그것은 비공개 기업을 커버해야 했다. Autobound 같은 가장 강력한 공개 기업 도구들은 SEC 공시와 10-K를 기반으로 시그널 라이브러리를 구축한다 — 이는 정말로 강력하지만, 약 4,500개의 공개 종목 티커에서 한계에 다다른다. 누구의 실제 파이프라인이든 그 대부분은 아무것도 공시하지 않는 비공개 기업이므로, 리서치 계층은 기댈 EDGAR 피드 없이도 작동해야 한다.

그것은 거버넌스 우선이어야 했고, 모든 주장과 모든 발송에 대한 감사 추적을 갖춰서, 컴플라이언스 팀이 "왜 AI가 그렇게 말했는가"에 답할 수 있어야 했다 — 나중에 규제 압박 아래 추가한 기능으로서가 아니라, 기반으로서 말이다.

그리고 그것은 CRM 네이티브여야 했고 깨끗한 데이터에서 시작해야 했다. 우리는 첫 주에 고객의 CRM을 감사하는데, 중복되고 오래된 연락처 레코드를 겨냥한 검증 파이프라인은 — 모든 RevOps 팀이 아는 HubSpot 중복 제거 충돌과 Salesforce API 스로틀링 말이다 — 그저 더 빨리 잘못된 받은편지함으로 검증해 들어갈 뿐이기 때문이다. 전체 접근 방식은 우리의 AI 세일즈 인텔리전스 솔루션 페이지에 정리되어 있으니, 이야기가 아니라 아키텍처를 원한다면 참고하라.

그냥 인간 SDR을 고용하면 안 되나?

AI 대 인간 대 휴먼-인-더-루프 아웃리치: 적격 기회 15% 대 25%, 매출 2.6배, ROI 317%, 5.2개월 회수 기간

사람들은 늘 내게 같은 질문의 어떤 버전을 묻는다: AI가 이렇게 오류가 잦다면, 왜 그냥 인간 SDR로 돌아가지 않는가?

왜냐하면 순수 인간 아웃바운드의 경제성도 성립하지 않으며, 그것이 성립하는 척하는 것은 그 나름의 부정직함이기 때문이다. 완전 부담 비용을 반영한 인간 SDR은 연간 75,000달러에서 125,000달러가 든다. AI가 제공하는 레버리지는 실재한다 — 그것이 검증되었을 때 말이다. 실제로 성과를 내는 모델은 AI 전용도 인간 전용도 아니다; 그것은 휴먼-인-더-루프 파이프라인이며, 2026년 데이터는 이것에 연간 317%의 수익률과 5.2개월의 회수 기간을 부여한다. Amplemarket의 Duo 같은 하이브리드 도구는 담당자당 5~6배의 생산성 배수를 보고하는데, 이는 바로 인간이 판단과 에스컬레이션을 담당하는 동안 검증된 기계가 규모를 담당하기 때문이다.

검증을 내장하는 요점은 AI를 인간을 제거해도 될 만큼 안전하게 만드는 것이 아니다. 그것은 AI를 충분히 신뢰할 수 있게 만들어서 인간의 판단이 지어낸 이야기를 수습하는 데 소진되는 대신 배가되도록 하는 것이다.

내가 받는 또 다른 질문은 비용에 관한 것인데, 그것은 정당하다. 맞춤형 검증 파이프라인은 좌석당 SaaS 구독보다 더 큰 초기 투자다 — SaaS 도구는 연간 수천 달러에서 3만 5천 달러 사이 어디쯤이고, 맞춤형 구축은 10~14주의 타임라인을 가진 다른 차원의 투자다. 하지만 진짜 비교를 해보라. 주장의 15%를 환각하고 당신의 도메인을 태우는 값싼 도구는 값싸지 않다; 그것은 6주에서 12주의 도달률 중단이자, 당신이 오염시킨 모든 임원의 받은편지함에서 지불하는 브랜드 세금이다. 비싼 부분은 결코 소프트웨어가 아니었다. 그것은 뒤처리였다.

출시하기 전의 나 자신에게 해줄 말

저 아름다운 첫 달 응답률 차트를 응시하던 나 자신의 버전에게 한 가지 메시지를 되돌려 보낼 수 있다면, 그것은 "아웃바운드에 AI를 쓰지 마"가 아닐 것이다. 나는 그것을 다시 만들 것이다. 그것은 이것일 것이다: 네가 보고 있는 대시보드는 잘못된 대시보드다. 중요한 숫자는 얼마나 많은 이메일이 나갔는가도, 심지어 얼마나 많은 이메일이 응답을 받았는가도 아니다. 그것은 네가 세상에 내보낸 주장 중 실제로 참이었던 것이 어느 정도의 비율인가이다 — 그리고 너는 그것을 알 방법이 없는데, 결코 확인하지 않는 시스템을 만들었기 때문이다.

검증할 수 있는 것보다 더 빠르게 발송하는 AI는 영업 가속기가 아니다. 그것은 정말 인상적인 오픈율을 가진 평판 소각로다. AI 세일즈 인텔리전스의 기술 전체 — 만들 가치가 있는 그 버전 — 는 다른 모두가 남의 문제로 취급하는 검증 단계에 있다. 그것이 바로 우리가 중심에 둔 부분이고, 우리의 청구서가 이제 도착하는 이유다. 그것이 어떻게 맞물리는지는 솔루션 페이지에서 볼 수 있다.

나는 여전히 대부분의 아침에 Postmaster 대시보드의 스팸률 선을 지켜본다. 이제 그것은 저 0.3% 임계값을 한참 밑돌며, 평평하고 지루하다. 내가 묘사한 그 한 해를 겪고 나니, 평평하고 지루한 선이 회사에서 가장 아름다운 차트다 — 왜냐하면 그것은 우리가 어제 잠재고객에게든 돈을 내는 고객에게든 보낸 모든 이메일이 실제로 도착했고, 그 안의 모든 주장이 떠나기 전에 참이었다는 것을 의미하기 때문이다.

관련 연구

다른 채널에도 게시됨

확신을 가지고 AI를 구축하세요.

차세대 엔터프라이즈 AI 구축에 깊은 경험을 갖춘 팀과 협업하세요. 신뢰할 수 있는 AI 전략을 설계하고 구축하며 배포할 수 있도록 지원해 드리겠습니다.

Veriprajna 딥테크 컨설팅 은(는) 헬스케어, 금융, 규제 분야를 위한 안전 필수 AI 시스템 구축을 전문으로 합니다. 당사의 아키텍처는 확립된 프로토콜에 따라 검증되며 포괄적인 규정 준수 문서를 갖추고 있습니다.