AI 아웃리치를 위한 검증 및 거버넌스 계층

결정론적 검증기가 귀사의 AI 아웃리치가 발송하도록 허용되는 내용을 결정합니다.

AI SDR은 물량을 최적화하고, 단일 패스 모델은 오래된 소스·잘못된 엔티티·과잉 주장 진술을 그대로 발송합니다. Veracity Engine은 LLM이 초안을 쓰게 한 뒤, 순수 Python 검사가 입증되지 않은 주장을 모두 제거하고, 남은 것을 점수 매기며, 리스크 보정 정책 게이트로 라우팅합니다. 에이전트는 자문하고, 코드가 결정합니다.

100%

주장이 살아남을 때의 발송 무결성

발송된 이메일의 모든 주장이 소스로 뒷받침됨

25/25

라벨링된 골든 세트에 대한 판정 정확도

결정론적이며 재현 가능(25건 벤치마크)

3

발송 전 결정론적 검사

그라운딩, 엔티티 일치, 시간적 유효성

이것은 실행 가능한 데모입니다. 검색, CRM, 이메일 발송은 시뮬레이션되며, Werner Enterprises를 제외한 리드는 합성입니다. Werner의 10-K 발췌는 실제 공개 기록입니다.

검증 없는 물량은 만들어내는 것보다 더 많은 파이프라인을 파괴합니다

널리 알려진 AI SDR 참패의 이면 실패 양상.

AI SDR은 더 많이 보내도록 만들어집니다. 단일 패스 LLM은 잠재 고객 특정 주장의 측정 가능한 비율을 환각하고, 개인화 도구는 그 결과 주장을 현재의·엔티티가 맞는 소스와 다시 대조하지 않습니다. 그래서 오래된 소스·잘못된 엔티티·과잉 주장 진술이 그대로 발송되고, 검증은 발송 후에 덧붙이거나 아예 일어나지 않습니다.

업계 맥락은 뚜렷합니다. 단일 패스 LLM은 잠재 고객 특정 주장의 12~18%를 환각합니다(AI SDR Industry Report, 2026). 엔터프라이즈 AI SDR 연간 이탈률은 50~70%입니다(UserGems, 2026). 11x.ai는 $74M을 조달한 뒤 2025년에 70~80% 이탈과 함께 붕괴했습니다(TechCrunch). 에이전트 특화 거버넌스를 갖춘 기업은 7%에 불과하고(Deloitte, 2026), Gartner는 에이전틱 AI 프로젝트의 40% 이상이 2027년까지 포기될 것으로 전망합니다. 2025년 11월부터 스팸률이 0.3%를 초과하면 Gmail SMTP 수준 거부가 발동하고 도메인 회복에 6~12주가 걸립니다.

진짜 버그는 잘못된 문법이 아닙니다. 문법은 완벽하며, 그래서 더 나쁩니다. 위험은 올바르게 인용되었지만 오해의 소지가 있게 쓰인 주장입니다. 오래된 소스에서 가져온 참인 사실, 같은 이름의 다른 회사에 대한 참인 사실, 또는 소스가 반박하는 벤더 주장. 우리는 이를 맥락적 오용이라고 부르며, 더 나은 기반 모델도 이를 제거하지 않습니다. 완벽한 모델조차 FINRA나 GDPR에 어떤 현재 소스가 어떤 주장을 뒷받침했는지 증명할 수 없습니다.

Veracity Engine의 작동 방식

LLM이 초안을 씁니다. 결정론적 코드가 무엇이 발송되는지를 결정합니다. 이것이 뉴로심볼릭입니다. 신경망 저작, 기호적 검증.

파이프라인은 Lead, 이어서 Research(각 사실이 날짜가 있는 소스에 묶인 팩트 시트), 이어서 Draft(팩트 시트만으로 제약된 Writer LLM), 이어서 Verify(결정론적 검사), 이어서 Policy Gate, 이어서 서명된 감사 영수증, 이어서 시뮬레이션된 CRM 라이트백을 실행합니다. 검증 단계는 LLM이 LLM을 판정하는 것이 아닙니다. 순수 Python이므로 같은 입력은 매번 같은 판정을 냅니다.

세 가지 결정론적 검사

각 사실 주장은 인용된 소스와 대조됩니다. 먼저 실패한 검사가 우선순위 순으로 이깁니다. unsourced, 그다음 contradicted, 그다음 entity mismatch, 그다음 stale.

1. 그라운딩

주장이 소스 스니펫에 함의되는가? 토큰 중첩은 콘텐츠 토큰의 최소 0.5여야 하며, 회사명 토큰은 제외되어 회사명만 반복해서 높은 점수를 받을 수 없습니다.

2. 엔티티 일치

소스가 같은 이름의 다른 회사가 아니라 바로 이 잠재 고객에 관한 것인가? 같은 이름을 가진 다른 기업에 관한 소스는 단어가 맞아떨어져도 실패합니다.

3. 시간적 유효성

주장이 최근성 표현("recently", "just", "now", "this week")을 쓰면, 소스는 365일 이내여야 합니다. 더 오래된 소스는 사실이 참이어도 stale로 표시됩니다.

이와 함께 두 가지 가드가 더 실행됩니다. 벤더 모순 검사, 그리고 유효한 fact id를 환각된 문장에 태우는 라이브 LLM을 막는 0.3의 문장 충실도 하한. 판정 어휘가 인터페이스 색을 결정합니다. supported(녹색)는 통과, stale(앰버), entity_mismatch(빨강), contradicted(빨강), unsourced(빨강)는 통과하지 않습니다.

정책 게이트

게이트는 supported가 아닌 주장을 모두 제거한 뒤 두 숫자를 보고합니다. Veracity Score는 초안의 전체 사실 주장 대비 supported 주장의 비율이며, AI가 쓴 것 중 실제로 참이었던 비중입니다. 발송 무결성은 주장이 하나라도 살아남으면 100%입니다. 발송 이메일에는 소스로 뒷받침된 주장만 남기 때문입니다. 그것이 설계 보장입니다.

라우팅은 리스크를 따릅니다. 안전한 것이 하나도 남지 않거나 초안 커버리지가 0.5 미만이면 이메일은 수정됩니다. 규제 대상이거나, C 레벨이거나, 거래가 최소 $100,000인 고가치이면 100% 깨끗한 초안이라도 사람 검토로 보내집니다. 그 외에는 자동 적격입니다. 비교 모드인 Standard AI SDR은 리서치·초안·발송을 발송 전 검증된 주장 0건으로 수행하며, 앱은 이미 나간 것에 대한 사후 섀도 검사로 이를 보여줍니다.

함정, 처음부터 끝까지 풀어 보기

데모 코퍼스의 리드 세 건(기준일 2026-06-17). 아래 이미지는 모두 실행 중인 앱의 스크린샷입니다.

오래된 소스에서 나온 참인 사실도 보내서는 안 되는 것입니다

Northwind Logistics 리드(합성 중견 시장 3PL)에서, 초안은 회사가 "recently expanded into APAC"이라고 주장합니다. 소스는 실제 Northwind APAC 뉴스이고, 그라운딩 중첩은 100%이며, 엔티티도 맞습니다. 그러나 소스 날짜는 2019-03-14로, 365일 최근성 창에 대해 2,652일(약 7.3년) 오래되어 시간적 유효성이 실패하고 주장은 제거됩니다. Veracity Engine은 supported 주장(2026-06-09 채용 공고로 입증된, Salesforce 관리자 6명을 채용하려는 움직임이 선두)을 유지하고, 나쁜 주장 두 건을 잡아 제거한 뒤, 100% 소스로 뒷받침된 이메일을 발송합니다.

Northwind 리드에 대한 Veracity Engine 결과: 발송 이메일의 100%가 소스로 뒷받침됨, 초안의 60%가 검증 가능, 이유가 인라인으로 표시된 채 잡히고 제거된 주장 두 건.
Veracity Engine 결과: 발송 무결성 100%, 초안 검증 가능 60%, 이유와 함께 취소선 처리된 주장 두 건.
그라운딩 100%와 엔티티 OK를 보여주지만 시간 검사는 실패하는 증거 패널: 소스 연령 2,652일이 최근성 주장의 365일을 초과하므로 판정은 stale.
증거 패널: 그라운딩 통과, 엔티티 통과, 시간적 유효성 실패(소스 연령 2,652일이 365일 창을 초과). 판정: stale.

실제 SEC 공시에서 같은 허점

Werner Enterprises, Inc.는 실제 상장 회사이며, 소스 W1과 W2는 FY2023 Form 10-K(SEC EDGAR, CIK 0000793074, 제출일 2024-02-26)의 축어 발췌입니다. 초안 주장 "recently growing your One-Way Truckload fleet to 2,735 trucks"는 사실로서 실재하지만, 공시가 2년이 넘었으므로 "recently" 프레이밍은 stale로 잡힙니다. 이것이 SEC 공시 개인화 도구가 열어 두는 바로 그 시간적 오용 허점입니다. (이 리드의 연락처와 채용 공고는 합성이며, Werner와 그 10-K 발췌만 실제입니다.)

FY2023 SEC 10-K로 뒷받침된 실제 Werner Enterprises 주장으로, 공시가 365일 최근성 창에 대해 2년이 넘어 stale로 잡힘.
사실적으로 정확한 실제 Werner 10-K 주장으로, 최근성 프레이밍에서 stale로 잡힘.

동일 명칭 엔티티 충돌

다시 Northwind 리드에서, 초안은 "$40M Series B"도 주장합니다. 인용된 소스는 실제이지만 "Northwind Logistics"가 아니라 오스틴 사이버보안 스타트업 "Northwind Inc."에 관한 것입니다. 엔티티 일치 검사가 실패하고 주장은 발송되기 전에 제거됩니다.

엔티티 일치 실패를 보여주는 증거 패널: 인용된 자금 조달 소스는 Northwind Logistics가 아니라 오스틴 사이버보안 스타트업 Northwind Inc.에 관한 것.
엔티티 불일치: 자금 조달 소스는 Northwind Logistics가 아니라 Northwind Inc.를 기술함.

거버넌스는 정확성만이 아니라 리스크에 관한 것입니다

Atlas Capital Markets는 합성 FINRA 규제 브로커-딜러로, Chief Revenue Officer 연락처와 $220,000 거래가 있습니다. 100% 깨끗하고 완전히 소스로 뒷받침된 초안이라도 정책 게이트가 사람 검토로 강제합니다. 규제 대상이고, C 레벨이며, $100,000 임계값을 넘기 때문입니다. 깨끗한 초안이 곧 발송 가능한 초안은 아닙니다.

Atlas Capital Markets가 사람 검토로 라우팅된 이유: 초안이 완전히 소스로 뒷받침되어도 규제 대상, C 레벨, $220,000 거래이기 때문.
100% 깨끗한 초안인데도 Atlas가 사람 검토로 라우팅됨: 규제 대상, C 레벨, $100,000 초과 거래.

서명된 영수증, 그리고 재현 가능한 벤치마크

모든 이메일은 다운로드 가능한 JSON 감사 영수증을 생성합니다. 모델 제공자와 버전, 잠재 고객과 리스크 티어, 팩트 시트, 소스 구간과 날짜가 있는 각 주장의 판정, Veracity Score, 발동된 정책 규칙, 사람 승인자. 25건의 라벨링된 골든 세트에서 결정론적 검증기는 판정 정확도 25/25를 기록합니다. 어렵거나 나쁜 주장 10건 중 10건 포착, 깨끗한 주장 15건 중 15건 보존. 그 재현 가능성이 인증 가능하게 만들며, LLM 판정자는 그렇지 않습니다. 우리는 25/25를 이 라벨링된 벤치마크에 귀속하며, 오픈월드 보증으로 제시하지 않습니다.

검사별 추적, 모델 버전, 판정, 소스 구간, 날짜, 발동된 정책 규칙이 담긴 다운로드 가능한 JSON 감사 영수증.
검사별 전체 추적이 담긴 서명된 JSON 감사 영수증.
판정 정확도 25/25를 기록한 25건 라벨링 골든 세트. 결정론적이며 재현 가능.
25건 골든 세트: 판정 정확도 25/25, 매 실행 동일 결과.

Standard AI SDR 대 Veracity Engine

데모가 나란히 비교하는 바로 그 토글.

차원 Standard AI SDR Veracity Engine
발송 전 검증된 주장 0 모든 사실 주장, 결정론적으로
무엇이 발송되는지를 누가 결정하는가 LLM이 초안 그대로 발송 순수 Python 검사, LLM이 아님
오래된 소스 포착 없음 시간적 유효성, 365일 창
잘못된 동일 명칭 엔티티 없음 엔티티 일치 검사
감사 추적 없음 이메일당 서명된 JSON 영수증
고위험 처리 그래도 발송 사람 검토로 라우팅

이 데모가 하지 않는 것

  • ✓ 환각률 제로를 주장하지 않습니다. LLM은 여전히 초안을 씁니다. 보장은 입증되지 않은 주장이 발송 전에 제거된다는 것입니다. 환각률 제로를 주장하는 사람은 정직하지 않습니다.
  • ✓ 라이브 커넥터를 사용하지 않습니다. EDGAR, LinkedIn, Greenhouse, 뉴스 검색, CRM 읽기·쓰기, 이메일 발송은 스텁이거나 시뮬레이션되며, 팩트 시트는 미리 구축되어 있습니다.
  • ✓ Northwind나 Atlas를 실제 회사로 제시하지 않습니다. 합성입니다. Werner Enterprises와 그 W1/W2 10-K 발췌만 실제 공개 기록입니다.
  • ✓ 12~18% 환각 범위를 이 제품 자체의 측정 결과로 보고하지 않습니다. 그 수치는 시장 맥락이며, 데모의 헤드라인은 출처 커버리지와 자동 처리율입니다.
  • ✓ 고객, 사례 연구, 추천사, ROI 수치를 내세우지 않습니다. 아직 없습니다. 이것은 메커니즘을 증명하는 데모이지 배포가 아닙니다.

구매자가 실제로 묻는 질문

이것은 또 하나의 AI SDR(11x처럼)에 불과합니까?

아닙니다. 우리는 시장에 또 하나의 AI SDR을 더하지 않습니다. Veracity Engine은 초안 뒤에 자리하는 검증 및 거버넌스 계층입니다. 결정론적 순수 Python 검증기가 AI가 쓴 각 주장을 날짜가 있고 엔티티가 맞는 소스와 대조하고, 입증되지 않은 것은 제거하며, 이메일 발송이 허용되기 전에 서명된 감사 영수증을 작성합니다. AI SDR은 물량을 최적화합니다. 우리는 무엇이 발송하기에 안전한지를 결정합니다.

발송 전에 AI가 생성한 영업 이메일 주장을 어떻게 검증합니까?

초안의 모든 사실 주장은 세 가지 결정론적 검사를 거칩니다. 그라운딩(주장이 소스 스니펫에 함의되는가, 토큰 중첩 최소 0.5), 엔티티 일치(소스가 같은 이름의 회사가 아니라 바로 이 잠재 고객에 관한 것인가), 시간적 유효성(주장이 최근성 표현을 쓰면 소스는 365일 이내여야 함). 통과한 주장만 supported로 표시되어 유지되고, 나머지는 모두 제거됩니다. 검증기는 코드이지, LLM이 LLM을 판정하는 것이 아니므로 같은 입력은 항상 같은 판정을 냅니다.

기술적으로는 참이지만 오해의 소지가 있는 주장을 어떻게 잡습니까?

그것이 우리가 구축한 바로 그 실패 양상이며, 데모는 이를 맥락적 오용이라고 부릅니다. 풀어 본 한 리드에서 문장 "recently expanded into APAC"은 그라운딩을 통과하고 올바른 회사에 관한 것이지만, 유일한 소스 날짜가 2019년이어서 365일 최근성 창에 대해 2,652일 오래되어 stale로 잡혀 제거됩니다. FY2023 SEC 10-K로 뒷받침된 실제 Werner Enterprises 주장에서도 같은 패턴을 보여줍니다. 사실적으로는 정확하지만 공시가 2년이 넘어 "recently" 프레이밍은 시간적 유효성에 실패합니다.

금융 서비스 / FINRA처럼 규제 산업에서 AI 아웃리치를 사용할 수 있습니까?

환각되거나 잘못 귀속된 주장이 규제적 결과를 수반하기 때문에, 검증 및 거버넌스 계층이 가장 중요한 곳이 바로 여기입니다. 데모에서 정책 게이트는 규제 대상이거나, C 레벨 담당자에게 보내지거나, 최소 $100,000 거래에 묶인 이메일을, 초안이 완전히 소스로 뒷받침되어도 사람 검토로 라우팅합니다. 여기 거버넌스는 정확성만이 아니라 리스크의 함수입니다.

컴플라이언스 감사를 위해 어떤 소스가 주장을 뒷받침했는지 어떻게 증명합니까?

각 이메일은 다운로드 가능한 JSON 감사 영수증을 생성하며, 모델 제공자와 버전, 잠재 고객과 리스크 티어, 팩트 시트, 소스 구간과 날짜가 있는 모든 주장의 판정, Veracity Score, 발동된 정확한 정책 규칙, 사람 승인자를 기록합니다. 어떤 주장이든 수초 만에 소스로 추적됩니다. 완벽한 모델조차 감사자에게 어떤 현재 소스가 어떤 주장을 뒷받침했는지 증명할 수 없습니다. 영수증은 할 수 있습니다.

더 낫거나 더 새로운 AI 모델이 환각 문제를 그냥 고칠까요?

아니요, 그리고 그것이 지속되는 요점입니다. 더 나은 기반 모델도 여전히 초안을 쓰며, 환각률 제로를 주장하는 사람은 정직하지 않으므로, 출처를 증명하고, 감사 추적을 유지하고, 리스크에 따라 게이트해야 할 필요는 사라지지 않습니다. 출처, 감사 영수증, 정책 게이트는 지속되는 속성이며, 더 강한 라이터가 자신이 쓴 것을 검증하고 거버넌스해야 할 요건을 제거하지는 않습니다.

이것은 라이브 제품입니까, 데모입니까?

메커니즘을 증명하는 실행 가능한 데모이지, 배포된 파이프라인이 아닙니다. 검색 소스(EDGAR, LinkedIn, Greenhouse, 뉴스), CRM 읽기·쓰기, 이메일 발송은 시뮬레이션되며, 팩트 시트는 미리 구축되어 있습니다. Werner Enterprises를 제외한 리드는 합성이며, 그 10-K 발췌는 실제 공개 기록입니다. 결정론적 검증기, 정책 게이트, 감사 영수증은 실제이며 보여 드린 그대로 실행됩니다.

기술 리서치

이 데모 이면의 리서치 — 아키텍처, 검증 설계, 엔터프라이즈 청사진.

규제 대상 구매자 앞에 AI 아웃리치를 내놓으시겠습니까?

검증 및 거버넌스 계층이 어려운 부분입니다. 우리가 구축합니다.

환각된 주장의 리스크 없이 규제 대상 구매자 앞에 AI 아웃리치를 내놓는 방법을 팀이 고민하고 있다면, 그 생각을 진심으로 듣고 싶습니다. 문제는 업계 전반의 것이며 해답도 그럴 것입니다.

검증 평가

  • ✓ AI 아웃리치가 입증되지 않은 주장을 발송할 수 있는 지점을 매핑
  • ✓ 데이터에 대한 그라운딩, 엔티티, 시간 규칙 정의
  • ✓ 리스크 티어와 사람 검토 게이트 설계
  • ✓ 컴플라이언스 팀이 필요로 하는 감사 영수증 명세

계층 구축

  • ✓ 실제 소스 위의 결정론적 검증기
  • ✓ 규제 업종에 보정된 정책 게이트
  • ✓ 발송당 서명되고 다운로드 가능한 감사 영수증
  • ✓ 모델을 교체할 수 있는 저작(Anthropic, OpenAI, Gemini, Ollama)
소셜

다른 채널에도 게시됨