법무 및 자문용4 분 소요

이제 여러분의 AI 챗봇은 법적으로 구속력 있는 직원입니다

법원은 AI가 고객에게 약속한 것이라면 무엇이든 회사가 이행해야 한다고 판결했습니다 — AI가 그 약속을 지어낸 경우에도요.

문제

에어캐나다의 챗봇은 슬픔에 잠긴 승객에게 정가 티켓을 구매하면 90일 안에 유가족 환불을 청구할 수 있다고 말했습니다. 그런 정책은 존재하지 않았습니다. 챗봇이 그 정책을 지어낸 것입니다. 승객이 환불을 요청하자 에어캐나다는 거부했습니다 — 실제 정책은 여행 후 환불을 금지하고 있었기 때문입니다. 승객이 소송을 제기하자 항공사는 놀라운 시도를 했습니다: 챗봇은 자신의 실수에 대해 스스로 책임지는 "별개의 법인"이라고 주장한 것입니다.

행정심판부(tribunal)는 그 방어 논리를 완전히 기각했습니다. 심판관 크리스토퍼 리버스(Christopher Rivers)는 "에어캐나다는 AI 챗봇과 자신을 분리할 수 없다"고 판결했습니다. 법원은 인간 상담원, 정적 웹페이지, 대화형 봇 사이에 실질적인 차이가 없다고 밝혔습니다. 이들 모두 회사를 대신하여 말합니다. 이들 모두 회사를 구속합니다.

이번 사건은 일회성 오류가 아니었습니다. 오늘날 대부분의 엔터프라이즈 AI 시스템이 작동하는 방식에서 예측 가능하게 빚어진 실패였습니다. 여러분의 챗봇은 여러분의 정책을 "알지" 못합니다. 통계적 패턴을 바탕으로 좋은 답변이 어떻게 들릴지를 예측할 뿐입니다. 확신에 찬 어조로 들리면 고객은 그것을 믿습니다. 틀렸을 때는 회사가 대가를 치릅니다. Moffatt v. Air Canada 판결은 AI 환각 — 모델이 확신에 찬 권위로 지어내는 응답 — 을 법적으로 과실에 의한 허위 표시(negligent misrepresentation)로 분류한다는 사실을 확립했습니다. AI가 말했다면, 회사가 서명한 것입니다.

이 문제가 비즈니스에 중요한 이유

여기서의 재무 노출은 이론에 그치지 않습니다. AI 환각으로 인한 전 세계 손실은 2024년에 674억 달러에 달했습니다. 이 수치에는 직접 배상금, 규제 과징금, 법률 비용, 브랜드 손상, 그리고 직원들이 AI 작업을 수작업으로 검증하는 숨은 비용이 포함됩니다.

이 숨은 비용만으로도 어마어마합니다. Forrester Research는 엔터프라이즈 직원 1인당 매년 약 14,200달러를 환각 대응 — 스스로 신뢰할 수 없는 AI 시스템의 출력 검증 — 에 쓰는 것으로 추산합니다.

Moffatt 사건의 배상액은 적었습니다 — 약 800달러. 그러나 중요한 것은 판례입니다. 이 판례가 조직에 의미하는 바는 다음과 같습니다:

  • 가격, 환불, 보증 또는 서비스 약관을 다루는 모든 챗봇은 이제 구속력 있는 계약 변경을 만들어낼 수 있습니다. 여러분의 AI는 실시간으로 회사의 공약을 다시 쓸 수 있습니다.
  • "블랙박스" 방어는 끝났습니다. AI가 어떻게 그 답에 도달했는지 이해하지 못했다고 주장할 수 없습니다. 법원은 시스템의 기술적 복잡성 따위는 신경 쓰지 않습니다.
  • "올바른 정보가 우리 웹사이트에 있었다"는 방어도 실패했습니다. 에어캐나다는 실제 정책이 담긴 정적 페이지를 가리켰지만, 행정심판부는 그것은 중요하지 않다고 판결했습니다 — AI의 발언도 유효하게 인정됩니다.
  • 집단소송 위험이 커지고 있습니다. 이 판결은 전 세계 원고 측 변호사들에게 AI 출력이 소송 대상이라는 신호를 보냈습니다. 금융 상품에 대한 단 한 번의 환각이 수백만 달러의 책임을 초래할 수 있습니다.

환각 탐지 도구 시장은 2023년부터 2025년 사이에 318% 성장했습니다. 이 성장은 위기 모드에 놓인 산업을 반영합니다. 경쟁사들은 벌써 벼르고 있습니다. 규제기관들은 지켜보고 있습니다. 이사회는 이것이 IT 문제가 아니라 대차대조표 리스크라는 점을 이해해야 합니다.

내부에서 실제로 일어나는 일

이런 일이 반복되는 이유를 이해하려면 대규모 언어 모델(Large Language Model)이 작동하는 방식에 관한 한 가지만 이해하면 됩니다: 다음 단어를 예측한다는 것입니다. 그게 전부입니다. 데이터베이스에서 환불 정책을 찾아보지 않습니다. 법률 조건을 논리적으로 헤아리지 않습니다. 학습 데이터의 패턴을 바탕으로 통계적으로 그럴듯하게 들리는 텍스트를 생성할 뿐입니다.

이렇게 생각해 보십시오. 수백 개의 서로 다른 항공사의 수천 권 회사 매뉴얼을 통째로 외운 유능한 신입 직원을 고용했다고 상상해 보십시오. 고객이 환불 정책을 물으면 이 직원은 여러분의 해당 매뉴얼을 확인하지 않습니다. 대신 지금까지 읽은 모든 것을 동원해 환불 정책이라면 이런 식으로 말할 법한 답변을 지어냅니다. 가끔은 맞습니다. 그리고 의외로 자주, 틀립니다.

최고 수준의 모델조차 — Google의 Gemini 2.0, OpenAI의 GPT-4o — 과업 복잡도에 따라 0.7%에서 25% 이상 사이의 기본 환각률을 유지합니다. 0.7%의 오류율은 작게 들립니다. 그러나 AI가 한 달에 백만 건의 고객 문의를 처리한다면, 그것은 잠재적으로 7,000건의 규제 위반, 잘못된 재무제표, 또는 유령 환불 약속이라는 뜻입니다.

진짜 위험은 이것입니다: 이 모델들은 "확신에 차 있지만 틀립니다." 사실을 진술할 때와 똑같은 권위 있는 어조로 거짓을 말합니다. 고객은 차이를 구분하지 못합니다. 사후에 대화 기록을 검토하는 현장 직원들도 마찬가지입니다.

많은 벤더가 검색 증강 생성(Retrieval-Augmented Generation, RAG) — AI에 실제 원본 문서를 입력하는 기법 — 을 해결책으로 판매합니다. 그러나 에어캐나다의 챗봇은 올바른 정책에 접근할 수 있었을 것입니다. 실제로 그 정책으로 연결되는 링크까지 제공했습니다. 그럼에도 봇은 정책을 잘못 요약했습니다. 추론 엔진 자체가 신뢰할 수 없다면 AI에게 올바른 정보를 주는 것만으로는 부족합니다. RAG는 지식을 제공합니다. AI가 그 지식을 따르리라는 보장은 하지 않습니다.

효과가 있는 것 (그리고 없는 것)

솔루션에 투자하기 전에, 여러분을 보호해 주지 못할 것이 무엇인지 이해해야 합니다:

프롬프트 엔지니어링만으로는 부족합니다: AI에게 "회사 정책에 근거해서만 답하라"고 요청하는 것은 제약이 아니라 제안일 뿐입니다. 모델은 특정 조건에서 이를 무시할 수 있고 실제로 무시합니다. 프롬프트 지시는 강제력 있는 가드레일(guardrails)이 아닙니다.

면책 조항과 세부 약관: 에어캐나다는 정적 웹페이지에 올바른 정보를 두고 있었습니다. 행정심판부는 그것이 그들을 보호하지 못한다고 판결했습니다. 고객에게 "공식 출처로 확인하라"고 말하는 것은 AI가 이미 한 구속력 있는 약속을 되돌리지 못합니다.

검증 없는 순진한 RAG: 문서를 벡터 데이터베이스에 넣고 AI가 알아서 올바르게 읽기를 바라는 방식은 바로 이 판례를 만든 사건에서 실패했습니다. 의미 유사도 검색은 엉뚱한 문서를 가져올 수 있습니다 — 질문이 "환불 자격"에 관한 것이었는데 "환불 처리 기간"을 끌어오는 식으로 말입니다.

실제로 효과가 있는 것은 결정론적 액션 계층(Deterministic Action Layer, DAL) — 대화와 컴플라이언스 의사결정을 분리하는 시스템 — 입니다. 실무에서는 다음과 같이 작동합니다:

  1. 입력 분류: 고객이 메시지를 보내면 시맨틱 라우터 — 단어 뒤에 숨은 의도를 읽어내는 시스템 — 가 그 질문이 환불, 가격, 법률 조건, 보증 같은 제한 주제에 닿는지 판단합니다. 이 라우터는 AI 모델 외부에 위치하므로, AI를 속이려고 설계된 프롬프트 인젝션 공격이 우회할 수 없습니다.

  2. 결정론적 처리: 쿼리가 제한 주제에 해당하면 AI 모델은 답변을 생성하는 것이 금지됩니다. 대신 시스템이 하드코딩된 로직 — 데이터베이스를 확인하는 실제 소프트웨어 코드 — 를 실행합니다. 환불 질문이라면 다음과 같은 코드를 실행합니다: "티켓 상태가 '탑승 완료'와 같으면 '환불 불가'를 반환하라." 결정은 확률이 아니라 여러분의 규칙에서 나옵니다.

  3. 통제된 출력: 코드가 검증된 결과를 반환합니다. AI의 유일한 역할은 그 결과를 정중한 문장으로 감싸는 것입니다. 그런 다음 출력 검증이 최종 응답이 코드가 반환한 데이터와 일치하는지 확인합니다. 규칙이 존재하지 않는 질문을 만나면 시스템은 즉흥적으로 답하지 않습니다. 이렇게 말합니다: "해당 질문에는 직접 답변드릴 수 없습니다. 전문 상담원을 연결해 드리겠습니다."

이 접근 방식 — AI의 언어 능력과 엄격한 규칙 기반 논리를 결합하는 신경상징적 아키텍처(neuro-symbolic architecture) — 은 순수 AI 래퍼로는 얻을 수 없는 것을 제공합니다: 완전한 감사 추적입니다. 모든 의사결정은 특정 규칙, 특정 데이터베이스 쿼리, 특정 코드 경로로 거슬러 올라갈 수 있습니다. 규제기관이나 법원이 "왜 당신 시스템이 그렇게 말했는가"라고 묻는다면, 무슨 일이 왜 일어났는지 정확히 보여줄 수 있습니다.

이 감사 기능은 자동화 시스템이 자신에게 영향을 미치는 결정을 내릴 때 개인에게 설명을 요구할 권리를 부여하는 GDPR 제22조를 직접 충족합니다. 또한 인간 감독(human oversight)에 관한 EU AI Act 제14조 요건과 ISO 42001이 요구하는 문서화 표준 (AI 관리 시스템 대상) 역시 충족합니다.

한편, 정부 및 공공 부문 조직에게는 시민 대상 서비스를 처리하는 경우, 이 아키텍처는 선택 사항이 아닙니다. AI가 복지 혜택 수급 자격, 세금 납부 의무, 또는 허가 요건을 다룰 때 모든 답변은 정부 권위의 무게를 지닙니다. 정부 챗봇이 환각으로 정책을 지어내면 책임이 생길 뿐만 아니라 디지털 서비스에 대한 공공 신뢰를 잠식합니다.

핵심 원칙은 간단합니다: 언어는 AI에게 맡깁니다. 결정은 결코 AI에게 맡기지 않습니다. 정책은 확률이 아니라 코드 속에 있어야 합니다. 다음을 읽어보실 수 있습니다: 전체 기술 분석 에서 상세한 엔지니어링 청사진을 확인하거나, 대화형 버전 살펴보기 에서 아키텍처 안내 투어를 받아보실 수 있습니다.

여러분의 AI는 번역가여야 하며, 의사결정자가 되어서는 안 됩니다. 고객의 질문을 데이터베이스 쿼리로, 데이터베이스의 답을 인간의 언어로 번역합니다. 결정은 여러분이 통제하고 감사하고 업데이트하는 코드에서 일어나야 합니다 — 들여다볼 수 없는 신경망 내부가 아니라.

핵심 요점

  • 이제 법원은 AI 챗봇의 발언을 법적으로 구속력 있는 회사의 약속으로 취급합니다 — '그저 봇일 뿐'이라는 방어는 Moffatt v. Air Canada에서 기각되었습니다.
  • AI 환각으로 인한 전 세계 손실이 2024년 674억 달러에 달했으며, 기업은 AI 출력을 검증하는 것만으로 직원 1인당 연간 약 14,200달러를 쓰고 있습니다.
  • 올바른 문서를 AI에 제공하는 것(RAG)만으로는 부족합니다 — 에어캐나다의 챗봇은 올바른 정책에 접근할 수 있었으면서도 잘못된 정책을 지어냈습니다.
  • 결정론적 액션 계층은 민감한 질문을 AI 생성 답변 대신 하드코딩된 규칙으로 라우팅하여 대화와 컴플라이언스를 분리합니다.
  • 모든 컴플라이언스 결정은 확률적 추측이 아니라 감사 가능한 논리 추적을 남겨야 합니다 — 이것이 바로 규제기관과 법원이 요구할 것입니다.

결론

여러분의 AI 챗봇은 이미 회사를 대신하여 약속을 하고 있으며, AI가 그 약속을 지어낸 경우라도 법원은 그 이행을 요구할 것입니다. 해결책은 아키텍처에 있습니다: AI가 말하는 것과 비즈니스가 결정하는 것을 분리하고, 돈·정책·법률 조건과 관련된 모든 것은 하드코딩된 규칙으로 처리하십시오. AI 벤더에게 물어보십시오: 챗봇이 고객에게 환불 자격이 있다고 말할 때, 그 답변을 만들어낸 정확한 규칙과 데이터베이스 쿼리를 보여줄 수 있습니까?

자주 묻는 질문

자주 묻는 질문

AI 챗봇이 고객에게 한 말 때문에 회사가 소송을 당할 수 있습니까?

네. Moffatt v. Air Canada(2024)에서 행정심판부는 회사가 자사의 AI 챗봇과 자신을 분리할 수 없다고 판결했습니다. 법원은 인간 상담원과 AI 봇 사이에 실질적인 차이가 없다고 보았습니다 — 둘 다 회사를 대신하여 말합니다. 챗봇이 환불을 약속하거나 정책을 잘못 말했다면, 회사는 그 약속을 이행해야 할 법적 의무를 질 수 있습니다.

AI 환각은 기업에 얼마나 많은 비용을 입힙니까?

AI 환각으로 인한 전 세계 손실은 2024년에 674억 달러에 달했습니다. 여기에는 직접 배상금, 규제 과징금, 법률 비용, 브랜드 손상이 포함됩니다. Forrester Research는 또한 기업이 스스로 신뢰할 수 없는 AI 출력을 검증하는 데 직원 1인당 연간 약 14,200달러를 쓰는 것으로 추산합니다.

회사 문서를 AI에 입력하면 환각을 막을 수 있습니까?

신뢰할 수 있는 방법이 아닙니다. 검색 증강 생성(RAG)은 AI에게 실제 문서에 대한 접근을 제공하지만, 에어캐나다의 챗봇도 올바른 정책에 접근할 수 있었으면서도 잘못된 답변을 지어냈습니다. AI의 추론 엔진이 엄격한 논리가 아닌 확률에 기반한다면 올바른 정보를 제공하는 것만으로는 부족합니다. 결정론적 액션 계층은 컴플라이언스 결정이 AI 생성이 아닌 하드코딩된 규칙에 의해 이루어지도록 보장합니다.

확신을 가지고 AI를 구축하세요.

차세대 엔터프라이즈 AI 구축에 깊은 경험을 갖춘 팀과 협업하세요. 신뢰할 수 있는 AI 전략을 설계하고 구축하며 배포할 수 있도록 지원해 드리겠습니다.

Veriprajna 딥테크 컨설팅 은(는) 헬스케어, 금융, 규제 분야를 위한 안전 필수 AI 시스템 구축을 전문으로 합니다. 당사의 아키텍처는 확립된 프로토콜에 따라 검증되며 포괄적인 규정 준수 문서를 갖추고 있습니다.