
물 18,000잔: 드라이브스루 음성 AI가 계속 놓치는 것
2025년 8월, 한 고객이 타코벨 스피커 앞에 차를 대고 물 18,000잔을 주문했다. AI는 그의 말을 완벽하게 알아들었다. 그리고 18,000잔을 전부 주문에 올렸다. 이 영상은 조회수 2,150만 회를 넘겼고, 타코벨은 무엇이 잘못됐는지 파악하기 위해 AI 확대를 잠정 중단했다.
여기서 불편한 지점은 이것이다: 인공지능에는 아무런 문제가 없었다. 음성 인식은 흠잡을 데 없었다. 언어 모델은 요청을 말한 그대로 정확히 해석했다. 빠져 있던 것은 AI와 금전등록기 사이에 자리 잡은, 지루하고 규칙 기반인 소프트웨어 한 조각이었다 — '18,000잔의 물'을 보고 이렇게 말했어야 하는 바로 그런 것 말이다: 안 됩니다, 그건 진짜 주문이 아닙니다. 그런데 아무도 그걸 만들어 두지 않았다.
나는 지난 커리어의 상당 기간을 드라이브스루 음성 AI 안에서 보냈다 — 사람이 창구에 서 있는 동안 스피커 앞에서 주문을 받는 바로 그 시스템들 말이다 — 그리고 나는 왜 이런 실패가 계속 반복되는지 이야기하고 싶다. 그 교훈이 헤드라인이 암시하는 것과 다르기 때문이다. 문제는 거의 언제나 모델이 아니다. 문제는 모델을 둘러싼 아키텍처다.
AI는 주문을 정확히 들었다. 다만 시스템 안에 '그건 맞을 리 없다'고 말할 수 있는 것이 아무것도 없었을 뿐이다.
이 한 문장이 드라이브스루 음성 AI가 그것을 도입한 체인들을 계속 망신시키는 이유의 전부다. 그리고 이것은 고칠 수 있다 — 더 똑똑한 모델이 아니라, 데모로 가는 길에 모두가 건너뛴, 화려하지 않은 엔지니어링으로 말이다.
아무도 이야기하고 싶어 하지 않는 3년간의 정체
내가 이 분야를 처음 진지하게 들여다보기 시작했을 때, 모두가 가리키던 경고성 사례는 맥도날드였다. 그들은 IBM과 3년간 드라이브스루 음성 파트너십을 진행했지만 주문 정확도 80~85% 언저리에서 막혔고, 2024년 7월에 조용히 전체를 종료했다. 그 과정에서 시스템은 한 차량의 주문에 치킨 맥너겟 260개를 추가했고, 누군가의 바닐라 아이스크림에 베이컨을 얹었다. 지금은 이 사건에 대한 '실패 박물관(Museum of Failure)' 항목까지 있다.
내 첫 직감은 대다수 엔지니어가 갖는 것과 같았다: 분명 약한 모델을 썼을 것이다. 그래서 우리는 모두가 시작하는 곳에서 시작했다 — 강력한 음성-텍스트 변환 엔진을 가져다 유능한 언어 모델에 넣고, 그 출력을 POS(판매 시점 관리) 시스템에 연결한 뒤 돌려 보는 것이다. 회의실에서는 정말로 인상적이었다. 복잡한 주문, 옵션 변경, 대체 요청까지 처리했다. 나는 우리가 몇 주 만에 이걸 풀어냈다고 확신했다.
그런 다음 우리는 그것을 춥고 바람 부는 어느 저녁, 실제 차선으로 가져갔고, 거의 즉시 무너져 내렸다.
트럭 한 대가 두 자리 건너에서 공회전하자 시스템은 그 엔진 소리를 받아쓰기 시작했다. 돌풍은 한바탕 말소리로 인식됐다. 고객의 차량 라디오가 켜져 있으면, AI는 신나게 DJ의 목소리를 주문에 섞어 넣었다. 실내에서 훌륭했던 그것은 실외에서는 거의 쓸 수 없었고, 나는 개인적으로 초기 로드맵을 모델이 어려운 부분이라는 가정에 걸었었다. 그렇지 않았다. 어려운 부분은 모델이 소리를 듣기도 전에 그 소리에 일어나는 모든 일이었다.
그날 밤 주차장에서의 경험은 나에게 문제 전체를 다시 규정해 주었고, 그것이 우리가 Veriprajna에서 만드는 것을 만들게 된 이유다 — 더 나은 모델이 아니라, 그것을 둘러싼, 빠져 있던 계층들 말이다.
스피커 앞은 왜 지구상에서 듣기 가장 어려운 곳인가

드라이브스루 스피커 앞은 기계에게 소리를 들으라고 요구할 수 있는 환경 중 음향적으로 가장 적대적인 곳 중 하나다. 나는 이것을 비유로 하는 말이 아니다.
엔진의 웅웅거림은 200~400Hz 대역에 집중되는데 — 이는 공교롭게도 전형적인 남성 목소리의 기본 주파수 바로 위에 자리한다. 그래서 이 소음은 걸러낼 수 있게 얌전히 옆으로 비켜나 있는 것이 아니라, 단어를 실어 나르는 바로 그 주파수에 뒤엉켜 있다. 바람은 비정상적인(non-stationary) 압력파를 만들어 예측 불가능한 돌풍으로 마이크를 때린다. 비는 음성 대역 전체에 걸쳐 광대역 잡음(hiss)을 더한다. 그리고 경쟁하는 목소리 — 동승자, 라디오, 옆 차선 — 는 표준적인 음성 활동 감지(VAD)가 고객의 목소리와 도저히 분리해 낼 수 없는 소리를 만들어 낸다.
맥도날드-IBM 시스템은 이 모든 것을, 가공되지 않은 원본 오디오를 언어 이해 계층으로 곧바로 보내는 방식으로 처리했다. 그것이 바로 그 시스템이 옆 차선의 주문을 '엿듣고', 엔진의 순간 소음을 누군가 말을 시작하는 것으로 잘못 읽고, 음소 조각들로부터 메뉴 항목을 환각(hallucinate)해 낸 이유다. 오디오가 열화되자 모델은 불확실성 아래에서 모델이 하는 일을 했다: 쓰레기 입력을 가장 확률이 높은 인접 토큰에 맞춰, 자신감 있고 틀린 무언가를 만들어 낸 것이다.
나쁜 오디오는 프롬프트 엔지니어링으로 빠져나갈 수 없다. 모델이 신호를 보기도 전에 신호가 손상돼 있으면, 더 똑똑한 모델은 그저 더 유창한 실수를 안겨 줄 뿐이다.
해법은 다단계 오디오 파이프라인이며, 연산의 순서가 중요하다. 우리는 큰 소리라면 무엇이든 음성으로 취급하는 에너지 기반 음성 감지를, 사람이 실제로 말하고 있다고 판단하기 전에 400밀리초의 연속 확률 임계값을 유지하는 신경망 감지기(Silero 계열 모델)로 교체했다. 그 한 가지 변경만으로 '엔진이 너겟을 주문한다'는 식의 실패 대부분이 사라진다. 그 위에서 우리는 음성 인식기가 신호를 받기도 전에 배경 소음의 약 75%를 제거하는 스펙트럼 게이팅을 돌리고, 운전자의 목소리를 차량 주변의 다른 모든 것으로부터 공간적으로 분리해 내는 마이크 어레이 — Andrea DA-252 또는 Veovox AudioBox — 를 통한 빔포밍을 사용한다.
여기서 함정은, 그리고 이것이 벤더들이 싫어하는 부분인데, 이 계층은 스피커 앞 기종별로, 그리고 음향 환경별로 튜닝해야 한다는 점이다. 깔끔한 사무실 오디오로 학습된 기성 노이즈 캔슬링은 주차장에서 힘없이 무너진다. 여기에 지름길은 없으며, 바로 그래서 이것을 실제로 하는 사람이 그토록 적은 것이다.
18,000잔의 물은 AI 버그가 아니라 소프트웨어 버그였다
다시 타코벨 이야기로 돌아오자. 이것이 두 번째 실패 유형을 가장 깔끔하게 보여 주는 사례이기 때문이다.
그 영상이 입소문을 탄 날 아침, 내가 이야기를 나누던 한 체인 운영자가 그것을 나에게 전달하며 우리 것도 똑같이 그럴지 솔직하게 물었다. 타당한 질문이고, 정직한 답은 대부분의 배포된 시스템이 그럴 것이라는 점이다. 같은 아키텍처적 결함을 공유하고 있기 때문이다.
AI는 '물 18,000잔'을 정확히 이해했다. 그건 한 번도 의심의 대상이 아니었다. 시스템에는 수량 검증도, 이상 탐지도, 세션당 요청 제한도 없었다. 모델의 출력은 곧바로 POS로 흘러 들어갔다. 주문이 주방에 도달하기 전에 그것이 물리적으로 타당한지 물어볼 미들웨어를 아무도 만들지 않았기 때문이다. 바로 이 빠져 있는 계층이 맥도날드가 한 계산서에 너겟 260개를 올리고 아이스크림에 베이컨을 얹은 이유다. 이 모든 사례에서 언어 이해는 정확했고, 비즈니스 로직이 그저 부재했을 뿐이다.
미치게 만드는 점은 이 해법이 얼마나 저렴한가다. 결정론적 검증 엔진 — 여기서 나는 더 많은 AI가 아니라 진정으로 규칙 기반인 코드를 말한다 — 은 체인당 구축에 2~3주가 걸린다. 이 엔진은 실제 주문 분포에서 도출한 수량 상한을 강제한다(퀵서비스 레스토랑에서 물 한 건 주문의 현실적 상한은 18,000잔이 아니라 여덟 잔 언저리다). 주문 데이터에서 '아이스크림 더하기 베이컨'의 과거 확률이 사실상 0인 항목 조합 로직을 확인한다. 거래당 가격 임계값을 설정하고, 그 한계를 벗어나는 것에는 무엇이든 사람이 개입하도록 강제한다.
드라이브스루 음성 AI에서 가장 저렴하고 가장 빠른 해법은, 조회수 2,100만 회를 기록하는 재난을 막아 주는 바로 그 해법이기도 하다. 그것은 지능이 아니라 규칙이다.
이것이 사람들을 놀라게 하는 역전이다. 화려한 부분 — 대화형 모델 — 은 이제 대체로 해결된, 상품화된 역량이다. 브랜드를 실제로 지켜 주는 부분은, 보기에 인상적이지 않아서 아무도 데모에 넣지 않는 결정론적 가드레일 계층이다.
말을 더듬는 사람이 차를 대면 어떻게 되는가?
세 번째 실패 유형은 나를 밤새 잠 못 들게 하는 것이다. 한편으로는 그것이 도덕적 문제이기 때문이고, 다른 한편으로는 곧 법적 문제가 될 참이기 때문이다.
웬디스 FreshAI는 말을 더듬는 고객들로부터 '사용 불가'라는 평을 들어 왔고, 그 원리를 이해하고 나면 왜 그런지 자명하다. 우리도 초기 빌드에서 똑같은 결함을 갖고 있었고, 내가 그것을 잡아낸 것은 오로지 누군가가 '베-베-베이컨네이터'를 주문하는 녹음을 앉아서 몇 번이고 되돌려 들었기 때문이다. 우리 시스템은 매번 어김없이 그들의 말을 끊어 버렸다.
비유창한 발화는 음성 AI를 세 가지 뚜렷한 방식으로 망가뜨린다. 사람이 소리를 반복하면 — '베-베-베이컨네이터' — 인식기는 주문 로직을 뒤죽박죽으로 만드는 중복 토큰을 만들어 낸다. 단어 중간에 소리가 막히는 침묵의 멈춤이 있으면, 음성 감지기는 그 침묵을 발화 차례의 끝으로 읽고 주문 도중에 듣기를 멈춘다. 소리를 길게 늘이면 — 'Mmmmilk' — 음소가 충분히 늘어나서 시스템은 전혀 다른 단어를 듣는다('Silk'). 이 중 무엇도 특이한 일이 아니다. 이것은 전 세계에서 말을 더듬는 약 8,000만 명, 여기에 강한 억양, 노년층의 발화 패턴, 비원어민 발음을 가진 훨씬 더 많은 사람에게 영향을 미친다. 이 시스템들은 유창하고 표준적인 미국 영어로 학습되었고, 그 외의 모든 사람에게는 실패한다.
나는 예전에 접근성을 '나중에, 있으면 좋은 것'으로 분류하곤 했다. 나는 틀렸고, 내 생각을 바꾼 것은 규제의 궤적이었다. 식음료업은 이제 미국 장애인법(ADA) 하에서 디지털 접근성 소송의 표적이 두 번째로 많은 산업으로, 전체 제소의 약 21%를 차지하며, 이 제소는 2025년에 전년 대비 40% 증가했다. 캐나다는 2025년 12월 CAN-ASC-6.2:2025를 발표했다 — 접근 가능한 AI에 대한 세계 최초의 국가 표준으로, 장애 여부와 무관한 공평한 성능과, AI를 거부하고 사람을 택할 수 있는 실질적 선택권을 요구한다. 유럽연합 AI법의 투명성 의무는 2026년 8월에 시행되며, 고객에게 자신이 기계와 대화하고 있음을 알리도록 요구한다.
드라이브스루 음성 AI 접근성 소송은 아직 제기된 적이 없다. 하지만 맥도날드 생체정보 프라이버시 소송 — 동의 없이 음성 지문을 수집했다고 주장하는 집단 소송 — 은, 비록 그 특정 사건이 기각되기는 했지만, 드라이브스루 AI가 소송의 정조준 사정권 안에 정면으로 들어와 있음을 이미 보여 주었다. 비용 계산은 잘못된 방향으로 잔혹하다: 이미 배포된 시스템에 접근성을 사후 개조하는 것은 처음부터 넣어 만드는 비용의 약 다섯 배가 든다. 첫날부터 비유창한 발화를 염두에 두고 설계하는 것은 자선이 아니다. 그것이 저렴한 쪽이다.
이게 실제로 작동하기는 하는가? 그렇다 — 아키텍처가 제대로일 때

여기까지 읽고 드라이브스루 음성 AI가 나쁜 아이디어라고 결론짓기 쉽다. 그렇지 않다. 계층을 제대로 엔지니어링한 체인들은 실패한 배포가 결코 도달하지 못한 수치를 내고 있으며, 그 둘 사이의 격차가 바로 핵심이다.
약 500개 매장에서 보장글스에 걸쳐 운영되는 Hi Auto는 주문 완료율 93%와 정확도 96%를 보고하며, 포트폴리오 전체로 연간 1억 건이 넘는 주문이 흘러간다. 화이트캐슬에 적용된 SoundHound의 시스템은 주문 완료율 90% 이상을 기록하고 매장당 연간 약 58,000달러의 비용 절감을 주장한다. 2025년 Intouch Insight 드라이브스루 연구는 AI 기반 차선이 전체 평균 4분 15초 대비 총 서비스 시간 평균 3분 53초 — 주문당 약 22초 더 빠른 — 를 기록하고, AI 없는 시간당 16대 대비 시간당 17~18대를 처리했음을 발견했다. AI 매장의 만족도는 약 97%로, 전통적 차선보다 몇 포인트 높게 나왔다.
그 격차를 보라. 맥도날드-IBM은 80~85%에서 멈췄다. Hi Auto-보장글스는 96%다. 그것은 약한 모델과 강한 모델의 차이가 아니다 — 2026년이면 기저 모델들은 대체로 비슷하다. 그것은 원본 오디오를 모델에 보내는 것과, 그 주위의 신호 처리, 결정론적 검증, 통합을 엔지니어링하는 것의 차이다.
그 마지막 단어 — 통합 — 이야말로 수많은 좋은 의도가 죽어 나가는 지점이다. 대형 체인 매출의 대략 75~80%가 드라이브스루 채널을 통해 들어오며, 그 주문은 체인이 이미 운영 중인 어떤 POS 시스템에든 깔끔하게 안착해야 한다. NCR Aloha, Toast, Oracle Simphony는 각각 서로 다른 API를 노출하며, 옵션 정보가 어떻게 스트리밍되는지와 다중 차선 세션이 어떻게 격리 상태를 유지하는지에 대해 서로 다른 제한을 둔다. 메뉴도 가만히 있지 않는다: 한정 판매(LTO), 시간대별 메뉴(dayparting), 지역 한정 품목이 일주일에 두세 번에서 네 번씩 바뀌며, 새 품목을 학습하려고 모델 재학습이 필요한 시스템은 그 속도를 따라갈 수 없다. 대신 우리는 언어 이해를 실시간 메뉴 피드에 그라운딩하며, 그래서 새 품목은 며칠이 아니라 몇 분 만에 사용 가능해진다.
운영자들이 실제로 나에게 던지는 질문들
이 체인들의 기술을 책임지는 사람들과 이야기하다 보면 같은 반론이 반복해서 나온다. 그래서 내가 회의실에서 답하는 방식 그대로 답해 보겠다.
그냥 구글이나 NVIDIA를 골라서 끝내면 안 되나요? 그럴 수 있고, 실제로 많은 곳이 그렇게 했다 — 웬디스는 구글 클라우드에서, 타코벨은 Yum!을 통해 NVIDIA 인프라에서, 버거킹의 직원용 어시스턴트 'Patty'는 OpenAI에서 돌아간다. 그 대가는 플랫폼 종속이다. API가 바뀌거나 가격이 달라지면 당신의 배포 전체가 노출되고, 당신은 특정 차선의 음향에 맞춰 엔지니어링된 것이 아니라 범용 모델을 받게 된다. 벤더 시장은 붐비고 유능하다 — Presto는 2026년 1월에 1,000만 달러를 조달하고 원조 FreshAI 창업자를 영입했으며, SoundHound, Hi Auto, ConverseNow, Vox AI는 모두 실제 규모로 배포돼 있다 — 그러나 그들 하나하나가 당신에게 건네는 것은 맞춤형 신호 파이프라인이 아니라 자신들의 스택이다. 우리의 입장은 벤더 중립적이다: 당신이 가진 것을 진단하고, 어떤 플랫폼 위에든 빠져 있는 계층을 구축하며, 당신을 종속시키지 않는다.
검증 계층과 접근성 계층이 모든 걸 느리게 만들지 않을까요? 이것이 진짜 엔지니어링상의 긴장이다. 300밀리초 미만의 응답이 기준선이고, 계층을 하나 더할 때마다 지연 시간이 든다. 클라우드 처리만으로도 네트워크 왕복에 100~500밀리초가 더해진다. 추론을 엣지 어플라이언스로 옮기면 이를 5~10밀리초로 줄이지만 매장당 500~1,500달러의 하드웨어 비용이 더해진다. 할 일은, 시간당 처리 대수를 사람 기준선 아래로 떨어뜨리지 않으면서 가드레일을 추가하는 것이다. 시스템이 줄을 늦추는 순간, 그것이 얼마나 정확하든 상관없이 철수되기 때문이다. 그 균형은 답이 알려져 있는 엔지니어링 문제이지, 가드레일을 건너뛸 이유가 아니다.
이건 진짜 예산 항목인가요, 아니면 과학 실험 프로젝트인가요? 매장당 음성 AI는 소프트웨어로 월 200~500달러, 하드웨어까지 포함하면 올인 400~980달러가 든다. 그에 반해 체인들은 매장당 월 3,000~18,000달러의 추가 매출과 월 네 자릿수의 인건비 절감을 보고하고 있다. 경제성은 성립한다. 성립하지 않는 것은, 그 예산을 대화형 계층에 쓰고 당신을 1면 기사에서 실제로 지켜 주는 세 계층을 건너뛰는 것이다.
입소문 실패들이 주는 진짜 교훈
뉴스에 오른 모든 드라이브스루 음성 AI 재난을 되짚어 보라 — 너겟 260개, 베이컨 선디, 물 18,000잔, 말을 더듬는데 시스템이 도중에 끊어 버리는 고객 — 그러면 영어를 이해하지 못한 모델이 초래한 사례는 단 하나도 찾지 못할 것이다. 그 모두가 아키텍처의 실패다: 결코 정제되지 않은 오디오, 결코 타당성 검사를 거치지 않은 주문, 시스템이 애초에 들을 수 있도록 만들어지지 않은 목소리.
이 분야에서 이기고 있는 체인들은 더 나은 두뇌를 산 것이 아니다. 그들은 그 두뇌를 둘러싼 몸을 만들었다 — 주차장에서도 작동하는 귀, 터무니없는 주문이 주방에 도달하기 전에 멈추는 반사 신경, 진짜 주문이 어떤 모습인지 아는 판단력. 그것이 우리가 Veriprajna에서 하는 일이며, 데모가 암시하는 것보다 훨씬 덜 화려하다.
기계로 드라이브스루 주문을 받는 기술은 이미 한동안 작동해 왔다. 그것을 배포하려 질주하는 대다수 체인에서 여전히 빠져 있는 것은, 출시 발표를 위해 아무도 촬영하지 않는 부분이다: 정제된 오디오, 만 팔천 번째 물 잔을 잡아내는 규칙, 말더듬이 그 단어를 끝맺도록 기다려 주는 인내심. 그것들을 만들면, 모델은 애초에 어려운 부분이 아니었다. 그것들을 건너뛰면, 그 영상이 어떻게 끝나는지 당신은 이미 알고 있다.


