
얼굴 인식 벤더가 99% 정확도를 기록하고도 하루 종일 무고한 쇼핑객을 표시했다
해당 벤더의 알고리즘은 미국 정부 자체 벤치마크에서 최상위 등급에 올라 있었다. 1,200만 장의 머그샷 갤러리에서, 선도적인 얼굴 인식 시스템들은 이제 99%가 넘는 정확도를 기록한다. 그 수치는 실제였고, 인증서도 실제였으며, 나는 그것을 근거로 파일럿 고객에게 그들의 손실 방지 배치가 견고하다고 안심시켰다.
그런 다음 우리는 그들의 실제 매장 데이터를 돌려보았고, 시스템은 하루 종일 무고한 쇼핑객들을 표시했다.
그 간극 — 99%라는 벤치마크 점수와, 6번 통로에서 엉뚱한 할머니를 제지하는 시스템 사이의 간극 — 이 바로 이 글의 전체 주제다. 얼굴 인식 컴플라이언스는 거의 결코 알고리즘 문제가 아니다. 그것은 조달의 문제이고, 데이터의 문제이며, 알고리즘의 옷을 입은 거버넌스의 문제다. 나는 그것을 값비싼 대가를 치르며 배웠고, 그래서 결국 Veriprajna의 우리 팀은 실제로 중요한 규제, 벤치마크, 운영 표준에 비추어 생체 인식 시스템을 감사하게 되었다 — 단순히 벤더의 정확도를 채점하는 대신에.
내가 처음 만든 스코어카드는 잘못된 도구였다

처음 시작했을 때, 나는 감사가 명백하다고 생각했다. NIST 얼굴 인식 벤더 테스트를 읽고 — 미국 국립표준기술연구소는 이 분야에서 가장 존중받는 독립 벤치마크를 운영한다 — 벤더의 순위를 뽑아 채점한 뒤, 고객에게 초록색 체크를 건네주는 것. 나는 정확히 그것을 만들었다: 깔끔한 벤더 정확도 스코어카드를.
그 파일럿은 알려진 조직적 절도 용의자 감시 목록을 가진 소매 체인이었다. 그들의 벤더는 FRVT에서 진정한 최상위 성능을 내는 곳이었다. 내 스코어카드로는 그들은 깔끔하게 통과했다. 그래서 그들의 매장이 어떤 목록에도 분명히 없는 사람들에 대해 계속 경보를 발생시켰을 때, 나는 그것이 튜닝 문제라고 가정하고 임계값에서 버그를 찾으러 나섰다.
버그는 없었다. 그 수학은 설계된 그대로 정확히 작동하고 있었다 — 나는 그저 잘못된 것을 감사했을 뿐이었다.
벤치마크는 알고리즘이 실험실에서 어떻게 성능을 내는지 알려준다. 그것이 당신의 매장에서 어떻게 작동할지에 대해서는 거의 아무것도 알려주지 않는다.
내가 놓쳤던 것은 이렇다. NIST의 대표 정확도는 클로즈드셋 매칭에서 나온다: 하나의 얼굴이 주어지면, 알려진 갤러리에서 그 짝을 찾는 것. 그것이 바로 휴대폰 잠금 해제 문제다 — 이 사람이 소유자인가, 예 또는 아니오. 그러나 소매 감시 목록은 오픈셋 문제이며, 이 둘은 사촌 관계도 아니다. 하루 8,000명의 방문객과 200명 규모의 감시 목록을 가진 매장에서, 모든 스캔의 97.5%는 애초에 등록되지 않은 사람을 대상으로 한다. 클로즈드셋 알고리즘은 자신이 보는 모든 얼굴에 대해 최적의 짝을 찾으려 애쓴다. 그것을 그런 규모에 겨냥하면 0.1%의 오탐률조차 매장당 하루에 대략 8건의 잘못된 경보를 던진다. 500개 지점에 걸쳐, 그것은 매일 4,000명의 무고한 사람을 표시하는 것이다. 나는 전적으로 잘못된 질문을 기준으로 시스템을 인증했던 것이다.
그것이 회사의 접근법을 다시 세운 실패였다. 우리는 벤더를 채점하는 것을 멈추고 배치를 감사하기 시작했다.
오탐은 사진첩 속에 숨어 있었다
두 번째 놀라움은 그 잘못된 매칭이 실제로 어디에서 왔는가였다. 나는 잘못된 매칭이 약한 모델을 의미한다고 가정했었다. 그런 다음 한 고객의 등록 갤러리 — 시스템이 얼굴을 비교하는 실제 감시 목록 이미지 세트 — 를 앞에 두고 앉아 썸네일 그리드를 띄웠다.
그것은 엉망이었다. 깨끗하고 통제된 증명사진 몇 장. 그리고 그다음에는 거친 CCTV 스틸, 휴대폰 스냅샷, 그리고 10년 된 입건 사진이 수십 장이었다. 살아 있는 2026년의 얼굴을 저해상도의 2014년 입건 사진과 안정적으로 매칭할 수는 없으며, 세상 어떤 알고리즘 순위도 그것을 고치지 못한다. 오염은 모델이 아니라 데이터에 있었다.
이것이 아무도 감사하지 않는 부분이다. 기업들은 어떤 벤더를 살지에 집착하면서 정작 그것에 먹이는 갤러리는 결코 들여다보지 않는다 — 정리되지 않은 감시 목록, 오래된 캡처, 그리고 대부분의 실제 오탐을 유발하는 해상도 불일치. 우리가 등록 데이터베이스 위생을 감사의 일급 요소로 다루기 시작하자, 파일럿에서의 오경보율은 우리가 단 하나의 임계값도 건드리기 전에 떨어졌다.
그리고 그 오경보들은 고르게 분포되어 있지 않다. NIST의 인구통계 테스트는 그룹 내 오탐률이 인구통계 집단에 걸쳐 최대 7,203배까지 차이가 난다는 것을 발견했다 — 어린이, 노인, 그리고 아시아계 및 아메리카 원주민 대상자 모두가 높아진 비율을 보이며, 이는 부분적으로 어두운 피부톤이 저렴한 카메라가 충족하지 못하는 더 까다로운 다이내믹 레인지 캡처 요구를 부과하기 때문이다. 이것은 이론적인 이야기가 아니다. 미국 연방거래위원회가 Rite Aid의 배치를 조사했을 때, 흑인과 아시아계가 다수인 지역사회의 매장이 백인이 다수인 지역사회의 매장보다 상당히 더 많은 오경보를 발생시켰다는 것을 발견했다. 시스템의 한계에 대해 훈련받지 않은 직원들은 각 경보를 사실로 취급하고 그에 따라 고객을 제지했다.
소매 리스크 담당자를 밤새 잠 못 이루게 해야 하는 질문은 "우리 벤더가 정확한가"가 아니다. 그것은 "우리 갤러리가 누구의 얼굴에 대해 가장 취약한가, 그리고 화면에 불이 들어왔을 때 우리 직원들은 무엇을 하는가"이다.
감옥에서의 108일이 어떤 모습인지
왜 내가 인간 검토 단계가 승부의 전부라고 생각하는지 알고 싶다면, Angela Lipps 사건 파일을 읽어보라.
Lipps는 50세의 할머니다. 2025년 7월, Fargo 경찰은 얼굴 인식을 사용해 그녀를 용의자로 식별했고, 미국 연방보안관들이 그녀를 체포했다. 그녀는 범행 현장에서 1,200마일 떨어져 있었다. 그녀는 감옥에서 108일을 보낸 뒤에야 2025년 크리스마스 이브에 혐의가 기각되었다. Fargo 경찰서장은 2026년 3월 27일 공개적으로 사과했다. 민권 소송이 준비되고 있다.
시스템이 하나의 숫자를 산출했다. 이미지 품질, 프로브 사진과 갤러리 이미지 사이의 나이 차이, 또는 그 알고리즘이 그녀의 인구통계 집단에서 어떻게 성능을 내는지를 감안할 때 그 숫자가 신뢰할 만한지 아무도 확인하지 않았다. 매칭 점수는 증거로 취급되었다. 그것은 증거가 아니었다 — 그것은 보정된 신뢰도가 전혀 붙어 있지 않은 확률이었고, 누군가 그것을 하나의 이름으로 읽었다.
Lipps는 예외적인 사례가 아니다. Washington Post는 얼굴 인식 매칭 이후에 잘못 체포된 미국인이 최소 여덟 명이라는 것을 기록했으며, 모든 사건에서 수사관들은 알리바이 확인 같은 기본적인 단계를 건너뛰었다. Harvey Murphy의 부당 구금은 10일간 이어졌고, 물리적 폭행을 포함했으며, 1,000만 달러 소송으로 이어졌다. Reno에서는 Jason Killinger의 카지노 얼굴 인식 부당 체포 사건이 재판으로 향하고 있으며, 한 경관은 그것이 "결코 일어나지 말았어야 했다"고 기록에 남겼다.
이것이 규제 당국이 인간 감독을 체크박스로 받아들이는 것을 멈춘 이유다. 이제 각 관할권에 걸쳐 수렴하고 있는 표준은 의례적이 아닌, 유의미한 검토다 — 그리고 대부분의 배치가 위조하는 것이 정확히 "유의미함"이다. 나는 SOP에 유의미한 감독이라고 적힌 칸이 있지만 그 아래에는 아무것도 없는 인간 개입(human-in-the-loop) 절차들을 검토해 왔다. 기계가 출력을 산출하는 것과 같은 속도로 기계의 출력에 고무도장을 찍는 검토자는 감독이 아니다. 검토 워크플로가 실제로 규제 기준을 충족하는지 — 인간이 시스템을 무효화할 수 있고 또 실제로 무효화하며, 그렇게 할 수 있는 정보를 갖추고 있는지 — 를 검증하는 것이, 우리가 수행하는 모든 감사에서 가장 어렵고 가장 중요한 부분 중 하나로 드러났다.
당신이 실제로 책임을 지고 있는 짜깁기 규제

사람들은 항상 나에게 자신들이 준수해야 할 "그 얼굴 인식 법"이 무엇이냐고 묻는다. 그런 것은 하나도 없다. 얼굴 인식을 규율하는 미국 연방법은 없다. 대신 존재하는 것은 짜깁기이며, 그 처벌은 상징적이지 않다.
Illinois BIPA는 이빨을 가진 법인데, 사적 소권을 담고 있기 때문이다 — 누구나 소송을 제기할 수 있다. 위반당 손해배상액은 과실 위반에 1,000달러, 고의 위반에 5,000달러이며, 2025년 한 해에만 합의금이 107건 이상의 새로운 집단소송에 걸쳐 1억 3,660만 달러에 달했다. 역대 수치는 이보다 더 크다: Facebook은 6억 5,000만 달러에, Clearview AI는 5,175만 달러에 합의했다. Texas CUBI는 위반당 최대 25,000달러의 처벌을 담고 있으며 13억 7,500만 달러의 Google 합의를 낳았는데, 다만 Texas는 검찰총장을 통해서만 집행하고 2025년의 TRAIGA 법은 보안 및 사기 방지에 대한 예외를 만들어 두었다.
그다음에는 EU AI Act가 있는데, 그 금지된 관행들 — 실시간 원격 생체 식별 금지를 포함하여 — 은 2025년 2월에 집행 가능해졌으며, 처벌은 최대 3,500만 유로 또는 전 세계 매출의 7%에 이른다. 그 고위험 시스템 마감 기한은 유럽 의회가 연장 투표를 한 뒤 2027년 12월 2일로 밀렸는데, 이는 시간을 벌어주지만 이미 시행 중인 금지에 대해서는 아무것도 바꾸지 않는다. 여기에 Colorado의 개정 프라이버시법, Washington의 생체 인식 법, 그리고 San Francisco, Boston, Oakland, Portland를 포함한 16개 이상의 미국 도시에서의 전면 금지 — 2026년 말까지 10개 이상의 추가 주가 생체 인식 보호법을 통과시킬 것으로 예상됨 — 를 겹쳐 놓으면, 한 우편번호에서는 합법이지만 바로 옆에서는 집단소송의 자석이 되는 배치를 갖게 된다. 2025년 12월에 출시된 Amazon Ring의 "Familiar Faces" 기능은 출시 몇 주 만에 Illinois, Texas, Portland에서 차단되었다.
진정한 감사는 단일 배치를 이 모든 것에 한꺼번에 대조해야 한다. 기성 도구 중 그것을 해내는 것은 없으며, 그것이 바로 우리가 그 역량을 구축해야 했던 이유다.
왜 최상위 순위 벤더를 사는 것으로는 충분하지 않은가?
초기에, 한 자문가는 나에게 이 전체 문제가 내가 만들고 있는 것보다 더 단순하다고 말했다: NIST 최상위 순위 벤더를 사면, 당신은 컴플라이언스를 준수하는 것이다. 나는 그것을 일주일쯤 믿었다 — 파일럿이 훌륭한 벤치마크의 최상위 벤더도 여전히 오경보로 가득한 매장을 만들어낸다는 것을 증명하기 전까지.
벤더 지형은 회의주의를 보상한다. 풀스택 선두주자들 — NEC, IDEMIA, Thales — 은 모두 진정한 FRVT 최상위 성능 기업이며, Paravision과 Rank One Computing 같은 소프트웨어 전문 기업들도 최고 수준에 든다. 그러나 그 순위는 계약에서 가장 중요한 조항을 빠뜨린다: 벤더들은 으레 어떠한 정확도 보증도 부인한다. 기업은 자신이 독립적으로 감사할 수 없는 출력에 대한 모든 책임을 떠안는다. 대형 클라우드 사업자들은 분위기를 읽고 떠났다 — Amazon은 Rekognition의 경찰 사용에 무기한 유예 조치를 두었고, Microsoft는 Azure Face에 대해 같은 조치를 했으며, IBM은 이미 2020년에 얼굴 인식에서 완전히 손을 뗐다. 가장 공격적인 수집가인 Clearview AI는 EU에서 전면 금지되었다.
당신의 벤더가 정확도를 보증하지 않을 것이고 규제 당국이 그 출력에 대해 당신에게 책임을 지운다면, 그 벤더의 벤치마크 순위는 당신의 배치에 관해 가장 흥미롭지 않은 사실이다.
대부분의 구매자가 결코 보지 못하는 더 깊은 조달의 함정이 있다. FTC의 Rite Aid 조치는 5년간 얼굴 인식을 금지한 것에 그치지 않았다 — 그것은 모델 반환(model disgorgement)을 명령했다: 모든 생체 인식 데이터 와 그것으로 학습된 모든 모델의 파기. 반환은 표준 도구가 되어 가고 있다; 2025년 5월의 한 사건은 에듀테크 회사에 자사 모델도 삭제하도록 강제했다. 그 원칙은 당신이 수집할 권한이 없었던 데이터, 또는 그런 데이터에서 파생된 알고리즘으로부터 이익을 얻을 수 없다는 것이다. 그래서 조달 책임자가 벤더에게 물어야 할 질문은 "당신은 얼마나 정확한가"가 아니다. 그것은 "당신이 나에게 팔고 있는 그 정확도가 모델 자체를 삭제당하게 할 수 있는 데이터 위에 만들어진 것이 아님을 증명할 수 있는가"이다. 그것은 실사(due-diligence) 질문이며, 거의 아무도 그것을 묻지 않는다.
은행은 정반대의 문제를 안고 있다 — 그리고 같은 간극을
소매업은 생생한 사례지만, 금융 기관들은 반대 방향에서 똑같이 빠듯한 처지에 놓여 있다. 그들의 생체 인식은 감시 목록 선별이 아니다 — 그것은 전자적 고객 확인(Know Your Customer) 절차다: 실제 사람이 실제 계좌를 개설하고 있음을 확인하기 위해 얼굴 매칭 및 라이브니스 탐지와 결합된 신분증 검증. 그 배치는 동의를 받았고 범위가 좁으며, 이는 더 쉬운 것처럼 들린다. 그렇지 않은데, 기준이 이동했기 때문이다.
2026년 1월 1일부로, FinCEN은 자금세탁 방지 요건을 확대했으며, 더 넓은 2026년의 감독 방향 전환은 통제의 존재에서 통제의 입증 가능한 효과성으로의 이동이다. 라이브니스 탐지를 운영한다고 말하는 것만으로는 더 이상 충분하지 않다. 당신은 그것이 작동함을 보여줘야 한다 — 당신의 라이브니스 확인이 표시 공격(인쇄된 사진, 재생된 영상, 카메라 앞에 들이댄 실리콘 마스크)을 견뎌낸다는 것, 당신의 오매칭률이 인구통계 전반에 걸쳐 유지된다는 것, 그 통제가 단지 존재하는 것을 넘어 측정 가능한 무언가를 한다는 것을. 은행 라이브니스를 위해 FacePhi 같은 벤더를 사용하는 은행은 소매업체와 같은 처지에 있다: 자신이 독립적으로 평가할 수 없는 시스템에 대한 모든 책임을 떠안은 채로, 이제 규제 당국으로부터 결코 측정한 적 없는 효과성을 증명하라는 요구를 받고 있는 것이다.
손실 방지 관리자와 은행의 컴플라이언스 담당자를 잇는 실은 같은 간극이다. 둘 다 벤더의 주장을 근거로 생체 인식 시스템을 샀다. 어느 쪽도 NIST FRVT 보고서를 조달 결정으로 옮길 만큼 충분히 잘 읽어낼 수도, 자신이 시스템에 먹이는 데이터의 품질을 감사할 수도, 자신들의 인간 검토 과정이 의례적이 아니라 유의미하다는 것을 증명할 수도 없다. 그 간극은 생체 인식 결정이 자율 AI 에이전트에게 넘겨지면서 넓어지고 있다 — 에이전트 신원 관리에 대한 공식 전략을 조금이라도 가진 조직은 23%에 불과하며, 신원 검증 기업 iProov는 에이전트가 고영향 결정을 내리는데 그에 대해 명확히 책임질 사람이 아무도 없을 때의 "책임 공백"에 대해 경고해 왔다.
보정된 의심은 실제로 당신에게 무엇을 사주는가?
가장 중요했던 해결책은 가장 화려하지 않은 것이었다. 얼굴 인식 벤더들은 매칭 점수 — 하나의 숫자 — 를 그 주변에 보정된 신뢰 구간 없이 보고한다. 시스템은 "0.94"라고 말하고 운영자는 "그녀가 맞다"고 읽는다. 그러나 깨끗한 스튜디오 증명사진에 대한 0.94와 알고리즘이 서투르게 처리하는 인구통계 집단에 속한 사람의 10년 된 입건 사진에 대한 0.94는 같은 주장이 아니며, 원본 점수는 그 차이를 숨긴다.
빠져 있는 것은 불확실성 계층이다: 각 매칭에 정직하고 보정된 신뢰도를 붙여, 경계선상의 결과가 스스로를 경계선상이라고 알리고 경비원의 무전기가 아니라 인간에게로 라우팅되게 하는 방법. 그런 종류의 미들웨어는 상업적으로 존재하지 않는다. 그것을 위한 평가를 구축하는 것 — Fargo 경관에게 "이 매칭은 이미지 품질과 대상자의 인구통계 집단을 감안할 때 신뢰도가 낮으니, 이것만으로 행동하지 말라"고 말해줬을 바로 그것 — 이 Lipps 사건 이후가 아니라 이전에 존재했더라면 하고 내가 바라는 그 작업이다.
이미 이것을 이해하는 기관들을 볼 수 있다. 영국의 Essex Police는 정보위원회(Information Commissioner's Office)의 감사 이후 편향 위험을 이유로 자신들의 얼굴 인식 프로그램을 중단했다. 그들은 자신들의 시스템에 인구통계적 사각지대가 있다는 것을 알아내기 위해 부당 체포가 일어날 때까지 기다리지 않았다. 그것이 바로 그 자세다: 독립 감사가 그 반대를 증명하기 전까지 시스템을 책임 요소로 취급하는 것, 그 반대가 아니라.
벤치마크 점수는 벤더의 영업 자료에 보여주는 것이다. 각 매칭에 대한 보정된 신뢰 구간은 규제 당국과 법정에 보여주는 것이며 — 그 둘 중 오직 하나만이 반대 심문을 견뎌낸다.
다음 벤더 통화에 가지고 갈 진짜 질문
당신이 얼굴 인식을 배치했다면, 불편한 진실은 당신의 벤치마크 인증서가 당신의 매장이나 온보딩 흐름에서 돌아가고 있는 시스템과는 다른 시스템을 측정하고 있다는 것이다. 그 정확도는 실제이지만 거의 요점에서 벗어나 있다. 당신의 노출을 결정하는 것은 당신 환경의 오픈셋 수학, 당신이 구축한 갤러리의 위생, 당신의 관할권들이 매핑되어 있는지, 그리고 인간이 기계가 엉뚱한 사람을 제지하기 전에 실제로 그것을 잡아낼 수 있는지다.
그 어느 것도 벤더 순위에는 나타나지 않는다. 그 모든 것은 집단소송, FTC 동의 명령, 또는 한 할머니가 감방에서 보낸 108일에 나타난다. 우리는 우리의 생체 인식 및 얼굴 인식 컴플라이언스 감사를, 그런 간극을 소송에서보다 보고서에서 발견하고 싶어하는 구매자를 위해 구축했다.
그러니 다음번에 벤더가 당신에게 99% 정확도 수치를 건네줄 때, 그들이 그것을 어떻게 얻었는지 묻지 말라. 그것이 무엇을 다루지 않는지를 물어라 — 그런 다음 매일 당신의 카메라 앞을 지나가는 얼굴들 중 애초에 어떤 목록에도 없었던 얼굴이 얼마나 많은지 세어보라.