0.94と表示された琥珀色の顔認識マッチ枠に、誤って選び出されたごく普通の買い物客
Facial RecognitionArtificial IntelligencePrivacy

あるベンダーの顔認識は精度99%——それでも一日中、無実の買い物客にフラグを立て続けた

Ashutosh SinghalAshutosh Singhal2026年6月1日13 min

そのベンダーのアルゴリズムは、米国政府自身のベンチマークで最上位ティアにランクされていた。1,200万枚のマグショットのギャラリーにおいて、主要な顔認識システムはいまや99%を超える精度に達している。その数字は本物であり、認証も本物であり、私はそれを使って、あるパイロット顧客に、彼らの万引き防止導入は健全だと安心させていた。

ところが、彼らの実際の店舗データを流してみると、システムは一日中、無実の買い物客にフラグを立て続けた。

そのギャップ——99%というベンチマークスコアと、6番通路で人違いのおばあさんを問い詰めるシステムとの間のギャップ——こそが、このエッセイのテーマそのものである。顔認識のコンプライアンスは、ほとんどの場合アルゴリズムの問題ではない。それは調達の問題であり、データの問題であり、アルゴリズムの衣をまとったガバナンスの問題である。私はそれを高くつく形で学んだ。そしてそれこそが、Veriprajnaの私のチームが最終的に、実際に重要な規制、ベンチマーク、運用基準に照らしてバイオメトリクス・システムを監査するようになった理由であり、ただベンダーの精度を採点するだけでは終わらなかった理由である。

私が最初に作ったスコアカードは、間違った道具だった

オープンセットの数学——0.1%の誤り率が、いかにして500店舗全体で毎日4,000人の無実の人々をフラグ付けする結果になるのか

始めたとき、監査は明白なものだと思っていた。NIST顔認識ベンダーテストを読み——米国立標準技術研究所は、この分野で最も信頼される独立系ベンチマークを運営している——ベンダーのランクを引き出し、採点し、顧客に緑のチェックマークを渡す。私はまさにそれを作った。きちんとしたベンダー精度スコアカードだ。

そのパイロットは、既知の組織的窃盗容疑者のウォッチリストを持つ小売チェーンだった。彼らのベンダーはFRVTで真のトップパフォーマーだった。私のスコアカードでは、彼らはきれいに合格した。だから、彼らの店舗が明らかにどのリストにも載っていない人々に対してアラートを出し続けたとき、私はそれをチューニングの問題だと思い込み、しきい値のバグを探しに行った。

バグなど無かった。数学は設計どおりに正確に機能していた——私はただ、間違った対象を監査していただけだった。

ベンチマークは、アルゴリズムが研究室でどう機能するかを教えてくれる。それが、あなたの店舗でどう振る舞うかについては、ほとんど何も教えてくれない。

私が見落としていたのは、こういうことだ。NISTの目玉となる精度は、クローズドセットのマッチングから来ている。すなわち、ある顔が与えられたとき、既知のギャラリーの中からその一致を見つける、というものだ。それはスマホのロック解除の問題である——これは持ち主か、イエスかノーか。しかし小売のウォッチリストは、オープンセットの問題であり、両者は近い親戚ですらない。1日8,000人の来店客と200人のウォッチリストを持つ店舗では、スキャンの97.5%は、そもそもまったく登録されていない誰かに対して行われる。クローズドセットのアルゴリズムは、見るあらゆる顔について最良の一致を見つけようと懸命に働く。それをこの規模の量に向ければ、0.1%という誤検知率ですら、1店舗あたり1日およそ8件の誤ったアラートを吐き出す。500拠点全体では、毎日4,000人の無実の人々にフラグが立つことになる。私はまったく間違った問いに対してシステムを認証していたのだ。

それが、会社のアプローチを再構築した失敗だった。私たちはベンダーの採点をやめ、導入の監査を始めた。

誤検知は、写真アルバムの中に隠れていた

2つ目の驚きは、その誤った一致が実際にはどこから来ていたか、ということだった。私は、誤った一致とはモデルが弱いことを意味すると思い込んでいた。ところが、ある顧客の登録ギャラリー——システムが顔を照合する相手となる、実際のウォッチリスト画像のセット——を前に腰を据え、サムネイルのグリッドを開いてみた。

それは散々な代物だった。ほんの一握りの、きれいで統制のとれた顔写真。そしてそのあとに、何十枚もの粒子の粗いCCTVの静止画、携帯電話のスナップ、10年も前の逮捕時写真。2026年の生きた顔を、低解像度の2014年の逮捕時写真に照らして確実に一致させることなど不可能であり、世界のどんなアルゴリズムのランクもそれを直せはしない。汚染はデータの中にあったのであって、モデルの中ではなかった。

これこそ、誰も監査しない部分だ。企業はどのベンダーを買うかに執着し、それに供給しているギャラリー——剪定されていないウォッチリスト、古びたキャプチャ、現実世界の誤検知の大半を引き起こす解像度の不整合——を決して精査しない。私たちが登録データベースの衛生管理を監査の一級の一部として扱い始めると、パイロットでの誤アラート率は、しきい値を一つも触る前に低下した。

そして、それらの誤アラートは均等には分布していない。NISTの人口統計的テストは、グループ内の誤検知率が、最大で7,203倍も人口統計グループ間で変動することを見出した——子供、高齢者、そしてアジア系および米国先住民の被験者はいずれも高い率を示す。その一因は、より濃い肌の色調が、安価なカメラでは満たせない、より厳しいダイナミックレンジ捕捉要件を課すためである。これは理論上の話ではない。連邦取引委員会がRite Aidの導入を精査したとき、黒人およびアジア系が多数を占める地域の店舗が、白人が多数を占める地域の店舗よりも著しく多くの誤アラートを生成していたことを見出した。従業員は、システムの限界について訓練されておらず、各アラートを事実として扱い、それに応じて客を問い詰めた。

小売のリスク責任者を夜も眠れなくさせるべき問いは、「うちのベンダーは正確か」ではない。それは「うちのギャラリーは誰の顔に対して最も不得手か、そして画面が点灯したとき、うちの従業員は何をするか」である。

留置場での108日間とはどのようなものか

なぜ私が、人間によるレビューの段階こそが勝負のすべてだと考えるのかを知りたければ、アンジェラ・リップスの記録を読んでほしい。

リップスは50歳のおばあさんだ。2025年7月、ファーゴ警察は顔認識を使って彼女を容疑者として特定し、米国連邦保安官が彼女を逮捕した。彼女は犯行現場から1,200マイル離れていた。彼女は、留置場で108日間を過ごし、その後2025年のクリスマスイブに起訴が取り下げられた。ファーゴの警察署長は2026年3月27日に公に謝罪した。公民権に関する訴えが準備されている。

システムはある数字を生成した。誰も、その数字が、画像品質、探索用写真とギャラリー画像との年齢差、あるいはアルゴリズムが彼女の人口統計グループでどう機能するかを踏まえて信頼できるものかどうかを確認しなかった。マッチスコアは証拠として扱われた。それは証拠ではなかった——それは、較正された信頼度が一切付随していない確率であり、誰かがそれを一つの名前として読んだのだ。

リップスは例外的な存在ではない。ワシントン・ポストは、顔認識による一致の後に不当に逮捕された少なくとも8人のアメリカ人を記録しており、いずれのケースでも捜査官はアリバイの確認といった基本的な手順を省いていた。ハーヴェイ・マーフィーの不当な拘束は10日間に及び、身体的暴行を含み、1,000万ドルの訴訟へと発展した。リノでは、ジェイソン・キリンガーのカジノ顔認識による不当逮捕事件が公判へと向かっており、ある警官が「決して起こるべきではなかった」と記録に残している。

だからこそ、規制当局は人間による監督をチェックボックスとして受け入れることをやめた。いまや各法域で収束しつつある基準は、儀礼的ではなく、意味のあるレビューである——そして「意味のある」というのは、まさにほとんどの導入が偽っているものだ。私は、SOPに「意味のある監督」というラベルの付いた欄はあるのに、その下には何も書かれていない、そんなヒューマン・イン・ザ・ループ手順をレビューしてきた。機械が出力を生成するのと同じ速さで機械の出力に判子を押すレビュー担当者は、監督ではない。レビューのワークフローが実際に規制の基準を満たしていること——人間がシステムをオーバーライドでき、実際にそうしており、そのために必要な情報を持っていること——を検証することは、私たちが行うすべての監査の中で、最も困難かつ最も重要な部分の一つであることが判明した。

あなたが実際に法的責任を負っている継ぎはぎ

バイオメトリクス法の断片化した継ぎはぎ——連邦法なし、BIPA、CUBI、EU AI Act、市による禁止、そして罰則

人々はいつも私に、遵守すべき「顔認識の法律」はどれかと尋ねる。そんなものは一つも存在しない。米国の顔認識を規律する連邦法は存在しない。代わりに存在するのは継ぎはぎであり、その罰則は象徴的なものではない。

イリノイ州のBIPAは牙を持つ一つだ。なぜなら、それは私人による訴権を伴う——誰でも訴えることができる。違反1件あたりの損害賠償額は、過失による違反で1,000ドル、故意による違反で5,000ドルに及び、2025年だけで、107件を超える新たな集団訴訟全体で和解額は総額1億3,660万ドルに達した。歴代の数字はさらに大きい。Facebookは6億5,000万ドルで、Clearview AIは5,175万ドルで和解した。テキサス州のCUBIは違反1件あたり最大25,000ドルの罰則を伴い、13億7,500万ドルのGoogle和解を生み出した。もっとも、テキサス州は司法長官を通じてのみ執行し、同州の2025年TRAIGA法は、セキュリティおよび詐欺防止のための適用除外を設けている。

そしてEU AI Actがある。その禁止行為——リアルタイムの遠隔バイオメトリクス識別の禁止を含む——は2025年2月に執行可能となり、罰則は最大3,500万ユーロまたは世界売上高の7%に達する。同法の高リスクシステムに関する期限は、欧州議会が延長を可決したことで2027年12月2日まで先送りされた。これは時間を稼ぐものの、すでに発効している禁止事項については何一つ変えない。これに、コロラド州の改正プライバシー法、ワシントン州のバイオメトリクス法、そしてサンフランシスコ、ボストン、オークランド、ポートランドを含む16を超える米国都市での全面禁止——さらに2026年末までにあと10州以上がバイオメトリクス保護法を成立させると見込まれている——を重ねれば、ある郵便番号では合法でありながら、隣の郵便番号では集団訴訟の磁石となる、そんな導入が出来上がる。2025年12月に発売されたAmazonのRing「Familiar Faces」機能は、発売から数週間以内にイリノイ州、テキサス州、ポートランドでブロックされた。

本物の監査は、単一の導入をこれらすべてに対して一度にマッピングしなければならない。既製のツールでそれをこなせるものは一つも無い。だからこそ私たちは、その能力を自ら構築せざるを得なかったのだ。

なぜ最上位ランクのベンダーを買うだけでは十分でないのか?

初期の頃、あるアドバイザーが私に、この件は私が思っているよりも単純だと言った——NISTで最高ランクのベンダーを買えば、それでコンプライアンスは達成される、と。私は1週間ほどそれを信じていた——パイロットが、優れたベンチマークで最上位のベンダーであっても、なお誤アラートだらけの店舗を生み出すことを証明するまでは。

ベンダーの状況は、懐疑心に報いる。フルスタックのリーダー——NEC、IDEMIA、Thales——はいずれも真のFRVTトップパフォーマーであり、ParavisionやRank One Computingといったソフトウェア専門企業も最良の部類にランクされる。しかしランキングは、契約書の中で最も重要となる一文を除外している。ベンダーは日常的に、いかなる精度の保証も否認している。企業は、自らが独立して監査できない出力について、すべての法的責任を引き受ける。大手クラウド勢は空気を読んで撤退した——Amazonは警察によるRekognitionの使用に無期限のモラトリアムを課し、MicrosoftはAzure Faceについて同じことを行い、IBMは2020年に顔認識から完全に撤退した。最も攻撃的な収集者であるClearview AIは、EUで全面的に禁止されている。

もしあなたのベンダーが精度を保証せず、規制当局が出力についてあなたに法的責任を負わせるのなら、ベンダーのベンチマークのランクは、あなたの導入について最もどうでもいい事実である。

ほとんどの買い手が決して目にしない、より根深い調達の罠がある。FTCのRite Aidに対する措置は、単に5年間の顔認識を禁止しただけではなかった——それは、モデル剥奪を命じた。すなわち、すべてのバイオメトリクス・データ、そしてそれで訓練されたあらゆるモデルの破壊である。剥奪は標準的な手段になりつつある。2025年5月のある事件では、あるエドテック企業に自社のモデルも削除することを強いた。その原則は、収集を許されていなかったデータ、あるいはそのデータから派生したアルゴリズムから、利益を得ることはできない、というものだ。だから、調達責任者がベンダーに問うべき問いは、「あなたはどれほど正確か」ではない。それは「あなたが私に売っているその精度が、モデルそれ自体の削除につながりかねないデータの上に築かれたものではないと、証明できるか」である。それはデューデリジェンスの問いであり、ほとんど誰もそれを尋ねない。

銀行は正反対の問題を抱えている——そして同じギャップを抱えている

小売は鮮烈な事例だが、金融機関も反対の方向から、同じくらい厳しい立場に置かれている。彼らのバイオメトリクスはウォッチリストのスクリーニングではない——それは電子的な顧客確認(KYC)チェックだ。すなわち、本人確認書類の検証を、顔照合と生体検知と組み合わせて、実在の人物が実在の口座を開設していることを確認するものである。その導入は同意に基づき、対象も限定されているため、より容易に聞こえる。だがそうではない。なぜなら、基準が動いたからだ。

2026年1月1日をもって、FinCENはマネーロンダリング防止要件を拡大し、より広範な2026年の監督上の転換は、統制の存在から、統制の実証可能な有効性へと移った。もはや、生体検知を実行していると言うだけでは十分ではない。それが機能することを示さなければならない——あなたの生体検知が、プレゼンテーション攻撃(印刷された写真、再生された動画、カメラの前にかざされたシリコンマスク)を切り抜けること、あなたの誤一致率が人口統計をまたいで維持されること、その統制が単に存在するのではなく、測定可能な何かを実際に行うこと、をである。銀行業務の生体検知にFacePhiのようなベンダーを使う銀行は、小売業者と同じ立場にある——独立して評価できないシステムについてすべての法的責任を抱えながら、いまや規制当局から、一度も測定したことのない有効性を証明するよう求められているのだ。

万引き防止責任者と銀行のコンプライアンス責任者を結ぶ糸は、同じギャップである。両者とも、ベンダーの主張を頼りにバイオメトリクス・システムを購入した。どちらも、NISTのFRVTレポートを、調達判断へと翻訳できるほど十分に読み解くことも、システムに供給しているデータの品質を監査することも、自らの人間によるレビュープロセスが儀礼的ではなく意味のあるものであることを証明することもできない。そのギャップは、バイオメトリクスの判断が自律型AIエージェントに委ねられるにつれて広がりつつある——エージェントのアイデンティティを管理するための正式な戦略を何らか持つ組織はわずか23%にすぎず、本人確認企業iProovは、エージェントが高い影響を持つ判断を下しながら、誰もそれに対して明確に答責を負わない場合の「答責性の空白」について警告し続けてきた。

較正された疑念は、実際に何をもたらしてくれるのか?

最も重要だった修正は、最も華やかさのないものだった。顔認識ベンダーはマッチスコア——一つの数字——を、その周りに較正された信頼区間なしに報告する。システムは「0.94」と告げ、オペレーターは「これは彼女だ」と読む。しかし、きれいなスタジオの顔写真に対する0.94と、アルゴリズムが不得手とする人口統計出身の誰かの10年前の逮捕時写真に対する0.94は、同じ主張ではなく、生のスコアはその違いを覆い隠している。

欠けているのは不確実性のレイヤーだ。すなわち、各一致に対して正直で較正された信頼度を付与し、境界線上の結果が、それ自身を自ら告げるように——境界線上のものとして——なり、警備員の無線ではなく人間へと振り分けられるようにする、そうした手段である。その種のミドルウェアは商業的には存在しない。そのための評価を構築すること——ファーゴの警官に「この一致は、画像品質と対象者の人口統計グループを踏まえると信頼度が低い。単独でこれに基づいて行動してはならない」と告げてくれたであろうもの——こそが、リップスの事件の後ではなく前に存在していてほしかったと私が願う仕事である。

すでにこれを理解している機関を見ることができる。英国のエセックス警察は、情報コミッショナー事務局(ICO)による監査を受けて、バイアスのリスクを理由に自らの顔認識プログラムを一時停止した。彼らは、自分たちのシステムに人口統計的な盲点があると知るために、不当逮捕が起こるのを待たなかった。それがあるべき姿勢だ——独立した監査が別のことを証明するまでは、システムを法的責任とみなす、その逆ではなく。

ベンチマークスコアは、ベンダーの営業資料に見せるものだ。各一致に付された較正された信頼区間は、規制当局と法廷に見せるものだ——そして、そのうち反対尋問を生き延びるのは一方だけである。

次のベンダーとの通話に持ち込むべき本当の問い

もしあなたが顔認識を導入しているなら、その居心地の悪い真実とは、あなたのベンチマーク認証が、あなたの店舗やオンボーディングのフローで動いているシステムとは別のシステムを測定している、ということだ。精度は本物だが、ほとんど的外れである。あなたのエクスポージャーを決めるのは、あなたの環境のオープンセットの数学であり、あなたが築いたギャラリーの衛生状態であり、あなたの法域がマッピングされているかどうかであり、そして機械が人違いの相手を問い詰める前に、人間が実際にその機械を捕まえられるかどうかである。

そのどれ一つとして、ベンダーのランクには現れない。そのすべてが、集団訴訟に、FTCの同意命令に、あるいはおばあさんの独房での108日間に現れる。私たちは、バイオメトリクスおよび顔認識のコンプライアンス監査を、そうしたギャップを訴訟の中よりもレポートの中で見つけたいと願う買い手のために構築した。

だから次にベンダーが99%という精度の数字をあなたに手渡してきたときは、どうやってそれを得たかを尋ねてはいけない。それが何をカバーしていないのかを尋ねよ——そしてそのうえで、毎日あなたのカメラの前を通り過ぎる顔のうち、そもそもどのリストにも一度も載っていなかった顔がどれほどあるかを、数えに行くのだ。

関連リサーチ

他のプラットフォームでも公開

確かな信頼のもとに、AIを構築する。

次世代のエンタープライズAI構築において豊富な経験を持つチームと、ぜひご一緒ください。信頼できるAI戦略の設計・構築・導入を、私たちがお手伝いします。

Veriprajna ディープテック・コンサルティング は、ヘルスケア・金融・規制対応分野における安全性重視のAIシステム構築を専門としています。当社のアーキテクチャは確立されたプロトコルに照らして検証され、包括的なコンプライアンス文書を備えています。