AIカメラが認識するものと物理的現実を左右に並べて対比し、スキンヘッドとサッカーボールの誤認という象徴的な事例を通じて記事の中心的なメタファーを表現したエディトリアルカバー画像。
Artificial IntelligenceComputer VisionMachine Learning

AIを狂わせたスキンヘッド(そして真に機能するビジョンシステム構築についてそれが教えてくれたこと)

Ashutosh SinghalAshutosh Singhal2026年3月6日12 min

2020年10月、インヴァネス・カレドニアン・シッスル対エア・ユナイテッドというスコットランドのサッカーの試合が、私がこれまで研究してきた中で最も示唆に富むAIの失敗例となった。人間のオペレーターなしでボールを追尾して試合を中継するために構築された自動カメラシステムが、試合中ずっと、サイドラインに立つ副審のスキンヘッドを一途に追いかけ続けたのだ。自宅で観戦していたファンはすべてのゴールを見逃した。ネット上はお祭り騒ぎとなった。

私も最初は笑った。だが、すぐに笑えなくなった。私のチームもまったく同じ盲点を抱えたシステムを構築していることに気づいたからだ。

カメラのAIは、自らの論理に従って完璧に役目を果たしていた。スタジアムの照明の下で白っぽい丸い物体を見つけ出し、それに「ボール」として98%の信頼度スコアを割り当てたのだ。一方、本物のボールは——高速で動き、影の中でブレ、時には選手に遮られながら——わずか80%前後のスコアしか得られなかった。システムは数式に従った。しかし数式は現実から乖離していた。「パターンの検出」と「何を見ているかの理解」の間にある溝こそが、私がここ数年の人生を費やしてきた領域であり、Veriprajnaで物理制約付きビジョンシステムの構築を始めた理由でもある。

世界を見るとき、AIは何を見ているのか?

大半のコンピュータビジョンシステムは、動物園で極めて自信満々な幼児が動物を見分けるのと同じような方法で画像を処理している。丸くて光っている? ボール。足が4本ある? 犬。この例えは冗談ではない——現代の畳み込みニューラルネットワーク(CNN)は、画像をテクスチャ、エッジ、形状に分解し、それらの特徴を訓練データから学習したパターンと照合する。それらは本質的に、テクスチャ照合マシンにすぎないのだ。

これは制御された条件下では驚くほど見事に機能する。だが、物理的な世界が物理法則に従って振る舞い始めた瞬間、崩壊する。

物体の検出は、物体の理解ではない。丸いものを見てボールと呼ぶシステムは、テクスチャを特定しただけだ。「ボール」が3分間も高さ1.7メートル(5.5フィート)に静止しているからという理由でその識別を棄却するシステム——それこそが、何かを理解しているシステムである。

インヴァネスのカメラが頭とボールを区別できなかったのは、ボールがどのように振る舞うかという概念を持っていなかったからだ。サッカーボールは放物運動を描く。インパクトの瞬間に加速する。時速80マイル(約130キロ)に達する速度で移動する。歩行速度で動く人間の胴体にくっついたまま移動することなどあり得ない。これらは決して奇抜な洞察ではない——試合を見ている子供でも分かることだ。しかしAIは、コンピュータビジョンコミュニティで「フレーム独立推論」と呼ばれる方式で動作し、過去の記憶も次に何が起こるべきかという予測も持たずに、個々の画像を孤立したスナップショットとして処理していた。

私たちが同じ問題を抱えていると気づいた夜

エレガントな理論的洞察によって物理制約付きビジョンに辿り着いたと言えれば格好いいのだが、現実はもっと泥臭いものだった。私たちはある半導体クライアントのために欠陥検査システムを構築していたのだが、開発したモデルがゴミ粒子を回路の欠陥として誤検知していた。たまにではない——頻繁にだ。その偽陽性(誤検知)率の高さは、製造チームのシステムに対する信頼を打ち砕いており、彼らがシステムを信用しなかったのは至極当然だった。

深夜2時に怒りに震えながら検証結果の前に座っていたのを覚えている。なぜなら、私たちのモデルは私たちが追跡していたあらゆるベンチマーク指標において高精度だったからだ。標準的なテストデータでは90%以上の確率で欠陥を正しく特定していた。しかし、実際の製造現場は標準テストデータとは違っていた。ウェハーの上にゴミが落ちる。検査ステーション間で照明が変わる。モデルは黒い点を見てそれを欠陥と判定した。インヴァネスのカメラが丸い形を見てボールと判定したのとまったく同じように。

CTOと私は修正方針をめぐって1週間にわたり議論を重ねた。彼はより多くの訓練データを求めた。私はアーキテクチャの変更を求めた。その議論は、私がひとつのシンプルな問いを投げかけたことで決着した。「私たちのモデルは、マルチアングル撮影の下でゴミ粒子と回路欠陥が異なる挙動を示すことを知っているだろうか?」と。モデルは知らなかった。本物の欠陥——シリコンの物理的なくぼみや傷——は、異なる角度から撮影したときに予測可能な形で位置がずれる。視差(パララックス)だ。表面に乗っているゴミ粒子は異なる振る舞いをする。私たちはテクスチャ照合器に物理学者の仕事を求めていたのだ。

それが転換点となった。私たちはニューラルネットワークをより賢くしようとするのをやめ、物理法則に従わせることにした。

思わぬ方向へ転がったデモ

半導体での方針転換から3か月後、私はある物流会社への提案のために会議室にいた。相手側のテーブルには15人が並んでいた。私は物理制約付きトラッカーが模擬倉庫内で荷物を追尾し、遮蔽されても見失わずに位置を予測し、誤検知を棄却する様子を実演するライブデモを用意していた。

デモは完璧な滑り出しを見せた。だがそのとき、誰かの電話が鳴り、画面からの反射光が最悪の角度でカメラに差し込んだ。トラッカーが揺らいだ。バウンディングボックスが天井の照明器具へと飛び、物理層がそれを補正するまでの苦悶の3秒間、そこに留まり続けた。

何カ月も「そんな失敗はしない」と主張し続けてきたまさにその形で、自らのソフトウェアが破綻するのを私は立ち尽くして見つめていた。部屋は静まり返った。穴があったら入りたい気分だった。

物理層は復帰した。それこそが要点だった。しかしその3秒間に、私はどのベンチマークも教えてくれなかったことを悟った。本番環境において、信頼とは平均精度ではない。最悪のフレームにおいて何が起こるかなのだ。

私は半分は部屋に向かって、半分は自分自身に言い聞かせるように声に出した。「汎用システムなら今もあの天井の照明を追尾し続けているはずです。私たちのシステムは補正しました。この復帰能力こそ製品そのものなのです」と。テーブルの向こうのCTOはゆっくりと頷いた。彼らは2週間後に契約を結んだ。だが私はその夜帰宅し、システムが不確実性をリアルタイムで表示できるように信頼度表示のロジックを書き直した——数式が魔法であるかのように装ってクライアントの前に立つなど、二度と御免だったからだ。

なぜ精度90%のAIシステムが本番環境で失敗するのか?

私が今「90%問題」と呼んでいる罠があり、いくつもの企業が次々とそこに足を踏み入れるのを目にしてきた。大手クラウドプロバイダーから午後の一仕事で立ち上げられるような汎用コンピュータビジョンAPIは、迅速かつ安価に90%の精度に到達させてくれる。デモでは魔法のように見える。だが、ビジネス上の価値は残りの10%にこそ完全に存在するのだ。

その最後の10%にこそ、あのスキンヘッドが潜んでいる。自動運転車にとって壁のように見え、高速道路でファントムブレーキ(幽霊ブレーキ)を引き起こす影。無人店舗で顧客の手が商品を隠す瞬間。無害な2ナノメートルのゴミ粒子と瓜二つに見える極めて稀な半導体欠陥。

半導体製造において、欠陥検出精度をわずか1%向上させるだけで歩留まりが5〜10%向上し、年間で数百万ドルの節約につながる可能性がある。自動運転車においては、テスラのオーナーたちが、ビジョンシステムが影や高架橋を障害物と誤認して引き起こすファントムブレーキ事象を広く報告している。これらは理論上のリスクではない。基盤となるAIが物理的直感を持たないために、あらゆる業界で今まさに起きている本番環境での障害なのだ。私たちの取り組みは、汎用APIには欠けている物理層を追加することで、90%から99.99%へのギャップを埋める。

私たちはどのようにしてシステムに物理学者のように考えるよう教え込んだのか

標準的なCNNが検出を処理する方法と、カルマンフィルタ検証ゲートを備えた物理制約付きシステムを対比して示した比較図。

核心となるアイデアは驚くほどシンプルだ。ニューラルネットワークの出力を事実としてではなく、物理法則に照らして検証すべきノイズ混じりの測定値として扱うことだ。技術的アーキテクチャの全貌については私たちの研究のインタラクティブ版で解説したが、数式以上に直感が重要である。

サッカーボールを追跡している場面を想像してみてほしい。カメラはボールが中盤にあり、東へ秒速20メートルで移動していると伝えている。その40分の1秒後、カメラは「ボール」が15メートル離れたサイドライン上にあり、歩行速度で動いていると伝えてきた。カルマンフィルタ——物体がどこにあり、どれほどの速度で動いており、その両方についてどれほど確からしいかという継続的な推定を保持する数学的フレームワーク——なら、その2回目の測定値を瞬時に棄却するだろう。そこに暗示される加速度は、サッカーボールにとって物理的に不可能だからだ。システムは「マハラノビス距離」と呼ばれるもの——要するに、新しい測定値が予測値から標準偏差何個分乖離しているか——を計算する。それが3シグマを超える場合、ニューラルネットワークがそれらのピクセルに対してどれほど確信を持っていようとも、その検出結果は破棄される。

これこそが、私が物理制約付きビジョンと呼ぶものの意味である。ニューラルネットワークが提案し、物理法則が裁定を下す。

私たちはすべての検出に対して複数のゲートを階層的に配置している。運動学ゲートは、ネットワークが主張する場所に物体が物理的に存在し得るかを検証する。オプティカルフローゲートは、バウンディングボックス内のピクセルの動きが実際の移動物体に期待されるものと一致しているかを検証する——静止している副審はほぼゼロのフローを生成するのに対し、飛行中のボールは特徴的なパターンを生成する。幾何学ゲートは、カメラから主張された距離における3Dの遠近感と物体の見かけの大きさが整合しているかを検証する。

いずれかのゲートを通過できなかった検出結果はすべて棄却される。例外もオーバーライドも一切認められない。

対象物が姿を消したとき、何が起こるのか?

汎用システムはパニックに陥る。信頼度スコアはゼロに急落する。トラッカーは対象を「ロスト(喪失)」と宣言し、フリーズするかリセットされる。物理的な世界において、これはナンセンスだ。秒速20メートルで動いているボールは、カメラの前を選手が横切ったからといって消滅するわけではない。抗力によってわずかに減速しながら動き続け、物理法則が驚くほどの精度で予測できる軌道を描く。

私たちのシステムは遮蔽中も対象をメモリ内に保持し、遮蔽前の軌道に基づいてその位置を前方予測する。対象が再び姿を現したとき、システムはすでに正しい場所を見据えている。私はこれを、AIに「対象の永続性」を与えることだと捉えている。私の2歳の甥は生後8か月頃にこのことを理解した。しかし本番環境のビジョンシステムの大半は、今なお理解できていない。

「もっと大きなモデルを使えばいい」

物理情報ニューラルネットワーク(PINN)を説明する図——標準的な学習と対比して、物理方程式がニューラルネットワークの学習をどのように制約するかを示している。

この言葉は絶えず私に投げかけられる。2023年のあるピッチで、ある投資家が椅子の背にもたれかかり、私たちの技術的課題をすべて解決したかのような顔でまさにこう言った。「基盤モデルをファインチューニングすれば済む話ではないのですか? なぜそんな物理云々をわざわざ構築するのですか?」と。

私は一呼吸置いた。「なぜなら、訓練のデータ分布がシフトしても物理法則は変わらないからです」

PINNは単にデータから学習するのではない。現実に制約されたデータから学習するのだ。その差は、解答を丸暗記することと、その科目を理解することの差に等しい。

物理情報ニューラルネットワーク——PINN——は、現代の機械学習における最もエレガントなアイデアのひとつである。標準的なニューラルネットワークは、自身の予測とラベル付き訓練データとの間の誤差を最小化する。PINNはそこに第2のペナルティを加える。予測が物理方程式に違反するたびに、ネットワークにもペナルティが科されるのだ。もし外力もないのにボールが空中で急旋回するような軌道を予測した場合、支配微分方程式に違反し、損失(ロス)が急上昇して、ネットワークはそうした予測をしないように学習する。

実用上の効果は劇的だ。PINNは訓練開始前に物理法則によって解空間の大部分が排除されるため、はるかに少ない訓練データしか必要としない。単に事例を記憶しただけでなくルールを内面化しているため、未曾有の条件下でも汎化する。スポーツ追跡における私たちの取り組みでは、初動の軌道からナックルボールの変化や曲がるフリーキックの軌道を予測できることを意味する——カメラはアクションを追いかけるのではなく、その先回りをしてパン(旋回)するのだ。PINNおよびハミルトニアンニューラルネットワークの完全な技術的詳細については、私たちの研究論文でさらに深く掘り下げている。

誰も正直に向き合おうとしない「自社開発か購入か」の問い

私が話をする企業のリーダーは皆、同じ選択に直面している。市販のビジョンAPIを購入するか、カスタムのものを自社構築するかだ。滅多になされない、この対話の正直なバージョンは次のようなものだ。

購入すれば迅速に本番導入できる。APIは初日から機能する。標準的なケースは問題なく処理できる。スプレッドシート上の総所有コスト(TCO)は低く見える。

やがてエッジケースが押し寄せる。誤検知が積み重なる。AIの成果をレビューするために人間を雇うことになり、本末転倒となる。ベンダーのモデルは自社固有の物理特性に合わせてファインチューニングできないことに気づく。自社のデータが社外へ流出していることを知る。そして、知的財産は一切蓄積されていない。

物理制約付きシステムの自社構築は初期費用が高くつく。本格的なエンジニアリングが必要だ。しかし、データ単体では取り除けないノイズを物理法則がフィルタリングするため、誤検知率は桁違いに低下する。システムは自社のインフラ上で自社のデータを用いて稼働し、自社が所有するモデルを生み出す。エラーが高くつくあらゆる用途において、長期的な総所有コストは自社構築に有利となる——そして私の経験上、自動化する価値のある用途はすべてこれに該当する。

すべての企業がゼロから構築すべきだと言っているのではない。もし貴社のAIがボールとスキンヘッドの区別もつかないのであれば、サブスクリプション料金など発生するコストの中で最も些細なものにすぎない、と言っているのだ。

「コンテキスト」こそが新たな精度である

昨年、あるカンファレンスの後方席に座り、AIに「常識」が必要かどうかを議論するパネルディスカッションを聞いていた。4人の研究者が45分間議論したが、結論は出なかった。私はずっと考えていた。私たちに必要なのは常識ではない。物理法則だ。常識は曖昧だ。物理法則はコードに落とし込める一連の方程式なのだ。

AI業界はこの10年間、ベンチマークデータセットにおける精度の最適化に費やしてきた。何十億ものパラメータを持つモデルが、何千もの物体カテゴリを超人的な精度で識別できる——訓練画像に似たテスト画像上では。次の10年はコンテキストの時代だ。より大きなモデルではなく、より賢い制約。より多くのパラメータではなく、より多くの物理法則だ。

貴社のAIはボールと頭の違いを理解しているだろうか? ピクセルだけに頼っているなら、その答えは「時々」だ。物理法則に頼っているなら、答えは「常に」である。

私はあのスコットランドのサッカーの試合のことを、おそらく人一倍考えている。サイドラインでただ立っていたスキンヘッドの男性が、期せずして一世代全体のAIシステムが抱える根本的な脆弱性を暴いてしまったのだ。ゴールを見逃したファンは苛立った。私は感謝した。あの副審は、私が読んできたどの論文よりも多くのことを、本物のAIを構築することについて教えてくれたのだ。

コンピュータビジョンの未来は、より多くを見る(検出する)ことにあるのではない。見えているものを理解することにあるのだ。

関連リサーチ

他のプラットフォームでも公開

確かな信頼のもとに、AIを構築する。

次世代のエンタープライズAI構築において豊富な経験を持つチームと、ぜひご一緒ください。信頼できるAI戦略の設計・構築・導入を、私たちがお手伝いします。

Veriprajna ディープテック・コンサルティング は、ヘルスケア・金融・規制対応分野における安全性重視のAIシステム構築を専門としています。当社のアーキテクチャは確立されたプロトコルに照らして検証され、包括的なコンプライアンス文書を備えています。