Inspection Trust Gateの創業者構築ノート:ドリフト検出、決定論的ゲート、ビジョンモデルとPLCのあいだのEU AI Act対応監査系譜。
ManufacturingMachine LearningComputer Vision

モデルを直し続けた。問題は光だった。

Ashutosh SinghalAshutosh Singhal2026年6月24日15 min

この構築のためにホワイトボードに最初に書いた数字は97パーセントだった。二番目は14だった。

それらは同じモデルを表している。私たちの研究のスタンピング事例では、ラボで97%の精度で検証されたビジョンモデルが、毎分40ストロークで動く200トンの順送プレスに載ると、良品の14%を誤不良判定し始める。モデルの中身は何も変わっていない。変わったのは入力だ:ストローク角度とともに変わる天井ベイ照明のグレア、冷えた金型と温まった金型では異なる潤滑油のたまり方、プレスが熱平衡に達する前に作られるシフト冒頭の50個の部品。ラインの物理が、画像をモデルが検証された分布の外へ歩み出させ、いかなる精度のモデルであれ、そこでは信頼できない。

私はこのプロジェクトの最後の期間を、その一文を本気で受け止めるデモの構築に費やした。それはInspection Trust Gateと呼ばれ、部品ごとに判断する様子を次で見ることができる:veriprajna.com/ja/demos/edge-ai-manufacturing-inspection。より良い欠陥モデルではない。ビジョンモデルとPLCの不良排出アクチュエータのあいだにあるランタイム層であり、その唯一の仕事は、部品一つひとつについて、モデルの判定が作動しても安全か

以下は、検査AIについての私の考え方を変えた三つの瞬間を通じた構築の物語だ:スクリプト化された06:00のドリフト事象、信じようとしなかったベンチマーク数値、そして削除しかけたルール。

修正は、より良いモデルではない

私はその一文に、本来よりも長く抵抗した。検出器がおかしくなると、ビルダーとしての私の本能はすべて、再学習しろ、バックボーンをアップグレードしろ、ラベルをもっと買えと言う。研究は協力を拒み続けた。箱出しのAOIシステムは良品の5〜15%を誤不良判定し、よくチューニングされたものは2%未満に抑える——私たちのソリューションページはそれを「モデルアーキテクチャの問題ではなく、校正とデータの問題」と呼ぶ。同じ研究は、システム統合プロジェクトの84%が失敗または部分的に失敗し、典型的な検査デプロイでは統合作業がプロジェクト期間の60%を占め、モデル学習は15%だと報告している。何度も読み返した一文:「ハードウェアは発注書だ。」

そこで私は、やや異端に感じることをした:デモの欠陥モデルを意図的に凡庸なものにした。それは既知の良品テクスチャへのkNN距離であり、PatchCore-liteの代用品で、MVTec AD metal_nutのホールドアウトテスト分割(実物の製造部品の実写写真、公開ラベル)で良品と欠陥品を分離するAUROCは0.845だ。その数字を隠しも売り込みもしない。本番ではそのスロットに、あなたのNVIDIA Metropolisパイプライン、Cognexシステム、カスタムモデルが、固定インターフェースの背後に入る。製品はエンジンではなく、エンジンの周りの層だ。

その層は、いかなる精度指標も答えない問いから始まる:この画像は、モデルが検証された撮影条件の内側にあるか?デモのEnvelopeDetectorは、物理信号空間(露出、コントラスト、ダイナミックレンジ、フォーカス代理、高周波ディテール、熱色かぶり、飽和、グレア比率)でマハラノビス距離を計算し、220枚の既知良品学習画像のみにフィットする。部品が検証済みエンベロープの外に落ちると、ゲートはモデルがどれほど自信を持っていても、その出力への信頼を完全に止める。

完璧なモデルでさえ、検証済みエンベロープの内側の入力に対してのみ有効だ。

構築全体が掛かっているのは、その一文だ。ドリフトはモデルの失敗ではなく入力の失敗であり、入力の失敗は精度ダッシュボードには決して現れない。スクラップ箱に現れる。

06:00には何が起きるのか?

デモ全体で私が最も信頼する瞬間は、タイムスタンプだ。アプリは「Line 3 - metal_nut press」ステーション上で決定論的にスクリプト化されたシフトを再生し、本物のMVTec AD metal_nut写真をフルパイプラインに流す。途中でマーカーが画面を横切る:「SHIFT CHANGE 06:00 - cold dies, bay lights on.」するとグレア、デフォーカス、熱色かぶりで壊された良品が12個到着する。何であるかを正確に言いたい:写真は本物で、ドリフトはそれらに適用した正直な画像破壊であり、アプリもそのようにラベル付けしている。撮影できるスタンピングラインは持っていなかったし、そうでないふりをすれば論点全体が毒される。

次に起きることは、デモが存在する理由そのものだ。エンベロープモニターが赤になる。ゲートはドリフトした各部品を検証済みエンベロープの外と読み取り、モデルの判定がアクチュエータに触れることを拒否する。判定のあと判定がHOLDとして返り、人間向けのエスカレーションキューへ送られる一方、横のパネルはエンベロープチェックのない素朴なAOIが同じ画像で何をしたかを示す:REJECT。

ドリフトの瞬間:エンベロープ外違反リング付きのHOLD判定と、同じ良品を不良判定していたであろう素朴なAOI列
デモの06:00ビート:SHIFT CHANGEバナーが発火し、違反リングが部品を検証済みエンベロープ外と旗立てし、ゲート判定は証明待ちのHOLDを読み、素朴なAOI列はこの良品を不良判定していたと認める。

初めてキューが埋まるのを見たとき、保留部品をクリックして「異常を検出」といった曖昧な言い訳を見るつもりだった。代わりにエンベロープモニターは違反を信号ごとに分解した——埋め込みではなく物理測定から作ったからで、物理測定は自ら説明できる。あるドリフト部品では、輝度が検証フィットから7.6シグマ離れ、二乗マハラノビス距離の87.1%を担っている。モデルが「感じている」のではない。それは計器の読みだ。

分布外スコアを信号ごとに分解するエンベロープ違反エビデンスパネル
計器の読みとして説明された違反:この保留部品で、輝度が検証フィットから+7.6シグマ、二乗マハラノビス距離の87.1%を占める。

ドリフトフェーズの終わりまでにスコアボードは厳しい。素朴なベースラインは良品12個を自動スクラップした。Trust Gateが自動スクラップしたのはゼロで、すべてをレビューのために保留した。同じ画像、同じ代用欠陥モデル、欠陥スコアの同じしきい値。唯一の違いは、一方の経路が出力を信頼する前に入力を確認したことだ。

素朴なベースラインとゲートは同じ部品と同じモデルを見た。唯一の違いは、作動の許可だった。
比較パネル:素朴なベースラインは良品12個をスクラップ、Trust Gateの自動スクラップは0、シフトあたりのスクラップ予測付き
ペイオフパネル:素朴は良品12個スクラップ対ゲート0、このランで誤不良判定KPIが57.1%から0%へ落ち、シフトあたり約2.65万ドルの予測——予測とラベルされている。

そのドル数字について——デモがふつう嘘をつき始める場所だからだ:パネルは測定された素朴な誤不良判定率をフルシフトへ外挿する(毎分40ストローク×8時間=19,200部品)、スクラップ部品あたり$2.42。$2.42は出典のある桁感で、8.7%のスクラップ廃棄物削減が年9.4万ドルと38,800 kgの製品を節約した公開のクッキー製造事例に錨を下ろしている。顧客の数字ではなく、カウンターは出現するすべての場所で予測とラベルされている。私は誤不良判定を測定し、ドルを予測した。UIはどれがどれかを示している。

自分のドリフト物語を信じる前にもう一つ確認したこと:ドリフトフェーズ中に注入された欠陥部品は、依然として捕捉またはエスカレーションされ、決して自動合格しない。ホールドアウト分割全体でその数字は93件中93件だ。不良が混沌の中ですり抜けてしまうなら、良品を保留しても無価値だ。

私のエンベロープチェックは自作自演の採点ではなかったか?

私が最も不信したベンチマーク数値は、自分の最良の数字だった。ベンチスクリプトを初めて走らせたとき、エンベロープ検出器はドリフト画像とクリーン画像を本質的に完璧に分離した。即座の反応は誇りではなかった。疑念だった——試験の両側を自分が作っていたからだ:グレア、デフォーカス、熱色かぶりの破壊を書き、検出器が見る物理信号を選んだ。もちろんグレア検出器はグレアを捕まえる。歯のあるレビュアーはそれを循環的と呼ぶだろうし、その通りだ。

そこで私はあるドリフト族を完全に除外した。検出器は露出不足に対して一度もチューニングされず、開発中にも見たことがない。それから私はbench.py(直近は2026-07-17)をMVTec AD metal_nutホールドアウトテスト分割で再実行した:良品22、欠陥93、学習フィットは220枚の良品画像のみ。ホールドアウトの露出不足族で、エンベロープ検出器はAUROC 1.000を記録した。それがテーゼを運ぶ数字だ——私が設計しなかった失敗モードで稼いだからこそ正確に。スクリプトは測定数値が実際に主張を支える場合にのみ「THESIS HOLDS」と印刷する。測定からマーケティングがドリフトしないよう、そう書いた。

ベンチマークの残りは正確なスコープに値するので、自分に有利な丸めなしでここに示す。ドリフトした良品で、エンベロープなしの素朴なベースラインはドリフト族ごとに95.5〜100%を誤不良判定する(グレア100%、デフォーカス100%、熱色かぶり100%、露出不足95.5%、平均98.9%)。Trust Gateはその0.0%を誤不良判定し、すべてをレビューのために保留する。そして正直な但し書き:破壊はフル強度なので、ベースラインの崩壊はほぼ総崩れで設計上そうなる。私が擁護する主張は方向性だ——きれいに検証されたモデルは入力がエンベロープを出ると崩れるということ——特定のパーセンテージではない。これらは合成ドリフト下の研究ベンチマーク上の測定だ。オープンワールドの保証ではなく、本番性能として引用する者は誰であれ誤用している。私も例外ではない。

削除しかけたルール

この構築で私が下した最も難しい誠実さの決断は、ほとんど機能しないルールについてだった。当初、幾何ゾーンルールを追加した:粗い8×8グリッド上で異常を局在化し、機能ゾーン内の欠陥を化粧エッジの傷とは 別に扱う。本物の計測のように聞こえる。それから測定し、測定結果は謙虚にさせた。局所粗さプロキシはホールドアウト欠陥93件中33件で異常を局在化する——約35%。ゲートの結果を変えるのはまさに93件中1件だけだ。そして自動不良判定18件のうち、本物の局在化異常に裏付けられたものは0件。何も局在化しないとき、重心はグリッド中心にフォールバックし、デフォルトでゾーン内と読まれる。

私は三つの選択肢と向き合った。ルールを削除して試したことなどなかったふりをする。残してUIに、持っていない精密計測をほのめかせる。あるいは残して、インターフェースに告白させる。私は告白を選んだ。デモのヒーロー欠陥が自動不良判定するとき(部品test-flip-264、MVTecのflipクラスからの本物の大きな構造欠陥)、幾何ドリルインは、この部品では何も局在化されず、不良判定はテクスチャ信頼度のみに依ると率直に述べる。

異常が局在化されず、不良判定がテクスチャ信頼度のみに依ることを開示する幾何ドリルイン
削除しかけた開示:ドリルインは、この自動不良判定部品では何も局在化されなかったので、判定はテクスチャ信頼度のみに依ると認める。ルールは装う代わりに、公に棄権する。

ルールが稼ぎを出すのはまさに一度だけで、私はそれを演出するのではなくアプリに証明させた。起動時、デモはホールドアウト欠陥93件すべてを検索し、それ以外では自信のある部品で機能ゾーン外に本物に局在化した異常がある部品を探す。出荷済み分割では、その検索がtest-flip-251を見つけ、重心は行2・列6、ゲートはアクチュエータを発火させる代わりにHOLDへ送る。データが変わり該当部品がなければ、そのビートは単純に現れない。私はルールのシグマしきい値を5分割交差検証でA/Bテストさえした。フィット値は手設定の2.5を上回る改善を示さなかったので、2.5を保ち、否定結果をリポジトリに"shipped": falseとして記録した。本番の案件ではこのルールはピクセル精度のCAD根拠計測に置き換わる。デモでは誠実な代用品であり、UIはすべての部品でそう言っている。

自らを売りすぎる信頼層は、言葉の矛盾だ。

その一文はデザインルールになった。製品の約束全体がモデルをいつ信頼しないかを知ることなら、同時に自らの最弱コンポーネントについて虚勢を張ることはできない。

エージェントは助言し、コードが決める

私が委譲を拒む決断は、金属を動かすものだ。ゲート自体は平明な決定論的コードで、いかなるLLMの外にも、ビジョンモデルの外にもある。そのしきい値はデモ自身のデータからフィットされ、手振りではない:校正済み信頼度スケールで0.948未満は自動合格、1.30超は自動不良判定、そのあいだのすべてとエンベロープ外のすべてがHOLDへ行く。硬質な750 msストローク窓予算に対して走り、出荷済み監査ログでは判断は数十ミリ秒で着地する:test-good-288は37.7 msで自動合格、test-good-289は24.4 ms、test-flip-264の不良排出アクチュエータログは「REJECT actuated in 25ms (budget 750ms).」と読む。

作動するものについて率直であるべきだ:まだ何もない。Allen-Bradley ControlLogix不良排出アクチュエータへのEtherNet/IP経路はシミュレータで、まさに何をしたであろうかを正確にログし、MESシンクは書いたであろうトレーサビリティ行を書くスタブだ。どちらもアプリ内でスタブとラベルされている。OTの現実(SiemensとAllen-Bradleyの混在工場、ミリ秒単位の不良排出窓)が実際の製品表面だから本物のアダプタの形をしているが、ライブラインをほのめかすデモは、自らの信頼テストに落ちる。

システムにはエージェントがあり、私は意図的に境界を設けた。部品がエスカレーションキューに積み上がると、Drift Triageのペアが動く:診断エージェントは保留部品全体のランク付けされた物理信号偏差を読み、推奨アクション付きの根本原因仮説を提案し、批評エージェントがその仮説を数値エビデンスに照らし、引用された信号が実際に支配的偏差でなければ「手動調査」へ格下げする。Pydantic AI上に構築されプロバイダ差し替え可能で、APIキーが設定されていなければ全体が決定論的テンプレート・トリアージへ劣化し、デモは完全オフラインで動く。エージェントができないこと——設計上——はアクチュエータに触れることだ。彼らが話すころには、ゲートはすでに決えている。

エージェントは助言し、コードが決める。

それらの判断の一つひとつが領収書を残す。各部品はJSONL系譜レコードを書く:部品id、ステーション、モデルid metalnut-defect-knn version v7、データセットハッシュ ae95b5b533c8、欠陥信頼度、OODスコア、物理信号、どのゲートルールが発火したか、750 ms予算に対するレイテンシ、作動とMESのログ行、素朴なベースラインが何をしたか、リスクタグ high-risk:quality-gate(EU AI Act Annex III、発効2026-08-02)。ワンクリックでシフトをinspection_audit.jsonlとしてエクスポートする。

モデル版、データセットハッシュ、発火したルール、EU AI Actリスクタグを示す部品ごとの監査系譜レコード
ある部品の監査系譜:モデルid metalnut-defect-knn v7、データセットハッシュ ae95b5b533c8、発火したルール、750 ms予算に対するレイテンシ、すべての判断に付くEU AI Act Annex IIIリスクタグ。

ここでは規制の時計が重要だ。EU AI Actの高リスク義務は2026年8月2日に完全適用となり、安全上重要な品質判断はAnnex IIIに座り、最大罰金は最も深刻な禁止行為違反で€3,500万または世界売上の7%に達する。言葉には慎重でありたい——まさに慎重な言葉が重要な場所だからだ:デモはEU AI Act認証ではなく、いかなるデモもそうなれない。それが示すのはEU AI Act対応の系譜——高リスク適合性ファイルに提出可能なエビデンスとして設計された判断ごとの記録で、インシデント後に再構成するのではなくライン速度で生成される。

次のモデルアップグレードを生き残るものは何か?

デモ作り手にとって残酷な問いを、構築中ずっと自分に問い続けていた:顧客の次の欠陥モデルが私の代用品より劇的に良いなら、これのどれかがなお重要か?今ではそれは正反対だと思う。Deloitteは製造業におけるエージェンティックAI採用が2026年に6%から24%へ上がると予測しており(Deloitte)、それはより多くのモデルとより多くの自律が、より多くのアクチュエータに到着することを意味する。それらのモデルの一つひとつに検証済みエンベロープがあり、プレスラインの物理(グレア、冷えた金型、熱平衡)は入力をそこから歩み出させ続ける。完璧なモデルはそのことについて何も変えない——ゲートが防ぐ失敗は入力の失敗であり、それが果たす監査義務はモデリング上のものではなく法的なものだ。ドリフト・ゲーティング、来歴、統治された作動はあらゆるモデル精度で成り立つ。この層であり、別のモデルではないものが構築する価値があると私を説得した性質がそれだ。スクリプト化されたシフトveriprajna.com/ja/demos/edge-ai-manufacturing-inspectionは、その主張を部品ごとに稼ぐ様子をあなたに見せようとする私の試みだ。

読んで私に説明されるより見たいなら、端から端までの創業者カットがここにある。

だからライン上のいかなる検査モデル——97%のものも含め——について私が問うのは、「どれほど正確か?」ではない。カメラをいま横切った部品について、その画像がモデルが検証されたエンベロープの内側にあったかを知っているか?部品ごとに、ミリ秒単位で、監査人に手渡せる記録とともに答えられないなら、精度の問題があるとは思わない。エンベロープの問題があると思う。そして、あなたのラインがどちらを抱えているのか、本気で知りたい。

関連リサーチ

他のプラットフォームでも公開

確かな信頼のもとに、AIを構築する。

次世代のエンタープライズAI構築において豊富な経験を持つチームと、ぜひご一緒ください。信頼できるAI戦略の設計・構築・導入を、私たちがお手伝いします。

Veriprajna ディープテック・コンサルティング は、ヘルスケア・金融・規制対応分野における安全性重視のAIシステム構築を専門としています。当社のアーキテクチャは確立されたプロトコルに照らして検証され、包括的なコンプライアンス文書を備えています。