多くのAIシステムは本番環境でブラインド状態で稼働しています。稼働状況ダッシュボードが証明するのはサービスが 稼働していることであり、その判断が 正確であることではありません。私たちのアプローチは、不足しているレイヤーを構築することです——本番環境におけるモデル品質、判断の出所、規制コンプライアンスを追跡し、数か月後であっても任意のAI判断を再構成できる耐改ざん性の監査証跡へと接続された監視インフラを提供します。
ほとんどのAIシステムは本番環境でブラインド状態で稼働している
直視すべき厳しい現実があります: MLモデルの91%は時間とともに劣化します。6か月間更新されなかったモデルでは、新しいデータに対するエラー率が35%跳ね上がります。2025年だけでも世界中で362件のAIインシデントが記録され(前年の233件から増加)、2026年初頭には月間インシデント数が435件に達しました。昨年、AIを利用している組織の51%がAIの不正確さに起因する悪影響を経験しました。これらは例外的な事例ではありません——真に機能する監視インフラを持たずにモデルをリリースしたときに生じる必然的な結果です。
一般的な企業の対応は、レイテンシのパーセンタイルとエラー率を表示するGrafanaダッシュボードを設置することです。それはシステムが稼働していることを伝えているにすぎず、システムが正確であるかどうかは分かりません。私たちはそれを可能にするレイヤーを設計します。すなわち、本番環境におけるモデル品質、判断の出所、規制コンプライアンスを追跡し、発生から数か月後であってもあらゆるAI判断を再構成できる監査証跡システムに接続された監視インフラです。
従来の可観測性ツールがAI特有の障害を見逃す理由
従来のAPMツール(Datadog、New Relic、Splunkなど)は、CPU、メモリ、レイテンシ、エラー率といったインフラストラクチャを監視します。しかしAIシステムは、インフラ指標では検知できない形で障害を起こします。より高リスクな借り手を承認し始めた融資モデルは、完璧な稼働率と100ミリ秒未満のレイテンシを示しながら、水面下で規制違反リスクを蓄積させていきます。偽陰性(見逃し)に傾いてドリフトしたコンテンツモデレーションモデルは、スループットの数値を維持したまま、有害なコンテンツを通過させてしまいます。
AIシステムにおいて重要な障害は、運用面ではなく統計的な問題です:
- 入力特徴量の分布シフト。
- 予測信頼度のキャリブレーションの劣化。
- 保護対象グループ間における公平性指標の乖離。
これらには専用の検知メカニズムが必要です: Kolmogorov-Smirnov検定 による分布シフトの検知、 Population Stability Index による入力特徴量の追跡、キャリブレーションエラー監視、および公平性指標SLO( 重大な意思決定におけるアルゴリズムの完全性に関する当社の研究で詳述)を、従来の可用性SLOと並行して導入する必要があります。私たちのアプローチでは、これらを第一級の本番シグナルとして実装します。公平性指標がSLOに違反した場合、そのアラートはP99レイテンシ違反と同等の重要度として扱われます。入力ドリフトが検知された場合、システムは単にダッシュボードの数値が上昇するだけでなく、特定のデータソースや特徴量パイプラインまで原因を遡って追跡します。
AI監視ベンダーを取り巻く状況は不安定——それに備えた計画を
AI監視に特化した7社のベンダーのうち3社が12か月の間に姿を消し、生き残った企業も大幅な事業転換(ピボット)を進めています。オープンソースライブラリは残っているものの、商用サポートや開発ロードマップは失われています。
| ベンダー | 経緯・状況 |
|---|---|
| WhyLabs | Appleにより買収され、商用事業を停止。 |
| NannyML | Sodaに統合。 |
| Aporia | Coralogixにより買収。 |
| Fiddler AI | 2026年1月に3,000万ドルを調達し、エージェント型システム向け「AIコントロールプレーン」へと再定義。 |
| Arthur AI | 評価エンジンをオープンソース化し、エンタープライズAIエージェントを棚卸しする「Agent Discovery」を発表。 |
| Arize AI | 同社のPhoenixプラットフォームがOpenTelemetry完全準拠となり、エバリュエーターのバージョニングに対応。 |
| Evidently AI | 従来非公開だった機能をオープンソースへ移行。 |
導入企業にとってこれが意味するのは、単一ベンダーに依存することは移行リスクを孕むということです。私たちのアプローチは、オープンプラットフォーム(トレース用のOpenTelemetry、メトリクス用のPrometheus、オープンソース評価ライブラリ)に基づいて監視アーキテクチャを構築し、ベンダー固有の機能は真の付加価値をもたらす部分にのみ階層化して適用することです。ベンダーが買収されたり方針を転換したりしても、基盤が揺らぐことはありません。
規制当局の精査に耐えうる監査証跡
AI判断における監査証跡とは、単なるログファイルではありません。それはフォレンジックな再構成システムです。監査人、規制当局、あるいは訴訟担当者が「なぜこのシステムがこの日時にこの判断を下したのか」と問うたとき、その回答には以下が含まれていなければなりません:
- どのモデルバージョンが稼働していたか、
- どのような入力特徴量が使用されたか、
- どのような前処理が適用されたか、
- 信頼度スコアはいくつであったか、そして
- その時点でどのガバナンスポリシーが有効であったか。
当社では、これらを暗号学的検証を備えた追記専用ストレージ上に設計します。2025年7月にAmazon QLDBが廃止されて以降、私たちのアプローチでは immudb (台帳レベルの耐改ざん性を必要とするチーム向け)や、 カスタムMerkleツリー検証レイヤーを備えたPostgreSQL (専用データベースなしで監査の完全性を確保したいチーム向け)を推奨しています。すべてのレコードはコンテンツアドレス指定され、ハッシュチェーン化されているため、いずれかのエントリに対する改ざんはそれ以降のチェーン全体を無効化します。
マルチモデルパイプラインやエージェント型AIシステムでは、課題はさらに複雑化します。あるモデルの出力が別のモデルに入力される場合や、エージェントが外部APIをまたいでツール呼び出しを連鎖させる場合、監査証跡はオーケストレーショングラフ全体を捉える必要があります(この課題については、 MLライフサイクル全体におけるAIサプライチェーンの完全性確保に関する当社の研究で検証しています)。当社では各ステップをOpenTelemetryトレースのスパンとして実装し、モデル推論からツール呼び出し、最終出力までを単一の再構成可能なシーケンスとしてリンクします。ここに63%の組織がつまずく要因があります。Deloitteの調査によると、その割合の組織がAIエージェントに対する利用目的制限を徹底できておらず、その主な原因はエージェントが実際に何を行っているかに対する可観測性(オブザーバビリティ)が欠如していることにあります。
EU AI法第12条は今や法律問題ではなく、技術的課題である
高リスクAIシステムを対象とするEU AI法のロギング要件は、 2026年8月2日に完全施行されます。第12条は、システム自体に組み込まれた自動ロギング機能を義務付けています。ログは、リスク特定、市場投入後のモニタリング、および運用の追跡のためのイベントを記録しなければなりません。配備者(Deployer)は、エントリごとに最低6か月間ログを保持する必要があります。不遵守に対する制裁金は最大で 1,500万ユーロまたは全世界の年間売上高の3%に達します。
現実的な課題は、調和された技術標準規格がまだ存在しないことです:
- CEN/CENELECは2025年8月の期限に間に合いませんでした。最初の標準規格(ロギングに関する prEN 18229-1 を含む)の策定は、早くても2026年第4四半期と見込まれています。
- 世界中でISO 42001認証を保持している組織はわずか約30社にとどまります。
- EU加盟27カ国のうち、自国の管轄当局を指定している国すら8カ国にすぎません。
この標準規格の空白期間こそが、実際には最も危険な時期です。組織は、「準拠」を定義する規格が最終決定される前に、今すぐコンプライアンスに適合したロギングを構築しなければなりません。私たちのアプローチは、第12条の条文を技術的統制へと直接マッピングします。どのようなイベントを捕捉すべきか、どの保持アーキテクチャを採用すべきか、推論ごとにどのようなメタデータを付与すべきか、そして将来規格が策定された際にも準拠し続けられるようにログをどう構造化するか——これは当社の 税務コンプライアンスAIの実働デモを支えるニューロシンボリック・エンジニアリングと同じ思想です。これを行わない場合の選択肢は、施行期限までに示されないかもしれない明確化を待ち続けることだけです。
プロジェクトで構築される成果物
すべてのプロジェクトは、お客様の既存の監視およびロギングに関するアーキテクチャ監査から始まります。ほとんどのチームはすでに断片的な仕組みを持っています。アプリケーションログ、何らかのドリフト検知、あるいは実験トラッカーなどです。通常の問題は、これらのピースが連携していないことです。モデルレジストリが特徴量ストアと連携しておらず、それが監査ログとも連携していません。判断を再構成するには、3つのシステム間で手作業でタイムスタンプを照合しなければなりません。当社のプロジェクトは、その結合組織(コネクティブ・ティシュー)を構築します。代表的な成果物は以下のとおりです:
- 根本原因追跡機能を備えたドリフト検知。 単に「特徴量Xがドリフトした」だけでなく、「3月3日にデータソースYがスキーマを変更し、パイプラインZに影響を与えたため、特徴量Xがドリフトした」というレベルまで突き止めます。当社は階層型アラートを実装します。情報レベルの変化はダッシュボードへ、警告は週次レビューへ、重大な違反はオンコール担当者へ直接通知されます。これが、本番運用チーム91組を対象とした2025年の調査でML実践者の不満第1位に挙げられたアラート疲れを解消する方法です。
- モデル品質SLO。 可用性とレイテンシのSLOは前提条件にすぎません。当社では、キャリブレーションエラー、公平性指標の安定性、説明の一貫性、予測信頼区間のためのSLOを定義し、実装します。品質SLOの違反は、インフラ障害と同じエスカレーションパスをトリガーします。
- 耐改ざん性監査ストレージ。 暗号学的ハッシュチェーンを備えた追記専用レコードストアであり、判断ごとの完全な推論コンテキストを保存します。これは 耐障害性システムにおけるソフトウェアの完全性に関する当社の研究に基づいています。判断ID、時間範囲、モデルバージョン、または結果クラスによるクエリが可能です。監査人の質問に数週間ではなく数分で回答できるように設計されています。
- エージェント型システムの計装。 マルチエージェント・アーキテクチャに対して、オーケストレーショングラフ全体をトレースします。エージェントの呼び出し、ツール呼び出し、中間推論、そして最終出力までを追跡します。各ステップは分散トレース内のスパンとして扱われ、相関IDによって紐付けられます。
- 規制コンプライアンス・マッピング。 お客様の監視および監査インフラを具体的な要件(第12条の義務、NIST AI RMFの統制項目[ガバナンス、マッピング、測定、管理]、SOC 2 Type II基準、および業界固有の要件)にマッピングする生きた文書(リビングドキュメント)です。このドキュメントこそが、監査人に提出すべき証跡となります。
この投資が適切である場合(およびそうでない場合)
AIシステムが規制、財務、または安全性に関わる判断を下し、それらの判断が正しく行われたことを証明する必要がある場合(金融サービス、医療、保険、行政など、規制当局に対して「モデルは問題なく動作していた」という弁明では通用しないあらゆるセクター)において、カスタムの監視および監査インフラが必要となります。
AIがレコメンデーションエンジンやコンテンツ推薦システムなど、出力の誤りが軽微なユーザー体験の問題にとどまるアプリケーションである場合、これは必要ありません。Arize Phoenixの無料プランとPrometheusインスタンスで監視ニーズが満たせるのであれば、それらを利用してください——私たちは初回の対話で率直にその旨をお伝えします。
コストに関して言えば、企業は 年間200万〜500万ドル をリアルタイムAI監視インフラに支出しています。EU AI法への準拠には、高リスクシステム1件あたり5万ユーロ超の初期費用に加え、継続的な監視のために年間1万〜2万5,000ユーロを要します。公式なAIガバナンスフレームワークを持つ組織は、AIプロジェクトの成功率が2.1倍に達し、規制リスクを73%低減させています。ROIの論点は監視そのものではなく、監視によって未然に防がれるインシデント、制裁金、プロジェクトの失敗にあります。ガバナンスフレームワークを持たない企業は、2025年にインシデント1件あたり平均440万ドルの損失を出しました。
主なポイント
- インフラの稼働状況はモデルの正確性を意味しません——MLモデルの91%は劣化し、AI特有の障害(分布シフト、キャリブレーションの低下、公平性の乖離)はDatadog、New Relic、Splunkには検知できません。
- 専用の検知機能(Kolmogorov-Smirnov検定、Population Stability Index、キャリブレーションおよび公平性SLO)は、公平性の違反をP99レイテンシ違反と同等の重要度として扱います。
- 特化型ベンダー市場の統合が進み(WhyLabs、NannyML、Aporiaは消滅)、当社は次の企業買収にも耐えうるオープンスタンダード(OpenTelemetry、Prometheus)に基づいてアーキテクチャを構築します。
- immudbやPostgreSQLのMerkleツリーレイヤーによる耐改ざん性監査証跡(2025年7月のAmazon QLDB廃止後)により、数週間ではなく数分であらゆる判断を再構成できます。
- EU AI法第12条は技術標準規格が未策定のまま2026年8月2日に施行されます——条文に直接マッピングされた準拠ロギングを今すぐ構築することが、期限に間に合わない可能性のあるガイダンスを待つよりも確実なアプローチです。
継続的モニタリング&監査証跡
AIサプライチェーンセキュリティとモデル完全性 | Veriprajna
AIサプライチェーンセキュリティのコンサルティング。規制業界企業のCISO向けに、モデル審査パイプライン、ML-BOMアーキテクチャ、シャドーAIガバナンスを構築します。NIST AI 100-2およびEU AI法に準拠。
材料回収と黒色プラスチック選別のためのAI | Veriprajna
カーボンブラック顔料は近赤外光を吸収します。光学選別機が見逃したすべての黒色PPトレイ、PE容器、ABS筐体は残渣となり、最終的に埋立処分されます。私たちは、それを回収するMWIRセンシングとエッジAIのレイヤーを構築します。
住宅AIコンプライアンス:入居者審査の公平性とアルゴリズム価格設定 | Veriprajna
不動産管理会社は、2つの方面で同時に法的リスクに直面しています。すなわち、公正住宅法(Fair Housing Act)の下で差別を生む入居者審査と、シャーマン法(Sherman Act)の下で価格を協調させる収益管理です。当社は両方を監査し、コンプライアンスに準拠したアーキテクチャを設計し、重要なすべての法域に照らしてお客様のシステムをマッピングします。
Smart Meter AI: AMI予知保全 & ファームウェア検証 | Veriprajna
1回の不良ファームウェア配信が、テキサス州プレイノに765,000ドルの損失をもたらし、73,000台のメーターをオフラインに陥れました。メンフィスは修理に900万ドルを投じています。あなたのAMIヘッドエンドは、どのメーターが通信を停止したかを追跡します。
ソフトウェアアップデート展開の完全性 & ITレジリエンス | Veriprajna
2024年7月19日、たった1つの設定ファイルが90分足らずで850万台のWindowsマシンをクラッシュさせました。マルウェアではありません。
税務コンプライアンスAI検証 | Veriprajna
Thomson Reutersの「Ready to Review」は1040フォームを自動作成。CCH Axcess Expert AIは10,000の会計事務所でアドバイザリー知見をドラフト。Blue Jは税務リサーチの質問に、不同意率700分の1未満で回答します。
よくあるご質問
エンタープライズ向けAI監視および監査証跡インフラのコストはどのくらいですか?
企業は通常、リアルタイムAI監視インフラに年間200万〜500万ドルを支出しています。特にEU AI法コンプライアンスに関しては、高リスクシステム1件あたり5万ユーロ以上の初期コンプライアンス費用に加え、継続的な監視のために年間1万〜2万5,000ユーロを要します。この投資はリスク削減によって正当化されます。AIガバナンスフレームワークを持たない企業は2025年のインシデント1件あたり平均440万ドルを失ったのに対し、正式なガバナンスフレームワークを持つ組織はプロジェクト成功率が2.1倍に達し、規制リスクを73%低減させています。
技術標準規格がまだ存在しない中で、EU AI法第12条のロギングをどのように実装すべきですか?
第12条は、リスク特定、市場投入後のモニタリング、運用追跡のためのイベントを記録する自動ロギング機能をAIシステム自体に組み込むことを求めています。配備者はエントリごとに最低6か月間ログを保持しなければなりません。課題は、CEN/CENELECが調和標準規格の2025年8月の期限に間に合わなかったことであり、最初のロギング標準規格(prEN 18229-1)は早くても2026年第4四半期と予想されています。私たちは第12条の条文を技術的統制へと直接マッピングします。イベント捕捉仕様、保持アーキテクチャ、推論ごとのメタデータスキーマ、そして規格が公開された際にも準拠し続けられるログ構造を設計します。これは、2026年8月の施行日までに届かないかもしれないガイダンスを待つのではなく、合理的に説明可能なアーキテクチャの選択に基づいて今すぐ構築することを意味します。
オンコールチームに誤検知の嵐をもたらさないドリフト検知をセットアップするにはどうすればよいですか?
アラート疲れは、本番ML監視における最大の不満です。根本的な原因は通常、すべての入力特徴量を均等に、過敏な統計的閾値で監視していることにあります。トラフィックの多いシステムでは、統計的に有意であってもビジネス上の影響が皆無である微小な分布シフトが頻繁に発生します。当社では階層型アラートを実装します。モデルの重要度に基づいて上位の特徴量のみを監視し、情報レベルの変化(ダッシュボードのみ)、警告(週次レビュー)、重大な違反(オンコール呼び出し)を明確に分離します。急激なシフトには変化点検知を、緩やかなドリフトには累積和(CUSUM)手法を用い、お客様の実際の決定境界に合わせて調整します。トラフィックの5〜10%の統計的サンプリングにより、すべての推論を処理することなく95%の信頼度を確保します。目指すのは、実際に品質劣化を示す、アラート数の削減と高シグナル化です。
WhyLabs、NannyML、Aporiaに何が起きたのか、そして何へ移行すべきですか?
AI監視の特化型ベンダー3社が12か月の間に姿を消しました。WhyLabsはAppleに買収されて商用事業を終了しました(オープンソースのwhylogsとlangkitは残っていますがサポートはありません)。NannyMLは2025年6月にSodaに買収され、ラベルなし性能推定技術がデータ品質プラットフォームに統合されました。Aporiaは2024年12月にCoralogixに買収され、ML監視が一般的な可観測性ツールへと統合されました。移行先候補としては、Arize Phoenix(OpenTelemetryネイティブ、強力なオープンソース)が最も有力な汎用代替となります。Evidently AIは良好なCI/CD連携を備えた評価およびドリフト検知をカバーします。Arthur AIのオープンソースエンジンはリアルタイム評価を担います。次の買収によって再度の移行を強いられないよう、オープンスタンダードをベースにベンダー固有のレイヤーを重ねる構成を推奨します。
AI監視インフラは自社構築(ビルド)すべきか、購入(バイ)すべきか?
2026年における現実的な答えは「融合(ブレンド)」です。ガバナンスダッシュボード、アラート、基本的なドリフト検知などのプラットフォーム機能は購入(導入)します。そしてラストワンマイルを自社構築します。具体的には、ドメイン固有の評価データセット、カスタム公平性検知器、そしてモデルレジストリ、特徴量ストア、監査ログを接続する統合レイヤーです。オープンソースツール(Evidently、Arize Phoenix、OpenTelemetry、Prometheus)はベンダーロックインを回避できますが、専任のエンジニアリングスタッフが必要です。マネージドプラットフォームは数日で稼働できますが、ベンダー統合の波を考慮すると移行リスクが伴います。当社は各レイヤーに最適なツールを配置し、それらの間にオープンなインターフェースを設けることで、単一ベンダーの破綻によってシステム全体が崩壊しないアーキテクチャ設計を支援します。
エージェントが複数のツール呼び出しを連鎖させるエージェント型AIシステムをどのように監視すべきですか?
標準的なML監視は単一モデルの推論を追跡します。エージェント型システムは、単一のユーザーリクエストに対して複数のLLM呼び出し、外部APIクエリ、データベース検索、サブエージェントへの委任を連鎖させるため、監視がより困難です。組織の63%がAIエージェントに対する利用目的制限を実施できず、60%が異常な動作をするエージェントを停止できないでいますが、その主な原因はエージェントが実際に何を行っているかの可視性が欠如していることにあります。当社は各ステップをOpenTelemetry分散トレースのスパンとして実装し、相関IDを介してエージェント呼び出し、ツール呼び出し、中間推論、最終出力を紐付けます。これにより、エージェントのすべての実行について再構成可能なシーケンスが得られ、各遷移ポイントに監視フックを設置してポリシーの適用、コストの追跡、品質チェックを行うことができます。
6か月前の特定のAI判断を再構成できる監査証跡をどのように構築すべきですか?
判断の再構成には、判断時点における完全な推論コンテキストを捕捉することが不可欠です。モデルバージョンのハッシュ、入力特徴量ベクトル、前処理パイプラインの状態、信頼度スコア、説明アーティファクト、そして有効だったガバナンスポリシーが含まれます。当社ではこれを暗号学的ハッシュチェーンを備えた追記専用システムに保存し、すべてのレコードの耐改ざん性を確保します。2025年7月のAmazon QLDB廃止後、台帳レベルの暗号学的証明が必要なチームにはimmudbを、専用データベースなしで監査の完全性を求めるチームにはカスタムMerkleツリー検証を備えたPostgreSQLを採用しています。すべてのエントリはコンテンツアドレス指定され、判断ID、時間範囲、モデルバージョン、結果クラスでクエリ可能です。このシステムは、数週間のログ発掘作業ではなく、数分で監査人の質問に回答できるように設計されています。
レイテンシや稼働率以外に、どのようなモデル品質SLOを定義すべきですか?
レイテンシと可用性は、システムが動作していることを示すにすぎず、システムが正しい判断を下しているかは示しません。当社では、さらに4つの側面に関するSLOを定義・実装します。キャリブレーションエラー(80%の信頼度が実際に80%の確率で正解しているか?)、公平性指標の安定性(保護対象グループの結果が乖離していないか?)、説明の一貫性(類似した入力が類似した説明を生成しているか?)、そして予測信頼区間(モデルの不確実性が増大していないか?)です。各SLOには、恣意的な統計的カットオフではなく、お客様のビジネスコンテキストに合わせて調整された閾値が設定されます。品質SLOの違反は、インフラ障害と同じエスカレーションパスをトリガーします。これにより、完璧な稼働率を示しながら水面下で高リスクな借り手を承認してしまう融資モデルを捕捉できるようになります。
SOC 2 Type II監査では、AI判断のロギングにおいて何が審査されますか?
SOC 2 Type II監査人は、単なる特定時点の設定だけでなく、一定期間を通じた統制の運用状況を評価します。AIシステムについては、モデルの変更が記録され承認されているか(変更管理)、監視によってモデルの異常動作が検知・アラートされているか(インシデント検知)、トレーニングデータやモデルアーティファクトへのアクセスが制御・記録されているか(アクセス制御)、そしてモデル障害への対応プロセスが文書化されているか(インシデント対応)を審査します。監査証跡は、これらの統制が対象期間全体にわたって効果的に機能していたことを実証しなければなりません。当社はこれらの統制ポイントを自動的に捕捉し、耐改ざん性システムに保存し、監査人が要求する証拠レポートを生成するロギングインフラを構築します。これにより、監査準備を四半期ごとの慌ただしい突貫作業から、日々の運用の副産物へと変革します。
確かな信頼のもとに、AIを構築する。
次世代のエンタープライズAI構築において豊富な経験を持つチームと、ぜひご一緒ください。信頼できるAI戦略の設計・構築・導入を、私たちがお手伝いします。
Veriprajna ディープテック・コンサルティング は、ヘルスケア・金融・規制対応分野における安全性重視のAIシステム構築を専門としています。当社のアーキテクチャは確立されたプロトコルに照らして検証され、包括的なコンプライアンス文書を備えています。