会議室のモニターに映る、すべてが緑色の AI ガバナンスダッシュボード。その横には、1 行が誤りとして印付けされた、印刷された AI の回答が置かれている。
Artificial IntelligenceFintechEnterprise Technology

緑色のダッシュボードは嘘をついていた——エンタープライズ AI 検証が本当に検証すべきもの

Ashutosh SinghalAshutosh Singhal2026年6月10日14 min

私はキャリアの大半を、会議室で「いや、そのモデルはまだ検証されていない」と言う役回りの人間として過ごしてきた。銀行業務では、この機能には無味乾燥な名前がついている——SR 11-7 に基づく独立したモデル検証だ。SR 11-7 とは、2011 年以来モデルリスクを規律してきた連邦準備制度理事会(FRB)と OCC のガイダンスである。その仕事は、字面どおりの華やかさしかない。誰も読まない「限界事項」の付録を読む。デモに出てこないケースでモデルがどう振る舞うかをベンダーに問いただす。そして時折、あなたは監査委員会の席に着き、目の前には隅々まで、安心させるように緑色のダッシュボードがある——すべての項目にチェックが入り、すべてのポリシーが対応づけられ、すべてのコンプライアンス状況が「問題なし」と表示されている——にもかかわらず、その緑色が、対象が実際に機能するかどうかについてはほとんど何も語っていないことを、沈み込むような気持ちで分かっているのだ。

そのギャップこそが本稿全体のテーマであり、私たちが次のものを築いた理由でもある——Veriprajna のエンタープライズ AI 検証プラクティス——それを、たった一つの流行らない考えを軸に据えてつくった。その考えとはこうだ——答えを検証しなければならない。プロセスではなく。 ガバナンスのダッシュボードが証明するのは、手順が守られたということだ。それは、あなたの AI がこの保険契約者、この融資、この法令について正しい答えを出したかどうかを証明するものではない。取締役会ではこの二つが絶えず混同され、そしてその混同は高くつく。

どれほど高くつくのか、お見せしよう。

Klarna は 40% を節約し——そして 9,900 万ドルを失った

2024 年、Klarna は自社の AI アシスタントが 700 人のカスタマーサービス担当者を置き換えたと世界に向けて発表した。このアシスタントは 35 言語にわたって、チャットのおよそ 3 分の 2 を処理していた。取引あたりのコストは 0.32 ドルから 0.19 ドルへと——約 40%——下がり、見出しは自ずと書き上がった。これこそが未来だった。より無駄がなく、より速く、より安い。

2025 年半ばまでに、彼らはソフトウェアエンジニアやマーケターを再配置して、コールセンターの人員に充てていた。CSAT(顧客満足度)スコアは 22% 低下していた。顧客は、難しい案件——請求への異議、争いのある返金、口座の解約——で、報道が「カフカ的なループ」と呼んだ状態に陥っていた。Klarna の 2025 年第 1 四半期は、前年の 4,700 万ドルから増加した 9,900 万ドルの純損失で締めくくられた。にもかかわらず、である——15% の増収があったのに、だ。CEO は、大規模に自動化したことが「サービス品質の低下を招いた」と認めた。

ここからが、私が腹落ちさせるのに時間のかかった部分であり、そしてそれは、多くの人が引き出した教訓とは正反対のものだ。Klarna の AI は機能した。 パスワードの再設定や注文状況の問い合わせでは、確かにコストを節約した。失敗は、AI が悪かったということではない。失敗は、金銭面と評判面の重みの大半を担う 20% のやり取り——異議申し立て、エッジケース、解約や苦情につながる事柄——を扱えるかどうかを、誰も検証しなかったことにある。毒性フィルターなら、それらの破綻した会話のどれも通過させてしまっただろう。その AI は、失敗している間も礼儀正しかった。

AI は不快なことを何も言わなかった。ただ、キャンセルされた航空便と、異議のある請求が絡む多通貨の返金を、うまく処理できなかっただけだ——そしてそれこそが、重要な 20% だった。

Klarna は例外ではない。それは、私が話をするあらゆる企業で静かに起きていることの、目に見える形にすぎない。エンタープライズ AI プロジェクトの 70% から 85% は、そもそも本番環境にまで到達しない——RAND、Gartner、BCG、McKinsey がいずれも独立に、近い数字にたどり着いている。MIT の NANDA による 2025 年の調査では、AI パイロットの 95% が、測定可能な損益への影響をもたらさなかったことが分かった。McKinsey は、2025 年に企業の 42% が自社の AI 施策の大半を断念したと報告している——前年の 17% からの増加だ。パイロットはデモでは美しく動く。しかし、デモが一度も見せなかったケースに触れた途端に息絶える。

私たちは最初に、間違ったものをつくった

私たちがプロセスではなく答えを検証するという考えにどうたどり着いたのか、正直に語りたい。というのも、私たちは賢さによってそこに至ったのではないからだ。私たちは、機能しないものを世に出し、それが顧客の目の前で失敗するのを見届けることで、そこにたどり着いたのだ。

私たちの AI 検証レイヤーの最初のバージョンは、振り返ってみれば、市場がすでに売っていたものとまったく同じだった。私たちは、まっとうなガードレールのフレームワーク——コンテンツモデレーション、PII(個人識別情報)検出、脱獄チェック——を組み上げ、そこにドリフトと公平性の監視を継ぎ足し、その全体を清潔なコンプライアンスのビューとして描き出した。入力はスキャンされる。出力は、毒性や漏洩した個人データがないかスキャンされる。緑色になるダッシュボード。私はそれを誇りに思っていた。それはガバナンスのように見えた。

私たちはそれを、規制対象の金融ワークフローにおけるパイロットに投入した。すると最初の数週間のうちに、AI は、自信に満ち、体裁が整い、毒性を一切含まず、PII の漏洩もない答えを出した——だが、それはあるドメインルールについて単純に間違っていた。私たちのシステムはそれを通過させた。私たちが組んだチェックはすべて緑色だった。誤りがあったのは、本質——答えの中身の部分だった。それは、私たちのガードレールのどれ一つとして見ていない場所であり、なぜなら、どのガードレールも、その答えが間違っていると分かるほどにはドメインを理解していなかったからだ。

その月に私は、自分たちが参入していたカテゴリーを信じるのをやめた。私はモデル検証の分野で何年も、銀行業務の文脈でこのことを知っていながら、それでもなお、自分がキャリアを通じて見つけ出してきたのと同じ誤りを犯すツールをつくってしまっていた。セキュリティは正しさではない。安全性は正しさではない。緑色のダッシュボードは正しさではない。

プロンプトインジェクションに対して安全な AI であっても、準備金を計算し損ねたり、廃止された法令を引用したり、公正融資規則に違反する融資を承認したりすることは、なおありうる。安全性と正しさは別々の問題であり、そして後者を検証している者は、ほとんど誰もいない。

あなたが耳にしたことのあるツールは、なぜそこで止まってしまうのか

5 つの AI ツールのカテゴリーが、それぞれ一つのことをカバーしており、その下には、答えが正しいかどうかにはどれも答えないことを示す、幅広い琥珀色のバーがある。

いまや、年平均成長率にしておよそ 45% で成長する、資金力のある本物の AI ツール市場が存在しており、私はそれを不当に扱いたくはない。これらの製品の大半は、自らの本来の仕事をよくこなしている。問題は、その本来の仕事が、多くの買い手が買っていると思っている仕事ではない、ということだ。

ガバナンスプラットフォーム——Credo AI、IBM の watsonx.governance、ModelOp——は、あなたの AI 施策を規制フレームワークに対応づけ、コンプライアンス状況を追跡する。Credo AI は、Fast Company の 2026 年リストの応用 AI 部門で、Google、Nvidia、Anthropic と並んで第 6 位にランクされた。これは真剣な仕事だ。しかし、ポリシー遵守は出力の正しさではない。緑色のポリシーダッシュボードが意味するのは、書類が整っているということであって、AI があなたの特定のユースケースに対して正しい答えを出すということではない。

監視ツール——Arthur、Galileo、Arize——は、モデルレベルの指標をリアルタイムで見張る。ドリフト、公平性、レイテンシ、トークン分布などだ。有用である。しかし、それらが監視するのは、モデルの全体としての挙動であって、特定の保険契約者の補償条件を踏まえたときに、ある特定の保険計算が正しいかどうかではない。セキュリティツールはもう一段深くまで踏み込む——Cisco は 2024 年 10 月に Robust Intelligence をおよそ 4 億ドルで買収し、それを Cisco AI Defense に組み込み、検知内容を OWASP と MITRE ATLAS に対応づけた。それは必要なことだ。だがそれもやはり、モデルが攻撃されうるかどうかについての話であって、モデルが正しいかどうかについての話ではない。

次に、ガードレールのフレームワークがある。NVIDIA の NeMo Guardrails のたぐいで、コンテンツモデレーション、PII、トピックのフィルタリングが得意だ——そして NVIDIA 自身が、それらはすべてを捕捉できるわけではないと慎重に断っている。なぜなら、その自己チェックの仕組みは、まさに自分が守っているモデルそのものに依存しているからだ。さらに Big Four(大手会計事務所 4 社)がいる。彼らは 50 万ドルから 500 万ドルの費用で、6 か月から 18 か月かけてガバナンス戦略を売り、最後に PowerPoint とベンダーの候補リストを手渡してくれる——フレームワークであって、火曜日にあなたの AI が間違っていると教えてくれる、動いているシステムではない。

これらのどれもが、有用性の尽きる境目を持っている。すべてを積み重ねれば、ポリシー、セキュリティ、ドリフト、そしてコンテンツの安全性はカバーできる。それでもなお、その導入が生きるか死ぬかを実際に決定づける問いには、答えられていない——すなわち、このケースについて、その答えは正しいのか?

69% の問題

これを私にとって具体的なものにした数字が欲しいなら、それはこれだ。法務デューデリジェンスのタスクにおいて、独立した検証は、AI のエラー率を 69% から 88% の間に位置づけている——ベンダーのベンチマークが示唆する値をはるかに上回る。この事実をじっくり受け止めてほしい。6.9% ではない。69 から 88 だ。

そして、これらはガードレールが捕捉するエラーではない。なぜなら、それらは不快でもなければ、安全上の問題があるわけでもないからだ。それらは、ドメインを知る者にだけ見える形で間違っている。2025 年の終わりまでに、法的な提出書類における AI のハルシネーション(幻覚)の記録された事例は 729 件を超えた——前年の 280 件からの増加だ。裁判所は人々に制裁金を科し始めた。あるケース、Doiban 対 OLCCでは、制裁は、捏造された 15 件の引用のそれぞれにつき 500 ドル、加えて、存在しない幻の判例を追い回した相手方弁護士の時間に対して 1,000 ドル、という計算になった。米国最大級の法律事務所の一つは、6 か月間に 3 件の別々のハルシネーション事案を記録した。

これらは、自分の仕事を二重にチェックする専門家たちであり、しかも、間違えれば結果が伴う分野での話だ——それでもなお、AI は、裁判所への提出書類に入り込むほど説得力をもって判例をでっち上げた。それが、この失敗の手触りだ。それは流暢で、もっともらしく、そして虚偽であり、まさに、汎用的な監視には評価するすべのないドメイン知識のなかに宿っている。

ベンダーが箱を開けようとしないとき、あなたは何を検証するのか

図:内部を見ることのできない、封印された LLM。その代わりに、既知の正しいケースに照らして出力レイヤーで検証され、更新のたびに再テストされる。

規制産業においては、これはもはや興味深いエンジニアリングの問題ではなくなり、法的な問題になる。モデルが引受、準備金の積み立て、あるいは資本に影響を及ぼす場合、米国の銀行業務における SR 11-7——そして欧州の保険会社に対する Solvency II の第 2 の柱(ピラー 2)——は、そのモデルが独立に検証され、文書化され、継続的に監視されることを求める。その義務は、いまや大規模言語モデルにも適用される。規制当局は、あなたのモデルがたまたま LLM であることなど気にしない。

そして、これが私が繰り返し陥ったジレンマだ。SR 11-7 の検証は、伝統的にモデルを理解すること——その前提、その内部構造、その境界——に頼っている。しかし、LLM のプロバイダーは、モデルがどのように機能するのかを教えてくれない。私のアーカイブには、さまざまな言い回しで、そのメールが残っている——当社はモデルの内部を開示できません。 あなたは、ベンダーが開けることを拒むものを、法的に検証するよう義務づけられているのだ。

そのジレンマから抜け出す唯一の道は、重みを覗き込もうとするのをやめて、次のものに評価の目を向け始めることだ——すなわち、出力を、ドメインのグラウンドトゥルース(正解基準)に照らして採点することだ。あなたは、正しい答えが分かっているケースの集合を築く——ある保険契約のサブリミットと補償の免責が相互作用するときにロングテールの賠償準備金をどう設定すべきか、廃止された法令が何を意味するのか、公正融資規則がどう適用されるのか——そして、そのモデルが更新あるいは再調整されるたびに、AI がそれらを正しく導けるかどうかを、大規模に、継続的に検証する。あなたは、目に見える挙動を検証する。なぜなら、それはいずれにせよ、規制当局と顧客が経験する挙動だからだ。それが、私たちがいま構築しているものの核心であり、そしてそれは、ベンダーが箱を開けようと開けまいと機能する、唯一のアプローチだ。

モデルの内部が見えないとき、出力レイヤーは、検証するために残された唯一の誠実な場所だ——そして都合のよいことに、それは、あなたの顧客と規制当局が実際に触れる唯一のレイヤーでもある。

「とにかくプラットフォームを買え」が、なぜ答えでなくなったのか

企業が AI をどう構築するかをめぐって、静かな反乱が起きており、それは検証に直接関わってくる。Retool の 2026 年の「自社構築か購入か(build-versus-buy)」レポートによれば、35% のチームがすでに少なくとも一つの SaaS ツールを自社構築のものに置き換えており、78% がさらに多くを構築する見込みだという。特定のビジネスロジックに合わせたカスタムソリューションは、汎用的なラッパーの 3 倍から 5 倍のリターンを示してきた——その一因は、ソフトウェアコストのおよそ 65% が、あるタイミングよりに発生することにある——つまり、展開してから先の、統合や保守、そしてラッパーが十分にはこなしきれなかった事柄のなかで、である。

だが、「自分で作ればいい」という人たちが見落としている落とし穴がある。カスタムの検証をきちんと構築するには、大半の企業が持っていない ML インフラのチームが必要になる。だから、本当の構図は、ラッパー対カスタムではない。それは三つの選択肢だ——あなたのドメインを理解しない汎用ラッパーか、人員の足りていない自前プロジェクトか、あるいは、この検証の仕事を過去にやり遂げた人々があなたの特定の業種向けに構築した、ドメインエキスパートのシステムか。その三つ目の選択肢こそ、私たちが住まうと決めた隙間だ。ライセンスで借りるダッシュボードではない。人を張りつけて運用するプラットフォームでもない。あなたのドメインの実際の真実を軸に構築された、検証レイヤーだ。

「すでに買ったガバナンスツールが、これをカバーしているのでは?」

人々は、この種の問いを絶えず私に投げかけてくる。たいていは、かすかな期待を込めて。というのも、彼らはすでに予算を使ってしまっているからだ。正直な答えはこうだ——あなたのガバナンスツールはガバナンスをカバーする。そしてガバナンスは、本当に必要なものだ。手放してはいけない。ただ、それは正しさを検証しないというだけのことであり、そもそもそのために作られてはいない。

彼らが二番目に尋ねるのは、彼らが見ることのできない AI についてだ——シャドー AI である。これはリスク担当役員を夜も眠らせない問題であり、そして数字は、そうなって当然だと告げている——従業員の 78% が、雇用主から提供されていない AI ツールを使っており、そのうちの 77% が、機微な情報や専有情報をそれらのツールに入力したことがある。Samsung と Amazon はいずれも、自社の専有コードが公開されている AI サービスの中に置かれているのを発見した。シャドー AI による侵害は、平均で 463 万ドルに上る。Gartner 自身の言い回しは、居心地の悪いものだ——認可されていない AI 利用の大半は、外部の攻撃者ではなく、内部のポリシー違反、共有しすぎ、そして誤用から生じている。あなたのガバナンスプラットフォームは、自らに見えないものを統治することはできず、そして検証は、実際に何が動いているのかを突き止めることから始めなければならない。

三番目の問いは、最も速く迫りつつあるものだ。Gartner は、2026 年の終わりまでに、エンタープライズアプリケーションの 40% が自律的な AI エージェントを組み込むと予測している——単に答えるだけでなく、行動するエージェントだ——データベースを変更し、取引を実行し、顧客への連絡を送信する。これらのいずれについても、成熟したガバナンスを備えていると報告する組織は、およそ 3 分の 1 にすぎない。エージェントが取り返しのつかない行動を取りうるようになると、検証の問いは、「それは正しいことを言ったか」から、「それは正しいことを実行したか」へと移る。そして、取り返しのつかない誤った行動は、誤った一文とはまた別のカテゴリーのリスクである。チャットボット向けに構築された監視は、それに対応するようには決して設計されていなかった。

誰も取締役会のスライドに載せたがらない、罰則の一覧表

議論に決着をつけがちな数字で締めくくろう。というのも、それは、検証をしないことのコストを、エラー率にはできないやり方で、CFO(最高財務責任者)に理解できるものにするからだ。

2026 年 8 月 2 日から、EU AI 法(AI Act)の残る義務の大半が発効する——高リスクシステムに関する規則、そして第 50 条に基づく透明性要件だ。禁止行為に対する罰則は、最大で 3,500 万ユーロ、または全世界売上高の 7% に達する。高リスクの不遵守は、最大で 1,500 万ユーロ、または 3% だ。フィンランドは、2026 年 1 月に、完全に稼働する執行権限を備えた最初の加盟国となった。これはもはや、未来についての備忘録ではない。日付の入った、予算項目なのだ。

検証を省いたことに対する、残りの請求書を足し合わせてみよう——シャドー AI による侵害 1 件あたり 463 万ドル、大規模な AI 障害の 1 時間あたり 100 万ドル超、サービス品質が静かに崩壊したときの 9,900 万ドル、ハルシネーション事案 1 件あたり 6 桁の制裁金、そして全世界収益の割合(ポイント)で測られる EU の罰則。それらすべてに対して、あなたの AI を適切に検証するコスト——答えを、あなたのドメインに照らして、継続的に検証すること——は、丸め誤差にすぎない。それでもなお、大半の企業は依然として、検証を、一度チェックを入れて終わりのチェックボックスとして扱っており、日々回し続ける規律としては扱っていない。

緑色のダッシュボードは、すべては問題ないと彼らに告げていた。厄介なのは、そのダッシュボードが、間違ったものを採点していたことだ。それは、彼らが手順に従ったことを確認した——手順とは、監査しやすく、責任を負うのも安全な、唯一のものであり、まさにそれゆえに、意味を持たなくなってからもずっと、取締役会の資料の中で生き残る。それは、答えが正しかったかどうかを、ただの一度も問わなかった——そして、答えが正しいということこそが、顧客も、規制当局も、そして損失の欄も、これまで気にかけてきた唯一のものだった。私たちが代わりにそれをどう検証しているのかを見たければ、そのアプローチについてはこちらにまとめている

私はいまも、SR 11-7 の四つの柱のチェックリストを、目の届くところに置いている。そして四つ目の柱は監視だ——それは、正しいものを監視している場合にのみ、意味を持つ。あなたのプロセスを採点するダッシュボードは、あなたの AI が多通貨の返金、争いのある準備金、廃止された法令を静かに取りこぼしている間も、緑色のままそこに居座り続ける。Klarna のダッシュボードもまた緑色だった——9,900 万ドルを失ったその四半期に至るまで、ずっと。あなたを本当に守る検証とは、私がキャリア全体を通じて続けてきた、華やかさのない仕事だ——正しい答えがすでに分かっているケースを集め、そして、モデルが変わるたびに、何度も、何度も、機械がなおもそれらを正しく導けるかどうかを確認するのだ。

関連リサーチ

他のプラットフォームでも公開

確かな信頼のもとに、AIを構築する。

次世代のエンタープライズAI構築において豊富な経験を持つチームと、ぜひご一緒ください。信頼できるAI戦略の設計・構築・導入を、私たちがお手伝いします。

Veriprajna ディープテック・コンサルティング は、ヘルスケア・金融・規制対応分野における安全性重視のAIシステム構築を専門としています。当社のアーキテクチャは確立されたプロトコルに照らして検証され、包括的なコンプライアンス文書を備えています。