問題点
エアカナダのチャットボットは、身近な人を亡くした乗客に対し、正規料金の航空券を購入すれば90日以内に忌引払戻金を請求できると告げました。そのような方針は存在しませんでした。チャットボットが捏造したのです。乗客が払い戻しを求めると、エアカナダは拒否しました——実際の方針では、旅行後の払い戻しは禁止されていたからです。乗客は提訴し、航空会社は驚くべき主張を展開しました。チャットボットは自らの過ちに責任を持つ「別個の法人格」である、と言い張ったのです。
審判所はその抗弁を完全に退けました。Christopher Rivers審判官は、「エアカナダはAIチャットボットから自身を切り離すことはできない」と判断しました。裁判所は、人間の代理人、静的なウェブページ、対話型ボットの間に実質的な違いはないと述べました。どれも会社を代表して語ります。どれも会社を拘束するのです。
これは一度きりの不具合ではありません。今日のほとんどのエンタープライズAIシステムの仕組みに内在する、予測可能な失敗です。あなたのチャットボットは方針を「知っている」わけではありません。統計的パターンに基づいて、良い回答らしく聞こえるものを予測しているだけです。自信ありげに聞こえれば、顧客はそれを信じます。誤っていれば、代償を払うのはあなたです。Moffatt v. Air Canada の判決は、AIハルシネーション——モデルが自信満々に捏造する応答——を法的に過失による不実表示と分類することを確立しました。AIが言ったなら、会社が署名したも同然です。
ビジネスにとってなぜ重要なのか
ここでの金銭的エクスポージャーは理論上の話ではありません。AIハルシネーションによる世界的損失は2024年に674億ドルに達しました。この数字には、直接的な支払い、規制罰金、訴訟費用、ブランドへの損害、そして従業員がAIの仕事を手動でチェックするという隠れたコストが含まれます。
その隠れたコストは、それだけで莫大です。Forrester Researchの推定では、企業の従業員は1人あたり年間約14,200ドルを、単独では信頼できないAIシステムの出力の検証——ハルシネーション対策——に費やしています。
Moffatt の損害賠償額は小さなものでした——約800ドルです。しかし重要なのは先例のほうです。これがあなたの組織にとって何を意味するか:
- 価格、払い戻し、保証、サービス条件に触れるチャットボットは、今やすべて、法的拘束力のある契約変更を生み出せる。 AIは企業のコミットメントをリアルタイムで書き換え得るのです。
- 「ブラックボックス」抗弁は死にました。 AIがどうやってその回答に至ったのか理解していなかった、と主張することはできません。裁判所はシステムの技術的複雑さなど気にしません。
- 「正しい情報はウェブサイトに載っていた」という抗弁は失敗しました。 エアカナダは実際の方針を掲げた静的ページを示しました。しかし審判所は、それでは意味がないと判断しました——AIの発言も同じく有効なのです。
- 集団訴訟のリスクは拡大しています。 この判決は、AIの出力は訴追可能だというシグナルを世界中の原告弁護士に送りました。金融商品に関するたった一つのハルシネーションが、数百万ドル規模の賠償責任を生み出しかねません。
ハルシネーション検知ツールの市場は2023年から2025年の間に318%成長しました。この成長は、危機モードにある業界の表れです。競合他社は右往左往しています。規制当局は監視しています。取締役会は、これがIT問題ではなくバランスシートリスクであることを理解する必要があります。
内部で実際に何が起きているのか
なぜこれが繰り返し起こるのかを理解するには、大規模言語モデルの仕組みについて一つだけ理解する必要があります。次の言葉を予測している、ということです。それだけです。データベースで払い戻し方針を調べているのではありません。法的条項を論理的に吟味しているのでもありません。学習データのパターンに基づいて、統計的にありそうな響きの文章を生成しているのです。
こう考えてみてください。何百もの異なる航空会社の何千もの社内マニュアルを暗記した、優秀な新入社員を雇ったと想像してください。顧客が払い戻し方針について尋ねても、この社員は御社固有のマニュアルを確認しません。代わりに、今まで読んできたあらゆるものをもとに、払い戻し方針が言いそうな響きの回答を組み立てます。時には正解します。しかし十分な頻度で、外します。
最高のモデルでさえ——GoogleのGemini 2.0、OpenAIのGPT-4o——タスクの複雑さに応じて、0.7%から25%超のベースラインハルシネーション率を抱えています。0.7%のエラー率は小さく聞こえます。しかしAIが月に100万件の顧客問い合わせを処理するなら、それは7,000件の潜在的な規制違反、誤った財務諸表、あるいは架空の払い戻し約束です。
本当の危険は、これらのモデルが「自信満々だが間違っている」ことです。事実を語るのと同じ権威ある口調で、捏造を断言します。顧客には違いが分かりません。後から記録を見直す現場スタッフにも分かりません。
多くのベンダーは、検索拡張生成(RAG)——AIに実際のソース文書を与える手法——を解決策として売り込んでいます。しかしエアカナダのチャットボットにも、おそらく正しい方針へのアクセスがありました。リンクまで提示していたほどです。それでもボットは方針を誤って要約したのです。推論エンジン自体が信頼できない場合、AIに正しい情報を与えるだけでは不十分です。RAGは知識を提供します。AIがそれに従うことを保証しません。
有効な対策(そして無効な対策)
ソリューションに投資する前に、何があなたを守らないのかを理解しておく必要があります:
プロンプトエンジニアリングだけ: 「会社の方針にのみ基づいて回答せよ」とAIに頼むのは提案であって、制約ではありません。モデルは一定の条件下でそれを無視できますし、実際に無視します。プロンプトの指示は強制力のあるガードレールではありません。
免責事項と細則: エアカナダは静的なウェブページに正しい情報を掲載していました。審判所は、それが盾にならないと判断しました。「公式情報源で確認してください」と顧客に伝えても、AIがすでに行った拘束力のある約束を取り消すことはできません。
検証なしの素朴なRAG: 文書をベクトルデータベースに入れて、AIが正しく読んでくれることを期待するだけ、というやり方は、まさにこの先例を確立した事件そのもので失敗しました。セマンティック類似検索は間違った文書を取得することがあります——質問が「払い戻しの適格性」だったのに「払い戻し処理時間」を引っ張ってくる、といった具合です。
実際に機能するのは決定論的アクションレイヤー(DAL)——会話とコンプライアンス判定を分離するシステムです。実務での仕組みは以下の通りです:
入力分類: 顧客がメッセージを送ると、セマンティックルーター——言葉の背後にある意図を読み取るシステム——が、その質問が払い戻し、価格設定、法的条項、保証といった制限対象トピックに触れるかどうかを判定します。このルーターはAIモデルの外部に置かれているため、AIを騙すよう設計されたプロンプトインジェクション攻撃でも迂回できません。
決定論的処理: 問い合わせが制限対象トピックに該当した場合、AIモデルは回答を生成することを許されません。代わりに、システムはハードコードされたロジック——データベースをチェックする実際のソフトウェアコード——を実行します。払い戻しの質問なら、例えば「チケットステータスが『traveled』なら『払い戻し不可』を返す」のような処理を行います。判定は確率からではなく、あなたのルールから導かれます。
制御された出力: コードは検証済みの結果を返します。AIの唯一の役割は、その結果を丁寧な一文に包むことです。その後、出力検証によって、最終応答がコードの返したデータと一致することが確認されます。ルールが存在しない質問に遭遇しても、システムは即興で答えません。「直接お答えできません。専門担当者におつなぎします」と伝えます。
このアプローチは、 ニューロシンボリック・アーキテクチャ(AIの言語能力と厳密なルールベースの論理を組み合わせた方式) ——純粋なAIラッパーには決して真似できないものを与えてくれます。完全な監査証跡です。すべての判定は、特定のルール、特定のデータベースクエリ、特定のコードパスに遡れます。規制当局や裁判所が「なぜあなたのシステムはそう言ったのか」と問えば、何が起き、なぜそうなったのかを正確に示せます。
この監査能力は、自動化されたシステムが個人に影響する判定を下す際に説明を受ける権利を定めたGDPR第22条に直接対応します。さらに、EU AI法第14条の人間による監督の要件、および ISO 42001が要求する文書化標準 (AIマネジメントシステム向け)にも適合します。
また、 政府および公共セクターの組織 が市民向けサービスを扱う場合、このアーキテクチャは選択肢ではありません。AIが給付の適格性、納税義務、許認可要件について語るとき、すべての回答は政府の権威の重みを帯びます。政府のチャットボットによる捏造された方針は、賠償責任を生むだけでなく、デジタルサービスへの公的信を蝕みます。
核心原則はシンプルです。言語はAIに扱わせる。決定は決してAIに扱わせない。あなたの方針は、確率ではなくコードの中にあるべきです。詳しくは 技術分析の全文 (詳細なエンジニアリング設計図)をお読みいただくか、 インタラクティブ版を体験して アーキテクチャのガイド付き解説をご覧ください。
あなたのAIは翻訳者であるべきで、意思決定者であってはなりません。顧客の質問をデータベースクエリへ、データベースの回答を人間の言葉へと翻訳します。判定が行われるのは、あなたが管理し、監査し、更新できるコードの中です——中身を検証できないニューラルネットワークの中ではありません。
要点
- 裁判所は今や、AIチャットボットの発言を法的拘束力のある企業の約束として扱います——「ただのボットです」という抗弁はMoffatt v. Air Canadaで退けられました。
- AIハルシネーションの世界的損失は2024年に674億ドルに達し、企業はAI出力の検証だけでも従業員1人あたり年間約14,200ドルを費やしています。
- 正しい文書をAIに与えても(RAG)不十分です——エアカナダのチャットボットは正しい方針にアクセスできていたのに、誤った方針を捏造しました。
- 決定論的アクションレイヤーは、センシティブな質問をAI生成の回答ではなくハードコードされたルールへ振り分けることで、会話とコンプライアンスを分離します。
- すべてのコンプライアンス判定は、確率的な推測ではなく監査可能な論理の痕跡を残すべきです——規制当局と裁判所が求めるのはまさにこれです。
結論
あなたのAIチャットボットはすでに会社の代理で約束をしており、AIがその約束を捏造したものだとしても、裁判所は履行させます。解決策はアーキテクチャにあります。お金、方針、法的条項に関わる一切をハードコードされたルールで処理し、AIが「言うこと」とビジネスが「決めること」を分離してください。AIベンダーにこう尋ねてください:チャットボットが顧客に払い戻しの適格性を伝えたとき、その回答を生み出した正確なルールとデータベースクエリを見せられますか?