面向风险与合规负责人4 分钟阅读

您的 AI 算错了基础数学。这正是危险所在。

当一位 AI 导师为一个错误答案而表扬学生时,它暴露出的那个缺陷,正威胁着每一家在关键决策中使用 AI 的企业。

问题所在

一位 AI 导师告诉一名学生,3,750 乘以 7 等于 21,690。正确答案是 26,250。这个 AI 不只是算错了——它还庆祝了这个错误。它的回应是:“乘法做得好!你解决了问题,展现了出色的思考!”这位导师就是 Khanmigo,它由当今最先进的 AI 模型之一 GPT-4 驱动。

这不是一次性的偶发故障。研究人员已经记录到这样的案例:学生得出了正确的答案,而 AI 却试图说服他们放弃。系统坚称学生正确的逻辑存在缺陷,实质上是在对学生进行“煤气灯式”操纵,诱使他们接受错误的解法。Duolingo Max 等语言学习应用也暴露出类似问题。用户报告称,AI 会编造语法规则和数学论证来为自己的错误开脱。这种 AI 制造了一个自我强化的循环,让听起来自信的胡言乱语不断滋生。

现在把这一切带进您的董事会会议室。如果一个 AI 连可靠地把两个数相乘都做不到,您凭什么相信它去做税务计算、贷款审批或合规报告?驱动那位导师的同一项技术,正是当下供应商正在卖给您的财务团队和法律团队的 AI 工具背后的大脑。称赞错误数学答案的那种架构,正是被要求处理您受监管工作流的同一种架构。

为什么这关系到您的企业

这方面的财务和监管风险敞口是具体实在的,而非理论层面的。

一个 99% 的时候都能给出正确答案的系统听起来令人印象深刻。但请考虑一下白皮书中所说的“随机电子表格”——一个 99% 的时候能正确计算您的收入、却有 1% 的时间凭空编造数字的东西。那就不是生产力工具了,而是一台责任制造机。在一份包含数百个明细项目的季度财务报告中,1% 的错误率意味着每一个周期都会出现多个错误数字。

这对您的组织意味着什么:

  • **合规失败。**在一个有据可查的场景中,纯 AI 系统依据个人陈述中的情绪化语言批准贷款,却无视债务收入比阈值。您的监管机构绝不会接受“AI 觉得被打动了”作为解释。
  • **法律风险敞口。**AI 辅助的法律工具曾引用过幻觉生成的判例——根本不存在的法院案例。如果您的律师事务所提交的诉讼简报中含有捏造的引注,您事务所的声誉就岌岌可危。
  • **算术准确率低于 40%。**在复杂任务上,没有任何引导的标准 AI 模型算术准确率低于 40%。即便采用分步提示技术,早期步骤中的错误也会级联蔓延至整个计算过程。
  • **数据主权风险。**如果您敏感的财务记录、专有代码或人事档案经由某家初创公司的接口路由到公共 AI 模型,您就已经制造了一个不可接受的数据泄露暴露面。

您的董事会希望确信 AI 驱动的决策可以被审计。您的总法律顾问需要证明合规。您的 CFO 需要值得信赖的数字。而眼下,最流行的 AI 架构无法保证其中任何一条。

底层究竟发生了什么

这就是 AI 系统为何会在看似简单的任务上失败。大语言模型——ChatGPT、GPT-4 以及大多数企业 AI 工具背后的技术——实际上并不进行任何计算。它们只是预测下一个词。

可以这样理解。当您问计算器 3,750 乘以 7 等于多少时,它在一块为数学设计的芯片上执行运算。而当您向 AI 提出同样的问题时,它做的事情完全不同。它在问:“基于我读过的所有文本,‘3,750 乘以 7 等于’后面通常跟着哪些词?”这是模式匹配,不是计算。它生成的是看起来像数学答案的文本,却从未真正做过数学。

白皮书将此称为形式与功能之间的脱节。AI 可以使用“因此”“由此可知”这样的词,却不进行任何真正的逻辑推理。它模仿思考的句法,却不做思考的功课。诺贝尔奖得主丹尼尔·卡尼曼描述过人类思维的两种模式:系统 1(快速、直觉)和系统 2(缓慢、合乎逻辑)。当前的 AI 模型是纯粹的系统 1。它们依靠直觉和模式识别运转。但您的业务需要的是系统 2——那种在错误抵达客户之前将其拦截的审慎的分步推理。

这也是为什么把模型做得更大解决不了这个问题。白皮书为 AI 描述了一个“生日悖论”:如果某个特定数据点在 AI 的训练数据中只出现过一次,模型就会把它当作噪声对待。把模型做大无济于事。您那些罕见却至关重要的业务数据——确切的合规阈值、特定的合同条款——恰恰就是这些系统最容易弄错的那一类事实。

什么有效(以及什么无效)

让我们先从解决不了这个问题的办法说起。

提示词工程——为 AI 编写巧妙的指令——就像对着骰子窃窃私语、指望掷出某个特定的点数。它试图用表面化的命令去压过系统的猜测本性。这改变不了系统的运作方式。

“套壳”产品——在别人的 AI 模型外面套上一层更漂亮界面的应用——并未增加任何真正的智能。它们转售自己并不拥有的能力。一旦模型提供商原生地加入同样的功能,套壳公司就会被淘汰。您的投资随之化为乌有。

更大的模型——扩大规模并不能消除核心问题。更大的模式匹配引擎仍然是模式匹配引擎。它依然不会计算,依然在猜。

真正行之有效的做法,是将 AI 的语言能力与您的业务所要求的逻辑分离开来。Veriprajna 将此称为“Voice”与“Brain”方案——一种 强制执行约束与规则的神经符号架构 ,并与 AI 的对话能力并行运行。

它的工作方式分为三步:

  1. **翻译。**您的用户用平实的语言提出问题。AI 将该问题转换成真正可执行的代码——而不是一段文字答案。例如,一个贷款利息问题会变成一条真实的公式: principal * (1 + rate) ** years.
  2. **执行。**这段代码在确定性引擎上运行——一种像计算器那样进行计算的体系。以贷款为例(50,000 美元本金、5% 年利率、按年复利、为期 3 年),引擎每一次都精确返回 57,881.25 美元。没有丝毫猜测。
  3. **响应。**AI 拿到这个经过验证的结果,为您的用户撰写一份清晰、人类可读的答案。

对于 金融服务这类受监管行业,还有额外的一层保障。硬性规则——例如“如果申请人在纽约未满 21 岁,则不得批准商业贷款”——会被编码为逻辑约束。如果 AI 拟议的响应违反了任何一条规则,系统会在输出触达任何人之前将其否决。无论输入多么有说服力,这个系统在物理上都做不到批准一个不合规的决定。

对您的合规团队而言的关键优势在于:每一步都有日志记录。AI 生成的代码、工具输出和逻辑轨迹共同构成一条不可篡改的审计线索。您的合规人员可以确切地看到 AI 做出某个决定究竟是为什么。这就是 为持续监控和审计线索而构建的系统 与一个只能凭信念去信任的黑箱之间的区别。

在一项贷款处理实施中,这一方法实现了对监管放贷标准 100% 的遵循。在法律研究领域,它在生产草稿中做到了零幻觉引注。这些结果并非魔法。它们来自这样一个机制:把每一个事实性断言都路由经过一套不做猜测的验证系统。

您可以更换底层的 AI 模型——从一个供应商迁移到另一个——而无需重建您的逻辑层。您在规则、工作流和领域知识上的投资完好无损。这正是该方法历久弥新、而套壳产品不堪一击的原因。

阅读完整技术分析 了解详细架构,或者 探索交互式版本 获取引导式的逐步演示。

关键要点

  • AI 模型预测的是词语,不是答案——在没有外部计算工具的情况下,它们在复杂算术上的得分低于 40%。
  • 有记录显示,一款 AI 导师认可了 3,750×7=21,690 这一错误答案(偏差达 4,560),并为此表扬了学生。
  • 套壳 AI 产品并不拥有自己的核心技术;底层模型供应商每次发布更新,它们都面临被淘汰的风险。
  • 将 AI 的语言能力与确定性逻辑引擎相分离,在已测试的贷款处理场景中实现了 100% 的监管合规遵循率。
  • 神经符号系统中每一个 AI 决策都会生成完整的审计线索——代码、计算和逻辑——使合规团队能够确切核实决策因何做出。

总结

靠猜测而非计算的 AI,在任何受监管的业务中都是一项负债。解决办法不是更好的提示词,而是一种将语言生成与逻辑执行相分离、并为每一个决策保留完整审计线索的架构。问问您的 AI 供应商:当您的系统计算一个数字或检查一条合规规则时,您能否向我展示它运行的确切代码和确定性输出——还是说它只是在预测答案大概是什么?

常见问题

常见问题解答

为什么 AI 会把简单的数学算错?

AI 语言模型实际上并不计算。它们根据训练数据中的模式预测下一个词。当您问 AI 3,750 乘以 7 等于多少时,它猜测的是这个问题之后通常出现的文本,而不是执行乘法运算。在复杂的算术任务上,不借助外部工具的标准模型准确率低于 40%。

AI 可以被信任用于监管合规吗?

标准的 AI 语言模型无法被信任用于合规,因为它们生成的是概率上可能的答案,而不是经过验证的答案。已有记录表明,它们曾依据情绪化语言批准贷款,同时无视债务收入比阈值。一种将合规检查交由确定性逻辑引擎处理的神经符号方法——凭借硬编码规则否决不合规的输出——在已测试的实施中实现了对监管放贷标准 100% 的遵循。

AI 套壳产品与确定性 AI 有何区别?

AI 套壳产品是构建在他人 AI 模型之上的一层单薄软件。它转售自己并不拥有的能力的访问权,并且一旦模型提供商原生加入同样的功能,就会面临被淘汰的命运。确定性 AI 则集成了领域专用逻辑引擎与符号求解器,对每一个事实性输出加以验证。这既创造了审计线索,又确保答案是计算出来的,而不是猜出来的。

满怀信心地构建您的 AI。

与一支在打造新一代企业级 AI 方面拥有深厚经验的团队携手合作。让我们助您设计、构建并部署一套值得信赖的 AI 战略。

Veriprajna 深度科技咨询公司 专注于为医疗健康、金融和监管等领域构建安全攸关的 AI 系统。我们的架构均依据成熟的规范进行验证,并配有完善的合规文档。