社论封面展示了标志性的光头与足球误判场景——通过对比AI摄像机所见与物理现实的分屏画面,生动呈现了文章的核心隐喻。
Artificial IntelligenceComputer VisionMachine Learning

那个让我们的AI崩溃的光头(以及它教给我的关于构建真正实用视觉系统的启示)

Ashutosh SinghalAshutosh Singhal2026年3月6日12 min

2020年10月,因弗内斯喀里多尼亚蓟花与艾尔联之间的一场苏格兰足球比赛,成了我研究过的最具启发性的AI故障案例。一套旨在追踪足球并在没有人工操作员的情况下转播比赛的自动摄像机系统,在整场比赛中都在深情款款地追踪着一名站在边线上的边裁的光头。守在电视机前的球迷错过了每一个进球。互联网彻底炸开了锅。

起初,我也笑了。但随后我便笑不出来了,因为我意识到我的团队正在构建具有完全相同盲点的系统。

摄像机的AI按照自身的逻辑完美地完成了任务。它在球场泛光灯下发现了一个圆形的浅色物体,并给它分配了98%的置信度得分的“足球”标签。真正的球——快速移动、在阴影中模糊、偶尔被球员遮挡——得分仅在80%左右。系统遵循了数学逻辑。而数学与现实脱节。在检测模式理解你所看到的事物之间的鸿沟,正是我过去几年倾注心血的地方,也是我开始在 Veriprajna 构建物理约束视觉系统的原因。

当AI观察世界时,它到底看到了什么?

大多数计算机视觉系统处理图像的方式,就像一个极其自信的蹒跚学步的幼儿在动物园辨认动物一样。圆圆发亮的?球。四条腿的?狗。这种相似并非玩笑——现代卷积神经网络(CNN)将图像分解为纹理、边缘和形状,然后将这些特征与从训练数据中学到的模式进行匹配。从本质上讲,它们就是纹理匹配机器。

在受控条件下,这种方法的效果好得惊人。但在物理世界开始展现其物理特性的那一刻,它就彻底崩溃了。

目标检测不等于目标理解。一个看到圆形物体并称其为球的系统,识别出的仅仅是纹理。而一个拒绝该识别结果、因为该“球”已经在5.5英尺的高度悬停了三分钟的系统——那才真正理解了某些东西。

因弗内斯的摄像机无法区分头和球,因为它完全没有球如何运动的概念。足球遵循抛体运动。它在受到冲击时加速。它的飞行速度可达每小时80英里。它不可能依附在一个以步行速度移动的人类躯干上。这些并非深奥的见解——观看比赛的孩子都会知道。但该AI以计算机视觉界所谓的“单帧独立推理”方式运作,将每幅图像视为孤立的快照,对前序发生的事情没有记忆,对接下来应该发生的事情也没有预期。

我意识到我们面临相同问题的那个夜晚

我真希望自己能说,我是通过某种优雅的理论洞察才得出物理约束视觉这一方法的。事实要难看得多。我们当时正在为一家半导体客户构建缺陷检测系统,而我们的模型不断将灰尘颗粒标记为电路缺陷。不是偶尔——而是接连不断。极高的误报率彻底摧毁了生产团队对系统的信任,而他们不信任也是完全正确的。

我记得凌晨两点坐在检测结果前,怒火中烧,因为按照我们跟踪的每一项基准指标,我们的模型都是准确的。在标准测试数据上,它识别缺陷的准确率超过90%。但生产环境并非标准测试数据。晶圆上会落上灰尘。检测工位之间的光照会发生变化。模型看到一个暗斑就称其为缺陷,就像因弗内斯的摄像机看到一个圆形就称其为球一样。

我和首席技术官(CTO)为了修复方案争论了一周。他想要更多的训练数据。我则想改变架构。当我们提出一个简单的问题时,争论结束了:“我们的模型知道灰尘颗粒和电路缺陷在多角度成像下的表现不同吗?”它不知道。真实的缺陷——硅片上的物理凹坑或划痕——当从不同角度对它成像时,其位置会发生可预测的变化。这就是视差。而停留在表面的灰尘颗粒表现则截然不同。我们当时是在要求一个纹理匹配器去完成物理学家的工作。

那是转折点。我们不再试图让神经网络变得更聪明,而是开始让它服从物理定律。

那场意外翻车的技术演示

在半导体项目转向三个月后,我坐在一家物流公司的会议室里推介我们的新方法。桌子对面坐着对方的十五个人。我搭建了一个现场演示,展示我们的物理约束追踪器如何在模拟仓库中追踪包裹、在遮挡情况下预测其位置并拒绝虚假检测。

演示开始时天衣无缝。随后有人电话响了,屏幕反射的一道光线以恰恰错误的角度击中了我们的摄像机。追踪器卡顿了一下。边界框瞬间跳到了天花板上的照明灯具上,并在那里令人煎熬地停留了三秒钟,随后物理层才将其纠正过来。

我站在那里,看着自己的软件以我花了数月坚称不会发生的方式崩溃。房间里一片寂静。我恨不得找个地缝钻进去。

物理层恢复了过来。这正是关键所在。但在那三秒钟里,我明白了一个基准测试从未教过我的道理:在生产环境中,信任不在于平均准确率。而在于在最糟糕的一帧中会发生什么。

我大声说了出来,一半是对房间里的人说,一半是对自己说:“通用系统现在肯定还在追踪那个吸顶灯。而我们的系统完成了纠偏。这种纠偏恢复能力才是真正的产品。”坐在桌子对面的CTO缓缓点头。两周后他们签约了。但我那天晚上回到家,重写了我们的置信度显示逻辑,使系统能够实时展示其不确定性——因为我再也不想站在客户面前假装数学是魔法了。

为什么准确率达90%的AI系统会在生产环境中失败?

有一个陷阱我如今称之为“90%问题”,我目睹了一家又一家的公司踩进这个坑里。通用计算机视觉API——就是你可以在一下午内从任何主流云服务商那里快速启动的那种——能让你以极低的成本迅速达到90%的准确率。在演示中,它们看起来宛如魔法。然而,商业价值完全存在于最后的10%之中。

最后的10%正是那些“光头”所在的地方。那些在自动驾驶汽车看来像墙壁一样的阴影,在高速公路上引发幽灵刹车。无人收银商店中顾客的手遮挡住商品的瞬间。那些看起来与无害的2纳米灰尘颗粒一模一样的罕见半导体缺陷。

在半导体制造中,将缺陷检测准确率仅提升1%就可带来5%至10%的良率提升,每年节省数百万美元。在自动驾驶领域,特斯拉车主报告了广泛的幽灵刹车事件,其中视觉系统将阴影和立交桥误判为障碍物。这些都不是理论风险。它们是眼下正在各行各业发生的生产故障,因为底层的AI缺乏物理直觉。我们的工作通过添加通用API所缺乏的物理层,消除了从90%到99.99%的差距。

我们如何教会系统像物理学家一样思考

对比图展示了标准CNN如何处理检测结果,以及带有卡尔曼滤波验证门的物理约束系统如何工作。

核心理念看似简单得不可思议:不要把神经网络的输出视为事实,而是将其视为必须经过物理定律验证的带噪测量值。我在我们研究的交互式版本中详细阐述了完整的技术架构,但直觉比数学公式更重要。

设想你正在追踪一个足球。你的摄像机显示球位于中场,以每秒20米的速度向东移动。四十分之一秒后,摄像机显示“球”现在位于15米外的边线上,以步行速度移动。卡尔曼滤波——一种对物体的位置、运动速度以及对两者的确定程度保持动态信念的数学框架——会立即拒绝第二次测量值。因为其蕴含的加速度对于足球来说在物理上是不可能的。系统会计算所谓的马氏距离——本质上是新的测量值与预测值相差多少个标准差。如果它超过3个标准差(3 sigmas),无论神经网络对那些像素有多自信,该检测结果都会被直接丢弃。

这就是我所说的物理约束视觉。神经网络提出假设,物理定律做出裁决。

我们在每一次检测上都叠加了多个验证门。运动学门检查该物体在物理上是否可能出现在网络所指示的位置。光流门验证边界框内的像素运动是否与真实运动物体的预期相符——静止的边裁几乎产生零光流,而飞行中的球则会产生独特的模式。几何门检查物体的视大小是否与其距离摄像机的标称距离下的3D透视保持一致。

任何未能通过任一验证门的检测都会被拒绝。绝无例外,概不覆盖。

当物体消失时会发生什么?

通用系统会陷入慌乱。置信度得分瞬间降至零。追踪器宣布物体“丢失”,要么卡死,要么重置。在物理世界中,这是荒谬的。一个以每秒20米速度移动的球,不会因为一名球员跑到摄像机前就停止存在。它会继续移动,因空气阻力略微减速,并沿着物理学能够以惊人精度预测的轨迹继续行进。

我们的系统在物体被遮挡期间会在内存中保留该物体,并根据遮挡前的轨迹向前投射其位置。当物体重新出现时,系统已经在正确的位置进行观察了。我认为这是赋予了AI“客体永久性”(物体恒存)。我两岁大的侄子在八个月大左右就明白了这一点。而大多数生产环境中的视觉系统至今仍未掌握。

“换个更大的模型不就行了”

解释物理信息神经网络(PINN)的示意图——展示了物理方程如何约束神经网络的学习,并与标准训练进行对比。

人们经常对我说这句话。在2023年的一次融资路演中,一位投资人原话对我说过,他往椅子上一靠,仿佛刚刚解决了我们整个技术难题:“为什么不直接微调一个基础模型呢?为什么要费劲搞所有这些物理机制?”

我停顿了一下回答道:“因为当你的训练分布发生偏移时,物理定律并不会改变。”

PINN不仅仅是从数据中学习。它是在受现实约束的数据中进行学习。这其中的差别,就像死记硬背答案与真正理解学科知识之间的差别一样。

物理信息神经网络(PINN)是现代机器学习中最优雅的构想之一。标准神经网络最小化其预测值与带标签训练数据之间的差距。而PINN增加了第二项惩罚:每当网络的预测违反物理方程时,它都会受到惩罚。如果它预测的轨迹显示球在没有外力的情况下在空中转弯,控制微分方程就会被打破,损失函数值激增,网络就会学会避免做出这种预测。

其实际效果是惊人的。PINN所需的训练数据要少得多,因为物理定律在训练开始之前就已经排除了大部分解空间。它能够泛化到从未见过的条件下,因为它已经将规则内化,而不仅仅是死记硬背样本。在我们从事的体育运动追踪工作中,这意味着我们可以根据初始轨迹预测指节球(蝴蝶球)的弧线或弧线任意球的轨迹——摄像机能够提前移动到动作发生处,而不是跟在动作后面追逐。关于PINN与哈密顿神经网络的完整技术剖析,我在我们的研究论文中进行了更深入的探讨。

没人坦诚面对的自研与外购抉择

与我交流过的每一位企业领导者都面临着相同的抉择:购买现成的视觉API还是定制自研。然而,鲜少有人展开的坦诚对话版本,其实是这样的。

外购能让你快速投产上线。API从第一天起就能运作。它能很好地处理标准场景。在电子表格上,总拥有成本看起来很低。

紧接着,边缘极端情况接踵而至。误报越积越多。你雇佣人工来审核AI的工作,这完全违背了初衷。你发现供应商的模型无法针对你的特定物理场景进行微调。你意识到你的数据正在流出企业内网。而且你没有积累任何属于自己的知识产权。

构建物理约束系统的前期投入更高。这需要扎实的工程研发。但误报率会下降几个数量级,因为物理机制过滤掉了仅靠数据无法消除的噪声。系统运行在你的基础设施上,使用你的数据,生成归你所有的模型。对于任何出错代价高昂的应用来说,长期的总拥有成本都更有利于自研——而根据我的经验,任何值得自动化的应用都是如此。

我并不是说每家公司都应该从头自研。我是说,如果你的AI连球和光头都分不清,那么订阅费反而是你付出成本中最微不足道的一部分。

语境即新的准确率

去年我坐在一次学术会议的后排,听着专家小组就AI是否需要“常识”展开辩论。四位研究员,辩论了四十五分钟,没有得出任何定论。我心里一直在想:我们不需要常识。我们需要的是物理学。常识是模糊的。而物理学是一组你可以用代码实现的方程。

AI行业花了十年时间在基准数据集上优化准确率。拥有数十亿参数的模型能够在测试图像与训练图像相似的情况下,以超人的精度识别成千上万的目标类别。而下一个十年属于语境。不是更大的模型,而是更聪明的约束。不是更多的参数,而是更多的物理学。

你的AI知道球和头颅之间的区别吗?如果它仅依赖像素,答案是“偶尔”。如果它依赖物理定律,答案是“始终”。

我想起那场苏格兰足球比赛的次数可能超出了应有的程度。一个光头男子站在边线上,做着自己的本职工作,却意外地暴露了整整一代AI系统的根本脆弱性。错过了进球的球迷感到沮丧。而我却心怀感激。那位边裁在构建真正实用的AI方面教会我的东西,比我读过的任何论文都要多。

计算机视觉的未来不在于看清更多。而在于理解你所看到的一切。

相关研究

同步发布于

满怀信心地构建您的 AI。

与一支在打造新一代企业级 AI 方面拥有深厚经验的团队携手合作。让我们助您设计、构建并部署一套值得信赖的 AI 战略。

Veriprajna 深度科技咨询公司 专注于为医疗健康、金融和监管等领域构建安全攸关的 AI 系统。我们的架构均依据成熟的规范进行验证,并配有完善的合规文档。