物理约束计算机视觉
在球场泛光灯下,一个反光的光头可能获得 98% 置信度的“足球”判定,而追踪最高置信度的摄像机则会直接偏离赛场。Plumbline 是一个确定性的物理门禁层,位于检测器之后,能够拒绝物理规律所不容许的检测结果,同时牢牢锁定真实的足球。
它是检测器与执行系统之间的验证层。运行该系统,即可查看它为每个决策所记录的物理依据。
运行中的 Plumbline 仪表板解说演示(3:58)。
97.7%
目标锁定时间占比,物理门禁
合成基准测试,随机种子 7
82.3σ
最极端伪目标,超出 5σ 判定线被拒绝
bald_linesman 场景审查,44 帧
68.3%
目标锁定时间占比,真实转播片段
真实 YOLO11x,240 帧,图像空间
本页通篇对两种基准测试范围进行严格区分。合成数据是在已知真实真值(ground truth)下的受控最大值;而面对高难度的实况真实视频,真实片段指标如实偏低。
这一失效是物理层面的失效,而非检测层面的失效。
目标检测器是逐帧独立的。它仅依据纹理和形状对每张图像进行打分,完全不清楚真实目标在物理上下一帧可能出现在何处。在体育场泛光灯下,光头反光如同足球,因此检测器会对光头输出高达 98% 置信度的“足球”判定,而实际的足球得分反而更低;追踪最高置信度的摄像机便会跟随光头移动,脱离了比赛本身。
这已有确凿记录,绝非假设。2020 年 10 月在因弗内斯喀里多尼亚压路机足球俱乐部(Inverness Caledonian Thistle),一台 Pixellot 自动摄像机在整场比赛中都在追踪边裁的光头而非足球(Veriprajna WP43 解决方案页面,2026 年)。这也绝非随着模型升级就能自然消除的偶然失效:SoccerNet 自身的追踪基准测试得出结论,多目标足球追踪“远未解决”,且目前的基准方法中尚未集成任何物理感知追踪机制,这是一个显而易见的空白(Veriprajna WP43 研究,2026 年)。
这一问题不会随检测器性能提升而自然消除的原因在于:物理上不可能的检测结果,在任何检测器准确率下都是错误的。一个始终处于 1.7 米恒定高度并以每小时 3 英里移动的“足球”,无论模型的置信度有多高,都不可能是足球。对于需要对自动化视觉决策承担责任的团队而言,边缘案例正是成本的核心所在:一项行业报告将其概括为“占用 80% 的工程时间、90% 的支持成本和 100% 的责任敞口”(Veriprajna WP43 研究,2026 年)。
Plumbline 运行在检测器的下游。它接收每个候选检测结果,检验物理规律是否容许,随后将当前帧路由至接受(accept)、审查(review)或惯性滑行(coast),并详细记录原因。
卡尔曼/UKF 滤波器(抛体过程模型配合非线性针孔测量模型)预测真实足球可能出现的位置。每个候选目标的残差转化为 马氏(Mahalanobis) 距离。阈值以配置形式预设:小于 3σ 接受,大于 5σ 拒绝,3 至 5σ 标记为审查(REVIEW)。在光头边裁场景最极端的一帧中,伪目标得分高达 82.3σ。
该门禁将轨迹预测的像素速度与候选目标的局部光流进行比对,并在方向或幅值不匹配时予以拒绝(预设区间:光流比处于 [0.35, 3.0],余弦值至少为 0.3)。在比赛进行中几乎静止的“足球”将被判定失败。
针孔模型给出了一个 22 厘米的足球在候选目标对应深度下所张成的像素尺寸,门禁会剔除不符合物理尺度的候选目标(合成路径上的尺寸比容差为 1.8 倍,真实片段图像空间路径上为 1.5 倍)。一个约 50 像素的人头,在约 12 米处不可能是一个张成约 22 像素的 22 厘米足球。
随后由确定性策略门禁做出判定,在两条输入路径上均使用相同的 gates.py 且代码保持不变。仅当所有门禁全部通过时才予以接受。它将临界候选目标(3 至 5σ 且无硬性失效)标记为审查(REVIEW),轨迹依靠预测进行惯性滑行,向上升级而非盲目臆测。当所有候选目标均被拒绝时(例如在短暂遮挡期间),系统进入惯性滑行(COAST,纯预测模式),并在足球重新出现时重新捕获。阈值属于配置项,不由任何模型设定。
每个决策都会写入逐决策审查记录中。文件头包含随机种子、场景、检测器 ID 和门禁阈值。每一帧都会列出每个候选目标及其类别和置信度、各门禁的数值判定和通俗解释原因、最终执行动作以及锁定的轨迹。可选的审查解说器可将该遥测数据转化为导出用的通俗事件摘要,但它仅起参考建议作用,绝不介入接受或拒绝路径;在没有模型密钥或桥接服务时,它会自动降级为确定性的模板化摘要,确保演示可以完全离线运行。
同样的三门禁策略运行在两种输入之上,这正是核心所在。在合成场景中,它使用世界空间的无迹卡尔曼滤波器(UKF)。在真实转播片段中,它则通过二维卡尔曼滤波器(kf2d)运行在图像平面上,因为单段未标定的视频片段无法提供度量深度,而伪造三维滤波器是不诚实的做法。门禁代码原样复用;发生实事求是变化的唯有滤波器。这正是该层独立于检测器的原因所在:核心价值在于门禁,而非检测器。
下方截图来自实际运行中的 Plumbline 仪表板。光头伪目标是作者对 2020 年记录事件的人为注入复现,应用中已对此作出明确说明。
在这段 44 帧的场景中,模拟检测器在边裁头部输出了 18 次高置信度的错误“足球”检测,置信度最高达 98%。三道门禁将这 18 次全部拒绝。最极端的一个伪目标在运动学门禁上得分高达 82.3σ,远超 5σ 的拒绝线;而真正的足球置信度约为 87%、误差仅为 0.4σ,顺利通过所有三道门禁并保持锁定。仅在这一单一场景下,物理层便实现了 97.7% 的目标锁定时间占比,且仅发生 1 次 ID 切换;相比之下,遵循最高置信度的基线方法为 59.1%,提高阈值的方法仅为 20.5%(三种合成场景的汇总数据见下文对比表)。
当球员短暂挡住足球时,朴素追踪器会跟丢目标或误捕获该球员。物理追踪器则进入 COAST(惯性滑行)状态,依靠预测平稳渡过遮挡间隙,随后在足球重新显现时重新捕获。它绝不会凭空捏造检测结果来填补空白;它只是预测位置、标记状态并耐心等待。
在一段 240 帧的真实转播片段中,真实的 YOLO11x 检测输入给运行在图像空间内的同一组三道门禁。门禁方案在 68.3% 的帧中稳稳锁定了足球,而朴素追踪器仅为 43.8%,提高阈值的追踪器仅为 30.0%;物理方案仅发生 4 次 ID 切换(基线为 7 次),平均误差为 26.2 像素(基线为 193.0 像素)。该指标实事求是地低于合成测试的上限,因为真实视频难度更大。但其核心趋势依然明确:物理门禁在真实检测场景中同样全面击败两种基线方案,而不仅是在模拟环境中有效。
导出的决策日志公开了完整的审计追踪链路:顶部是随机种子、场景、检测器 ID 和阈值,紧随其后是逐帧记录的每个候选目标的类别与置信度、各门禁的数值判定结果及其通俗物理依据、最终动作和锁定轨迹,末尾附有记分板。对于需要为自动化视觉决策承担责任的团队而言,这是一套可供合规归档的完整凭证,清晰解释了每一项检测为何被采信或拒绝。
这些是追踪质量指标,独立于检测器本身质量。它们绝非模型错误率,也绝非开放世界承诺。下方的两组数据针对不同的测试范围,未作任何混淆混合。
| 追踪器 | 目标锁定时间占比 | ID 切换次数 | 平均误差(像素) | 干净数据集漏检率 |
|---|---|---|---|---|
| Veriprajna 物理方案 | 97.7% | 3 | 2.7 | 2.3% |
| B1:遵循最高置信度 | 80.3% | 4 | 63.0 | 0.0% |
| B2:提高置信度阈值 | 40.2% | 29 | 115.0 | 43.2% |
| 追踪器 | 目标锁定时间占比 | ID 切换次数 | 平均误差(像素) |
|---|---|---|---|
| Veriprajna 物理方案 | 68.3% | 4 | 26.2 |
| B1:遵循最高置信度 | 43.8% | 7 | 193.0 |
| B2:提高置信度阈值 | 30.0% | 1 | 245.1 |
支撑本文论点的关键数据是正交性验证结果。在合成干净数据集上,提高置信度阈值(B2)导致 43.2% 的真实低置信度足球被漏掉;而物理方案将干净数据集漏检率控制在 2.3%,这仅仅是一帧的捕获延迟,并非假阴性漏报。单纯调高置信度旋钮不过是用一种错误替代另一种错误。物理方案的作用机制则与其完全正交。(B2 在真实视频中仅有 1 次 ID 切换,这是由于其目标锁定时间占比仅为 30% 几乎未跟踪到目标所致的假象,绝非优势。)
不是。Plumbline 位于您已运行的任意检测器的下游,负责裁定哪些候选检测结果值得采信。在演示中,完全相同的门禁代码在合成场景中运行于模拟黑盒检测器之上,在转播片段中则运行于真实 YOLO11x 检测结果之上。我们不干涉检测器的输出质量。产品本身是围绕其构建的确定性门禁层,因此即使底层检测器不断升级迭代,该层的价值依然持久稳固。
因为这不是正确的调节维度。在合成干净数据集上,调高置信度阈值会导致 43.2% 真正的低置信度足球被遗漏,同时依然会误选高置信度的伪目标。物理门禁与置信度完全正交运作:它们将干净数据集漏检率控制在 2.3%,这属于单帧捕获延迟而非真正丢球。当伪目标的置信度打分更高时,您根本无法仅凭分值将真实目标与伪目标区分开来。
二者皆有效,并且我们对两者进行了明确区分。在已知真实真值(随机种子 7)的受控合成测试中,物理层实现了 97.7% 的目标锁定时间占比,而遵循最高置信度基线为 80.3%,调高阈值基线为 40.2%。在包含真实 YOLO11x 检测结果的 240 帧真实转播片段中,相同的门禁在 68.3% 的帧中锁定了足球,而两种基线分别为 43.8% 和 30.0%。真实视频指标实事求是地偏低,因为实况视频难度更大。我们绝不会将合成环境下的数据包装为现实环境的结果。
这三道门禁完全是运行在任何模型之外的纯 numpy 和 scipy 代码:卡尔曼/UKF 运动学门禁(小于 3 sigma 接受,大于 5 sigma 拒绝)、光流一致性门禁以及几何透视门禁。系统可信度不依赖于模型的自我陈述。虽然配备了可选的审查解说器以将门禁遥测数据转化为通俗易懂的摘要,但它仅起参考作用,绝不介入接受或拒绝路径;在未配置密钥时,它会自动回退到确定性的模板化摘要。
可以。每项决策都记录并留存有可查的物理依据。导出的决策日志在头部记录了随机种子、场景、检测器 ID 和门禁阈值,并在逐帧列表中呈现每个候选目标及其类别和置信度、各门禁的数值判定与通俗解释(例如:马氏距离 82 sigma 超过 5 sigma 判定线,运动学上不可能发生)、最终执行动作以及锁定的轨迹。日志可导出为 JSON 或 HTML 格式。
两者的回答均为否定。这是一个用以验证门禁机制的可运行演示,而非已实际部署的生产管线。我们所击败的基线方案属于未结合物理特性的通用失效模式类别(遵循最高置信度与提高阈值),并非特指任何具体厂商。我们并未声称追踪表现超越已上市的商用产品,且知名摄像机厂商在后续固件更新中已修复了 2020 年光头边裁这一特定案例。演示中的光头伪目标是作者对该真实记录事件的人为注入复现,并非现场采集到的自然检测器噪声。
如果在您的业务场景中,自动化视觉决策需要承担责任风险,那么核心失效模式在于物理规律,而非置信度。
我们构建 Plumbline 旨在证明:确定性门禁层能够有效剔除物理上不可能的检测结果,并留下可供归档审查的依据。相同的框架可适用于不同的物理规律约束:例如面向晶圆厂的视差门禁,或面向产线的反射率门禁。欢迎告知我们您的检测器频繁违背的物理约束,我们将共同评估门禁层是否适合您的业务场景。