MWIR 1D-CNN 能够识别近红外分选机遗漏的黑塑料。关掉置信度门控,同一模型就会交付出不合格的料包。合规保障机制才是真正的产品。
回收机器学习循环经济

我构建了一套 AI 用于回收被丢弃的黑塑料,构建分类器只是最容易的部分

Ashutosh SinghalAshutosh Singhal2026年7月16日12 min

炭黑会吸收整个近红外波段的光,因此在黑色传送带上运行的黑色聚丙烯托盘,对市场上所有的近红外(NIR)光学分选机来说都是一个零信号黑洞——包括运转着全球回收分选线的 TOMRA Autosort、Machinex 以及 Pellenc 级别的分选设备。分选机根本看不到该物体,所以它会直接落入残渣流并最终运往垃圾填埋场。根据废料流的不同,3% 到 15% 的废弃物正是以这种方式损失的黑塑料;对于一家年处理量为 50,000 吨且黑塑料占比为 5% 的回收工厂而言,每年因这种方式流失的可回收物大约有 2,500 吨,相当于每年 220 万至 270 万欧元的经济机会(WP45 研究,2026)。在这次系统构建的大部分时间里,我都以为真正有意思的问题是如何让这些塑料被看见。确实如此,大约持续了一周。然后真正的问题浮出水面,而且它根本不是模型本身的问题。

我构建的演示系统名为 Assay,访问地址为 https://veriprajna.com/demos/materials-recovery-ai。在说明其他事情之前,我应该先讲清楚其中哪些是真实的,因为这个领域里的每一个演示都有模糊界限的冲动。光谱数据是合成的,由一个代表 Specim FX50 传感器的物理仿真器生成,气动喷射阀是一个打日志的桩实现。真正真实的是分类器、门控、策略检查以及评估数据。我特意构建了合成端,因为决定一个料包能否售出的案例,恰恰是那种干净的实验室采集几乎从不提供给你的模棱两可、受污染且废料流中混有 PVC 的工况。

我花了一周时间试图赢得一场跑偏的竞赛

在这个系统的构建初期,我的思路和大多数人一样,把它当成了一场准确率的竞赛。每个人谈到黑塑料回收时都会给出一个数字目标:只要把分类器从近红外盲区的零准确率提升到实验室宣传的近 99%,就算解决了回收行业的盲区。因此我首先构建了传感物理层。炭黑确实会削弱中波红外(MWIR)信号,但并不会抹去它,而这一微弱的信号缝隙就是突破口。在 2.7 到 5.3 微米的中波红外波段,每种聚合物依然会留下诊断性的光谱指纹:PP 和 PE 的脂肪族碳氢双峰、PS 的芳香环、ABS 的腈基伸缩振动,以及 PVC 的邻氯特征。我用 numpy 手写了一个小型的 1D 卷积神经网络,包含三个卷积层、池化层、两个全连接层,最后在 PP、PE、PS、ABS 和 PVC 上进行 softmax 分类,具备真实的前向和反向传播、Adam 优化器以及温度校准步骤,作为纯数值代码在约 5 毫秒的热路径中运行。这里没有任何大语言模型参与决策。它是你完全看得懂的算术运算。

而且在实事求是的水平上,它确实奏效了。在包含 1,700 个物体的留出重度废料流上(故意设置得比我训练时使用的数据更脏),它取得了 0.894 的平衡准确率,紧挨着同行评审发表的针对真实废弃物进行 MWIR 分类的 83.4% 现场基准(《Resources, Conservation & Recycling》,2026 年 1 月),底层还辅以可解释的峰值比率规则(准确率为 0.668),以确保神经网络不会自己批改自己的作业。在困难的数据分布上,这是一个不错的数字。它不是实验室里的 99%,而且我很早就做出决定,绝不让它伪装成那个样子。

但接下来发生的事让我停下了脚步。我看着 0.894 这个数字,问自己一家工厂会拿它做什么,答案是:什么也做不了。材料回收设施(MRF)从不为准确率数字买单。它们唯一愿意掏钱购买的,是符合规格的料包。

重构整个系统构建的开关

整个构建过程的转折点,源于我几乎是事后顺手加上去的一个开关。美国塑料回收商协会(APR)针对 A 级再生聚丙烯(rPP)的标准料包规范既具体又严苛:PP 含量至少达到 97%,PVC 含量不得超过 0.5%。未达标的料包意味着整车被拒收、被收取填埋转运费,以及下游再生加工商对你的信任度下降。因此我在控制面板上接入了一个控制开关——一个可以开启或关闭的置信度门控,并在同一废料流上以两种模式运行完全相同的模型,以观察单靠门控能产生多大价值。

在门控开启的情况下,低置信度的物体——那些光谱与单一聚合物均不匹配的多层复合材料和受污染碎片——会在 0.86 的 softmax 阈值下被留存送往人工质检,而不是靠盲猜混入料包;同时,任何高于预设低阈值的疑似 PVC 物体都会被直接硬性拒收。在演示种子 11(seed 11)上,经门控处理后的料包测得 PP 含量为 99.2%,零 PVC 穿透泄漏,证书显示为通过(PASS),达到 APR A 级标准。

演示种子 11 上开启置信度门控后的 rPP 料包证书:PP 含量 99.2%,PVC 含量 0%,通过 APR A 级 rPP 标准,38 件物体路由至人工质检
演示种子 11 上的门控料包。测得 PP 含量 99.2%,PVC 含量 0.00%,两项 APR 条款均显示为绿色通过状态,且面板在同一证书上打印出了留存送往人工质检的 38 件物体,以及实时计算出的回收吨数和收入。

然后我关掉了同一个开关,让分类器对每个物体仅采纳其概率最高的猜测(简单的 argmax),不做任何留存拦截。相同的废料流,相同的模型权重。此时料包读数为 94.2% 的 PP 和 1.94% 的 PVC,证书变成了拒收(rejected),超出了定义该级别的 0.5% PVC 上限。

关闭置信度门控后的同一演示控制面板:rPP 料仓填入了 155 件物体,PVC 拒收和人工质检数量发生变化,面板显示料包将被拒收(BALE WOULD BE REJECTED)
相同的模型,相同的废料流,门控关闭(简单 argmax)。rPP 料仓现在吞下了门控运行模式下被拦截留存的物体,PVC 和误读杂质漏入 A 级料包中,证书显示料包将被拒收(BALE WOULD BE REJECTED)。

我一直以来构建的只是一个分类器。而我眼前所看到的,恰恰证明了分类器从来都不是让料包具备商业销售价值的关键。拒判弃权(abstain)、PVC 硬性拒收以及确定性策略检查才是关键。在上述两张截图之间,模型本身没有发生任何变化。发生变化的是围绕模型构建的合规保障基础设施,而这正是可归档的 A 级料包与一堆受污染破碎料之间的天壤之别。

为什么我把针对 PVC 的判断设计为非对称决策

我特意对 PVC 区别对待,其背后的逻辑值得开门见山地讲清楚。PP 料包中的 PVC 假阴性(漏检)绝非小疏忽,它是一种氯污染物,足以使下游整个熔融批次发生降解。因此门控不会将 PVC 与其他类别对称权衡。只要神经网络将某个物体标记为哪怕具有微弱的疑似 PVC 特征,系统就会将其作为氯风险进行硬性拒收。这意味着我愿意舍弃一部分真正的 PP,以确保绝不会混入 PVC。这是一种代价,而我希望演示系统展示这种代价,而不是掩盖它。在针对 60 个料包的拟合门控评估中,系统将大约 12.6% 的物体分流至人工质检,捕获了大约 99.8% 的 PVC(在全部 60 个料包中仅出现了一次 PVC 穿透泄漏),同时回收了大约 71.2% 的 PP 流。相比朴素系统,它分流给人工复核的材料更多;相比完美系统,它的回收率更低——并且它直言不讳地指出了这一点。一个过度吹嘘自身纯度的回收系统,在其赖以存在的唯一核心任务上就已经失败了。

置信度门控开启,显示 38 件物体累积在人工质检料仓中,而不是被强行塞入 rPP 料仓
拒判弃权层在发挥作用。神经网络不够确信的物体(复合层压材料和受污染碎片)累积在人工质检料仓中(这里为 38 件),而不是靠胡乱猜测进入 rPP 料仓。将其拦截,绝不硬猜。

这种构想的陷阱在于:拒判弃权看起来像是一种软弱。当我向工程师展示人工质检堆时,他们的本能反应是问我为什么不放宽阈值以回收更多材料。因为在分选线上决定的事情,并不是平均猜测水平有多高。而是绝不能让一颗氯炸弹混入 A 级料包中,你绝不希望由一个随机性模型来做出这项裁决。你需要的是一条连模型本身都无法推翻的刚性规则。

我选择写在计分板上的数字

我在计分板数字上做出了一个让我付出了一定代价才坚持下来的决定。0.894 是在肮脏的留出废料流上测得的真实数字。接近 99% 则是具有商业卖点的数字,来自干净的 Specim 实验室采集环境,我本可以引用它并任由人们去遐想。然而,我在演示系统中内置了基准测试面板,将我们的 0.894 与 0.668 的可解释基线规则以及 83.4% 的同行评审现场数据并排呈现,以便任何人都能看清我们的真实水平,并明白我们并没有虚夸实验室天花板。

演示系统的模型基准面板:MWIR 1D-CNN 为 0.894,峰值比率规则为 0.668,现场基准为 0.834,在 40 个随机料包中,门控料包满足 APR 标准的比例为 85%,而无门控料包仅为 23%
留出重度废料流上的基准面板。我们的 1D-CNN 模型为 0.894,与 0.668 的规则基线及 0.834 的同行评审现场数字(RCR,2026 年 1 月)并列,而非约 99% 的实验室数字。在下方是坚实的事实证明:在 40 个随机料包中,门控料包达到 APR A 级的比例约为 85%,而简单 argmax 模式仅约为 22.5%(面板四舍五入显示为 23)。

面板上承载着真正至关重要的数字,而它并不是准确率。在 40 个随机重度废料流料包中,门控料包达到 APR A 级标准的比例约为 85%,而无门控料包达到该标准的比例仅约为 22.5%。请仔细辨析这两个论证点,因为它们是不同的度量,我特意将它们区分开来:99.2% 与 94.2% 的对比是演示种子 11 上某个具体料包的数据,而 85% 与 22.5% 的对比则是 40 个随机料包的汇总聚合数据。单个料包是直观生动的版本,汇总数据是坦诚严谨的版本,而这个论断之所以能够成立,是因为两者的指向完全一致。一个准确率为 0.894 的模型,最终产出的料包是绝大多数时候合格,还是绝大多数时候不合格,完全取决于控制闭环中是否存在门控机制。

我不再向客户推销更贵配置的理由

我在构建算力方案时,其结论其实是在砸自己的咨询账单,这给我的震动比预想的还要大。延迟的物理计算很简单:气阀喷吹的位移等于传送带速度乘以从检测到喷吹的延迟时间,而只有当该气吹覆盖范围不超过约 4 个喷嘴间距时架构才算达标,因为足够窄才能维持纯度。在工厂 3.0 米/秒的带速下,经过优化的边缘 GPU(运行 TensorRT 的 Jetson AGX Orin,延迟为 14 毫秒)产生 42 毫米的气吹宽度,跨越约 3.4 个喷嘴间距,处于合格窗口之内。因此引擎推荐使用 GPU,并明确声明在此带速下采用 FPGA 并不合理,从而为客户节省约 32,000 欧元和 20 周的工程周期。只有当带速推高至约 3.6 米/秒以上时,GPU 的气吹跨度才会超过 4 个喷嘴的界限,此时系统才会转为推荐 FPGA。只要物理条件允许,系统就会推荐成本更低的硬件,即便 FPGA 能开出更高的发票。我不想做出一个诱导每个买家选择昂贵方案的演示系统,因此我将推荐低成本方案设为默认行为,并将背后的推导逻辑直接显示在屏幕上。

比更优模型更具生命力的部分

我并没有造一台分选机,我想在这个问题上保持谨慎,因为人们很容易误以为这是在声称要取代 TOMRA、Steinert 或 Machinex。那是错误的解读。Assay 作为中立第三方的侧带工位,部署在主近红外(NIR)分选线的下游,负责检测初级分选已经剔除的高浓度黑塑料残渣,它完全不会干扰前端设备。它所带来的价值并不是一个会随着模型迭代改进而过时的数字。每个发运的料包都附带一份由 SHA-256 哈希签名的证书,明确记录其测得的成分、每项 APR 条款的合格或不合格核验结果、模型的哈希值、弃权拒判和直接拒收计数,以及回收的总吨数。这份凭证才是工厂真正可以归档存查的东西。

出于特定的监管原因,这在今天比五年前更为重要。随着欧盟的《包装与包装废弃物法规》(PPWR,Regulation 2025/40)、加利福尼亚州的 SB 54 法案以及 RecyClass 框架逐步生效,炭黑包装只有在回收设施实际具备中波红外(MWIR)分选能力的情况下,才会被认定为可回收物(WP45 研究,2026)。这并非针对本演示系统的合规性声明——该证书是可归档的纯度证明凭据,而非合格认证印章。这是行业大环境发生变化的背景。在这样的时代背景下,胜出的回收工厂是那些能为发运的每一个料包向审计员提供可归档凭证的工厂,而不是那些在 PPT 上展示最高基准分数的工厂。分选线上的信任必须是确定性的,而这种确定性恰恰是不存在于分类器内部的东西。

如果你宁愿亲眼看着一个优秀模型交付出不合格的料包,也不愿只读我的文字描述,这里是整个系统端到端运行的全过程。

如果你想亲眼看着一个优秀的模型交付出不合格的料包,然后拨动一个开关,看着它交付出合格的料包,演示系统的地址在 https://veriprajna.com/demos/materials-recovery-ai,它在同一废料流上运行了这两种模式,因此唯一的变量就是门控。最初我认为最困难的问题是识别黑塑料。识别它花了我一周的光谱分析和一个小型网络。而证明回收出来的材料确实洁净,并在材料不合格时敢于弃权拒判、直接剔除并明确报警,才耗费了之后的所有心力。

相关研究

同步发布于

满怀信心地构建您的 AI。

与一支在打造新一代企业级 AI 方面拥有深厚经验的团队携手合作。让我们助您设计、构建并部署一套值得信赖的 AI 战略。

Veriprajna 深度科技咨询公司 专注于为医疗健康、金融和监管等领域构建安全攸关的 AI 系统。我们的架构均依据成熟的规范进行验证,并配有完善的合规文档。