边缘 AI 与实时部署

面向在受限设备上以确定性延迟运行的 AI,提供模型优化、硬件选型与推理流水线工程。

边缘 AI 的成败取决于部署工程,而非模型或芯片:为工作负载选择正确的硬件,在不破坏精度的前提下优化模型以适配该硬件,构建具有确定性延迟保障的推理流水线,并在系统运行于基站、车辆、工厂或国防设施之后持续对其进行更新与监控。这种部署工程正是我们各项合作所围绕的专业领域。

硬件选型是一项工程决策,而非供应商关系

2026 年的边缘芯片格局是有史以来最为碎片化的。每个平台都有着不同的算子覆盖情况、内存架构、编译器工具链以及规模化下的成本曲线。

平台性能功耗 / 能效亮点
NVIDIA Jetson Orin NX在 JetPack 6.1.1 Super Mode 更新(2025 年 1 月)后达到 157 TOPS通过在现有硬件上的软件解锁,生成式 AI 性能提升 1.7 倍
Hailo 10H40 TOPS2.5 瓦(每瓦 16 TOPS)自 2025 年 7 月起商用;M.2 外形规格;AEC-Q100 Grade 2 车规级温度等级
Qualcomm QCS855048 TOPS INT8Dragonwing 产品线
SiMa.ai Modalix Gen 2可从 25 TOPS 扩展至 200 TOPSTSMC 6nm;夺得 MLPerf Closed Edge ResNet50 基准测试冠军
Arm Ethos-U85 NPU为微控制器级设备带来 4 倍性能提升早期授权厂商 Alif Semiconductor 和 Infineon

此处的错误选择代价高昂且难以回头。为 Jetson 上的 TensorRT 优化的模型,如果不进行可能耗时数周的重新优化工作,无法迁移到 Hailo 的数据流架构或 Qualcomm 的 QNN SDK。在做出决定之前,我们会针对候选平台对工作负载进行剖析(参考 我们关于工业边缘计算延迟的研究):

  • 针对模型架构的算子覆盖分析。
  • 内存带宽建模——FPGA 上真正的瓶颈是 DDR 带宽,而非计算。
  • 持续负载下的热包络仿真。
  • 在目标部署规模下的总拥有成本。

一次合作的范围界定,是为了给出带有量化依据的硬件推荐,而非一种供应商偏好。

不破坏模型所学内容的模型优化

让模型适配边缘硬件是一条流水线,而非单一步骤,且其顺序至关重要:

  1. 架构搜索 在硬件约束之内进行:FLOP 预算、受支持的算子集、内存上限。
  2. 量化感知训练(QAT) 以 INT8 或 INT4 精度为目标,并采用逐通道校准。训练后量化(PTQ)速度更快但不可靠——NVIDIA 自己的基准测试显示,在批归一化折叠后对 EfficientNet 架构使用 PTQ 会造成灾难性的精度损失,而 QAT 则可以达到甚至超过 FP32 基线精度。
  3. 结构化剪枝 以敏感度分析为指导,在不触发非结构化剪枝所导致的精度断崖的情况下移除冗余容量。
  4. 知识蒸馏 从更大的教师模型中蒸馏,以恢复在压缩步骤中损失的精度。

选择编译器工具链

编译器工具链的选择决定了可能性的边界,因此我们针对每个目标进行选择,而不是默认沿用上一次使用的那一个:

  • TensorRT 在 NVIDIA 硬件上始终能提供最快的推理,但它是闭源的且仅限 NVIDIA。
  • Apache TVM 是跨平台且开源的,但需要大量调优;未经调优时其性能不及 ONNX Runtime,而经过调优后在 Transformer 架构上可与 TensorRT 相媲美(MDPI Electronics 基准测试,2025 年)。
  • Xilinx Vitis AI 可为 FPGA 目标处理 INT8 量化,但算子覆盖并不完整,会迫使手动重新实现某些层。

确定性延迟不是平均延迟

大多数边缘 AI 基准测试报告的是平均推理时间——这一数字对安全攸关的部署几乎毫无用处。真正重要的是 最坏情况执行时间(WCET):即在热应力、内存压力、电源波动以及操作系统调度争用下,推理步骤所需的最长时间。一个平均耗时 2 毫秒、但在垃圾回收暂停期间偶尔飙升至 15 毫秒的系统,并不是一个实时系统(这正是 我们边缘 AI 制造检测的实用演示 所围绕构建的一项约束)。它是一个有时不够快的快速系统。

我们的方法是构建面向尾部而非平均值进行工程设计的推理流水线:

  • 预分配内存缓冲区,以消除分配抖动。
  • 固定 CPU 亲和性,以防止调度器迁移。
  • 硬件加速的预处理,让数据通路远离 CPU。
  • 输出后处理,其置信度校准针对量化模型偏移的输出分布进行调优。

在 FPGA 目标上,我们的设计完全不依赖软件调度层来实现确定性的亚毫秒级推理;在学术基准测试中,基于 FPGA 的传感器融合已展示出 5.51 毫秒延迟、99.3% 精度 (Springer,2025 年)。对于基于 GPU 的目标,我们使用 CUDA 图和持久化内核启动来最小化驱动开销,并通过 WCET 分析来刻画热降频下的尾部延迟。仅热降频一项,就可能在持续负载下使推理速度降低 30% 至 50% (SINTRONES 军用基准测试),因此一个仅针对平均情况设计的系统,恰恰会在最看重可靠性的条件下失效。

面向现场运行模型的 OTA 更新

部署一个模型只是开始,而非结束。随着周围世界的变化,模型会发生漂移——传感器老化、环境变迁、改变数据分布的供应链变动。在边缘检测漂移比在云端更难,因为带宽有限,而且你无法将原始遥测数据回传至中央系统,否则会耗尽你的连接预算。我们使用统计方法实现边缘侧漂移检测—— KL 散度总体稳定性指数 ——在本地计算,仅将汇总指标向上游发送。当漂移超过阈值时,系统可以触发自动化的再训练工作流,或标记以供人工审查。

更新机制本身也带有风险,而正确的机制取决于监管环境:

  • 汽车: 自以下时间起,UNECE R155 和 R156 已成为所有新车型式认证的强制要求: 2024 年 7 月。R155 要求在整个供应链范围内建立网络安全管理体系;R156 要求为整个车辆软件生命周期建立软件更新管理体系。任何通过 OTA 交付的 AI 模型都属于 R156 的范畴。
  • 医疗设备: FDA 于 2025 年 1 月发布的关于 AI 赋能设备软件功能的指南草案引入了预定变更控制计划(PCCP),允许在变更保持于预先批准的参数范围内时,无需重新提交即可进行上市后的模型更新。FDA 在 2025 年批准了 295 款支持 AI/ML 的医疗设备,其中 62% 被归类为医疗器械软件(SaMD)。
  • 国防与主权领域: OTA 往往根本不是一个可选项。气隙隔离环境使用经加密签名的物理介质或单向数据二极管,并通过与 IEC 62443-4-2 组件级安全要求相匹配的完整性验证(这类被拒绝访问、断连的边缘构建,正是 我们 GPS 拒止无人机自主性的实用演示 为之工程设计的对象)。

我们设计与具体环境相匹配的更新基础设施:汽车 SUMS 合规、FDA PCCP 文档,或带有监管链追踪的气隙隔离物理介质工作流。

何时边缘 AI 是错误的选择

并非每一种推理工作负载都适合放在边缘。在以下四种情况下,它是错误的选择:

  • 参数量约超过 70 亿参数 的大语言模型——除了经过大幅量化、能力削减的版本外,它们在当前的边缘芯片上无法有意义地运行。
  • 模型架构快速变化的工作负载,即你预计每季度都要更换模型系列——云推理更适合它们,因为每一个特定于硬件的优化周期都会额外增加数周时间。
  • 低于数百台设备的小规模部署,它们很少能达到边缘硬件投资回本的 TCO 交叉点;在该规模下的云推理成本是可控的。
  • 数据已经在云端的工作负载,例如对来自众多站点的聚合数据进行分析——将推理推送到边缘并无任何收益。

边缘与云相比的 TCO 交叉点通常落在 12 至 24 个月 ,具体取决于部署规模和推理频率。在规模化情况下,数字是决定性的: 50,000 台设备每分钟运行 60 次推理 每月产生大约 30 亿次 API 调用,折算下来仅云推理成本每月就约为 300,000 美元 (CIO 行业分析)。为该设备群配备的边缘硬件前期投入更高,但持续成本会趋平至 每台设备每月 10 美元 ,功耗为 每节点 10 至 25 瓦。我们为每一次合作建模 TCO 盈亏平衡点,从而让决策建立在数字之上,而非假设之上。

边缘端的多模态与生成式 AI

边缘已不再局限于分类和检测模型:

  • NVIDIA 的 Cosmos Nemotron 视觉语言模型可在 Jetson Orin 上运行,用于多图推理。
  • Hailo 的 10H 可运行 20 亿参数 的语言模型,首个 token 延迟低于一秒,吞吐量超过 每秒 10 个 token ,功耗低于 5 瓦。
  • SiMa.ai 的 Modalix 平台与 Cerence 合作,将 CaLLM Edge——一款车规级嵌入式小语言模型——带入边缘芯片。
  • Latent AI 推出了它所称的业界首个具备智能体能力的边缘 AI 平台,将模型优化与自动化 MLOps 相结合,用于边缘硬件上基于智能体的工作流。

边缘设备现在可以运行视觉问答、自然语言操作员界面(参见 我们关于语音 AI 中超越 API 封装的架构必要性的白皮书),以及此前需要云端往返的短推理链。约束是实实在在的:上下文窗口有限,响应时间随序列长度增加,而且你需要精心的提示工程,以保持在量化模型可靠的输出分布之内。我们帮助团队识别哪些生成式能力受益于边缘部署,哪些则更适合由带边缘缓存的云调用来提供服务。

关键要点

  • 边缘 AI 的瓶颈在于部署工程,而非模型或芯片——在一个 2025 年约达 250 亿美元的市场中,仅有 11% 的企业实现了全面生产(Spectro Cloud,2026 年 1 月)。
  • 硬件选型是一项剖析工作(算子覆盖、内存带宽、热包络、规模化 TCO),因为为一种工具链优化的模型,若不经数周的返工,无法迁移到另一种工具链。
  • 优化是一条有顺序的流水线——架构搜索、QAT(INT8/INT4)、结构化剪枝、蒸馏——其编译器工具链(TensorRT、Apache TVM、Xilinx Vitis AI)针对每个目标进行选择。
  • 安全攸关的系统要求确定性的最坏情况执行时间,而非平均延迟;仅热降频一项就可能使推理速度降低 30% 至 50%。
  • 现场更新与漂移检测(KL 散度、总体稳定性指数)必须与监管环境相匹配——UNECE R155/R156、FDA PCCP 或 IEC 62443-4-2 气隙隔离工作流。
  • 对于参数量 >70 亿的模型、快速变化的架构、少于数百台设备的设备群,以及数据驻留在云端的场景,边缘都是错误的选择;TCO 交叉点落在 12 至 24 个月。

边缘 AI 与实时部署

Sports & Entertainment

面向理疗平台和企业健康项目的 AI 生物力学 | Veriprajna

姿态估计是免费的。BlazePose、MoveNet 和 MediaPipe 都是开源的,可以在任何手机上运行。真正的难题在于其上层:运动专属的生物力学智能——它知道一位 70 岁的膝关节置换术后患者与一位 30 岁的企业运动员有着不同的深蹲深度目标。

35%
PT patients fully adhere to home exercises
$3,591
Annual MSK burden per employee
Explore Solution
Industrial & Manufacturing

面向制造质量检测的边缘 AI | Veriprajna

无论您是首次评估基于 AI 的检测、从无法满足节拍时间的云试点中恢复,还是将可用原型扩展到 15 家工厂,问题都是相同的:将边缘 AI 投入生产是一项集成与运维挑战,而非一次硬件采购。

84%
of integration projects fail or partially fail
5-15%
false reject rate from out-of-box AOI
Explore Solution
Security & Defense

GPS拒止环境下的无人机自主导航:VIO、边缘AI与Blue UAS集成 | Veriprajna

俄罗斯R-330Zh干扰系统在乌克兰前线制造了横跨数公里的GPS盲区。FCC在2025年12月封锁了对所有外国制造无人机的新授权。陆军刚刚在72小时内采购了2,500台Skydio X10D,因为获批库存中再没有其他装备能够应对受争夺的电磁环境。

50%+
Ukrainian FPV drones downed by EW jamming
$1B/day
US economic loss from a GPS service outage
Explore Solution
Energy & Infrastructure

电网 AI 与韧性工程 | Veriprajna

PJM 有史以来首次未达其可靠性目标,缺口达 6,625 MW。ERCOT 的并网排队规模触及 233 GW,而新增上线发电仅有 23 GW。伊比利亚大停电在 5 秒内损失 15 GW,原因是无人监测正确的电压层级。

$163B
Projected PJM capacity costs, 2028-2033
2,600 GW
US interconnection queue backlog
Explore Solution
Healthcare & Life Sciences

面向养老社区的智能设施跌倒检测与环境监测 | Veriprajna

为辅助生活与专业护理机构提供被动式、保护隐私的跌倒检测与环境监测。高风险房间采用毫米波雷达。全楼覆盖采用Wi-Fi感知。

$30,000
Average cost per fall with injury
63%
of facilities short-staffed
Explore Solution
Energy & Infrastructure

智能电表 AI:AMI 预测性维护与固件验证 | Veriprajna

一次糟糕的固件推送让德克萨斯州普莱诺市付出了 765,000 美元的代价,并导致 73,000 块电表掉线。孟菲斯正在花费 900 万美元进行修复。您的 AMI 主站系统能追踪哪些电表停止了通信。

73,000
Meters bricked by one firmware push
29%
Endpoints failing silently without alerts
Explore Solution
常见问题

常见问题解答

与云推理相比,边缘 AI 部署的成本是多少?

边缘与云相比的 TCO 交叉点通常落在 12 至 24 个月。在小规模(低于数百台设备)时,云推理通常更便宜。在规模化情况下,账目会发生决定性的变化:50,000 台设备每分钟运行 60 次推理,每月产生约 30 亿次 API 调用,仅云推理每月成本就约为 300,000 美元。为该设备群配备的边缘硬件前期成本更高,但持续成本会趋平至每台设备每月约 10 美元。功耗为每节点 10 至 25 瓦,对于中等规模部署折算为每年 4,000 至 8,000 美元。将训练和批量分析保留在云端、同时将实时推理推送到边缘的混合架构,据报告相比任一纯粹方案可节省 15% 至 30% 的成本。

针对我的工作负载,我应该选择哪种边缘 AI 硬件?

这取决于四个因素:延迟要求、功耗预算、部署规模,以及针对你模型架构的算子覆盖情况。对于需要高吞吐量的 GPU 级工作负载,NVIDIA Jetson Orin NX 在 Super Mode 更新后可提供 157 TOPS。对于功耗受限的部署,Hailo 的 10H 以 M.2 外形规格在 2.5 瓦下实现 40 TOPS(每瓦 16 TOPS),并具备车规级温度等级。对于无软件调度抖动的确定性亚毫秒级延迟,FPGA 是正确的选择。对于微控制器级的 tinyML,Arm 的 Ethos-U85 NPU 为具有 256KB SRAM 的设备带来了真正的 ML 能力。在做出决定之前,我们会针对候选平台剖析你的具体模型,因为为一种工具链优化的模型,若不经数周的重新优化工作,无法迁移到另一种工具链。

你们如何处理已部署边缘设备上的模型更新?

更新机制取决于监管环境。对于汽车部署,UNECE R155 和 R156(自 2024 年 7 月起强制执行)要求建立覆盖整个供应链和车辆软件生命周期的网络安全管理体系与软件更新管理体系。对于医疗设备,FDA 于 2025 年 1 月发布的指南草案引入了预定变更控制计划,允许在变更保持于已批准参数范围内时,无需重新提交即可进行上市后的模型更新。对于国防与主权部署,气隙隔离环境使用经加密签名的物理介质或单向数据二极管,并配以 IEC 62443-4-2 完整性验证。在所有情况下,我们都会实施差分模型更新(而非整体模型替换)、加密验证、带自动化金丝雀分析的分阶段发布,以及在更新后验证检查失败时的自动回滚。

对于边缘 AI,平均延迟与确定性延迟之间有何区别?

平均延迟告诉你系统通常有多快。确定性延迟告诉你它始终有多快。一个平均耗时 2 毫秒、但在垃圾回收或热降频期间偶尔飙升至 15 毫秒的系统,并不是一个实时系统。仅热降频一项,就可能在持续负载下使推理速度降低 30% 至 50%。对于安全攸关的部署(自动驾驶车辆、工业自动化、医疗设备),真正重要的是在热应力、内存压力、电源波动以及操作系统调度争用下的最坏情况执行时间(WCET)。我们通过预分配内存缓冲区、固定 CPU 亲和性、硬件加速的预处理,以及在 FPGA 目标上完全不依赖软件调度层的推理,来实现确定性延迟。

生成式 AI 和大语言模型可以在边缘运行吗?

可以,但有一定限制。Hailo 的 10H 可运行 20 亿参数的语言模型,首个 token 延迟低于一秒,吞吐量超过每秒 10 个 token,功耗低于 5 瓦。NVIDIA 的 Cosmos Nemotron 视觉语言模型可在 Jetson Orin 上运行,用于多图推理。SiMa.ai 与 Cerence 将 CaLLM Edge——一款车规级小语言模型——带入边缘芯片。参数量约超过 70 亿的模型,若不经大幅削减能力的重度量化,在当前边缘硬件上无法有意义地运行。实际的上限是视觉问答、自然语言操作员界面和短推理链。长上下文生成以及复杂的多轮对话仍然需要云端算力,或需要为延迟敏感的交互配备边缘缓存的混合方案。

你们如何检测和处理边缘设备上的模型漂移?

边缘漂移检测比云端漂移检测更难,因为你无法在不超出带宽预算的情况下将原始遥测数据回传至中央系统。我们使用在本地计算的 KL 散度和总体稳定性指数实施设备端统计监控。仅有汇总指标会被向上游传输。当漂移超过配置的阈值时,系统可以触发自动化的再训练工作流、通过 OTA 流水线排队进行模型更新,或视部署的风险状况标记以供人工审查。常见的漂移来源包括传感器老化、环境变化(光照、温度、振动特征),以及改变数据分布的上游流程变动。该监控与推理并行地持续运行,计算开销极小。

在安全攸关行业中,哪些监管框架适用于边缘 AI?

监管格局按垂直领域而碎片化。汽车:ISO 26262 用于功能安全(ASIL A 至 D),UNECE R155/R156 用于网络安全和 OTA 更新,两者自 2024 年 7 月起均为强制要求。医疗设备:FDA 的 AI/ML 赋能设备软件指南(2025 年 1 月草案),2025 年有 295 项 AI/ML 批准,其中 62% 为医疗器械软件(SaMD)。工业:IEC 62443 用于工业自动化系统的网络安全,来自 Eurotech、IXON、SINTRONES 和 Innodisk 的边缘 AI 产品已获得认证。跨行业:欧盟《AI 法案》的高风险要求于 2026 年 8 月生效(可能延迟),涵盖生物识别、关键基础设施和公共安全领域的边缘部署。ISO 26262 在基于 ML 的软件方面存在明显且有文献记载的空白,尤其是在可解释性以及无法完全预先规定依赖感知的功能方面。我们帮助团队将其具体部署映射到适用的框架,并构建合格评定所要求的文档产物。

我在什么情况下不应该在边缘部署 AI?

在以下四种情况下,边缘部署是错误的选择。第一,需要完整能力、参数量约超过 70 亿的模型,因为当前的边缘芯片若不经大幅降低输出质量的重度量化便无法运行它们。第二,你预计要频繁更换模型架构的工作负载,因为每一个特定于硬件的优化周期都会额外增加数周时间。第三,低于数百台设备的小规模部署,此时云推理成本仍然可控,而前期硬件投资无法回本。第四,数据已经在云端、且对该用例而言云推理调用的延迟可以接受的工作负载。我们为每一次合作建模 TCO 盈亏平衡点,从而让边缘与云的决策由数字驱动,而非基于边缘总是更好的假设。

满怀信心地构建您的 AI。

与一支在打造新一代企业级 AI 方面拥有深厚经验的团队携手合作。让我们助您设计、构建并部署一套值得信赖的 AI 战略。

Veriprajna 深度科技咨询公司 专注于为医疗健康、金融和监管等领域构建安全攸关的 AI 系统。我们的架构均依据成熟的规范进行验证,并配有完善的合规文档。