EdgeFirst Perception Index:首个全流程 AI 视觉基准测试发布

Au-Zone Technologies 近日宣布推出 EdgeFirst Perception Index(EFPI),这是一项季度性基准测试,旨在衡量完整的 AI 视觉处理流程——从图像采集到检测输出的每个阶段——覆盖开发者日常使用和实际部署的各类硬件平台。
与仅关注推理性能的基准测试或厂商自定义的 TOPS 评分不同,EFPI 在所有目标平台上采用统一的 EdgeFirst Profiler 工具、框架和测试方法,为每项配置发布详细的性能分析报告,内容涵盖完整的验证精度评分、各阶段延迟细分、内存与功耗测量,并最终归纳为两项核心指标:核心吞吐量(去除主机开销后的加速器峰值性能)和实际吞吐量(已部署流程端到端的真实帧率)。所有测试结果均链接至公开的 EdgeFirst Studio 会话,任何人均可免费查看和评估。
YOLO26:首次独立边缘端验证
EFPI 第二季度版本是首个在边缘 AI 硬件上对 YOLO26 这一最新 YOLO 架构进行独立验证的基准测试,测试对象涵盖独立 NPU 和集成 SoC 加速器。四个 YOLO 系列(YOLOv5、YOLOv8、YOLO11 和 YOLO26)均在 nano、small 和 medium 模型规格下完成验证,共产生 330 余份公开的 EdgeFirst Studio 会话记录。在 NVIDIA Jetson Orin Nano 上,YOLO26n 检测任务通过 TensorRT 实现了 251 FPS 的实际吞吐量,与同一硬件上的 YOLOv8n 相差不超过 4%,证明新架构在边缘端几乎不存在吞吐量损耗。
全平台横向测评
在基于 YOLOv8n 检测任务的全平台横向测评中,Apple M2 Max 通过 CoreML 以 791 FPS 的实际吞吐量位居榜首;搭载 NVIDIA RTX 4060 GPU 的 x86_64 桌面平台通过 CUDA 实现 351 FPS;NVIDIA Jetson Orin Nano Super 通过 TensorRT 达到 260 FPS;四个 YOLO 系列在所有平台上的精度均与 FP32 参考值保持一致。
嵌入式层级覆盖多款离散与集成 NPU 平台,从低于 7 瓦功耗的边缘加速器到量产 SoC 模块,可下载报告中包含各阶段延迟瀑布图、各精度级别的精度对比以及能效对比表。
主机端流程开销是关键瓶颈
预处理、内存拷贝和后处理往往在实际吞吐量中占据主导地位。开源的 EdgeFirst SDK 有效消除了这一瓶颈。在 Apple M2 Max 上,该 SDK 通过 CoreML 实现检测性能 12.8 倍的提升;Jetson Orin Nano 通过 TensorRT 实现 6.8 倍提升;嵌入式 NPU 平台在 YOLOv8n 检测任务上实现 2 至 12 倍不等的提升——均在相同硬件和相同模型条件下取得。分割任务的提升幅度更为显著,在同一芯片上最高可达 23 倍。
每瓦性能表现
从每瓦帧率的维度来看,EFPI 中的边缘 NPU 平台相较桌面 GPU 具有数量级级别的能效优势,测试基于相同模型和相同 COCO 验证集。NVIDIA RTX 4060 在 115 瓦 TDP 下实现 351 FPS,约合 3 FPS/W;而低于 7 瓦功耗的边缘加速器在同一模型上仍可维持实时吞吐量,功耗仅为前者的一小部分。各平台详细的每瓦性能数据(含遥测信息)可在可下载报告中查阅。
INT8 精度恢复
边缘 NPU 平台运行全整数 INT8 计算,量化损耗客观存在,检测精度通常下降三至五个百分点。Au-Zone 的 Smart Quantizer 通过图分割技术解决了这一问题——为每个输出头分配独立的校准范围,无需重新训练模型。在 EFPI 覆盖的嵌入式 NPU 平台上,Smart Quantizer 可将 INT8 模型的检测精度恢复至与 FP32 参考值相差两个百分点以内,并在分割任务上恢复高达 24 个百分点的掩码精度,将原本无法实际部署的默认导出模型转化为可用的生产级模型。
EFPI 为季度性报告。第二季度版本涵盖四个 YOLO 系列的目标检测与实例分割任务;后续版本将扩展至姿态估计和旋转边界框任务,并超越验证性分析,对包含相机、视频和 ROS 2 感知流程的完整场景进行基准测试,涵盖多模型与多任务工作流。其余平台与模型组合及新款芯片将随验证会话完成后陆续纳入。
EFPI 第二季度的性能分析测试在来自 Apple、Intel、NVIDIA、NXP Semiconductors、Ezurio、PHYTEC、Toradex 的设备与平台上进行,AI 模型由 Ultralytics 提供。
Q&A
Q1:EdgeFirst Perception Index 和普通推理基准测试有什么区别?
A:EFPI 测量的是从图像采集到检测输出的完整 AI 视觉流程,而不仅仅是推理阶段。它使用统一工具和方法覆盖所有硬件平台,提供两项核心指标:核心吞吐量(加速器峰值性能)和实际吞吐量(端到端真实帧率),还包含各阶段延迟细分、内存与功耗数据,比单一的 TOPS 评分或推理测试更能反映实际部署表现。
Q2:YOLO26 在边缘硬件上的性能表现如何?
A:YOLO26 是首次在边缘 AI 硬件上获得独立验证的最新 YOLO 架构。在 NVIDIA Jetson Orin Nano 上,YOLO26n 通过 TensorRT 实现 251 FPS 的实际吞吐量,与 YOLOv8n 在同一硬件上的成绩相差不超过 4%,说明新架构在边缘端几乎没有额外的性能损耗。
Q3:Au-Zone 的 Smart Quantizer 是如何解决 INT8 量化精度损失问题的?
A:边缘 NPU 运行 INT8 计算时,检测精度通常会下降三到五个百分点。Smart Quantizer 通过将模型计算图进行分割,为每个输出头分配独立的校准范围来弥补这一损失,且无需重新训练模型。测试结果显示,使用 Smart Quantizer 后,INT8 模型检测精度可恢复至与 FP32 相差两个百分点以内,分割任务掩码精度最高可恢复 24 个百分点。