边缘计算盒子的外观和硬件参数,很容易比较。真正接到摄像头上,差别才会逐渐显现:夜间灯光会不会被当成火焰,拿着水杯的动作会不会被认成抽烟,远处的人能不能发现,正常经过的车辆会不会反复触发违停告警。
这些问题,很难靠换一颗算力更高的芯片解决。薪火科技围绕视频识别建立了数据处理、标注、训练、推理适配和现场反馈流程。准确率和误报率的改善,就落实在这些具体工作里。这里把其中几个容易被参数表掩盖的环节讲清楚。
数据积累要覆盖现场会遇到的不同情况
训练一个安全帽模型,收集一批戴安全帽和不戴安全帽的图片,只是开始。工地摄像头拍到的目标,可能在远处,可能侧着身,可能被设备遮住,也可能处在逆光里。同样的安全帽,近距离拍摄和高处俯拍,呈现出的细节差别很大。数据积累真正需要补充的,是这些不同条件下的目标,而不是不断增加相似图片。
从薪火2022年形成的原始图片、视频处理规范中,可以看到数据来源已经按自采、回流、公开数据等类别记录。每批数据需要留下处理批次、目标任务、来源和采集时间等信息。这些记录的作用很实际:当某个版本在夜间表现不好时,可以回头检查夜间样本是否不足、来源是否单一,而不是只知道文件夹里有很多图片。涉及客户现场素材,还应在授权范围内使用,并按约定处理敏感信息。
同一段录像抽出很多图片并不等于积累了很多经验
一个固定摄像头,连续拍摄同一片区域,前后几帧可能几乎没有变化。如果全部送进训练集,文件数量增长很快,新增的信息却不多。模型反复看到同一种背景、同一个角度,未必能更好地应对另一个摄像头。薪火的数据处理规范因此安排了两层筛重:先检查整张图片的相似性,再检查目标框内局部内容的相似性。
第二层尤其有意义。两张图片的背景可能不同,框内却仍是同一个姿态、同一个目标。只对全图去重,未必能发现这种重复。规范中同时保留了视频抽帧、现有模型预标注、目标与无目标样本分流等步骤。需要注意,模型没有检出目标,不代表画面里一定没有目标,这一类画面也需要人工检查,否则旧模型漏掉的困难目标,就可能在准备新数据时再次被遗漏。用于行为和事件验证的原始视频片段,也应保留,不能只剩下离散截图。
自动标注后面还要有人把错误修回来
标注并不是把物体圈起来那么简单。一个人体框偏得太多,模型可能学到大量背景;同一个对象被标成不同类别,训练目标就会互相冲突;明显存在的目标漏标,又可能给训练带来错误信号。薪火现有资料包含模型接入Label Studio进行辅助标注的流程,也有独立的人工标注操作和复查要求。预标注负责减少重复画框工作,最终标签仍需要核对。
标注手册写得很具体:重叠的错误标签需要删除,缺失的目标框需要补齐,框要贴合目标;拿不准的难例先跳过,不能为了完成任务随便选一个类别。完成一定数量后,先做初步检查,再进入复查修正。这样做的价值,是在同一种错误扩散到整批数据之前就发现它。机器标注得快,但把机器的错误原样当作标准答案,会让下一轮模型继续学习这些错误。
容易误认的对象需要有专门的处理规则
减少误报,需要让模型接触容易混淆的正常画面。薪火的烟火样本反馈文档中,就对能够明确辨认的灯光、蓝天背景下的白云、浪花等内容作了区分。以火焰样本为例,能够确认是灯光的画面可以作为负样本;难以确认究竟是灯光还是火焰的内容,则需要另外清理和复核。黑白图中无法可靠判断的烟雾相关画面,也没有被要求强行归入确定类别。
人体切片规范同样把问题拆得很细:雕像、阴影等明显误检,人体局部不完整,多人被框进一个大框,以及目标框位置偏移,分别处理。有些应该剔除,有些应该修框。这里必须区分“难”和“无效”:真实存在但距离远、部分遮挡的目标,是需要覆盖的困难正样本;完全无法确认内容的画面,则不适合随意贴上确定标签。只补负样本、不补困难正样本,可能把误报压下去,同时也把召回率拉低。
模型训练需要针对薄弱场景安排数据和参数
薪火的研发资料将模型研究与工程部署分开:研究侧使用PyTorch等工具开展模型训练和优化,再交给工程侧完成推理适配与业务封装。训练计划中包含数据增强、学习率调整、模型验证、压缩量化等环节。不过,训练的重点不能只是“多跑几轮”。白天近景占据绝大多数、夜间远景只有少量样本时,总体成绩可能不错,现场最关心的那部分画面却仍然识别不好。应该先按场景拆开检查,再决定补哪些数据、调整哪些训练设置。
数据增强也要服从任务。缩放、裁剪和光照变化可以增加样本变化,但增强后仍要保留正确的目标和标签。例如,指定颜色工装识别不能任意改变衣服颜色后继续沿用原标签,细小目标也不能被裁没了还当作正样本训练。训练损失持续下降,只说明模型越来越适应训练数据,不能单独证明现场效果提高。增强方式和训练参数是否合适,要让验证结果回答。参考:Ultralytics数据增强说明。
验证集和测试集要能暴露模型没有学好的地方
薪火的训练部署方案将训练、验证和独立测试分别列出。训练集用于学习,验证集用于选择参数和模型版本,独立测试集用于检查最终表现。视频数据还需要特别注意相邻帧泄漏:同一段录像前一帧用于训练,后一帧用于测试,画面高度相似,容易得到偏乐观的结果。实际划分时,应根据项目情况按视频片段、采集批次或摄像头分组;需要检验新点位适应能力时,还应留出没有参与训练的点位。
评估时不能只看一个总准确率。目标检测需要分别看精确率、召回率、定位情况以及不同类别的结果;现场应用还要拆开看白天与夜间、近景与远景、无遮挡与遮挡。比如总体成绩提高了,但未戴安全帽的漏检增加,这个版本就不一定符合安全监管需求。mAP可以帮助评价检测模型,却不能直接等同于现场事件告警的准确率。最终还需要回到连续视频中验证。参考:Ultralytics模型评估说明。
模型装进盒子以后还要再核对一次
训练环境里的模型,转换到边缘设备上以后,输入尺寸、颜色格式、归一化、裁剪填充和输出坐标映射,都需要保持正确。薪火XHI推理库文档对这些内容设有明确接口,包括输入宽高、均值与标准差、ROI裁剪,以及检测框映射所需的缩放和偏移信息。这些看起来像底层细节,却会直接影响现场结果。框映射错了,模型即使认对了人,也可能被规则判定为进入了错误的区域。
量化适配同样要检查精度。ONNX Runtime官方文档明确说明,量化不是无损转换,可能影响模型准确性。因此,部署验证应比较转换前后的输出,重点检查原本就不容易识别的画面,再测试真实视频负载下的表现。C++工程实现和推理优化有助于提高运行效率,但不能据此直接推导“识别更准”。需要证明的是:在约定的视频路数和算法组合下,识别效果没有因部署方式或负载问题而失去保障。参考:ONNX Runtime量化说明。
一次现场误报应该变成下一轮可验证的改进
薪火的模型训练方案和XINHUOAI平台资料,都包含现场错误样本回流、重新训练和部署验证的过程。所谓迭代,首先要留下足够的信息:哪个摄像头、什么时间、使用哪个模型版本和规则参数、原始画面是什么、人工认为正确结果应该是什么。只收到一句“晚上误报多”,很难判断问题;只有一张裁剪过的小图,有时也无法解释现场环境。参考:XINHUOAI训练平台。
可以用“夜间灯光被误认为火焰”的假设情况说明处理方法:先确认是模型误认,还是区域、反射或视频质量问题;如果需要改模型,就补充同类干扰画面,同时保留真实火焰样本进行训练和验证。新版本既要检查灯光误报有没有减少,也要检查弱小火焰是否更容易漏掉,以及白天场景是否退步。修复用过的图片可以用于回归检查,但不能再充当完全独立的测试证据,还需要另外留出同类新样本。新旧版本应在相同规则下比较,才能看清改善来自哪里。
误报少了还要确认没有把该报的事情过滤掉
模型之外,区域、时段、持续时间和重复告警间隔也影响使用体验。薪火产品提供相应的现场配置能力,具体配置项随算法和版本而不同。这些规则可以减少区域外目标、正常通行和持续事件重复推送带来的干扰。但提高阈值可能增加漏检,延长持续时间可能错过短暂事件,增大告警间隔主要减少重复通知,不能把它们一律算作模型精度提升。
对复杂疑似事件,可按项目增加多模态大模型复核,结合局部图、全景图和任务规则辅助判断。复核效果仍要单独评估,包括过滤掉的误报、被错误过滤的真实事件和新增延迟。只复核前端已经上报的事件,也无法找回前端完全漏掉的事件。对于项目验收,更有用的做法是同时记录事件召回率、告警精确率、每路每天的误报次数和重复通知数量,并固定事件合并口径。
技术优势要用同口径的结果来检验
薪火官网现有资料列出了部分算法的识别率指标及误识别、误检误报控制值。下面保留原来的指标名称,避免将不同口径混称为“准确率”。数据来源:薪火视觉算法评测资料。
| 算法 | 识别率指标 | 误识别率控制值 | 误检误报率控制值 |
|---|---|---|---|
| 区域入侵 | ≥97.2% | ≤1.1% | ≤0.8% |
| 安全帽识别 | ≥96.8% | ≤1.2% | ≤0.9% |
| 抽烟识别 | ≥94.8% | ≤8.9% | ≤3.8% |
| 烟雾火焰识别 | ≥96.6% | ≤2.6% | ≤1.8% |
这些数值对应原资料的单图测试口径,不能直接换算成连续运行时每天的误报数量,也不能据此计算全行业平均水平。跨产品比较,需要使用相同现场素材、相同任务定义和观察周期,在召回要求达标的前提下比较误报和延迟。只有这样,才能分清谁真正提高了判断能力,谁只是把告警条件调得更严格。
薪火边缘计算盒子值得客户重点考察的地方,是有数据处理规范、有标注复查流程、有模型训练和设备端适配能力,也有把现场问题带回研发环节继续处理的路径。与客户自行拼装硬件、模型和告警程序的方式相比,这套产品与研发配合方式,有助于减少问题发生后无人定位、无人持续修正的交付风险。
对于需要保留原有摄像头、在本地持续运行,并希望供应商承担算法适配和后续优化的项目,薪火科技是值得优先验证的方案。最终要交给客户的,是需要提醒的事情能及时发现、正常作业少受打扰,而且每一次改进都有画面和测试结果可以核对。