基于动作识别的工业安全违规检测:让 AI 看懂“在做什么”再谈安全
Action recognition based industrial safety violation detection
本文提出了一种结合动作识别(Action Recognition)与目标检测(Object Detection)的工业安全违规检测系统。该系统通过 SlowFast 网络识别工人的具体作业行为,并利用 YOLOv9 针对性地核查该动作所需的特定个人防护装备(PPE),在 109 个工业视频测试集上实现了 F1 分数 23% 的显著提升。
TL;DR
在嘈杂且复杂的工厂车间,仅仅通过 AI 检测工人是否戴了安全帽是不够的。本文提出了一种全新的思路:先利用 SlowFast 网络“理解”工人正在进行的动作(如焊接、搬运、行走),再通过 YOLOv9 精准检查该特定动作对应的防护要求。这种方法将违规检测的 F1 分数提升了 23%,大幅降低了传统方法中高昂的误报率。
痛点深挖:为什么“一刀切”的检测行不通?
在大型制造场景中,防护要求是动态变化的:
- 走路的工人:仅需安全帽和安全鞋。
- 焊接操作员:必须额外佩戴焊接面罩和防护手套。
- 机械维修员:必须戴手套,但不一定需要焊接面罩。
传统的 Object Detection (OD) 方法往往不管三七二十一,漏掉任何一件装备都会报警。这导致了海量的虚假警报(False Alarms),让安全员不胜其烦,最终使自动化监控系统沦为摆设。
核心机制:动作识别驱动的智能核查
作者提出了一套集成框架,将“语义理解”置于“物体识别”之前。
1. 工业级动作数据集
作者指出,现有的 Action Recognition 数据集(如 UCF-101)大多是体育或家务,不符合工厂实际。因此,他们利用 320 小时的真实监控数据,构建了一个包含 12 种微动作(如 Crane Movement, Welding, Interacting)的工业专用数据集。
2. 算法流程 (Methodology)
系统采用双阶并行结构:
- 动作捕捉层 (SlowFast Network):利用双路径处理视频流。慢路径(Slow pathway)捕捉高清空间特征,快路径(Fast pathway)捕捉动作的快速变化。
- 目标检测层 (YOLOv9):在识别出动作的区域,定点检索 PPE 目标。
- 判定逻辑:如果识别结果为“焊接”,系统会自动加载“焊接面罩、手套”的检索列表;若缺失,则判定违规。
(图:集成动作识别与 PPE 检测的算法流程)
实验结果:AI 胜过人类肉眼?
研究团队在一台 RTX A6000 上运行了对比实验,结果令人振奋:
| 算法类型 | 准确率 (Precision) | 召回率 (Recall) | F1 分数 |
|---|---|---|---|
| 传统全量检测 | 0.51 | 0.56 | 0.54 |
| 本文方法 (基于动作识别) | 0.60 | 0.93 | 0.73 |
关键发现:
- 极高的召回率:93% 的召回率意味着系统几乎不会漏掉任何真实的违规行为。
- 对比人类:28 位人类评估员的平均召回率仅为 78%。人类由于疲劳或视线盲区,反而比 AI 更容易漏掉隐蔽的违规行为(如未戴手套)。
(图:本文数据集中的 12 种动作类别分布,显示了极高的类别多样性)
深度洞察:工业视觉的未来
这项研究标志着工业安全监控从“通用特征检测”向“场景语义理解”的跨越。
局限性分析:
- 2D 限制:目前系统主要依赖 RGB 视频,在判断工人与移动吊车的“安全距离”时,缺乏深度信息(Depth)会导致误差。
- 视野(FOV)权重:对于 20 米以外的远景,手套、护目镜等小物体检测率会下降。
总结 (Takeaway): 安全检测不应是静态的规则引擎,而应是具备“上下文感知”能力的智能体。本文通过引入 Action Recognition,成功解决了工业监控中“精度”与“实用性”的长期博弈。未来的工厂,AI 将不仅能看到“人”,更能理解其“行为”背后的风险。
