摘要:国内大部分离散制造业产线的非计划停机,故障排查时间占停机总时长的60%以上,大部分工厂仍依赖资深工程师的经验排查。本文从工程落地角度,拆解可实际运行的产线停机故障根因分析诊断系统的设计逻辑,分享一线踩过的真实坑点,给具备基础的中级工程师做落地参考。
为什么大部分工厂的故障排查还跳不出经验依赖的坑
去年去长三角某汽车零部件焊装产线做现场调研,刚好碰到一次非计划停机。整条线停了三个小时。直接亏掉一百二十万的产能加订单违约金。
找了设备班班长,找了厂家售后,找了甲方设备经理,翻了大半个控制柜,拆了三个伺服电机,最后发现什么?只是一个几十块钱的接近开关接线端子虚焊,震动松了,信号断了。
这种事你要是干过工厂设备,肯定见过,对吧?老工程师在的时候,闭着眼睛都能猜到大概率是IO信号的问题,十分钟就能搞定。老工程师一退休,一走人,新人摸个三五个月都摸不清门道,产线越是复杂,耦合的故障越多,排查起来全靠试错,耽误的都是真金白银。
说实话,很多工厂搞所谓的预测性维护搞了好多年,钱砸了不少,真正能用在根因定位上的系统没几个。要么就是太复杂,一线师傅不会用,要么就是准确率低,误报一大堆,最后还是扔在一边吃灰。

落地可用的产线停机故障根因分析诊断系统核心逻辑
我见过很多方案一上来就堆大模型,堆全量数据采集,说要搞定所有故障,说实话,根本不落地。我们做过快十个不同行业的产线项目,总结下来,能用的系统核心逻辑其实很简单,就是先固化已知经验,再识别未知故障,不要搞一步到位。
数据层的设计,这里必须提,要符合GB/T 39116-2020《智能制造 生产设备运行状态监测数据采集规范》的要求,但是很多人上来就踩坑:非要把所有能采的数据都采下来,一分钟采几百个点,全存云端,不到半年带宽和存储成本就超过系统本身报价了。
我们现在做方案,只要求采三个核心维度的数据:控制层IO触发状态、核心运动部件的负载电流、关键转动部件的振动温度。足够了。这三类数据已经能覆盖90%以上的常见停机故障,采集成本也能压下来,中小企业也能上。
根因分析的算法,我们用的是故障树+半监督小样本学习的组合,没有搞什么通用大模型。先把老工程师脑子里面的排查逻辑拆成故障树,从上到下分级,比如总装线皮带输送机停机,一级分支分成动力故障、控制故障、工艺故障,每个分支再往下拆到具体零件,已知故障靠故障树直接出定位结果,准确率能到95%以上。半监督学习用来抓那些之前没发生过的未知故障,靠异常数据聚类提前发现隐患。
前年给某家电总装线做系统,上线第三个月,系统就弹出预警,说后端张紧机构存在异常疲劳损伤,当时负责的师傅一开始不信,拆开看,果然皮带轮上已经有两厘米长的裂纹了,提前三天换了零件,没发生非计划停机。要是真断了,又是几个小时的停机,损失几十万。

落地最容易踩的三个坑,都是砸钱试出来的教训

第一个坑,过度追求100%准确率。说实话,工业现场什么妖魔鬼怪的干扰都有,焊接的强电磁干扰,电网的波动,原材料的来料差异,都会带来误报。你非要把误报降到0,只能把异常阈值调得极高,最后真故障来了,反而漏报了,那才是大问题。我们现在给客户提的要求就是,允许5%以内的误报,总比漏报强,对吧?
第二个坑,把系统做成IT部门的花架子,不贴合一线维修人员的使用习惯。很多系统做出来,全是专业术语,全是曲线图表,师傅们上来一看就头大,最后还是愿意自己瞎猜,系统成了摆设。我们做输出的时候,直接把根因结果改成一步一步的排查清单:第一步,到几号工位查哪个接线端子,用万用表测电压范围多少,第二步,要是正常再拆哪个护罩,检查皮带张紧力多少,写的明明白白,初中文化的师傅都能跟着走。
第三个坑,不做脏数据清洗直接建模。这个坑我记忆犹新,现在想起来都肉疼!第一年做项目的时候,拿到采集的数据直接就训练模型,结果现场焊接的强电磁干扰把电流信号搞的全是毛刺,一半数据都是脏的,模型准确率直接掉到60%,上线根本不能用,后来砸了一个月的时间,按照ISO 10816-3《机械振动 机器振动测量与评价 第3部分:工业机器的现场评价标准》做异常值截断,再加滑动窗口滤波去噪,准确率才拉回到90%以上。这一趟下来,十几万的成本砸进去了,才换了这个教训。
不过话说回来,产线停机故障根因分析诊断系统,本质上不是用来取代老工程师的。是把他们攒了十几年的经验存下来,不会因为人走就断掉,给新人铺个路,也把能提前拦住的故障提前拦住,少亏点钱,多赚点产能。工业系统,从来不是越先进越复杂就越好,能用,好用,一线愿意用,比什么都强。