摘要:本文以国内某1780mm热轧生产线的辊耗优化项目为案例,聊一聊工业数据从治理到挖掘落地的真实踩坑经验,给准备做数据项目的中级工程师一点可落地的参考。
为什么九成工业企业挖不动数据价值
说实话,我刚接这个热轧项目的时候,甲方总工拍胸脯跟我说,我们厂数据全,PLC、L2、MES全打通了,就等着你们挖了提产能。我去现场拉了一周数据,直接头大。
同一块钢坯的出口厚度,PLC出来的是12.34mm,L2记录的是12.41mm,MES报给生产部的是12.37mm——三个数三个口径,你信哪个?
十几个测温传感器,一年下来空值率超过15%,有的传感器坏了半个月才有人修,这段时间的数据全是补的固定值,混在正常数据集里。垃圾进垃圾出,这句话真不是说说的。

去年隔壁园区一家汽配厂,花了六百多万上工业大数据平台,上来就要做全产线质量预测,结果跑出来的模型精度才67%,连质检工人的肉眼准确率都不如,项目直接烂尾,领导换了一届,现在平台还在服务器上落灰。
问题出在哪?不是算法不行,是没人做深度治理。上来就谈挖掘谈AI,相当于给你一堆混着铁锈、泥沙、废钢的铁矿石,直接扔炉子里炼,能出好钢才怪。
深度治理的核心不是洗数据,是对齐业务逻辑
很多人对数据治理的理解,就是删异常值、补缺失值,弄成一个整齐的csv就完事了。真不是。
我们做辊耗预测,轧辊的磨损是跟每一次咬钢、每一块钢坯的轧制力直接相关的,不同层级的数据时间粒度差了好几个数量级:PLC的轧制力数据是100ms一条,L2的工艺参数是5s一条,MES的钢坯批次信息是1小时更新一次。原来大家都是按天统计辊耗,把一天的所有数据平均了扔进模型,能准吗?
我们做深度治理的第一步,就是按咬钢周期切分时间窗,把不同数据源的所有数据,对齐到每一块钢坯的单个轧制单元。光梳理这个时间对齐规则,我们跟工艺工程师泡了三天现场,跟着轧钢班走了两个夜班,才把逻辑捋顺。

说个常见的踩坑点。碰到缺失值你怎么办?大部分人会用均值、线性插值补上。我告诉你,工业数据里,大部分缺失值不是随机丢的,是传感器坏了、或者刚好过钢的时候信号断了才丢的,这种数据你补上,反而会把模型带偏。我们的做法是,把单轧制单元内缺失率超过10%的数据直接标记剔除,不到10%的,用同钢种同规格的历史数据按轧制力加权补,比瞎补准多了。
还有口径问题,辊耗怎么定义?设备部算的是轧辊总磨削量除以产量,生产部算的是轧辊从上线到下线的总损耗,财务算的是采购成本分摊到产量,三个口径差了快8%。做治理第一步就得跟业务部门把指标定义聊死,对齐到同一个口径,不然后面挖出来的结果,各说各话,没人认。
深度挖掘分析落地:窄域嵌入机理,比通用大模型靠谱

不过话说回来,治理完数据,挖掘该怎么做?现在动不动就说大模型,上来就用千亿参数预训练,我跟你说,工业场景真没必要,还容易出事。
我们这个项目,治理完一共拿到了近12万块钢坯的对齐数据,一开始用通用的XGBoost做辊耗预测,精度大概82%,看起来不错,但工艺部门不认——为什么这个轧辊磨损比那个快?模型说特征重要性最高的是轧制力,可工艺上本来就知道啊,说不出个所以然,没人敢用这个结果调工艺。
后来我们把经典的轧辊疲劳磨损机理公式嵌进了模型,把公式里的轧制力、轧制速度、冷却水温这些变量作为硬约束,模型只需要拟合机理公式里没覆盖的材料不均、安装偏差这些误差项,结果精度直接拉到了94%,而且每一个输出都能用工理解释,工艺工程师一看就懂,直接拿去做轧制计划优化了。
这个项目上线跑了半年,辊耗预测平均偏差从原来的16%降到了4%,每年节省的轧辊采购和磨辊费用超过180万,还间接提升了约2.1%的成材率,这个收益,真的是超出预期。
别总想搞大而全的全局挖掘。很多企业上来就要覆盖全产线所有环节,光梳理数据就耗了两年,需求改了三茬,最后项目没钱了,不了了之。不如找一个痛点足够明确、收益好算的小切口,比如轧辊损耗、比如轴承故障预测、比如冲压件开裂预判,先拿到实实在在的结果,拿到业务部门的认可,再慢慢扩,比什么都强。
工业数据的价值,从来都不是摆在台面上的。它埋在现场几十年攒下来的乱糟糟的原始数据里,埋在不同部门各说各话的口径里,埋在没人在意的时间错位和缺失里。你得沉下去淘,把杂质筛掉,把逻辑理顺,才能挖出真金。不是搭个平台跑个大模型就叫挖掘了,那是花架子,中看不中用。