多智能体协同的设备资产巡检与维保工单落地

日期:2026-08-16

一、项目背景

这家制造企业的设备资产上千台,分布在几个厂区。巡检一直靠人,巡检员拿着纸质单子一台台跑,勾完交上去。我们去看他们的痛点,漏检和假检都很普遍,有的巡检员图快,整层楼的设备签个到就走了,真有问题发现不了。等设备故障停机,维修一看保养记录,该保养的没保养,记录却写着已检,互相扯皮。

更麻烦的是,巡检记录、维修工单、设备台账三套系统各管各的,出了事对不上。我们决定用多智能体把巡检、异常识别、工单生成串起来,让点检数据直接进系统,异常自动转工单,保养和故障才有据可查。调研时维修主管给我们算了一笔账,光是因为保养漏做导致的非计划停机,一年损失就够上这样一套系统的钱了,所以我们推进得很顺。

二、落地场景

设备类型杂,有产线设备、动力设备、安防设备,巡检频率和标准都不一样。落地场景是:巡检计划智能体按计划把任务派给巡检员,点检时通过手机或者 PDA 采集数据,比如温度、振动、拍照,采集智能体把数据归到对应设备;异常识别智能体比对阈值和历史,发现超标就生成预警;维保工单智能体把预警转成工单派给维修,维修完回填,设备健康看板汇总所有状态。

整个过程数据自动流转,不靠人抄。我们还把设备台账接了进来,工单和设备档案关联,维修历史能回溯,哪台设备老是出同样的问题一目了然,对后续的技改决策也有用。

三、关键技术挑战与解决思路

巡检数据采集的真实性是第一个难点。纸质单假检的根源是没法验证人到底去没去。我们让点检必须带定位加设备二维码扫码,而且关键指标现场录入,不是打勾了事,这样数据天然带着「人到过、设备扫过」的证据。上线头一个月,系统就抓到好几起定位偏离设备几十米的假检,之前根本发现不了。

异常识别不能太灵敏也不能太钝。太灵敏天天告警,维修不理;太钝该报的不报。我们用设备自己的历史基线做动态阈值,而不是全场一个固定值,新设备老设备区别对待,告警量降下来但关键的没漏。基线每周滚动,避免设备老化导致阈值失真。我们还加了一个趋势预警,指标在阈值内但连续上升的,也提前提示,把故障扼在萌芽。

工单自动生成要接得顺。预警转工单最大的问题是派给谁、什么优先级。我们按设备重要度和异常严重度算工单优先级,重要设备的高优先级异常直接升级到人,不只在系统里躺着。一开始我们转了工单就以为完事,结果有次预警转了工单但没人盯,还是停了机,后来加了升级到人这条才真正兜住。

这个系统上线半年,维修主管说最大的变化不是停机少了,而是扯皮少了,设备台账、巡检、工单三套数据现在能对上,谁该负责一目了然。厂区的安全检查也顺带受益,原本纸质巡检记录难以核查,现在点检数据实时上传,检查组来了直接拉系统,省了多少准备材料的时间。我们还把设备健康分开放给产线班长看,哪个设备快到保养周期了他提前排产,避免保养撞上生产高峰。

四、效果数据

上系统之后,漏检率,也就是该检没检的比例,从之前靠纸质单无法统计、抽样估计的两成多,降到可监测的接近零,因为不扫码点检根本过不了。故障停机次数按月统计降了三成多,主要是保养该做的都做了,小毛病没拖成大故障。巡检工时反而降了,因为不用再手抄和交单,点检完数据自动进系统。工单闭环率,也就是生成到解决回填的比例,提到九成以上。

案例片段(已脱敏): 异常转工单的一段规则(yaml 示意): inspect:  require: [gps, qr_scan, metrics] anomaly:  method: history_baseline  threshold_shift: 3sigma  trend_alert: true  workorder:    priority_by: [device_critical, severity]    auto_escalate: true 一次记录:某产线电机振动值超基线 3.2 倍,异常识别告警,5 分钟内转高优先级工单派至机电班组,2 小时后更换轴承,避免一次预计 8 小时的非计划停机。同周趋势预警提前 3 天提示另一台泵机温度连续上升,检修发现密封磨损。

五、可复用经验总结

设备巡检这件事,我现在的判断是,纸质单能废就废。假检漏检的根就在数据可以造假,让点检带定位和扫码、现场录指标,造不了假,管理成本反而低。我们上线头一个月就抓到好几起假检,之前这些全是盲区。

异常阈值别全场一套固定值,新设备和老设备差太多。我们用历史基线做动态阈值之后,告警从天天轰炸变成真有事儿才响,维修也愿意看了。趋势预警是后来加的,提前几天发现问题,比等超标再报值钱。

工单自动转了还不够,优先级和升级要接上。我们有一次预警转了工单但没人盯,结果还是停了机,后来加了按设备重要度自动升级到人,关键异常才不会被埋在系统里。自动化最后一环一定是人,别以为转了工单就完事。