问题在哪
六个厂区各自有一套 MES 和 SCADA,数据格式、采集频率、字段命名全不一样。集团要看整体产能与设备健康度,只能靠各厂手工报表汇总,月度数据要到下月中旬才能看到,且经常对不上。
更实际的痛点是设备故障。关键设备突发故障导致产线停工,每小时损失可观。设备上其实有传感器数据,但只用来做本地报警,没有历史积累也没有趋势分析,谈不上预测。
数据平台架构
应用层
模型层
分析层
加工层
接入层
设备层
老设备不支持 MQTT,用厂区边缘网关做 Modbus/OPC-UA 到 MQTT 的协议转换,避免改造设备本体。
分阶段落地
-
01
第一阶段:单厂试点
选设备数最多的厂区,接入 2000 台设备,验证采集链路与数据质量。
交付物:采集标准、数据字典、试点看板
10 周
-
02
第二阶段:数据平台搭建
建 Iceberg 湖仓分层、统一指标口径、数据质量规则、权限模型。
交付物:湖仓底座、指标字典、质量规则集
12 周
-
03
第三阶段:全量接入
六个厂区逐步接入,边缘网关分批部署,历史数据回灌。
交付物:12400 台设备接入、历史数据入湖
16 周
-
04
第四阶段:预测模型
基于积累的数据训练异常检测与寿命预测模型,先在关键设备上试运行。
交付物:预警模型、验证报告、预警推送流程
14 周
-
05
第五阶段:运营固化
预警处置流程纳入设备管理制度,模型效果按月复盘迭代。
交付物:处置 SOP、月度模型报告
持续
预警模型效果
| 设备类型 | 预警准确率 | 平均提前时间 | 误报率 |
|---|---|---|---|
| 数控机床主轴 | 94% | 38 小时 | 6% |
| 注塑机液压系统 | 91% | 22 小时 | 9% |
| 焊接机器人 | 88% | 16 小时 | 11% |
| 空压机组 | 95% | 72 小时 | 4% |
| AGV 电池 | 89% | 48 小时 | 8% |
误报率控制很关键。初期模型准确率虚高但误报多,维修班组不信任,后来调整了阈值策略才真正被采用。
最有价值的不是模型
客户后来反馈,平台最大的价值其实是「数据终于统一了」。六个厂区第一次能用同一套口径对比产能与良率,管理层的决策依据从「各厂上报的表」变成了「同一个看板」。预测模型是加分项。
技术栈
- IoT Core
- Kinesis Data Streams
- Managed Flink
- S3
- Apache Iceberg
- Glue
- Athena
- QuickSight
- SageMaker
- Timestream