工业工程

工业工程

首页
专业认知
课程体系
方法与工具
软件技能
就业发展
考研深造
院校学科
行业洞察
文章
关于
登录 →
工业工程

工业工程

首页 专业认知 课程体系 方法与工具 软件技能 就业发展 考研深造 院校学科 行业洞察 文章 关于
登录
  1. 首页
  2. 方法与工具
  3. 工业工程数据与指标看板:从指标定义、采集口径到可视化落地的完整手册

工业工程数据与指标看板:从指标定义、采集口径到可视化落地的完整手册

0
  • 方法与工具
  • 发布于 2025-10-04
  • 10 次阅读
伴读书童
伴读书童
目录
当前文章没有目录

工业工程数据与指标看板:从指标定义、采集口径到可视化落地的完整手册

大多数工厂的看板是"假看板"——屏幕上数字很漂亮,但没人知道它怎么算的、该不该信、超限时该找谁。这篇从指标定义卡的 12 个要素讲起,给出六个统计口径的纠偏方法、八个核心指标的手算算例、采集方案的选型对照与看板设计规则,最后附 40 项检查清单。

一、先诊断:为什么你的看板没人看

工业工程做数据看板,最常见的失败不是技术失败,而是信任失败。以下三类失败几乎覆盖了 90% 的情况。

1.1 失败类型一:口径不清,数字打架

典型场景:早会上产量看板显示 12,480 件,MES 系统显示 12,310 件,ERP 显示 12,655 件。争论半小时,最后谁的数字都不信,改用"大概一万二"来决策。

根因:三个系统的分母定义不同。

系统 计数时点 是否含返工件 是否含试产件 是否含报废件
看板 下线扫码 含(重复计) 含 不含
MES 工序报工 不含 含 不含
ERP 入库过账 不含 不含 不含

三个数字都对,也对不上。 解决办法不是"统一到一个系统",而是在指标定义卡里把口径写死,并让所有系统按同一口径取数。

1.2 失败类型二:只报不改,看板变成装饰

典型场景:看板天天显示 OEE 72%,红色告警每周都亮,但三个月过去了没人动。

根因:指标没有责任人和行动规则。 一个能驱动行动的指标必须回答三个问题:

  1. 谁对这个数字负责?(到具体岗位,不是"生产部")
  2. 超限时做什么?(预设的动作清单,不是"分析原因"这种废话)
  3. 多久内必须响应?(分钟级/小时级/日级)

看板三问(本文会反复用到):谁看?看什么?看完做什么? 回答不了这三问的指标,不配占用屏幕空间。

1.3 失败类型三:指标被"游戏化"

典型场景:某厂把"设备利用率"纳入车间月度考核。三个月后,利用率从 68% 涨到 89%,但 WIP 翻了一倍、交期延误率上升、在制资金占用超标。

根因:单指标考核必然被博弈。 这是古德哈特定律的标准案例:当一个指标成为目标,它就不再是好指标。

对策在本篇第七章展开(指标组合、对冲指标、过程+结果双轨)。


二、指标体系设计:从战略到工位的四层结构

2.1 指标金字塔

层级 服务对象 更新频率 典型指标 指标数量
L1 战略层 厂长/总经理 月/季 单位制造成本、OEE 趋势、OTIF、库存周转、人均产值 5~8 个
L2 部门层 部门经理 周/月 计划达成率、良率、设备可动率、人员效率、在制水平 10~15 个
L3 产线层 车间主任/班组长 日/班 班次 OEE、产量达成、停机 TOP3、FPY、节拍达成 8~12 个
L4 工位层 操作工/检验员 实时/小时 实际节拍 vs 目标节拍、不良数、安灯响应、换型计时 3~5 个

设计原则:

  1. 上层指标必须能被下层指标解释。 如果 L1 的"单位制造成本"上升,必须能通过 L2/L3 的指标追溯到具体原因(是良率降了?还是停机多了?还是人员效率低了?)。
  2. 每一层只保留能驱动行动的指标。 L4 工位层超过 5 个指标,操作工就一个都不会看。
  3. 上下层之间用"指标树"连接,不要用"拍脑袋的比例分摊"。

2.2 指标定义卡:12 个必填要素

这是本文最实用的一张表。任何一个要上墙的指标,都必须先填完这张卡。 我见过太多项目因为跳过这一步,在上线后推倒重来。

# 要素 说明 示例(OEE)
1 指标名称 唯一且无歧义 设备综合效率 OEE
2 业务定义 用一句话说清它度量什么 设备实际创造合格产品的时间占计划负荷时间的比例
3 计算公式 可复现的算式 OEE = 可用率 × 性能效率 × 合格品率
4 分子定义 含什么、不含什么 合格品数 × 理论节拍(单件标准时间)
5 分母定义 关键,最易出错 负荷时间 = 日历时间 − 计划停机(休息、交接班、计划保养)
6 数据来源 系统 + 字段 + 取数接口 MES 设备状态表 equip_status;SCADA 脉冲计数
7 采集方式 自动/半自动/人工 设备状态自动采集;人工填报停机原因代码
8 统计频率 计算与刷新周期 每班计算一次,日/周/月滚动汇总
9 聚合规则 多设备/多线如何合并 按负荷时间加权,禁止算术平均(见 3.2 节)
10 目标值与阈值 目标 / 预警 / 报警 目标 85%;预警 < 75%;报警 < 65%
11 责任人 到岗位,不到部门 设备工程师(可用率)/工艺工程师(性能)/质量工程师(合格品率)
12 行动规则 超限时的标准动作清单 报警触发→2 h 内召开停机分析会→输出 TOP3 停机原因→48 h 内对策

特别强调第 9 条(聚合规则)和第 12 条(行动规则)。 前者决定数字对不对,后者决定看板有没有用。

2.3 指标树:让上层指标可追溯

指标树的作用是建立"结果指标 → 过程指标"的因果链。以 OEE 为例:

                        OEE
        ┌───────────────┼───────────────┐
      可用率           性能效率         合格品率
        │                 │                │
   ┌────┴────┐       ┌────┴────┐      ┌────┴────┐
  换型     故障     空转     速度     返修    报废
  停机     停机     待料     损失     品      品
   │        │        │        │        │       │
 SMED    PM/备件  物料配送  参数优化  工艺    工艺
 项目    管理     节拍化    与维护    能力    能力

算例 2-1:用指标树分配改善资源

某产线某月 OEE = 71.6%,负荷时间 8,000 min。反推损失时间构成:

损失类别 损失时间(min) 占负荷时间 对 OEE 的影响 归口
换型停机 480 6.0% −6.0 pp IE(SMED)
故障停机 420 5.25% −5.25 pp 设备
待料/等待 260 3.25% −3.25 pp 物流/计划
空转与短停 340 4.25% −4.25 pp 设备/工艺
速度损失 300 3.75% −3.75 pp 工艺
返修与报废 400 5.0% −5.0 pp 质量/工艺
合计损失 2,200 27.5% OEE = 72.5% —

(校验:1 − 0.275 = 0.725,与实测 71.6% 的差异来自四舍五入与未归类损失,实务中应保留"其他"项做平账)

改善资源分配的正确逻辑:

  • 不是按损失大小排序,而是按「可改善空间 × 改善难度」排序。 故障停机 5.25 pp 看着不小,但如果该设备是进口专用设备、备件交期 12 周,短期几乎无法改善。
  • 优先做"低垂的果实": 换型停机 6.0 pp 通常通过 SMED 能压缩 40%~60%(具体效果因场景而异),且不需要资本开支 → 优先投入。
  • 每次只追 2~3 个损失项。 同时追 6 项的结果是每项都做了 20%。

建议的季度节奏: 选 2 个损失项 → 集中资源做深 → 固化标准 → 下季度选新的 2 项。


三、六个必须讲清楚的统计口径

这一章是全篇最容易"看起来懂了但实际还在犯错"的部分。每一节都给一个对照算例。

3.1 均值 vs 分位数:长尾会骗人

算例 3-1:交付提前期的均值陷阱

15 个订单的实际交付提前期(天,已排序):

3, 4, 4, 5, 5, 5, 6, 6, 7, 8, 9, 12, 15, 18, 25

计算:

  1. 总和 = 132 → 均值 = 132 / 15 = 8.8 天
  2. 中位数 P50 = 第 8 个 = 6 天
  3. P90 位置 = 0.9 × (15 − 1) + 1 = 13.6 → x₁₃ = 15,x₁₄ = 18 → P90 = 15 + 0.6 × 3 = 16.8 天
  4. P95 位置 = 0.95 × 14 + 1 = 14.3 → x₁₄ = 18,x₁₅ = 25 → P95 = 18 + 0.3 × 7 = 20.1 天
  5. 承诺 10 天交付 → 达标率 = 11 / 15 = 73.3%

管理层看到均值 8.8 天会认为"我们承诺 10 天,没问题"。实际上 26.7% 的客户被延误,P90 客户等了 16.8 天。

规则:

指标性质 应使用 禁用
时间类(周期时间、TAT、等待、响应) P50 + P90 + 达标率 均值(作为唯一指标)
成本类、总量类 均值/合计 —
质量特性(尺寸、重量、性能) 均值 + 标准差 + Cpk 均值(作为唯一指标)
通过率/达成率 加权值(见 3.2) 算术平均

3.2 加权 vs 算术:多线合并时必然踩的坑

算例 3-2:三条产线的 OEE 汇总

产线 负荷时间(min) OEE 合格产出时间(min)
A 450 75.44% 339.5
B 900(两班) 62.00% 558.0
C 450 81.00% 364.5
合计 1,800 — 1,262.0

错误算法(算术平均):

(75.44% + 62.00% + 81.00%) / 3 = 72.81%

正确算法(按负荷时间加权):

加权 OEE = (339.5 + 558.0 + 364.5) / 1,800 = 1,262.0 / 1,800 = 70.11%

差异 2.70 个百分点。 为什么会错?因为 B 线开两班、负荷时间是其他线的两倍,它的低效应该占更大权重。算术平均把三条线当成同等重要,等于假设每条线的产能相同,这在现实中几乎从不成立。

同理适用于:

  • 良率:多工序/多产品的合并良率应按投入量加权,而不是各良率的算术平均
  • 达成率:应按计划量加权
  • 单价、成本:应按数量加权

但有一个例外:当各单元权重相等时,两者相同。 上例中若三条线负荷时间都是 450 min,加权 = 算术 = 72.81%。所以问题不在于方法,而在于你是否检查过权重。

3.3 移动平均 vs 累计:趋势与现状是两件事

口径 算法 用途 陷阱
日/班值 单期实际值 现场日报、异常响应 波动大,容易被单日异常干扰
移动平均(MA) 最近 n 期均值,如 MA7 看趋势、过滤噪声 滞后(滞后约 n/2 期)
累计值(YTD/MTD) 期初至今累计 考核、对账 会被早期数据稀释,掩盖近期恶化

典型误用: 用"年度累计 OEE 78%"汇报,而最近三个月已经跌到 68%。累计值的滞后性会掩盖拐点。

推荐组合: 主图用 MA7 趋势线 + 单期值散点,副图用 累计值(仅对账用)。

3.4 分母定义:OEE 的三个分母

这是 OEE 领域最经典的争议。三种分母对应三种用途:

分母口径 定义 数值(同一组数据) 用途
日历时间 24 h × 天数 480 min/班 衡量资产总利用,适合投资决策
计划工作时间 日历 − 非排产时间(周末、无订单) 480 min 衡量排产合理性
负荷时间 计划工作时间 − 计划停机(休息、交接、计划保养) 450 min 标准 OEE 定义,适合现场改善

算例 3-3:同一组数据,三种口径的三个 OEE

基础数据:单班 8 h = 480 min;计划停机 30 min(休息 20 + 交接 10);非计划停机 45 min;理论节拍 30 s/件;实际产出 700 件,其中合格 679 件。

口径 A(分母 = 负荷时间 450 min,标准 OEE):

  1. 运行时间 = 450 − 45 = 405 min
  2. 可用率 = 405 / 450 = 90.00%
  3. 理论产出 = 405 × 60 / 30 = 810 件
  4. 性能效率 = 700 / 810 = 86.42%
  5. 合格品率 = 679 / 700 = 97.00%
  6. OEE = 0.9000 × 0.8642 × 0.9700 = 0.7545 → 75.45%

口径 B(分母 = 计划工作时间 480 min):

  1. 运行时间 = 480 − 30 − 45 = 405 min(同样)
  2. 可用率 = 405 / 480 = 84.38%
  3. OEE = 0.8438 × 0.8642 × 0.9700 = 0.7074 → 70.74%

口径 C(分母 = 日历时间 480 min,且假设全天排产):

同口径 B(若只排一班且日历口径按 24 h 计,则可用率 = 405/1440 = 28.13%,OEE ≈ 23.58%)

结论:同一个现场,OEE 可以是 75.45% 或 70.74% 或 23.58%,全都"正确"。

IE 的实务建议:

  • 对外对标/内部横向比较:用口径 A(负荷时间),这是业界最通用的定义
  • 做投资决策(要不要加设备):用口径 C,因为它反映了资产的真实利用水平
  • 无论如何,必须在指标定义卡里写明口径,并永远不混用

3.5 时间粒度对齐:班次、日、周

常见问题:日看板显示"日产量达成 102%",但月度达成只有 94%。为什么?

典型原因:

  1. 班次之间的归属问题:夜班跨零点,22:00 开始的班次产量算哪一天?必须有明确规则(通常按班次开始日归属)。
  2. 周末与工作日的混合:月度达成率的分母应包含所有排产日,不能只算工作日。
  3. 月末截断:最后一天只跑了半个班,却被按整天比较。

规则:所有比率类指标,分子分母必须来自同一时间窗口、同一口径的排产集合。

3.6 异常值处理:规则必须先定,不能事后挑

算例 3-4:三种剔除规则的差异

某工序 12 次测时值(秒):

34.2, 35.1, 36.8, 34.9, 35.5, 72.4, 35.8, 34.6, 35.2, 36.1, 35.9, 34.8

规则一(不剔除):均值 = ?

34.2+35.1=69.3; +36.8=106.1; +34.9=141.0; +35.5=176.5; +72.4=248.9; +35.8=284.7; +34.6=319.3; +35.2=354.5; +36.1=390.6; +35.9=426.5; +34.8=461.3 均值 = 461.3 / 12 = 38.44 s

规则二(3σ 剔除):

  • 均值 38.44,标准差:偏差平方和 72.4 的偏差 = 33.96 → 平方 1153.3 其余值围绕 35.4 左右。先算:不含 72.4 的 11 个值均值 = (461.3−72.4)/11 = 388.9/11 = 35.35 但 3σ 要用全样本算: 各值偏差(相对 38.44):−4.24, −3.34, −1.64, −3.54, −2.94, +33.96, −2.64, −3.84, −3.24, −2.34, −2.54, −3.64 平方:17.98, 11.16, 2.69, 12.53, 8.64, 1153.28, 6.97, 14.75, 10.50, 5.48, 6.45, 13.25 和 = 1263.68;样本方差 = 1263.68/11 = 114.88;s = 10.72 s
  • 3σ 界 = 38.44 ± 32.16 = [6.28, 70.60]
  • 72.4 > 70.60 → 剔除
  • 剔除后 11 个值均值 = 388.9 / 11 = 35.35 s

规则三(IQR 剔除):

  • 排序:34.2, 34.6, 34.8, 34.9, 35.1, 35.2, 35.5, 35.8, 35.9, 36.1, 36.8, 72.4
  • n = 12 → Q1 位置 = 0.25 × 11 + 1 = 3.75 → x₃ + 0.75(x₄ − x₃) = 34.8 + 0.75 × 0.1 = 34.875
  • Q3 位置 = 0.75 × 11 + 1 = 9.25 → x₉ + 0.25(x₁₀ − x₉) = 35.9 + 0.25 × 0.2 = 35.95
  • IQR = 35.95 − 34.875 = 1.075
  • 上界 = Q3 + 1.5 × IQR = 35.95 + 1.6125 = 37.56
  • 72.4 > 37.56 → 剔除(同时检查下界 = 34.875 − 1.6125 = 33.26,无低值被剔除)
  • 剔除后均值 = 35.35 s

三种规则对比:

规则 剔除结果 均值 特点
不剔除 — 38.44 s 被单点污染,高估 8.7%
3σ 剔除 72.4 35.35 s 需样本量足够;单个极端值会把 s 拉大,导致剔除不干净("掩蔽效应")
IQR 剔除 72.4 35.35 s 稳健,不受极端值影响,小样本更可靠

这个算例里 3σ 侥幸成功,但如果 72.4 变成 60,3σ 就可能剔除不掉(因为 s 会被它自己拉大)。 这就是为什么工时测量推荐用 IQR 或"三倍中位绝对偏差(MAD)"这类稳健统计量。

规则必须事前写在指标定义卡里,而且剔除记录要留痕。 事后挑数据删,是数据造假的第一步。


四、八个核心指标的公式与手算算例

4.1 OEE 及其三因子

公式与算例见 3.4 节算例 3-3(OEE = 75.45%)。这里补充三因子的解释:

因子 公式 本例 含义 常见改善手段
可用率 A 运行时间 / 负荷时间 90.00% 设备有没有在跑 SMED、TPM、备件管理
性能效率 P 实际产出 / 理论产出 86.42% 跑得够不够快 参数优化、短停消除、操作标准化
合格品率 Q 合格数 / 产出数 97.00% 跑出来的好不好 工艺能力、防错、首件确认

牢记:OEE 是三个独立问题的乘积,不是一个"设备好不好"的总分。 一个 OEE 75% 可能来自 A=95%、P=98%、Q=81%(质量问题是主因),也可能来自 A=80%、P=94%、Q=99%(停机是主因)——对策完全不同。

4.2 加权 OEE

见算例 3-2(70.11% vs 算术平均 72.81%)。

4.3 OTIF(准时足额交付率)

算例 4-1:100 个订单行的交付表现

组合 行数 占比
准时 + 足额(OTIF) 86 86%
准时 + 短少 7 7%
延误 + 足额 4 4%
延误 + 短少 3 3%
合计 100 100%

三个指标:

  • OTD(On Time Delivery,准时率)= (86 + 7) / 100 = 93%
  • OF(Order Fill,足额率)= (86 + 4) / 100 = 90%
  • OTIF(准时且足额)= 86 / 100 = 86%

为什么必须看 OTIF 而不是 OTD? 因为对客户来说,"准时到了但少了一半"和"没到"一样麻烦——生产线照样停。OTD 93% 看起来很好,但只有 86% 的客户真正满意。这两个数字相差的 7 个百分点,就是你的客户不满意但你的报表却说没问题的部分。

4.4 RTY(流通合格率)与 DPMO

算例 4-2:五工序串联的合格率

各工序一次通过率(FPY):0.96, 0.93, 0.98, 0.95, 0.97

RTY(Rolled Throughput Yield)= 各工序 FPY 连乘:

  • 0.96 × 0.93 = 0.8928
  • × 0.98 = 0.874944
  • × 0.95 = 0.831197
  • × 0.97 = 0.806261 → 80.63%

错误算法(各工序算术平均):

(0.96 + 0.93 + 0.98 + 0.95 + 0.97) / 5 = 4.79 / 5 = 95.80%

两者相差 15.17 个百分点! 这是制造业最经典的指标失真之一:"我们的合格率是 95.8%"这句话,几乎可以肯定是错的。

DPMO 与西格玛水平:

投入 1,000 件,逐工序追踪:

工序 投入 合格产出 缺陷数
1 1,000 960.0 40.00
2 960.0 892.8 67.20
3 892.8 874.9 17.86
4 874.9 831.2 43.75
5 831.2 806.3 24.94
合计 — 806.3 193.75
  1. 总缺陷数 = 193.75
  2. 总机会数 = 1,000 × 5 = 5,000
  3. DPMO = 193.75 / 5,000 × 10⁶ = 38,750
  4. 长期西格玛水平 Z_long = Φ⁻¹(1 − 38,750/10⁶) = Φ⁻¹(0.96125) ≈ 1.766
  5. 短期西格玛水平 Z_short = Z_long + 1.5 = 3.27σ

一个细节(体现专业性): 若用 Poisson 近似(RTY ≈ e^(−DPU_total)),DPU_total = 193.75/1,000 = 0.19375 → e^(−0.19375) = 82.38%,与连乘的 80.63% 差 1.75 个百分点。差异来自"缺陷在单位上非随机分布"的假设偏离。实务中应以连乘法为准,Poisson 近似仅用于快速估算。

4.5 库存周转率与 DOS

算例 4-3:库存改善的资金释放

假设(以企业实际财务口径为准):

  • 年销售成本 COGS = 12,000 万元
  • 期初库存 2,100 万元,期末库存 2,700 万元 → 平均库存 = (2,100 + 2,700) / 2 = 2,400 万元

计算:

  1. 周转次数 = 12,000 / 2,400 = 5.0 次/年
  2. 库存天数 DOS = 365 / 5.0 = 73 天

改善方案:库存降到 2,000 万元

  1. 新周转次数 = 12,000 / 2,000 = 6.0 次/年
  2. 新 DOS = 365 / 6.0 = 61 天
  3. 释放资金 = 2,400 − 2,000 = 400 万元
  4. 按资金成本 6%/年估算(以企业实际资金成本为准)→ 年节省 24 万元

注意:降库存不能只看资金收益,还要评估缺货风险。 正确做法是配套计算安全库存(见配套阅读中的库存模型文章),并在看板上同时监控"库存天数"与"缺货次数"这对对冲指标。

4.6 设备可靠性 MTBF / MTTR / 可用率

算例 4-4:一条产线的设备可靠性

观察期 30 天 × 20 h/天 = 600 h;期间故障 5 次,总维修时间 20 h。

  1. MTBF(平均无故障工作时间)= (600 − 20) / 5 = 116 h
  2. MTTR(平均修复时间)= 20 / 5 = 4 h
  3. 固有可用率 A = MTBF / (MTBF + MTTR) = 116 / 120 = 96.67%

改善的两个方向:

方向 目标 手段 难度
提 MTBF 故障间隔从 116 h → 150 h 预防性维护(PM)制度化、备件质量、操作标准化、根因分析 中~高(长期工程)
降 MTTR 修复时间从 4 h → 2.5 h 备件可得性、维修 SOP、故障树快速定位、维修技能矩阵 低~中(见效快)

MTTR 从 4 h 降到 2.5 h 的效果验证:

  • 总维修时间 = 5 × 2.5 = 12.5 h
  • 新 MTBF = (600 − 12.5) / 5 = 117.5 h
  • 新可用率 = 117.5 / 120 = 97.92%(提升 1.25 pp)
  • 释放运行时间 = 20 − 12.5 = 7.5 h/月 = 90 h/年

IE 的建议:先降 MTTR,再提 MTBF。 因为降 MTTR 的手段(备件、SOP、技能)通常投入小、见效快、易验证;提 MTBF 是长期工程,需要可靠性数据积累。

4.7 劳动生产率

算例 4-5:人均产出与工时效率

假设:月产出 45,000 件,直接人工 25 人,当月 26 个工作日 × 8 h = 208 h/人。

  1. 总直接工时 = 25 × 208 = 5,200 h
  2. 人均月产出 = 45,000 / 25 = 1,800 件/人·月
  3. 工时效率 = 45,000 / 5,200 = 8.65 件/工时

改善后:产出 48,000 件,人工 24 人

  1. 人均月产出 = 48,000 / 24 = 2,000 件/人·月(+11.1%)
  2. 总工时 = 24 × 208 = 4,992 h
  3. 工时效率 = 48,000 / 4,992 = 9.61 件/工时(+11.1%)

注意两个坑:

  1. 人均产出上升不一定是真的效率提升。 如果产出增长来自加班(工时不变但实际投入增加),或来自外协(把内部工序外包),人均产出会虚高。必须与工时效率交叉验证。
  2. 劳动生产率要与质量、安全指标一起看。 单纯追效率常导致返修率上升或安全隐患。

4.8 计划达成率:总量掩盖结构

算例 4-6:为什么"达成 95%"还不够

型号 计划产量 实际完工 达成率
A 500 480 96.0%
B 400 400 100.0%
C 300 260 86.7%
合计 1,200 1,140 95.0%

三种口径:

  • 总量达成率 = 1,140 / 1,200 = 95.0%
  • 按计划量加权的型号达成率 = (500×0.96 + 400×1.00 + 300×0.867) / 1,200 = (480 + 400 + 260) / 1,200 = 95.0%(与总量一致,因为分母相同)
  • 型号齐套率(所有型号都达标)= 1 / 3 = 33.3%

关键洞察: 如果你的产品需要 A、B、C 三件配套才能出货(如一台设备需要三种部件),那么真正能出货的比例不是 95%,而受制于最短板 C(86.7%)。总量达成率在配套生产场景下系统性高估交付能力。

正确做法: 对配套型产品,主指标用**"齐套率"或"按订单的完整交付率(OTIF)"**,总量达成率仅作参考。


五、数据采集:从纸单到自动,以及如何判断数据可不可信

5.1 数据成熟度四级

级别 特征 典型采集方式 数据可信度(参考区间,以实测为准)
L0 无数据 凭经验判断,无记录 口头、记忆 不可用
L1 纸单 + 事后录入 有记录,但滞后且易丢失 纸质工单、Excel 事后补录 低(完整性、及时性均差)
L2 结构化人工录入 系统表单 + 必填校验 工位终端、PDA、扫码枪 中(及时性好,准确性依赖人)
L3 自动采集 设备/传感器直采,无需人工 PLC、SCADA、IoT、MES 自动报工 高(需验证传感器与口径)

IE 的实务判断:不要一上来就追求 L3。 很多改善项目在 L1 阶段就能完成 80% 的分析——你需要的是"数据能回答问题",不是"数据很先进"。

建议路径:

  1. 先用 L1/L2 把指标体系与口径跑通(这个阶段会暴露大量定义问题)
  2. 跑通后再投资 L3 自动化,否则你会把错误的口径自动化成"高效地产生错误数据"

5.2 采集方案选型对照

方案 初期投入 维护成本 时效性 数据丰富度 适用
纸质表单 + Excel 极低 高(人工录入) 差(天级) 低 试点、临时分析
共享 Excel / 在线表格 低 中 中(小时级) 中 小团队、单产线
扫码/PDA 报工 中 低 好(分钟级) 中 工序流转、批次追踪
MES 自动报工 高 中 好(秒~分钟级) 高 多工序、需追溯
PLC/SCADA 直采 高 低 优(秒级) 高(设备侧) 设备状态、节拍、能耗
IoT 传感器加装 中~高 中 优 高 老设备改造、能耗、环境
视觉/机器视觉 高 中 优 高 计数、缺陷检测、动作分析

选型三问:

  1. 这个数据用来做什么决策?(日报 → 小时级足够;实时调度 → 需要秒级)
  2. 不采这个数据会怎样?(不影响决策的数据,不要采——采集本身也是成本)
  3. 数据错了能被发现吗?(有没有交叉校验机制)

5.3 数据质量四维度:乘法效应

算例 5-1:三个 90% 加起来不是 90%

某厂 MES 停机数据的质量抽查结果:

维度 定义 实测 说明
完整性 应记录 6,000 条,实际录入 5,460 条 91% 有 540 条停机未记录
及时性 应 1 h 内录入,实际 1 h 内录入的比例 82% 18% 的记录是事后补录
准确性 抽核 200 条,18 条原因分类错误 91% 停机原因填写不规范
一致性 MES 与 ERP 产量差异 99.4% 较好

综合可信度(乘法模型):

0.91 × 0.82 × 0.91 × 0.994 = 0.675 → 67.5%

这是全篇最反直觉的一个数字:四个看起来都"80%~99%"的质量维度,乘起来只有 67.5%。 意味着你在看板上看到的每一个停机数字,都有约三分之一的概率是不完整、不及时或不准确的。

管理含义:

  1. 数据质量必须用乘法模型汇报,不能用平均分。 平均分 90.8% 会让人误以为"还不错"。
  2. 改善数据质量要找最短板。 上例中及时性 82% 是瓶颈,把它提到 92%,综合可信度立刻升到 75.7%(+8.2 pp);而把已经很好的一致性从 99.4% 提到 99.9%,只带来 +0.3 pp。
  3. 数据质量本身应该上墙。 在指标看板旁边放一个"数据健康度"小组件,让所有人知道这个数字能信几分。

六、看板设计:让数字变成行动

6.1 图表选型决策表

你想表达什么 推荐图表 避免
趋势(随时间变化) 折线图(配 MA7)、控制图 柱状图(点数多时不可读)
对比(A vs B) 柱状图、条形图 饼图(无法精确比较)
构成(部分占整体) 堆叠柱状图、瀑布图 3D 饼图(严重失真)
分布(数据散布形态) 直方图、箱线图、散点图 只看均值
关系(两变量相关) 散点图 + 趋势线 —
达成 vs 目标 子弹图(Bullet Chart)、仪表盘 大号数字 + 红绿灯
异常定位 帕累托图(降序柱 + 累计线) 平均分配的饼图
流程/时序 甘特图、泳道图 表格
多层次占比 树图(Treemap) 多层饼图

三条硬性规则:

  1. 不超过 5 种颜色,且颜色必须有语义(如:达标=灰,预警=黄,报警=红,目标线=蓝)。
  2. 不用 3D 效果、不用渐变、不用装饰性图标。 每一个视觉元素要么承载信息,要么删掉。
  3. 数字要有对比基准。 单独一个"OEE 75.4%"没有意义;"75.4%(目标 85%,上月 78.1%)"才有意义。

6.2 控制图:看板上必须有的一条线

大部分看板只画"实际值 vs 目标线",这有个致命缺陷:无法区分正常波动与真正异常。结果就是要么天天报警(狼来了),要么真异常被当成噪声。

解法是把控制限画上去。 对于单值数据(如每日 OEE、每日产量),用 X-MR 图(单值-移动极差图)。

算例 6-1:OEE 日值的 X-MR 控制图

20 天的 OEE 日值(%):

72.1, 74.5, 73.2, 75.8, 71.0, 76.4, 74.9, 73.6, 75.1, 62.3,
73.8, 74.2, 72.9, 75.5, 73.1, 74.7, 76.0, 72.4, 74.0, 73.5

X 图(单值图):

  1. 均值 X̄ = 1,469.0 / 20 = 73.45%
  2. 移动极差 MR(相邻两值之差的绝对值,共 19 个): 2.4, 1.3, 2.6, 4.8, 5.4, 1.5, 1.3, 1.5, 12.8, 11.5, 0.4, 1.3, 2.6, 2.4, 1.6, 1.3, 3.6, 1.6, 0.5
  3. MR̄ = 60.4 / 19 = 3.179
  4. 估计标准差 σ̂ = MR̄ / d₂ = 3.179 / 1.128 = 2.818(d₂ = 1.128 为 n = 2 时的常数)
  5. UCL = X̄ + 3σ̂ = 73.45 + 8.45 = 81.90%
  6. LCL = X̄ − 3σ̂ = 73.45 − 8.45 = 65.00%

判异:第 10 天 OEE = 62.3% < LCL 65.00% → 判为异常。

MR 图(移动极差图):

  1. UCL_MR = D₄ × MR̄ = 3.267 × 3.179 = 10.38
  2. MR 值 12.8(第 9→10 天)和 11.5(第 10→11 天)均超过 10.38 → 判为异常

两图同时判异,确认第 10 天存在特殊原因(如设备故障、停产、大批量返工),需追溯。

剔除异常点后重算控制限(这一步很多人忘了做):

  1. 剔除 62.3 后:n = 19,和 = 1,469.0 − 62.3 = 1,406.7 → 新 X̄ = 74.04%
  2. MR 重算:去掉 12.8 和 11.5,新增 |73.8 − 75.1| = 1.3 → 新 MR 和 = 60.4 − 24.3 + 1.3 = 37.4,MR 个数 = 18
  3. 新 MR̄ = 37.4 / 18 = 2.078;新 σ̂ = 2.078 / 1.128 = 1.842
  4. 新 UCL = 74.04 + 5.53 = 79.57%;新 LCL = 74.04 − 5.53 = 68.51%

注意新控制限变窄了(±8.45 → ±5.53)。 这意味着过程其实比想象的更稳定,剔除特殊原因后,日常波动只有 ±5.5 个百分点。这个信息对后续设定目标值很有价值:如果目标设 85%,它远在控制限之外,说明靠"日常管理"达不到,必须做系统性改善(而不是靠现场努力)。

这是控制图给看板带来的最大价值:区分"该由现场处理"和"该由系统改善解决"的问题。

6.3 异常触发规则

红绿灯只看单点阈值是不够的。推荐叠加以下规则(源自控制图判异准则的简化版):

规则 触发条件 说明 误报率
R1 单点超过 3σ 控制限 明显异常 极低
R2 连续 9 点位于中心线同侧 过程发生偏移 低
R3 连续 6 点递增或递减 趋势性变化(如刀具磨损) 低
R4 连续 3 点中有 2 点超过 2σ 早期预警 中
R5 单点超过目标值 ± 固定阈值 业务规则(最直观) 取决于阈值设定

实务建议:

  • R1 + R2 + R5 是最小可用组合,同时启用不会造成过多误报
  • R4 作为预警(黄色)而非报警(红色)
  • 所有触发都要有"确认/关闭"动作,否则告警会堆积成噪音

6.4 看板布局:一屏原则与三层钻取

一屏原则: 每个角色的主看板必须能在一屏内看完,不需要滚动、不需要切换。

5 秒原则: 看板的核心信息(是否达标、哪里异常)应在 5 秒内被识别。测试方法:让不熟悉的人看 5 秒,然后问他"今天有没有问题"。

三层钻取:

第一层:状态层(红/黄/绿 + 关键数字)  ← 5 秒
         ↓ 点击异常项
第二层:归因层(帕累托、损失分解、TOP3)← 30 秒
         ↓ 点击具体项
第三层:明细层(原始记录、时间序列、关联单据)← 5 分钟

不要让第一层就堆满细节。 最常见的错误是把明细表当看板——那是报表,不是看板。

典型产线日看板布局示例:

┌──────────────────────────────────────────────────────────┐
│  A 线 · 白班 · 2026-09-05          数据健康度: 88%  🟢    │
├───────────┬───────────┬───────────┬──────────────────────┤
│ 产量达成   │    OEE    │    FPY    │     停机时长          │
│  1,140/   │   75.4%   │   97.0%   │      45 min          │
│  1,200    │ 目标 85%  │ 目标 98%  │    目标 ≤30 min      │
│   🟡 95%  │   🔴      │   🟡      │      🔴              │
├───────────┴───────────┴───────────┴──────────────────────┤
│  近 20 天 OEE 趋势(含 UCL/LCL/目标线/MA7)                │
│  [控制图区域]                                             │
├──────────────────────────────────────────────────────────┤
│  今日停机原因帕累托(TOP5 + 累计线)                       │
│  换型 18min ████████ 40%                                 │
│  故障 15.8min ███████ 35%                                │
│  待料 6.8min ███ 15%                                     │
│  其他 4.5min ██ 10%                                      │
├──────────────────────────────────────────────────────────┤
│  ⚠ 待办:① 换型超时 3 次 → IE 张工 · 今日 16:00 前反馈    │
│         ② 第 10 天 OEE 异常 → 已完成根因,待关闭          │
└──────────────────────────────────────────────────────────┘

看板底部那个"待办区"是最容易被忽略却最重要的部分。 没有它,看板就是一块显示数字的海报。

6.5 看板三问与责任人矩阵

看板 谁看 多久看一次 看完做什么 不达标时找谁
L4 工位看板 操作工、班组长 每 1~2 h 调整节拍、呼叫支援 班组长
L3 产线日看板 车间主任、IE、设备、质量 每班/每日 分配改善任务、开停机分析会 对应工程师
L2 部门周看板 部门经理 每周 资源调配、跨部门协调 部门经理
L1 月度经营看板 厂级管理层 每月 投资决策、目标调整 厂长

每一块看板都必须有一个"所有者" ——负责口径维护、数据质量、看板更新。没有所有者的看板会在三个月内变成过期数据。


七、五大反模式与指标"游戏化"的破解

7.1 五大反模式

反模式 表现 后果 对策
虚荣指标 指标只会变好,从不暴露问题 掩盖问题 加入"不达标也能显示"的指标;用控制图暴露波动
单指标考核 只考一个数字 必然被博弈 用指标组合(见 7.2)
指标通胀 屏幕上有 40 个指标 等于没有指标 每层限 5~15 个,定期清理
滞后指标为主 只看月度财务结果 无法实时干预 至少 50% 是过程指标(前置指标)
指标不退役 三年前的指标还在墙上 与当前战略脱节 每半年评审一次,强制淘汰

7.2 用"对冲指标"破解游戏化

核心思想:任何被考核的指标,都要配一个能暴露其副作用的对冲指标。

主指标 可能的博弈行为 对冲指标
设备利用率 ↑ 过量生产、WIP 堆积 WIP 周转天数、在制资金占用
产量达成率 ↑ 提前生产不需要的型号 库存天数、呆滞物料金额
OEE ↑ 只做容易的产品、拒绝换型 换型次数、产品覆盖度、OTIF
单位成本 ↓ 降低检验强度、推迟维护 客户退货率、故障停机时长
人均产出 ↑ 过度加班、外包内部工序 加班工时占比、外协金额、安全事故数
交付周期 ↓ 插队、挤压小订单 小订单准时率、订单排队公平度
库存 ↓ 缺货频发 缺货次数、紧急采购金额

规则:主指标与对冲指标必须同时上墙、同时汇报。 只汇报主指标的报告,应被视为不完整。

7.3 前置指标 vs 滞后指标

类型 定义 例子 作用
滞后指标(Lagging) 结果发生后才能测量 月度不良率、客户退货率、OEE、成本 评价结果
前置指标(Leading) 预示未来结果的过程量 PM 完成率、首件确认执行率、换型演练次数、培训覆盖率 预测与干预

IE 应主动提高前置指标的占比。 理由很简单:滞后指标变差时,损失已经发生;前置指标变差时,你还有机会。

一个经典例子: 设备可用率是滞后指标;PM(预防性维护)计划完成率是它的前置指标。如果 PM 完成率连续两个月低于 85%,几乎可以肯定未来 3~6 个月故障停机会上升。看板上应该同时显示这两个指标,并在前置指标恶化时提前行动。


八、落地路线与 40 项检查清单

8.1 十二周落地路线

阶段 周次 关键动作 交付物
诊断 W1–W2 盘点现有报表与指标,识别口径冲突 指标现状清单、冲突点清单
定义 W3–W4 为核心指标填写定义卡(12 要素) 指标定义卡(8~15 张)
基线 W5–W6 用历史数据回算,验证公式与数据源 基线值、数据质量评估报告
原型 W7–W8 做一个产线的看板原型,跑两周 可交互原型、用户反馈
试点 W9–W10 正式上线试点看板,配套行动规则与责任人 上线看板、行动记录
推广 W11–W12 复制到其他产线/车间,建立评审机制 全厂看板体系、评审制度

不要跳过 W5–W6(基线验证)。 我见过的失败项目中,超过一半是在这个阶段发现"公式算出来的数和实际对不上",而此时如果已经上线,信任就毁了。

8.2 检查清单(40 项)

A. 指标设计(10 项)

  • 每个上墙指标都有完整的定义卡(12 要素填齐)
  • 上层指标能通过下层指标解释(指标树已建立)
  • 每层指标数量在建议范围内(L1 58 / L2 1015 / L3 812 / L4 35)
  • 时间类指标同时定义了 P50 / P90 / 达标率
  • 比率类指标明确了聚合规则(加权方式)
  • 每个指标都有唯一责任人(到岗位,不到部门)
  • 每个指标都有目标值 + 预警阈值 + 报警阈值
  • 每个指标都有明确的行动规则(超限做什么、多久内做)
  • 每个被考核指标都配了至少 1 个对冲指标
  • 前置指标占比不低于 30%

B. 口径与公式(8 项)

  • 分子、分母的"含什么/不含什么"已写死
  • 多系统取数已明确唯一数据源(避免三套数字)
  • 跨零点班次的日期归属规则已明确
  • 异常值剔除规则已事前定义,且剔除有留痕
  • 累计 vs 移动平均的使用场景已区分
  • 所有 OEE 类指标的分母口径已声明(日历/计划/负荷)
  • 型号/工序合并时的加权方式已验证(与算术平均对比过)
  • 公式在至少 3 组历史数据上做过回算验证

C. 数据质量(8 项)

  • 四维度(完整性/及时性/准确性/一致性)已有测量方法
  • 综合可信度用乘法模型计算并展示
  • 数据质量的最短板已识别并有改进计划
  • 关键数据有交叉校验机制(如 MES 产量 vs 入库数)
  • 人工录入字段有必填校验与可选值约束
  • 传感器/自动采集设备有定期校准记录
  • 数据缺失时有明确的"补录/标注"流程,不留空
  • 数据健康度在看板上可见

D. 看板设计(8 项)

  • 满足一屏原则(无需滚动即可看完)
  • 通过 5 秒测试(不熟悉的人能看出是否有问题)
  • 趋势类图表已画上控制限(UCL/LCL),不止画目标线
  • 颜色不超过 5 种,且颜色有语义
  • 无 3D、渐变、装饰性元素
  • 每个数字都有对比基准(目标 / 上期 / 同期)
  • 支持三层钻取(状态 → 归因 → 明细)
  • 底部有"待办/责任人/时限"区域

E. 运营与治理(6 项)

  • 每块看板有明确所有者,负责口径维护与更新
  • 有告警的确认/关闭机制,无堆积僵尸告警
  • 每半年进行一次指标评审,强制淘汰过时指标
  • 指标变更有版本记录与通知机制
  • 使用方(班组长、操作工)参与过设计评审
  • 有看板使用情况的反馈渠道(数字看不懂?指标没用?)

小结

做数据看板,技术是最后一环,前两环是定义和信任。六个核心结论:

第一,指标定义卡是地基。 12 个要素填不完,后面所有工作都会返工。其中分母定义与聚合规则最易出错——三条产线的 OEE,算术平均 72.81% 与加权 70.11% 差 2.7 个百分点;五工序的合格率,算术平均 95.80% 与实际流通合格率 80.63% 差 15.17 个百分点。

第二,分母必须写死。 同一现场,OEE 可以是 75.45%(负荷时间口径)或 70.74%(计划时间口径)或 23.58%(日历时间口径),全都正确。混用口径比没有指标更糟。

第三,均值会系统性掩盖长尾。 交付提前期均值 8.8 天看起来达标,实际 P90 是 16.8 天、达标率只有 73.3%。时间类指标必须 P50 + P90 + 达标率三件套。

第四,数据质量是乘法不是加法。 四个维度 91%、82%、91%、99.4%,乘起来只有 67.5%。改善要找最短板,不是平均分。

第五,看板上必须画控制限。 算例 6-1 中,剔除异常点后控制限从 ±8.45 收窄到 ±5.53,这个信息告诉你:85% 的目标在日常管理范围之外,必须做系统性改善。没有控制限的看板,要么天天狼来了,要么真异常被当噪声。

第六,任何被考核的指标都要配对冲指标。 主指标与对冲指标同时上墙,是破解"指标游戏化"最有效的手段。

最后一句: 看板的目的不是显示数字,是改变行为。如果一个看板上线三个月后,没有任何一个决策因为它而改变,那它就是一块昂贵的屏幕。


配套阅读

  • OEE 设备综合效率:三个因子背后的真实产能 — 本文第 3.4 与 4.1 节的详细展开
  • SPC 统计过程控制:控制图判异与过程能力 Cpk — 第 6.2 节 X-MR 图的方法基础
  • 标准工时与工时测量:从秒表到宽放率 — 第 3.6 节异常值剔除规则的完整背景
  • 工业工程师的 Excel 实战手册:30 个技法 — 本文所有算例的表格实现方法
  • 供应链与库存模型基础:安全库存与订货策略 — 第 4.5 节库存天数与安全库存的配套计算
  • Python for IE:数据处理与分析的实用路径 — 从 Excel 走向自动化分析的下一步
  • IE 软件地图:Excel / Python / CAD / 仿真 / ERP-MES — 第 5.2 节采集方案选型的工具参考
  • 质量管理七项原则:从 ISO 9001 条文到车间动作 — 第 2.1 节指标体系与战略对齐的原则来源
  • 可靠性与 FMEA/FTA:MTBF、MTTR 与维修策略 — 第 4.6 节设备可靠性指标的方法延伸
  • 运筹学在工业工程中的落地:从建模到求解 — 指标树与资源分配的优化建模基础

相关阅读

  • SQL 工业工程数据分析实战:从 MES 取数到指标看板:IE 日常有 60% 的时间花在等数据上。本文从真实取数场景出发,讲透 SQL 核心语法(S…
  • OEE 设备综合效率:定义、算法、达标线与常见误用:用完整算例讲清 OEE 三大因子与时间口径,拆解六大损失,给出世界级达标线与 MTBF/MT…
  • TPM 全员生产维护完全指南:OEE、自主保全与零故障的八根支柱:设备一停,全线的产出就没了。本文讲透 TPM 完整体系:OEE 三要素的时间分解与六大损失(…
  • 工业工程必备软件地图:从 Excel 到 FlexSim,每个阶段该学什么:按学习阶段给出 IE 的软件全景图:Excel、统计分析、仿真建模、CAD、企业系统,并给出…
  • 运筹学在工业工程里的落地:线性规划、排队论与仿真:从产品组合的线性规划算例讲到影子价格与瓶颈判断,详解 M/M/1 与 M/M/c 排队模型算…
相关文章
GB/T 工时标准完全指南:用国标体系建立可信的标准工时

GB/T 工时标准完全指南:用国标体系建立可信的标准工时

标准工时不是掐秒表掐出来的数,而是有国标依据的科学测定结果。本文讲清 GB/T 工时标准体系、标准工时四要素、宽放率与评定系数的取法、四种测定方法对比,以及企业如何搭建可信的工时标准库。

MES 落地方法论完全指南:从选型到上线,避开 80% 项目踩的坑

MES 落地方法论完全指南:从选型到上线,避开 80% 项目踩的坑

MES 不是买套软件装上就行,70% 的项目失败在落地。本文讲清 MES 的 11 个功能模块、与 ERP/SCADA 的层级关系、六步实施法、数据采集策略、IE 在其中的角色,以及最常见的五大失败根因。

仿真方法论完全指南:用数字孪生前的第一步把产线跑明白

仿真方法论完全指南:用数字孪生前的第一步把产线跑明白

仿真不是画动画,而是用统计实验回答'如果这样改,会怎样'。本文讲清离散事件仿真原理、建模七步与 V&V 验证、随机分布与输出分析、主流软件对比,以及在产线/仓储中的落地套路。

产能规划完全指南:算清产线到底能产多少、该扩多少

产能规划完全指南:算清产线到底能产多少、该扩多少

产能不是设备铭牌上的数,而是扣除了停机、换型、良率后的真实产出。本文讲清设计/有效/实际三种产能、产能计算、扩展策略(领先/滞后/同步)、季节性调节手段,并给出产能规划的完整步骤与指标。

价值工程(VE)完全指南:用功能分析把成本砍半而不降质

价值工程(VE)完全指南:用功能分析把成本砍半而不降质

价值工程不是一味压价,而是追问'这个功能值不值这个钱'。本文讲清价值公式 V=F/C、功能评价三种方法、VE 七步工作程序与 FAST 图,并用零件简化案例展示如何降本 40% 而不减性能。

物料搬运分析完全指南:把看不见的搬运浪费挖出来

物料搬运分析完全指南:把看不见的搬运浪费挖出来

搬运不直接增值,却常占工厂成本的 20%—50%。本文系统讲清搬运活性理论、20 条搬运原则、SHA 系统分析法、设备选型与布局协同,并给出可落地的改善路径。

目录
当前文章没有目录
Copyright © 2002 CUMT All Rights Reserved. Powered by 中国矿业大学工业工程系.
粤ICP备2024349181号-3