平均数骗了你多久?——层别法五步实战,揪出真正的问题源

作者:卓越质量智库 发布时间:2026/8/27 阅读 50
目前评级: ★★★☆☆ 我要评级 等效 8 人评分

一、不良率 1.8% 的报表,为什么客户还在投诉

某汽车零部件企业的冲压车间,月度质量例会上总会上演同一幕:质量经理把 PPT 翻到"本月不良率 1.8%,与上月持平"那一页,会议室里一片平静,散会。可就在同一个月,客户连着两次退货,原因都是毛刺超标。车间主任委屈:报表上明明写着不良率在控制范围内啊?

质量经理老李决定较一次真。他让检验员把最近两周的 856 件不良品记录全部导出来,按班次、机台、模具、材料批次、操作工五个维度分别统计。结果让他后背发凉:按班次分,白班不良率 1.1%,夜班 3.2%;按机台分,3 号压机不良率 6.8%,其余机台平均不到 1%;再把"夜班"和"3 号压机"两个维度交叉起来看,夜班 3 号压机的不良率高达 11.5%——全车间的不良,超过六成集中在这一个交叉点上。

总不良率 1.8% 没有造假,但它把真相稀释了。平均数把所有差异抹平,让"问题到底出在哪"变得不可见。这是质量管理中最常见、也最隐蔽的认知陷阱:报表上的每个数字都是真的,据此得出的结论却可能完全错误。

平均数误导决策,通常有三种形态:一是分组差异被抹平,好组和差组混在一起,谁也看不出来;二是样本结构失衡,某组数据量特别大,把平均数整个拖向自己一边;三是异常值拉偏,个别极端数据让平均数失真。而要拆穿平均数制造的假象,靠的正是 QC 七大工具中最朴素、也最容易被忽视的一个——层别法。

二、层别法:把数据"分开看"的功夫

层别法(Stratification),又叫分层法,是 QC 七大工具(旧七大手法)之一,也是其余六个工具的前置动作。它的原理只有一句话:按不同类别把数据分开,再分别观察。画柏拉图之前要先分层,做直方图之前要先分层,控制图报警之后更要分层——数据不分层,后面所有分析都可能建立在错误的前提上。

为什么必须分层?因为任何一组质量数据,都是多种因素共同作用的结果。如果把不同班次、不同机台、不同批次的数据混在一起统计,等于把"正常的波动"和"异常的信号"搅成一锅粥,彼此抵消、互相稀释。举个极端的例子:甲设备合格率 95%,乙设备合格率 75%,两台合并统计是 85%——单看这个数字,你既看不出甲设备其实很稳定,也看不出乙设备已经失控。分层的作用,就是先把混合的数据拆回各自的"同质组",让差异显形。

更极端的情况是所谓"辛普森悖论":合并数据时得出的结论,与分层后每个组内的结论完全相反。统计史上有过一个著名案例:两家医院治疗同一种病,合并统计时 A 院治愈率更高;可把病人按病情轻重分层后,轻症、重症两组里都是 B 院治愈率更高——原因是 A 院收治的轻症病人比例大,把整体数字抬上去了。质量场景里同样会出现这种反转:某供应商总不良率看着更低,但按物料类别分层后,恰恰是它在关键物料上不良率最高。不层别,你连"结论反了"都不知道。

层别的维度,业界习惯归纳为"人机料法环测"六个方向,再辅以时间、供应商、批次等。具体怎么分,取决于你想回答什么问题:

维度 常见分层项目 典型要回答的问题
班次、操作工、技能等级、新老员工 不良是不是集中在某个人或某个班次?
机台、模具、刀具、工装、夹具 是不是某台设备或某套模具的问题?
材料批次、供应商、存放时长 是不是某批来料或某家供应商的问题?
工艺参数、作业方法、调试方式 是不是某种作业方法的问题?
温湿度、洁净度、季节、照明 是不是环境条件变化引起的?
量具、检验员、测量方法 是不是测量环节的差异,而非产品本身?
时间 小时、班次、星期、月份 问题是不是随时间周期性出现?

这里要特别提醒"测"这个维度:它最容易被忽略,却最常给出假线索。有时候"不良率上升"不是产品变差了,而是换了检验员、量具没有校准、或者判定标准被放宽收紧了。先排除测量因素,再去追究生产因素,顺序不能反。

三、层别法五步实战

回到老李的冲压车间。把层别法拆成五个步骤,每一步都有明确产出,照着做就能落地。

第一步:明确要回答的问题。 层别不是"把数据分分类"就完事,而是带着问题去分。问题要具体到"不良集中在哪个维度",而不是笼统的"为什么有不良"。老李的问题就是:毛刺不良到底集中在哪?是人的问题、机的问题,还是料的问题?

第二步:穷举候选维度,按差异假设筛选。 先用人机料法环测把能想到的维度全部列出来,再逐个问自己:这个维度上,各组之间有没有可能存在差异?如果某台设备是全新的、所有人操作手法完全一致,那"设备""人员"两个维度就先放一放,把精力留给最可能有差异的维度。筛选时可以给每个候选维度简单打分:差异可能性高、近期有过变化(换模、换人、换料、调参)的维度排前面。老李的候选维度是五个:班次、机台、模具、材料批次、操作工。模具和材料批次因为近期刚换过模、刚进过新批次料,被标记为"重点怀疑对象"。注意:这一步宁多勿少,一时看不出差异的维度先保留,等数据出来再排除,而不是事先凭感觉砍掉。

第三步:设计数据收集,保证每个层别都有足够样本。 层别法最怕"想分析的时候才发现数据没记全"。如果检验记录里没有机台号、没有班次、没有材料批次,事后神仙也分不了层。所以数据收集要提前设计:记录表单上必须包含你打算分层用的全部字段,而且要确保每个层别里样本量足够——一般建议每个层别至少 30 个数据点,否则结论的偶然性太大。老李让检验员补录了全部字段,856 件不良品每一件都能追溯到机台、班次和批次。

第四步:分层对比,先单维、后交叉。 这是核心一步。先把每个维度单独分层,用不良率或不良数量做对比,找出差异明显的维度;再把两个可疑维度交叉起来看,锁定问题坐标。老李先做单维分层,得到一张清晰的对比表:

层别维度 分组 不良率 判定
班次 白班 1.1% 差异显著
班次 夜班 3.2% 差异显著
机台 3 号压机 6.8% 差异显著
机台 其余四台 0.4%~1.0% 差异显著
模具 模具 A/B/C 1.5%~2.1% 差异不大
材料批次 三个批次 1.6%~2.0% 差异不大

单维结果指向班次和机台,但还不能确定是"夜班整体差"还是"3 号机整体差",于是再做"班次 × 机台"交叉层别:白班 3 号机不良率 1.2%,夜班 3 号机不良率 11.5%,其他组合都在 1% 上下——问题坐标瞬间锁定。交叉层别是这个步骤里价值最大的动作:单维分层只能告诉你"夜班差"或"3 号机差",交叉之后才知道真正的问题坐标是"夜班 × 3 号机"。

第五步:验证与行动。 锁定层别之后,马上对嫌疑对象做根因分析(鱼骨图、5Why 都用得上),制定措施,然后用层别法再验证一次:措施实施后,重新分层统计,看"夜班 3 号机"的不良率是否真的降下来了。老李最终查出的根因是:3 号压机的模具导柱磨损,夜班温度低、润滑不到位时磨损加剧,毛刺随之增多。更换导柱、调整夜班润滑频次后,重新分层统计,3 号压机不良率从 6.8% 降到 0.9%,总不良率从 1.8% 降到 0.7%。客户退货从此消失。这里有个细节值得借鉴:验证期不要只盯总不良率,要继续按原来的维度分层跟踪两周以上——如果总不良率降了但"夜班 3 号机"这一格没有明显变化,说明措施没打中根因,需要回到第四步重新排查,而不是被总数字的改善迷惑。

这五步里,前两步决定方向,第三步决定数据质量,第四步决定分析深度,第五步决定改善闭环——任何一步跳过,层别法都会打折。

四、层别法的五个常见误区

误区一:维度选错,层了半天白层。 最典型的错误是"习惯性分层":永远只按班次分,或者永远只按机台分,从不根据问题特点调整维度。某电子厂焊接不良率居高不下,质量部按班次、按线别分了两个月都没结论,后来有人提出按"焊料批次"分层,一次就锁定了一批锡膏——问题从头到尾都在料上,与人和设备无关。层别的维度必须服务于要回答的问题:问"是不是料的问题"却只按班次分层,当然找不到答案。对策:每次层别前,先把人机料法环测六个方向的候选维度列全,再按差异假设筛选,而不是用固定套路。

误区二:只层别、不行动,把分析当结论。 很多团队分层分析做得漂亮,PPT 汇报完就结束了,问题原封不动。层别只是手段,锁定差异层别后必须跟进根因分析和改善措施,否则就是"用分析代替行动"。衡量层别法有没有用的唯一标准,是问题坐标上的数字有没有降下来。

误区三:层别过细,样本量不足,结论失真。 维度分得太细,每个格子里的样本只剩三五个,一个异常点就能让不良率翻几倍,得出的结论全是噪音。一般原则:每个层别至少 30 个样本;样本不够时,先合并相近层别,或延长数据收集周期,而不是急着下结论。

误区四:只看单维,忽视交叉效应。 这是最隐蔽的坑。单维看,白班、夜班都不算差,可"夜班 × 换模后第一小时"却差得离谱——这种交互效应单维分层永远看不见。数据量大时,务必对可疑维度做交叉层别;数据量有限时,至少要对"最可疑的两个维度"做一次交叉验证。

误区五:分层结果不复测,措施无效还以为是层别错了。 措施实施后必须重新分层对比,用数据确认改善有效。有些企业措施上了、效果没出来,不反思措施本身,反而怀疑当初分层分错了——其实往往不是层别错,而是措施没有真正触及根因,或执行打了折扣。复测是层别法闭环的最后一环,缺了它,前面四步都白做。

五、一句话总结

层别法是让数据开口说话的第一步——先分开看,再下结论,别让平均数替你思考。


数据先分层,真相才现身。

知识编号:5.2.4

版本:v20260827

作者:卓越质量智库 卓越质量智库致力于为质量管理从业者提供系统化的专业知识、方法论与实战工具,助力企业质量能力持续提升。