过程明明很稳定,控制图上偶尔还是冒出一个出界点;过程明明已经跑偏了,图上却安安静静。这两件事,到底多久才会发生一次?
搞质量管理的人,几乎天天和控制图打交道,却很少有人能回答清楚:一张控制图,到底要等多久才会报警?
这个"等待时间",有一个专门的名字——平均运行长度ARL(Average Run Length)。它是衡量一张控制图灵不灵的核心标尺。这篇文章用大白话把它讲透。
01 控制图上的两个经典困惑
画过控制图的人,多半都遇到过两种窝火的情况。
第一种:过程明明一切正常,操作者也很小心,可图上就是时不时蹦出一个超出控制限的点。你派人去查,设备、原料、工艺都好好的——这是不是误报?
第二种:过程其实已经悄悄漂移了,比如均值偏移了一个量,可连续十几个点都落在控制限之内,图上看着"一切正常"。等你发现时,不合格品已经流出一批了。
这两件事不是错觉,而是控制图固有的统计特性。问题是:误报多久来一次?失控后又要多久才被发现?这两个"多久",就是ARL要回答的。
02 ARL 是什么:从现在开始,平均等几个点才报警
在2026版《AIAG VDA SPC》手册9.2.4.2节介绍到,平均运行链长(ARL)是指在预定的过程位置或过程变差条件下,直至出现导致失控状态的控制限超出为止,所抽取样本的预期平均数量。顾名思义,就是控制图上从一次抽样开始,到第一次触发判异为止,平均连续抽了多少个点子。
打个比方。它就像等公交车:每经过一辆车,它"是末班车(判异)"的概率是固定的 p。那么平均要等几辆才等到?答案是1/p。
这就是ARL 最核心的公式:ARL=1/p,其中p是单次抽样被判异的概率。
只要每次抽样是否报警相互独立、且单次报警概率p保持不变,等待报警的次数就服从几何分布,它的期望正好是1/p。这个简单的公式,是后面所有计算的总钥匙。
但关键来了:p不是一个数,而是取决于过程此刻是"好"还是"坏"。于是ARL也分成了两个。
03 受控看ARL0:为什么±3σ下是370
当过程受控(本应正常)时,我们关心的是:平均多少个点会误报一次?这个数叫ARL0。此时单次报警概率就是误报概率,也就是第一类风险α(生产方风险)。所以:
ARL0=1/α,以最经典的±3σ控制限、且只采用"点出界即判异"这一条准则为例。标准正态分布落在+3σ以外的单侧概率是0.00135,落在−3σ以外也是0.00135,两侧加起来:α=2×0.00135=0.0027
代入公式:ARL0=1/0.0027≈370
这就是质量管理里那个著名的"370"的来历。它的意思是:正常生产时,平均每抽370 个子组,才会出现一次误报警。换个角度说,误报其实没那么频繁——这正是人们愿意用±3σ限的原因。
顺带说一句直觉:ARL0越大越好。过程本来就正常,谁也不希望三天两头被误报折腾去排查。
04 失控看ARL1:同样漂移,n=4要等6次,n=16只要1次
当过程失控(已经漂移)时,关心的就变成:平均抽几次才能把它抓出来?这个数叫ARL1。
此时单次报警概率是"正确检出"的概率,等于1−β。β是第二类风险(使用方风险),即过程已经异常却仍落在控制限内、被漏掉的概率。所以:ARL1=1/(1−β)
新版SPC手册里给了个子组大小为2和10的比较,但是因为涉及到子组均值控制限计算的时候会用到开根号,所以我们把子组大小改为4和16来进行模拟。假设某个质量特性真实均值μ=0、标准差σ=1,控制限按±3σ设在样本均值x̄上。现在均值悄悄向上漂移了1个单位(μ'=1)。
情形一:子组样本量n=4。此时样本均值的标准差σx̄=σ/√n=0.5,控制限为±1.5。漂移后,均值中心移到了1,但控制限没变——新分布的大部分面积仍然挤在±1.5之内。算下来漏报概率β≈0.8413,单次只有0.1587的概率被检出:
ARL1=1/0.1587≈6.301
也就是说,漂移之后平均要再抽6次才能报警。这6次里,不合格品可能已经做出来不少了。
情形二:子组样本量n=16。σx̄缩小到0.25,控制限也跟着收窄到±0.75。漂移后的分布又高又窄,中心1已经基本跑到控制限外面去了。漏报概率β骤降到0.1587,单次检出概率高达 0.8413:
ARL1=1/0.8413 ≈1.189
几乎第一次抽样就报警了。
注意一个容易被忽略的点:从n=4到n=16,ARL0仍然是370,因为控制限还是±3σ、α没变;变的只有ARL1,从6.301一路降到1.189。
05一张表看懂:n到底改变了什么
把两个情形并排放在一起,结论一目了然:
读懂这张表,就抓住了样本量的本质:子组越大,样本均值越集中、控制限越窄,对同样大小的漂移就越灵敏;而误报水平ARL0保持不变。代价只是——每次抽样要测更多件,成本更高。
06 判异准则加得越多越好吗
除了扩大子组,另一个调灵敏度的旋钮是"判异准则"。除了最基础的"点出界",人们还会叠加"连续 9 点在同侧""连续 6 点递增递减"等多条规则。
直觉上,规则越多越灵敏。但它是一把双刃剑:
只用准则一(点出界):判异条件严格,α小,ARL0大(约370),误报少;但相应地,对漂移的ARL1也偏大。好比"只有一项罪名成立才定罪"——谨慎,但容易漏判。
叠加准则二、三、四……:判异条件变松,只要满足任一模式就报警,α随之变大。结果是ARL0变小(误报变频繁),同时ARL1也变小(报警变快)。好比"八项罪名任一成立即定罪"——灵敏,但更容易冤枉人。
这里没有免费的灵敏度:加准则,误报和漏报是一起向同一个方向动的。选几条准则,本质是在"少误报"和"快报警"之间做权衡,而不是越多越好。
总结
回过头看,控制图好不好用,最后就落在两个数上:
受控时看ARL0=1/α,越大越好——别让正常过程三天两头误报;
失控时看ARL1=1/(1−β),越小越好——漂移了要尽快抓出来。
调子组样本量,可以在不增加误报的前提下加快报警;调判异准则,则会让两个 ARL 一起变化。设计一张控制图,说到底,就是在这两个互相拉扯的数字之间,找到适合自己产品和成本的那个平衡点。
下次再看到图上一个孤点出界、或一连十几个点"稳如泰山"时,你心里就该有这两个数在转了。