
1.Question
在学习统计的过程中,置信区间这个词总是无处不在,总是让人稀里糊涂的。统计软件以及代码中总是自动帮助我们输出这个数值,但是要想精通统计分析,彻底搞懂置信区间是必不可少的。鄙人通过学习其他UP主的视频[1],记录下置信区间的学习内容。
2. Answer
要想弄明白置信区间,我们首先搞清楚什么是点估计和区间估计
2.1 点估计
假如我们想知道B站视频的平均时长是多少?最准确的做法就是将B站所有的视频时长都统计下来,然后求平均数。这里我们认为所有B站视频时长为一个总体(Population),而要求的B站全部视频时长的平均数为总体的参数(Parameter)。但是B站视频很多,全部统计比较费事费力,所以此时我们就可以从B站中抽取一个样本(这个样本中包含多个视频时长的平均值),这个样本的平均值被称为估计量(estimator),一般来说,当没办法获取总体参数的时候,我们会用样本估计量去估计总体的参数(平均值、方差、偏度、峰度....)(这个例子中是平均值),这个过程我们称作点估计!

(参考up主“小周同学_慢慢学”[1])
点估计就是用样本的估计量来估计总体的参数(平均值、方差、偏度、峰度...)。
这里我们有10个样本,所以可以求得10个样本的平均值,虚线就是真实的总体的平均值,这里代表所有B站视频时长的平均值,而点估计就是用这些点来估计这条虚线。但是点估计有缺陷,这10个样本计算出来的均值都是在总体均值附近波动的,很难刚好落在这条虚线上,此外如果我们抽取的样本如果有极端值,比如我们某个样本抽取的都是短视频,那我们计算这个样本得到的视频时长的均值可能只有1分钟,如果抽取的样本中都是公开课,那可能这个样本中的视频时长均值就是半小时。不论是短视频还是公开课,我们很可能通过点估计估计出来的总体均值与真实的总体均值相差较远。为了解决这个问题,我们采用另外一种方法,叫做区间估计。

(参考up主“小周同学_慢慢学”[1])
2.2 区间估计
点估计中,我们是通过样本的估计量,并用这些估计量来估算我们总体的均值,也就是上图中的点,而在区间估计中,计算的不仅仅是这些点,而是以这些点计算一个区间,这个区间有很大的概率将我们总体均值覆盖到我们区间之内,也就是我们这些区间它有很大概率能将我们中间这条虚线包含进来。比如圈起来这个点,它虽然离总体均值比较远,但是通过这一个点所构造出来的区间,还是可以把总体均值给覆盖在内的。这就是区间估计得主要思想。

(参考up主“小周同学_慢慢学”[1])
我们不是用一个点,而是用围绕这个点的区间来估计出一个很大概率包含总体参数的范围。
那该如何选取置信区间呢?
2.3 置信区间
选取置信区间面临2个问题:
一是我们选择的置信区间范围如果很大,好处就是它覆盖总体真实参数的概率会很大,但是坏处就是提供的信息会比较少。比如通过置信区间估计计算出来B站平均时长是在30秒到1个小时之内,这个估计范围就很大,并且正确率很高,但是这估计没啥用。
二是如果置信区间范围比较小,置信区间覆盖总体真实参数的概率就比较小,但是如果这个估计比较准确,它所提供的信息量就会比较大。
所以,置信区间覆盖总体真实参数的概率和提供的信息是此消彼长的。没有办法全都要。
2.3.1 如何选取置信区间
一般来说我们会采用95%的置信区间(人为设置的)。这里的95%就是置信度。
95%的置信区间:依照某一方法构造出来的所有置信区间中,约有95%的执行期间覆盖了总体真实值。(例如在B站视频中进行100次抽样,并求样本均值,构造100个置信区间。其中有95个置信区间覆盖了总体均值的真实值。)
错误理解:95%的置信区间含义并不是说我们总体真实值有95%的概率落在置信区间内。而是我们构造所有置信区间当中,有95%的置信区间能够覆盖总体真实值!错误的原因就在于,这里我们将总体真实值当做一个变量来进行估计,它其实是讨论真实值出现在某一个位置的概率,这是错误的,因为总体参数是常数,是不变的,无论是采用点估计还是区间估计,无论是估计还是不估计,它不增不减,所以不能说总体参数有95%的概率落在这个置信区间内。要么在,要么不在,一旦给定置信区间,在或者不在已经确定了。变化的是我们多次抽样所构造的置信区间。而在多次抽样所构造的众多置信区间中,约有95%的置信区间覆盖了总体真实值。(本质就是总体真实值是固定的,而置信区间是随机的)
通过置信区间,我们虽然不能100%确定B站视频时长具体是多少,但是通过给定一个置信区间,我们能有很大概率说B站视频平均时长在某个范围内的。
2.3.2 如何确定置信界限?
到底该如何确定置信区间的宽度,下面的叫做置信下限,上面的叫做置信上限。下限和上限的计算公式都是以样本均值为起点,加减一个数值来构造的置信界限。

(参考up主“小周同学_慢慢学”[1])
这里的可靠因子(依赖因子)都是根据95%置信度查表,如果总体方差σ已知,那这里的可靠因子就可以查正态分布表,也就是Z值表。如果总体方差未知,此时就要用样本的方差替代总体的方差,此时的依赖因子就变为Tα/2,就需要去查学生T分布表。随着置信度的增加,我们的可靠因子也会增加(正态分布第一象限中X轴的值)。
最右边这个是总体的标准差除以根号n,也就是样本平均值X拔的标准误。那为啥置信区间和标准误有关呢?主要因为置信区间和(1)总体的离散程度和(2)样本量有关。而离散程度用总体的标准差衡量,这就是分子部分,而样本量就是分母中的n。

(参考up主“小周同学_慢慢学”[1])
至于为什么和总体离散程度有关,这里举个例子:假如B站的视频全部都是在10-12分钟之间,那意味着总体的离散程度是非常窄的。我们构造的95%置信区间再宽也宽不过2分钟。这是因为总体视频的时长的波动就是在10~12分钟之间的,意味着我们置信区间它的宽度比较窄。假如B站视频的时长是从10秒到2个小时之间十分分散,此时要构造一个95%的置信区间来覆盖总体均值的话,这个区间就需要很宽,要不然达不到95%的置信度。所以置信区间和总体的离散区间是正相关的,所以我们会在分子部分乘以总体的标准差。
那为什么和样本量有关呢?这里举2个极端的例子:
一个例子是我们的样本量是2,也就是说我们从所有B站视频中抽取两个视频,那这两个视频它可能都是短视频,所以视频时长的均值也就是几十秒;假如抽取的两个视频都是公开课视频,那这两个视频的均值,将是一个小时左右;当然我们也可能取到一个是短视频,一个是公开课,这样样本均值可能就在总体均值附近,那这些都是有可能的。此时,我们就发现当我们的样本量特别小的时候,抽取样本后所求得的样本均值,它的波动是非常大的。假如我们要用这些样本均值来构造置信区间,我们这个置信区间的范围就需要很大,才能保证我们有很大的把握去覆盖我们的总体均值。
另一个极端的情况:假如我们抽取了总体中99%的观测值作为一个样本,我们会发现无论我们怎么抽取样本,比如我们从视频时长最短的一个视频开始抽取,或者从视频时长最长的那个抽取,但是由于样本是99%的总体观测值,那我们抽取出来的样本均值都是在总体均值附近波动的,且波动范围非常小,几乎是接近总体均值的,这就意味着假如我们想通过这个样本来构造一个置信区间,我们只需要选取一个很小的置信区间,它就可以有95%的概率覆盖总体均值。
所以上述这两个极端的例子告诉我们,随着样本量增加,我们样本均值波动的范围它会越来越小。那我们根据这个样本所构造的置信区间也就越来越小。这也就是为什么我们要在分母中除以样本量n。
2.3.3 公式推导
当样本量n大于30的时候,无论总体它分布是什么样的,我们样本量的均值总是趋于正态分布的(中心极限定理)。
情景1:总体方差已知(用Z分布)
样本均值x拔服从的是总体均值为μ,方差是总体方差除以样本量n的正态分布,这里我们将样本均值标准化,标准化的过程就是让样本均值减去它所服从的正态分布的均值μ,之后再除以这个正态分布的标准差,也就是σ除以根号n,这个标准化后的数据它就是一个Z统计量。称它为Z统计量是因为它是服从标准正态分布的。但是它的均值为0,标准差为1,有了这个Z统计量之后,我们就可以查得标准正态分布的概率分布表。通过查询表格,会发现Z统计量,在-1.96~1.96之间的概率为95%。

(参考up主“小周同学_慢慢学”[1])
也就意味着Z统计量在-1.96~1.96之间的概率为95%。这里把Z统计量替换成原来的公式,经过变换,可得到以下的式子。自然可以得到置信上限和下限。

(参考up主“小周同学_慢慢学”[1])
情景2:总体方差未知(用T分布)
求解思路和上面类似,只是我们不知道总体的标准差,我们采用样本标准差s替代总体标准差,得到的标准化公式就是服从学生T统计量的。这个T统计量的自由度为n-1。此时同样可以去查表。去查自由度为n-1的学生T分布表。同样根据我们的置信度,依然可以得到上下界的两个可靠因子。然后通过公式变换,得到在方差未知的情况下,确定置信区间的公式。

(参考up主“小周同学_慢慢学”[1])
3.Reference
[1]. 网页链接