学习笔记

 

  • 假设验证和P值

药物是否有效为假设前提,如果通过已知的实验前后各自的均值和标准差计算出试验后均值偏离的概率过大,那么我们认定实验无效,反之认定实验有效。

 

  • 单侧检验和双侧检验

上述考虑到的是双侧检测,考虑到具体实例中值相对实验前的均值偏小,通过单侧检验计算得到均值偏离的概率对比双侧检验还需要除以2

  • z-statistic和t-statistic

样本量比较大比如超过30,使用z-statistic,yang样本量比较小时使用t-statistic

z-statistic计算公式如下:

                                  Z-dist=\frac{\bar{x}-\mu _{\bar{x}}}{\frac{\sigma }{\sqrt{n}}}

t-statistic计算公式如下:

                                  T-dist=\frac{\bar{x}-\mu _{\bar{x}}}{\frac{s}{\sqrt{n}}}

其中样本量s大大小于\sigma

  • 第一型错误

根据前文提到的假设验证和P值,我们拒绝了零假设即认为零假设是错误的(根据概率值过低),然而,实际上零假设是正确的。这就是第一型错误。

  • 小样本假设检验

已知小样本,判断大样本是否能达到犯第一型错误的风险足够要求小!

根据小样本,我们可以计算样本均值、标准差和t分布值,并且计算双侧检验小于t分布值概率,比较犯第一型错误的概率。

  • t-统计量置信区间

根据区间概率值和小样本,我们可以计算得出(或者查表)t分布的范围。而后根据t分布公式计算\mu所在的范围,即为t统计量的置信区间。

  • 大样本占比假设

跟小样本假设检验类似,我们已知大样本的均值、P等可以计算出大样本标准差,进而计算小样本对应的t分布。而根据给出的显著性水平可以计算达到要求对应的t分布值,进而判断,小样本是否符合要求。

  • 随机变量之差的方差

对于独立随机随机变量X和Y,它们的期望和方差有如下运算关系:

                                                                                                 E(X)=\mu _{x}

                                                                                        Var(X)=E((x-\mu _{x})^{2})=\sigma_{x}^2

如果有Z=X+Y,则有:

                                       E(Z)=E(X+Y)=E(X)+E(Y)

                                       Var(Z)=Var(X)+Var(Y)=\sigma _{x}^2+\sigma _{y}^2

如果Z=X-Y,则有:

                                       E(Z)=E(X)-E(Y)=\mu _{x}-\mu _{y}

                                       Var(Z)=Var(X)+Var(Y)=\sigma _{x}^2-\sigma _{y}^2

  • 样本均值之差的分布

对于总样本方差\sigma _{x}^2,可以用以下公式计算样本均值之差的方差:

\sigma _{\bar{x}}^2=\frac{\sigma _{x}^2}{n}

其中n样本总数

对于独立随机变量Y,同上

Z=X-Y,则有:

\sigma _{\bar{z}}^2=\sigma _{\bar{x}}^2+\sigma _{\bar{y}}^2=\frac{\sigma _{x}^2}{n}+\frac{\sigma _{y}^2}{m}

其中m为随机变量Y的样本总数,在可汗课堂中使用了m,不过个人认为应该同用n比较合适,因为这里m必然等于n,才有可能计算X和Y的样本均值之差的差的方差。

  • 均值之差的置信区间

举例:

我们想检验一种低脂节食能否帮助人们减肥。100个随机抽取的人采用低脂节食,另100个随机抽取的肥胖者作为对照,对照组少吃几乎等量的食物。这样,第二组就是普通节食的对照组,第一组是低脂节食实验组。4个月后,第一组的体重减轻均值是9.31磅,标准差是4.67磅。对照组体重减轻均值是7.40磅,标准差是4.04磅。

第一组:均值=9.31,标准差=4.67
第二组:均值=7.40,标准差=4.04

均值之差 = 9.31-7.40=1.91
我们要在1.91周围找到95%的置信区间。

随机抽样均值之差分布 近似服从正态分布,该分布均值为: 1.91,标准差为:根号下(4.674.67/100+4.044.04/100)=0.617

该分布的95%置信区间的Z值为 1.96,也就是均值左右1.96个标准差距离的面积为95%,1.96*0.617=1.21
95%置信区间下: 1.91-1.21 < 抽样均值差 < 1.91+1.21 即:0.7 <抽样均值差<3.12
零假设:低脂节食对减肥无效(相对于普通节食)
备择假设:低脂节食对减肥有效(相对于普通节食)
零假设下:低脂组的总体均值 - 对照组的总体均值 = 0 即低脂组的抽样均值 - 对照组的抽样均值 = 0
也就是说总体均值差=0 即: 随机抽样均值差=0
备择假设下:低脂组的总体均值 - 对照组的总体均值 > 0 即低脂组的抽样均值 - 对照组的抽样均值 > 0
也就是说总体均值差>0 即: 随机抽样均值差>0
假设检验的显著性水平5%
零假设下:抽样均值差1.91达到(均值差为0)的95%范围内,择我们拒绝零假设,选择备择假设。
均值差分布近似服从正太分布,大样本下,查Z分布表可得:单侧95%的Z值为1.65
标准差为:0.617 则1.65*0.617 = 1.02
所以如果假设低脂节食对减肥无效,随机抽样的均值差只有5%的概率大于1.02.
1.91 > 1.02,概率只有5%,所以拒绝零假设,选择备择假设。
 

  • 总体占比的比较

举例:

选举中,我想知道男人和女人都给某些候选人的占比是否有显著不同?
男性中 投给某候选人的占比为p1,不投给这个候选人的占比为1-p1. 投给此候选人为1,不投给此候选人为0.
女性中 投给这个候选人的占比为p2,不投给这个候选人的占比为1-p2. 投给此候选人为1,不投给此候选人为0.

这两个都是伯努利分布。

男:均值=p1,方差=p1*(1-p1)

女:均值=p2,方差=p2*(1-p2)

所求:p1 和 p2 是否有显著差异?也就是 p1 - p2的分布。

我们希望求出一个95%的置信区间,为此我们调查了1000个男性 和 1000个女性投票者。

样本男:642投了此候选人,记为1 358未投此候选人,记为0. p1 = 0.642 方差=0.6420.358
样本女:591投了此候选人,记为1 409未投此候选人,记为0. p2 = 0.591 方差=0.5910.409

由于样本容量大,所以随机抽样分布 接近 正太分布:

随机抽样均值分布男 总体均值=样本均值=0.642 总体方差=方差=0.6420.358/1000(大容量样本下 我们用样本方差估计总体方差)
随机抽样均值分布女 总体均值=样本均值=0.591 总体方差=方差=0.5910.409/1000(大容量样本下 我们用样本方差估计总体方差)

随机抽样均值差分布 分布均值=0.642-0.591=0.051 方差=0.6420.358/1000 + 0.5910.409/1000=0.022X0.022
差值分布95%的置信区间 查表可知 z=1.96 d=1.96X0.022=0.043
所以 有95%机率均总体占比之差落在样本占比之差左右0.043范围内 即:p1-p2的95%置信区间是 0.008到0.094

假设检验:
零假设:投票男女占比无差别 即总体差值 p1-p2 = 0
备择假设:投票男女占比有差别 即总体差值 p1-p2 != 0
使用显著性水平5%进行检验

零假设下:总体差值分布的均值为0,样本差值=0.051,求出0.051距离0有几个标准差?

查Z表可知:正太分布下,2.5%的z值=1.96。如果0.051距离0的标准差数>1.96,说明样本概率小于5%,这样就可以拒绝零假设。

零假设下:p1=p2,方差有更好的估计值,即 方差=2p(1-p)/1000 p=(642+591)/2000 则标准差=0.0217
0.051/0.0217=2.35
2.35>1.96,所以拒绝零假设

参考:https://blog.csdn.net/xdy1120/article/details/88537542

 

  • 问题:

 

 

注:

  1. 显著性水平(Signicificance level):统计学中的术语,指总体样本落在置顶区间内可能犯错误的概率。
  2. 二项分布标准差的计算方法为:\sigma =\sqrt{p(1-p))}
Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐