一元线性回归 —— 知识点详解


一、变量间关系的度量

1.1 两类变量关系

关系类型说明例子
函数关系确定性关系,一个变量完全由另一个决定S=πr2S = \pi r^2S=πr2
相关关系非确定性关系,变量间存在趋势但不完全决定身高与体重

1.2 相关系数(Pearson 相关系数)

定义公式:

r=∑i=1n(xi−xˉ)(yi−yˉ)∑i=1n(xi−xˉ)2⋅∑i=1n(yi−yˉ)2r = \frac{\sum_{i=1}^{n}(x_i - \bar{x})(y_i - \bar{y})}{\sqrt{\sum_{i=1}^{n}(x_i - \bar{x})^2 \cdot \sum_{i=1}^{n}(y_i - \bar{y})^2}}r=i=1n(xixˉ)2i=1n(yiyˉ)2i=1n(xixˉ)(yiyˉ)

等价计算式(便于计算):

r=n∑xiyi−∑xi∑yi[n∑xi2−(∑xi)2][n∑yi2−(∑yi)2]r = \frac{n\sum x_i y_i - \sum x_i \sum y_i}{\sqrt{\left[n\sum x_i^2 - \left(\sum x_i\right)^2\right]\left[n\sum y_i^2 - \left(\sum y_i\right)^2\right]}}r=[nxi2(xi)2][nyi2(yi)2]nxiyixiyi

推导过程:

Lxy=∑(xi−xˉ)(yi−yˉ)L_{xy} = \sum(x_i - \bar{x})(y_i - \bar{y})Lxy=(xixˉ)(yiyˉ)Lxx=∑(xi−xˉ)2L_{xx} = \sum(x_i - \bar{x})^2Lxx=(xixˉ)2Lyy=∑(yi−yˉ)2L_{yy} = \sum(y_i - \bar{y})^2Lyy=(yiyˉ)2

r=LxyLxx⋅Lyyr = \dfrac{L_{xy}}{\sqrt{L_{xx} \cdot L_{yy}}}r=LxxLyyLxy

其中展开 LxyL_{xy}Lxy

Lxy=∑(xi−xˉ)(yi−yˉ)=∑xiyi−nxˉyˉ=∑xiyi−(∑xi)(∑yi)nL_{xy} = \sum(x_i - \bar{x})(y_i - \bar{y}) = \sum x_i y_i - n\bar{x}\bar{y} = \sum x_i y_i - \frac{(\sum x_i)(\sum y_i)}{n}Lxy=(xixˉ)(yiyˉ)=xiyinxˉyˉ=xiyin(xi)(yi)

同理:

Lxx=∑xi2−(∑xi)2n,Lyy=∑yi2−(∑yi)2nL_{xx} = \sum x_i^2 - \frac{(\sum x_i)^2}{n}, \quad L_{yy} = \sum y_i^2 - \frac{(\sum y_i)^2}{n}Lxx=xi2n(xi)2,Lyy=yi2n(yi)2

性质与判断标准:

  • −1≤r≤1-1 \leq r \leq 11r1
  • ∣r∣|r|r 越接近 1,线性相关程度越强
  • ∣r∣|r|r 越接近 0,线性相关程度越弱

| ∣r∣|r|r 范围 | 相关程度 |
| --------------------- | -------- |
| 0.8≤∣r∣≤10.8 \leq |r| \leq 10.8r1 | 高度相关 |
| 0.5≤∣r∣<0.80.5 \leq |r| < 0.80.5r<0.8 | 中度相关 |
| 0.3≤∣r∣<0.50.3 \leq |r| < 0.50.3r<0.5 | 低度相关 |
| 0≤∣r∣<0.30 \leq |r| < 0.30r<0.3 | 不相关 |

1.3 相关系数的检验

原假设与备择假设:

H0:ρ=0(总体相关系数为零,不存在线性相关)H_0: \rho = 0 \quad \text{(总体相关系数为零,不存在线性相关)}H0:ρ=0(总体相关系数为零,不存在线性相关)
H1:ρ≠0H_1: \rho \neq 0H1:ρ=0

检验统计量:

t=rn−21−r2∼t(n−2)t = \frac{r\sqrt{n-2}}{\sqrt{1-r^2}} \sim t(n-2)t=1r2rn2t(n2)

推导过程:

H0H_0H0 成立的条件下,可以证明统计量 t=rn−21−r2t = \dfrac{r\sqrt{n-2}}{\sqrt{1-r^2}}t=1r2rn2 服从自由度为 n−2n-2n2ttt 分布。

证明思路(简要):样本相关系数 rrr 可以表示为:

r=LxyLxx⋅Lyyr = \frac{L_{xy}}{\sqrt{L_{xx} \cdot L_{yy}}}r=LxxLyyLxy

U=LxyLxxU = \dfrac{L_{xy}}{\sqrt{L_{xx}}}U=LxxLxyQ=Lyy−Lxy2LxxQ = L_{yy} - \dfrac{L_{xy}^2}{L_{xx}}Q=LyyLxxLxy2

可以证明,在 ρ=0\rho = 0ρ=0 的条件下:

  • ULyy/n∼N(0,1)\dfrac{U}{\sqrt{L_{yy}/n}} \sim N(0,1)Lyy/nUN(0,1),即 Uσ2\dfrac{U}{\sqrt{\sigma^2}}σ2U 标准化
  • Qσ2∼χ2(n−2)\dfrac{Q}{\sigma^2} \sim \chi^2(n-2)σ2Qχ2(n2)
  • UUUQQQ 独立

因此 t=U/σ2Q/[σ2(n−2)]=Un−2Q∼t(n−2)t = \dfrac{U/\sqrt{\sigma^2}}{\sqrt{Q/[\sigma^2(n-2)]}} = \dfrac{U\sqrt{n-2}}{\sqrt{Q}} \sim t(n-2)t=Q/[σ2(n2)]U/σ2=QUn2t(n2)

r=UU2+Qr = \dfrac{U}{\sqrt{U^2+Q}}r=U2+QU 的关系代入,化简得:

t=rn−21−r2t = \frac{r\sqrt{n-2}}{\sqrt{1-r^2}}t=1r2rn2

决策规则:∣t∣>tα/2(n−2)|t| > t_{\alpha/2}(n-2)t>tα/2(n2) 时,拒绝 H0H_0H0,认为线性关系显著。


二、一元线性回归

2.1 回归模型

总体回归模型:

Yi=β0+β1xi+εi,i=1,2,…,nY_i = \beta_0 + \beta_1 x_i + \varepsilon_i, \quad i = 1, 2, \ldots, nYi=β0+β1xi+εi,i=1,2,,n

其中:

  • β0\beta_0β0:总体截距(回归常数)
  • β1\beta_1β1:总体斜率(回归系数)
  • εi\varepsilon_iεi:随机误差项,假设 εi∼N(0,σ2)\varepsilon_i \sim N(0, \sigma^2)εiN(0,σ2),且相互独立

样本回归方程:

y^=β^0+β^1x\hat{y} = \hat{\beta}_0 + \hat{\beta}_1 xy^=β^0+β^1x

2.2 最小二乘法(OLS)推导 β^0\hat{\beta}_0β^0β^1\hat{\beta}_1β^1

目标函数:

使残差平方和最小:

Q(β0,β1)=∑i=1n(yi−β0−β1xi)2Q(\beta_0, \beta_1) = \sum_{i=1}^{n}(y_i - \beta_0 - \beta_1 x_i)^2Q(β0,β1)=i=1n(yiβ0β1xi)2

求偏导并令其为零:

∂Q∂β0=−2∑i=1n(yi−β0−β1xi)=0(1)\frac{\partial Q}{\partial \beta_0} = -2\sum_{i=1}^{n}(y_i - \beta_0 - \beta_1 x_i) = 0 \tag{1}β0Q=2i=1n(yiβ0β1xi)=0(1)

∂Q∂β1=−2∑i=1nxi(yi−β0−β1xi)=0(2)\frac{\partial Q}{\partial \beta_1} = -2\sum_{i=1}^{n}x_i(y_i - \beta_0 - \beta_1 x_i) = 0 \tag{2}β1Q=2i=1nxi(yiβ0β1xi)=0(2)

由方程(1)展开:

∑yi−nβ0−β1∑xi=0\sum y_i - n\beta_0 - \beta_1 \sum x_i = 0yinβ0β1xi=0

β0=∑yi−β1∑xin=yˉ−β1xˉ(3)\beta_0 = \frac{\sum y_i - \beta_1 \sum x_i}{n} = \bar{y} - \beta_1 \bar{x} \tag{3}β0=nyiβ1xi=yˉβ1xˉ(3)

将(3)代入方程(2):

∑xi(yi−(yˉ−β1xˉ)−β1xi)=0\sum x_i\left(y_i - (\bar{y} - \beta_1 \bar{x}) - \beta_1 x_i\right) = 0xi(yi(yˉβ1xˉ)β1xi)=0

∑xi[(yi−yˉ)−β1(xi−xˉ)]=0\sum x_i\left[(y_i - \bar{y}) - \beta_1(x_i - \bar{x})\right] = 0xi[(yiyˉ)β1(xixˉ)]=0

∑xi(yi−yˉ)=β1∑xi(xi−xˉ)\sum x_i(y_i - \bar{y}) = \beta_1 \sum x_i(x_i - \bar{x})xi(yiyˉ)=β1xi(xixˉ)

注意 ∑xi(yi−yˉ)=∑(xi−xˉ+xˉ)(yi−yˉ)=∑(xi−xˉ)(yi−yˉ)+xˉ∑(yi−yˉ)⏟=0=Lxy\sum x_i(y_i - \bar{y}) = \sum(x_i - \bar{x} + \bar{x})(y_i - \bar{y}) = \sum(x_i - \bar{x})(y_i - \bar{y}) + \bar{x}\underbrace{\sum(y_i - \bar{y})}_{=0} = L_{xy}xi(yiyˉ)=(xixˉ+xˉ)(yiyˉ)=(xixˉ)(yiyˉ)+xˉ=0(yiyˉ)=Lxy

同理 ∑xi(xi−xˉ)=Lxx\sum x_i(x_i - \bar{x}) = L_{xx}xi(xixˉ)=Lxx

因此:

β^1=LxyLxx=∑(xi−xˉ)(yi−yˉ)∑(xi−xˉ)2=∑xiyi−nxˉyˉ∑xi2−nxˉ2\boxed{\hat{\beta}_1 = \frac{L_{xy}}{L_{xx}} = \frac{\sum(x_i - \bar{x})(y_i - \bar{y})}{\sum(x_i - \bar{x})^2} = \frac{\sum x_i y_i - n\bar{x}\bar{y}}{\sum x_i^2 - n\bar{x}^2}}β^1=LxxLxy=(xixˉ)2(xixˉ)(yiyˉ)=xi2nxˉ2xiyinxˉyˉ

β^0=yˉ−β^1xˉ\boxed{\hat{\beta}_0 = \bar{y} - \hat{\beta}_1 \bar{x}}β^0=yˉβ^1xˉ

二阶条件验证(确认为最小值):

Hessian矩阵:

H=(∂2Q∂β02∂2Q∂β0∂β1∂2Q∂β1∂β0∂2Q∂β12)=(2n2∑xi2∑xi2∑xi2)H = \begin{pmatrix} \dfrac{\partial^2 Q}{\partial \beta_0^2} & \dfrac{\partial^2 Q}{\partial \beta_0 \partial \beta_1} \\[6pt] \dfrac{\partial^2 Q}{\partial \beta_1 \partial \beta_0} & \dfrac{\partial^2 Q}{\partial \beta_1^2} \end{pmatrix} = \begin{pmatrix} 2n & 2\sum x_i \\ 2\sum x_i & 2\sum x_i^2 \end{pmatrix}H=β022Qβ1β02Qβ0β12Qβ122Q=(2n2xi2xi2xi2)

∣H∣=4n∑xi2−4(∑xi)2=4[n∑xi2−(∑xi)2]=4nLxx>0|H| = 4n\sum x_i^2 - 4(\sum x_i)^2 = 4\left[n\sum x_i^2 - (\sum x_i)^2\right] = 4nL_{xx} > 0H=4nxi24(xi)2=4[nxi2(xi)2]=4nLxx>0

∂2Q∂β02=2n>0\dfrac{\partial^2 Q}{\partial \beta_0^2} = 2n > 0β022Q=2n>0,故为极小值。

2.3 回归系数的性质

(1)β^1\hat{\beta}_1β^1 的期望:

E(β^1)=E(LxyLxx)=1Lxx⋅E[∑(xi−xˉ)(Yi−Yˉ)]E(\hat{\beta}_1) = E\left(\frac{L_{xy}}{L_{xx}}\right) = \frac{1}{L_{xx}} \cdot E\left[\sum(x_i - \bar{x})(Y_i - \bar{Y})\right]E(β^1)=E(LxxLxy)=Lxx1E[(xixˉ)(YiYˉ)]

由于 Yi=β0+β1xi+εiY_i = \beta_0 + \beta_1 x_i + \varepsilon_iYi=β0+β1xi+εiE(Yi)=β0+β1xiE(Y_i) = \beta_0 + \beta_1 x_iE(Yi)=β0+β1xi

E(β^1)=1Lxx∑(xi−xˉ)⋅E(Yi−Yˉ)E(\hat{\beta}_1) = \frac{1}{L_{xx}} \sum(x_i - \bar{x}) \cdot E(Y_i - \bar{Y})E(β^1)=Lxx1(xixˉ)E(YiYˉ)

=1Lxx∑(xi−xˉ)(β0+β1xi−β0−β1xˉ)=β1Lxx∑(xi−xˉ)2=β1= \frac{1}{L_{xx}} \sum(x_i - \bar{x})(\beta_0 + \beta_1 x_i - \beta_0 - \beta_1 \bar{x}) = \frac{\beta_1}{L_{xx}} \sum(x_i - \bar{x})^2 = \beta_1=Lxx1(xixˉ)(β0+β1xiβ0β1xˉ)=Lxxβ1(xixˉ)2=β1

β^1\hat{\beta}_1β^1β1\beta_1β1 的无偏估计。

(2)β^0\hat{\beta}_0β^0 的期望:

E(β^0)=E(Yˉ−β^1xˉ)=β0+β1xˉ−β1xˉ=β0E(\hat{\beta}_0) = E(\bar{Y} - \hat{\beta}_1 \bar{x}) = \beta_0 + \beta_1 \bar{x} - \beta_1 \bar{x} = \beta_0E(β^0)=E(Yˉβ^1xˉ)=β0+β1xˉβ1xˉ=β0

β^0\hat{\beta}_0β^0β0\beta_0β0 的无偏估计。

(3)β^1\hat{\beta}_1β^1 的方差:

D(β^1)=σ2Lxx=σ2∑(xi−xˉ)2D(\hat{\beta}_1) = \frac{\sigma^2}{L_{xx}} = \frac{\sigma^2}{\sum(x_i - \bar{x})^2}D(β^1)=Lxxσ2=(xixˉ)2σ2

推导:

β^1=LxyLxx=∑(xi−xˉ)YiLxx\hat{\beta}_1 = \frac{L_{xy}}{L_{xx}} = \frac{\sum(x_i - \bar{x})Y_i}{L_{xx}}β^1=LxxLxy=Lxx(xixˉ)Yi

(注意:∑(xi−xˉ)Yˉ=Yˉ∑(xi−xˉ)⏟=0=0\sum(x_i - \bar{x})\bar{Y} = \bar{Y}\underbrace{\sum(x_i - \bar{x})}_{=0} = 0(xixˉ)Yˉ=Yˉ=0(xixˉ)=0,所以 β^1\hat{\beta}_1β^1 只是 YiY_iYi 的线性函数)

D(β^1)=1Lxx2∑(xi−xˉ)2D(Yi)=σ2Lxx2⋅Lxx=σ2LxxD(\hat{\beta}_1) = \frac{1}{L_{xx}^2} \sum(x_i - \bar{x})^2 D(Y_i) = \frac{\sigma^2}{L_{xx}^2} \cdot L_{xx} = \frac{\sigma^2}{L_{xx}}D(β^1)=Lxx21(xixˉ)2D(Yi)=Lxx2σ2Lxx=Lxxσ2

(4)β^0\hat{\beta}_0β^0 的方差:

D(β^0)=σ2(1n+xˉ2Lxx)D(\hat{\beta}_0) = \sigma^2\left(\frac{1}{n} + \frac{\bar{x}^2}{L_{xx}}\right)D(β^0)=σ2(n1+Lxxxˉ2)

推导:

β^0=Yˉ−β^1xˉ=∑[1n−(xi−xˉ)xˉLxx]Yi\hat{\beta}_0 = \bar{Y} - \hat{\beta}_1 \bar{x} = \sum\left[\frac{1}{n} - \frac{(x_i - \bar{x})\bar{x}}{L_{xx}}\right]Y_iβ^0=Yˉβ^1xˉ=[n1Lxx(xixˉ)xˉ]Yi

D(β^0)=σ2∑[1n−(xi−xˉ)xˉLxx]2D(\hat{\beta}_0) = \sigma^2 \sum\left[\frac{1}{n} - \frac{(x_i - \bar{x})\bar{x}}{L_{xx}}\right]^2D(β^0)=σ2[n1Lxx(xixˉ)xˉ]2

展开计算(利用交叉项求和为零),最终得:

D(β^0)=σ2(1n+xˉ2Lxx)D(\hat{\beta}_0) = \sigma^2\left(\frac{1}{n} + \frac{\bar{x}^2}{L_{xx}}\right)D(β^0)=σ2(n1+Lxxxˉ2)

2.4 σ2\sigma^2σ2 的估计

无偏估计量:

σ^2=Se2=∑i=1n(yi−y^i)2n−2=Qen−2\hat{\sigma}^2 = S_e^2 = \frac{\sum_{i=1}^{n}(y_i - \hat{y}_i)^2}{n-2} = \frac{Q_e}{n-2}σ^2=Se2=n2i=1n(yiy^i)2=n2Qe

其中 Qe=∑(yi−y^i)2Q_e = \sum(y_i - \hat{y}_i)^2Qe=(yiy^i)2 为残差平方和,n−2n-2n2 为自由度(因为估计了 β^0\hat{\beta}_0β^0β^1\hat{\beta}_1β^1 两个参数)。

QeQ_eQe 的计算公式:

Qe=Lyy−β^1Lxy=Lyy−Lxy2LxxQ_e = L_{yy} - \hat{\beta}_1 L_{xy} = L_{yy} - \frac{L_{xy}^2}{L_{xx}}Qe=Lyyβ^1Lxy=LyyLxxLxy2

推导过程:

Qe=∑(yi−y^i)2=∑[(yi−yˉ)−β^1(xi−xˉ)]2Q_e = \sum(y_i - \hat{y}_i)^2 = \sum\left[(y_i - \bar{y}) - \hat{\beta}_1(x_i - \bar{x})\right]^2Qe=(yiy^i)2=[(yiyˉ)β^1(xixˉ)]2

=∑(yi−yˉ)2−2β^1∑(xi−xˉ)(yi−yˉ)+β^12∑(xi−xˉ)2= \sum(y_i - \bar{y})^2 - 2\hat{\beta}_1\sum(x_i - \bar{x})(y_i - \bar{y}) + \hat{\beta}_1^2\sum(x_i - \bar{x})^2=(yiyˉ)22β^1(xixˉ)(yiyˉ)+β^12(xixˉ)2

=Lyy−2β^1Lxy+β^12Lxx= L_{yy} - 2\hat{\beta}_1 L_{xy} + \hat{\beta}_1^2 L_{xx}=Lyy2β^1Lxy+β^12Lxx

β^1=LxyLxx\hat{\beta}_1 = \dfrac{L_{xy}}{L_{xx}}β^1=LxxLxy 代入:

=Lyy−2Lxy2Lxx+Lxy2Lxx2⋅Lxx=Lyy−Lxy2Lxx= L_{yy} - 2\frac{L_{xy}^2}{L_{xx}} + \frac{L_{xy}^2}{L_{xx}^2} \cdot L_{xx} = L_{yy} - \frac{L_{xy}^2}{L_{xx}}=Lyy2LxxLxy2+Lxx2Lxy2Lxx=LyyLxxLxy2

2.5 回归方程的显著性检验(FFF 检验法)

总平方和的分解(ANOVA分解):

∑(yi−yˉ)2⏟SST=∑(y^i−yˉ)2⏟SSR+∑(yi−y^i)2⏟SSE\underbrace{\sum(y_i - \bar{y})^2}_{SST} = \underbrace{\sum(\hat{y}_i - \bar{y})^2}_{SSR} + \underbrace{\sum(y_i - \hat{y}_i)^2}_{SSE}SST(yiyˉ)2=SSR(y^iyˉ)2+SSE(yiy^i)2

SST=SSR+SSESST = SSR + SSESST=SSR+SSE

其中:

  • SST(总平方和)=Lyy= L_{yy}=Lyy,自由度 n−1n-1n1
  • SSR(回归平方和)=β^12Lxx=β^1Lxy= \hat{\beta}_1^2 L_{xx} = \hat{\beta}_1 L_{xy}=β^12Lxx=β^1Lxy,自由度 111
  • SSE(残差平方和)=Qe= Q_e=Qe,自由度 n−2n-2n2

推导 SST=SSR+SSESST = SSR + SSESST=SSR+SSE

∑(yi−yˉ)2=∑[(yi−y^i)+(y^i−yˉ)]2\sum(y_i - \bar{y})^2 = \sum\left[(y_i - \hat{y}_i) + (\hat{y}_i - \bar{y})\right]^2(yiyˉ)2=[(yiy^i)+(y^iyˉ)]2

=∑(yi−y^i)2+2∑(yi−y^i)(y^i−yˉ)+∑(y^i−yˉ)2= \sum(y_i - \hat{y}_i)^2 + 2\sum(y_i - \hat{y}_i)(\hat{y}_i - \bar{y}) + \sum(\hat{y}_i - \bar{y})^2=(yiy^i)2+2(yiy^i)(y^iyˉ)+(y^iyˉ)2

证明交叉项为零:

由于 y^i=β^0+β^1xi=yˉ+β^1(xi−xˉ)\hat{y}_i = \hat{\beta}_0 + \hat{\beta}_1 x_i = \bar{y} + \hat{\beta}_1(x_i - \bar{x})y^i=β^0+β^1xi=yˉ+β^1(xixˉ)

∑(yi−y^i)(y^i−yˉ)=β^1∑(yi−y^i)(xi−xˉ)\sum(y_i - \hat{y}_i)(\hat{y}_i - \bar{y}) = \hat{\beta}_1 \sum(y_i - \hat{y}_i)(x_i - \bar{x})(yiy^i)(y^iyˉ)=β^1(yiy^i)(xixˉ)

=β^1∑ei(xi−xˉ)= \hat{\beta}_1 \sum e_i (x_i - \bar{x})=β^1ei(xixˉ)

由正规方程 ∑ei=0\sum e_i = 0ei=0∑eixi=0\sum e_i x_i = 0eixi=0,所以 ∑ei(xi−xˉ)=∑eixi−xˉ∑ei=0\sum e_i(x_i - \bar{x}) = \sum e_i x_i - \bar{x}\sum e_i = 0ei(xixˉ)=eixixˉei=0

因此交叉项 =0= 0=0,分解成立。

FFF 检验统计量:

F=SSR/1SSE/(n−2)=MSRMSE∼F(1,n−2)F = \frac{SSR/1}{SSE/(n-2)} = \frac{MSR}{MSE} \sim F(1, n-2)F=SSE/(n2)SSR/1=MSEMSRF(1,n2)

F>Fα(1,n−2)F > F_\alpha(1, n-2)F>Fα(1,n2) 时,拒绝 H0:β1=0H_0: \beta_1 = 0H0:β1=0,认为回归方程显著。

2.6 ttt 检验法

检验统计量:

t=β^1σ^/Lxx=β^1Se2/Lxx∼t(n−2)t = \frac{\hat{\beta}_1}{\hat{\sigma}/\sqrt{L_{xx}}} = \frac{\hat{\beta}_1}{\sqrt{S_e^2/L_{xx}}} \sim t(n-2)t=σ^/Lxxβ^1=Se2/Lxxβ^1t(n2)

∣t∣>tα/2(n−2)|t| > t_{\alpha/2}(n-2)t>tα/2(n2) 时,拒绝 H0H_0H0

说明: FFF 检验与 ttt 检验在一元线性回归中是等价的,因为 F=t2F = t^2F=t2

2.7 决定系数 R2R^2R2

R2=SSRSST=1−SSESST=β^1LxyLyy=r2R^2 = \frac{SSR}{SST} = 1 - \frac{SSE}{SST} = \frac{\hat{\beta}_1 L_{xy}}{L_{yy}} = r^2R2=SSTSSR=1SSTSSE=Lyyβ^1Lxy=r2

含义: R2R^2R2 表示因变量的总变异中能被回归方程解释的比例。R2R^2R2 越接近 1,拟合效果越好。


三、利用回归方程进行预测

3.1 点预测

给定 x=x0x = x_0x=x0,预测值为:

y^0=β^0+β^1x0\hat{y}_0 = \hat{\beta}_0 + \hat{\beta}_1 x_0y^0=β^0+β^1x0

  • 这既是 E(Y∣x0)E(Y|x_0)E(Yx0) 的无偏估计,也是个别值 Y0Y_0Y0 的无偏预测。

3.2 均值 E(Y0)E(Y_0)E(Y0) 的置信区间

E(Y0)=β0+β1x0E(Y_0) = \beta_0 + \beta_1 x_0E(Y0)=β0+β1x0 的置信水平为 1−α1-\alpha1α 的置信区间为:

y^0±tα/2(n−2)⋅σ^1n+(x0−xˉ)2Lxx\hat{y}_0 \pm t_{\alpha/2}(n-2) \cdot \hat{\sigma}\sqrt{\frac{1}{n} + \frac{(x_0 - \bar{x})^2}{L_{xx}}}y^0±tα/2(n2)σ^n1+Lxx(x0xˉ)2

推导过程:

Y^0=β^0+β^1x0=Yˉ+β^1(x0−xˉ)\hat{Y}_0 = \hat{\beta}_0 + \hat{\beta}_1 x_0 = \bar{Y} + \hat{\beta}_1(x_0 - \bar{x})Y^0=β^0+β^1x0=Yˉ+β^1(x0xˉ)

E(Y^0)=E(Yˉ)+(x0−xˉ)E(β^1)=(β0+β1xˉ)+(x0−xˉ)β1=β0+β1x0E(\hat{Y}_0) = E(\bar{Y}) + (x_0 - \bar{x})E(\hat{\beta}_1) = (\beta_0 + \beta_1\bar{x}) + (x_0 - \bar{x})\beta_1 = \beta_0 + \beta_1 x_0E(Y^0)=E(Yˉ)+(x0xˉ)E(β^1)=(β0+β1xˉ)+(x0xˉ)β1=β0+β1x0

D(Y^0)=D(Yˉ)+(x0−xˉ)2D(β^1)=σ2n+(x0−xˉ)2σ2LxxD(\hat{Y}_0) = D(\bar{Y}) + (x_0 - \bar{x})^2 D(\hat{\beta}_1) = \frac{\sigma^2}{n} + \frac{(x_0 - \bar{x})^2 \sigma^2}{L_{xx}}D(Y^0)=D(Yˉ)+(x0xˉ)2D(β^1)=nσ2+Lxx(x0xˉ)2σ2

=σ2[1n+(x0−xˉ)2Lxx]= \sigma^2\left[\frac{1}{n} + \frac{(x_0 - \bar{x})^2}{L_{xx}}\right]=σ2[n1+Lxx(x0xˉ)2]

因此:

Y^0−E(Y0)σ^1n+(x0−xˉ)2Lxx∼t(n−2)\frac{\hat{Y}_0 - E(Y_0)}{\hat{\sigma}\sqrt{\dfrac{1}{n} + \dfrac{(x_0 - \bar{x})^2}{L_{xx}}}} \sim t(n-2)σ^n1+Lxx(x0xˉ)2Y^0E(Y0)t(n2)

3.3 个别值 Y0Y_0Y0 的预测区间

对于给定 x0x_0x0,个别值 Y0Y_0Y0 的预测水平为 1−α1-\alpha1α 的预测区间为:

y^0±tα/2(n−2)⋅σ^1+1n+(x0−xˉ)2Lxx\hat{y}_0 \pm t_{\alpha/2}(n-2) \cdot \hat{\sigma}\sqrt{1 + \frac{1}{n} + \frac{(x_0 - \bar{x})^2}{L_{xx}}}y^0±tα/2(n2)σ^1+n1+Lxx(x0xˉ)2

推导过程:

预测误差 e0=Y0−Y^0e_0 = Y_0 - \hat{Y}_0e0=Y0Y^0,其中 Y0Y_0Y0Y^0\hat{Y}_0Y^0 独立。

E(e0)=E(Y0)−E(Y^0)=(β0+β1x0)−(β0+β1x0)=0E(e_0) = E(Y_0) - E(\hat{Y}_0) = (\beta_0 + \beta_1 x_0) - (\beta_0 + \beta_1 x_0) = 0E(e0)=E(Y0)E(Y^0)=(β0+β1x0)(β0+β1x0)=0

D(e0)=D(Y0)+D(Y^0)=σ2+σ2[1n+(x0−xˉ)2Lxx]D(e_0) = D(Y_0) + D(\hat{Y}_0) = \sigma^2 + \sigma^2\left[\frac{1}{n} + \frac{(x_0 - \bar{x})^2}{L_{xx}}\right]D(e0)=D(Y0)+D(Y^0)=σ2+σ2[n1+Lxx(x0xˉ)2]

=σ2[1+1n+(x0−xˉ)2Lxx]= \sigma^2\left[1 + \frac{1}{n} + \frac{(x_0 - \bar{x})^2}{L_{xx}}\right]=σ2[1+n1+Lxx(x0xˉ)2]

标准化:

Y0−Y^0σ^1+1n+(x0−xˉ)2Lxx∼t(n−2)\frac{Y_0 - \hat{Y}_0}{\hat{\sigma}\sqrt{1 + \dfrac{1}{n} + \dfrac{(x_0 - \bar{x})^2}{L_{xx}}}} \sim t(n-2)σ^1+n1+Lxx(x0xˉ)2Y0Y^0t(n2)

3.4 预测区间的特征

  • 预测区间是关于 xˉ\bar{x}xˉ 对称的,x0x_0x0 越远离 xˉ\bar{x}xˉ,区间越宽(呈喇叭形)。
  • nnn 越大,区间越窄(信息越多,预测越精确)。
  • 个别值的预测区间比均值的置信区间宽(多了一项 σ2\sigma^2σ2)。
Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐