简单线性回归
简单线性回归
变量关系:函数关系与统计关系
经济变量间的关联分两类。确定性函数关系给定 X 唯一确定 Y,如 \(Y=2X\)、销售额等于价格乘销售量。统计相关关系给定 X 后 Y 仍会波动,如施肥量与小麦产量、工资与教育、环境规制与环境质量。计量经济学研究统计相关关系,刻画工具为散点图、协方差与线性相关系数。
线性相关系数 \(\rho=\dfrac{\operatorname{cov}(X,Y)}{\sqrt{\operatorname{var}(X)}\sqrt{\operatorname{var}(Y)}}\),取值 \([-1,1]\)。\(\rho=0\) 只说明没有线性相关,可能存在非线性相关,如 \(Y=X^2\) 的 U 型关系;\(\rho\) 接近 \(1\) 或 \(-1\) 说明线性关联强。异常值对相关系数影响很大,研究常去掉最大最小 5% 的极端观测。
回归的含义
回归(regression):用解释变量 X 解释被解释变量 Y 的条件均值 \(E(Y|X)\)。回归一词源自高尔顿对父母身高与子女身高的研究:高个子父母的孩子平均身高低于父母、矮个子父母的孩子平均身高高于父母,子代身高向群体平均回归。现代回归不研究 Y 的个别值,只研究给定 X 时 Y 的平均水平。
相关不等于因果(correlation is not causation)。太阳镜销量与冰激凌销量正相关,但两者并无因果关系,共同因素"夏天天气热"同时推高两者销量,该因素称混淆因素。回归反映的是统计依存关系,因果关系须依据经济理论与直觉断定,数据本身无法证明。
回归分析与相关分析的区别:回归分析中变量地位非对称,解释变量 X 在重复抽样中可以固定、被解释变量 Y 恒为随机变量,侧重因果识别;相关分析中两变量对称、都视为随机变量,只测度相关程度。
总体回归函数与总体回归模型
总体回归函数(PRF):\(E(Y|X)=\beta_0+\beta_1X\),是给定 X 时 Y 的条件均值,其中 \(\beta_0\) 为截距项参数、\(\beta_1\) 为斜率项参数。
随机误差项 \(u=Y-E(Y|X)\),是个别观测偏离条件均值的部分。引入误差项的理由:代表未知的影响因素;代表缺失的数据;代表众多细小因素以保持模型简洁;代表数据观测误差;代表模型设定误差;变量本身的内在随机性。
总体回归模型(PRM):\(Y=\beta_0+\beta_1X+u\),给定 X 时 Y 分解为确定性部分 \(\beta_0+\beta_1X\) 与随机部分 \(u\)。
计量经济学中的线性指对参数线性:回归系数只以一次方出现,对解释变量 X 的形式不作限制。\(Y=\beta_0+\beta_1X^2+u\)、\(\ln Y=\beta_0+\beta_1\ln X+u\) 都是参数线性模型;\(Y=X_1^{\beta_1}+X_2^{\beta_2}+u\) 对参数非线性且无法经变换化为线性。
样本回归函数与样本回归模型
总体回归线未知,因为总体的全部个体无法一一观测。现实做法是抽样,用样本信息估计总体回归函数。
样本回归函数(SRF):\(\hat Y=\hat\beta_0+\hat\beta_1X\),是对总体回归线的估计;\(\hat Y\) 是 \(E(Y|X)\) 的估计量,\(\hat\beta_0\)、\(\hat\beta_1\) 是 \(\beta_0\)、\(\beta_1\) 的估计量。
残差 \(\hat u=Y-\hat Y\),是真实值 Y 与拟合值 \(\hat Y\) 的差距。残差与误差项不是一回事:误差项 u 不可观测,残差 \(\hat u\) 可由样本计算。
样本回归模型(SRM):\(Y=\hat\beta_0+\hat\beta_1X+\hat u\)。
四个核心概念对应关系:PRM \(Y=\beta_0+\beta_1X+u\);PRF \(E(Y|X)=\beta_0+\beta_1X\);SRM \(Y=\hat\beta_0+\hat\beta_1X+\hat u\);SRF \(\hat Y=\hat\beta_0+\hat\beta_1X\)。
六条经典假定
模型写成 \(Y_i=\beta_0+\beta_1X_i+u_i\)(\(i=1,\dots,n\)),为保证估计量具有良好性质提出基本假定。
假定 1(模型设定):回归模型正确设定,既无遗漏重要变量也无多余无关变量,函数形式正确;违反时存在设定偏误。
假定 2(解释变量变异):X 在所抽样本中具有变异性,且随样本容量增加其样本方差趋于非零有限常数 \(Q\),即 \(\operatorname{plim}\dfrac1n\sum(X_i-\bar X)^2=Q\)。
假定 3(条件零均值):\(E(u_i|X)=0\),u 的条件均值为零、不依赖 X 的取值;此时 X 称外生解释变量或严格外生。由迭代期望法则得推论 \(E(u_i)=0\)、\(\operatorname{cov}(u_i,X)=0\)。只要求 \(\operatorname{cov}(u_i,X_i)=0\) 时称同期外生,是大样本理论所用条件。
假定 4(同方差):\(\operatorname{var}(u_i|X)=\sigma^2\),不随 X 变化;不满足时存在异方差。
假定 5(无序列相关):\(\operatorname{cov}(u_i,u_j|X)=0\)(\(i\neq j\));不满足时存在序列相关或自相关,时间序列数据常出现该问题。
假定 6(正态性):\(u_i|X\sim N(0,\sigma^2)\)。OLS 参数估计本身不需要此假定;小样本统计推断需要它;大样本下由中心极限定理可放松。
假定 1-5 合称高斯-马尔科夫假定,假定 1-6 合称经典假定;满足经典假定的模型称经典线性回归模型(CLRM)。
OLS 基本思想与估计量
普通最小二乘法(OLS):选择 \(\hat\beta_0\)、\(\hat\beta_1\) 使残差平方和最小。残差有正有负,直接相加会正负相抵,平方后全部为正再加总,才能衡量整条样本回归线离观测点的总体远近。目标函数为
对两个参数求一阶偏导并令其为 0,得正规方程组
解之得 OLS 估计量
记离差 \(x_i=X_i-\bar X\)、\(y_i=Y_i-\bar Y\),则 \(\hat\beta_1=\dfrac{\sum x_iy_i}{\sum x_i^2}\)。回归系数与相关系数分子相同、分母不同,数值一般不等,但符号必相同。
五观测样本 \((1,5),(4,6),(5,7),(3,9),(2,8)\) 的估计:\(\bar X=3\)、\(\bar Y=7\),分子 \(\sum(X_i-\bar X)(Y_i-\bar Y)=2\),分母 \(\sum(X_i-\bar X)^2=10\),得 \(\hat\beta_1=0.2\)、\(\hat\beta_0=6.4\),样本回归线 \(\hat Y=6.4+0.2X\);第 1 次观测拟合值 \(\hat Y_1=6.6\)、残差 \(\hat u_1=-1.6\)。
OLS 估计量的性质
代数性质对任意样本均成立:残差和为 0,即 \(\sum\hat u_i=0\);\(\sum X_i\hat u_i=0\),X 与残差的样本协方差为 0;样本回归线通过样本均值点 \((\bar X,\bar Y)\);拟合值均值等于实际值均值 \(\bar{\hat Y}=\bar Y\);拟合值与残差的样本协方差为 0。
小样本性质三条:线性,\(\hat\beta_1=\sum k_iY_i\),两个估计量都是 Y 的线性组合;无偏,\(E(\hat\beta_1|X)=\beta_1\)、\(E(\hat\beta_0|X)=\beta_0\),依赖假定 3;有效,OLS 估计量的方差在线性无偏估计量中最小,方差公式
n 越大方差越小。最小方差证明的关键:任取线性无偏估计量 \(\hat\beta_1^*=\sum\omega_iY_i\),其方差等于 OLS 方差加一个非负平方项,仅当权重取 OLS 权重时该项为 0。
高斯-马尔科夫定理:满足高斯-马尔科夫假定(假定 1-5)时,OLS 估计量是 BLUE,即最优线性无偏估计量。表述须限定在线性无偏估计量中,非线性或有偏估计量的方差可能更小。
大样本性质:一致性。\(\operatorname{plim}\hat\beta=\beta\),样本足够大时估计量收敛于真值。大样本理论把严格外生放松为同期不相关,且不要求扰动项正态分布。若 X 与 u 相关,即使样本很大也不收敛,一致性不成立。
拟合优度 R²
把总离差分解为 \(Y_i-\bar Y=\hat u_i+(\hat Y_i-\bar Y)\),残差是回归未解释的部分,\((\hat Y_i-\bar Y)\) 是回归已解释的部分。三个平方和:总平方和 \(\mathrm{SST}=\sum(Y_i-\bar Y)^2\)、解释平方和 \(\mathrm{SSE}=\sum(\hat Y_i-\bar Y)^2\)、残差平方和 \(\mathrm{SSR}=\sum\hat u_i^2\),恒有 \(\mathrm{SST}=\mathrm{SSE}+\mathrm{SSR}\)。
可决系数 \(R^2=\dfrac{\mathrm{SSE}}{\mathrm{SST}}=1-\dfrac{\mathrm{SSR}}{\mathrm{SST}}\),表示 Y 的总变差中由回归解释部分所占的比重,取值 \([0,1]\)。\(R^2=1\) 表示完全拟合,\(R^2=0\) 表示回归没有解释力。简便计算 \(R^2=\hat\beta_1^2\dfrac{\sum(X_i-\bar X)^2}{\sum(Y_i-\bar Y)^2}\)。\(R^2\) 等于真实值 Y 与拟合值 \(\hat Y\) 之间相关系数的平方;与相关系数不同,它区分解释变量与被解释变量,取值 \([0,1]\)。
上述五观测样本中,拟合值 \(\hat Y_i\) 为 6.6、7.2、7.4、7.0、6.8,\(\mathrm{SSE}=0.4\)、\(\mathrm{SST}=10\)、\(\mathrm{SSR}=9.6\),\(R^2=0.04\),拟合很差。
社会科学尤其是横截面数据的 R² 往往不高,0.1、0.2 并不罕见,低 R² 不说明 OLS 回归没有价值;回归是否有意义还要看变量关系是否显著、是否符合经济理论。
σ² 估计与标准误
方差公式中的 \(\sigma^2\) 未知。由 \(E(\sum\hat u_i^2)=(n-2)\sigma^2\),无偏估计量为
自由度解释:n 个残差受两个线性约束 \(\sum\hat u_i=0\) 与 \(\sum X_i\hat u_i=0\) 约束,可自由变动的只有 n-2 个。把 \(\sigma^2\) 换成 \(\hat\sigma^2\) 并开根号得标准误
标准误衡量估计量抽样波动的大小,SE 越小估计越精确。
t 检验与 P 值
显著性检验判断解释变量 X 对 Y 是否真的有影响,即检验斜率参数是否显著不为 0。检验四要素:
原假设 \(H_0:\beta_1=0\),备择假设双侧 \(H_1:\beta_1\neq 0\) 或单侧 \(H_1:\beta_1>0\)、\(H_1:\beta_1<0\)。检验统计量
显著性水平 α 是犯第一类错误(去真)的概率,常用 1%、5%、10%;第二类错误是纳伪。给定 α 查 t 分布表得临界值,双侧检验中 \(|t|>t_{\alpha/2}\) 落入拒绝域则拒绝 \(H_0\),称系数显著;单侧检验 \(H_1:\beta_1>0\) 时 \(t>t_\alpha\) 拒绝,\(H_1:\beta_1<0\) 时 \(t<-t_\alpha\) 拒绝。α 越大拒绝域越大、越容易拒绝;自由度越大临界值越小,增大样本量直接降低拒绝门槛。
P 值:拒绝 \(H_0\) 所需的最小显著性水平,软件自动汇报。双侧 \(P=2P(T>|t|)\)。判断规则为 \(p<\alpha\) 则拒绝。例:\(p=0.031\) 在 1% 水平不显著、5% 水平显著;\(p=0.063\) 在 5% 水平不显著、10% 水平显著。t 越大 P 越小,两者信息等价。
双侧检验算例:样本 \(N=20\)、\(t=2.5\)、自由度 18,α=0.05 时临界值 \(t_{0.025}(18)=2.1009\),\(2.5>2.1009\) 拒绝 \(H_0\);α=0.01 时临界值 \(2.8784\),不能拒绝。同一个 t 值在不同显著性水平下结论不同。
置信区间
由 \(\dfrac{\hat\beta_1-\beta_1}{se(\hat\beta_1)}\sim t(n-2)\) 反解出置信区间
置信水平默认 95%。置信区间端点是随机的,对某一次抽样区间要么包含要么不包含 \(\beta_1\);正确表述是重复抽样 100 次,约有 95 个区间覆盖真实 \(\beta_1\)。
收窄区间、提高精度的三条途径:增大样本量 n;提高拟合优度 R²;增大 X 的变异程度。X 无变异时 \(\operatorname{se}=\infty\),参数无法估计。
基于置信区间的双侧检验:\(0\) 不在区间内则拒绝 \(H_0\),称 \(\beta_1\) 显著;\(0\) 在区间内则不拒绝。该结论与 t 检验、P 值判断等价。
预测区间
给定 \(X_0\),可预测条件均值 \(E(Y|X=X_0)\) 或个别观测 \(Y_0\),两者点预测相同 \(\hat Y_0=\hat\beta_0+\hat\beta_1X_0\)。均值预测的方差
个别值预测 \(Y_0=\beta_0+\beta_1X_0+u_0\),预测误差的方差
比均值预测多出常数 1,来自个体扰动项 \(u_0\) 的方差,故个别值预测区间总比均值预测区间宽。预测区间为 \(\hat Y_0\pm t_{\alpha/2}\,se\);把各 \(X_0\) 的端点连起来得到置信带,在 \(X_0=\bar X\) 处最窄,向两侧越拉越宽。
关键算例
美国 526 名工人的工资-教育回归:\(\widehat{wage}=-0.9049+0.5414\,educ\),\(educ\) 系数标准误 0.0532、\(t=10.17\)、\(P\approx0.000\),\(R^2=0.1648\)。经济含义:教育每增加 1 年,小时工资约增加 0.54 美元;斜率在 1% 水平显著,95% 置信区间 \([0.4367,0.6460]\) 不含 0。
2013 年中国 31 省居民人均可支配收入与消费支出回归:\(expenditure=477.12+0.71\,income\),\(\hat\beta_1=0.707\) 是边际消费倾向(MPC),人均可支配收入每增加 1 元,人均消费支出增加约 0.707 元,\(P\approx0.000\),\(R^2=0.9764\)。收入 20000 元时点预测 \(\hat Y_0=14619\) 元,均值预测 95% 区间 \([14276,14961]\),个别值预测 95% 区间 \([12829,16409]\),后者明显更宽。
发现错误?想一起完善? 在 GitHub 上编辑此页!
本页面贡献者:AI-PM Wiki Team
本页面的全部内容在 CC BY-SA 4.0 和 SATA 协议之条款下提供,附加条款亦可能应用