多重共线性与异方差
多重共线性与异方差
多重共线性的概念与后果
多重共线性(multicollinearity):解释变量之间存在线性相关。它是多元回归特有的问题,一元回归不存在。
完全多重共线性:存在某个解释变量是其他解释变量的严格线性组合,\(\mathbf{X'X}\) 不可逆,OLS 估计量 \(\hat{\boldsymbol\beta}=(\mathbf{X'X})^{-1}\mathbf{X'Y}\) 不存在,直接违反基本假设。二元例:\(X_2=\lambda X_1\) 时模型变为 \(Y=\beta_0+(\beta_1+\lambda\beta_2)X_1+u\),只能估计出组合 \(\beta_1+\lambda\beta_2\),两个系数分不开。
近似多重共线性:解释变量间高度但不完全相关,\(\mathbf{X'X}\) 仍可逆,OLS 估计量仍无偏、仍为 BLUE,但方差被放大:
其中 \(R_j^2\) 是把第 j 个解释变量对其余全部解释变量(含常数项)作辅助回归得到的拟合优度。
方差膨胀因子(VIF):\(\mathrm{VIF}_j=1/(1-R_j^2)\),与辅助回归 R² 一一对应:\(R_j^2=0\) 时 VIF=1,0.9 时 VIF=10,0.99 时 VIF=100。经验规则:VIF>10(辅助回归 R²>0.9)认为共线性较严重。
三个后果:参数估计量标准误变大、置信区间变宽、t 值变小,本应显著的变量可能被判为不显著,从而把重要变量排除出模型;预测区间变宽、预测精度下降;参数估计量经济意义不合理,高度相关的变量只能反映联合影响、无法分辨各自的独立作用,系数符号甚至反常。
产生原因三条:经济变量有共同趋势,如 GDP、就业人口、资本投入三者高度相关;模型设定问题,如 \(\ln Y\) 对 \(\ln X\) 与 \(\ln X^2\) 回归时 \(\ln X^2=2\ln X\) 造成完全共线,应写成 \((\ln X)^2\);样本资料限制,如收入与房屋面积天然高度相关,小样本下相关系数可达 0.9 以上,扩大样本量可缓解。
多重共线性的检验
检验任务有二:检验是否存在多重共线性;判明存在共线性的范围。方法:模型的 R² 与 F 值较大但只有少数几个显著的 t 值,各解释变量对 Y 的联合线性作用显著而独立作用不能分辨;解释变量间两两相关系数接近 1;某变量 VIF>10;辅助回归的 F 检验,对每个解释变量 \(X_j\) 作辅助回归,检验 \(H_0\) 其余解释变量系数全为 0,统计量 \(F_j=[R_j^2/(k-1)]/[(1-R_j^2)/(n-k)]\);逐步回归法,逐个引入解释变量观察拟合优度变化,新变量引入后拟合优度变化不显著说明它可被其他变量的线性组合替代。
consumption2 数据案例:回归 consumption 对 income、wealth,\(R^2=0.9635\)、\(F(2,7)=92.40\) 整体高度显著,但 income 系数 \(t=1.14\)、wealth 系数 \(t=-0.53\) 均不显著,income 与 wealth 的 VIF 均为 482.13,典型"R²、F 大而 t 小、VIF 巨大"组合。
多重共线性的处理
处理措施:不作任何处理,OLS 估计仍 BLUE,只要参数标准误较小、t 统计值较大就无需过度关注;排除引起共线性的变量,但保留变量的系数经济意义与估计值随之变化;转换变量,时间序列可用一阶差分,Y、X 同时除以一个解释变量变为人均变量;增加样本容量,多收集数据可能减缓共线性;岭回归,以引入偏误为代价减小方差。
异方差的定义与产生情境
同方差:\(\operatorname{Var}(u_i|X_1,\dots,X_k)=\sigma^2\),条件方差为常数。异方差(heteroskedasticity):\(\operatorname{Var}(u_i|X_1,\dots,X_k)=\sigma_i^2=f(X_i)\),条件方差随 X 变化;由于 \(\operatorname{var}(Y_i|X_i)=\operatorname{var}(u_i|X_i)\),Y 的离散程度也随 X 变化。三种类型:单调递增型、单调递减型、复杂型(如 U 形)。
经济实例:家庭储蓄对可支配收入回归,高收入家庭储蓄差异大、低收入家庭差异小;受教育水平越高,工资散布越开;居民消费按收入分组取组均值时,人数多的组平均值误差小、人数少的组误差大,样本观测值误差呈 U 形变化;企业生产函数中各企业所处外部环境不同,随机误差项呈不规律变化。一般经验:采用横截面数据作样本的计量回归,往往会存在异方差问题。
异方差对 OLS 的影响
无偏性与一致性不受影响:无偏性推导只需严格外生性,与方差假定无关,\(E(\hat{\boldsymbol\beta})=\boldsymbol\beta\) 仍成立。
有效性被破坏:\(\operatorname{var}(\hat{\boldsymbol\beta})=(\mathbf{X'X})^{-1}\mathbf{X}'E(\mathbf{uu'})\mathbf{X}(\mathbf{X'X})^{-1}\neq\sigma^2(\mathbf{X'X})^{-1}\),高斯-马尔科夫定理失效,OLS 不再是 BLUE。
检验失效:t 统计量与 F 统计量建立在同方差从而正确估计标准误的基础上。一元模型真实方差为 \(\sum(X_i-\bar X)^2\sigma_i^2/[\sum(X_i-\bar X)^2]^2\),而 OLS 报表用 \(\sigma^2/\sum(X_i-\bar X)^2\),两者不同,t 统计量不具有 t 分布、F 统计量不具有 F 分布,大样本也不能解决。
预测失效:预测方差含参数估计量的方差,异方差下 \(\operatorname{Var}(\hat\beta_j)\) 不再最小,预测的精确度降低。
异方差的检验
图示法:作 \(\hat u^2\) 对 X 的散点图(多元情形作对拟合值 \(\hat Y\) 的散点图)。同方差时散点呈等宽水平带状;呈三角或喇叭形、斜带形、弧形、U 形则提示存在异方差。
Breusch-Pagan(BP)检验:原假设 \(H_0:\operatorname{Var}(u|X_1,\dots,X_k)=\sigma^2\)。步骤:对原模型 OLS 回归并计算残差 \(\hat u\);真实扰动项 u 不可观测,用 \(\hat u^2\) 代替作辅助回归 \(\hat u^2=\delta_0+\delta_1X_1+\cdots+\delta_kX_k+v\);联合检验 \(H_0:\delta_1=\cdots=\delta_k=0\),统计量
p 值很小则拒绝原假设,表明具有异方差。
White 检验:辅助回归除 \(X_j\) 的一次项外还加入平方项 \(X_j^2\) 与交叉项 \(X_jX_h\),原假设为所有斜率系数全为 0。k=3 时辅助回归含 9 个回归元,\(F\sim F(9,n-10)\)、\(LM=nR^2\sim\chi^2(9)\);缺点消耗过多自由度,k=6 时 White 回归有 27 项。改进方法用 OLS 拟合值 \(\hat y\):\(\hat u^2=\delta_0+\delta_1\hat y+\delta_2\hat y^2+v\),检验 \(H_0:\delta_1=\delta_2=0\),\(F\sim F(2,n-3)\)、\(LM=nR^2\sim\chi^2(2)\)。
consumption3 数据案例(n=30):OLS 回归 consumption 对 income 后,BP 检验 \(\chi^2(1)=5.27\)、p=0.0217,5% 水平拒绝同方差原假设;White 检验 \(\chi^2(2)=5.33\)、p=0.0696,5% 水平不能拒绝、10% 水平可拒绝,检验结论对显著性水平较敏感。
修正一:WLS 与 FGLS
加权最小二乘(WLS):误差项条件方差具有形式 \(\sigma_i^2=\sigma^2h(X_i)\) 且 \(h(\cdot)\) 已知时,方程两边同除以 \(\sqrt{h(X_i)}\),新误差项 \(u_i^*=u_i/\sqrt{h(X_i)}\) 的方差为 \(\sigma^2\),变换后模型满足线性模型假设,直接作 OLS 得到无偏、有效且一致的估计量。转换后的目标函数为 \(\sum(1/h_i)\hat u_i^2\):方差大的观测权重小、方差小的权重大。\(h(X_i)=1\) 时 WLS 退化为 OLS。WLS 也称广义最小二乘(GLS)。
可行广义最小二乘(FGLS):实际中 \(h(\cdot)\) 未知,需先估计。假设 \(h(X_i)=\exp(\delta_0+\delta_1X_1+\cdots+\delta_kX_k)\),两边取对数用 \(\log(\hat u_i^2)\) 作回归得拟合值 \(\hat g_i\),取权重 \(\hat\omega_i=1/\exp(\hat g_i)\) 再作 WLS。GLS 具有 BLUE 性质;FGLS 的权重是估计出来的,不具有无偏性,但在正确设定方差函数形式时大样本下一致且渐近有效。
修正二:异方差稳健标准误
异方差稳健标准误(White 标准误):保留 OLS 系数估计不变,只把方差公式中的 \(\sigma^2\) 用每个观测的残差平方 \(\hat u_i^2\) 替代(三明治形式),得到稳健标准误;稳健标准误下 t/F 检验仍然有效。稳健标准误只在大样本下有效,小样本推断不成立。
房价数据(HPRICE1,N=88)案例:OLS 结果 lotsize 系数 2.8678(标准误 0.6432、\(t=3.22\)、p=0.002);加稳健标准误后 lotsize 标准误变为 1.2514(\(t=1.65\)、p=0.102)。存在异方差时传统标准误会错误地夸大显著性,lotsize 在 OLS 下 5% 显著、换稳健标准误后不再显著;OLS 系数仍无偏,但显著性判断必须基于稳健标准误。实践建议:横截面数据回归通常都应报告稳健标准误。
发现错误?想一起完善? 在 GitHub 上编辑此页!
本页面贡献者:AI-PM Wiki Team
本页面的全部内容在 CC BY-SA 4.0 和 SATA 协议之条款下提供,附加条款亦可能应用