模型设定偏误
模型设定偏误
设定偏误的类型
线性回归模型的经典假设之一就是模型设定正确。模型设定错误时,即使其他经典假设都满足,估计结果也可能有偏,这种偏误称模型设定偏误。设定偏误对应经典假设第 1 条:既无遗漏重要变量也无多余无关变量、函数形式正确。设定偏误分两大类:解释变量选取的偏误,包括遗漏相关变量与多选无关变量;函数形式选取的偏误,即错误的函数形式。
遗漏相关变量的后果
真实模型为 \(Y=\beta_0+\beta_1X_1+\beta_2X_2+u\),却估计了 \(Y=\alpha_0+\alpha_1X_1+v\)。沿用离差形式,把真实模型代入 OLS 估计量可得
\(X_1\) 与 \(X_2\) 相关时第二项不等于 0,\(\hat\alpha_1\) 小样本下有偏、大样本下不一致,偏误方向等于 \(\beta_2\) 的符号乘 \(X_1\)、\(X_2\) 相关系数的符号。\(X_1\) 与 \(X_2\) 不相关时 \(\hat\alpha_1\) 仍无偏、一致,但截距 \(\hat\alpha_0\) 有偏且不一致,随机扰动项方差 \(\hat\sigma^2\) 的估计与 \(\hat\alpha_1\) 方差的估计也有偏。
方差对比:遗漏模型 \(\operatorname{Var}(\hat\alpha_1)=\sigma^2/\sum x_{1i}^2\),正确模型 \(\operatorname{Var}(\hat\beta_1)=\sigma^2/[\sum x_{1i}^2(1-\gamma_{x_1x_2}^2)]\),\(\gamma_{x_1x_2}\) 是 \(X_1\) 与 \(X_2\) 的相关系数。只要 \(X_1\)、\(X_2\) 相关,正确模型的方差就更大;遗漏变量的模型把 \(X_2\) 的影响混入扰动项,"看起来更精确"是虚假的精确。
多选无关变量的后果
真实模型为 \(Y=\alpha_0+\alpha_1X_1+v\),却估计了 \(Y=\beta_0+\beta_1X_1+\beta_2X_2+\varepsilon\),其中真实 \(\beta_2=0\)。估计模型仍满足全部经典假设,\(\hat\beta_1\)、\(\hat\beta_0\) 仍无偏、一致,\(E(\hat\beta_2)=0\)。
代价在方差:\(X_2\) 与 \(X_1\) 完全无关时 \(\operatorname{Var}(\hat\beta_1)=\operatorname{Var}(\hat\alpha_1)\),无损失;相关时 \(\operatorname{Var}(\hat\beta_1)=\sigma^2/[\sum x_{1i}^2(1-\gamma^2)]>\operatorname{Var}(\hat\alpha_1)\),标准误变大、置信区间变宽、估计精度下降。多选无关变量不破坏无偏性,但可能损失效率,应通过 t 检验或 F 检验把无关变量剔除。例:真实模型只含 \(X_1\) 而误加 \(X_2\),\(X_2\) 的系数估计 \(E(\hat\beta_2)=0\),检验中该系数一般不显著。
错误函数形式的后果
真实模型是非线性的,如双对数模型 \(Y=AX_1^{\beta_1}X_2^{\beta_2}e^u\),却设定了线性模型 \(Y=\beta_0+\beta_1X_1+\beta_2X_2+u\)。后果是"全方位的":参数的经济含义完全改变,双对数模型里的 \(\beta_1\) 是弹性,线性模型里的 \(\beta_1\) 是 \(X_1\) 变动一单位对 Y 的影响;两者一般给出不同的估计结果,且样本量再大也无法修正。
无关变量的检验
单个变量用 t 检验,\(t=\hat\beta_k/se(\hat\beta_k)\);一组变量(如 \(X_3\)、\(X_4\) 是否应包含)用 F 检验,受约束模型为去掉该组变量的回归。t 检验判断单个系数是否显著异于 0,F 检验判断一组变量是否应同时进入模型,两者都是设定偏误排查的组成部分。
残差分析
残差分析诊断是否遗漏重要解释变量或函数形式有误:OLS 之后把残差与某解释变量 X 作散点图,考察残差是否呈规律性变动。残差随 X 持续上升,可能遗漏了与 X 正相关的重要变量;持续下降,可能遗漏了与 X 负相关的变量;真实关系是凹的(如幂函数)却被用直线拟合时,残差呈"先正、后负、再正"的规律变化,说明函数形式错误。软件实现:回归后用 predict 保存残差,再与解释变量作散点图观察规律性。
Ramsey RESET 检验
Ramsey RESET 检验(回归设定误差检验):步骤为估计原模型,得拟合值 \(\hat Y\) 与 \(R^2_{old}\);在原模型中引入拟合值的若干次幂(\(\hat Y^2\)、\(\hat Y^3\),必要时更高次)作为新增回归元,重新 OLS,得 \(R^2_{new}\);检验 \(H_0:\gamma_2=\gamma_3=0\)(新增项系数全为 0,即无设定偏误),统计量
通常新增 2 项时 \(F=\dfrac{(R^2_{new}-R^2_{old})/2}{(1-R^2_{new})/(n-4)}\)。F 显著(p 值小)则认为原模型有设定偏误。软件操作:EViews 在估计方程窗口选 View → Stability Diagnostics → Ramsey RESET Test,Stata 用 estat ovtest。RESET 提示"模型可能不对",不指出具体错在哪里、如何修正。
应用案例:香烟消费模型选择
美国 48 个州 1995 年香烟人均消费数据,变量为人均消费量 Q、居民收入 Y、销售价格 P、州平均消费税 tax、州特产税 taxs,用 RESET 检验在对数模型与水平模型之间选择。对数模型 \(\ln Q=f(\ln Y,\ln P)\) 的 RESET 检验,EViews 加入平方项与三次项(2 项)得 \(F=1.918\)、p=0.159,Stata 的 estat ovtest 默认加 3 项得 \(F=1.26\)、p=0.3011,两种设定下 10% 水平都不能拒绝原假设,不存在明显的设定偏误。水平模型 \(Q=\beta_0+\beta_1Y+\beta_2P+u\) 的 RESET 检验 \(F=4.210\)、p=0.0209(LR 统计量 p=0.0127),5% 水平拒绝原假设,存在设定偏误。结论:应选择对数(双对数)模型。设定检验可以在候选函数形式之间做选择。
三类设定偏误的检验路径:无关变量用 t 检验(单个变量)或 F 检验(一组变量)剔除;遗漏变量与函数形式错误用残差分析与 RESET 检验诊断;函数形式的选择用 RESET 在候选形式之间裁定。遗漏相关变量与错误函数形式都会使残差呈现规律性,残差分析是两类偏误的共同诊断工具。
发现错误?想一起完善? 在 GitHub 上编辑此页!
本页面贡献者:AI-PM Wiki Team
本页面的全部内容在 CC BY-SA 4.0 和 SATA 协议之条款下提供,附加条款亦可能应用