计量小课:计量经济学基础
计量经济学计量小课

遗漏变量偏误:明知有变量被遗漏,为什么不放进去?怎么分析它的影响?

在上一篇文章中,我们区分了多重共线性和遗漏变量偏误——前者让估计\"看不清\",后者让估计\"看错\"。而在这两者之间,遗漏变量偏误(Omitted Variable Bias, OVB)是计量经济学中最根本、最棘手的问题。

作者:计量科研导航站发布:2026-07-29★★

一、开篇:所有回归背后都站着一个幽灵

在上一篇文章中,我们区分了多重共线性和遗漏变量偏误——前者让估计"看不清",后者让估计"看错"。而在这两者之间,遗漏变量偏误(Omitted Variable Bias, OVB)是计量经济学中最根本、最棘手的问题

它棘手不在于数学上复杂——遗漏变量偏误的公式只有一行。它棘手在于:你永远无法证明你已经控制了所有该控制的变量。 无论你在回归表里放了多少个控制变量,审稿人总可以问:"你有没有考虑 XX 因素?它既影响你的 X 又影响你的 Y,你如果不控制它,你的系数可能是有偏的。"

这篇文章讨论四个问题:遗漏变量偏误的精确机制、为什么明知有遗漏却不放进基准回归、稳健性分析中"逐步加变量"的操作是否合理、以及面对一个"你知道它存在但不可能测到"的遗漏变量时,你该如何分析它对结论的威胁。

核心信息:遗漏变量偏误的大小 = 遗漏变量对 Y 的效应 × 遗漏变量与 X 的相关性。要产生有实质影响的偏误,遗漏变量必须同时满足两个条件。明知有遗漏但不放进基准回归,通常是因为它不可测度或只能用有误差的代理变量衡量。面对不可测度的遗漏变量,现代计量经济学提供了系数稳定性分析和边界分析等工具——你无法消除它,但可以量化它对你的结论的威胁有多大。


二、遗漏变量偏误的精确机制——一行公式就够了

2.1 公式

假设真实的 Y 由以下过程生成:

Y=β0+β1X+β2Z+εY = \beta_0 + \beta_1 X + \beta_2 Z + \varepsilon

其中 Z 是一个同时影响 X 和 Y的混淆变量——β20\beta_2 \neq 0Cov(X,Z)0\text{Cov}(X, Z) \neq 0

但你没有观测到 Z,所以你实际跑的回归是:

Y=β~0+β~1X+uY = \tilde{\beta}_0 + \tilde{\beta}_1 X + u

那么你的 β~1\tilde{\beta}_1(遗漏了 Z 的 OLS 估计)的期望是:

E[β~1]=β1+β2Cov(X,Z)Var(X)\mathbb{E}[\tilde{\beta}_1] = \beta_1 + \beta_2 \cdot \frac{\text{Cov}(X, Z)}{\text{Var}(X)}

第二项就是遗漏变量偏误。 它等于:

OVB=(Z对Y的效应)×(Z与X的关联强度,经X的尺度缩放)\text{OVB} = (\text{Z对Y的效应}) \times (\text{Z与X的关联强度,经X的尺度缩放})

2.2 两个条件必须同时满足——OVB 不是在真空中发生

遗漏变量偏误的大小取决于两个因子的乘积。两者必须同时非零才会有偏误:

  • 条件一β20\beta_2 \neq 0——Z 必须影响 Y。
  • 条件二Cov(X,Z)0\text{Cov}(X, Z) \neq 0——Z 必须和 X 相关。

如果 Z 影响 Y 但不与 X 相关(如"某地区某天的天气"影响农业产出 Y,但天气与农民的受教育年限 X 无关)→ OVB = 0。遗漏它不会让你的核心系数有偏——它只让残差方差增大,标准误变大,但不改变点估计的期望值。

如果 Z 与 X 相关但不影响 Y(如"眼睛颜色"可能和教育 X 微弱相关,但不影响工资 Y)→ OVB = 0。遗漏它同样不会导致偏误。

所以在面对任何"你可能遗漏了 XX"的质疑时,你应该追问:这个遗漏变量是否同时满足上述两个条件? 如果它只满足其中一个,它对核心系数的威胁为零。审稿人说"你应该控制 Z"——如果 Z 只影响 Y 但不影响 X,你可以回答:"Z 虽然影响 Y,但它和 X 不相关——遗漏它不会导致核心系数有偏,只会让标准误略微偏大,而我们的结论已经显著,因此这不影响文章的核心发现。"


三、为什么明知有遗漏却不放进基准回归?

这是实证研究者最常被问到的问题之一——"你承认能力会影响工资,也承认能力和教育相关,那能力为什么不放进回归?"

3.1 根本原因——有些变量根本无法被精确测量

能力(Ability)、"社会资本""制度质量""文化价值观""风险偏好""管理才能"——这些在经济学理论中至关重要的变量,没有一个可以被直接、无误差地观测到。你只能用代理变量(Proxy)——用 IQ 测试成绩代理"能力",用"邻里信任度"代理"社会资本"。

但代理变量的问题是——它不等于那个真实的 Z。IQ 测试成绩测量的是认知能力的某几个侧面,而且包含测量误差。如果你用有测量误差的代理放入回归,经典的"测量误差导致衰减偏误(Attenuation Bias)"会使核心系数趋向于零——你在"纠正"一种偏误时,可能引入了另一种偏误。

3.2 实践原因——自由度、多重共线性、数据可获得性

  • 自由度有限:小样本下,加一个代理变量消耗一个自由度,边际收益可能为负。
  • 多重共线性:代理变量往往和核心 X 高度相关,加入后核心系数的标准误膨胀。
  • 数据不可得:很多调查数据中根本就没有一个好的能力指标或社会资本指标。

所以,研究者不把一个已知的混淆变量放进基准回归,通常不是因为"不知道它的存在",而是因为"放进去比不放进去带来的问题可能更多"。


四、稳健性分析中"加一个变量声称避免遗漏变量偏误"——合理吗?

4.1 这种做法本身是合理的——但前提是正确的变量

很多实证论文在稳健性分析中会有这样一句话:"我们进一步控制了 XX 变量,以检验我们的核心结论是否对潜在的遗漏变量偏误稳健。"

如果 XX 是一个理论上重要的混淆变量,而且这一次你在数据中有办法度量它(即使有误差),那么把它加入回归并在表中报告"核心系数基本不变"——这是一个有效且被广泛接受的稳健性策略。它告诉你:即使存在遗漏变量偏误,至少在这个可观测的混淆变量维度上,偏误的程度不足以改变核心结论。

4.2 但两种错误的使用方式会适得其反

错误一:加入了中介变量却声称"避免遗漏变量偏误"。

如果你加入了"职业声望"作为控制变量,声称这是为了避免遗漏变量偏误——但实际上"职业声望"是教育影响工资的中介通道。你控制了它,等于堵住了教育影响工资的一条真实因果路径。降低的不是遗漏变量偏误——降低的是你的核心系数的因果含义。

错误二:加了变量后系数变了,但没有讨论"为什么变"。

如果你加了某个变量后核心系数从 0.08 变成了 0.02,你不能轻描淡写地说"系数略有变化但仍然显著"。系数从 0.08 到 0.02 意味着 75% 的原始估计可能是由这个新变量所捕获的混淆效应。这恰恰证明了——你的基准回归存在严重的遗漏变量偏误,而不是"稳健"。 在这种情况下,有偏误的研究正在被坦率地记录在文中——这是好事。但你需要诚实地对待变化的大小,而非以"仍然显著"来遮掩。


五、什么迹象暗示可能存在遗漏变量偏误?

迹象一:加入理论上重要的混淆变量后,核心系数大幅变化

这是最直接的诊断手段。如果你控制了"父母教育程度"之后,教育回报率从 12% 降到了 6%——这说明基准模型中"教育"系数的一部分来自于父母教育程度对工资的混淆效应,而不是教育本身的因果效应。

经验法则:如果核心系数在加入混淆变量后变化超过 20%—30%,必须认真对待遗漏变量偏误的可能性。

迹象二:核心系数与已有文献的估计方向或量级存在系统性差异

已有文献中教育回报率的估计集中在 0.07—0.10,你的估计是 0.18。如果你找不到"你的样本和研究人群与其他研究在本质上不同"的理由,那么这额外的 0.08—0.11 可能来自于你没有控制的某些混淆效应。

迹象三:基准模型的 R² 极低但核心系数显著——且方向"太好看"

你只控制了年龄和性别,模型的 R² = 0.03,但教育回报率 = 0.15,p < 0.001。这可能意味着"教育"正在替你吸收所有被遗漏的、既影响教育又影响工资的混淆因素的效应。

相比之下——如果你控制了 15 个变量后 R² = 0.35,教育回报率 = 0.08——这个 0.08 经过了更严格的"混淆变量清洗",它更接近真实的因果关系。

迹象四:使用不同识别策略得到差异很大的估计

如果你用 OLS 估计出教育回报率 = 0.12,但用工具变量(如义务教育法改革)估计出的结果是 0.06——这两者之间的差异很可能反映了 OLS 中存在遗漏变量偏误(能力偏误使 OLS 向上偏)。


六、当遗漏变量无法被测量——如何合理分析它的影响?

这是本文最核心的实用部分。你面对一个已知存在但无法测量的混淆变量(如能力),你不能把它放进回归——那你还能做什么?

6.1 系数稳定性分析——Oster (2019) 的方法

Emily Oster(2019)提出了一个优雅的框架,用于评估不可观测的遗漏变量对核心系数的威胁。

核心思想:比较两个回归的系数变化——一个只含核心变量(无控制变量),一个含所有你能观测到的控制变量。从中推断:如果可观测的混淆变量能让核心系数从 β_raw 移动 β_controlled,那么同等规模的"不可观测的混淆变量"在理论上还能让核心系数再移动多远?

具体来说,Oster 方法需要两个输入:

  • δ\delta:不可观测变量相对于可观测变量的"选择强度"(通常取 δ = 1 表示两者同等重要)。
  • RmaxR_{\max}:如果所有的混淆变量(包括不可观测的)都被控制了,模型的理论最大 R²(通常取 Rmax=1.3×R~2R_{\max} = 1.3 \times \tilde{R}^2,其中 R~2\tilde{R}^2 是含控制变量回归的 R²)。

在给定 δ 和 RmaxR_{\max} 的假设下,Oster 方法给出一个"偏误调整后的系数"——如果这个调整后的系数仍然落在经济显著且方向正确的范围内,那么你的结论对不可观测的遗漏变量是稳健的。

6.2 Altonji-Elder-Taber (2005) 比率方法

Altonji, Elder & Taber(2005)提出了另一种思路:用可观测变量的"选择程度"作为不可观测变量选择程度的合理猜测。

如果有可观测的混淆变量使核心系数从 β_raw 降为 β_controlled,那么你需要多大的"不可观测混淆变量的选择强度"才能把 β_controlled 进一步推到零?如果这个需要的"不可观测选择强度"远大于可观测变量已经表现出的选择强度,那么"不可观测变量能把剩余系数全部解释掉"这个论断就需要极强的假设。

结论:如果在控制了大量可观测的混淆变量之后核心系数仍然保持方向和显著性,而"需要的不可观测混淆变量的相对强度"远大于可观测混淆变量的强度,那么证据支持核心结论对遗漏变量偏误是稳健的。

6.3 边界分析(Bounding Analysis)

边界分析问的是"最坏情况"——在最极端的、对你的结论最不利的假设下,你的核心系数的可能范围是什么?

例如:

  • 假设不可观测的能力 Z 对工资的效应和可观测的母亲教育程度对工资的效应一样大(β_Z = β_mother_edu)。
  • 假设 Z 和教育的相关性等于母亲教育程度和教育的相关性(Cov(Z, X) = Cov(mother_edu, X))。
  • 在这个"最坏情况"下,OVB = β_Z × (Cov(Z,X)/Var(X))。
  • 从你的核心系数中减去这个"最坏情况 OVB"。如果相减后系数仍然显著为正(或至少保持相同的方向),那么即使在最悲观的假设下,你的定性结论("教育对工资有正效应")也能保持。

边界分析的精华在于:它不是给出一个点估计,而是给出一个"偏误的合理上限"。如果你在最坏情况下(不可观测的混淆效应被设定为等于可观测混淆效应的最大值),核心系数的符号和显著性都没有被逆转,那么审稿人很难再以"遗漏变量偏误"对研究提出颠覆性的质疑。


七、总结

遗漏变量偏误的四个核心事实:

  1. 遗漏变量偏误 = β_Z × (Cov(X, Z)/Var(X))——遗漏变量必须同时影响 Y 且与 X 相关才会造成偏误。只满足其中一个条件的遗漏变量不导致偏误。

  2. 明知有遗漏但不放进基准回归——通常因为该变量不可精确测量、代理变量包含测量误差、或数据中不存在该变量。这是一种被动的、但诚实的操作选择。

  3. 稳健性分析中"加变量"的操作是合理的——前提是加入的是混淆变量而非中介变量或对撞变量,且加入后需要诚实地讨论系数变化的大小和方向。系数的"稳定性"(加入混淆变量后基本不变)而非"仍然显著"才是稳健性检验的核心。

  4. 对于不可测度的遗漏变量——Oster 方法、Altonji-Elder-Taber 比率和边界分析提供了三种互补的框架,让你可以量化地讨论"即使存在遗漏变量偏误,我的结论在多大程度上仍然成立"。


一句话收尾

"你永远无法证明你的回归里没有遗漏变量——但你可以证明,即使存在不可观测的遗漏变量,它们也不太可能大到足以推翻你的核心结论。这就是从'声称没有遗漏变量偏误'到'论证遗漏变量偏误不足以改变结论'的认知飞跃。"


八、B站/公众号呈现建议

  • B站视频:建议用"OVB 分解动画"——画面上方是公式 OVB = β_Z × Cov(X,Z)/Var(X),然后分裂成两个独立的手柄。拖动第一个手柄(β_Z ↑)→ 偏误柱状图上升。拖动第二个手柄(Cov(X,Z) ↑)→ 偏误柱状图上升。如果其中一个手柄为零 → 偏误归零,直观演示"两个条件必须同时满足"。
  • 公众号:遗漏变量偏误公式建议配分解示意图。Oster 方法的核心思想建议用一个"已知偏误 → 推断未知偏误"的流程图。边界分析建议配一个"被允许的混淆效应范围"的可视化段落。
  • 推荐标题
    • 主标题:《遗漏变量偏误:明知有变量被遗漏,为什么不放进去?》
    • 备选标题:《无法测量的混淆变量——怎么证明它不会推翻你的结论?》
  • 金句提炼

    "你永远无法证明你的回归里没有遗漏变量。但你可以证明——即使存在不可观测的遗漏变量,它们也不太可能大到足以推翻你的核心结论。"