计量小课:计量经济学基础
计量经济学计量小课

潜在因果框架 vs 多元回归:两种\"因果\"语言有什么不同?谁更可信?

如果你同时读两类论文,会发现\"因果关系\"这个词被用在了两种看起来完全不同的语境中——

作者:计量科研导航站发布:2026-07-29★★

一、开篇:两种语言,同一个词

如果你同时读两类论文,会发现"因果关系"这个词被用在了两种看起来完全不同的语境中——

语境A(常见于劳动经济学、教育经济学、发展经济学):

"我们使用倾向得分匹配来估计培训项目对工资的处理效应。在条件独立假设下,ATT 估计值为 0.12,即参加培训使工资提高了约12%。"

语境B(更传统的实证研究):

"在控制了个体特征、家庭背景和地区固定效应之后,受教育年限的系数为 0.08 且在 1% 水平上显著。这表明,保持其他条件不变,每增加一年教育,工资提高约 8%。"

两种表述都在说自己估计的是"因果效应"。但它们用的是两套完全不同的语言体系。语境A用的是潜在因果框架(Rubin Causal Model, RCM)——以反事实、处理效应、分配机制为核心概念。语境B用的是多元回归——以偏导数、控制变量、FWL定理为核心概念。

这两个框架各自声称的"因果",是同一个东西吗?一个更可信吗?它们在什么条件下会给出相同的答案?

这篇文章就是要打通这两套语言。

核心信息:潜在因果框架和多元回归不是两种"对立的因果理论"——它们是同一套识别逻辑的两种表达方式。潜在因果框架更透明(你被迫把假设写清楚),多元回归更便捷(但假设容易隐形)。理解两者的等价条件,是判断一篇实证论文可信度的关键技能。


二、潜在因果框架:用"反事实"定义因果

2.1 核心思想——每个人有两个潜在的自己

潜在因果框架由 Rubin(1974)系统化,它的起点是一个"反事实"定义:

对每个个体 i,定义两个潜在结果(Potential Outcomes)

  • Yᵢ(1):个体 i 如果接受处理(如参加培训、上大学、服用药物)会出现的潜在结果。
  • Yᵢ(0):个体 i 如果不接受处理会出现的潜在结果。

个体处理效应(Individual Treatment Effect)就是这两个潜在结果之差:

τi=Yi(1)Yi(0)\tau_i = Y_i(1) - Y_i(0)

这个定义干净到什么程度?它完全不依赖任何模型、任何假设、任何回归方程。因果就是两个潜在结果的差——定义上无懈可击。

2.2 根本问题——你永远看不到两个潜在结果

但定义干净是一回事,实际操作是另一回事。对于任何一个个体,你只能观测到一个潜在结果。 参加了培训的人,你看不到他"没参加培训"会怎样;没参加的人,你看不到他"参加了"会怎样。

这就是 Holland(1986)所说的因果推断的根本问题(Fundamental Problem of Causal Inference)——因果效应定义在个体层面,但个体层面的因果效应永远不可直接观测。

2.3 解决办法——从个体到群体,引入可观测假设

既然个体因果效应不可观测,实证研究的目标就转向了估计平均处理效应(Average Treatment Effect, ATE)

ATE=E[Y(1)Y(0)]\text{ATE} = \mathbb{E}[Y(1) - Y(0)]

要识别 ATE,需要满足一个关键条件——无混淆分配(Unconfoundedness),也叫条件独立假设(Conditional Independence Assumption, CIA)

Y(0),Y(1)TXY(0), Y(1) \perp T \mid \mathbf{X}

意思是在控制了协变量 X 之后,谁接受处理(T=1)和谁不接受处理(T=0),不再与潜在结果相关。在给定 X 的条件下,处理的分配"就像是随机的一样"。

如果 CIA 成立,ATE 就可以通过以下方式来识别:

ATE=EX[E[YT=1,X]E[YT=0,X]]\text{ATE} = \mathbb{E}_{\mathbf{X}} \left[ \mathbb{E}[Y|T=1, \mathbf{X}] - \mathbb{E}[Y|T=0, \mathbf{X}] \right]

即在 X 的每个取值层内比较处理组和控制组的均值差异,然后按 X 的分布取加权平均。

2.4 潜在因果框架的"因果语言"到底是什么?

用一句话概括:在潜在因果框架里,"因果效应"是定义在反事实之上的——它不依赖任何函数形式假设,只依赖于一个实质性假设(分配机制是否等同于"在控制了X后近似随机")。


三、多元回归:用"偏导数"逼近因果

回顾 FWL 定理(前一篇的完整展开):多元回归中的 β^1\hat{\beta}_1,等于"把 X₁ 中与所有控制变量线性相关的部分剔除后,剩余的 X₁ 变异"和 Y 之间的关系。

但要把这个 β^1\hat{\beta}_1 解释为因果关系,同样需要一个实质性条件——遗漏变量偏误为零。也就是说,在控制了已有的变量之后,不存在既影响 X 又影响 Y 的未观测变量。

注意这句话和潜在因果框架的 CIA 有多么相似——实际上,它们在数学上是同一个条件,只是换了一种说法。

所以,多元回归声称的"因果效应",本质上也是在同一个 CIA 条件下才成立的。 区别在于:潜在因果框架把 CIA 放在明面上——你必须在论文里写"我们假设在控制了X之后处理分配近似随机";而回归用户有时候甚至不提及这个条件,直接跳到"系数为β,表示因果效应"。


四、两者的等价与不等价:什么条件下它们给出相同的答案?

4.1 一个被低估的结论:OLS = 方差加权的处理效应

Angrist & Pischke(2009, Mostly Harmless Econometrics)给出了一个影响深远的结果:

在条件独立假设(CIA)下,多元回归的系数 β^1\hat{\beta}_1 不是 ATE,也不是 ATT——它是处理效应的一个条件方差加权平均。

具体来说,假设处理变量 T(0/1),控制变量 X。在 CIA 成立且线性模型设定正确的情况下:

β1=E[ω(X)τ(X)]\beta_1 = \mathbb{E}\left[ \omega(X) \cdot \tau(X) \right]

其中 τ(X)=E[Y(1)Y(0)X]\tau(X) = \mathbb{E}[Y(1)-Y(0)|X] 是X条件下的处理效应,而权重 ω(X)Var(TX)\omega(X) \propto \text{Var}(T|X)——即处理变量的条件方差

这意味着什么?

X 取值处,处理变量的方差越大,该处的处理效应在 OLS 估计中获得的权重就越大。

直觉上:如果在一个X的取值层内,几乎所有人都被处理了(或几乎都不被处理),那么这个层的处理效应对OLS系数的贡献很小——因为这个层内数据"区分不了"被处理和未被处理的人群。相反,在一个X层内,如果有大约一半的人被处理、一半人没被处理(方差最大),这个层的处理效应就获得最大权重。

这个权重的选择是OLS自动做出的——它不是任何处理效应定义(ATE、ATT)的自然权重,而是回归本身的数学性质决定的。

4.2 当处理效应同质时:回归系数 = ATE

如果处理效应是同质的(homogeneous)——即每个人受到的处理效应都一样,无论X取值如何,τ(X)τ\tau(X) \equiv \tau 对所有X不变——那么无论权重怎么分配,加权平均都等于τ:

β1=τ=ATE=ATT\beta_1 = \tau = \text{ATE} = \text{ATT}

在这种特殊情况下,潜在因果框架下的 ATE 和多元回归系数完全等同

但同质处理效应是一个极强的假设。在教育回报的例子中,它意味着"上大学对每个人的影响都一样"——无论你的能力高低、无论你学什么专业、无论你在哪个劳动力市场。这显然不符合直觉。

4.3 当处理效应异质时:回归系数 ≠ ATE,≠ ATT

如果处理效应是异质的(heterogeneous)——即不同的人受到的处理效应不同——OLS 系数既不是 ATE 也不是 ATT。它是一个对高方差层赋予了更大权重的处理效应加权平均。

一个对比:

估计量 定义 加权方式
ATE E[Y(1)Y(0)]\mathbb{E}[Y(1)-Y(0)] 按总体分布等权
ATT E[Y(1)Y(0)T=1]\mathbb{E}[Y(1)-Y(0)\|T=1] 只对处理组取平均
OLS系数(CIA下) E[ω(X)τ(X)]\mathbb{E}[\omega(X)\tau(X)] 按处理变量的条件方差加权

这意味着,即使 CIA 成立,你从多元回归中读出来的那个数字,也不等于潜在因果框架定义的 ATE——除非你愿意额外假设处理效应同质,或者你使用的是更灵活的估计方法(如交互项模型、匹配方法等)来允许异质性处理效应的存在。


五、谁更可信?——不是高下问题,是透明度问题

5.1 潜在因果框架的优势:假设透明化

潜在因果框架几乎强迫你做三件事:

  1. 明确定义处理:T 是什么?是二值的还是连续的?处理是怎样被分配的?
  2. 明确定义反事实:谁和谁比较?你在估计 ATE、ATT 还是 LATE?
  3. 明确写出识别假设:CIA 是否合理?在控制了哪些变量之后,你愿意相信CIA成立?

这些步骤不能跳过。如果你跳过了,审稿人会替你补上。

潜在因果框架的"可信度",不在于它的数学更高级——而在于你把所有"如果"都摆在了桌子上,读者可以自己判断这些"如果"是否成立。

5.2 多元回归的风险:假设隐形化

多元回归的危险之处在于——你可以在不追问任何识别假设的情况下,跑出一个回归并得到显著的系数。 回归表里的星星(***)会给你一种虚假的确定感:p < 0.01,三个星,一定是真的。

但回到上文——如果 CIA 不成立,这个 p 值衡量的是"在错误模型下,零假设被拒绝的概率",而不是"效应真实存在的概率"。它什么也保证不了。

这就是为什么当代实证经济学越来越把"回归"仅仅当作估计工具,而把识别论证放在完全独立的部分。在识别论证中,你需要讲清楚:为什么在控制了这些变量之后,处理变量的残余变异可以"被认为是近似于随机的"?这并不是回归表能回答的问题。


5.3 一张表对比两种框架

维度 潜在因果框架(RCM) 多元回归
因果的定义 反事实:Y(1)-Y(0) 偏导数:∂Y/∂X(保持其他不变)
识别条件 CIA(无混淆分配) 遗漏变量偏误 = 0
条件和CIA的关系 直接就是CIA 等价的,只是没说出来
估计的目标量 ATE/ATT/LATE(明确定义) CIA下 = 方差加权的处理效应
异质性处理效应 可灵活估计(匹配法、分层、ML等) 标准OLS只能给方差加权平均
假设的可见度 ——被框架强制写出来 ——容易被"控制变量"的修辞遮掩
最容易被滥用之处 倾向得分匹配的"黑箱化"使用 "控制变量越多越好"的盲目操作
一句话 "假设是明牌,你自己看" "假设是底牌,你得会掀开"

六、在什么情况下两者接近或等同?——实用性判断

综合前述,这里给出几个实用判断条件:

  1. CIA 成立 + 处理效应同质 → 两者完全等同。回归系数 = ATE。但同质效应假设在大多数应用场景中过于严格。

  2. CIA 成立 + 处理效应异质但不大 → 两者接近。如果处理效应在不同人群之间的差异较小,方差加权平均和简单平均的差距也不大。在应用上,这种"接近"可能已经足够支撑你的定性结论。

  3. CIA 成立 + 异质性较大 → 两者可能相差很大。此时最好使用匹配方法、逆概率加权(IPW)或交互项回归等更灵活的方法——让模型允许处理效应随X变化。

  4. CIA 不成立两者都不等于因果效应。 此时需要转向更可信的识别策略(IV、DID、RDD等),而不是在回归和RCM之间纠结"谁更好"。

关键结论:潜在因果框架和多元回归在识别逻辑上是同一类方法——都依赖于"在控制可观测变量后,处理分配近似随机"。它们的差异在于,潜在因果框架让你更清楚地看到自己的假设,并且在不做额外假定(如同质处理效应)的情况下,这个框架给出的估计目标更清晰。


七、总结

回到标题的四个问题:

  1. 两种框架说的"因果"有什么不同? ——潜在因果框架在反事实上定义因果,多元回归在偏导数上逼近因果。但两者依赖同一个实质条件(CIA / 无遗漏变量偏误)。

  2. 谁更可信? ——不是更可信,而是更透明。潜在因果框架不会让你的因果推断自动变得更强,但它会让你更清楚地看到你的推断"强在何处、弱在何处"。可信度来源于假设的合理性,而非框架的选择。

  3. 两者在什么情况下接近? ——CIA 成立 + 处理效应同质时,两者等同。CIA 成立 + 异质性不大时,两者接近。

  4. 在什么情况下等同? ——CIA 成立 + 处理效应严格同质时,回归系数 = ATE。


一句话收尾

"潜在因果框架和多元回归不是两种对立的因果哲学——它们是同一套逻辑的不同表达。框架的意义不在于哪个更'高级',而在于:你是愿意把你的假设摆在桌子上让所有人审视,还是把它们藏在回归表的脚注下面。"


八、B站/公众号呈现建议

  • B站视频:核心逻辑链建议用"并排对比"视觉——左侧画面展示 Rubin 因果框架的反事实语言,右侧画面展示回归的偏导数语言,下方叠加一行不断出现的文字"它们依赖同一个假设:CIA"。在讲到 OLS ≠ ATE 时,用一个天平动画展示"两边权重不同",直观呈现条件方差加权的含义。
  • 公众号:两种框架的对比表适合做成左右分栏的信息图。Angrist & Pischke 的"OLS = 方差加权平均"结论可以做成一个突出引用的卡片,是本文的核心信息增量。
  • 推荐标题
    • 主标题:《潜在因果 vs 多元回归:两套"因果"语言有什么不同?》
    • 备选标题:《你跑回归得到的那个系数,等于 ATE 吗?——大多数情况下不等》
  • 金句提炼

    "潜在因果框架不会让你的因果推断自动变得更强——但它会让你更清楚地看到,你的推断强在何处、弱在何处。"