潜在因果框架 vs 多元回归:两种\"因果\"语言有什么不同?谁更可信?
如果你同时读两类论文,会发现\"因果关系\"这个词被用在了两种看起来完全不同的语境中——
一、开篇:两种语言,同一个词
如果你同时读两类论文,会发现"因果关系"这个词被用在了两种看起来完全不同的语境中——
语境A(常见于劳动经济学、教育经济学、发展经济学):
"我们使用倾向得分匹配来估计培训项目对工资的处理效应。在条件独立假设下,ATT 估计值为 0.12,即参加培训使工资提高了约12%。"
语境B(更传统的实证研究):
"在控制了个体特征、家庭背景和地区固定效应之后,受教育年限的系数为 0.08 且在 1% 水平上显著。这表明,保持其他条件不变,每增加一年教育,工资提高约 8%。"
两种表述都在说自己估计的是"因果效应"。但它们用的是两套完全不同的语言体系。语境A用的是潜在因果框架(Rubin Causal Model, RCM)——以反事实、处理效应、分配机制为核心概念。语境B用的是多元回归——以偏导数、控制变量、FWL定理为核心概念。
这两个框架各自声称的"因果",是同一个东西吗?一个更可信吗?它们在什么条件下会给出相同的答案?
这篇文章就是要打通这两套语言。
核心信息:潜在因果框架和多元回归不是两种"对立的因果理论"——它们是同一套识别逻辑的两种表达方式。潜在因果框架更透明(你被迫把假设写清楚),多元回归更便捷(但假设容易隐形)。理解两者的等价条件,是判断一篇实证论文可信度的关键技能。
二、潜在因果框架:用"反事实"定义因果
2.1 核心思想——每个人有两个潜在的自己
潜在因果框架由 Rubin(1974)系统化,它的起点是一个"反事实"定义:
对每个个体 i,定义两个潜在结果(Potential Outcomes):
- Yᵢ(1):个体 i 如果接受处理(如参加培训、上大学、服用药物)会出现的潜在结果。
- Yᵢ(0):个体 i 如果不接受处理会出现的潜在结果。
个体处理效应(Individual Treatment Effect)就是这两个潜在结果之差:
这个定义干净到什么程度?它完全不依赖任何模型、任何假设、任何回归方程。因果就是两个潜在结果的差——定义上无懈可击。
2.2 根本问题——你永远看不到两个潜在结果
但定义干净是一回事,实际操作是另一回事。对于任何一个个体,你只能观测到一个潜在结果。 参加了培训的人,你看不到他"没参加培训"会怎样;没参加的人,你看不到他"参加了"会怎样。
这就是 Holland(1986)所说的因果推断的根本问题(Fundamental Problem of Causal Inference)——因果效应定义在个体层面,但个体层面的因果效应永远不可直接观测。
2.3 解决办法——从个体到群体,引入可观测假设
既然个体因果效应不可观测,实证研究的目标就转向了估计平均处理效应(Average Treatment Effect, ATE):
要识别 ATE,需要满足一个关键条件——无混淆分配(Unconfoundedness),也叫条件独立假设(Conditional Independence Assumption, CIA):
意思是在控制了协变量 X 之后,谁接受处理(T=1)和谁不接受处理(T=0),不再与潜在结果相关。在给定 X 的条件下,处理的分配"就像是随机的一样"。
如果 CIA 成立,ATE 就可以通过以下方式来识别:
即在 X 的每个取值层内比较处理组和控制组的均值差异,然后按 X 的分布取加权平均。
2.4 潜在因果框架的"因果语言"到底是什么?
用一句话概括:在潜在因果框架里,"因果效应"是定义在反事实之上的——它不依赖任何函数形式假设,只依赖于一个实质性假设(分配机制是否等同于"在控制了X后近似随机")。
三、多元回归:用"偏导数"逼近因果
回顾 FWL 定理(前一篇的完整展开):多元回归中的 ,等于"把 X₁ 中与所有控制变量线性相关的部分剔除后,剩余的 X₁ 变异"和 Y 之间的关系。
但要把这个 解释为因果关系,同样需要一个实质性条件——遗漏变量偏误为零。也就是说,在控制了已有的变量之后,不存在既影响 X 又影响 Y 的未观测变量。
注意这句话和潜在因果框架的 CIA 有多么相似——实际上,它们在数学上是同一个条件,只是换了一种说法。
所以,多元回归声称的"因果效应",本质上也是在同一个 CIA 条件下才成立的。 区别在于:潜在因果框架把 CIA 放在明面上——你必须在论文里写"我们假设在控制了X之后处理分配近似随机";而回归用户有时候甚至不提及这个条件,直接跳到"系数为β,表示因果效应"。
四、两者的等价与不等价:什么条件下它们给出相同的答案?
4.1 一个被低估的结论:OLS = 方差加权的处理效应
Angrist & Pischke(2009, Mostly Harmless Econometrics)给出了一个影响深远的结果:
在条件独立假设(CIA)下,多元回归的系数 不是 ATE,也不是 ATT——它是处理效应的一个条件方差加权平均。
具体来说,假设处理变量 T(0/1),控制变量 X。在 CIA 成立且线性模型设定正确的情况下:
其中 是X条件下的处理效应,而权重 ——即处理变量的条件方差。
这意味着什么?
X 取值处,处理变量的方差越大,该处的处理效应在 OLS 估计中获得的权重就越大。
直觉上:如果在一个X的取值层内,几乎所有人都被处理了(或几乎都不被处理),那么这个层的处理效应对OLS系数的贡献很小——因为这个层内数据"区分不了"被处理和未被处理的人群。相反,在一个X层内,如果有大约一半的人被处理、一半人没被处理(方差最大),这个层的处理效应就获得最大权重。
这个权重的选择是OLS自动做出的——它不是任何处理效应定义(ATE、ATT)的自然权重,而是回归本身的数学性质决定的。
4.2 当处理效应同质时:回归系数 = ATE
如果处理效应是同质的(homogeneous)——即每个人受到的处理效应都一样,无论X取值如何, 对所有X不变——那么无论权重怎么分配,加权平均都等于τ:
在这种特殊情况下,潜在因果框架下的 ATE 和多元回归系数完全等同。
但同质处理效应是一个极强的假设。在教育回报的例子中,它意味着"上大学对每个人的影响都一样"——无论你的能力高低、无论你学什么专业、无论你在哪个劳动力市场。这显然不符合直觉。
4.3 当处理效应异质时:回归系数 ≠ ATE,≠ ATT
如果处理效应是异质的(heterogeneous)——即不同的人受到的处理效应不同——OLS 系数既不是 ATE 也不是 ATT。它是一个对高方差层赋予了更大权重的处理效应加权平均。
一个对比:
| 估计量 | 定义 | 加权方式 |
|---|---|---|
| ATE | 按总体分布等权 | |
| ATT | 只对处理组取平均 | |
| OLS系数(CIA下) | 按处理变量的条件方差加权 |
这意味着,即使 CIA 成立,你从多元回归中读出来的那个数字,也不等于潜在因果框架定义的 ATE——除非你愿意额外假设处理效应同质,或者你使用的是更灵活的估计方法(如交互项模型、匹配方法等)来允许异质性处理效应的存在。
五、谁更可信?——不是高下问题,是透明度问题
5.1 潜在因果框架的优势:假设透明化
潜在因果框架几乎强迫你做三件事:
- 明确定义处理:T 是什么?是二值的还是连续的?处理是怎样被分配的?
- 明确定义反事实:谁和谁比较?你在估计 ATE、ATT 还是 LATE?
- 明确写出识别假设:CIA 是否合理?在控制了哪些变量之后,你愿意相信CIA成立?
这些步骤不能跳过。如果你跳过了,审稿人会替你补上。
潜在因果框架的"可信度",不在于它的数学更高级——而在于你把所有"如果"都摆在了桌子上,读者可以自己判断这些"如果"是否成立。
5.2 多元回归的风险:假设隐形化
多元回归的危险之处在于——你可以在不追问任何识别假设的情况下,跑出一个回归并得到显著的系数。 回归表里的星星(***)会给你一种虚假的确定感:p < 0.01,三个星,一定是真的。
但回到上文——如果 CIA 不成立,这个 p 值衡量的是"在错误模型下,零假设被拒绝的概率",而不是"效应真实存在的概率"。它什么也保证不了。
这就是为什么当代实证经济学越来越把"回归"仅仅当作估计工具,而把识别论证放在完全独立的部分。在识别论证中,你需要讲清楚:为什么在控制了这些变量之后,处理变量的残余变异可以"被认为是近似于随机的"?这并不是回归表能回答的问题。
5.3 一张表对比两种框架
| 维度 | 潜在因果框架(RCM) | 多元回归 |
|---|---|---|
| 因果的定义 | 反事实:Y(1)-Y(0) | 偏导数:∂Y/∂X(保持其他不变) |
| 识别条件 | CIA(无混淆分配) | 遗漏变量偏误 = 0 |
| 条件和CIA的关系 | 直接就是CIA | 等价的,只是没说出来 |
| 估计的目标量 | ATE/ATT/LATE(明确定义) | CIA下 = 方差加权的处理效应 |
| 异质性处理效应 | 可灵活估计(匹配法、分层、ML等) | 标准OLS只能给方差加权平均 |
| 假设的可见度 | 高——被框架强制写出来 | 低——容易被"控制变量"的修辞遮掩 |
| 最容易被滥用之处 | 倾向得分匹配的"黑箱化"使用 | "控制变量越多越好"的盲目操作 |
| 一句话 | "假设是明牌,你自己看" | "假设是底牌,你得会掀开" |
六、在什么情况下两者接近或等同?——实用性判断
综合前述,这里给出几个实用判断条件:
-
CIA 成立 + 处理效应同质 → 两者完全等同。回归系数 = ATE。但同质效应假设在大多数应用场景中过于严格。
-
CIA 成立 + 处理效应异质但不大 → 两者接近。如果处理效应在不同人群之间的差异较小,方差加权平均和简单平均的差距也不大。在应用上,这种"接近"可能已经足够支撑你的定性结论。
-
CIA 成立 + 异质性较大 → 两者可能相差很大。此时最好使用匹配方法、逆概率加权(IPW)或交互项回归等更灵活的方法——让模型允许处理效应随X变化。
-
CIA 不成立 → 两者都不等于因果效应。 此时需要转向更可信的识别策略(IV、DID、RDD等),而不是在回归和RCM之间纠结"谁更好"。
关键结论:潜在因果框架和多元回归在识别逻辑上是同一类方法——都依赖于"在控制可观测变量后,处理分配近似随机"。它们的差异在于,潜在因果框架让你更清楚地看到自己的假设,并且在不做额外假定(如同质处理效应)的情况下,这个框架给出的估计目标更清晰。
七、总结
回到标题的四个问题:
-
两种框架说的"因果"有什么不同? ——潜在因果框架在反事实上定义因果,多元回归在偏导数上逼近因果。但两者依赖同一个实质条件(CIA / 无遗漏变量偏误)。
-
谁更可信? ——不是更可信,而是更透明。潜在因果框架不会让你的因果推断自动变得更强,但它会让你更清楚地看到你的推断"强在何处、弱在何处"。可信度来源于假设的合理性,而非框架的选择。
-
两者在什么情况下接近? ——CIA 成立 + 处理效应同质时,两者等同。CIA 成立 + 异质性不大时,两者接近。
-
在什么情况下等同? ——CIA 成立 + 处理效应严格同质时,回归系数 = ATE。
一句话收尾:
"潜在因果框架和多元回归不是两种对立的因果哲学——它们是同一套逻辑的不同表达。框架的意义不在于哪个更'高级',而在于:你是愿意把你的假设摆在桌子上让所有人审视,还是把它们藏在回归表的脚注下面。"
八、B站/公众号呈现建议
- B站视频:核心逻辑链建议用"并排对比"视觉——左侧画面展示 Rubin 因果框架的反事实语言,右侧画面展示回归的偏导数语言,下方叠加一行不断出现的文字"它们依赖同一个假设:CIA"。在讲到 OLS ≠ ATE 时,用一个天平动画展示"两边权重不同",直观呈现条件方差加权的含义。
- 公众号:两种框架的对比表适合做成左右分栏的信息图。Angrist & Pischke 的"OLS = 方差加权平均"结论可以做成一个突出引用的卡片,是本文的核心信息增量。
- 推荐标题:
- 主标题:《潜在因果 vs 多元回归:两套"因果"语言有什么不同?》
- 备选标题:《你跑回归得到的那个系数,等于 ATE 吗?——大多数情况下不等》
- 金句提炼:
"潜在因果框架不会让你的因果推断自动变得更强——但它会让你更清楚地看到,你的推断强在何处、弱在何处。"