多元线性回归中的\"保持其他条件不变\"到底应该怎么理解?
打开任何一篇使用了多元线性回归的实证论文,你大概率会在解释系数的部分看到这句话:
一、开篇:一个说了无数遍、但很少有人追问的话
打开任何一篇使用了多元线性回归的实证论文,你大概率会在解释系数的部分看到这句话:
"在保持其他条件不变的情况下,X 每增加一个单位,Y 平均变化 β 个单位。"
这句话太熟悉了,熟悉到你已经不会去琢磨它的意思了。但如果停下来追问一句——"保持其他条件不变"到底是怎么做到的?
你跑回归的时候,并没有在物理上"控制"任何东西。你没有把一群人关在实验室里统一饮食、统一作息、统一工资水平。你只是往回归方程里多扔了几个变量,点了一下鼠标。那凭什么说,你"保持"了它们?
这篇文章做三件事:
- 讲清楚 "保持其他条件不变"在数学上到底是什么意思——它和物理控制有什么本质区别。
- 回答一个关键问题:多元回归能不能自动推出因果关系?
- 给出一个可操作的判断:在什么情况下,多元回归的系数比较接近因果关系?
核心信息:多元回归中的"控制",不是物理上的控制,而是统计上的"剔除"——把其他变量已经解释过的那部分变异拿掉,看剩下的变异和 Y 的关系。这个操作本身不创造因果关系,但在特定条件下可以逼近因果关系。
二、"保持其他条件不变"的数学真相:Frisch-Waugh-Lovell 定理
2.1 不止是"偏导数"——偏导数的直觉和局限
在初等计量课本里,"保持其他条件不变"通常被解释为偏导数。考虑模型:
对 X₁ 求偏导:。课本说:β₁ 衡量的是"当 X₁ 变化一个单位而 X₂ 保持不变时,Y 的变化量"。
这个解释在数学形式上完全正确,但它给初学者造成了一种危险的直觉——仿佛"保持 X₂ 不变"的意思是你真的在物理上把 X₂ 固定住了,然后单独变动 X₁ 看 Y 怎么变。
你没有。 你拿到的是一份观测数据,里面不同个体的 X₁ 和 X₂ 都在自由地变化。你从来没有"控制"过任何东西——至少在物理意义上没有。那个"保持其他条件不变"的数学操作,和你想象的完全不是一回事。
2.2 真正发生的事情:用 Frisch-Waugh-Lovell 定理来理解
多元回归中 β₁ 的估计值,到底是怎么被计算出来的?
Frisch-Waugh-Lovell (FWL) 定理给出了一个等价的操作步骤,比任何抽象解释都更直观:
步骤一:把 X₁ 当作因变量,X₂ 当作自变量,跑一个回归。取这个回归的残差。
这个残差 是什么?它是 X₁ 中不能被 X₂ 的线性函数解释的那部分变异。换句话说,你从 X₁ 中"剔除"了 X₂ 的影响(严格来说是剔除了 X₁ 和 X₂ 之间的线性相关部分),留下了 X₁ 中与 X₂ "正交"的部分。
步骤二:用这个残差 去回归 Y。你得到的系数就是 β₁。
2.3 用例子说人话
假设你想研究**"教育年限对工资的影响",你控制了一个变量:"父母的受教育年限"**。
你实际做的回归:
FWL 定理告诉你, 的计算等于:
- 先用父母教育年限去"预测"一个人的教育年限,得到残差。这个残差代表的是——在同父母教育水平下,这个人的教育年限和该父母教育水平对应的"典型教育年限"之间的偏离。 比如,父母都是小学毕业的人,典型的子女教育年限可能是初中。你读了大学——你的残差就是"大学 - 初中"。
- 然后用这个残差去"预测"工资。
所以 β₁ 真正衡量的是:
"在父母教育程度相同的人群内部,那些教育年限高于该人群典型水平的人,他们的工资比该人群的典型工资高出多少?"
这就是"保持其他条件不变"的数学真相——它不是"把所有人关进同一个实验室",而是在统计上把"其他条件相同的人"归到一组,然后看组内 X₁ 的变异和 Y 的变异之间的关系。
| 维度 | 你以为的"控制" | 实际发生的"控制" |
|---|---|---|
| 操作方式 | 物理上固定其他变量,只变动 X₁ | 统计上从 X₁ 中剔除其他变量的线性影响 |
| 数据要求 | 需要实验环境 | 只需要观测数据中有足够的共同变异 |
| 数学实现 | 实验设计 | 取残差 |
| 能控制多少变量 | 受实验条件限制 | 受自由度和多重共线性限制 |
三、多元回归能自动推出因果关系吗?
不能。 这是每一个学计量的人必须接受的事实。而且理解"为什么不能",比知道"不能"更重要。
3.1 回归系数 ≠ 因果效应——一个让人清醒的例子
我们回到教育回报的例子,并且加上一个变量:个人能力(ability)。
真实的工资决定过程(数据生成过程)是:
在真实的数据生成过程中,能力影响工资(β₂ > 0),而且能力和教育年限正相关(能力强的人更可能多读书)。
现在,如果你没有测量到能力——也就是说,你实际跑的回归里没有 ability 这个变量,你只跑了:
你的 会同时捕捉两个东西:(1)教育本身对工资的影响,(2)教育和能力的相关性所连带过来的"能力→工资"的影响。你估计出来的教育回报率已经被能力偏误污染了。
这就是遗漏变量偏误(Omitted Variable Bias)——当存在一个既影响Y又和X相关的变量没有被控制时,回归系数就是有偏的。数学上:
第二项就是偏误。只要 Cov(edu, ability) ≠ 0 且 ability 确实影响工资(β₂ ≠ 0),偏误就存在。
3.2 回归系数成为因果效应的条件
那在什么条件下,多元回归的系数可以被解释为因果效应?
答案是:条件独立假设(Conditional Independence Assumption, CIA),也叫基于可观测变量的选择(Selection on Observables)。
在控制了所有你放进去的变量(记为 Z)之后,处理变量 X 的取值不再与潜在结果相关。形式化地说:
用大白话说:在"其他条件相同"的组内,谁受到"处理"(如多读一年书)和谁没受到"处理",不应该再有系统性的差异。 如果组内高教育者和低教育者在不可观测维度上仍然存在系统性差异(如能力),上述条件就被破坏了,回归系数≠因果效应。
这个条件的核心困难在于:它本质上是不可被数据直接检验的。 你永远无法证明"我已经控制了所有该控制的变量"——因为总有一些变量是你没有测量到的,甚至是你根本不知道它存在的。
四、什么情况下,多元回归的系数比较接近因果关系?
尽管上面说了"回归不能自动推出因果",但现实中大量的实证研究还是基于多元回归——因为在某些条件下,回归系数离因果关系可以相当接近。 什么条件?这里给出三个判断维度。
条件一:控制变量的丰富程度和理论说服力
控制变量越多、越关键,遗漏变量偏误就越小——但这里有一个重要的微妙之处:不是所有控制变量都有同样的意义。
控制变量应该主要瞄准那些同时影响 X 和 Y 的混淆变量(confounders)。你控制了一个只影响Y但不影响X的变量,它不会减少偏误(只是可能降低标准误);你控制了一个只影响X但不影响Y的变量,它同样不解决遗漏变量偏误的问题。
判断标准:在读一篇使用多元回归的论文时,你应该追问——作者控制了哪些变量?为什么要控制这些变量?遗漏了哪些可能同时影响X和Y的变量?作者有没有讨论"控制了这些变量后,是否可能仍然存在不可观测的混淆因素"?
一个好的使用多元回归的实证研究,往往在回归表本身之外,花大量篇幅在论述——为什么在控制了这些特定变量之后,处理变量的残余变异可以"接近于随机"。
条件二:处理变量的变异来源需要被审视
多元回归利用的是X的全部变异来估计β₁——包括组间变异和组内变异。但X的变异来源不同,其"接近随机"的程度也不同。
举一个经典对比:
- 跨国家横截面回归:"民主程度对经济增长的影响"。X的变异来自"为什么有些国家是民主的,有些不是"——这背后混杂了殖民历史、文化传统、地理位置、资源禀赋等等。这些因素同时影响民主程度和经济增长。控制几十个变量之后,你真的相信已经穷尽了所有混淆因素吗?这非常困难。
- 家庭内部的兄弟姐妹比较:"教育对收入的影响"。如果使用家庭固定效应(本质上是控制了"家庭"这个虚拟变量集合),你是在比较同一个家庭内部不同兄弟姐妹之间的教育差异如何对应他们的收入差异。X的变异来自"为什么同一个家庭的不同孩子受教育程度不同"——这可能是出生顺序、某年家庭经济状况波动、某个老师的影响等。这些因素虽然不完美,但比"为什么这个国家是民主的而那个不是"要更接近于随机。
判断标准:X的变异主要来自什么层面?这种变异在多大程度上可以被认为是"在控制了可观测因素后,近似于随机分配"?
条件三:研究设计先于回归——识别策略为回归提供合理性
在当代的实证经济学中,回归本身通常不被当作识别策略——它只是估计工具。识别策略是独立于回归之外的:工具变量、双重差分、断点回归、固定效应——这些设计逻辑才是论证因果关系的主体。回归只是在最后一步负责估计参数。
但同样使用固定效应模型作为识别策略时,回归中的系数就更接近因果。因为固定效应通过"每个个体做自己的对照组",从源头上排除了所有不随时间变化的混淆因素。
判断标准:这篇论文的"因果论证"主要发生在讨论识别策略的部分,还是在展示回归表的那一刻?如果主要论证都在识别策略部分,那么回归系数就更接近因果。
五、"控制"这件事有哪些需要注意的坑?
坑一:过度控制(Over-controlling)
不是控制越多越好。有些变量不应该被控制——控制它们反而会引入新的偏误。
经典场景:控制了一个中介变量。
假设真实的因果链是:教育 → 职业声望 → 工资。你如果想估计教育对工资的总效应,不应该控制"职业声望"——因为教育对工资的一部分影响正是通过"进入声望更高的职业"来实现的。控制了职业声望后,你只能估计教育的直接效应(扣除通过职业路径发挥的影响之后剩下的那一部分),而不是你想了解的总效应。
**坏控制(Bad Controls)**的判断标准:这个变量是不是在 X 和 Y 的因果链条上?如果是,控制它会"堵住"因果路径的一部分。
坑二:控制变量自己也是内生的
如果你的控制变量本身也是内生的(即在另一个方程中,它也被某个遗漏变量影响),控制它可能不仅不会减少偏误,还可能把偏误"传染"到其他系数上。经典案例:在教育回报回归中控制"职业"——但职业选择本身就是一个内生过程。
坑三:多重共线性下的虚假安全感
当 X₁ 和控制变量高度相关时(即多重共线性严重时),回归系数的方差会膨胀(标准误会变得很大)。此时,"保持其他条件不变"虽然在数学上依然成立,但在统计上已经几乎无法做到——因为数据里几乎没有"X₁变化但X₂不变"的观测。 你的估计高度依赖于模型设定的线性外推,而非数据中的实际证据。
六、总结
理解"保持其他条件不变"的三个层次:
- 数学层次(FWL定理):β₁ 衡量的是"从 X₁ 中剔除了其他控制变量的线性影响后,残余的 X₁ 变异和 Y 之间的关系"。这和你是否在物理上"控制"了什么无关。
- 实证层次:多元回归系数是否可以解释为因果效应,取决于在控制了可观测变量之后,X的残余变异是否与潜在结果独立(CIA假设)。这个假设本质上是不可检验的,它的可信度依赖于研究者的论证和读者的判断。
- 操作层次:为了让回归系数更接近因果,需要结合识别策略(固定效应、IV、DID、RDD等),而非仅仅往回归方程里堆变量。同时需要注意过度控制、内生控制变量和多重共线性的陷阱。
一句话收尾:
"保持其他条件不变"不是一个你通过点一下鼠标就能实现的魔法——它是一种在特定假设下、通过特定研究设计、才可能逼近的理想状态。理解它的数学本质是第一步,识别它背后的因果假设是第二步,而最重要的第三步,是知道在自己的研究场景中,你离这个理想状态还有多远。
七、B站/公众号呈现建议
- B站视频:FWL定理的两步操作建议用动画演示——用两个并排的画面展示"原始X₁"和"剔除X₂影响后的残差",让观众直观感受到"保持其他条件不变"就是在用这个残差做回归。
- 公众号:公式部分(FWL定理、遗漏变量偏误公式)建议用手写体标注图呈现,降低阅读压力。CIA假设用加框的引用块突出。
- 推荐标题:
- 主标题:《多元回归中"保持其他条件不变"到底是怎么做到的?》
- 备选标题:《你没有在物理上控制任何东西——多元回归"控制变量"的数学真相》
- 金句提炼:
"保持其他条件不变不是魔法——它是用残差做回归。理解它的数学本质是第一步,知道它离因果关系还有多远是第二步。"